大数据面试题之葵花宝典------Flink高级

2023大数据面试题+附答案 2023大数据面试题+附答案。 阅读详情

1、Flink Job的提交流程

用户提交的Flink Job会被转化成一个DAG任务运行,分别是:StreamGraph、JobGraph、ExecutionGraph,Flink中JobManager与TaskManager,JobManager与Client的交互是基于Akka工具包的,是通过消息驱动。整个Flink Job的提交还包含着ActorSystem的创建,JobManager的启动,TaskManager的启动和注册。

2、Flink所谓"三层图"结构是哪几个"图"?

一个Flink任务的DAG生成计算图大致经历以下三个过程:
1、StreamGraph 最接近代码所表达的逻辑层面的计算拓扑结构,按照用户代码的执行顺序向StreamExecutionEnvironment添加StreamTransformation构成流式图。
2、JobGraph 从StreamGraph生成,将可以串联合并的节点进行合并,设置节点之间的边,安排资源共享slot槽位和放置相关联的节点,上传任务所需的文件,设置检查点配置等。相当于经过部分初始化和优化处理的任务图。
3、ExecutionGraph 由JobGraph转换而来,包含了任务具体执行所需的内容,是最贴近底层实现的执行图

3、JobManger在集群中扮演了什么角色?

JobManager 负责整个 Flink 集群任务的调度以及资源的管理,从客户端中获取提交的应用,然后根据集群中 TaskManager 上 TaskSlot 的使用情况,为提交的应用分配相应的 TaskSlot 资源并命令 TaskManager 启动从客户端中获取的应用。JobManager 相当于整个集群的 Master 节点,且整个集群有且只有一个活跃的 JobManager ,负责整个集群的任务管理和资源管理。JobManager 和 TaskManager 之间通过 Actor System 进行通信,获取任务执行的情况并通过 Actor System 将应用的任务执行情况发送给客户端。同时在任务执行的过程中,Flink JobManager 会触发 Checkpoint 操作,每个 TaskManager 节点 收到 Checkpoint 触发指令后,完成 Checkpoint 操作,所有的 Checkpoint 协调过程都是在 Fink JobManager 中完成。当任务完成后,Flink 会将任务执行的信息反馈给客户端,并且释放掉 TaskManager 中的资源以供下一次提交任务使用。

4、JobMa
史上最全141道大数据面试题:Redis+Linux+kafka+Hadoop,附答案 18、有 10 个文件,每个文件 1G,每个文件的每一行存放的都是用户的 query,每个文件的 query 都可能重复。20、腾讯面试题:给 40 亿个不重复的 unsigned int 的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在那 40 亿个数当中?23、一个文本文件,大约有一万行,每行一个词,要求统计出其中最频繁出现的前 10 个词,给出思想,给出时间复杂度分析。MySQL 里有 2000w 数据,redis 中只存 20w 的数据,如何保证 redis 中的数据都是热点数据? 阅读详情

相关推荐

大数据面试题(附答案,持续更新...)

说说对hadoop的理解,都有哪些组件,分别是干什么的 还了解大数据其他组件嘛? kafka在什么地方需要用到zookeeper 了解HBase吗? 说下spark中的transform和action 为什么spark要把操作分为transform和action spark中有了RDD,为什么还要有Dataframe和DataSet? 了解函数式编程吗?说下c/c++和scala这种函数式编程语...

xiaozhaoshigedasb的博客 9921

大数据常见面试题及答案

大数据常见面试题及答案,大部分都有涉及

遐想者 3万+

大数据知识面试题-通用(2026版)

序列号 内容 链接 1 大数据知识面试题-通用(2022版) 待续… 2 大数据知识面试题-Hadoop(2022版) 待续… 3 大数据知识面试题-MapReduce和yarn(2022版) 待续… 4 大数据知识面试题-Zookeepr (2022版) 待续… 5 大数据知识面试题-Hive (2022版) 待续… 6 大数据知识面试题-Flume(2022版) 待续… 7 大数据知识面试题-Hbase(2022版) 待续… 8 大数据知识面试题-sqoop(....

拉格朗日的学习笔记 2万+

大数据常见面试题及答案(Linux、Zookeeper、Hadoop、Hive)

本文包括大数据常见技术问答面试题目及答案(Linux、Zookeeper、Hadoop、Hive)

m0_63845988的博客 7263

面试必背」大数据面试题100道(收藏)

前言 随着 5G 时代的到来,大数据人工智能产业链又一次迎来了井喷式的爆发,随着岗位需求的不断增加,越来越多的人选择大数据课程,但是没有真正从事大数据工作的人面对企业面试有种无从下手的感觉,面对面试说不到技术的重点,每次面试只能靠队友,靠兄弟支援,尤其是面对架构,编程更是无从下手。于是我决定对市场上大多的有关大数据核心的面试题做一个详细的分析,也希望大家尽可能的做到举一反三,而不是局限于题目本身。 1、选择题 1.1.下面哪个程序负责 HDFS 数据存储。 a)NameNode b)Jobtrac

q66562636的博客 2万+

大数据面试题面试大数据这一篇就够了

大数据面试题面试大数据这一篇就够了 Hadoop 常见面试题 Hive 常见面试题 Spark 常见面试题 Flume 常见面试题 Kafka 常见面试题 Hbase 常见面试题 Redis 20 问

abluer~的博客 6万+

大数据超详细面试题汇总(附答案)

Yarn是一个资源调度平台,负责为运算程序提供服务器运算资源,相当于一个分布式的操作系统平台Hdfs 是一个分布式文件系统,用来存储文件,通过目录树来定位文件Hdfs适合一次写入,多次写出的文件场景,且不支持文件的修改,适合用来做数据分析,并不适合用来做网盘应用NameNode : 管理HDFS的命名空间,配置副本策略,管理block的映射信息,处理客户端读写请求。

qq_45132574的博客 2万+

大数据面试问题总结

Shuffle reduce task 数量小于spark.shuffle .sort.bypassMerge Threadshold参数的值小于200,不开启,溢写磁盘不需要排序,小于等于的时候是开启的。面试题58:大促场景下实时链路数据积压,rps为100w,导致数据大屏不动了,上线前该如何保障,临时处理该如何操作,兜底方案该如何做?面试题73:如何解决数据建模中的一些挑战,例如复杂的业务规则、数据粒度的把控等?面试题73:如何解决数据建模中的一些挑战,例如复杂的业务规则、数据粒度的把控等?

MDZ_1122333322的博客 1987

大数据面试题—包含真实面经(压力拉满)

大数据最全面试题 吐血整理

weixin_53191998的博客 2142

(转)大数据面试题130道及答案整理 1-15

大数据面试题130道及答案整理 1-15 转载自:https://www.cnblogs.com/yuluoxingkong/p/13475235.html 1、HashMap 和 Hashtable 区别 HashMap和Hashtable都实现了Map接口,但决定用哪一个之前先要弄清楚它们之间的分别。主要的区别有:线程安全性,同步(synchronization),以及速度。 HashMap几乎可以等价于Hashtable,除了HashMap是非synchronized的,并可以接受null(HashM

tiand7的博客 2696

常见大数据面试题汇总带答案

大数据常见面试题

Direction_Wind的博客 1万+

2023大数据面试真题(持续更新)

5.有两个数据源,一个记录的是广告投放给用户的日志,一个记录用户访问日志,另外还有一个固定的用户基础表记录用户基本信息(比如学历,年龄等等)。9.线上业务每天产生的业务日志(压缩后>=3G),每天需要加载到hive的log表中,将每天产生的业务日志在压缩之后load到hive的log表时,最好使用的压缩算法是哪个,并说明其原因。为什么不用 Hive 默认的分隔符,默认的分隔符是什么?41.有一千万条短信,有重复,以文本文件的形式保存,一行一条数据,请用五分钟时间,找出重复出现最多的前10条。

我的祖传代码 3万+

大数据面试题大全】大数据真实面试题(持续更新)

Flink 是一个分布式的流式数据的处理引擎,对于有界和无界数据进行状态计算,提供了很多便于用户编写分布式任务的 API,有 DataSetAPI,但是新版本中已经被舍弃了,即将淘汰了,现在用的是 DataStreamAPI,还有一些 TbaleAPI,但是做的并不是十分完善,比起 SqarkSQL 还是有很大的差距,Flink 里面还提供了容错机制,FlinkCEP实时预警等功能。RDD是一个分布式的数据集,是Spark中最基本的数据抽象,RDD有这么五个特点,分别是:依赖性:RDD之间有依赖关系。

weixin_53543905的博客 1万+

史上最全141道大数据面试题:Redis+Linux+kafka+Hadoop,附答案PDF

18、有 10 个文件,每个文件 1G,每个文件的每一行存放的都是用户的 query,每个文件的 query 都可能重复。20、腾讯面试题:给 40 亿个不重复的 unsigned int 的整数,没排过序的,然后再给一个数,如何快速判断这个数是否在那 40 亿个数当中?25、有一千万条短信,有重复,以文本文件的形式保存,一行一条,有重复。23、一个文本文件,大约有一万行,每行一个词,要求统计出其中最频繁出现的前 10 个词,给出思想,给出时间复杂度分析。21、怎么在海量数据中找出重复次数最多的一个?

m0_49496327的博客 718

大数据常见面试题

9. JVM调优,组成,堆的大小,新生代和老年代大小,比例,GC回收器选择,垃圾标记算法,垃圾回收算法。4. 项目中用到的重点指标(至少3个),要非常熟悉,能说出怎么建的表,怎么算的。用ODS层重新算一遍。11.kafka怎么调优,遇到过什么问题,怎么解决的,10.常见问题: 数据丢失,数据重复,吞吐量。4.你为什么不用其他的组件,技术选型,对比。7. 数据治理项目,离线数仓,实时数仓。6. 拉链表,累积型事务事实表。5.kafka怎么部署的,几台。9.深入,架构,工作流程。2.数据丢失,数据重复。

qq_40382400的博客 592

大数据面试130题

大数据面试题总结一波,助力准备在年底跳槽寻找好工作的小伙伴们,只有度过笔试这一关才能在下面的关卡中大展宏图!Hadoop,Spark,Flink,数据仓库,10多个技术面、100多道面试题,为你的面试保驾护航。

大数据研习社 4244

大数据精选面试题160道

大数据精选面试题160道 01、 Hive和数据库比较 Hive 和数据库除了拥有类似的查询语言,再无类似之处。 1)数据存储位置 Hive 存储在 HDFS 。数据库将数据保存在块设备或者本地文件系统中。 2)数据更新 Hive中不建议对数据的改写。而数据库中的数据通常是需要经常进行修改的, 3)执行延迟 Hive 执行延迟较高。数据库的执行延迟较低。当然,这个是有条件的,即数据规模较小,当数据规模大到超过数据库的处理能力的时候,Hive的并行计算显然能体现出优势。 4)数据规模 Hive支持很大规模的数

金玉良缘 2497
上一篇: 大数据面试题之葵花宝典------Flink中级
下一篇: Datax系列(二) MysqlReader → MysqlWriter
海鸥~
博客等级 码龄7年 52粉丝 30原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值