Spark-ClickHouse-ES实时项目第四天-消费Kafka数据

Kafka消费数据并存储到ES的高效解决方案 最后,通过循环遍历documents列表,构建IndexRequest请求并使用bulkProcessor.add方法将请求添加到bulkProcessor中,bulkProcessor会异步批量处理这些请求。接下来,通过BulkProcessor.builder配置BulkProcessor的一些属性,比如每个批量操作的请求数量、总批量数据大小、刷新间隔等。首先,创建了一个BulkProcessor.Listener监听器,用于在存储前、存储后或发生异常时记录日志信息。 阅读详情

仓库位置

日志生成:https://github.com/SmallScorpion/gmall-mock.git
日志服务器:https://github.com/SmallScorpion/gmall-spark-ch-es-realtime.git

需求

在这里插入图片描述

分析

  1. 做日活,取启动日志“GMALL_SPARK_CK_ES_START”中的数据(事件日志也可以做,但是会麻烦一点)
  2. 消费kafka中的数据。
  3. 利用redis过滤当日已经计入的日活设备
  4. 把每批次新增的当日日活信息保存到ES中(也可以做一层聚合数据量变小之后保存到redis或者MDB中)
  5. 从ES中查询出数据,发布成数据接口,通可视化化工程调用。

消费Kafka数据测试

  1. 启动zookeeper和kafka
  2. 启动nginx和日志服务器
  3. 启动sparkstreaming
  4. 开启日志生成jar
    在这里插入图片描述
Spark-ClickHouse-ES实时项目第六天-es的批量保存 仓库位置 日志生成:https://github.com/SmallScorpion/gmall-mock.git 日志服务器:https://github.com/SmallScorpion/gmall-spark-ch-es-realtime.git 分析 做日活,取启动日志“GMALL_SPARK_CK_ES_START”中的数据(事件日志也可以做,但是会麻烦一点) 消费kafka中的数据。 利用redis过滤当日已经计入的日活设备 把每批次新增的当日日活信息保存到ES中(也可以做一层聚合数据量变小 阅读详情

相关推荐

数据实时+离线项目架构----智慧物流大数据平台(超流行框架!)

智慧物流大数据平台 文章目录智慧物流大数据平台一、项目背景二、逻辑架构三、解决方案技术亮点:数据流转四、项目的技术选型4.1流式处理平台4.2 分布式计算平台4.3 海量数据存储框架软件版本总结 一、项目背景 本项目基于一家大型物流公司研发的智慧物流大数据平台。该物流公司是国内综合性快递、物流服务商,并在全国各地都有覆盖的网点。经过多年的积累、经营以及布局,拥有大规模的客户群,日订单达上千万。如此规模的业务数据量,传统的数据处理技术已经不能满足企业的经营分析需求。公司需要基于大数据技术构建数据中心,从而挖

weixin_48143996的博客 6401

kafka】海量kafka数据es速度优化处理

1、采用批量插入,批量插入效率较单条插入效率高很多(效果相当明显,一次批量插入数据大小限制在5M内)2、调整es 中索引的副本为0(效果相当明显,es无需做主副分片的复制,减少插入数据请求等待时间)主要是涉及到kafka 消费端到es数据处理。1、增加kafka消费并行度(效果相当明显)以下图为kibana中调整索引xxxx的副本数。2、kafka 设置多分区(效果相当明显)

qq_31286957的博客 1664

数据最全大数据物流项目:概述及Docker入门(一)_物流大数据项目

在整个中,最后给大家展示:实时大屏统计分析,实时性要求不是很高,分钟基本延迟。实时大屏每隔10秒,刷新一下记录,从ClickHouse 数据库中查询分析数据,进行大屏展示。1)、行业背景介绍:​ 自从国内电商购物节开始以后,每年用户电商APP购买物品增加,快递数量指数级别增长。2)、物流行业特点:属于复合型产业,实时产生大量的业务数据,需要关联性分析处理。3)、项目背景介绍:基于上述诉求,需要将快递物流产生相关业务数据,存储到大数据平台引擎中,进行分析(离线报表和实时查询检索)。

2401_84182318的博客 1271

项目Eskafka、mysql容量评估方案和服务器资源预估方案

正确的思想更具大厂经验建议(空间换技术)也就是机器多换技术简单(别把技术玩的太极限,亏钱的时候剩下那点就是九牛一毛,所以建议靠谱技术加横向扩展机器为最稳定方案)实际空间 = 源数据 × (1 + 副本数量) × (1 + 数据膨胀) / (1 - 内部任务开销) / (1 - 操作系统预留)存储容量 = 源数据 × (1 + 副本数量) × 1.45 × (1 + 预留空间)按照 12000 tps * 60s * 60m *24h = 日。按照 60 tps * 60s * 60m *24h = 日。

银河系天城知识宝库_技术专家蒋浩宇 3231

flink中读取kafka消息写进es消费进度过慢问题

问题:在数据量较小的时候,从kafka中读取消息并写入es,没什么问题。但是等数据量多的时候,发现读kafka消息向es写入速度明显变慢,出现了时间上较大的延迟。最后排查原因,发现是es有提交的机制,设置的最大的提交量是1,这样就会导致数据每来一条就要执行一次提交的操作,这样极大的拖慢了整个系统的处理速度。 esSinkBuilder.setBulkFlushMaxActions(1); 后面修改为 esSinkBuilder.setBulkFlushMaxActions(1000

qq_35642849的博客 3007

基于TransportClient的elasticsearch(es)消费kafka数据---Java程序设计

d 转载于:https://www.cnblogs.com/ChaosJu/p/5370984.html

dmr91325的博客 253

Spark-ClickHouse-ES实时项目第一天下-数据发送Kafka并部署在Linux中

仓库位置 日志生成:https://github.com/SmallScorpion/gmall-mock.git 日志服务器:https://github.com/SmallScorpion/gmall-spark-ck-es-realtime.git 添加依赖 <dependency> <groupId>com.alibaba</groupId> <artifactId>fastjson&lt

SmallScorpion 473

Spark-ClickHouse-ES实时项目第七天-精确一次性消费读取偏移量

仓库位置 日志生成:https://github.com/SmallScorpion/gmall-mock.git 日志服务器:https://github.com/SmallScorpion/gmall-spark-ch-es-realtime.git 手动提交偏移量 第一次读取会加载Redis数据,若是redis中没有数据那么将消费kafka起始数据,经过业务计算保存到redis中 中间循环过程是业务到redis保存数据的过程 若中途宕机,重启进程服务都会读取redis偏移量位置进行消费 Offs

SmallScorpion 348

seatunnel 消费kafka数据写入clickhouse

seatunnel 消费kafka 数据写入clickhouse

flye的专栏 2877

Spark-ClickHouse-ES实时项目第五天-redis去重

仓库位置 日志生成:https://github.com/SmallScorpion/gmall-mock.git 日志服务器:https://github.com/SmallScorpion/gmall-spark-ch-es-realtime.git 需求 分析 做日活,取启动日志“GMALL_SPARK_CK_ES_START”中的数据(事件日志也可以做,但是会麻烦一点) 消费kafka中的数据。 利用redis过滤当日已经计入的日活设备 把每批次新增的当日日活信息保存到ES中(也可以做一层聚合数

SmallScorpion 655

Spark-ClickHouse-ES实时项目第八天-精确一次性消费保存偏移量

仓库位置 日志生成:https://github.com/SmallScorpion/gmall-mock.git 日志服务器:https://github.com/SmallScorpion/gmall-spark-ch-es-realtime.git 手动提交偏移量 第一次读取会加载Redis数据,若是redis中没有数据那么将消费kafka起始数据,经过业务计算保存到redis中 中间循环过程是业务到redis保存数据的过程 若中途宕机,重启进程服务都会读取redis偏移量位置进行消费 Offs

SmallScorpion 390

SparkStreaming & Kafka & ClickHouse

网上关于Spark 读写 clickhouse的文章不少,但我认为适用你的可能还真不多。看看本文是否能给你开启一个新思路? 一、Spark消费Kafka后写入Clickhouse 注意,clickhouse集群部署?kafka集群部署?Spark消费Kafka的CDC过程 怎么实现?怎么实现一次性语义?等不在本文的讨论范围。本文主要想给出一种写clickhouse的一种方式。 二、参考代码 ......这里省略了部分无关代码 val topic = "testdbserver.cdc_test_

nick_huangzheng的博客 2008

Kafka】Elasticsearch 与 Kafka 整合剖析

1.概述 转载:https://www.cnblogs.com/smartloli/p/6978645.html 目前,随着大数据的浪潮,Kafka 被越来越多的企业所认可,如今的Kafka已发展到0.10.x,其优秀的特性也带给我们解决实际业务的方案。对于数据分流来说,既可以分流到离线存储平台(HDFS),离线计算平台(Hive仓库),也可以分流实时流水计算(Storm,Spark)等,同样也可以分流到海量数据查询(HBase),或是及时查询(ElasticSearch)。而今天笔者给大家分享的就是Ka.

九师兄 1885

ESKafka消费堆积报警,elasticsearch [cluster:monitor/nodes/info] timed out after [5000ms]

2. 修改消费者连接ES的超时时间.put("client.transport.ping_timeout", "120s")1. es集群挂掉了,登陆线上监控平台发现es运行正常,但是堆内存使用过高。2. 堆内存过大,可能导致FULL GC,影响ES数据写入,默认是5s超时。3. 优化ES集群堆内存,保持在70%以下,或者扩容。es集群连接超时,导致消费消费kafka卡死。3. ES长时间运行可能导致堆内存过高。1. 重启es集群,堆内存恢复。

后端研发工程师Marion的博客 1338

kafka 通过logstash消费ES

在不需要处理的kafka收集到的数据的时候,可以通过logstash直接存到ES,不用再另外的写消费kafka数据的代码 步骤: 1.收集数据,通过KafkaTemplate的send方法,将数据以JSON格式给kafka(要带topic) @Autowired KafkaTemplate kafkaTemplate; //省略中间数据处理阶段 //topic:每条发布到Kafka集群的消息都有一个类别,这个类别被称为Topic //message:json格式的数据 kafkaT

qq_43637491的博客 1270

kafka java api 消费es

最近在做日志监控,日志通过logback或者log4j写入kafka,需要用kafka的java api写个消费端。由于是进行日志消费,可以允许有一定的丢失和重复消费,但是应该尽量避免。 代码: public class KafkaConsumerTest {     private static Logger LOGGER = LoggerFactory.getLogg

Cumu Blog 5502

使用clickhouse kafka表引擎消费kafka写入clickhouse

本文使用seatunnel 消费kafka数据写入clickhouse文章的kafka topic,用另一种方式写入clickhouse,也是练习下clickhouse kafka引擎。本文也默认已安装了kafkaclickhouse,这方面的安装文档很多,这里不做详述;前提准备 kafka :2.7.0;通过filebeat 写入kafka一、kafka数据格式使用kafka 命令查看数据格式:{},},},},"ecs": {},"host": {},"log": {

flye的专栏 3022

kafka数据同步Elasticsearch深入详解

1、kafka同步到Elasticsearch方式?目前已知常用的方式有四种: 1)logstash_input_kafka插件; 缺点:不稳定(ES中文社区讨论) 2)spark stream同步; 缺点:太庞大 3)kafka connector同步; 4)自写程序读取、解析、写入 本文主要基于kafka connector实现kafka到Elasticsearch全量、增量同

铭毅天下Elasticsearch 3万+
上一篇: Spark-ClickHouse-ES实时项目第三天-ES工具类编写测试
下一篇: Spark-ClickHouse-ES实时项目第五天-redis去重
SmallScorpion
博客等级 码龄9年 146粉丝 301原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值