近年来,Apache Kafka 凭借其简单易上手及高吞吐量等优势渐渐成为互联网... 展开 >



Apache Kafka Committer,老虎证券技术负责人,著有《Apache Kafka实战》一书,曾任职于IBM、搜狗和新浪微博等公司。对 Kafka 及其他开源流处理框架与技术有深刻理解,精通 Kafka 原理,主导过多个十亿级/天的消息引擎业务系统的设计与搭建,具有丰富的线上环境定位和诊断调优经验,曾给多家大型公司提供企业级 Kafka 培训。
近年来,Apache Kafka 凭借其简单易上手及高吞吐量等优势渐渐成为互联网业界消息引擎领域的主流框架。无论是在大厂亦或是创业小公司,Kafka 的身影随处可见,但如何搭建一套好用的 Kafka 环境,如何将 Kafka 合理恰当地应用到符合自身业务条件的场景等问题是众多 IT 从业者面临的一个主要难题。本专题通过引入一线大厂的实际解决方案和最佳实践介绍,希望能够从 Kafka 基本应用、底层设计、日常运维等多个方面给大家带来新的思考和借鉴。
Kafka 因其高吞吐低延迟特性在数据集成领域有着广泛的应用。DataPipeline 作为一款面向企业私有化部署的数据集成产品,在其架构中也将 Kafka 作为可选的数据缓存和分发组件。将 Kafka 用在私有化部署中会面临一些独有的挑战,包括数据完整性、一致性、日志留存管理以及性能调优等等。本次分享我将分享 DataPipeline 多年应用 Kafka实战中的心得总结,包括如何防止数据丢失和重复,如何对日志留存进行动态管理以防止数据的意外回收、集群容量及可用性规划等方面。
演讲提纲:
1. 硬币的两面:应用 Kafka 的收获与代价
2. 通过合理的可用性规划保证数据完整性
3. 数据处理的至少有一次 vs 恰好有一次
4. 动态日志留存管理的实现方法
5. 减少 topic partition 数量增长对性能的影响
你将获得:
Uber 是在实践中采用 Apache Kafka 最早的公司之一,拥有世界上最大的 Kafka 集群部署之一。经过多年的实践,Kafka 在 Uber 经过多次架构上的迭代来适应在数据规模、用户规模、用例规模上的增长。这次演讲主要分享 Kafka 在 Uber 的演进经历与 Uber 在 Kafka 上做过的不同改进。
演讲提纲:
1. Kafka 在 Uber 的主要用例
2. Kafka 在 Uber 遇到的挑战
3. Uber 对 Kafka 在不同维度和方向上进行的改进与迭代
你将获得:
了解 Uber 基于 Kafka 构建超大规模的实施流数据平台的挑战与解决方案
在互联网技术更新迭代如此迅速的今天,海量的数据增长和治理问题变得尤为突出。业界的技术选型众多,无论是数据存储引擎,还是数据交互组件,主流的技术方案在生产和消费数据量小的场景下,很少会遇到性能瓶颈。然而,如果日均处理数据量级在数十亿时,服务的整体技术架构就会面临可用性和稳定性的巨大挑战。而大多数公司的数据同步和清洗技术手段还比较传统,存在延迟高、吞吐低、性能差等一系列问题。这就导致服务的整体技术架构面临着可用性和稳定性的挑战。
本次我为大家主要分享基于 Kafka Connect 从0到1搭建一个工业级可用的异构数据流式处理平台,实现海量 MySQL、PostgreSQL、MongoDB、Elasticsearch 等异构数据源之间基于 Kafka 的双向流式同步和清洗,并基于 JMX、Prometheus Exporter、Grafana 提供一站式分布式集群的监控和报警能力。
演讲提纲:
1. 主流异构数据流式处理的技术选型及 Kafka Connect 生态的优势
2. Kafka Connect 架构设计及 Source & Sink Connectors 组件化机制
3. Kafka Connect Transforms 架构设计及轻量级 ETL 自研实践
4. 集群管理控制台自研及监控体系搭建
5. 基于 Kafka Connect 的异构数据流式处理工业级平台实践
你将获得:



微信咨询

电话咨询
微信联系我们
