Flink 实时计算业务融合之路

会议室:待定
出品人:方伟

Flink 实时计算趋于成熟,基于 Flink 的各种业务生态也迅速崛起,与此同... 展开 >

专题出品人:方伟

京东资深架构师

拥有多年中间件、大数据 PaaS 化经验,在实时流处理、分布式计算、数据引擎、数据分析、微服务等技术方向都有非常深入的理解,目前担任京东数据与智能部资深架构师。

专题:Flink 实时计算业务融合之路

Flink 实时计算趋于成熟,基于 Flink 的各种业务生态也迅速崛起,与此同时,Flink 在批流一体和数据算法中提供的能力也愈发显著。本专题将从批流一体、低代码开发、Flink CEP 等方面详细介绍 Flink 批流一体、数据算法的融合之路。

by 于哲

SmartNews
资深研发工程师

SmartNews 每天有近百亿的数据量,而且对于数据分析有着低延迟的要求,因而需要 ClickHouse 来实现 sub-seconds 数据分析。ClickHouse 是一个近几年来非常流行的开源数据分析数据库,提供了非常快速的宽表数据查询功能,然而 ClickHouse 并不支持 transaction,导致数据导入时可能引入重复。ClickHouse 的数据导入由 Flink 来完成。我们在内部研发时,通过分析 Flink 的现存精确一次的 Sink 的解决方案以及 ClickHouse 的写入特性,解决了上述问题。本次分享中我们将介绍现存的 Flink 精确一次的解决方案, ClickHouse 的写入细节,我们提出的解决方案,以及未来进一步的优化方案,希望能给遇到类似问题的团队带来启发。

演讲提纲:

  1. SmartNews 的技术与服务现状
    • 主营业务
    • 近百亿条的单日写入量
    • 技术栈以及取得成就
    • ClickHouse 在 SmartNews 的现状及问题
    • ClickHouse 的现状和优势
    • ClickHouse 的问题
  2. 技术重点
    • Flink 精确一次 Sink 的原理
    • ClickHouse 写入的原理
    • ClickHouse 关联 Materialized View 的写入
    • Flink 到 ClickHouse 的精确一致性的实现
  3. 项目实践
    • 背景
    • 实践过程
    • 结果
  4. 总结与展望
    • 进一步优化写入过程
    • 优化 ClickHouse 的数据存储

你将获得:

  • 了解 Flink 精确一次的输出原理
  • 了解 ClickHouse 的写入原理
  • Flink 到 ClickHouse 的精确一次写入的解决方案

by 龚中强

大健云仓
基础架构部负责人

随着公司业务飞速发展,实时处理和分析海量数据的需求日益提升,搭建实时数仓已经纳入公司重点工作清单中。Flink CDC 是实时数据集成框架的开源代表,具有全增量一体化、无锁读取、并发读取、分布式架构等技术优势,在开源社区中非常受欢迎。除了具备实时入湖入仓能力,Flink CDC 还支持强大的数据加工能力,可以通过 Flink SQL 对数据库数据做实时关联、聚合、打宽等。TiDB CDC 是 Flink CDC 的众多 connector 之一,本次分享,我将重点为大家介绍 TiDB CDC 的实现原理。

演讲提纲:

  1. Flink CDC 介绍
    • 快速了解 Flink CDC
    • Flink CDC 支持的 connectors
  2. TiDB CDC 原理剖析
    • 整体运行过程
    • 全量阶段
    • 增量阶段
    • TiDB 与 Flink SQL 类型映射
  3. 未来的优化方向和规划
    • TiDB CDC 现有不足和未来规划
    • Flink CDC 并发无锁框架

你将获得:

  • 了解 Flink CDC 项目
  • 了解 Flink TiDB CDC 的原理和未来规划
  • 了解 Flink CDC 并发无锁框架原理
  • 了解 Flink CDC 社区的最新动向

by 张猛

京东
资深技术专家

成本是高还是低,永远和价值挂钩,好的架构一定可以帮助大家降低学习成本,提升开发效率。低代码实时框架以 Flink / Flink SQL 为技术依托,将数据处理流程化、算子化,对业务研发效率高效赋能,在大数据处理实时化的同时极大提高研发效率,降低成本。本次分享我以京东榜单业务为切入点,介绍京东的低代码实时体系和在上面做的优化,包括但不限于 TopN 优化实战、多流拼接优化实战、Flink SQL 优化实战等。

演讲提纲:

  1. 实时计算低代码体系
    • 业界低代码现状
    • 京东实时框架低代码整体架构
    • 对比的优势
  2. TopN 场景低代码实战
    • TopN 在京东榜单业务体系中的应用
    • 传统 TopN 技术体系
    • 京东榜单业务 TopN 技术体系以及优化和发展
  3. Flink 多流 Join 优化实战
    • Flink 多流拼接在京东榜单业务体系中的应用
    • 目前实现以及做的优化
  4. Flink SQL 优化实战
    • Table Function 结果重用
    • Flink Shuffle 优化
    • Flink DAG 优化
  5. 总结

你将获得:

  • 了解京东基于 Flink 实时计算的低代码探索和实践
  • 了解京东低代码背后的做出的优化

by 徐超

袋鼠云
技术专家

袋鼠云的数据开发平台对外提供一站式的数据开发服务,需要对多个类型外部数据源进行接入。在此背景下,就需要一个高效、稳定的数据集成工具保障后续的数据开发任务能顺利进行。在对比多个工具之后,我们选择了 Flink 作为基座自研了 ChunJun(原 Flinkx)数据集成框架。经过 4 年多的迭代,ChunJun 已经成为一个稳定、高效、易用的批流一体数据集成工具,可实现多种异构数据源高效的数据同步。本次演讲我将介绍 ChunJun 在数据集成上的重要功能,并分享其实现原理。

演讲提纲:

  1. ChunJun 介绍
    • ChunJun 框架基本介绍
    • ChunJun 框架的架构
    • ChunJun 的一个基础样例
  2. ChunJun 在离线数据集成上的工作
    • 增量同步原理和实现
    • 断点续传原理和实现
    • 脏数据管理的原理和实现
  3. ChunJun 在实时数据集成上的工作
    • Binlog 实时采集的实现
    • 数据还原(DDL + DML)的原理和实现
  4. ChunJun 未来的规划
    • 建设数据集成的周边
    • 提供 RESTful 服务
    • 加强实时数据还原

你将获得:

  • 了解 ChunJun 项目
  • 了解 ChunJun 功能和背后的原理
  • 了解 Flink 自定义插件的扩展

交通指南

来广营·朝来科技园

Laiguangying Beijing
地址: 北京市朝阳区来广营朝来科技园
  • 微信咨询

  • 电话咨询

    联系电话:+86 13167596032

微信联系我们