新一代互联网应用下大数据平台

会议室:待定
出品人:周家英

各个互联网公司经历了独立建设数仓体系,大数据计算引擎的阶段,后来逐渐转向所谓流批... 展开 >

专题出品人:周家英

蚂蚁集团 资深技术专家

周家英(徒离),蚂蚁集团资深技术专家,现负责数据技术部在线计算团队。2011 年加入支付宝后,一直参与支付宝数据相关工作。经历了蚂蚁集团从离线数据,实时数据,到目前在线数据的不同的阶段,参与过蚂蚁实时数据平台,Serverless Streaming,在线作业调度,计算元数据,以及新一代计算引擎的建设。熟悉蚂蚁数据技术架构演进历史,对分布式环境下的在线计算场景及高可用方案有切身体会。

专题:新一代互联网应用下大数据平台

各个互联网公司经历了独立建设数仓体系,大数据计算引擎的阶段,后来逐渐转向所谓流批一体,离在线结合的趋势,可以看到大数据的发展已经从点状的引擎搭建,逐渐走向更加全面的平台建设。本次专题关注新一代互联网应用下的一体化的大数据平台,探究不同公司面临的问题及解决办法。

by 姜伟华

阿里巴巴
资深技术专家

实时数仓是大数据领域目前炙手可热的主题,各公司都在积极构建实时数仓,甚至实时数据中台。传统Lambda架构已不堪重负。新的产品和方案层出不穷。构建一个适合的实时数仓需要考虑哪些因素?怎么设计架构和链路?本演讲基于阿里内外的成功实时数仓案例来分享实时数仓的构建,分别对流量场景(例如精准营销、算法分析、网络监控等)和数据库场景(AP数据中台)下的分析与服务给出经验分享,希望对于听众能有所启发。 

内容大纲

1. 实时数仓建设方法的演进

2. 实时数仓原则与方法论

  • 模型统一、接口统一、流批一体
  • 灵活、低成本
  • 不要lambda架构
  • 架构一定要简单
  • 成本 vs 性能

3. 实时数仓的建设方法

  • ODS->DWD->DWS->ADS
  • 热数据与冷数据的存储

4. 实时数仓查询方法的设计

  • 查询pattern
  • 查询QPS
  • 预聚合

5. 实时数仓写入链路的设计

6. 流量分析场景下的实践案例

  • AB Test
  • 智能营销
  • 网络监控
  • 实时排行榜

7. 数据库场景下的实践案例

  • 数据打宽
  • 分库分表合并

听众受益

  • 实时数仓建设方法的演进
  • 实时数仓的建设方法
  • 实时数仓写入链路和查询方法的设计
  • 流量分析场景下的实践案例 (例如精准营销、算法分析、网络监控、实时大屏、实时排行榜等)
  • 数据库场景下的实践案例  

适合人群

大数据从业人员、企业数据中台建设者、企业大数据总监、企业CTO等。

by 张亮

滴滴云
商业数据负责人

Kafka作为滴滴大数据消息队列,每天承载万亿级消息的生产与消费,面对100GB/S峰值流量,服务了公司内数千Kafka用户,托管了数十Kafka集群,数万Kafka Topic,单集群>300+Broker,面向Kafka用户、Kafka运维人员,打造了一套共享多租户Logi-KafkaManager服务体系。本次演讲将主要分享滴滴Kafka服务体系建设的经验和挑战。

内容大纲

1.  滴滴Kafka应用概况

  • Kafka在滴滴的应用场景
  • Kafka在生产实践痛点

2.  Kafka服务建设实践

  • Kafka引擎高可用建设
  • Logi-KafkaManager平台建设

3.  Kafka服务建设规划

  • Logi-KafkaManager开源迭代规划
  • 滴滴Kafka引擎迭代规划

听众受益

  • 了解 Kafka 在滴滴实践中的稳定性建设经验
  • 了解滴滴开源Logi-KafkaManager背后的思考
  • 了解滴滴解决Kafka核心痛点技术问题的思路

适合人群

对实时数据平台及 Kafka引擎 感兴趣的技术人员,架构师与产品经理等。

by 左琴

网易
高级技术专家

业务的快速发展与迭代,如何合理的控制数据与算法基础设施的成本,如何为前线业务提供充足的计算与存储能力,是基础设施团队必须要面对的问题。 随着云原生社区的蓬勃发展,给我们带来了很多思路和工具来应对这个成本和灵活性的难题。从2018年开始,网易严选的大数据和算法基础架构开始朝着计算存储分离、批流、模型训练与推理等计算混合部署方向演进,到2020年为止,我们基本上完成了这一个方向的工作。 本次演讲,我想给大家介绍下网易严选在这个演进过程中具体的工作,包括架构演进的目标、核心的推进策略(Spark、Flink、Tenseflow等服务的改造策略)和推进过程中遇到的坑等等。 

听众受益

  1. 获得计算存储分离,计算混合部署,拥抱云原生等技术革新实践经验
  2. 了解架构演进对各个公司大数据体系的成本和灵活性层面的意义
  3. 为正处于数据架构升级中的各大公司提供不错的参考案例
  4. 以实战经验帮助企业避免重复采坑,共同探讨未来的发展趋势和应对策略

适合人群

大数据从业人员,对大数据基础设施和云原生相关技术感兴趣的同学。 

by 郑生俊

有赞
数据基础平台负责人

随着近几年业务快速发展与迭代,大数据的成本也水涨船高,如何优化成本,建设低成本高效率的底层服务成为了有赞数据基础平台2020年的主旋律。本次分享主要介绍了随着云原生时代的到来,经历7年发展的有赞离线计算平台如何拥抱云原生,通过容器化改造、弹性伸缩、大数据组件的错峰混部,做到业务成倍增长的情况下成本负增长。  

演讲大纲

1. 有赞离线计算的发展历程

  • 有赞离线计算7年发展史
  • 当前规模下的挑战

2. 存储计算分离

  • 存储计算分离的实践
  • 有赞存储治理的经验

3. 离线计算容器化改造

  • Spark on K8s 容器化改造

4. 容器化改造后的大幅度降本

  • 基于云主机的离线计算弹性伸缩
  • 在线服务与离线计算的错峰混部

5. 未来规划

你将获得
1. 了解有赞离线计算的发展历程
2. 了解存储计算分离的实践以及有赞关于存储治理的经验
3. 了解 Spark on K8s 容器化改造

适合人群

大数据从业人员,适合对大数据基础设施、云原生感兴趣的同学。

by 顾亮亮

PingCAP
研发工程师

Flink 是一款流批一体的计算框架,在实际应用中由于缺少一款流批一体的存储引擎,导致实际架构会比较复杂。TiDB 是一款开源的、分布式、同时能支持 OLAP 和 OLTP 负载的 NewSQL 数据库,TiDB 能做到水平扩展、强一致性和高可用。利用 TiDB 的水平扩展能力和强大的 HTAP 能力配合 Flink 的流式计算能力,可以搭建出可以水平扩展的、高效、易用的实时数据仓库。此外还会介绍一下业界真实使用 TiDB + Flink 来构建实时数据仓库的案例。

演讲大纲

1、TiDB 如何做到 HTAP

  • TiKV: OLTP
  • TiFlash: OLTP

2、业界使用 Flink 做实时数仓的案例及遇到的问题

  •   Flink + MySQL
  •   Flink + Clickhouse

3、Flink + TiDB 做实时数仓

  • 方案
  • 优势
  • 行业案例

4、未来方向

听众收益

  • 了解 TiDB 的架构
  • 了解如何使用 Flink + TiDB 构建实时数仓
  • 了解其他公司真实案例

适合人群

对TiDB、Flink、实时计算感兴趣的技术人员,架构师与产品经理等。

交通指南

杭州·JW万豪酒店

Renaissance Beijing Capital Hotel
地址: 杭州拱墅区湖墅南路28号
  • 微信咨询

  • 电话咨询

    联系电话:86+ 13167596032

微信联系我们