各个互联网公司经历了独立建设数仓体系,大数据计算引擎的阶段,后来逐渐转向所谓流批... 展开 >






周家英(徒离),蚂蚁集团资深技术专家,现负责数据技术部在线计算团队。2011 年加入支付宝后,一直参与支付宝数据相关工作。经历了蚂蚁集团从离线数据,实时数据,到目前在线数据的不同的阶段,参与过蚂蚁实时数据平台,Serverless Streaming,在线作业调度,计算元数据,以及新一代计算引擎的建设。熟悉蚂蚁数据技术架构演进历史,对分布式环境下的在线计算场景及高可用方案有切身体会。
各个互联网公司经历了独立建设数仓体系,大数据计算引擎的阶段,后来逐渐转向所谓流批一体,离在线结合的趋势,可以看到大数据的发展已经从点状的引擎搭建,逐渐走向更加全面的平台建设。本次专题关注新一代互联网应用下的一体化的大数据平台,探究不同公司面临的问题及解决办法。
实时数仓是大数据领域目前炙手可热的主题,各公司都在积极构建实时数仓,甚至实时数据中台。传统Lambda架构已不堪重负。新的产品和方案层出不穷。构建一个适合的实时数仓需要考虑哪些因素?怎么设计架构和链路?本演讲基于阿里内外的成功实时数仓案例来分享实时数仓的构建,分别对流量场景(例如精准营销、算法分析、网络监控等)和数据库场景(AP数据中台)下的分析与服务给出经验分享,希望对于听众能有所启发。
1. 实时数仓建设方法的演进
2. 实时数仓原则与方法论
3. 实时数仓的建设方法
4. 实时数仓查询方法的设计
5. 实时数仓写入链路的设计
6. 流量分析场景下的实践案例
7. 数据库场景下的实践案例
大数据从业人员、企业数据中台建设者、企业大数据总监、企业CTO等。
Kafka作为滴滴大数据消息队列,每天承载万亿级消息的生产与消费,面对100GB/S峰值流量,服务了公司内数千Kafka用户,托管了数十Kafka集群,数万Kafka Topic,单集群>300+Broker,面向Kafka用户、Kafka运维人员,打造了一套共享多租户Logi-KafkaManager服务体系。本次演讲将主要分享滴滴Kafka服务体系建设的经验和挑战。
1. 滴滴Kafka应用概况
2. Kafka服务建设实践
3. Kafka服务建设规划
对实时数据平台及 Kafka引擎 感兴趣的技术人员,架构师与产品经理等。
业务的快速发展与迭代,如何合理的控制数据与算法基础设施的成本,如何为前线业务提供充足的计算与存储能力,是基础设施团队必须要面对的问题。 随着云原生社区的蓬勃发展,给我们带来了很多思路和工具来应对这个成本和灵活性的难题。从2018年开始,网易严选的大数据和算法基础架构开始朝着计算存储分离、批流、模型训练与推理等计算混合部署方向演进,到2020年为止,我们基本上完成了这一个方向的工作。 本次演讲,我想给大家介绍下网易严选在这个演进过程中具体的工作,包括架构演进的目标、核心的推进策略(Spark、Flink、Tenseflow等服务的改造策略)和推进过程中遇到的坑等等。
大数据从业人员,对大数据基础设施和云原生相关技术感兴趣的同学。
随着近几年业务快速发展与迭代,大数据的成本也水涨船高,如何优化成本,建设低成本高效率的底层服务成为了有赞数据基础平台2020年的主旋律。本次分享主要介绍了随着云原生时代的到来,经历7年发展的有赞离线计算平台如何拥抱云原生,通过容器化改造、弹性伸缩、大数据组件的错峰混部,做到业务成倍增长的情况下成本负增长。
1. 有赞离线计算的发展历程
2. 存储计算分离
3. 离线计算容器化改造
4. 容器化改造后的大幅度降本
5. 未来规划
你将获得
1. 了解有赞离线计算的发展历程
2. 了解存储计算分离的实践以及有赞关于存储治理的经验
3. 了解 Spark on K8s 容器化改造
大数据从业人员,适合对大数据基础设施、云原生感兴趣的同学。
Flink 是一款流批一体的计算框架,在实际应用中由于缺少一款流批一体的存储引擎,导致实际架构会比较复杂。TiDB 是一款开源的、分布式、同时能支持 OLAP 和 OLTP 负载的 NewSQL 数据库,TiDB 能做到水平扩展、强一致性和高可用。利用 TiDB 的水平扩展能力和强大的 HTAP 能力配合 Flink 的流式计算能力,可以搭建出可以水平扩展的、高效、易用的实时数据仓库。此外还会介绍一下业界真实使用 TiDB + Flink 来构建实时数据仓库的案例。
1、TiDB 如何做到 HTAP
2、业界使用 Flink 做实时数仓的案例及遇到的问题
3、Flink + TiDB 做实时数仓
4、未来方向
对TiDB、Flink、实时计算感兴趣的技术人员,架构师与产品经理等。



微信咨询

电话咨询
微信联系我们
