字节跳动如何通过优化列式存储加速 Spark SQL

所属专题:融合趋势下的大数据技术

嘉宾 : 郭俊 | 字节跳动 数据引擎团队负责人

会议室 : 水晶厅

讲师介绍

专题演讲嘉宾:郭俊

字节跳动 数据引擎团队负责人

郭俊,就职于字节跳动(上海),现负责数据引擎团队。团队负责以 Spark SQL、Presto 为代表的 OLAP 引擎优化。曾就职于 Cisco 及 eBay,负责 Streaming MPP 系统研发,大数据基础架构的研发及优化工作。

议题介绍

演讲:字节跳动如何通过优化列式存储加速 Spark SQL

在字节跳动数据仓库领域,Spark SQL 已经取代 Hive 成为了主要的计算引擎。目前 Spark SQL 每天处理千万亿级数据。数据引擎团队针对线上复杂的场景,以及用户对于稳定性及性能方面的需求,进行了大量的优化,包含 SQL 层优化、执行层优化、Shuffle 优化、列式存储优化等。

在字节跳动内部,列式存储在数仓领域广泛使用。目前字节跳动主推的列式存储格式是 Parquet,同时存在部分使用 ORC 的场景。本次演讲,将介绍字节跳动数据引擎团队如何通过列式存储上的一系列优化加速 Spark SQL 从而更好支撑 EB 级数仓。

内容大纲

1. 列式存储基本原理及常见优化方向(高效压缩、向量化读、Late Materialization、Invisible Join)

2. Parquet 支持复杂数据类型向量化读及 field pruning

3. 物化列大幅提升复杂数据类型的读取及过滤效率

3. 自定义 Parquet 索引

4. LocalSort 提升压缩比并优化查询性能

5. IO并行化:并行读小文件,并行读大文件 Row Group

6. 异步 Spill

听众受益

1. 了解列式存储常见优化方法

2. EB 级数仓下列式存储优化实践

交通指南

上海虹口三至喜来登酒店

Beijing International Convention Center
地址:上海市四平路59号
  • 微信咨询

  • 电话咨询

    联系电话:86+ 17310043226

微信联系我们