郭俊,就职于字节跳动(上海),现负责数据引擎团队。团队负责以 Spark SQL、Presto 为代表的 OLAP 引擎优化。曾就职于 Cisco 及 eBay,负责 Streaming MPP 系统研发,大数据基础架构的研发及优化工作。

郭俊,就职于字节跳动(上海),现负责数据引擎团队。团队负责以 Spark SQL、Presto 为代表的 OLAP 引擎优化。曾就职于 Cisco 及 eBay,负责 Streaming MPP 系统研发,大数据基础架构的研发及优化工作。
在字节跳动数据仓库领域,Spark SQL 已经取代 Hive 成为了主要的计算引擎。目前 Spark SQL 每天处理千万亿级数据。数据引擎团队针对线上复杂的场景,以及用户对于稳定性及性能方面的需求,进行了大量的优化,包含 SQL 层优化、执行层优化、Shuffle 优化、列式存储优化等。
在字节跳动内部,列式存储在数仓领域广泛使用。目前字节跳动主推的列式存储格式是 Parquet,同时存在部分使用 ORC 的场景。本次演讲,将介绍字节跳动数据引擎团队如何通过列式存储上的一系列优化加速 Spark SQL 从而更好支撑 EB 级数仓。
1. 列式存储基本原理及常见优化方向(高效压缩、向量化读、Late Materialization、Invisible Join)
2. Parquet 支持复杂数据类型向量化读及 field pruning
3. 物化列大幅提升复杂数据类型的读取及过滤效率
3. 自定义 Parquet 索引
4. LocalSort 提升压缩比并优化查询性能
5. IO并行化:并行读小文件,并行读大文件 Row Group
6. 异步 Spill
1. 了解列式存储常见优化方法
2. EB 级数仓下列式存储优化实践



微信咨询

电话咨询
微信联系我们
