ClickHouse 集群版深度实践

会议室:待定
出品人:郭炜

ClickHouse集群面对大量数据查询性能优异,但是具有难扩容、建表繁琐、Zo... 展开 >

专题出品人:郭炜

ClickHouse 中国社区发起人

郭炜,人称“郭大侠”,ClickHouse 中国社区发起人,Apache Foundation Member,Apache DolphinScheduler PMC。中国软件行业协会智能应用服务分会副主任委员,TGO 北京董事会学习委员,全球中小企业创业联合会副会长,人民大学大数据商业分析研究中心客座研究员。
郭大侠曾任易观 CTO,联想研究院大数据总监,万达电商数据部总经理,并曾在中金、IBM、Teradata 公司担任大数据方向重要岗位,对大数据前沿领域研究做出过卓越贡献。
郭大侠一直致力于让“数据能力平民化”的事业上,本人参与多个开源项目,非常擅长深入简出地讲解复杂的大数据和开源概念,被评为虎啸 10 年杰出数字人物。郭大侠在易观从 0 到 1 打造了一支技术团队,建设了 6.8Pb、月活用户 6.02 亿大数据平台,完成易观千帆、方舟等多个商业数据产品,促进了 Apache Dolphin Scheduler 开源并成为 Apache 顶级项目。

专题:ClickHouse 集群版深度实践

ClickHouse集群面对大量数据查询性能优异,但是具有难扩容、建表繁琐、ZooKeeper瓶颈、不支持高并发等痛点。本专题将结合大型厂商的ClickHouse集群真实实践案例,从短期、中期、长期使用经验三个层次,由浅入深地给你带来应用ClickHouse集群的痛点问题的解决方案,帮助你得心应手地驾驭这匹ClickHouse黑马。

by 王玉

唯品会
OLAP资深工程师

随着 ClickHouse 越来越火热,很多公司都迫切地想体验一下这匹来自战斗民族的黑马,但体验这匹黑马,首先需要解决原有 Hive 数据仓库的数据和 ClickHouse 的互通问题。

本次分享主要带来唯品会如何选型组件 Sea Tunnel (原 Waterdrop) 完成 ClickHouse 和 Hive 的数据出仓入仓,内容包括过程中唯品会遇到了哪些痛点,是怎么解决的,在原有的功能上做了哪些优化等等,希望能和大家互相学习,交流经验。

演讲提纲:

  1. ClickHouse 数据导入的需求和痛点
  2. ClickHouse 和 Hive 出仓入仓工具的选型
  3. Hive 出仓 ClickHouse
    • 使用 Sea Tunnel 中 HyperLogLog 加速
    • Bitmap 出仓入仓的实现
  4. ClickHouse 数据入仓 Hive (含 Bitmap 数据类型)
  5. Sea Tunnel 在唯品会数仓中扮演的角色
    • 平台的集成与扩展

听众受益:

  • 完整了解 ClickHouse 和其他数据组件的数据导出导入
  • 规避初次接触 ClickHouse 数据出入仓时可能碰到的问题和痛点

by 虞李凯

网易
高级数据研发工程师

ClickHouse 的实时处理能力强悍,网易使用 ClickHouse 搭建了数据平台,承担数据存储和指标计算任务。但是数据平台在使用过程中,我们发现了 ClickHouse 的一些痛点问题:

  • 更新支持能力弱
  • 对明细表统计分析数据量极大时,查询时间较长
  • 并发查询能力弱

网易是如何解决这些问题的?这是我今天要分享的重点,希望能和你一起交流讨论,给你在使用 ClickHouse 时提供一些帮助。

演讲提纲:

  1. ClickHouse 在网易 CDP 中的角色
  2. ClickHouse 更新能力弱
    • 如何利用聚合表实现以插入代替更新
  3. ClickHouse 查询性能瓶颈
    • 如何利用预计算来加速查询
    • 网易预计算系统的实现思路
  4. ClickHouse 大并发的查询时
    • 如何减少并发量

听众受益:

  • 深入理解 ClickHouse 聚合表
  • 了解 ClickHouse 做预计算的新视野
  • 大并发的场景的解决方案

by 孔文

云智慧
研发总监

2016 年 ClickHouse 刚开源时,云智慧就被它强悍的查询性能和可以支撑的数据规模所吸引到,期望能将它应用于 AIOps 的场景中。随着 ClickHouse 本身的迭代完善和对其不断学习和研究,到 2018 年我们已经将 ClickHouse 作为了我们 AIOps 产品运维主数据的存储引擎,其以成本优势、支撑的数据规模和查询性能在实际项目中得到了不少客户的认可。迄今为止,已经服务了约数百个大中型的客户,在这个过程中,也遇到了不少问题和挑战,很高兴能和广大 ClickHouse 的用户和爱好者进行分享和交流,希望能互相学习共同进步。

演讲提纲:

  1. AIOps 场景介绍
    • AIOps 在数据库方面的挑战
    • 为什么选择 ClickHouse 作为主数据库
  2. ClickHouse 集群部署问题
    • 数据库集群的资源隔离问题
    • 集群配置以及数据冗余问题
    • 集群的动态扩容
    • 数据迁移备份问题
  3. ClickHouse 对日志实时写入与查询问题
    • 海量日志及指标数据的实时写入
    • 读写分离
    • 确保写入一致性
    • 日志数据查询性能优化
    • 支持有并发要求的场景
    • 通过异常查询排查定位问题

你将获得:

  • 了解 AIOps 的场景中 ClickHouse 使用方案

by 贺钰城

联想
开源优化架构师

在使用 ClickHouse 集群时,很多人都以为必须使用 ZooKeeper。实际上 ZooKeeper 只是起到了一个辅助作用,可以让不熟练的人快速上手。事实上,用了 ZooKeeper 会在数据录入上导致不小的麻烦。因此,本次我分享的重点是联想如何去除 ZooKeeper 的依赖。

演讲提纲:

  1. 为什么不使用 ZooKeeper 来完成标准集群实现
    • ZooKeeper 同步出现延迟问题
    • ZooKeeper 压力太大, 表处于“read only mode”模式
    • on Cluster 只支持 MergeTree 相关引擎的表
  2. 实现无 ZooKeeper 的高可用的理论基础
    • ClickHouse 的独立性
    • ClickHouse 分片原理
    • Distributed 表引擎的原理
  3. 实现高可用的历程
    • 通过 Distributed 实现数据同步复制
    • 通过修改 JDBC 实现数据复制同步
    • 通过修改 JDBC 实现读写分离

你将获得:

  • 去 ZooKeeper 的 ClickHouse 使用方案

by 孙弘毅

腾讯微信
大数据高级研发工程师

微信丰富多样的业务生态对数据分析产生了巨大的需求,如何对无时无刻不在产生的海量数据进行分析也成了一个艰巨的挑战。ClickHouse 作为当前 OLAP 领域的一匹快马,目前已成为微信团队实现数据驱动的重要载具。本次分享将聚焦 ClickHouse 的海量数据接入问题,分享微信 OLAP 团队在 ClickHouse 数据接入层累积的经验。

演讲提纲:

  1. ClickHouse 在微信的应用(实验平台、BI 分析、特征计算,监控) 
  2. ClickHouse 数据写入的一般原理与常见问题 
  3. 微信 ClickHouse 数据接入层介绍(离线 & 在线)
  4. Hash 路由写入实践 
  5. 实时数据接入中的端到端的精确一次 
  6. 效果总结与未来展望

by 高天铎

中国移动
云能力中心高级系统架构师

针对业务日志信息的统计是一种常见的需求场景,实现方法也多种多样。中国移动在数据千亿条的场景下,先尝试了 ETL+MySQL,可处理的数据量又无法满足需求,又尝试了 ETL+Hive,但计算性能较差。我们希望在满足容量需求的情况下,能达到较好的性能,对整体架构进行了优化。本次分享将给大家带来使用 ClickHouse 实现千亿条日志数据统计的架构落地及优化,以及 ClickHouse 在这个过程中有哪些优势又有哪些问题。

演讲提纲:

  1. 业务日志统计应用面临的问题
    • 业务需求概述
    • 应用的第一次尝试——MySQL
    • 应用的第二次尝试——Hive
  2. 基于数据流动的架构优化
    • 架构优化思路
    • 基于 ClickHouse 的性能优化
    • 基于 ClickHouse 的数据流优化
    • 基于 ClickHouse 的数据生命周期优化
  3. 后续的故事
    • 存在的问题以及后续研发方向

你将获得:

  • 中国移动业务日志统计的选型经验
  • 使用 ClickHouse 实现千亿条日志数据统计的落地方案

交通指南

来广营·朝来科技园

Laiguangying Beijing
地址: 北京市朝阳区来广营朝来科技园
  • 微信咨询

  • 电话咨询

    联系电话:+86 13167596032

微信联系我们