专题演讲嘉宾:杜克伟

蚂蚁集团技术风险部 开发工程师

蚂蚁集团技术风险部开发工程师,目前负责蚂蚁kubernetes集群的稳定性方面的工作,专注于集群组件变更、稳定性风险保障等方面。

by 杜克伟

蚂蚁集团
技术风险部 开发工程师

蚂蚁集团运行着全球最大的 Kubernetes 集群之一。Kubernetes 社区官方以 5k node 作为 Kubernetes 大规模的标准,而蚂蚁集团已经在运营万级节点的集群。蚂蚁集团的 Kubernetes 的演进,从 2018 年至今已经走过了 3 年多的岁月,随着业务形态的复杂化和集群规模量级的提升,对集群的稳健运营带来了极大的挑战。所谓万丈高楼平地起, Kubernetes 集群的基石就是存储数据的 etcd,只有 etcd 的性能和稳定性得到保障,Kubernetes 集群才能稳定运转。在保障 etcd 方面,进行 etcd 的数据拆分是一种行业内广为人知的技术手段,但对一个正在业务运营的超大规模的集群进行拆分,一个简单的事情就变得充满挑战,就像给正在飞行的飞机更换发动机。这里将会对蚂蚁集群的 etcd 数据拆分实践进行介绍和分享。

演讲提纲:

1. etcd 数据拆分面临的挑战

  • 集群规模增长存储压力骤增
  • 复杂业务聚合发生化学反应

2. etcd 数据拆分整体思路解析

  • 拆分是在做什么
  • 拆分影响了什么
  • 重启服务是否必须

3. etcd 数据拆分的关键技术 

  • 拆分总体流程
  • API Server Watch 逻辑定制
  • etcd 数据裁剪
  • etcd 数据压缩

你将获得:

  • etcd 数据拆分实践中的坑点
  • API Server 中的 Resource Version 的作用
  • etcd 中的 Revision 与 Kubernetes 的 Resource Version 的映射关系
  • Kubernetes 的 Client 中的 Watch 处理机制
  • Kubernetes 的 API Server 中的 Watch 处理机制

交通指南

来广营·朝来科技园

Laiguangying Beijing
地址: 北京市朝阳区来广营朝来科技园
  • 微信咨询

  • 电话咨询

    联系电话:+86 13167596032

微信联系我们