江淮,eBay架构师,18年IT老兵。经历过通讯行业和游戏行业,于2011年加入eBay。加入eBay后的前6年负责了eBay两代云计算平台的架构和建设,从2017年开始负责eBay监控系统,目前致力于推动eBay的监控体系向下一代演进。

江淮,eBay架构师,18年IT老兵。经历过通讯行业和游戏行业,于2011年加入eBay。加入eBay后的前6年负责了eBay两代云计算平台的架构和建设,从2017年开始负责eBay监控系统,目前致力于推动eBay的监控体系向下一代演进。
近10年来,因为基础设施的规模增长、云原生和微服务架构的演进,运维的工作发生了巨大的变化,越来越多的自动化工作成为了运维的一部分。这些自动化应该遵循什么样的原则组织起来?运维平台化的要素是什么?在eBay,运维和Cloud Team属于同一部门,共同为业务产品部门提供一个可编程基础设施。
而监控是运维维护站点可用性最重要的工具。eBay建立了一个高吞吐高可用的监控的基础设施——Sherlock.io,它每秒接收8M的Metric,500k的Events, 2M Traces(40M Span)和每天6PB的日志。在这个基础设施之上,我们打造了一个基于图的因果关系推导的异常检测的智能化解决方案,为运维提供更精准的告警。
同时,eBay 运维系统的其他部分也在进行从自动化变成智能化的转变,比如eBay的发布系统、流量管理系统 ,等等。
本话题我将分享eBay在可观察性上的实践。
1. Operation evolution
2. Build operation work as a platform
3. Observability in eBay
3.1 The infrastructure
4. 从自动化到智能化



微信咨询

电话咨询
微信联系我们
