建立云原生组织的8个要素
建立云原生组织需要围绕 Business KPIs、SLOs、平台团队、SRE 团队、应用开发团队、DevOps、GitOps 和 IaC 搭建协作机制,让技术团队更快支撑业务迭代并保障系统稳定。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
建立云原生组织需要围绕 Business KPIs、SLOs、平台团队、SRE 团队、应用开发团队、DevOps、GitOps 和 IaC 搭建协作机制,让技术团队更快支撑业务迭代并保障系统稳定。
本文从用户视角重新定义系统稳定性,提出通过北极星指标、灭火图、信息协同、事件中心和智能辅助决策建设稳定性体系,让技术团队、业务方和故障应急团队围绕同一套可量化事实协作。
映客直播从 Open-Falcon 迁移到夜莺监控,建设公司级统一监控平台,支撑每个采集周期 5 亿级时间线,并将机器量从 80 台降到 20+ 台。
从 Open-Falcon 与 Prometheus 的数据模型差异出发,梳理云原生监控在采集、数据模型、查询、关联分析、OaC/API-Driven 和系统云原生化上的十大趋势。
基于 Rancher v2.6.4、RKE Kubernetes 1.22.9 和 Nightingale Helm Chart v0.1.0,演示如何通过 Rancher Explorer UI 安装夜莺监控,并导入 Dashboard 与告警规则。
2022 年 5 月 11 日,夜莺监控开源项目由滴滴捐赠给中国计算机学会开源发展委员会(CCF ODC),成为 CCF ODC 接收捐赠的首个产业界开源项目。