SRE Google 运维解密读书笔记一:SRE 方法论概述
《Google 运维解密》读书笔记第一篇:概述 SRE 的来源、团队技能、50% 琐事原则、SLO、错误预算、监控、变更管理、容量规划和性能优化。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
《Google 运维解密》读书笔记第一篇:概述 SRE 的来源、团队技能、50% 琐事原则、SLO、错误预算、监控、变更管理、容量规划和性能优化。
介绍如何将 Zabbix 告警接入 Flashduty,并用 Flashduty 补齐告警降噪、排班、认领、升级、IM 协同和告警治理分析能力。
可观测性不应只围绕日志、指标和分布式链路追踪三支柱建设。本文从定故障、定边界、定原因三个阶段出发,强调以告警、上下文、拓扑和止损结果衡量可观测性价值。
本文结合 Kubernetes 与 kube-prometheus-stack 场景,梳理 Prometheus 性能优化和高基数治理实践:从丢弃未使用指标、配置 node-exporter、使用 metric relabeling,到用 Prometheus TSDB Status、Cardinality Explorer 和 pprof 分析资源占用。
技术社区提问指南:想更快得到答案,先自己排查,提供版本、配置、日志、请求响应、复现步骤和完整截图,只描述事实,保持礼貌,并在解决后回馈社区。
Prometheus 指标瘦身实践:使用 mimirtool 分析 Grafana Dashboard、Prometheus 规则和 Prometheus 实例中的指标,找出已使用与未使用指标,为基数治理和采集优化提供依据。
Flashcat 统一观测平台提供指标、日志、链路等数据的仪表盘、即时查询和快捷视图能力。本文介绍这些可视化能力分别解决什么问题,以及如何把排障经验沉淀成可复用视图。
系统介绍 Flashcat 统一观测平台的告警能力:PromQL 阈值告警、机器失联告警、日志告警、智能告警、静默屏蔽、订阅分组、回调集成和告警事件流转。
LinkedIn 如何扩展 Salt 支撑大规模远程命令执行:从单 master 瓶颈,到 REST API、li-salt-master、li-minion、mTLS、ACL 和监控日志体系。
LinkedIn SRE 面试流程解读:从规模背景、电话筛选、代码与运维题,到现场故障排除、告警分级和大型网站架构设计面试。
本文介绍 Meta/Facebook SLICK 的 SLO 平台实践:统一 SLI/SLO 定义、长期保留分钟级指标、提供可发现的服务可靠性视图,并把 SLO 接入事件处理和可靠性报告工作流。
告警通知降噪的关键不是把所有告警细节塞进短信或电话,而是把通知入口收敛、把查看细节交给页面聚合。本文用 300 条告警的场景说明通知策略、分派、升级和值班协同如何配合。
排班 OnCall 不是简单把告警分给某个人,而是让故障响应、团队稳定、知识沉淀和客户支持形成机制化闭环。
告警风暴治理不能只靠屏蔽通知,核心是优化告警策略、区分业务告警和资源告警、建立统一 OnCall 中心,并用去重、聚合、抑制、静默和量化指标持续降低告警噪音。
介绍 SRE 的基本概念、可靠性与自动化目标,并梳理 SRE 与 DevOps 在理念、实践方式、责任和代码所有权上的关系与差异。
在过去的几年里,我一直在构建和运营一个大型分布式系统:优步的支付系统。在此期间,我学到了很多关于分布式架构概念的知识,并亲眼目睹了高负载和高可用性系统不仅要构建还要运行的挑战。构建系统本身是一项有趣的工作。规划系统如何处理10x / 100x流量的增加,确保数据持久,面对硬件故障处理等等,这些都需要智慧。不管怎样,运维大型分布式系统对我来说是一次令人大开眼界的体验。
Jaeger 是面向微服务架构的分布式链路追踪系统,常用于上下文传播、请求链路分析、根因定位、服务依赖分析和延迟优化。本文梳理 Jaeger 的核心概念、部署架构和主要组件。
从 Open-Falcon 的监控系统实践出发,梳理微服务和云原生架构为什么推动监控系统演进到可观测平台,并说明云原生时代对数据模型、采集方式、Metric/Log/Trace 融合、告警和开源社区的要求。
本文解读 Netflix 自研应用监控系统 Telltale:它通过 Atlas、Mantis、基础架构事件、Canary、上下游依赖和 QoE 指标构建应用健康评估模型,并把智能监控、上下文告警、异常事件管理和部署监控串成完整链路。
优化 PromQL 和 MetricsQL 查询,先判断慢查询,再分别检查时间序列数量、原始样本数量、重复处理样本、高流失率标签和复杂二元运算,最后通过标签过滤、缩短窗口、调大 Grafana step 等方式降低 CPU、RAM 和 IO 消耗。