SRE 简介,和 DevOps 的关系和异同
介绍 SRE 的基本概念、可靠性与自动化目标,并梳理 SRE 与 DevOps 在理念、实践方式、责任和代码所有权上的关系与差异。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
介绍 SRE 的基本概念、可靠性与自动化目标,并梳理 SRE 与 DevOps 在理念、实践方式、责任和代码所有权上的关系与差异。
在过去的几年里,我一直在构建和运营一个大型分布式系统:优步的支付系统。在此期间,我学到了很多关于分布式架构概念的知识,并亲眼目睹了高负载和高可用性系统不仅要构建还要运行的挑战。构建系统本身是一项有趣的工作。规划系统如何处理10x / 100x流量的增加,确保数据持久,面对硬件故障处理等等,这些都需要智慧。不管怎样,运维大型分布式系统对我来说是一次令人大开眼界的体验。
Jaeger 是面向微服务架构的分布式链路追踪系统,常用于上下文传播、请求链路分析、根因定位、服务依赖分析和延迟优化。本文梳理 Jaeger 的核心概念、部署架构和主要组件。
从 Open-Falcon 的监控系统实践出发,梳理微服务和云原生架构为什么推动监控系统演进到可观测平台,并说明云原生时代对数据模型、采集方式、Metric/Log/Trace 融合、告警和开源社区的要求。
本文解读 Netflix 自研应用监控系统 Telltale:它通过 Atlas、Mantis、基础架构事件、Canary、上下游依赖和 QoE 指标构建应用健康评估模型,并把智能监控、上下文告警、异常事件管理和部署监控串成完整链路。
优化 PromQL 和 MetricsQL 查询,先判断慢查询,再分别检查时间序列数量、原始样本数量、重复处理样本、高流失率标签和复杂二元运算,最后通过标签过滤、缩短窗口、调大 Grafana step 等方式降低 CPU、RAM 和 IO 消耗。
稳定性体系建设要围绕故障生命周期展开:事前预防、事中发现与止损、事后复盘改进,并通过方法论和工具把这些动作产品化。
Flashduty 2023-04-06 更新重点包括 IM 协同升级、模板管理交互优化、菜单优化,以及 AWS CloudWatch、华为云监控、百度云监控告警集成。
新东方硬件监控案例:通过服务器带外 SNMP 暴露硬件健康状态,用 Telegraf 采集 OID 数据,写入 Loki,再由 Nightingale 配置日志告警并对接统一告警中心。
夜莺黄埔营第 1 期免费在线培训招募:围绕夜莺安装部署、架构原理、Categraf 采集器、中间件监控和 Prometheus/VictoriaMetrics/Zabbix 等监控知识,帮助新用户入门夜莺与可观测性实践。
王明松分享云原生应用实践“王四条”、深度用云的取舍、平台工程边界、成熟 SaaS 工具使用、SRE 梯队建设和运维自我革命。
概述 Netflix SRE 实践:CORE 团队、自由与责任文化、you build it you run it、生产工具、事故响应、性能工程、混沌工程和对企业可观测性建设的启发。
途游游戏邹轶分享中小公司运维建设方法,涵盖游戏运维特点、研运一体化团队、平台工程、自服务、FinOps 成本优化和服务运营价值表达。
Nightingale 夜莺 6.x 版本架构上做了调整,本文从中心部署架构和下沉部署架构两个常见场景进行介绍。
SRE 接手新业务前要做运维准入测试,把架构、容量、稳定性、安全、可观测性和责任边界前置验证,避免上线后由运维替设计缺陷背锅。
如何做好今天的运维:优秀运维和架构师的核心竞争力不是会多少工具,而是对业务价值、系统流程、核心模块、部署架构、基础设施和风险预案的理解深度。
说明如何在 VictoriaMetrics 中使用 delete_series 删除指标,以及通过导出、修改、删除、重新导入的流程间接更新指标数据,并提示删除 API 的性能和合规边界。
转载自阮一峰的网络日志。老规矩,兼听则明,偏信则暗,听百家之言,自我决策。
以一篇由 NotionAI 生成的 SNMP Exporter 示例为基础,介绍 SNMP Exporter 的用途、基础配置、Prometheus 抓取方式和使用注意事项,帮助读者理解 SNMP 设备指标如何进入 Prometheus。
解释夜莺、Nightingale、快猫、Flashcat、开源版本和商业版本之间的关系,说明夜莺的定位、快猫公司的角色以及商业版的上层能力。