可观测性 Observability 3.0 是个啥
可观测性 3.0 是个啥?本文介绍了可观测性 3.0 的背景、目标和实现方式,强调了成本效率和智能数据收集的重要性。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
可观测性 3.0 是个啥?本文介绍了可观测性 3.0 的背景、目标和实现方式,强调了成本效率和智能数据收集的重要性。
Airbnb 内部负载测试框架 Impulse 的实践解析:如何通过上下文感知负载生成、依赖项模拟、生产流量采集与回放、测试 API 生成,在 CI/CD 中完成自助式负载测试和容量验证。
基于夜莺监控 Pipeline、Event Update 和 Event Drop,把发版系统与告警事件联动,实现发布期间自动静默相关告警。
断路器模式(Circuit Breaker Pattern)用于在依赖服务失败、超时或变慢时快速失败、触发降级并等待恢复。本文解释 Closed、Open、Half-Open 三种状态、适用场景、Resilience4j Java 示例和关键配置项。
夜莺监控发布了 v8.beta14 版本,新增 Postgres 告警支持和 AI Summary 处理器,增强业务监控能力。
用 Keycloak 与 OIDC 打通夜莺监控和 Grafana:统一 SSO 登录,并将 Grafana 内嵌到夜莺,实现一个入口管理告警、通知和可视化大盘。
秦晓辉复盘在运维监控和可观测性领域创业的判断:为什么创业、为什么选这个赛道、解决什么痛点、Flashduty 与 Flashcat 的产品区别,以及 To B 产品长期存续靠什么。
逐项解析 Categraf 主配置文件 config.toml,说明 global、log、writer、http、ibex、heartbeat、prometheus 等关键配置的作用、默认部署含义和排查重点。
夜莺 v8.0.0-beta13 新增 MySQL 数据源告警支持,适合围绕订单、商品等业务数据配置关键业务指标告警,并修复通知媒介联系方式和 Elasticsearch KQL 报错显示问题。
介绍微软 Azure SRE Agent 的能力与工作方式,涵盖 Azure 资源上下文、事件响应、日志和指标分析、根因定位、安全检查、人工批准后的止损动作以及 GitHub 闭环。
从传统的ELK转向由OpenTelemetry和OpenSearch驱动的技术栈,能为您的日志需求提供更灵活、高效且真正开源的解决方案。您可以借助OTel实现标准化的遥测数据收集,从日志开始,之后再添加追踪和指标数据。这是在内部构建全栈可观测性系统的第一步
夜莺 v8.0.0-beta11 新增 ClickHouse 告警、事件 Pipeline、新版菜单和新版活跃告警,并保留 v6/v7 平滑升级说明。
告警风暴会让团队疲劳、关键告警漏处理、电话短信成本升高。本文从告警规则治理、On-call、复盘、收敛降噪、认领升级五个环节说明治理方法。
本文翻译并整理 Teiva Harsanyi 关于复杂系统的经验:区分 complicated 与 complex,解释涌现行为、延迟后果、局部优化、迟滞和非线性,并总结可逆决策、全局指标、受控发布、可观测性、模拟、机器学习和团队协作等处理方法。
介绍 SRE(站点可靠性工程)的七项原则:拥抱风险、SLO、消除琐事、监控、自动化、发布工程和简洁性,帮助运维人员理解从传统运维转向 SRE 的核心方法。
Gergely Orosz 结合 Stack Overflow 提问量数据,分析 LLM、审核政策和开发者求助方式变化如何共同推动 Stack Overflow 走向衰落。
复盘 Spotify 2025 年 4 月 16 日全球中断:Envoy 过滤器顺序变更触发崩溃,重试流量与 Kubernetes 内存限制配置问题放大影响,并总结变更灰度、容量和告警启示。
Feature Flag 能降低发布风险、支持灰度和快速回滚,但也会带来代码复杂度、僵尸标志、命名混乱、监控缺失和性能瓶颈。本文整理 SRE 视角下的常见错误和改进做法。
在夜莺里重新整理了机器的仪表盘,包括 Categraf 作为采集器和 NodeExporter 作为采集器两种指标的仪表盘。也整理了夜莺 v8 版本的自身监控数据的仪表盘。自取。
最近行业内讨论 Observability 2.0 又多起来了,怎么算是 2.0?如果我没记错,最原始的观点应该是 Honeycomb 的 CTO 提出来的。她说:三大支柱(指标、日志、链路追踪)时代是 Observability 1.0 时代,三类数据分散存储,不好统一分析,而 Observability 2.0 时代是三类数据统一存储,甚至不再归类为三类数据,而是统一归为“宽事件”数据,每个事件有很多字段和标签。