夜莺 v9.1.0 发布:告警评估过程可回看,内置时序库开箱即用
夜莺监控 Nightingale v9.1.0 发布:新增告警评估执行记录,每个评估周期查了什么、判定结果如何、事件后来去哪了都会落盘可回看;内置 Prometheus 时序库,小规模场景不用先部署 Prometheus / VictoriaMetrics;支持从 Grafana 一键导入数据源,新增 Categraf 采集配置向导,通知媒介与消息模板支持保存前测试。本文介绍 v9.1.0 的主要变化与升级注意事项。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
夜莺监控 Nightingale v9.1.0 发布:新增告警评估执行记录,每个评估周期查了什么、判定结果如何、事件后来去哪了都会落盘可回看;内置 Prometheus 时序库,小规模场景不用先部署 Prometheus / VictoriaMetrics;支持从 Grafana 一键导入数据源,新增 Categraf 采集配置向导,通知媒介与消息模板支持保存前测试。本文介绍 v9.1.0 的主要变化与升级注意事项。
夜莺监控 Nightingale v9.0.0 正式发布:全新推出 Nightingale AI(内置 AI 助手、Skill 市场、LLM 集中管理),内置 MCP Server 与 A2A 协议,告警规则支持测试触发,新一代日志浏览统一支持 Elasticsearch、Loki、VictoriaLogs,导航、布局与四大规则表单全面重构。本文带你速览 v9 的核心变化与升级要点。
本文介绍 Categraf 指标已写入后端、但夜莺或 Grafana Dashboard 没有数据时的完整排查方法,覆盖 Dashboard 文件选择、数据源、时间范围、变量、实际标签、PromQL、采集周期、版本兼容和面板变换。
本文介绍 Categraf 使用 test 模式确认采集、再用 debug 或正式模式验证写入,但夜莺、VictoriaMetrics 或 Prometheus 兼容后端仍查不到数据时的完整排查方法,覆盖运行模式、writer、标签转换、内存队列、HTTP、认证、TLS、时间偏差、租户和查询端点。
本文给出 Categraf 进程正常但单个 input 没有指标时的完整排查路径,覆盖插件目录、instances、--inputs、test 模式、采集周期、网络、认证、TLS、运行用户、数据库权限和指标过滤。
本文从 Categraf 当前源码和 Linux 部署流程出发,给出启动失败的完整排查顺序,覆盖配置目录、TOML 语法与编码、文件权限、systemd 服务、二进制架构、版本兼容、端口冲突和日志定位。
本文从源码和实际目录结构出发,讲清楚 Categraf 的配置目录、global、writer、heartbeat、input 插件,以及 Metrics、Prometheus、Logs、Ibex 四类 Agent 的配置与数据链路。
本文介绍如何使用 Categraf 采集 PostgreSQL 指标,包括监控账号、实例配置、事务与缓存指标、锁等待自定义 SQL、pg_stat_statements、夜莺和 Grafana Dashboard,以及告警建议。
本文介绍如何使用 Categraf 采集 MongoDB 指标,覆盖单节点、副本集、mongos、config server、shard server、认证权限、核心指标、Dashboard 和告警建议。
本文记录如何用 Docker Compose 搭建用于 Categraf MongoDB 监控验证的测试环境,覆盖单节点、三节点副本集、config server、shard replica set、mongos、认证账号和测试数据。
本文介绍如何使用 Categraf dns_query 插件做 DNS 查询质量监控,包括 DNS 服务器配置、域名解析探测、非预期 IP 校验、结果码、响应码、解析耗时、Dashboard 和告警建议。
面向正在评估 AI SRE 的企业团队,说明为什么第一阶段应优先做事件上下文收集、相似事件对比、沟通草稿和复盘材料,而不是直接无人值守自动修复。
面向 B2B SaaS 平台、SRE、支持和客户成功团队,说明如何把 SLA、SLO、SLI、租户级影响分析、状态页和事件响应连接成客户可用的可靠性闭环。
面向长期使用 Zabbix 的企业团队,说明如何保留已有监控资产,先统一告警响应和责任归属,再分阶段引入现代可观测能力。
面向互联网平台和 SRE 团队,说明如何围绕登录、搜索、下单、支付、消息等核心用户旅程建立从体验信号到根因路径的可观测性和响应闭环。
面向 SRE、平台工程和运维团队,说明为什么告警治理不能停留在调阈值,而要连接标签、责任人、降噪、路由、排班、升级、复盘和管理指标。
面向银行、证券、期货、支付和金融科技团队,梳理如何把可观测性、告警治理、值班响应、ITSM、变更证据和复盘改进连接成可审计闭环。
面向公共部门、电信运营商和关键基础设施团队,说明如何在遗留基础设施、私有云、Kubernetes 和多厂商系统共存时建设统一监控与事件响应工作流。
面向游戏开服、大版本更新、赛事活动和高价值营销活动,梳理如何用 Flashcat、Flashduty 与 AI SRE 建立玩家视角的可观测性、告警治理和值班响应闭环。
本文介绍如何使用 Categraf http_response 插件做 HTTP/HTTPS 黑盒探测,包括探测配置、结果码、状态码、分阶段耗时、HTTPS 证书过期时间、Dashboard 和告警建议。