夜莺 v7.beta12.1 发版,支持集成 Grafana
夜莺 v7.beta12.1 支持在夜莺中集成 Grafana 仪表盘,适合已经习惯 Grafana 面板的用户统一查看监控数据,并说明 allow_embedding、anonymous 和 cookie_samesite 等配置要点。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
夜莺 v7.beta12.1 支持在夜莺中集成 Grafana 仪表盘,适合已经习惯 Grafana 面板的用户统一查看监控数据,并说明 allow_embedding、anonymous 和 cookie_samesite 等配置要点。
本文说明 node-exporter filefd 插件如何读取 /proc/sys/fs/file-nr 监控系统文件句柄使用率,并解释 file-nr 与 ulimit、/proc/PID/limits、categraf procstat 进程句柄限制监控的关系。
夜莺 v7.beta11 优化钉钉、企微、飞书机器人通知配置,支持在告警规则回调地址中直接识别 webhook,并改进钉钉和飞书 at 人方式。
这是专栏第 8 篇,介绍一下 node-exporter 的 conntrack 插件。这个插件大家平时关注可能较少,但是在一些场景下,比如防火墙、NAT 网关等,需要监控 conntrack 表的使用情况。我就遇到过一次生产事故,就是因为 conntract 表满了,导致新连接无法建立,所以这个插件还是很有用的。
基于 opentelemetry-demo 微服务项目,演示如何用 OpenTelemetry 搭建端到端可观测性系统,查看 Trace、Metrics 和数据流转。
夜莺 v7.0.0.beta10 支持在告警规则中配置 recovery_promql,并在恢复通知模板中读取 recovery_value,从而在 Prometheus 告警恢复时展示恢复时的值。
夜莺监控 v7.beta8 引入模板中心,集中管理采集说明、指标、仪表盘和告警规则;同时支持机器列表联动指标视图,并修复边缘机房机器失联告警问题。
介绍如何用 httpstat 排查 HTTP 接口超时,按 DNS、TCP、TLS、服务端处理和内容传输拆解耗时,辅助判断问题在网络侧还是服务端。
围绕阿里巴巴 1-5-10 故障目标,说明如何用北极星指标、灭火图、事件墙和多维分析缩短发现、处置与恢复时间,帮助团队建立更快的应急响应机制。
介绍 GPU 服务器与 InfiniBand 的监控方案,对比 nvidia-smi 和 DCGM,并演示如何结合 Categraf 与 Exporter 接入夜莺。
node-exporter 是 Prometheus 的官方 exporter 之一,用于监控 Linux 系统的各种指标。本文是专栏第一篇,介绍 node-exporter 的框架,后面会逐步深入 node-exporter 的原理和实现。
多个 Prometheus 或 VictoriaMetrics 集群需要统一查询时,可以用 promxy 或 VictoriaMetrics vmselect 做聚合入口。本文基于本地模拟环境说明数据源聚合、server_group 标签和查询验证方法。
夜莺监控 v7.beta4 支持仪表盘变量与业务组机器联动,同一大盘导入不同业务组后,可自动按业务组筛选机器,并新增跨业务组克隆、LDAP Role Mapping 等能力。
夜莺监控(Nightingale)上线内置指标功能,把常用 PromQL 以中文指标视图沉淀下来,降低普通用户查询 Prometheus 指标的门槛,并支持通过过滤条件复用到具体业务或机器场景。
Prometheus 监控平台由 Prometheus Server、Service Discovery、Exporter、Pushgateway、Alertmanager、Grafana 等组件协同完成采集、存储、查询、告警和展示。本文按数据流解释每个组件的职责、边界和常见扩展方式。
Prometheus 与 Nightingale 不是简单替代关系,而是更常见于协同使用:Prometheus 生态负责采集、存储和查询,Nightingale 更适合作为时序数据告警引擎、规则管理和边缘机房告警自治平台。
开源许可证对比:陆续有一些知名开源项目,出于保护商业利益的角度出发,更改了自己的开源许可证,比如:Redis、Zabbix、Grafana、ElasticSearch、Kibana 等,开源许可证应该怎么选?
夜莺监控告警自愈机制通过告警引擎、ibex 命令通道和 Categraf Agent 协作,在告警触发后自动执行脚本。本文介绍配置方法、命令通道测试、自愈脚本创建和权限注意事项。
本文以 NGINX access_log 提取为例,对比 Logstash 与 fc-stash 在配置方式、字段解析、平台化管理和压测表现上的差异,帮助团队理解日志 ETL 组件选型时应重点关注的功能、成本和运维体验。
从 SRE 视角梳理 502 Bad Gateway 排查路径:用 Chrome 开发者工具确认接口,用 cURL 绕过 Nginx 验证后端,结合 Nginx 日志、超时配置、容器日志和 OOM 线索定位问题。