7k star 监控系统,100%国产,推荐了解
本文介绍开源监控工具夜莺监控(Nightingale):它适合解决 Zabbix 与 Prometheus 在云原生、告警管理、多数据源、仪表盘和多机房场景中的常见痛点,并提供安装部署、数据源、采集器和社区支持说明。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
本文介绍开源监控工具夜莺监控(Nightingale):它适合解决 Zabbix 与 Prometheus 在云原生、告警管理、多数据源、仪表盘和多机房场景中的常见痛点,并提供安装部署、数据源、采集器和社区支持说明。
Flashduty 2023-09-07 更新新增深色模式与主题配置,并优化分析看板、协作空间、故障列表、故障详情和值班详情在深色模式下的显示效果。
夜莺 v6.1.0 发布说明:增强日志、链路和仪表盘之间的数据串联能力,并支持 v6 小版本自动更新表结构,简化升级流程。
Uptime Kuma 1.23.0 版本开始支持 Flashduty。本文演示如何安装 Uptime Kuma、获取 Flashduty 集成地址、配置监控项和通知渠道,并在 Flashduty 中查看告警结果。
说明如何用 Categraf 的 PostgreSQL 插件采集数据库指标,并在夜莺中测试插件输出、导入 PostgreSQL 仪表盘、导入告警规则和扩展自定义 SQL 采集。
夜莺 v6.0.3 发布说明:优化告警订阅逻辑、大盘全屏展示、Grafana 大盘导入兼容性,并支持 SSO SkipTlsVerify 与 Postgres jsonb 兼容。
一篇面向初学者的 eBPF Hello World 入门教程,解释 eBPF 的基本概念、执行流程、BCC 安装方法和 hello_world.py 示例,帮助理解 Linux 内核可编程能力。
本文介绍夜莺专业版如何在中心端管理 Categraf 采集规则并下发,解决采集器配置分散、难登录机器修改困难、新人使用采集插件成本高等问题。
夜莺 v6.0.2 发布说明:增强仪表盘排查能力、订阅规则支持业务组、Elasticsearch 即时查询支持字段值快速过滤,并优化 Loki 数据源校验。
夜莺开源项目在 2023 年 7 月底发布 V6 正式版,项目目标从开源监控系统升级为开源可观测性平台。V6 引入 ElasticSearch 日志数据源、内置中间件大盘和告警规则,简化架构与配置,并明确 LTS 和小版本发布节奏。
本文回顾 CCF夜莺·2023可观测性高峰论坛:论坛于 2023 年 7 月 28 日在北京举行,围绕夜莺 V6、BPF、云监控、医疗、连锁药房、高精度定位、金融、高校和故障定位等实践展开分享。
Flashduty 2023-07-24 更新重点包括告警聚合、风暴预警、抖动收敛、故障分派升级、通知过程展示,以及 Webhook 按协作空间和事件类型过滤。
MySQL 主从延迟排查要先区分 IO_THREAD 和 SQL_THREAD:看主从 binlog 位置、relay log 堆积、Seconds_Behind_Master 的局限,再针对网络、慢 SQL、缺少主键、大事务和诊断采集逐项处理。
基于 SigNoz 官网介绍和本地 Docker Compose 体验,初步评估 SigNoz 在 OpenTelemetry、ClickHouse、Trace、Logs、Dashboard、Alert 和权限模型上的产品设计。
监控系统自监控要避免循环依赖:正常情况采集 Prometheus、VictoriaMetrics、Nightingale 等自身 /metrics,严重故障则用 catpaw + Flashduty 做外挂存活监控和独立告警兜底。
可观测性是根据系统输出数据理解系统内部状态的能力,常见数据包括日志、指标和链路追踪。本文介绍可观测性的定义、与监控的区别、主要收益、三大支柱、实践方法和落地挑战。
解释不可变基础设施与可变基础设施的区别,说明它在 DevOps、CI/CD、镜像生命周期、补丁管理、蓝绿发布和金丝雀发布中的实践方式。
监控 /etc/shadow 等敏感文件变化时,传统指标方案只能上报 mtime,告警文本有限。本文介绍用 catpaw filechange 插件配合 Flashduty 监控文件变化、配置告警和验证效果。
JMX Exporter 可以把 Java 应用通过 JMX 暴露的 MBean 指标转换为 Prometheus 可抓取的 HTTP 指标。本文以 Kafka 和 Zookeeper 为例,说明安装、javaagent 启动参数、端口验证、采集方式和 rules 配置含义。
可观测性体系的目标不是堆 metrics、logs、traces,而是帮助技术团队快速发现故障、定位直接原因并完成止损。本文从故障生命周期、结果类指标、数据特征、观点和洞察几个层次,说明面向故障处理的可观测性应该如何建设。