开源的Datadog?可观测性平台SigNoz是否名副其实?
基于 SigNoz 官网介绍和本地 Docker Compose 体验,初步评估 SigNoz 在 OpenTelemetry、ClickHouse、Trace、Logs、Dashboard、Alert 和权限模型上的产品设计。
汇总 Flashcat 博客中与 Nightingale 相关的文章,方便按主题连续阅读实践、案例、选型和产品更新。
基于 SigNoz 官网介绍和本地 Docker Compose 体验,初步评估 SigNoz 在 OpenTelemetry、ClickHouse、Trace、Logs、Dashboard、Alert 和权限模型上的产品设计。
新东方硬件监控案例:通过服务器带外 SNMP 暴露硬件健康状态,用 Telegraf 采集 OID 数据,写入 Loki,再由 Nightingale 配置日志告警并对接统一告警中心。
Nightingale 夜莺 6.x 版本架构上做了调整,本文从中心部署架构和下沉部署架构两个常见场景进行介绍。
解释夜莺、Nightingale、快猫、Flashcat、开源版本和商业版本之间的关系,说明夜莺的定位、快猫公司的角色以及商业版的上层能力。
夜莺 V6 以 6.0 beta 版本开始从监控系统升级为开源可观测平台,支持 Prometheus、ElasticSearch、Jaeger 等数据源,简化 n9e 架构,并增强内置大盘、告警规则、屏蔽规则和订阅规则能力。
夜莺监控(Nightingale)6.x 重新设计机器失联告警:不再由 n9e-server 周期性生成 target_up 指标,而是基于 MySQL 中 target 心跳时间直接判断失联状态,让逻辑更简单、即时性更好。
介绍如何用 Telegraf 的 outputs.http 插件通过 Prometheus remote write 协议发送指标到 Nightingale 或 Prometheus,并说明 host 标签冲突和 agent_hostname 配置建议。
夜莺监控 6.x 架构设计思考:从指标监控扩展到 metrics、logs、traces 多数据源统一接入,并通过 n9e-center、告警引擎和 Pushgateway 的中心/边缘部署适配多地域网络。
Kubernetes Pod 内应用监控实操:比较 statsd、Prometheus 埋点和日志分析方案,说明 sidecar、Pod annotation 服务发现与 Prometheus agent 抓取配置。
kube-state-metrics 监控 Kubernetes 对象实操:安装 KSM、区分 8080 与 8081 指标、配置 Prometheus 抓取、理解分片、告警规则和资源过滤。
Kubernetes ETCD 监控实操:说明 /metrics 访问方式、2381 指标端口、Prometheus agent 抓取配置,以及 leader、proposal、WAL、DB 大小等关键指标。
Kubernetes scheduler 监控实操:验证 /metrics 认证、用 Prometheus agent 抓取 kube-scheduler,并理解调度队列、调度耗时、抢占和 leader election 等关键指标。
Kubernetes controller-manager 监控实操:如何验证 /metrics、配置 Prometheus agent 抓取、导入夜莺大盘,并理解 workqueue、leader election、PV/PVC 等关键指标。
Kubernetes 监控手册第 6 篇,讲解 APIServer 监控:6443 HTTPS 指标接口、Token/RBAC 认证、Prometheus agent mode 服务发现、Remote Write 上报和关键指标含义。
夜莺监控大盘可以通过文字卡片展示图片。本文以 Redis logo 为例,介绍如何把图片上传到图床,并用 Markdown/HTML 在仪表盘文字卡片中展示。
夜莺监控对象列表来自流经 n9e-server 的监控数据,主要用于机器标签、业务组权限、自愈脚本和基础利用率展示;PULL 模式数据不流经 n9e-server 时可能不会出现在列表中。
Kubernetes 监控手册第 5 篇,讲解 Kubelet 监控:10248 健康检查、10250 HTTPS 指标接口、ServiceAccount/RBAC 认证、Categraf DaemonSet 配置以及 Kubelet 与 cAdvisor 指标。
夜莺监控从 v5 开始取消树形机器分组,改用一维业务组与标签协同:业务组负责权限与配置归属,标签负责机器细分和时序数据过滤。
Kubernetes 监控手册第 4 篇,讲解 Kube-Proxy 监控:10249 指标端口、10256 健康检查、Categraf Prometheus 插件配置、DaemonSet 部署和关键指标含义。
Kubernetes 监控手册第 3 篇,演示如何用 Categraf 采集 Linux 宿主机 CPU、内存、IO、进程等指标,并通过 Remote Write 推送到 Nightingale 或其他兼容后端。