通过 Categraf SNMP 插件采集监控数据
介绍如何通过 Categraf SNMP 插件采集监控数据,包括 SNMP agent 地址、版本、community、Scalar 数据、Table 数据、is_tag、inherit_tags 和 agent_host_tag 等关键配置。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
介绍如何通过 Categraf SNMP 插件采集监控数据,包括 SNMP agent 地址、版本、community、Scalar 数据、Table 数据、is_tag、inherit_tags 和 agent_host_tag 等关键配置。
Categraf SNMP 插件通过启发式算法自动提取带单位字符串中的数值,解决浪潮等服务器返回 60 degree Celsius 格式导致指标采集失败的问题,无需正则即可智能解析温度、电流等复杂格式。
使用夜莺监控、Categraf 和 VictoriaMetrics 监控多个进程的存活、CPU、内存、句柄、IO 等指标,并配置 procstat 插件和进程存活告警。
本文介绍 Nginx stub status 指标采集的完整流程:在 CentOS 7.2 环境编译 http_stub_status_module,配置 /stub_status 状态页,并通过 Categraf input.nginx 插件采集连接数、读写状态和请求指标。
本文介绍 Nginx upstream 健康状态采集流程:添加 nginx_upstream_check_module,配置 /upstream_status 状态页,并通过 Categraf input.nginx_upstream_check 插件采集 upstream rise、fall、up/down 等指标。
本文介绍 Nginx vts 指标采集流程:添加 nginx-module-vts,配置 /vts_status 状态页,并通过 Categraf input.prometheus 插件采集 Prometheus 格式的 vhost、upstream 和状态码指标。
介绍使用 Categraf 的 mtail 插件把系统日志异常转换为指标,再接入夜莺告警的轻量级方案,并给出 /var/log/messages 中 10 类严重系统错误的 mtail 规则示例。
在大规模 Kubernetes 集群中,单机低级别告警可能需要按数量升级为集群级告警。本文基于夜莺 MySQL 数据源和 alert_cur_event 当前告警表,演示如何用 SQL 统计活跃告警数量,并将聚合计数作为告警阈值。
基于 Categraf GitHub Issue #1261,解释容器中 PID 1 为什么会导致僵尸进程泄漏,以及如何通过 Go reapDaemon、SIGCHLD、wait4 和 PR_SET_CHILD_SUBREAPER 清理子进程。
具备产品思维的工程师关注用户、业务目标、产品决策和工程取舍。本文总结产品思维工程师的 9 个特质,并给出工程师培养产品思维的实践建议。
深入解析 Kubernetes OOM 和 CPU Throttling 问题:理解 limits/requests 配置、内存过量分配、CPU shares 机制,以及如何通过 Prometheus 指标监控和预防资源耗尽导致的 Pod 被杀或限流。
Kubernetes 必备 10 个告警配置及处置方法:涵盖 CPU 过高、Kubelet 卷管理器故障、API Server 错误、节点资源压力、Pod 状态异常、ETCD leader 变更等关键场景的监控与排查命令。
Prometheus 14 点最佳实践:包括 USE/RED 方法论、标签基数控制、指标命名规范、告警症状而非原因、rate 和 sum 顺序等核心经验,来自 PromCon 2017 的经典分享。
SRE 解决的核心问题是研发不懂运维、运维不懂研发的割裂问题。它用软件工程、自动化工具和可靠性方法,使系统增长时运维人力不必线性增加,并以运维敏捷支撑研发敏捷。
解读微软 Pingmesh 论文:一套大规模数据中心网络延迟监控系统,通过 Controller-Agent 架构实现每天 2000 亿次 ping 探测,用于网络故障判定、SLA 追踪和静默丢包检测。
非 Google 公司落地 SRE 的实践指南:解释 SRE 与 DevOps 的关系、团队职责、成熟度模型、自动化能力、SLI/SLO/SLA 设计,以及如何从监控和事件响应开始推进可靠性工程。
使用 eBPF 实现云网络可观测性:对比 Ring Buffer、Hash Map、Array 等数据结构在流量指标收集中的性能差异,分析 Skydive、Cilium、Falco 等开源工具的实现方案。
OpenTelemetry 入门指南:介绍 OTel 的 API、SDK、Collector 组件,以及 Traces、Metrics、Logs 三大可观测性支柱,通过购物车示例应用演示分布式链路追踪实现。
OpenTelemetry 埋点详解:讲解手动埋点创建 Span、设置属性和事件,以及使用 Flask、MySQL 自动埋点零代码获取链路追踪数据,快速实现应用可观测性。
OpenTelemetry SDK 导出详解:介绍 TracerProvider 链路追踪生产者、Resource 资源元数据、OTLP Exporter 导出器的配置,实现遥测数据从应用到收集器的传输。