MySQL监控概述
MySQL 监控应优先关注查询吞吐量、查询性能、连接数和 InnoDB 缓冲池,并结合服务器状态变量、Performance Schema、sys schema 和慢查询日志获取关键指标。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
MySQL 监控应优先关注查询吞吐量、查询性能、连接数和 InnoDB 缓冲池,并结合服务器状态变量、Performance Schema、sys schema 和慢查询日志获取关键指标。
夜莺监控对象列表来自流经 n9e-server 的监控数据,主要用于机器标签、业务组权限、自愈脚本和基础利用率展示;PULL 模式数据不流经 n9e-server 时可能不会出现在列表中。
Kubernetes 监控手册第 5 篇,讲解 Kubelet 监控:10248 健康检查、10250 HTTPS 指标接口、ServiceAccount/RBAC 认证、Categraf DaemonSet 配置以及 Kubelet 与 cAdvisor 指标。
夜莺监控从 v5 开始取消树形机器分组,改用一维业务组与标签协同:业务组负责权限与配置归属,标签负责机器细分和时序数据过滤。
Kubernetes 监控手册第 4 篇,讲解 Kube-Proxy 监控:10249 指标端口、10256 健康检查、Categraf Prometheus 插件配置、DaemonSet 部署和关键指标含义。
介绍 snmpget、snmpwalk 等 SNMP 命令常见认证参数,包括 SNMP 版本、community、用户名、安全级别、认证协议、加密协议和口令,并给出 v2c 与 v3 查询 OID 的命令样例。
介绍 SNMP(简单网络管理协议)的基本概念,包括 SNMP manager、SNMP agent、MIB、OID、PDU 命令和 v1/v2c/v3 版本差异,帮助理解交换机、路由器、防火墙、UPS 等设备监控的基础。
本文讲解如何使用 Categraf 的 mtail 插件从应用日志中提取 metrics 指标,适用于无法改代码埋点、需要从系统日志关键字生成监控指标、或希望用一个 Categraf 进程统一管理多个日志解析规则的场景。
Kubernetes 监控手册第 3 篇,演示如何用 Categraf 采集 Linux 宿主机 CPU、内存、IO、进程等指标,并通过 Remote Write 推送到 Nightingale 或其他兼容后端。
Kubernetes 监控手册第 2 篇,讲解宿主机监控的范围和采集器选型:带内 Agent、带外 IPMI/SNMP,以及 Telegraf、Grafana Agent、Datadog Agent、Node Exporter、Categraf 的适用场景。
Kubernetes 监控手册第 1 篇,从整体架构梳理 Kubernetes 监控对象:控制面组件、工作负载节点、容器运行时、Pod 应用和底层宿主环境。
Zabbix 与夜莺监控如何选型?本文从传统基础设施、云原生、混合云、多数据源告警、采集器、可视化和二次开发等维度,对比 Zabbix 与 Nightingale 的适用场景。
本文介绍 AIOps 智能告警中最容易落地的智能异常检测:为什么静态阈值容易漏报和误报,动态阈值如何降低告警噪音,以及夜莺智能告警的配置流程。
介绍如何基于夜莺构建 ElasticSearch 日志告警能力,包括日志告警需求、产品页面改造、架构设计、规则同步、日志查询、异常判断和事件推送流程。
稳定性一号位或稳定性负责人应承担什么职责:承担结果责任,制定可分解可量化的稳定性目标,锁定预算,并建立提升确定性、降低门槛的技术保障体系。
分析经典 SLO(CSLO)在故障处理场景中的适用边界,介绍以 BLO 做故障发现、以服务层 SLO 做故障定位的稳定性实践。
服务稳定性保障中,服务可用性、故障、根本原因、故障定位和业务监控经常被混用。本文从用户视角解释这些概念的边界、统计口径和实践影响。
介绍夜莺新版在可视化体验、仪表盘设计、Dark Mode、recording rule、多集群规则、告警屏蔽、查询性能和自身监控方面的改进。
介绍夜莺监控如何通过智能异常检测模块补足静态阈值告警能力,覆盖适用场景、两种落地方案、自建与购买取舍,以及业务周期性指标的动态基线思路。
方正证券运维工程师分享夜莺监控落地经验:在证券行业高稳定性要求下,通过兼容 Open-Falcon、接入 Prometheus 数据源、简化架构和权限管控,提升监控统一管理与研发使用效率。