MongoDB 监控(一)MongoDB 简介和常用监控工具
MongoDB 监控系列第一篇:先理解 MongoDB 的定位、适用场景、潜在限制,再梳理连接数、内存、CPU、磁盘 I/O、慢查询、副本集状态等健康指标,以及 MongoDB Shell、Profiler、Prometheus、Grafana、Zabbix、Datadog 等常见监控工具。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
MongoDB 监控系列第一篇:先理解 MongoDB 的定位、适用场景、潜在限制,再梳理连接数、内存、CPU、磁盘 I/O、慢查询、副本集状态等健康指标,以及 MongoDB Shell、Profiler、Prometheus、Grafana、Zabbix、Datadog 等常见监控工具。
从 Zabbix Web 菜单理解 Zabbix 功能,包括 Dashboards、Monitoring、Problems、Hosts、Latest data、Maps、Discovery、Services、Inventory、Reports 和 Data collection 的作用与设计逻辑。
Zabbix 和普罗米修斯有什么区别?本文从历史背景、设计理念、采集、存储、告警、事件分发和适用场景解释两类监控生态的选型边界。
从网络设备、主机监控、中间件、数据库、Kubernetes 和微服务场景分析 Zabbix 是否被淘汰:Zabbix 仍适合传统基础设施和网络设备,但在高维指标、云原生和现代可观测场景中需要与 Prometheus 生态或告警响应平台配合。
对比 Zabbix Agent 2 与 Nightingale/Categraf 监控 Redis 的方式,说明 Redis INFO 采集原理、Zabbix Redis 模板、Categraf Redis 插件、标签模型、存储压力和选型边界。
对比 Zabbix 与 Nightingale/Categraf 做 Linux 进程监控的方式:解释 /proc 采集原理、Zabbix proc.num Key、Trigger 配置、Categraf procstat 配置、Prometheus 标签模型和告警规则差异。
企业如何在 Zabbix 和 Prometheus 之间做监控选型?本文从性能容量、采集方式、数据可视化、告警规则、事件分发和混合使用策略给出判断。
在 Ubuntu 22.04 上安装 Zabbix 6 Server 和 Agent 的完整步骤,包含 PostgreSQL 初始化、Nginx/PHP 配置、Web 初始化、Agent 接入和主机添加注意事项。
系统介绍 Zabbix 的 Server、Agent、Proxy、Web、数据库和数据采集模型,说明 PUSH、PULL、无代理监控、数据存储和适用场景,帮助理解 Zabbix 的监控系统原理。
夜莺即时查询功能详解:说明数据源选择、PromQL 编辑器、内置指标、Table/Graph 视图、时间戳、step、单位、Tooltip、分享和多 Panel 等功能。
介绍 OpenTelemetry Collector 的部署方式,包括 sidecar 模式、daemonset 模式和中心集群模式。不同的部署方式适用于不同的场景,需要根据实际情况选择合适的部署方式。
系统梳理链路追踪中的 Trace、Span、Span Context、Attributes、Span Events、Span Links、Span Status 和 Span Kind,帮助理解 OpenTelemetry Tracing 的核心模型。
OpenTelemetry 是用于分布式系统的可观测性采集框架,提供追踪、度量和日志等数据的统一标准、API、SDK 和工具,帮助团队降低埋点迁移成本并提升可观测性建设的一致性。
链路追踪是分布式系统可观测性的重要组成部分,通过记录请求在多个服务之间的流转路径、调用关系和耗时分布,帮助团队识别性能瓶颈、定位故障并提升系统稳定性。
本文以 Nightingale 7.5.0 日志为例,演示如何用 Fluentbit 3.1.9 采集多行日志、用正则解析时间、级别、位置和消息字段,写入 ElasticSearch 7.15.0,并在 Kibana 中查看。
演示如何用 Fluentbit 的 node_exporter_metrics 输入插件采集机器指标,并通过 prometheus_remote_write 输出到 Nightingale,同时说明机器元信息 Unknown 的原因和适用边界。
VictoriaMetrics 集群版简介:说明 vmstorage、vminsert、vmselect 架构,多租户 URL,集群启动方式,只读模式,replication、deduplication 和数据安全注意事项。
VictoriaMetrics Troubleshooting 清单:从默认参数、日志、版本升级、CPU/RAM/磁盘资源、慢写入、高基数、缓存间隙、损坏 part 和 NaN 值等角度排查性能与运维问题。
本文解释 VictoriaMetrics 的存储结构、part、block、IndexDB、后台合并和 retentionPeriod 保留策略,帮助理解数据如何写入、查询、合并、清理以及如何为不同数据设置不同保留期。
夜莺 v7.5 主要优化告警规则列表、仪表盘 UUID 跳转链接和多项使用细节,提升告警事件联动、模板中心仪表盘下钻和日常运维体验。