使用 nsenter 排查容器网络问题
我想进入容器中执行 curl 命令探测某个地址的连通性,但是容器镜像里默认没有 curl 命令。我这里是一个内网环境不太方便使用 yum 或者 apt 安装,怎么办?这个需求比较典型,这里教大家一个简单的方法,使用 nsenter 进入容器的 net namespace,即可使用宿主机的 curl、ip、ifconfig 等命令,其效果,就跟进入容器中执行是一样的。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
我想进入容器中执行 curl 命令探测某个地址的连通性,但是容器镜像里默认没有 curl 命令。我这里是一个内网环境不太方便使用 yum 或者 apt 安装,怎么办?这个需求比较典型,这里教大家一个简单的方法,使用 nsenter 进入容器的 net namespace,即可使用宿主机的 curl、ip、ifconfig 等命令,其效果,就跟进入容器中执行是一样的。
介绍 Pingmesh 在大规模数据中心网络排障中的作用:基于微软论文思路,说明 Controller、Agent、pinglist、机柜/交换机探测、丢包和时延指标,以及 Flashcat-Pingmesh 的设计方案。
手把手介绍如何用 Flashduty 免费做消息通知:注册账号、创建协作空间、配置分派策略、生成自定义事件 integration key,并通过 curl 推送测试告警。
MetricsQL 扩展了 PromQL 的表达能力。本文用“5 分钟内某指标超过阈值 3 次就告警”的场景,说明 count_gt_over_time、count_le_over_time、count_ne_over_time、count_eq_over_time 这 4 类函数适合处理按次数判断的告警条件。
面向 Linux 初级用户的软件问题排查教程:从官网和 GitHub 获取资料,检查进程、端口、CPU 架构、版本、配置文件和日志,再用浏览器 Network、curl、系统日志和 ulimit 等线索定位运行时问题。
以 Flashduty 为例,演示如何基于 ElasticSearch、Loki、ClickHouse 等日志数据源配置日志告警,包括告警引擎安装、数据源配置、SQL 查询、阈值判定和事件分发。
说明 PromQL 阈值写在查询语句中时,告警恢复通知为什么拿不到当前值,并给出两种配置思路:阈值外置判定和恢复时关联查询。
用咖啡馆点餐类比解释 Go Channel:无缓冲 Channel、带缓冲 Channel、Goroutine 通信、工作池和 select 超时等并发编程基础。
《手把手构建生产级监控系统》第二篇,使用 Cprobe 快速接入 MySQL、Redis、MongoDB、Oracle、Postgres、Tomcat、Kafka 和 ElasticSearch 监控,并配置仪表盘与告警规则。
《手把手构建生产级监控系统》第一篇,从 VictoriaMetrics、Cprobe、Node-Exporter、Grafana 到 Flashduty,演示如何搭建指标采集、存储、展示、告警判定和事件分发底座。
夜莺监控 v6.7 将机器 Metadata 管理能力开放到开源版,机器列表可直接查看 Kernel、CPU、IP、Mac 地址等由 Categraf 自动采集的主机信息。
Flashcat 灭火图是故障发现和定位的入口,通过服务、模块、组件、基础设施等层级化健康视图,聚合时延、流量、错误、饱和度等指标,并串联指标、日志、链路、事件等下钻分析能力。
从 Google SRE 的 OnCall 方法、减少琐事原则和 Outalator 工具出发,分析国内团队落地 OnCall 时需要补齐的文化、机制、工具、指标和产品能力。
使用 Cprobe 快速采集 Oracle 数据库监控指标:准备 Oracle 连接账号和权限,配置 oracledb 插件、测试采集输出、写入 Prometheus/VictoriaMetrics/夜莺,并导入参考 Grafana 仪表盘。
以 H3C 无线 AC/AP 监控为案例,介绍如何使用夜莺开源版和 Categraf SNMP 插件配置华三无线设备指标,包括 SNMP 实例、field、table、MIB 对象类型、is_tag、index_as_tag、过滤和最终仪表盘效果。
Flashduty 2023-12-18 更新说明:增强值班管理、服务日历、自定义操作和邮件集成,覆盖轮换、节假日静默、Webhook 操作和邮件告警接入等场景。
理想的监控系统不是单个工具,而是一条从采集、传输、存储、可视化、告警到事件分发的链路。本文总结采集器、vmagent/Vector、VictoriaMetrics、Grafana/Nightingale、告警引擎和 OnCall 平台的职责边界。
什么是可观测性?相比传统监控,可观测性是“新瓶装旧酒”吗?他们有哪些区别和联系,从传统监控到可观测性,Gap 到底有多大?
cprobe 是一个面向远端监控对象的探针式采集器,尝试用统一插件、统一配置、服务发现和 Prometheus 生态兼容能力,解决 Exporter 分散部署、配置割裂和开箱体验不足的问题。
本文延续 TiDB 多集群监控实践,介绍如何在夜莺中统一管理多套 TiDB Grafana Dashboard,通过内置模板、JSON 导入、变量调整和业务组区分减少重复看盘成本。