Categraf Dashboard 没有数据:数据源、变量、标签和 PromQL 排查
本文介绍 Categraf 指标已写入后端、但夜莺或 Grafana Dashboard 没有数据时的完整排查方法,覆盖 Dashboard 文件选择、数据源、时间范围、变量、实际标签、PromQL、采集周期、版本兼容和面板变换。
汇总 Flashcat 博客中与 Troubleshooting 相关的文章,方便按主题连续阅读实践、案例、选型和产品更新。
本文介绍 Categraf 指标已写入后端、但夜莺或 Grafana Dashboard 没有数据时的完整排查方法,覆盖 Dashboard 文件选择、数据源、时间范围、变量、实际标签、PromQL、采集周期、版本兼容和面板变换。
本文介绍 Categraf 使用 test 模式确认采集、再用 debug 或正式模式验证写入,但夜莺、VictoriaMetrics 或 Prometheus 兼容后端仍查不到数据时的完整排查方法,覆盖运行模式、writer、标签转换、内存队列、HTTP、认证、TLS、时间偏差、租户和查询端点。
本文给出 Categraf 进程正常但单个 input 没有指标时的完整排查路径,覆盖插件目录、instances、--inputs、test 模式、采集周期、网络、认证、TLS、运行用户、数据库权限和指标过滤。
本文从 Categraf 当前源码和 Linux 部署流程出发,给出启动失败的完整排查顺序,覆盖配置目录、TOML 语法与编码、文件权限、systemd 服务、二进制架构、版本兼容、端口冲突和日志定位。
排查 Flashduty monitor 监控告警数据不符合预期的方法:理解 Prometheus query lookback 影响,模拟 /api/v1/query 查询告警时刻数据,并用脚本按告警频率回放 PromQL 结果。
从症状、堆转储分析到修复验证,梳理 Java 内存泄漏和 OutOfMemoryError 排查方法:关注堆内存趋势、CPU 飙升、响应超时、Heap Dump、Dominator Tree 和 Class Histogram。
梳理 Kafka 集群常见性能与稳定性调优项:分区数量、ISR 滞后、网络与 I/O 线程、生产者压缩、acks、消费者 fetch、socket buffer、KRaft 超时、log.dirs 和复制因子。
系统梳理 Elasticsearch 常见问题排查方法:备份快照、日志权限、Bootstrap 检查、Discovery 配置、集群组建、red/yellow/green 状态、分片分配和快照恢复。
从 SRE 视角梳理 502 Bad Gateway 排查路径:用 Chrome 开发者工具确认接口,用 cURL 绕过 Nginx 验证后端,结合 Nginx 日志、超时配置、容器日志和 OOM 线索定位问题。
面向 Linux 初级用户的软件问题排查教程:从官网和 GitHub 获取资料,检查进程、端口、CPU 架构、版本、配置文件和日志,再用浏览器 Network、curl、系统日志和 ulimit 等线索定位运行时问题。