增强您的可观察性:将 Logrus 与 Grafana Loki 集成
本文介绍如何通过 Logrus Hook 将 Go 应用日志直接发送到 Grafana Loki,并保留请求路径、方法、请求体、请求 ID 和耗时等上下文,方便在 Grafana 中使用 LogQL 查询和排障。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
本文介绍如何通过 Logrus Hook 将 Go 应用日志直接发送到 Grafana Loki,并保留请求路径、方法、请求体、请求 ID 和耗时等上下文,方便在 Grafana 中使用 LogQL 查询和排障。
项目是否可由运维共担稳定性,应先通过运维准入标准。建议从可用性、性能、可观测性和 SOP 四个方面评估,未达到标准的项目可以让运维介入,但不应让运维单独负责稳定性。
VictoriaMetrics 面对突发指标暴增时如何自保:从业务沟通、按业务拆分、单机和集群选型、自监控、VMUI Explore、高基数治理、storage.maxHourlySeries 和 dedup.minScrapeInterval 等角度梳理实践。
夜莺 v8.0.0-beta10 支持中心端无法直连时序库时仍由边缘告警引擎执行告警,适合边缘机房、安全隔离和只能边缘访问中心的网络场景。
sretalk/prometheus-rules 是一个整理常用 Prometheus 告警规则的开源项目,按 MySQL、Linux、Kubernetes、Prometheus、VictoriaMetrics 等目录组织规则,提供 Prometheus 规则格式和中英文版本,方便团队复用和共建。
本文演示如何用 Vector 采集夜莺日志、通过 remap 解析成结构化字段,并直接写入 Elasticsearch,适合机器规模不大、暂时不需要 Kafka 或复杂日志链路的小型 ToB 环境。
运维价值经常被挑战,根因通常在于研发与运维的边界、平台化能力、生产规范和业务技术支持没有被说清楚。
记录在 Linux 测试机上安装 Elasticsearch 8.x 和 Kibana 8.x 的完整过程,包括非 root 部署、HTTPS、重置密码和首次登录配置。
告警配置最重要的原则,是优先覆盖用户体验和核心业务结果,再把关键原因类指标沉淀为排障事件。本文解释结果类指标、原因类指标、数据源选择和告警通知边界。
Flashduty 日志监控可以通过关联查询把匹配日志的 request_id、remote_addr 等原文字段带入告警事件。本文以 Elasticsearch SQL 为例,说明告警查询、关联查询和备注模板的配置方式。
Flashduty 告警规则支持多个 PromQL 查询。本文说明多指标联合运算和多指标并行告警的区别,并解释何时使用阈值计算、何时改用数据存在模式或拆分规则。
手把手演示夜莺 v8 新版通知规则对接钉钉、飞书和企业微信的配置流程,覆盖机器人创建、通知规则、消息模板、domain 设置、钉钉 at 人和通知测试。
说明夜莺 v8 新版通知规则中钉钉告警如何配置 at 人,重点解释 text 与 markdown 消息的差异、Phone 联系方式、$sendtos、batchContactsAts 和 batchContactsJsonMarshal 的用法。
介绍夜莺监控 v8 新版通知规则如何对接飞书告警,覆盖普通 text 消息、飞书卡片、FeishuCard 模板 domain 配置、告警详情字段和模板优化示例。
夜莺 v8 从 beta7 版本开始,抽象了通知规则的概念,可以非常方便的配置各种通知媒介,比如钉钉、短信、电话等。而且还有非常通用的 HTTP、脚本 通知方式,那么是不是就不需要 Flashduty 了呢?
介绍夜莺监控 v8 新版通知规则如何对接企业微信机器人,包括告警规则关联、通知规则配置、Wecom 通知媒介、消息模板 domain 设置和最终验证效果。
介绍夜莺监控 v8 新版通知规则如何对接钉钉机器人,包括告警规则关联、通知规则配置、Dingtalk 通知媒介、消息模板 domain 和请求体设置。
夜莺监控 v8.0.0-beta7 抽象出通知规则,将告警规则与通知方式解耦,支持自定义 HTTP、脚本发送、不同媒介模板和用户 Profile 参数。
本文解释夜莺开源版日志监控为什么默认只能基于 Elasticsearch 或 Loki 查询结果做数值告警,不能直接把日志原文放进告警事件,并给出附加查询、Flashduty 和自定义脚本 enrichment 三种实现思路。
Flashduty 面向告警 OnCall 场景,解决告警事件分散、告警风暴、漏处理、认领升级和移动协同等问题。本文说明统一集成、Pipeline 处理、故障协同、排班和统计分析如何组成完整响应链路。