为 Prometheus 告警规则增加 UI 管理能力
Prometheus 告警规则通常通过 YAML 和 Git 管理,跨团队自助、权限隔离、规则评审和通知治理都会变复杂。本文演示如何用 Nightingale 夜莺监控为 Prometheus alerting rules 增加 UI 管理能力,并介绍数据源接入、规则配置、Prometheus 规则导入和告警引擎能力。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
Prometheus 告警规则通常通过 YAML 和 Git 管理,跨团队自助、权限隔离、规则评审和通知治理都会变复杂。本文演示如何用 Nightingale 夜莺监控为 Prometheus alerting rules 增加 UI 管理能力,并介绍数据源接入、规则配置、Prometheus 规则导入和告警引擎能力。
解释 Prometheus 高基数和基数峰值的含义、常见成因、对成本与性能的影响,以及在确有高基数业务需求时的处理思路。
译文分享作者用 Prometheus、Grafana 和 Alertmanager 构建公司第一个监控系统的经验,重点讨论自定义指标、最佳实践、指标管道验证和可观测性完成定义。
Java 程序监控通常有四条路径:Spring Boot Actuator、Micrometer、JMX 以及组件自带指标接口。本文对比适用场景,并给出暴露 Prometheus 指标的配置示例。
可观测性体系建设可以按明业务、立规范、采数据、显特征、获洞见五步推进。本文从业务指标、SLI/SLO、数据采集、特征呈现和故障止损洞见梳理建设路径。
Flashduty 在告警 On-call 场景中引入 AI 总结能力,把同一故障下的多条告警事件整理成人可读的故障摘要,帮助值班人更快理解 incident。
业务应用是否要接收底层基础设施告警,关键不在依赖关系,而在是否有可执行 SOP。本文给出上层 DEV/SRE 判断告警订阅、SLI 看板和业务埋点的实践口径。
CPU 负载高是否应该告警,关键看告警是否 actionable:是否有人处理、是否有 SOP、是否能进入合适的 Critical、Warning 或 Info 通知链路。
整理第三届 CCF·夜莺开源创新论坛中张同浩关于 HUATUO 的分享,覆盖 eBPF 内核可观测、系统故障分析挑战、持续性能剖析和 GPU 大模型性能剖析。
Zepto 从 Prometheus + Thanos 迁移到 Grafana Mimir,用多租户指标平台解决 OOM、慢查询、告警中断和查询扇出问题。本文梳理迁移背景、架构选择、关键挑战和经验教训。
使用 Grafana、Loki、Fluent Bit、Mimir 和 OpenTelemetry 构建可观测性技术栈,本文演示 Docker Compose 下日志采集、OTLP 转发、Loki 存储、Grafana 数据源和 Loki 标签配置。
SRE 想提升职业竞争力,不能只重复日常运维工作,而要系统提升底层技术、故障响应、架构规划、协作沟通和业务理解能力。
对比 HAProxy、Nginx 与自定义方案负载均衡 100,000 个 WebSocket 连接的实践:包括会话持久性、NAT 问题、连接建立时间、内存开销、运营成本和最终选型建议。
与首席工程师共事一年后总结的 10 条工程成长经验:可维护代码、稳健交付、业务理解、代码历史、沟通能力、日志、取舍判断和帮助团队成长。
Kafka 难用往往不是工具本身的问题,而是主题建模、消费者组、状态流转、发件箱、重试队列和 Schema 演进没有设计好。本文用 6 个模式说明 Kafka 如何支撑可靠的事件驱动架构。
从单体应用、Nginx、MySQL 到 Redis、Kafka、分库分片、可观测性和 CDN,复盘一个产品从 100 用户增长到 100 万用户时的架构演进路径与瓶颈治理经验。
整理 8 个实用 Python 库:Rich、Typer、Pendulum、Pydantic、Faker、tqdm、Requests-HTML 和 Loguru,覆盖 CLI、参数解析、日期时间、数据验证、测试数据、进度条、网页抓取和日志记录。
Kubernetes YAML 编写最容易踩坑的地方包括 Tab 缩进、布尔值自动转换、数字和日期类型推断、键名歧义、锚点复用和 lint 校验。本文给出实践建议和排查清单。
总结夜莺 v8 正式版的核心升级,包括更多数据源告警支持、事件 Pipeline、通知规则抽象、机器告警优化和新版告警全景看板。
解释软件工程中的鲁棒性 Robustness 和弹性 Resilience:二者分别关注异常下不崩溃和故障后可恢复,并通过 API、微服务、网站和数据库示例对比。