使用 OpenTelemetry 构建可观测性 04 - 收集器
OpenTelemetry Collector 详解:介绍接收器、处理器、导出器组件,DaemonSet 和 Sidecar 两种 Kubernetes 部署方式,以及使用 ocb 工具构建自定义收集器分发版。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
OpenTelemetry Collector 详解:介绍接收器、处理器、导出器组件,DaemonSet 和 Sidecar 两种 Kubernetes 部署方式,以及使用 ocb 工具构建自定义收集器分发版。
OpenTelemetry 传播与行李机制详解:通过 Propagation 传递 TraceID 和 SpanID 实现分布式链路追踪,使用 Baggage 在微服务间传递自定义上下文数据。
OpenTelemetry 生态系统入门指南:介绍 OTel 官网、项目博客、CNCF Slack、社区仓库、核心 GitHub 仓库、Collector 仓库、语言 SDK 仓库和 OpenTelemetry Registry。
介绍 VSCode 插件 insertisodate:在 Hugo Markdown 中一键插入 ISO 8601 时间,方便维护 date 和 lastmod 字段,并说明核心实现代码和适用场景。
详解 Prometheus 实验性 info 函数,告别复杂的 group_left join 语法实现标签 Enrichment。info 函数简化 PromQL 写法,并解决标签变化导致的 Churn Problem 和 many-to-many 匹配问题。
记录 Categraf http_response 插件报错 remote error: tls: handshake failure 的排查过程,说明 IPv4/IPv6 入口 TLS 配置差异、Go 1.24 默认加密套件变化,以及 tls_cipher_suites 兼容配置方案。
排查 Flashduty monitor 监控告警数据不符合预期的方法:理解 Prometheus query lookback 影响,模拟 /api/v1/query 查询告警时刻数据,并用脚本按告警频率回放 PromQL 结果。
夜莺监控机器告警配置指南:说明 PUSH 模式下如何做机器存活监控,以及普通指标告警如何在标签过滤、业务组变量、通知规则分派之间取舍。
夜莺监控 FAQ 汇总:解释 Nightingale 是什么、与 Prometheus/Grafana/Categraf/Flashcat/Flashduty 的关系,以及排查问题时应优先查看文档、日志和 GitHub issue。
一次 JVM Stop-the-World 停顿并不是 GC 算法本身变慢,而是 GC 日志写入被磁盘 I/O 阻塞。本文通过 GC 日志中的 user、sys、real 时间差异,解释如何定位问题并用 tmpfs 或异步 GC 日志规避关键路径阻塞。
从症状、堆转储分析到修复验证,梳理 Java 内存泄漏和 OutOfMemoryError 排查方法:关注堆内存趋势、CPU 飙升、响应超时、Heap Dump、Dominator Tree 和 Class Histogram。
给首次担任 Staff SRE 或专家级 SRE 的实践建议:如何从个人救火转向组织级可靠性影响力,推动跨团队协作、系统化改进、健康值班和长期可靠性工程。
本文从日志目的、上下文、结构化、指标与追踪分工、日志级别和采集过滤几个方面,说明怎样把日志从无用流水账变成可用于排障、关联分析和成本控制的可观测证据。
使用 Docker Compose 搭建 Fluent Bit 集中式 Syslog 收集器,通过 UDP 接收 Alpine logger 日志,并将 Syslog 数据转发到 Elasticsearch 索引中验证。
系统介绍 Google Core Web Vitals 的 LCP、INP、CLS 三项核心指标,说明它们与 SEO、SEA、用户体验和 RUM 监控的关系,并给出桌面端、移动端优化建议。
梳理 Go 日志库选型:标准库 log 与 slog、Logrus、Zap、Zerolog 的适用场景、结构化日志示例、框架集成方式和生产日志最佳实践。
对比 RUM(真实用户监控)、Synthetic Monitoring(合成监控)和 Google Analytics(GA)的数据来源、使用对象、诊断深度和适用场景,帮助团队选择合适的监控与分析组合。
RUM(真实用户监控 Real User Monitoring)是一种从真实用户访问中采集网站性能和体验数据的被动监控方式,可帮助企业理解页面加载速度、地域差异、设备和浏览器影响、错误现场与业务体验。
宽事件(Wide Events)是一种强大的可观测性实践方法,能够显著提升系统调试效率与可见性。本文将介绍如何在实际项目中应用宽事件理念,包括所需工具、代码实现思路及属性添加清单,帮助开发者更好地理解和实践这一理念。
系统介绍 RUM(真实用户体验监控)的定义、优势、工作流程、采样方式和存储挑战,并说明 Flashduty RUM 在趋势指标与原始数据采样存储上的推荐做法。