Docker 容器网络浅析
Docker 多容器应用不要依赖临时 IP 或过时的 --link。本文从默认 bridge 网络的问题讲起,解释用户自定义桥接网络、Docker DNS 服务发现、Compose 自动网络和 host、overlay、none 等网络驱动的适用场景。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
Docker 多容器应用不要依赖临时 IP 或过时的 --link。本文从默认 bridge 网络的问题讲起,解释用户自定义桥接网络、Docker DNS 服务发现、Compose 自动网络和 host、overlay、none 等网络驱动的适用场景。
通过 OpenTelemetry 在 Kubernetes 集群中实现指标、日志和追踪数据的统一流水线,提升可观测性和故障排查效率。
本文聚焦于将可观测性转化为可靠性的人员体系,介绍如何定义能指导决策的 SLO、构建可扩展团队知识的运行手册、设计能推动改进的结构化事后分析,以及如何将这些实践融入工程文化。
如果主要目标是在 Prometheus 中使用指标,直接用 OpenTelemetry SDK 埋点并不总是最佳选择。本文从目标健康监控、指标命名转换、资源标签、OTLP 接收配置、SDK 复杂度和性能开销等方面,解释为什么 Prometheus 原生客户端库仍然更适合 Prometheus 指标场景。
本文总结了可观测性的五大最佳实践,涵盖从业务入手、定位路径、数据关联、自动化响应到自顶向下推进等关键方面,帮助提升系统的监控与故障排查效率。
本文总结了日志管理的五大最佳实践,涵盖统一日志格式、合理日志级别、关联上下文信息、安全日志管理以及将日志转换为指标等关键方面,帮助提升日志处理效率与安全性。
可观测性能够帮助团队检测故障,并深入了解故障的根本原因。这不仅简化了调试流程,还能提升系统性能与可靠性。现代 DevOps 从开源可观测性工具中获益良多。
从结构化日志、OpenTelemetry 约定、上下文、日志级别、敏感数据防护、性能、成本、采集流水线到后端选型,系统梳理日志记录的 9 项最佳实践。
OpenTelemetry Collector 的 filelog receiver(文件日志接收器)为我们提供了一种将日志文件接入现代可观测性流水线的方法。本文将介绍如何配置和使用 filelog receiver,从基础读取到生产级日志处理的各个方面,帮助你构建可靠且高效的日志摄入解决方案。
本文整理 Kafka 常见错误的现象、原因和处理思路,包括 Broker 不可用、Leader 不可用、Offset 超出范围、请求超时、Unknown Topic or Partition、Not Leader For Partition、发送失败、复制因子过高和认证失败。
梳理 Kafka 集群常见性能与稳定性调优项:分区数量、ISR 滞后、网络与 I/O 线程、生产者压缩、acks、消费者 fetch、socket buffer、KRaft 超时、log.dirs 和复制因子。
系统梳理 Elasticsearch 常见问题排查方法:备份快照、日志权限、Bootstrap 检查、Discovery 配置、集群组建、red/yellow/green 状态、分片分配和快照恢复。
用 Flashduty 告警引擎实现 QPS 突增告警和关联查询,把当前 QPS、昨天同时刻 QPS、最近一个月最大 QPS 写入告警消息,帮助 On-call 快速判断影响。
解释 SQL DELETE 为什么通常不会立即释放磁盘空间:MVCC、死行、墓碑标记、PostgreSQL VACUUM、MySQL OPTIMIZE TABLE 以及大批量删除的维护建议。
JMX 是 Java 应用暴露运行时指标的常见方式。本文以 Tomcat 为例,说明如何通过 OpenTelemetry JMX Scraper、OpenTelemetry Java Agent 和 OpenTelemetry Collector JMX Receiver 三种方式采集 JMX 指标。
系统从早期产品走向百万用户时,最容易暴露架构上的隐性问题。本文梳理 10 个常见架构陷阱,包括过早微服务、OFFSET 分页、同步调用链、可观测性缺失、表结构迁移、幂等性、会话状态、缓存失效、功能标志和速率限制,并给出可落地的改进方法。
夜莺开源走进星巴克中国创新科技中心:30 多位零售连锁行业技术专家围绕可观测性、AI SRE、故障治理和 eBPF 实践交流零售场景落地经验。
探索如何通过战略性设计和文化转型实现可观测性,提升系统可靠性并推动业务成功。
解析 AI 可观测性如何结合指标、日志、Trace 和事件数据,帮助工程团队进行异常检测、根因分析、预测扩容和故障响应。
企业级可观测性需要把日志、追踪、指标和 OpenTelemetry Collector 组织成统一管道。本文说明结构化日志、分布式追踪、黄金信号、采样策略和敏感信息边界。