使用自定义 Fluent Bit 配置解析多行日志
介绍如何使用自定义 Fluent Bit 多行解析器把 Java 堆栈等多行日志合并为单条日志记录,并说明 CRI 解析器、multiline filter、parsers.conf 和 New Relic 输出配置。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
介绍如何使用自定义 Fluent Bit 多行解析器把 Java 堆栈等多行日志合并为单条日志记录,并说明 CRI 解析器、multiline filter、parsers.conf 和 New Relic 输出配置。
告警收敛是通过时间、属性、文本相似性和关联分析等策略合并相似告警、过滤冗余信息,帮助运维团队在告警风暴中更快识别根因、减少误报并保护监控系统稳定性。
系统梳理运维监控的常见方向:服务器、网络、数据库和中间件组件、应用、业务指标、监控系统选型与告警 OnCall,帮助团队建立完整的监控覆盖模型。
可观察性是一种方法,可以帮助您预测和预防未来的问题。它有助于根据外部输出的知识确定系统的状态。本文将详细介绍可观测性的定义、重要性、好处、挑战、支柱及其如何运作。
介绍如何用 Flashcat 的定时执行能力监控大数据平台 HANA 子任务超时:通过 Categraf 采集 HANA 表状态,用 sum_over_time 计算本次任务耗时,用定时记录规则沉淀历史耗时,并配置超时告警。
从定位、资源占用、依赖、插件生态、部署方式和适用场景对比 Fluent Bit 与 Fluentd,帮助你判断日志采集应选择轻量级 Agent、服务端聚合器,还是二者组合使用。
介绍如何在 Kubernetes 集群中使用 Fluent Bit 收集 Pod 日志,理解 INPUT、PARSER、FILTER、OUTPUT 插件、DaemonSet 部署、CRD 动态配置和 Fluent Bit 与 Fluentd 的差异。
PromQL 函数教程第五篇,系统讲解聚合函数、increase、rate、irate、histogram_quantile、over_time、absent_over_time 及 MetricsQL 扩展函数的适用场景和易错点。
随着技术架构的不断演进以及云原生、微服务理念的广泛推广,可观测性(Observability)概念逐渐崭露头角,成为提升系统稳定性和运维效率的关键技术。本文将探讨可观测性与传统监控之间的区别与联系,介绍快猫星云在可观测性领域所提供的先进服务。
本文讲解 Grafana Loki 的日志架构、核心组件和数据流,包括 Promtail、Distributor、Ingester、Ruler、Querier、Query Frontend、Grafana、Log Storage,以及 Loki 与 EFK Stack 的差异。
可观测性,顾名思义,指的是系统状态能够被观察与度量的特性。在信息技术领域,可观测性被精确定义为根据系统生成的输出数据(涵盖日志、指标及跟踪信息)来测量和理解系统当前状态的能力。
介绍 Fluent Bit 3.0 在日志、指标和追踪可观测性管道中的使用边界与最佳实践,包括 processor、tag、健康检查、热重载、Prometheus 指标和资源控制。
面向 Ubuntu 服务器,介绍 Fluent Bit 的 APT 安装、systemd 启动、Tail 输入配置和 OpenObserve HTTP 输出配置,帮助快速搭建轻量级日志转发链路。
随着云原生技术的广泛应用,可观测性作为云原生运维的核心工具,正成为事件管理实践中的关键支撑。本文探讨可观测性的本质、来源、发展、重要性及其实施路径。
PromQL 教程第四篇讲解向量匹配:on、ignoring、group_left、group_right 的作用,one-to-one、many-to-one、one-to-many 匹配的区别,以及如何把 Kubernetes Pod 标签等元信息带入查询结果。
系统科普可观测性的起源、定义与价值,讲清日志、指标、追踪三大支柱,以及它们如何帮助团队快速排障、提升系统稳定性与协作效率。
在复杂的服务器运维环境中,可观测性(Observability)是确保系统稳定运行、及时发现并解决问题的关键。这一概念核心通过系统输出的数据—如日志、指标及链路追踪—来精准衡量并理解当前系统的运行状态。
PromQL 教程第三篇讲解入门操作:标签选择器、聚合计算、offset 历史查询、算术运算符、比较运算符,以及 and、or、unless 逻辑/集合运算符在告警规则中的用法。
本文围绕企业告警管理、告警治理和 On-Call 响应闭环,说明如何通过告警集中汇聚、信息丰富、分派升级、降噪收敛、自动化处理和持续优化提升运维效率与业务连续性。
面向云原生、多云和混合云环境,系统说明统一告警管理的必要性、常见痛点、建设步骤、标签设计原则,以及 Flashduty 在告警接入、降噪、协同和响应中的作用。