使用AI写篇文章:SNMP Exporter 的使用样例和注意事项
以一篇由 NotionAI 生成的 SNMP Exporter 示例为基础,介绍 SNMP Exporter 的用途、基础配置、Prometheus 抓取方式和使用注意事项,帮助读者理解 SNMP 设备指标如何进入 Prometheus。
围绕可观测性、AI SRE、告警治理、On-call、Nightingale、Categraf、Prometheus、Kubernetes、Zabbix、用户案例和产品更新,沉淀一线工程实践、选型参考和稳定性治理方法。
以一篇由 NotionAI 生成的 SNMP Exporter 示例为基础,介绍 SNMP Exporter 的用途、基础配置、Prometheus 抓取方式和使用注意事项,帮助读者理解 SNMP 设备指标如何进入 Prometheus。
解释夜莺、Nightingale、快猫、Flashcat、开源版本和商业版本之间的关系,说明夜莺的定位、快猫公司的角色以及商业版的上层能力。
本文介绍如何利用Flashduty完成告警聚合降噪、告警升级、告警认领、告警排班、告警协同等需求。每个公司大概率都同时使用多个监控系统,对告警事件做统一处理,是一个很强的需求,本文为大家讲解如何落地实践。
Flashcat 的设计初衷是实现从数据、平台到故障处理场景的一体化统一监控,解决采集、兼容、告警、定位路径和稳定性保障落地问题。
六分科技是 GNSS 高精度定位服务提供商。本文介绍六分科技如何使用 Flashcat 整合近 10 个 Prometheus 集群、十余个日志主题、ClickHouse 和云监控等数据源,建设统一告警管理、业务北极星指标、灭火图和全局稳定性视图。
围绕运维岗位是否还值得做,整理马驰和来炜直播交流中的观点:平台工程、COE、外部供应商、研发 OnCall、变更发布和成本优化会重塑运维,但不会简单消灭运维。
夜莺 V6 以 6.0 beta 版本开始从监控系统升级为开源可观测平台,支持 Prometheus、ElasticSearch、Jaeger 等数据源,简化 n9e 架构,并增强内置大盘、告警规则、屏蔽规则和订阅规则能力。
Flashduty 协作空间用于按团队或业务隔离告警处理。本文说明协作空间设计逻辑、故障升级逻辑,以及全局 Webhook 和协作空间专属 Webhook 两种告警路由方式。
快猫星云 Flashcat 监控分析平台 V5.0 完成与统信服务器操作系统 V20、海光 5000/7000 系列处理器等环境的兼容性互认证,测试结果显示整体运行稳定,满足功能及兼容性测试要求。
从运维视角解释稳定性体系建设:如何用成功率和延迟衡量客户体验,识别影响稳定性的因素,并围绕风险预防、监控发现、可观测性定位、预案止损和复盘改进建立体系。
度小满陈存利结合 20 多年互联网运维和团队管理经验,讨论团队文化、人才培养、业务阶段差异、FinOps、可观测性、ChatGPT、Ops 转型和绩效机制。
又拍云邵海杨结合 25 年 Linux 和云运维经验,分享 DevOps 八荣八耻、运维准则、工程师成长、Kubernetes 适用场景、研发协作和 SRE 转型路径。
快猫星云来炜从创业者和运维从业者视角,讨论运维价值、稳定性目标、FinOps、ChatGPT、云原生影响、工具选型和 Flashcat 平台定位。
解释 Linux 为什么看起来吃掉了内存:free/top 中 used、free、buff/cache、available 的含义,以及何时才需要担心内存不足。
作业帮聂安系统阐述云原生时代传统运维的领域危机,以及通过 OPaS、ICSP、IDP、同构维持、业务运维和运维中台实现服务化转型的路径。
面向 CTO/CIO 的运维/SRE 能力建设指南:从自建团队、第三方供应商、基础环境、变更管理、可靠性保障、最佳实践和人才选择等角度,拆解企业如何获得稳定性支撑能力。
本文意译 Netflix 技术博客 Linux Performance Analysis in 60,000 Milliseconds,介绍如何在登录服务器后的 60 秒内用 uptime、dmesg、vmstat、mpstat、pidstat、iostat、free、sar 和 top 快速判断 CPU、内存、磁盘、网络和进程瓶颈。
什么是网站可靠性工程师 SRE:解释 SRE 与 DevOps 的关系、SRE 的职责、技能要求、日常工作、常见工具和收入参考,说明 SRE 如何用软件工程方法提升系统可靠性。
夜莺监控(Nightingale)6.x 重新设计机器失联告警:不再由 n9e-server 周期性生成 target_up 指标,而是基于 MySQL 中 target 心跳时间直接判断失联状态,让逻辑更简单、即时性更好。
介绍如何用 Telegraf 的 outputs.http 插件通过 Prometheus remote write 协议发送指标到 Nightingale 或 Prometheus,并说明 host 标签冲突和 agent_hostname 配置建议。