很多团队的运维文档并不少,真正出事时,值班群里出现频率最高的消息仍然是:“谁熟这个系统?”
原因并不复杂。文档记录了知识,却不会主动判断当前问题该看哪一段,也不会帮新人把告警、指标和现场信息对应起来。同一条 MySQL 主从延迟告警,资深 SRE 知道先看复制线程、网络和磁盘,再判断是否需要切换;新人面对一篇很长的 Wiki,凌晨两点往往还是只能叫醒老同事。
夜莺 v9 引入 Skill,想解决的不是“让 AI 知道更多通用知识”,而是让团队自己的排障顺序、判断标准和安全边界,在真正需要时被自动带进对话。它要扩展的不是大模型的知识量,而是资深工程师的可用时间。
Skill 和普通运维文档有什么区别
普通文档需要人主动找到、阅读并判断该执行哪一步。Skill 仍然以 Markdown 为主要载体,但会说明适用场景、所需信息、处理步骤和可以调用的工具。当用户的问题与描述匹配时,AI 可以加载这套方法,结合当前告警事件、机器、规则和数据源继续分析。
例如,团队可以为“Redis 内存使用率过高”写一份 Skill:先确认告警是否持续,再区分数据增长与碎片率问题,检查淘汰策略和命中率,最后根据是否为核心实例给出不同建议。新人问“这条 Redis 告警该怎么处理”时,拿到的是团队认可的检查顺序,而不是一份与现网无关的通用答案。
这也意味着,Skill 不应该只是把 Wiki 换一种格式保存。真正有价值的内容,是那些依赖团队环境才能成立的判断:自研中间件要看哪些指标,大促期间使用什么阈值,哪些变更必须升级审批,什么情况下只能建议而不能操作。
读者能得到的好处,也正在这里。对新人,Skill 缩短了从“看见告警”到“知道下一步查什么”的距离;对资深 SRE,它减少了低价值的重复答疑;对管理者,排障过程不再完全依赖某个人是否在线。即使 AI 最终没有直接给出结论,能够把证据按团队认可的顺序收集齐,也已经节省了大量沟通。
22 个内置 Skill 先解决通用问题
夜莺 v9 正式版内置 22 个 Skill,覆盖几类常见工作:
- 创建告警规则,辅助配置屏蔽、订阅、通知规则及仪表盘;
- 生成 PromQL、SQL 和消息模板,查询告警事件及多种数据源;
- 诊断主机健康、Categraf 接入和告警规则未触发问题;
- 分析或修改仪表盘、导入 Prometheus 规则、回答夜莺使用问题;
- 帮助团队创建新的 Skill。
内置 Skill 解决的是各家公司都会遇到的共性任务。它们能降低使用门槛,却不可能知道某家企业的发布窗口、资产标签、自研系统和事故分级标准。夜莺允许团队上传自定义 Skill,也可以从 Git 仓库安装,并配置公开或团队可见范围。团队经验因此可以像配置和代码一样维护、评审与迭代。
如果团队只使用内置 Skill,得到的是一位熟悉通用监控知识的助手;把自己的 SOP 写进去之后,它才开始理解“你们公司遇到这个问题时应该怎么做”。不做这一步也能使用 AI,但那些最值钱、最依赖现场的判断仍然会留在少数人的脑子里,人员流动和轮班交接的成本不会消失。
从一条高频告警开始,不要先写“大而全”的手册
第一份 Skill 最好选择一个高频、步骤明确、风险可控的场景,例如主机失联、磁盘空间不足或 MySQL 连接数过高。写作时至少说明五件事:
- 什么问题应该触发这份 Skill,哪些相似问题不适用;
- 需要读取哪些告警、指标、机器或数据源信息;
- 排查步骤的先后顺序,以及每一步如何判断;
- 哪些结论证据不足时必须停止,转交人工处理;
- 输出需要包含什么,例如结论、证据、风险和下一步建议。
写完后,可以用历史事件做几轮回放。重点不是看 AI 的文字是否流畅,而是检查它有没有跳过关键证据、混淆环境、给出越过安全边界的建议。每次事故复盘后,再把新发现的判断条件补进 Skill。
知识复用必须带着权限和边界
让 AI 读取监控数据,不等于给它管理员权限。夜莺的 AI 调用会继承当前登录用户的身份,继续受到角色和业务组权限限制。用户看不到的数据,AI 也不应该绕过权限获取。
自定义 Skill 如果携带脚本,会在服务端沙箱中执行,出网行为可以受代理控制。大模型由企业集中配置,可以接公网 API、内部 LLM 网关或本地模型。对数据不出域有要求的团队,应优先选择内网模型,并在上线前审查 Skill 能调用的工具、脚本和网络地址。
还要避免另一个误区:有了 Skill,不代表 AI 可以替代事故负责人。高风险操作仍应保留人工确认和原有审批流程。Skill 最适合承担信息收集、证据整理、步骤提示和低风险配置工作,把人的注意力留给影响判断与变更决策。
真正沉淀的是判断过程
运维知识最难传承的部分,往往不是某条命令,而是“为什么先看这个指标”“什么证据足以排除误报”“到哪一步必须叫人”。把这些内容写进 Skill,团队的经验才不会只停留在少数人的记忆里。
夜莺 v9 给出的并不是一套替企业做决定的万能 AI,而是一个可以承载团队方法的入口。最适合迈出的第一步,不是组织一场“大而全”的知识工程,而是挑一条每周都有人重复询问的告警,把资深同事真实采用的判断顺序写进去,再用历史事件验证。
内置 Skill 决定了开箱即用的下限,持续复盘和维护自己的 Skill,才决定它在生产环境中的上限。否则,再好的 AI 也只能给出“行业一般怎么做”,无法回答“我们这里应该怎么做”。