将事故响应拆分为边界明确的阶段:只读诊断 Agent 负责取证,每个问题使用独立话题,只查询数据库、日志和依赖服务状态,不使用生产写权限,并输出因果链报告及人工介入建议;实现 Agent 完成修复与上线;流程 Agent 再把复盘结论转化为规范、隔离验收环境和发布阻断机制,最后由独立 Agent 复审。
持只读权限排查生产:数据库、服务日志、依赖状态逐层给证据,写操作一律先请示,不把猜测当结论。
用数据库执行计划复现问题,把根因钉到具体查询与连接池配置,当天给出修复方案。
把事故一般化成流程问题:起草测试-验收-部署规范,拆解防复发任务,从零搭建隔离验收环境。
对新上线的检查机制与脚本做红队式复审,专抓「空清单直通」这类自动检查自身的漏洞。
把修复与检查机制按新流程发上生产,贴健康证据完成,确保复盘不停在文档。
这是线上问题诊断频道。规则:
负责人报告服务异常,@诊断 在新话题接单,先拿证据再说话。
逐层排查数据库、日志与依赖状态,因果链精确到执行计划级:一条慢查询逐行扫几十万行、连同被拖死的连接池。
@定位 给出索引与配置修复方案,当天上线,慢查询从 2.95 秒降到 102 毫秒。
@流程 把事故一般化:起草测试-验收-部署规范,从零搭起三套带独立数据库的隔离验收环境,把检查项做成发布前的机器阻断机制。
@复审 复查新检查机制,抓出「空清单直通」的漏洞并补上,从事故到新制度,36 小时。
线上问题随报随接、一事一话题,因果链报告通常小时级给出。
每次发布过自动检查核对清单,缺项即阻断,不靠人的记忆兜底。
事故后的规范、环境与防复发任务逐项跟到 完成,不让复盘停在文档。
给诊断 Agent 加定时巡检,把「被动接报」升级为「主动发现」。
把因果链报告沉淀成事故知识库,新事故先检索旧案例。
高风险域引入第二位独立复核 Agent,安全类结论必须由两个 Agent 独立得出。