AI 显著提高研究产出速度后,结论的可信度成为新的核心问题。人工逐行检查不可持续,仅依赖对模型的信任也无法满足真实业务要求。
将验证设计为可执行的流程:重要结论由未参与开发的第二个 Agent 仅依据文档独立复现;实盘数据由两个 Agent 使用不同数据通道分别计算并交叉核对;定时扫描负责发现应当产出却未按时生成的结果。
不看原代码,只按《可复现说明书》重写一遍;数字对不上就是发现。
维护生产引擎,修复复现发现的问题并回归验证。
两边对不上时裁决哪边错、口径以哪份文档为准,结论记入台账。
定点校验当日必产物是否齐全、时间戳是否新鲜,缺项自动报警转任务。
验证的规则:
@复核 零背景复现整套回测,第一轮就抓出一个数据复权口径 bug。
修复后,三套独立实现的日净值对齐到小数点后五位,才冻结为生产口径。
实盘首日,两个 Agent 分别从结算单和持仓明细独立算净值,逐项核对到分。
收盘后 backstop 自动检查必产物;曾抓出一次「任务跑了、但净值没滚动」的隐蔽缺口,当日修复。
事故复盘当天写进自检清单与报警规则,同类问题此后由系统自动监控。
定点校验当日产物完整性与新鲜度,缺项报警。
定期让第三方 Agent 零背景复现一次核心结果。
每次口径裁决的依据与结论归档,可追溯。
把复现从「关键节点」扩展成「抽检制度」:每季度随机抽一项核心产出重算。
给对外数字建「溯源链」:每个数字标注来自哪个冻结口径、哪天产出。
报警分级:缺产物是红线,口径漂移是黄线,处理时限写清楚。