
一个在演示中表现出色的 Agent,等到真实用户开始使用,仍可能在不显眼之处出现问题,例如错误调用工具、在任务中途丢失线索,或给出一份表述通顺却未切中要点的结果。Agent 评测是团队有意识地识别这些失败的手段,通过明确的标准检验 Agent 经过的步骤及其给出的结果。文章说明 Agent 评测需要衡量什么、团队常用哪些指标与方法,以及如何建立一套在团队将 Agent 投入生产之前运行的检查。
快速结论
Agent 评测在 Agent 上线之前,对照明确标准检验它,核查它走过的步骤与给回的结果两方面。一个 Agent 是否站得住,须由团队在自己备好的用例上度量,因为在演示里读来顺畅的 Agent,等真实使用抵达仍可能出错。团队按自身工作设定标准,于是同一份结果在一项任务上算通过、在另一项上未必,本文提供的是按能力核查的方法,并非一份照抄的固定方法清单。
于是团队从一次核查得到的,是本轮的证据,并非对此后每一次运行的承诺。下文说明 Agent 评测衡量什么、团队用哪些指标与方法、先要定哪些标准,以及这套核查与「构建、运行 Agent」的关系,帮助团队在 Agent 上线前,用自身工作检验它。
Agent 评测衡量什么
Agent 评测看同一次运行的两层,即 Agent 走过的步骤与它给回的结果。步骤这一层,看 Agent 如何走过任务,例如调用了哪些工具、是否守在任务上还是走偏。结果这一层,看 Agent 最后给回什么,对照团队为该任务所定的标准来读。
这两层回答不同的问题,团队对照自身工作把两者一并掂量。一份结果可能读来正确,其背后的步骤却已出错,且这出错会在稍后显现;步骤也可能看着稳妥,结果却漏掉了任务所需。每一层算作对的是什么,由团队为手上这项任务设定,并非为每个 Agent 预先固定。
上线前检验 Agent 的指标与方法
下面的指标与方法,是团队能核查一个 Agent 的几个角度,每一个均对照要开展的工作。其中两个覆盖上面点到的两层,即步骤与结果,第三个覆盖团队如何运行这次核查本身。没有哪一个是固定权威,团队挑对得上任务的角度,并定下每个角度算通过的线。
Agent 的步骤与工具调用是否站得住
一个角度,是看 Agent 走过的步骤,即它调用了哪些工具、以什么次序、是否守在任务上。核查步骤,能显出一次运行在哪里出错,哪怕最后的答案读来无碍,因为一次错误的工具调用、或任务中途丢失的线索,可能就藏在一个看着对的结果背后。团队对照任务所需来读这些步骤,一个稳妥的步骤算什么由该任务设定,因为在一项任务上合适的工具调用,换一项可能就是错的。
结果是否达到团队所定的标准
另一个角度,是看 Agent 给回的结果,对照团队为该任务所定的标准来读。一份结果能核查它是否做到任务所求、是否守在成本与时延边界内、是否留在团队所设的限度里。标准在这里承载分量,因为一份结果要对着团队写下的准绳方有意义,而这准绳由团队按自身工作来定,并非取自一个通用分数。
如何运行一次核查(固定用例、评分与成员复核)
一次核查,在团队备好的用例上运行,配一套给每份结果评分的办法,加一处供成员复核的点位。固定用例每次给 Agent 相同的输入,团队据此看出一次改动是帮了忙还是添了乱。评分能由一条规则把结果对照设定答案来查,能由一个模型来打分,也能由一名成员来读,各有其适用,看任务需要什么。任务需要时,成员复核能补充自动评分,因为来自规则或模型的一个分数,给出的是本轮的证据,本身并不定论结果是否合适。
测试前要定的标准
在团队测试一个 Agent 之前,先定下这次核查要对照的标准,从「任务算成功」讲起。标准涵盖一项任务应达到的结果、团队接受的工具使用、一次运行应守住的成本与时延,以及这项工作带有的安全限度。这几项均由团队按自身工作来定,于是一项任务的标准与另一项不同,核查对着它们方有意义。
先把标准写下来,能让核查保持诚实,因为看过结果之后再补的标准,会朝着迎合它的方向弯折。先于运行定好准绳的团队,有一条固定的线来读结果,成员也能在 Agent 被拿去对照之前,确认这些标准对这项工作站得住。
评测与「构建、运行 Agent」的关系
Agent 评测紧挨着「构建一个 Agent 工作流」与「Agent 所跑的运行时循环」,且与两者均为不同的活儿。把它与两者的分界讲清,能让核查不至滑成一次重建或一次重跑。
构建一个 Agent 工作流并提升其可靠性,是把 Agent 搭起来并加固的活儿,这由 AI Agent 工作流一篇承载。Agent 评测不重建、不加固工作流,它检验并度量搭好的 Agent 对照团队所定标准做了什么。构建做法归 AI Agent 工作流一篇,本篇停在检验。
单个 Agent 所跑的运行时循环,即它边走边规划、行动并核查自己的工作,由自主式工作流一篇承载。那个环内的核查,是 Agent 在运行时自己的一步,而 Agent 评测是团队从外部另做的一次测试,多在上线之前,对照预先定好的标准。一个在线 Agent 的运行时监控与可观测,归运行它的平台,本篇停在上线前的核查。
在上线前运行这套评测
运行这套评测,是团队在 Agent 上线之前走的一串步骤,即从真实使用里备好用例、定下标准、让 Agent 在用例上跑、按评分与一次成员复核读结果,再据此决定。用例宜取自 Agent 将要遇到的工作,这样核查看到的是真实使用的样子,并非一份齐整的样本。
若要比较改动,团队可让 Agent 在相同用例上运行,于是一次稍后的改动能对着较早的一次运行来读。读结果覆盖步骤层与结果层两方面,对照先定的标准来掂量,成员再确认评分显示了什么。团队据此决定什么,包括 Agent 是否上线,落在团队与它指定的一名成员身上,因为核查给出证据,并不替团队做这个决定。
评测可能在何处不足
一次评测,可能在几处不及团队对它的期待,把它们点出来,能让核查保持恰当的分量。每一种均是要留意的缺口,而没有哪一种会从一个通过的分数上自行显现。
用例可能覆盖不到真实使用带来的情形,于是一个 Agent 通过了核查,仍会遇到未曾被测到的输入。评分标准可能漏掉要紧的项,于是一份结果分数不错,仍在任务上不足。而本轮的一次通过,是本轮的证据,它并不证明这个 Agent 会在此后的运行或更宽的一块工作上站住。团队把一次通过的核查读作一步,并把上线的决定留给一名成员,由其把这些缺口对着工作带有的风险来权衡。
让标准、结果与验收保持可见
- 记录可见,复核不用反推路径。选定的工作、交接与复核记录在共享 Channel 中对成员和 Agent 同时可见,成员照记录复核运行过程,不必从结果倒推它如何得来。
- 状态与归属清楚,下一步不悬空。每项工作在 Task 上带状态与负责方,谁在做、到哪一步、由谁接手,团队一眼看清。
- 产出按标准评估。某一步的结果可表示为交付物,由成员打开并按团队书面标准评估。
- 关键动作有人把关。对事先指定的高风险或对外动作,Agent 或团队能把该动作准备为 Action Card,交由有权限的成员以本人身份审阅并提交。
- 上下文跨会话延续。对话轮次与多次会话之间,相关上下文保持连续,交接时不从头再来。
一次评测会产出数字,而数字比它背后的推理活得更久。半年之后,团队手上有一个通过率,却说不清当时衡量的是什么、又是谁接受了这个结果。
如果判定条件是事后定下的,那么上线前跑一次检验的价值有限。写下标准的团队、产出结果的那次核查、给出验收的那位成员,是三件分开的事。Syfo 让这三者保持在一处可见,也覆盖一次评测工作随之带来的协同,即标准如何记录、结果由谁持有、评测由谁验收。
- 标准与结果放在一起。 团队写下的标准与产出结果的那次核查留在一个 Channel 里,两者能互相照着读。
- 结果有负责方。 任务带着谁跑了这次核查、推进到哪一步,在一轮评测反复进行时这一点尤其要紧。
- 验收作为一项动作被记下。 成员的接受随工作以交付物的形式留存,后来的读者因此看得到是谁承担了这份责任。
- 影响重大的动作等这一位成员。 团队事先标记为高风险或对外的一步,可准备为由获授权成员以本人身份复核并提交。
同一条记录让上下文跨会话延续,第二轮测试因此能在第一轮之上继续,而不必重做一遍。评测本身的运行与托管,仍由团队选用的工具负责。
与相邻概念的关系
有几个概念与 Agent 评测相邻,容易混淆。以下按本文的工作定义区分。
- AI agent workflow(AI Agent 工作流) 是如何构建 Agent 工作流并提升其可靠性,另有专篇,构建与加固落在那里。
- Agentic workflow(自主式工作流) 是单个 Agent 所跑的运行时循环及其背后的设计模式,另篇讨论,环内的核查落在那里。
- 运行时监控 针对一个在线 Agent,其可观测与治理归运行该 Agent 的平台,与本文所讲的上线前核查是不同的活儿。
问题与回答
Agent 评测衡量什么? 它衡量一次运行的两层,即 Agent 走过的步骤(例如它的工具调用、是否守在任务上),与它给回的结果(对照团队所定标准来读)。团队对照自身工作把两者一并掂量,因为一份结果可能读来正确、其步骤却已出错,而标准是为手上这项任务设定的。
如何为一次 Agent 评测定标准? 在运行之前定,从「任务算成功」讲起,涵盖结果、团队接受的工具使用、成本与时延边界,以及安全限度。标准由团队按自身工作来定,于是一项任务与另一项不同,先把它们写下来,能让稍后的结果无从弯折它们。
评测有几种类型? 类型的数目取决于某个出处如何切分,因此一个固定数字,不如团队实际核查的那些角度有用。本文把核查归为 Agent 走过的步骤、它给回的结果,以及核查如何运行三类,团队能按工作需要再添角度。
如何开始做 Agent 评测? 在通行层面,团队在上线前跑一次小核查,即几个取自真实使用的用例、先定好的明确标准、一套给结果评分的办法,加一名复核的成员。看 Agent 如何走过这些用例、给回什么,比看一次演示更能说明问题。
从何处起步
从一项标准易于设定的任务起步,即一个清楚的「任务算成功」、几个取自真实使用的用例、一套给结果评分的办法,以及一处成员复核的点位。在它上线之前把 Agent 放到这些用例上跑,对照标准读步骤与结果两方面,看它在哪里站得住、在哪里不足。这样一次小核查,显出这个 Agent 做了什么,比页面上的一次演示更能说明问题。
当核查站得住、记录也足以支撑复核,团队便有了对照更宽一块工作来权衡这个 Agent 的依据。这个 Agent 是否就绪,是团队与一名指定成员依证据来做的判断,因为一次通过的核查是朝那个判断迈出的一步,本身并不替团队做出它。