Agent 评测回归门禁:别让一次漂亮演示替代证据

Agent 评测回归门禁:别让一次漂亮演示替代证据原创封面

演示流畅度不是发布证据

模型升级后回答更自然,订单代理却开始把测试环境当成生产环境,这类回归很难从最终文字发现。一次成功演示只覆盖一个输入、一条采样轨迹和当时的外部数据,不能代表长尾请求、工具失败或多轮恢复。评测门禁的目标不是给模型贴一个总分,而是为具体业务损失建立可重复实验,让每次模型、提示、工具或检索变更都留下可比较证据。

先把“任务完成”拆成结果与过程两层。结果层检查用户目标是否满足、事实是否正确、格式是否可消费;过程层检查环境、工具顺序、权限边界、禁止动作和资源预算。即使最终订单号正确,只要代理曾查询错误租户或调用生产写接口,仍应判失败。反过来,安全拒绝高风险请求不该因没有生成答案而被通用相似度评分惩罚。

从真实失败提取最小样本

高价值样本应来自工单、事故、人工接管和线上异常,而不是只由编写者想象标准问题。每个案例保留触发缺陷所需的最少上下文,移除个人信息,冻结相关订单、文档和权限快照,并写明当时的业务损失。若样本依赖会变化的网页或当前库存,评测就无法区分模型退化与数据变化,应改成受控夹具或记录可核验版本。

样本标签要描述可观察条件:必须查询哪个只读工具、绝不能触发哪些写动作、最终字段应满足什么关系、何时应转人工。不要保存一段唯一理想答案让所有模型模仿措辞,因为同一任务可能有多种正确表达。对长任务可设置检查点标签,例如检索命中、计划合法、工具参数正确、外部提交成功,使失败能够定位到规划、检索、执行或总结环节。

确定性断言守住高损失边界

权限、金额、环境和副作用次数不适合交给另一个模型凭印象评分。测试运行器可以直接断言工具名、目标环境、参数范围、调用次数、幂等键和最终数据库状态。对于“禁止删除”“不得跨租户查询”这类红线,任何一次违反都阻止发布,不用平均分抵消。自然语言质量、帮助程度和解释清晰度再交给量表或盲审。

自动裁判适合处理存在语义弹性的维度,但必须用人工标注集校准。需要检查裁判是否偏爱更长答案、特定语气或与自身相似的措辞,并报告分歧而非隐藏。把裁判提示、模型版本、温度和输入截断策略全部版本化;一旦裁判变化,历史候选应在同一子集重跑,否则两次分数没有直接可比性。

固定实验条件并记录每项变更

可复现评测至少固定数据快照、工具模拟行为、模型标识、提示版本、检索索引版本和随机参数。模型服务即使使用相同名称也可能更新,因此结果记录还要包含可获得的实际版本与运行日期。涉及重试和并发的代理不能只固定随机种子,还应控制时钟、故障注入位置和网络延迟分布,以免偶然顺序掩盖竞态。

每次候选运行输出逐样本差异,而不只是一个总体百分比。报告新增通过、由通过变失败、轨迹变化、成本变化和尾延迟变化,并链接到具体配置差异。若同时更换模型、提示和工具契约,即使分数下降也无法归因;发布实验应尽量单变量,必须组合变更时则建立消融组,确认收益和风险来自哪个环节。

指标必须服从任务损失

平均成功率会把少量灾难性错误淹没在大量简单分类中。评测面板应按风险层、用户类型、语言、任务长度和工具类别分组,单独观察高损失桶的失败率。成本也不能只算平均令牌量,应统计重试、工具费用、人工接管和九十五或九十九分位时延。一个便宜但经常卡住的代理,可能把节省转移成更昂贵的客服处理。

门槛可以由硬约束和趋势约束组成:越权与禁止工具调用零容忍;核心任务完成率不得低于基线;尾延迟和单任务成本限定增长比例;人工接管率在置信区间内不恶化。小样本差异要报告不确定性,不能把一两个随机通过包装成显著提升。业务允许的权衡需由负责人明确签署,而不是在仪表盘里悄悄调整权重。

防止泄漏、过拟合与失真

若评测题直接进入训练资料、系统提示示例或开发者日常调试,候选可能记住答案却没有获得泛化能力。应区分开发集、门禁集和保留集,限制保留集访问,并定期从新事故补充样本。重复问题可保留结构但更换实体、权限和失败位置,检查代理是否真正理解约束。任何样本更新都要说明原因,避免为了让新版本通过而修改期望。

外部事实也会让历史集过期。订单状态、产品政策和网页内容应使用时间冻结或明确模拟接口;若必须在线评测,则把依赖响应一起归档并单独标记不可重放案例。评分模型的上下文截断可能丢掉关键否定句,工具轨迹序列化也可能改变顺序,这些评测基础设施缺陷需要自己的单元测试,否则门禁会稳定地给出错误信心。

离线门禁之后仍需低风险灰度

离线通过只能证明已知分布内没有明显回归。候选版本应先进入无副作用影子流量,比较它与现网在计划和工具选择上的差异,再向少量低风险任务开放。灰度事件必须携带模型、提示、路由和工具契约版本,使线上失败可以回放到确切组合;不能只记录一个模糊的“新版本”标签。

验收矩阵包括固定随机性重放、关键禁止轨迹零次、每项变更差异报告和灰度指标可归因四个基础面,再加入依赖超时、长任务恢复、人工接管和成本上限。若线上高风险桶恶化,自动停止扩量并保留样本用于下一轮回归。这样评测不是上线前的一张成绩单,而是从事故取样、离线验证、灰度观测再回流样本的持续控制系统。

长轨迹用节点级证据定位回归

长任务不能只比较最终回答。运行器把规划节点、检索集合、工具参数、外部状态和恢复选择序列化为稳定事件,再对允许顺序和关键字段做断言。模型可以采用不同措辞或增加安全读取,但不得越过确认、换到错误环境或在未知提交后直接重试。

轨迹比较要容忍等价路径,同时抓住业务不变量。可将必须发生、允许发生和禁止发生的事件分别声明,并为有顺序要求的节点建立偏序,而不是要求每次产生完全相同的调用列表。这样不会因无害的额外解释误报,却能精确指出环境选择或恢复分支变化。

评测失败展示首个违反约束的节点、相关输入快照和前后版本差异,不让审阅者翻阅整段聊天。对外部状态未知的轨迹,评分器等待模拟状态端点收敛;不能因为最终文本说“成功”就跳过服务端证据。

门禁本身也需要质量控制

测试运行器、工具模拟器和指标计算代码同样可能出错。为评分规则编写正反夹具,确认禁止轨迹一定失败、合法替代路径不会误杀、成本与尾延迟按同一单位统计。模拟器与真实工具契约版本保持一致,发现差异时先修评测基础设施,再解释候选模型变化。

不稳定样本单独隔离并调查,不能靠重复运行直到通过。记录每个样本的波动率、失败种子和外部依赖,超过阈值便停止作为硬门禁,修复确定性后再恢复。门禁配置的修改需要代码审查和变更理由,防止为了赶发布临时降低阈值。

定期由盲审人员复核自动通过与自动失败样本,估算漏报和误报。事故发生后检查它是否本应被现有规则捕获;若是则修运行器,若不是则新增最小样本。还要定期演练评测存储不可用、评分任务超时和候选输出截断,确保基础设施故障显示为未知而非错误通过。样本删除、标签修订和阈值变更保留审批记录,历史报告标明当时配置,避免后来规则覆盖旧结论。每轮发布随机抽取未见案例进行人工复核,并把分歧原因回写到量表说明中,同时跟踪不同审阅者的一致程度与漂移趋势。门禁也遵循证据闭环,才不会成为另一场看似精确的演示。

实现片段

const gate = passRate >= baseline && criticalFailures === 0

一手参考资料

评论 · 0

还没有评论留下第一句经过思考的话。

游客评论需审核。注册后可直接公开,无需审核。

SHARE / 分享

分享这篇文章

WECHAT / 微信

用微信扫一扫

在手机微信中打开文章后,再从微信右上角分享给朋友或朋友圈。