跳转到内容

04|设计一场公平实验

假设你的新交接方案成功了 8 次,旧方案成功了 5 次。先不要着急高兴:如果新方案用了更强模型、更容易的题目和更多尝试,你还不知道改善来自哪里。

公平不是“所有东西必须永远完全一样”,而是:为回答当前问题,尽量固定无关差异;不得不不同的地方要记录,并准确解释你究竟在比较什么。

下面用一个虚构的小型配置程序贯穿说明。它最初让环境变量覆盖配置文件,后来用户取消这个规则。第三次会话只要求增加日志。你检查 Agent 是否在完成日志功能时恢复了已取消的覆盖规则。

最终不能只问 Agent:“你做好了吗?”应当用外部检查确认行为:日志功能可用;新配置规则仍然有效;无关的旧功能没有损坏。

这里的“外部”指不由被测 Agent 的自我评价决定结果。可以是你提前写的程序测试、实际数据库状态,或按照事先规定的规则进行人工判断。

测试也会写错。所以在让 Agent 参加前,先准备一个人工正确版本和几个故意有特定错误的版本。正确版本应通过;恢复旧配置规则的版本应被拦下。如果评分器分不清它们,继续测 Agent 只是积累错误数字。

不要在隐藏测试里要求用户从未表达的功能。隐藏是为了避免 Agent 针对答案写代码,不是让它猜谜。

对照就是用来判断新办法到底改变了什么的比较对象。第一次至少保留一个合理的简单办法,而不只挑一个故意很差的版本。

在交接例子里,可以比较自由格式交接、固定长度的普通摘要、同等长度且标注当前/作废状态的交接。另用人工正确交接诊断任务是否可解,但不能把人工整理的劳动当成免费优势。

若结构化交接胜出,还要进一步查:是不是多了一句“请注意新需求”,而不是结构本身?是不是允许写更多字?下一轮可以加入相同提醒或长度相近的无关文本对照。第一轮不必一次铺满所有组合,但要知道当前结果还排除不了哪些解释。

“消融实验”这个词常见,意思是去掉方法的一部分,再看结果怎样变化。它用来辨认组件作用;不是删掉什么分数下降,就能证明这个组件在所有情境都必要。

调试集用来排查程序和改提示;验证集可以帮助选配置;最后的测试集留给最终检查。小规模练习也可以先只分“开发用”和“最后保留”两部分,但名称与用途要说清楚。

如果不断查看最后保留的题目并据此改提示,它实际上已经变成开发数据。应记录这一点,再找新题检查。

同一模板换十个人名,不太像十个独立问题。更好的任务家族可能是:配置优先级、输出格式、权限范围、文件路径等,每一类内部可以有几个版本。划分时尽量按家族或原始文档分开,避免只是把近乎相同的题拆到两边。

AI 可以协助出题,但应由你核查含义、答案与相似度。合成题容易控制条件;真实案例更能说明问题确实出现过。两者用途不同,不能把自己刻意造的陷阱出现率解释成真实用户中的故障率。

至少保存任务 ID、原始输入、代码版本、模型标识与日期、提示词、工具权限、输出长度和调用上限、真实输出、评分器版本、结果以及耗时费用。任务失败、请求超时、程序崩溃也要进入记录。

重试规则提前定,例如接口暂时错误可以再试一次,同时保留第一次错误。不要只对输的一组不断重跑,直到它赢或直到另一组显得更差。

有些 API 即使设置同样的随机种子,也不能承诺跨日期完全一致。因此“保存 seed”不等于“已经可复现”。保留版本、输入与输出,别人才能知道差异来自哪里。

模型可见的文件和评分器也应分开。若 Agent 能改最后的评分程序,它可能让分数变好,却没有修好目标程序。

比较完整工作流程时,要计算写摘要、读取材料、失败重试和验收的成本,不能只算最后一次回答。若新方案多花了一倍预算,仍可能值得用,但结论应变成“用这些额外资源获得这些收益”。

API 成本可按下式估算:所有调用的输入 token 数乘输入单价,加输出 token 数乘输出单价,再计入缓存或其他收费。token 是模型处理文本的计量单位,不等于汉字数,也不等于会话数。若价格按百万 token 标注,计算时要除以一百万。

先跑几条测量实际用量,再决定扩大多少。不要为了填完整表格一口气跑满模型、方法、语言和任务的所有组合。

本地性能实验也要固定设备、电源状态、后台负载和软件版本。用户等待一段完整译文的时间,与模型每秒生成多少 token,是两种不同的测量。

动手前,在工作簿里填:问题;主要比较;题目与分组;正确标准;预算上限;失败和排除规则;最重要的指标;什么时候扩大、什么时候暂停。

这些安排是给你的实验设计建议,不是某个会议规定的万能模板。正式研究对细节的要求可以参考 NeurIPS 的清单:它强调交代设置、可复现路径、资源、误差来源和限制。清单的作用是暴露遗漏,而不是替实验质量打包票。NeurIPS,Paper Checklist Guidelines,本次查阅 2026-09-07

写完计划后先用两三题检查整条流程。第一次值得追求的结果是:输入明确,输出留存,评分可信,失败能解释。