05|从结果走向结论
分数是线索,结论还要往下查
Section titled “分数是线索,结论还要往下查”下面全部是教学用虚构数字,不来自任何真实实验。
假设普通摘要与结构化摘要完成了相同的 20 个任务,结果如下:
| 同一个任务的结果 | 任务数 |
|---|---|
| 两种方法都成功 | 10 |
| 只有结构化摘要成功 | 5 |
| 只有普通摘要成功 | 2 |
| 两种都失败 | 3 |
| 合计 | 20 |
普通摘要成功 12/20,即 60%;结构化摘要成功 15/20,即 75%。相差 15 个百分点。相对普通摘要的成功率增加了 25%,因为 15 除以 60 等于 25%。这两个表述不是同一个数字,写文章时要区分。
更值得注意的是:新方法帮助了 5 个任务,却也让 2 个原本成功的任务失败。只报总分,会隐藏后面这件事。
为什么要保留一题对一题的结果
Section titled “为什么要保留一题对一题的结果”你比较的是相同任务,所以要把结果配对。这样可以追问:新方法在哪些任务上帮了忙,在哪些任务上造成损害。不能把两组当作来自完全无关题目的分数,丢掉这个对应关系。
如果那 5 次改善都来自同一个模板的细微改写,你得到的证据比“5 种不同任务都改善”弱。重复运行也类似:同一个问题跑 100 遍,能帮助了解这道题上的波动,却不会自动变成 100 种使用场景。
因此报告时分开写任务家族数、任务数、每题重复次数和总运行数。最终想推广到新问题,就需要新问题的证据。
结果有多不稳定
Section titled “结果有多不稳定”小样本里的百分比变化很容易显得大。上面的 20 题只要有两题改变结果,差距就变化 10 个百分点。
置信区间是一种表达估计不确定性的方式:它给出按某种抽样方法计算出的区间,而不是只有一个点。通俗说,它帮助你看到当前数据把答案限制得有多窄。但“95% 置信区间”不能随意解释为“真实值有 95% 概率在这个已经算出的区间里”;频率学派的标准含义关乎重复使用该构造方法时的覆盖表现。
你暂时不必手推公式,但要知道工具以什么为抽样单位。若同一任务家族里的题强相关,却把每次输出都当独立样本,区间可能显得过窄。
在有足够不同任务时,可以使用成对 bootstrap:每次抽取同一批任务的两种方法结果,再计算差异,重复得到差异的变化范围。如果存在家族或文档关联,应按合适的整体单位抽取;只有几个家族时,这个估计本身也不稳定。不要认为调用了统计库就自动解决样本设计问题。
选择统计方法要考虑任务、指标和实验结构;Dror 等的 NLP 方法文章专门讨论这一点,可在准备正式分析时对照阅读。Dror、Baumer、Shlomov、Reichart,ACL 2018,The Hitchhiker’s Guide to Testing Statistical Significance in NLP。
显著、重要、普遍,是三件不同的事
Section titled “显著、重要、普遍,是三件不同的事”统计显著性讨论的是:在某些假设下,观察到的差异是否容易由随机波动解释。它不告诉你改善是否有实际价值,也不自动排除不公平对照、错误评分或数据泄漏。
一个很小但稳定的改善,可能不值得额外几十倍成本。一个看起来很大的改善,也可能因为题目太少而暂时无法确认。没有达到显著性,不等于证明两种方法相同;如果要说“足够接近”,还需要事先定义多大的差异算实际重要,并采用适合的问题和分析方式。
此外,试了很多模型、很多指标,只挑最漂亮的一个报告,会增加偶然发现被包装成规律的风险。先确定主要指标;后来发现的现象,标成探索结果,再用保留数据检验。
必须回头看失败案例
Section titled “必须回头看失败案例”把失败按可观察原因分类:没读到当前要求;交接写错;读到了但执行错;测试环境坏了;输出中断;评分不确定。先不要给每次失败都贴“推理不足”这样难以验证的标签。
分类规则最好在看方法名称前确定。若只能由你一个人判,至少隐藏配置名、打乱顺序,保存判断理由;有同学协助时,让对方独立判断一部分,再检查分歧。这不能消除所有偏差,但会让主观判断更可检查。
自动分数也有盲区。翻译句子里的数字都在,不代表数值关系正确;服务返回正常,不代表旧任务已经处理;Agent 说“已验证”,不代表验证真的执行过。
一个真实案例:总数对了,任务却丢了
Section titled “一个真实案例:总数对了,任务却丢了”Replaybook 的固定版本实验记录描述过这样的过程:Agent 排查队列时取走了一个原有任务,后来处理了剩余任务,又创建了新的测试任务。数据库总行数看起来对了,但原来的一个任务 ID 没有完成。按原有 ID 检查的验收器发现了它;只数总量容易漏掉。
这是作者公开的开发实验记录,本次没有亲自复现,也不能拿单个场景概括所有模型。它却清楚说明了一种测量问题:数量相同,不代表要求的对象都正确。 你可以把同样的问题意识带到自己的通知、文件、测试用例或引用核查中。Replaybook,20260808.0.0 的 benchmarks 记录,2026-08-08 发布版。
从不合格表述改成可信表述
Section titled “从不合格表述改成可信表述”不合格:“我们的方法显著提升 Agent 的可靠性。”
更合适的教学写法:“在这 20 个预试任务中,完整通过率从 60% 升到 75%;5 题改善、2 题退步。任务规模较小,且尚未检查新任务家族和第二个模型,因此目前只能把它视为值得进一步验证的信号。”
如果结果没有改善,可以写:“在当前等长度对照下,未观察到稳定优势;下一步先排查是否只是额外提醒造成原来的改善。”这是一条清楚的研究进展。
第一次结果报告不必很长。用一页写清:问题、条件、具体分母与结果、代表性失败、目前支持什么、还不能支持什么、下一步。完成这页,你就可以开始和别人讨论证据,而不只是介绍想法。