课题 A|Agent 更新交接后,会不会恢复已经取消的要求?
查新截至 2026-09-07
建议定位:优先的 Agent 研究训练。 先研究一个很小的代码任务和三次会话,不搭通用记忆平台。与你的 hmd/Zita 和 AI 辅助开发经历相近,但这些项目材料不等于已经证明本问题在其中发生。
问题具体长什么样
Section titled “问题具体长什么样”一个配置工具最初允许环境变量覆盖文件设置。第一会话实现它并留下交接。第二会话用户明确取消覆盖规则,Agent 修改代码并自己更新交接。第三会话清掉对话,只保留代码与交接,让它增加日志功能。
你要检查:日志完成了吗?已取消的覆盖规则是否又出现?其他仍有效的要求有没有被误删?
这比问“它记不记得新要求”多了一步:它要在真实代码行为中保持正确。若出错,再追踪错误出现在写交接、读取交接还是修改代码时。
已有工作已经覆盖到哪里
Section titled “已有工作已经覆盖到哪里”| 最近工作 | 已有内容 | 对本方案的限制 |
|---|---|---|
| agent-memory-bench,作者仓库,2026 | 代码任务与过时、冲突事实;提供多种对照 | 不能声称首次测旧记忆误导编程;其当前范围是预先导入后的检索 |
| Fan 等,StateMemBench,2026-08-20 | 动态状态、撤回与更新、相关控制实验 | 当前/作废标签不是新的基本想法 |
| Patel,Supersede,2026-06-25 | 自行重写受限记忆后回答更新问题 | 不能声称自维护过程是整个领域的空白 |
这三者合起来,使原始题意的新颖性很弱。可能的后续价值在于发现一种具体、可重复的记忆到代码行为的失败机制,并证明现有解释或对照不足以说明它。这点目前没有实验支持,也没有确认无人研究。
检索范围包含 coding agent handoff、stale/superseded memory、memory update、multi-session、memory consolidation 等问题族及相近原文。开展第二阶段前,应围绕实际发现的机制继续追查;本次不声称穷尽整个领域。
第一次实验怎样搭
Section titled “第一次实验怎样搭”自己写一个几十到几百行的小工具,比直接搬大型仓库更容易核对。首先只用“配置优先级”和“输出格式”两个任务家族。
每个家族做一对历史:一题明确更改决定;另一题只是讨论旧方案,没有真正撤销当前规则。后者防止“总听最后出现的词”冒充正确理解。
三种条件都让 Agent 自己写交接:自由格式、固定长度普通摘要、同等长度且标明当前/作废/适用范围的摘要。相同模型、工具、代码起点和每会话预算。计入写交接的调用与 token。
另放人工正确交接作为诊断:如果它也普遍失败,可能是任务过难或编码能力不足。它不进入公平方法排名。必要时加一个“无交接”条件,判断代码本身是否已把全部答案暴露出来。
每个完整实验单元含三次会话。进入第三会话时,不再在用户提示中重复正在考查的旧决定,否则你绕过了记忆过程。保留所有交接版本、实际读取内容、代码修改和独立评分。
评分先于模型运行
Section titled “评分先于模型运行”预先准备人工正确版本,以及故意恢复旧规则、漏掉新功能、误删有效要求的版本。隐藏测试必须分别识别它们。你应能手动解释每个判定。
主要指标是恢复废弃行为的比例;同时报告完整通过率和误删有效要求的比例。评分不以“交接里出现了正确词语”代替实际执行结果。
开发题用来调提示,正式保留题按任务家族区分。若只有两个家族,结果只作为流程预试;第二阶段可扩到六个家族,再考虑更多独立类型。
工作量与预算
Section titled “工作量与预算”两个家族 × 两种历史 × 三种交接 × 两次重复,共 24 个完整实验单元、72 个会话。若每会话上限五次模型调用,最多 360 次调用;实际 token 用量需预跑测量。六个家族对应 72 个单元、216 个会话,上限 1,080 次调用。
不要从这个上限反推固定金额:每次输入长度、缓存和模型单价不同。第一天先跑一个家族的一条链,检查日志,再估算。无需 GPU;本地执行应限制在可重置的小项目里。
作者仓库提供复现说明,仓库标 Apache-2.0;若复用须检查具体文件与通知。StateMemBench 数据下载与许可、本方案在你机器上的兼容性,本次未实跑核验。最小方案使用自己编写的代码与任务,可以避开依赖整套基准。
哪些结果值得继续
Section titled “哪些结果值得继续”如果结构化方法只因多了提醒或更长文本而获益,继续补等预算对照;不要把收益都归给“结构”。如果交接没错但执行反复恢复旧规则,值得追查代码上下文和修改过程。若平均无优势,但某类撤销模式出现稳定差异,可扩大那类及反向控制,并重新查新。
若所有条件都全对,先判断题目是否过易;若人工正确交接也失败,先检查环境;若已有工作完全覆盖自己的扩展,保留复现报告。不能通过删除不支持想法的题目来制造结果。
第一轮成功可以只是:“我定位了两次可复现失败,解释它们在哪一步发生,并知道尚不能推广。”这足以开始与导师讨论下一步。
第一次开工清单
Section titled “第一次开工清单”写两种历史和最终需求;手写正确行为测试;造一个恢复旧规则的错误版本检查评分;读上述最接近的两项工作;最后只跑一条三会话链。完成后填一页工作簿,再决定是否扩大。