跳转到内容

研究工作簿

复制一份,为自己的第一轮实验填写。

不需要一次填满。先写问题和最近工作,做预试后补结果。空着比编一个听起来合理的答案好。

  • 日期与项目:
  • 一次具体经历:
  • 我想知道什么:
  • 谁会因答案改变什么做法:
  • 我目前猜测:
  • 什么结果会让我改主意:
  • 第一轮定位:复现/探索/验证(可说明先后)

填写示例(设计建议,尚未运行): 我想知道相同长度下,当前/作废标记能否减少 Agent 在后续编码时恢复旧配置规则。若收益在普通摘要加同样提醒后消失,我不会把它归因于结构格式。相关工作已有动态状态和自维护记忆研究,本轮先作复现与诊断。

  • 标题、作者、最早公开日期、所读版本、链接:
  • 第一遍用自己的话说:问题/办法/证据/限制。
  • 与我最接近的实验,原文哪一节:
  • 数据、模型、题目、评分和预算:
  • 它已经回答了什么:
  • 它没有回答的内容,为什么对我有意义:
  • 代码、数据、许可证是否看过;是否实际运行:
  • AI 帮忙总结后,我亲自核对的两个位置:
日期与查询词 找到的原始来源 与我重合在哪里 是否改变计划
待填 待填 待填 待填

目前只能说“在这些范围内尚未找到……”;不能因为一轮搜索没结果,就填“首次”。

  • 主要问题与主要指标:
  • 基础对照及选择理由:
  • 新方法具体改变了什么:
  • 题目家族、题数、每题重复数:
  • 开发题与保留题怎样分开:
  • 正确标准;人工正确和故意错误样例:
  • 模型、提示、工具、环境版本:
  • 每次调用或时间上限;总预算:
  • 请求失败、重试、排除规则:
  • 未被排除的其他解释:
  • 扩大或暂停的条件:

一条记录对应一个清楚定义的实验单元。建议字段:运行 ID、任务 ID、家族 ID、条件、重复序号、时间、代码版本、模型标识、提示版本、输入路径、输出路径、评分器版本、各项结果、错误类型、调用数、输入与输出 token、缓存用量、耗时、备注。

记录失败,不把空结果默默删除。表格里的总分应能回到这些记录重新计算。

我研究什么:

怎么做: 数据、模型、对照、评分和预算。

看到了什么: 写清分子与分母,分别列出改善、退步和失败;贴一个代表性案例的记录位置。

目前可以说:

还不能说:

可能的其他解释:

下一步及其理由:

原来计划 改成什么 为什么改 改动前是否已经看过结果
待填 待填 待填 待填

改变计划很正常。把改变写清楚,未来才能区分事先检验的判断与事后发现的线索。