02|读论文与查已有工作
不要从“看懂每一行”开始
Section titled “不要从“看懂每一行”开始”论文通常写给同行,作者会省略他们认为读者知道的背景。第一遍被术语拦住很正常。你的任务是先弄清楚文章在回答什么,之后才决定哪些细节值得深读。
第一遍可以只看摘要、引言、主要图表和结论,写四句话:作者要解决什么;用了什么办法;什么结果支持它;哪些情况还不能据此判断。第二遍看实验:题目从哪里来、和谁比、怎么评分。只有最接近自己问题的论文,才需要继续细查实现、附录和关键公式。
这不是跳过困难,而是给阅读排顺序。Jason Eisner 的阅读建议也强调按目的阅读、沿引用和不同术语搜索,而不是孤立地从第一页硬读到底。Jason Eisner,How to Read a Technical Paper,2018 更新。
遇到关键公式,可以先问:“它拿什么输入,算出什么,为什么这能代表作者关心的东西?”如果你的实验要用它评分,最终就需要理解和核对它;暂时不用的证明可以留到以后。
用两篇真实论文练习比较
Section titled “用两篇真实论文练习比较”SWE-agent 研究 Agent 与计算机交互的界面设计如何影响软件任务表现。Agentless 则用定位、修复、验证的较简洁流程研究软件修复。这两篇让你练习一个问题:效果到底来自模型、工具界面,还是工作流程?Yang 等,SWE-agent,2024-05-06 首版;Xia 等,Agentless,2024-07-01 首版。
不要仅凭两篇文章各自的总分就宣布“复杂 Agent 没用”。先对齐使用的模型、题目版本、尝试次数、成本和评分方式。即便原文报告同一基准名称,所选子集、修复采样数或验证流程仍可能不同。
读完后试写:“这篇让我知道,设计交互方式值得检查;另一篇让我意识到,复杂程度本身不是效果证据。”这比只记哪个系统赢了更可迁移。
再看一张具体的阅读卡
Section titled “再看一张具体的阅读卡”Lost in the Middle 研究长上下文中的信息使用。你可以把它的一类实验理解为:让完成任务所需的信息出现在不同位置,再观察表现。原文在所测模型和任务中发现,相关信息位于开头或末尾时往往优于中间位置。Liu 等,Lost in the Middle,TACL 2024。
阅读卡可以这样写:问题是“能放进很长的文本,是否就能同样有效地使用各处信息”;证据来自位置变化下的任务结果;限制是它所测的模型、任务与当时设置,不能直接推出今天所有模型都有相同程度的问题。
这里最值得学习的是实验思路:把“长上下文能力”拆成一个可以改变和比较的因素。你以后也可以把“交接好不好”拆成信息是否存在、是否过时、是否实际被读取。
检索时,把一个想法拆成三类词
Section titled “检索时,把一个想法拆成三类词”假设你的想法是“旧交接记录让 Agent 恢复废弃配置”。可以分别找:
| 你关心的部分 | 可尝试的英文词 | 日常含义 |
|---|---|---|
| 对象 | coding agent, agent memory | 会写代码的 Agent、Agent 的记忆 |
| 问题 | stale memory, superseded decisions, knowledge update | 过时记忆、已被替换的决定、知识更新 |
| 发生过程 | handoff, memory consolidation, multi-session | 交接、整理记忆、多个会话 |
先组合两三类词,不必一次全塞进去。搜不到时换说法;搜到一篇接近的,就用它的术语、引用和后续引用继续找。搜索引擎和学术检索工具用来发现线索,正式写结论时回到论文原文、正式条目或作者代码。
检索目标是找到最可能推翻“我这个想法很新”判断的工作。一味搜自己创造的专有名词,容易得到虚假的空白。
比标题更重要的是这张比较表
Section titled “比标题更重要的是这张比较表”每篇最接近的工作只写下面五项:
- 它实际问什么?
- 它让系统经历了什么情况?
- 它怎样判定正确?
- 它已经给出了什么答案?
- 我的计划与它有什么可能影响答案的区别?
最后一项如果只是“我换成中文”“我换个模型”“我用 MCP”,先别急着叫创新。继续问:这个变化为什么可能改变原结论?实际使用者会因此做出什么不同选择?
可以把自己的想法暂时分为:已经覆盖;接近但条件不同;尚未找到明确答案。第三类只能写“在这些检索范围内尚未找到”,不能写成“世界上没人做过”。
日期怎么核查
Section titled “日期怎么核查”先记录最早公开的版本日期,再确认那一版是否已经包含你关心的方法或发现。正式发表时间、代码发布时间、论文首版时间可能不同。代码也可能比论文先公开。
私有笔记能帮助证明你自己的思考过程,但不能仅凭它判定你在公开学术记录中优先。反过来,独立想到后来才知道的已有工作,也不等于你在主观上抄袭;写作时仍须承认已有工作,不能把已知内容再声称为首次。
本指南引用近期仓库时,不用仓库活跃度或产品宣传证明方法有效,只用可见文件证明“这种做法已经公开出现”。
可以怎样让我帮你读
Section titled “可以怎样让我帮你读”一个有效请求是:
请读这篇原文,告诉我作者的问题、实验条件、评分方法和限制。每个关键判断指出对应章节。把作者直接报告的结果与你的解释分开;无法看到全文的地方明确说出来。
然后你自己随机检查两处原文,尤其是最影响你选题的那一处。AI 摘要可能把“某个数据集上”删成“普遍如此”,也可能把“未来工作”当作已完成结果。
第一次不追求数量。先把两三篇最接近的读到能口头讲明白。之后在投入大量实验前,围绕发现的具体问题做第二轮查新;写作前再检查新增论文。把日期和查询词保存在工作簿里即可。