08|四个课题怎么选
如果你现在最想研究 Coding Agent,我建议先选 A;如果最想尽快完成一次自己看得懂的测量,且已有能跑小模型的机器,先选 B。C 更贴近 AI 与安全的交叉,D 更贴近系统可靠性,后两项需要多花精力定义环境与正确结果。
这是按你的背景和首次实验的可检查程度作出的建议,不是按发表概率排名。
| 方案 | 具体问题 | 与你的连接 | 第一轮主要困难 |
|---|---|---|---|
| A:会更新的交接记录 | 自己更新笔记后,Agent 会不会在改代码时恢复废弃要求? | hmd、Zita、跨会话开发 | 分清写错、没读到与执行错 |
| B:本地翻译的关键错误 | 更省资源的配置是否损害数字、否定和条件表达? | MTOpt、本地小模型 | 人工判断译文与公平计时 |
| C:邮件来源是否丢失 | 转换或摘要后,外来邮件是否被当成用户指令? | InboxSaver、MCP、安全 | 限定攻击者权限,兼顾正常任务 |
| D:修复结果有没有验全 | 健康检查通过时,旧任务是否仍丢失或重复? | Uptimer、验收与可靠性 | 搭建可重置的故障环境 |
查新后的真实定位
Section titled “查新后的真实定位”四项都找到了高度相关的公开研究或工程实现。现在没有哪一项可以直接承诺“这是已经确认的新颖课题”。
A 已有过时事实、动态状态、自维护记忆和代码执行相关工作;B 已有翻译量化与切块性能研究;C 已有来源标记、邮件注入基准和强制权限策略;D 已有副作用、重启和积压任务验收。
因此每份方案都从“复现或诊断练习”起步,再给出可能值得继续的条件。这是认真查新后的结果。可实际开始,意味着你能够搭出一个可检查的实验;不意味着实验的未来结果已经替你保证了论文空间。
不必先拥有全部资源
Section titled “不必先拥有全部资源”A、C、D 可以用普通电脑跑本地小环境,再调用你选择的模型;不要求自己训练模型。模型调用可能产生费用,先用两三条估算。C 的动作全部模拟,D 的通知也只写本地记录。
B 可以没有 API 费用,但需要本地模型真正能装下并运行。尚未确认你的内存和设备,因此模型卡只提供候选;内存不足就缩小模型,暂时不做跨硬件比较。
所有数量都是预试建议。多种子、多模型或几百条样本,不是自动获得可靠结论的门槛数字;题目质量、独立性和评分正确性更先决。
第一轮共同的毕业标准
Section titled “第一轮共同的毕业标准”你能把一条任务从头走到尾:说明正确结果,检查模型实际做了什么,解释评分,找到对应日志,并用自己的话指出结论的局限。
达到这一点后,再问“怎样扩大、怎样形成论文”。如果还做不到,增加平台功能和运行数量通常不能补上这个缺口。
选择时读最感兴趣的两份,然后只启动一份。每份末尾都有第一次开工清单,也可以直接填研究工作簿。