跳转到内容

08|四个课题怎么选

如果你现在最想研究 Coding Agent,我建议先选 A;如果最想尽快完成一次自己看得懂的测量,且已有能跑小模型的机器,先选 B。C 更贴近 AI 与安全的交叉,D 更贴近系统可靠性,后两项需要多花精力定义环境与正确结果。

这是按你的背景和首次实验的可检查程度作出的建议,不是按发表概率排名。

方案 具体问题 与你的连接 第一轮主要困难
A:会更新的交接记录 自己更新笔记后,Agent 会不会在改代码时恢复废弃要求? hmd、Zita、跨会话开发 分清写错、没读到与执行错
B:本地翻译的关键错误 更省资源的配置是否损害数字、否定和条件表达? MTOpt、本地小模型 人工判断译文与公平计时
C:邮件来源是否丢失 转换或摘要后,外来邮件是否被当成用户指令? InboxSaver、MCP、安全 限定攻击者权限,兼顾正常任务
D:修复结果有没有验全 健康检查通过时,旧任务是否仍丢失或重复? Uptimer、验收与可靠性 搭建可重置的故障环境

四项都找到了高度相关的公开研究或工程实现。现在没有哪一项可以直接承诺“这是已经确认的新颖课题”。

A 已有过时事实、动态状态、自维护记忆和代码执行相关工作;B 已有翻译量化与切块性能研究;C 已有来源标记、邮件注入基准和强制权限策略;D 已有副作用、重启和积压任务验收。

因此每份方案都从“复现或诊断练习”起步,再给出可能值得继续的条件。这是认真查新后的结果。可实际开始,意味着你能够搭出一个可检查的实验;不意味着实验的未来结果已经替你保证了论文空间。

A、C、D 可以用普通电脑跑本地小环境,再调用你选择的模型;不要求自己训练模型。模型调用可能产生费用,先用两三条估算。C 的动作全部模拟,D 的通知也只写本地记录。

B 可以没有 API 费用,但需要本地模型真正能装下并运行。尚未确认你的内存和设备,因此模型卡只提供候选;内存不足就缩小模型,暂时不做跨硬件比较。

所有数量都是预试建议。多种子、多模型或几百条样本,不是自动获得可靠结论的门槛数字;题目质量、独立性和评分正确性更先决。

你能把一条任务从头走到尾:说明正确结果,检查模型实际做了什么,解释评分,找到对应日志,并用自己的话指出结论的局限。

达到这一点后,再问“怎样扩大、怎样形成论文”。如果还做不到,增加平台功能和运行数量通常不能补上这个缺口。

选择时读最感兴趣的两份,然后只启动一份。每份末尾都有第一次开工清单,也可以直接填研究工作簿