先看证据
评审能力,不能只用像不像人来衡量
Sakana AI 在 TMLR 发表的《Beyond Imitation》,研究的是 LLM 能否辅助同行评审,重点不是生成一份像人类评语的报告,而是发现论文中的错误。为此,团队同时提出了 Multi-Layered Review(MLR)审稿系统和 Contradiction Benchmark 矛盾基准:前者尝试组织审稿过程,后者把“有没有抓到错误”变成可计分的问题。
这个转向值得技术负责人留意,因为评审文本看起来专业,并不代表模型核验过论文的核心论证。MLR 在植入矛盾的论文上显著领先基线,但在真实撤稿论文上的成绩低得多。两类结果放在一起,显示的不是一个简单的“AI 审稿已可用”结论,而是评测任务本身会怎样改变我们对系统能力的判断。
先建立论文脉络,再形成评语
MLR 使用三个 Claude 模型代理分工。Appendix Agent 由 Claude Haiku 3.5 驱动,提取附录中的实验与实现细节;Review Agent 使用 Claude Sonnet 4;另一个 Sonnet 4 文献综述代理会检索相关工作,但这一环节可以关闭。系统直接读取 PDF,因此图表和公式仍在审阅材料中,而不是先被压缩成一段纯文本摘要。
核心审稿流程分三遍:先写高层提纲,再细读并标记弱点、假设和缺口,最后综合各代理的输出,形成优点、缺点、问题、建议、评分和待办清单。这个顺序把“理解论文”放在“判断论文”之前。系统最多读取正文 10 页,使用现成 API 模型,不需要 GPU 或微调,材料给出的单次审阅成本约为 0.47 美元;因此它更像一个可部署的评审工作流,而非为某个专用模型打造的实验室方案。
基准测的是“矛盾离主张有多近”
Contradiction Benchmark 从 ACL、AISTATS、CVPR、ICML 2025 和 NeurIPS 2024 收集了 257 篇开放许可论文。研究团队先用 Gemini 2.5 Pro 为每篇论文建立知识图谱,连接主张、证据和方法;节点与“主张”的距离用于表示错误严重程度。随后 GPT-4.1 在不同距离上改写节点、植入矛盾,最终形成 1,164 个样本,再由 o3 对每份评审进行 10 次判分。
这种设计的优势是能区分“核心结论被推翻”和“细节出错”,也能比较系统发现不同严重程度问题的能力。MLR 使用四份评审时,抓到 73.43% 的核心主张错误,整体检出率为 40.95%;单份评审也抓到 60.79% 的核心错误。最佳基线 AgentReview 在核心错误上的检出率为 14.81%。论文还报告,基准对干净论文的准确率为 99.9%,对人工确认命中的敏感度为 86.8%,因此作者认为部分报告结果可能偏保守。
领先来自模型,也来自流程
论文的消融结果试图拆开两个因素:模型选择和系统设计。把 LLM-Review 中的 GPT-4.1 换成 Claude Sonnet 4,核心错误检出率从 14.56% 升至 35.40%;在单次审阅条件下,MLR 的流程设计又带来约 25 个百分点的提升。这说明表现不能只归功于“换了更强模型”,多轮阅读和代理分工本身也影响了结果。
但受控植入并不等于真实错误。面对 WithdrarXiv-Check 收录的 211 篇撤稿论文,MLR 在“相似”匹配上的成绩为 26.07%,在“精确”匹配上只有 16.11%;最强基线对应为 18.48% 和 9.00%。MLR 仍然领先,却远未达到矛盾基准上的检出水平。材料还指出,系统仍会受到隐藏提示注入影响,这也提醒部署者:审稿代理要处理的不只是论文本身,还有输入内容对模型行为的干扰。
适合做第二视角,不适合做最终裁决
MLR 与人类评审的关系也不是简单的替代。在 ICLR 2025 投稿上,它的预测分数与人类评分的 Pearson 相关系数为 0.586,人类评审之间的参考相关系数为 0.742;在 ICML 2025 上,AI Reviewer 的相关性略高于 MLR,分别为 0.439 和 0.429。更重要的是,MLR 偏重有效性和实验,人类则更看重表达清晰度与新颖性,二者关注重点并不相同。
对研究团队而言,较稳妥的用法是把 MLR 当作补充检查:让它指出论证链、实验细节或假设中的可疑之处,再由评审者核对原文,而不是把模型评分直接当成录用依据。对构建研究代理的团队,这篇研究给出的可执行判断是先明确要优化哪一种错误,再分别验证受控基准和真实材料上的表现。核心错误检出率很高,是系统值得进入下一轮评估的理由,不是把同行评审交给它的理由。