它解决的不是“读不懂论文”,而是“跑不起来论文”

计算论文真正难以复用的地方,往往不在论文有没有写清楚,而在读者能否把代码、依赖、数据路径和运行顺序拼成一次成功执行。研究人员需要先找到代码仓库,再安装环境、处理版本问题、理解教程,最后判断输出是否与论文中的图表相符。这些工作并不产生新的科学发现,却决定了一种方法能不能离开原作者的机器。

Paper2Agent 试图把这段隐性的工程劳动显式化。斯坦福 Jiacheng Miao、James Zou 团队提出的系统接收论文和代码库,最终生成一个 Model Context Protocol 服务器。连接 Claude Code 或其他兼容 MCP 的代理后,用户可以用自然语言调用论文中的方法,而不是再次从 PDF 和仓库开始手工搭建流程。

关键变化不是“论文会聊天”。生成的服务器同时暴露三类东西:可以执行方法的工具,保存论文、数据集和图表的资源,以及规定多步调用顺序的提示。论文因此不再只是解释某个函数做什么,还能告诉代理什么时候调用它、如何组合它,以及什么输出可以作为参考。

Paper2Agent 的官方项目图:从论文方法到可调用的研究智能体。
Paper2Agent 的官方项目图:从论文方法到可调用的研究智能体。 查看原始材料 ↗

真正的系统设计:把教程变成一份可执行契约

Paper2Agent 的核心不是让一个大模型自由浏览代码,而是让多个子代理围绕一条受约束的流水线工作。中央编排器先定位并下载代码库,环境管理器建立隔离环境,教程扫描器寻找可用教程,教程执行器完整运行参考流程。之后,工具提取器把教程转成带参数的 MCP 工具,测试验证器再检查这些工具是否真的重现了参考输出。

验证门槛具体到文件、数字和图像。预期文件必须出现,数值结果的误差要控制在 3% 以内,图像则通过感知哈希比较,汉明距离必须低于 20。每个函数最多有 6 次修复机会,持续失败的工具不会被勉强放进最终服务器。这个设计牺牲了一部分覆盖率,却避免了把“看起来能调用”的函数伪装成可靠工具。

从工程角度看,这是一种重要的重构:教程不再只是给人看的说明,而成了工具生成和验收的参考实现。AlphaGenome 案例中,系统在约 45 分钟、14 美元的成本下生成了 22 个工具,且全部通过验证。对 300 个问题的测试中,代理准确率为 91.2%,高于直接使用 Claude Sonnet 4 的 80.3%;每个问题平均成本为 0.20 美元、耗时 1.6 分钟,对照方案分别为 0.38 美元和 4.3 分钟。

通过测试,不等于得出了正确的生物学结论

Paper2Agent 最容易被高估的地方,正是它最有说服力的地方:它能稳定复现教程。团队在 100 篇生物信息学论文中成功完成了 74 篇代理化,生成的 599 个候选工具中有 593 个通过验证。这个结果说明自动化流程已经接近批量工程化,但也说明仍有论文无法被顺利转换。现有材料没有解释那 26 篇失败论文分别卡在代码、环境、数据还是教程环节,因此不能把成功率直接外推到所有科研软件。

更重要的边界出现在新问题上。Paper2Agent 用 AlphaGenome 重新分析一个 LDL 胆固醇相关变异时,把 SORT1 排在更可能的因果基因位置,而原论文强调的是 CELSR2 和 PSRC1。代理可以调用正确的工具、完成计算并给出排序,却无法仅凭流程重演解决不同数据、模型假设和生物学解释之间的冲突。可执行性让分歧更容易被发现,却不会自动消除分歧。

因此,技术负责人应把 Paper2Agent 看成科研软件的可验证适配层,而不是自动通讯作者。适合优先接入的是有公开代码、明确教程、稳定输出和可比较参考结果的流程。部署时还需要把原始论文结论、代理在新数据上的输出和人工专家判断分开记录;只有这样,工具通过了回归测试,才不会被误读成新发现已经获得了科学证明。

Paper2Agent 项目的官方 MCP/Claude Code 使用示意。
Paper2Agent 项目的官方 MCP/Claude Code 使用示意。 查看原始材料 ↗