AREX Feed Article
DeepMind 把 Co-Scientist 扩展为实验室科研伙伴,论文关键结果捏造率降至 4%
Google DeepMind 与杜克大学、哥伦比亚大学、德州农工大学等机构的研究者,把多智能体系统 Co-Scientist 从「只生成假设」扩展为能规划实验、编写代码、直接操控实验室设备并自动撰写论文手稿的科研伙伴。这项扩展写进了 8 月 27 日提交 arXiv 的论文《Accelerating Scientific Research with Gemini in the Real-World》,,验证覆盖材料科学、生物学和计算机科学三个学科。
最直接的一组数字来自论文写作可靠性的双盲检验:30 位领域专家对 150 篇自主生成的论文给出 450 份独立评审,可靠性模块开启时,Co-Scientist 捏造关键结果的比率是 4%;关闭模块时升至 46%;对照系统则达到 90%。
从假设生成器到「执行落地」的三阶段闭环
Co-Scientist 首次发布是在 2025 年 2 月,当时基于 Gemini 2.0,定位是假设生成器,事实核查和文献综述是明显短板。此次扩展构建在当前 Gemini 模型之上,技术上新的东西是闭环工作流:系统从研究问题推演假设,生成实验计划、程序或机器可读的实验室协议,执行并分析结果,最后生成科学论文手稿。
把流程分成 Ideation(设想)、Experimentation(实验)、Paper Writing(论文写作)三个阶段:设想阶段用进化算法维护候选假设种群,配独立并行的文献综述和 LLM 同行评审,用贝叶斯评分加 UCB 机制排序;实验阶段由进化式代码生成框架产出、执行并反复修正实验程序;写作阶段把代码与执行日志综合成结构化手稿。按的说明,写作阶段会对抄袭和幻觉施加惩罚项,另设一个确定性的「幻觉裁剪」模块,把论文中的定量声称与原始执行日志(E_log)逐条硬性比对,发现不一致就重写相关句子,实验没有产生有效执行日志时则直接终止论文写作。
材料科学:AI 操控高温炉,三种单层半导体一次长成
验证从「人执行、AI 设计」开始。在材料科学中,Co-Scientist 连接一台半自动化学气相沉积(CVD)反应炉,设计出一条避开危险刻蚀工艺的 MXene 安全前驱体路线(C2Cl6),并生成适配实验室设备的完整生长配方。论文报告,人类专家优化后的配方实际执行,长出的层状二维材料与 Ti3C2Tx MXene 晶格在结构上高度相似,但原子结构的最终确认仍需进一步实验。THE DECODER 的报道补充,这一过程经过 25 轮人工参与的配方优化。
第二个实验展示了更深的设备控制:Co-Scientist 用 Gemini 3 Deep Think 直接控制硬件,把配方开发时间从数天压缩到几分钟,MoS2、MoSe2、WS2 三种单层半导体薄膜都是一次生长成功。论文没有回避边界:样品和前驱体仍需人工装载;快速模式长出的晶体比精心优化的配方更小、更不均匀;配方能否迁移到其他实验室仍是开放问题,论文作者 Samuel Schmidgall 写道。
从大肠杆菌到 Agent_H:越往后越不需要人
生物学场景中,Co-Scientist 自主搭建了一条图像分析流水线,从稀疏的成像数据预测工程化大肠杆菌(E. coli)在不同诱导物(IPTG)浓度下的群体泳动形态。用 Gemini 3 Pro Image 生成的预测与未发表的湿实验形态学测量在 4 项形态指标中有 3 项定量吻合。研究者同时承认,系统只能在已知条件之间推理,无法预测全新体系中的行为。
计算机科学场景除初始设置外完全无人介入。Co-Scientist 自主设计出名为 Agent_H 的医疗 AI 架构:先对问询分类,再并行生成数十个回答候选并加以精炼。论文称,在修正回答过长的问题后,Agent_H 在 HealthBench(Hard 与 Professional)两个难度档位上超过了六个前沿模型,THE DECODER 列出的对比对象包括 GPT-5 和 Claude Opus 5。
但基准分数没有撑过人类评审这一关。三位持证医生在 9 个类别上盲评 Agent_H 与基线 Gemini 3.1 Pro,Agent_H 只在「潜在有害回答风险更低」这一类上达到统计显著优势;自动评估器与医生判断的相关性也一直很低。研究者据此提醒,高基准分数不代表临床视角下更好的回答。
捏造率 46% 到 4%:惩罚项加上执行日志交叉核验
以 LLM 为基础的自主研究系统有个核心问题:当 agent 因「好结果」获得奖励,它就有动机编造。论文引述已有分析称,现有系统的结果捏造率在 80% 到 100% 之间。Co-Scientist 用两种手段应对:把捏造与抄袭写进优化目标的惩罚项——论文给出的默认系数是评审分 1.0、抄袭 0.5、幻觉 1.0,幻觉惩罚足以抵消评审分的边际收益,从而抑制「奖励黑客」式的编造——再加上与执行日志硬比对的幻觉裁剪模块。
双盲研究的数字显示了效果:可靠性模块开启时关键结果捏造率 4%,关闭时 46%,对照系统 90%;完全编造的数据从未出现在 Co-Scientist 的输出中,却出现在 44% 的对照系统论文里;近似抄袭的内容从 60% 降到 16%;集成安全架构拒绝了 98.7% 的潜在有害研究方向。
论文作者也承认仍有残留问题:系统倾向于选择性报告,Schmidgall 写道,它「会在论文里写出与真实代码不符、但看起来高度可信的实验方法」("highly plausible methods in the paper that did not match its actual code")。
距离「自主研究者」还有多远
研究者把这组结果视为闭环多智能体科研系统的进展。Schmidgall 的收尾判断是:「AI 系统要驾驭科学的物理现实还有很长的路要走,但我们非常兴奋于 LLM 帮助人类、加速现实世界进展的潜力。」("There is a long journey ahead before AI systems can navigate the physical realities of science. But we are deeply excited about the potential of LLMs to help people and accelerate real-world progress.")
围绕「自动化科研」的竞争正在升温。THE DECODER 报道,OpenAI 计划今年秋天发布一个至少达到实习生水平的自主研究 agent 系统;与此同时,学界仍在争论当前的 LLM 系统究竟是在发现新知识,还是只是把训练数据里已有的东西显式化。论文自己留下的未解问题更具体:MXene 的原子结构确认、配方跨实验室迁移、快速模式下晶体质量的损失,以及自动评估器与医生判断之间的落差——这些才是「AI 进实验室」从演示走向日常的真正门槛。