AREX Feed Article
伦敦实验室 Inherent Labs 发布 27B「AI 科学家」Faraday,自报论文复现任务胜过 Claude Opus 4.8 与 GPT-5.5
8 月 14 日,伦敦实验室 ,宣布推出新模型 Faraday:一个 27B 参数的「AI Scientist」,经长程强化学习(long-horizon RL)训练,据其自述在「复现研究论文」任务上超过 Claude Opus 4.8 与 GPT-5.5;同天放出的还有 《Training AI Scientists to Replicate Research》和。
论文给出的核心数字是:在 Inherent 自建的 Replica 评测空间里,Faraday 在 73% 的分布内(in-distribution)机器学习任务、60% 的留出(held-out)AI-for-science 任务上得分高于两个基线;测试集平均分比 Claude Opus 4.8 高 6%,比 GPT-5.5 高 8%。所有分数来自公司自制的 rubric 裁判,属于自报基准,尚未经过独立验证。
60 分钟、七分之一块 H200:复现一张被删掉的论文图
Replica 是 Faraday 的训练场,也是它的评测空间。每条任务要求 agent 复现一篇机器学习或 AI-for-science 论文里的一张结果图,前提是看不到原图、算力和时间都受限。初始套件共 310 个任务,来自 100 篇 1990 至 2026 年间的论文。
具体条件写在论文里:agent 拿到的是原图被不可逆删除的论文 PDF 和原图注;它有 60 分钟、一张 H200 GPU 的七分之一 MIG 切片、一个预装研究库的 containerd 容器和网络访问权。242 个训练任务取自机器学习论文,68 个测试任务取自 2012 至 2026 年的 AI-for-science 论文。
任务由 Gemini 2.5 Pro 自动生成,三个视觉语言阶段分别完成扫描结果图与图注、定位和删除原图。每篇论文产出 1 至 13 个任务,中位数 2 个,全部经过人工逐个检查过滤。
60 分钟往往跑不完原论文的完整实验,任务提示会要求 agent 交出「忠实于原论文的缩小版实验」。论文把这一点当作任务空间的关键特征:复现天然欠定义(underspecified),agent 必须自己决定放弃什么、保留什么。博客的解释更直白:论文只写作者发现可行的路径,不写引向它的阴性结果,agent 要补回纸上没有的「99% 的汗水」。
不可验证的复现,交给 rubric 裁判打分
论文复现没有标准答案可以核对。Inherent 的说法是,完美复刻原图不等于复现成功,还要看实验设计、科学操守和资源利用,最终靠的是「研究品味(research taste)」。为此公司设计了一个 rubric 裁判:Claude Opus 4.7 从一段简短元提示词出发,为每个任务自动生成专属评分标准,生成时看不到原图,避免过度拟合坐标轴、格式等细节。
rubric 覆盖五个维度:复现图与原图的视觉匹配、是否支撑论文主张、实验是否真正实现并检验了论文所述、算力预算的使用、科学诚信(按指令行事、不取巧)。打分者是 Codex GPT-5.5:它拿到整个容器、代码库、git 历史和完整交互记录,有 10 分钟时间检查,再逐维度给出 0 到 1 分。
针对长程 RL 常见的奖励不稳定,训练时做了两处修改:每个 rollout 对裁判采样三次取均值;让裁判输出逐轮权重,把信用分配到具体回合。
Faraday 以 Qwen3.6-27B 为底座,用带逐轮信用的 GRPO 变体在 Replica 训练集上后训练,LoRA rank 128、128K 上下文窗口、学习率 6×10⁻⁶,每步 10 个任务、各 8 条 rollout。
裁判的可靠性经过一项人工研究:20 名来自顶尖高校的在读或已毕业博士给出 117 组排序,每人每任务 £150。按 Kendall τ 衡量,rubric 裁判两次独立打分的一致性为 0.66,基线裁判 0.46,两个人类之间只有 0.30;与人类排序的一致性,rubric 裁判 0.19,基线裁判 0.15。
27B 参数指挥 5T 参数的 Codex
Faraday 的核心设定是把自己当指挥者,把 GPT-5.5 Codex 当工具,像人类科学家使用 coding agent 一样。论文估算 GPT-5.5 约有 5T 参数,博客称 Faraday 指挥着一个大几个数量级的模型,并且让复现表现变得更好。
实现上,一个 wrapper 脚本非交互地运行 Codex CLI,Faraday 通过 shell 工具调用它,拿到带时间戳的执行转写;它可以并行开多个 Codex、续接上次会话、自设截止时间。训练大部分用 GPT-5.4-mini,最后阶段与评测换成 GPT-5.5,测试时还能适应更强的 coding agent。
基线配置是:Claude Opus 4.8 在 Claude Code harness、GPT-5.5 在 Codex harness 中运行,thinking effort 都设为 extra high,另测了 GLM-5.2。每个 agent 在每个任务上跑 8 条 rollout 取均值,由同一个 rubric 裁判打分。论文发现前沿 agent 并未打满这个任务空间。
结果是 Faraday 在 73% 的分布内任务、60% 的留出任务上领先,测试集平均分高 6% 和 8%;针对 Codex 优化提示词只能略微缩小差距。
定性分析显示它更像人类科学家:实现主张背后的机制而非硬编码输出、忠实缩小实验、避开讨好分数的捷径。博客补充,它在每个论文类别上都更忠实,meta-learning、结构生物学与材料科学优势最突出,且受较新论文的拖累更小。
公司还给出两个更进一步的实验:Faraday 在测试时发现新洞察,不需要专门的演化 harness、没有测试时奖励,用公司的话说是「学会了内在地看重新发现」;团队制作了 ,Faraday 在上面同样超过 GPT-5.5,公司称之为在不知情的情况下创新。
五月末才公开的实验室,借了法拉第的名字
Inherent 是一家很年轻的实验室,,自称「从零设计、构建能发现新知识的 AI agent 的实验室」,账号简介是「Living within the experiment」。
同一条推文披露,公司刚完成 5000 万美元种子轮,由 Index Ventures 和 Radical Ventures 领投,NVentures(Nvidia 的风险投资部门)、@buildexante、Metaplanet、Macroscopic、Mythos Ventures、Charlie Songhurst 等参与,个人投资人包括 @chalfs、@jluan、@dwarkesh_sp、@Thom_Wolf、@j_foerst、@maxjaderberg,顾问为 @matthewclifford。公司注册为 Public Benefit Corporation,总部在伦敦。
Faraday 论文的 11 位作者全部署名为 Inherent:共同一作 Damon Falck 与 Samer Sabri,基础设施负责人 Kaloyan Aleksiev,共同通讯作者 Louis Kirsch 与 Edward Hughes。
模型的名字有出处。官方博客开头写道:1821 年,Richard Phillips 请 Michael Faraday 为电磁学写一篇综述,Faraday 几乎没受过正式教育,却是有名的实验家。他决定亲手复现前人的结果,在皇家研究院(Royal Institution)的地下实验室里发现通电导线会绕磁铁转动,日记里写下「Very satisfactory」——他发明了电动机。Inherent 表示自己正是受这段历史启发:从复现出发,走向创新。
社区先问:裁判和人工评分者差多远?
这条消息传播量不小:截至 8 月 15 日中午,首条推文累计约 21.3 万次查看、1321 个赞、176 次转发。几则点名细节的回复,不约而同把矛头对准评测标尺。
(美国佛罗里达的 AI 应用团队账号)认可复现作为评测目标,因为它接近有 ground truth,但提醒「在不可验证的任务上,是裁判设定了标尺」;它最想看到的下一个数字,是「裁判与人工验证者在他们意见分歧的案例上的一致率」。
(自述由 Mobile Lead 转型的 AI builder,哥本哈根)问:如果 Opus 和 GPT 被用同样方式 harness 起来,差距还剩多少?「27B 模型打败前沿实验室,通常意味着评测奖励的是一项窄技能,而不是它更聪明。」
论文对基线的交代部分回应了这一疑问:两个基线分别在 Claude Code 与 Codex harness 里以 extra high thinking 运行。
自称有 Imbue Catalyst 工作经历的旧金山开发者 认为方向对:「研究品味非常稀缺,就我在 Imbue Catalyst 的经验,前沿 LLM 在这方面仍然欠缺。」
ML 工程师、AI 方向博士生 则盯着一个论文没给的数据:「不统计隐蔽的人工干预,复现分数没有意义。Faraday 的干预率是多少?」
AI 从业者 (自述在 AudaciousHQ 做 AI,曾任 GoCodeoAI 的 CTO)要求按学科拆解:「复现一篇统计密集的 ML 论文和复现一篇湿实验生物论文是完全不同的技能,一个平均分可能掩盖它在某类上很强、在另一类上没用。」
物理学出身的创业者、前 McKinsey 顾问 写道,27B 拿下前沿任务是正在反复发生的事,「能力在数周内沿价格曲线下渗」,真正不下渗的是分发、专有数据与信任。
论文自己也承认,rubric 裁判与人类在若干任务上仍有分歧,留作未来改进。
在独立第三方复现出现之前,Faraday 的胜绩只存在于 Inherent 自己设定的任务空间与裁判尺度上;裁判与人类在争议案例上的一致率、Faraday 的人工干预率、按学科拆分的成绩,三样都是社区最先问到的,也都还没有公开答案。