AREX Feed Article
Inherent 结束隐身:Index 领投 5000 万美元,发布 27B「AI Scientist」Faraday
8 月 14 日,伦敦 AI 实验室 Inherent 发布第一个公开成果 Faraday,一个 27B 参数的「AI Scientist」agent。,Faraday 经过 long-horizon RL 训练,「在复制研究论文的任务上超过 Claude Opus 4.8 和 GPT-5.5」。一个多小时后,报道英国和欧洲科技的通讯作者 ,称这家公司由 DeepMind 校友创立,「刚刚结束隐身」,拿到 Index 领投的 5000 万美元种子轮,结尾连发两个感叹:「This is VERY COOL. London AI is flying right now.」
结束隐身和融资并非这周才发生:、就已报道 Inherent 以 5000 万美元种子轮结束隐身,。8 月 14 日真正的新事件是 Faraday:官宣推文、与 (编号 2608.13331,论文标注日期 2026 年 8 月 14 日)在同一天上线。
310 个任务里,27B 的 Faraday 赢过两家旗舰
论文的核心主张集中在复制研究上。作者建了一个名为 Replica 的任务集:310 个「复制论文图表」任务,来自 1990 年到 2026 年的 100 篇机器学习与 AI for Science 论文,覆盖自然语言处理、材料科学、天气预报等领域。
基线并不弱:Claude Opus 4.8 跑在 Claude Code harness 里,GPT-5.5 跑在 Codex harness 里,thinking effort 都设为 extra high。论文称,按自建的 rubric 评委打分,Faraday 在 73% 的分布内 ML 任务和 60% 的留出 AI-for-science 任务上超过两个基线;测试集平均分比 Claude 高 6%、比 Codex 高 8%。对 Codex 的 prompt 做优化,也只能略微缩小差距。人类专家在评委判定 Faraday 占优的那些 rollout 上也站在 Faraday 一边。优势最明显的是 meta-learning、结构生物学和材料科学;对较新的论文它也表现更稳,论文的说法是「对预训练时没见过的工作,它同样能应用科学技能」。
需要说明口径:所有「超过」都是论文自己报告的 rubric 分数。论文内部把 Claude Opus 4.8 简称 Claude、把 GPT-5.5 简称 Codex。
把原图涂掉,让 agent 把研究重做一遍
任务的具体形态是:agent 拿到的是被删去目标图表的论文 PDF,要在有限时间和算力预算内把那张图复现出来,全程看不到原图。Replica 用 Gemini 2.5 Pro 自动把每篇论文的结果图「涂掉」,一张被涂掉的图就是一个任务。agent 的工作环境是一台容器:任务提示、涂改过的 PDF、Codex 二进制、常用科研库、一块 H200 GPU 的 1/7 MIG 切片,以及互联网访问。
论文只记录成功的那部分,复现要求 agent「把没写进论文的 99% 汗水找回来」,这正是开放式研究所需要的假设驱动探索。论文开篇把这项工作与「复制危机」挂钩,并点名机器学习领域的问题尤其严重。研究页面还预告了课程设计:可以继续拿走论文里除单张图之外的更多信息、进一步收紧资源。
低噪声评委,和 27B 指挥 5T 的组合
长程 RL 在无法验证的领域里训练,难点是奖励信号。Inherent 的配方:先用 Claude Opus 4.7 加一个 meta-rubric,为每个任务生成专属评分细则;再用基于 Codex 的评委多采样打分,配合逐轮 credit assignment。论文称这套自动 rubric 评委比普通 LLM 评委更一致、噪声更低,并做了人类研究校验。Faraday 的底座是 Qwen3.6-27B,在 Replica 训练集上用 GRPO 的一个逐轮信用分配变体 post-train 得到。
Faraday 还把 GPT-5.5 Codex 当工具用,就像人类研究者用编码 agent。一个 27B 的模型指挥论文援引估计约 5 万亿参数的模型,还比大模型单独干得更好。论文称,Faraday 训练时用的是 GPT-5.4-mini,测试时换到更强的 GPT-5.5 Codex 也能适配。与既有的 AI Scientist agent 不同,Faraday 不需要手写进化 harness,也没有 test-time reward,论文的说法是它「学会从内在看重发现」。定性分析里,Faraday 更像人类科学家:实现论文声称的机制而不是硬编码输出、忠实于原论文规模地缩小实验、避开那些会美化自己结果的捷径。
结束隐身发生在 5 月,不是这周
Seb Johnson 的推文说 Inherent「刚刚结束隐身」。按 TNW 的报道,这个时间点要早约两个半月:Inherent 在 5 月 27 日(周三)结束隐身。TNW 5 月 30 日发稿时写道「emerged from stealth on Wednesday」,并给出融资明细:5000 万美元种子轮,Index Ventures 与 Radical Ventures 共同领投(co-led),Nvidia 旗下 NVentures、Ex/Ante、Metaplanet、Macroscopic Ventures、Mythos Ventures 参投。
领投方的表述略有出入。Sifted 写的是 Index 领投、Radical 参投;Index 官方博客的说法是「lead their $50m seed round, alongside Radical Ventures」。无论哪种口径,Index 都是主要出资方。TNW 称这是 2026 年欧洲规模最大的 AI「从隐身到公开」融资之一。
Index 合伙人 Danny Rimer 在融资报道中给出投资逻辑:现有 AI 擅长回答问题,但「搞不清哪些问题值得问——正是这种开放式好奇心催生了青霉素、微波炉和 GPU」。Index 博客则写道,AI-native science「会和过去 400 年的科学方法完全不同:更凌乱、更难读,但可能带来非凡的产出」。Inherent 注册为 public benefit corporation,即公益公司,需要在股东回报之外考虑社会影响。
四位创始人:DeepMind、白宫,和一位合唱指挥
创始团队四人。Tantum Collins 与 Edward Hughes 在 DeepMind 时合作研究 cooperative AI,Collins 之后去了白宫处理 AI 政策事务;Hughes 还有一个平行职业:职业合唱指挥,Index 博客说他这段经历反过来滋养了他在 AI 系统文化演化方面的研究。Louis Kirsch 同样出身 DeepMind,其 X 简介写着「PhD @SchmidhuberAI」;Kaloyan Aleksiev 来自 Reka AI 与微软,在 Faraday 论文里标注为 infrastructure lead。四人都出现在论文作者名单中,论文第一作者是 Damon Falck 与 Samer Sabri,Kirsch 和 Hughes 是共同最后作者。Entrepreneur First 联合创始人、前英国政府 AI 顾问 Matt Clifford CBE 加入担任顾问,他当时在 X 上写道:「Teddy、Ed、Kally 和 Louis 是我见过的最令人印象深刻、最有想法、最有雄心的创始人之一。」Index 博客还提到,早期天使投资人与员工里有技术 AI 安全和 AI 民主应用背景的人。
共同创始人 Kirsch 在发布当天说:「我们对第一个公开的 AI scientist 成果非常兴奋。At Inherent,我们在训练具备科学智能的 agent。」
「为什么比 Opus 4.8,而不是 Opus 5?」
Seb Johnson 的推文截至 8 月 15 日约有 395 次点赞、2.9 万次浏览;Inherent 官宣推文约有 1340 次点赞、21.7 万次浏览。回复里很快有人追问版本问题。格拉斯哥用户 Thomas Clark 在回复里:「But we are on opus 5 so why compare to opus 4.8?」论文列出的基线就是 Claude Opus 4.8 和 GPT-5.5,两个模型的 thinking effort 均设为 extra high。
其他提问集中在泛化。Meta FAIR 的研究工程师 Tom Mann,复制很有意思,但他更想知道 Faraday 在真实研究任务上表现如何。自称 Medium 上关注者最多的 AI 分析师 Ignacio de Gregorio结果和论文都很酷,但「主要问题是复制这个不寻常的训练目标如何泛化」。也有直接泼冷水的:Axiom 创始人、伦敦 AI 社区组织者 Gerard Sans「那主要是炒作,大量证据表明前沿模型有 RL、规模或更好的 harness 都解决不了的严重问题」。
Inherent 在研究页面给出的下一步是:调查这套方法如何推进 scalable oversight、减轻 reward hacking,并让 Faraday 的改进在公司内部「复合」起来。论文为复制课程预告的最后一级是:把图涂得更狠、把资源收得更紧,甚至把论文想象出来,让同一个 Faraday 模型在不知情的情况下创新。