AREX Feed Article
Vals AI 完成 4000 万美元 A 轮融资:a16z 领投,估值 4 亿美元
8 月 13 日,AI 模型评测公司 Vals AI 在官方 X 账号完成 4000 万美元 A 轮融资,估值 4 亿美元。本轮由 a16z 领投,8VC、Pear VC、Bloomberg Beta 继续参投,HRT Ventures 与 Next Ladder 为新进投资方。
同一则公告还宣布三件事:Vals Smith 全面上市,任何 GitHub 仓库都能生成定制编程评测;与 CoreWeave 合作发布 RSI Index,并推出网络安全评测基准 ReverseEngBench;官网重建并上线 Vals Index 2.0。公司称收入已是 2025 全年的 8 倍,客户数半年翻倍、团队半年增至三倍。
完整声明在同日发布的博客《Series A: Always a Higher Peak》,CryptoBriefing 也在公告发出约 20 分钟后了同样的数字。
4000 万美元换 4 亿美元估值
投资人名单出自 Vals 自己的公告:a16z 领投,现有股东 8VC、Pear VC、Bloomberg Beta 追加,新股东 HRT Ventures、Next Ladder 入场。
Pear VC ,它最早在 pre-seed 阶段投资 Vals,当时创始人 Rayan Krishnan 与 Langston Nashold 带着公司加入 PearX S23,这一轮选择继续加注。
据 Dani Grant 与 Katie Kirsch 署名的 ,本轮之后 Vals 累计融资超过 4500 万美元。律所 Wilson Sonsini 也,由 Rob Broderick 带队的团队担任本轮交易的法律顾问。
博客还称,"一些最大的企业 AI 部署"正在用 Vals 决定构建在哪个模型上,并把产品与前沿对标。
AI 有 vibes,没有评级机构
Vals 给这轮融资的叙事:模型发布时,分数由造模型的公司自己报。"Finance has ratings agencies. Medicine has the FDA. AI has vibes and vendor benchmarks",公告写道,Vals 要做这个行业缺失的独立评测层(independent evaluation layer)。
博客作者、联合创始人 Rayan Krishnan 从 hill-climbing(爬坡)讲起:AI 每次进步都靠定义可测量的目标、找差距、再优化,一座山接一座山。
问题在于模型开发的速度超过了业界造山的速度:旧基准几个月就被登顶,测试集混进训练语料,新基准还常由模型公司自己出题。
博客的判断是:AI 已经是万亿美元市场,却没有金融、医疗那样的独立测量机构。Vals 的解法是私有测试集加行业机构合作,让模型去做律师、银行家、工程师、医生的工作。
公司称其结果被 OpenAI、Anthropic、Google、Meta、xAI 的模型卡引用,并支持过美国商务部和国会议员的 AI 政策工作。同批发布的还有重建的官网和 Vals Index 2.0:按各行业占美国 GDP 的比重聚合金融、编程、法律任务成绩,覆盖的经济部门更多,。
120 个免费积分,把 GitHub 仓库变成考卷
Vals Smith 的用法:接入任意公开或私有 GitHub 仓库即可生成定制编程评测,新用户有 120 个免费积分。
出题逻辑写在上:系统挑出仓库中代表真实工程任务的合并 PR,把每个 PR 转成一道带 issue 描述、隐藏测试和可复现环境的题目。
依赖脆弱基础设施或行为不清的候选会被淘汰,题目必须满足"隐藏测试在原始修复前失败、修复后通过"才能入榜。评测时模型只拿到 issue 和修复前的代码,必须让隐藏测试通过且不让既有行为回归,最终得分是能完成的真实仓库任务占比。
Vals 已经在 linux、next.js、Valkyrie 等公开仓库发布示例基准,各 15 个模型参测;产品页在 "Trusted by" 下列出 Vercel、Exa、Fireworks AI、Harvey 等公司 logo,并承诺"你的代码不会离开你的控制"。
五个任务、三款模型、一张 1900 美元账单
RSI Index 测的是 recursive self-improvement:模型能不能自己完成"研究出下一个模型"的工作。Vals 与 CoreWeave 合作发布这一指数,模型被要求用 marimo notebook 记录所有实验轨迹,方便下一轮迭代接着跑。
marimo 是已被 CoreWeave 收购的开源 AI-native Python notebook,其官方账号与 Vals 合作,增长负责人 Shyam Mani 双方在 RSI Index 上已经合作了几个月。
目前三款模型参测:Claude Opus 5、GPT-5.6 Sol、Kimi K3,各自跑在 Claude Code、Codex、Kimi Code 的长期自主模式里。任务覆盖压缩、语言模型训练、Parameter Golf、harness 工程和 post-training 五类,预算从 12 到 30 小时不等。
给出三点结论:没有模型达到人类前沿水平;最好成绩能超过中级人类纪录,追不上顶级纪录;Claude Opus 5 领先五项任务中的四项,也是最贵的研究员,API 开销约 1900 美元,GPT 约 1620 美元,Kimi 约 590 美元。
Vals 还在接受自定义 harness 提交,任何认为自己能让模型研究得更好的团队都可以申请接入。
保护一加,逆向成功率砍半
ReverseEngBench 是 Vals 与 Columbia、Tufts、UC Berkeley、UCLA 合作的二进制逆向评测,衡量 agent 能否在没有源码的情况下弄清真实二进制的行为。Vals 在 8 月 12 日的里以 SRE Bench 为名介绍它,13 日的融资公告中称它为 ReverseEngBench。
按的说法,这套题投入了超过 5000 小时领域专家工时的 clean-room 开发:19 个内部程序,平均 16915.8 行代码,覆盖网络协议、固件、游戏、文件格式恢复和恶意软件五个领域。
配套 27000 行的反分析保护套件,十多种保护中一半以上没有公开实现,由此生成 262 个无污染实例、1572 个可确定性验证的任务。所有 agent 共用同一套 Ghidra、radare2、GDB、angr 工具箱,但反汇编几乎出现在每条轨迹里,工具不是瓶颈。
当前五个参测模型里,GPT-5.6 Sol 在没有保护时能解出固件域 83%、协议域 66% 的实例,套上内部反分析保护后成功率整体约减半;按语言看 C 最容易,Rust 最难。论文标题是《The Next Challenge for Agentic Cybersecurity》,arXiv 预印本标注为 forthcoming。
投资人管它叫"AI 的评级机构"
据 ,新股东 HRT Ventures 的全称是 Hudson River Trading Ventures。
Hudson River Trading(HRT)的 AI 负责人 Iain Dunning ,量化的核心就是测量并理解当下,"Vals is the 'rating agency' for AI"(Vals 是 AI 的评级机构);他还提到联合创始人 Nashold 曾是 HRT 的实习生。
Bloomberg Beta 的 James Cham ,让 AI 行业既被问责又繁荣的办法,是有一个独立、可信的评测者。a16z 基础设施与 AI 方向合伙人 Yoko 的是:Vals 测试模型"在人们真正想让它们做的工作"上的表现,会继续定义前沿。新股东 NextLadder 的更直白:驱动 NavTech 工具的模型需要独立评测者,这正是 Vals。
公告排出的路线图还有:心理健康评测只是第一步,环境、军事、生物安全方向的评测将陆续跟进,目前都还是承诺。眼下最具体的动作是招聘:a16z Build 的通讯已经挂出 Head of Research 一职,职责是从法务合同审查、承保到医疗,给 AI 性能定测量标准。