AREX Feed Article
AI 评测初创 Vals 以 4 亿美元估值完成 4000 万美元 A 轮融资,Andreessen Horowitz 领投
据 2026 年 9 月 19 日报道,2024 年创立、致力于独立 AI 模型评测的初创公司 Vals 已于 2026 年 8 月完成 4000 万美元 A 轮融资,由 Andreessen Horowitz 领投。这是该公司继 2025 年由 8VC 与 Bloomberg Beta 领投的种子轮之后的又一轮融资。
按 Vals 自己披露的口径,公司营收已达 2025 年全年水平的 8 倍,员工从年初的 8 人增至 25 人,并已启动一项向美国联邦机构提供模型评测的计划。
从种子轮到 A 轮:4 亿美元估值与投资人名单
Vals 于 2026 年 8 月 13 日在 X 平台发布,宣布以 4 亿美元估值完成 4000 万美元 A 轮:Andreessen Horowitz(a16z)领投,原有股东 8VC、Pear VC 与 Bloomberg Beta 继续参与,Hudson River Trading 和 NextLadder Ventures 作为新投资人加入。 在 8 月 18 日的报道中列出了相同条款。TechCrunch 补全了时间线:种子轮于 2025 年完成、由 8VC 和 Bloomberg Beta 领投,A 轮则在一段快速增长之后完成。
不公开的考卷:防止模型针对性训练
TechCrunch 指出,基准测试已成为 AI 公司验证模型能力、并在数字有利时宣传优势的行业惯例——好的基准几乎总能换来好的公关;但许多老牌基准发布已久,并非为衡量现代模型而设计,公司也已经摸清了应付它们的办法。不少基准系统的题目是公开的,公司可以拿测试题训练模型,TechCrunch 称这可以说是在考试中作弊。
Vals 的做法是不对外披露具体测试材料,避免模型被针对性训练。citybiz 的报道也提到,为降低模型直接在将来被测题目上训练的风险,Vals 将多数测试集保持私有。Krishnan 对 TechCrunch 回忆了创立公司的动因:「我们看到大量能力很强的新模型快速进入市场,而学术基准跟不上前沿的进展。」他又说:「过去,评测往往以非常抽象的方式衡量智能,比如模型掌握的信息够不够通过律考这类考试。」
Krishnan 在融资公告中写道,模型迭代的速度已经超过了社区造出新基准的能力:「模型在几个月内就能登顶旧基准,测试题泄漏进训练语料,新的评测又由造模型的公司自己做、自己跑。」
评的是实际工作:从法律、金融、编程到武装冲突法
Vals 评测的是具体行业的复杂任务,而非通用知识问答。Krishnan 说:「我们真正关注的是模型的实际影响——在每个领域里,它们能不能做出与人类同等质量的工作成果?」TechCrunch 介绍,公司目前在法律、金融与编程等行业特定工作上评测模型;citybiz 提到,其基准围绕律师、银行家、工程师与医生的真实工作搭建。
评测也不只看正面结果。Krishnan 表示,公司希望分析「如果这些模型在世界里放任自流,负面后果会是什么」。在测评范围上,他说:「我们有一个关于递归自我改进(recursive self-improvement)的基准,也在做心理健康、网络安全、生物安全(biosecurity),甚至武装冲突法(law of armed conflict)方面的工作,让模型理解如何适用《日内瓦公约》。」
其中一些方向已有具体产物。据 Vals 公告与 citybiz 报道:递归自我改进方向的 RSI Index 与 CoreWeave 合作开发;网络安全基准 ReverseEngBench 由 Vals 与哥伦比亚大学、塔夫茨大学、UC Berkeley 和 UCLA 共同搭建;编程评测产品 Vals Smith 已全面开放,用户可以从任意 GitHub 仓库生成自定义编程基准,注册即获 120 个免费额度。Vals 还在公告中称,其评测结果已被 OpenAI、Anthropic、Google、Meta 和 xAI 的模型卡引用。
付费送测:评测结果进入企业采购决策
Vals 的收入来自企业付费送测自家模型。Krishnan 把这套收入模式比作学生付费参加大学理事会(College Board)的 SAT 考试:有效的测量能帮助企业排查问题、持续改进。TechCrunch 写道,这类评测正在成为企业选购新 AI 模型时的关键决策依据。
Krishnan 在融资公告中给出的行业判断是:「AI 经济目前建立在自报成绩之上。模型发布时,分数来自开发它的那家公司。没有其他万亿级行业这样运作——金融有评级机构,医药有 FDA,而 AI 靠感觉和厂商自建基准。我们做 Vals,是要做这个行业缺失的独立评测层。」
客户翻倍、拟再招 10~15 人,评测走向联邦机构
Vals 在 8 月 13 日的公告中给出过同样的营收口径,并称客户数翻倍、团队在六个月内增至原来的三倍;citybiz 报道了相同数字,并补充公司同时发布了覆盖更多经济活动的 Vals Index 2.0。TechCrunch 还报道,公司计划再增加 10~15 人,并搬入明显更大的办公室。
政策方向上,TechCrunch 报道上述联邦评测项目于近期启动;citybiz 则称,Krishnan 已把公司业务扩展到 AI 政策领域,与美国商务部和国会议员合作,并向美国国家标准与技术研究院(NIST)提供基准数据。
Krishnan 的判断:AI 公司上市,评测写进公开文件
Krishnan 今年 25 岁,曾在 Palantir 实习,斯坦福读本科期间为微软和该校的人工智能实验室工作过。他对评测行业的未来给出了这样的预期:「AI 公司开始上市了。SpaceX 已经上市,Anthropic 预计今年晚些时候,我猜 OpenAI 也快了。我认为,随着 AI 模型成为经济的核心部分、被更广泛地使用,我们做的这类基准和评测将驱动模型的使用,并成为这些公司提交公开文件、谈论 AI 投资计划时的核心部分。」这是他本人的说法,TechCrunch 仅将其作为引语呈现,未对 SpaceX、Anthropic 或 OpenAI 的上市进度作独立核实。
上述营收、客户与团队规模数字均出自 Vals 一方披露,目前没有独立的财务数据予以印证。