AREX Feed Article
Qwen3.8-Max 法律研究排名从 22 跃至第 4,得分翻倍距前三仅差 0.48 个百分点
8 月 12 日,阿里 Qwen 官方 X 账号,旗舰模型 Qwen3.8-Max 在 Vals AI 的 (法律研究基准)上从第 22 名升至第 4 名,得分从 25.48% 翻至 47.60%,成为该榜单上排名最高的中国模型。"扎实进展,"Qwen 团队在帖文中写道。
一个测美国法的基准,32 个模型同台
Legal Research Bench 由独立评测机构 Vals AI 维护,专门评估 AI 代理在美国联邦与州法律框架下执行多步骤法律研究的能力。每道题由执业律师撰写并互审,要求模型使用判例检索、网络搜索和文档调取等工具,完成从法规解释到跨司法管辖区综合的全流程任务。
基准覆盖行政监管、商业、民事诉讼、宪法/民权、刑事、家庭法、医疗和移民八大执业领域。Vals AI 采用严格的全通过(all-pass)评分:答案必须满足评分标准中的每一项要求才算正确,缺一条判零分。Vals AI 对此的解释是——法律工作中,一份看似正确但遗漏关键要素的回答,可能比完全错误的回答更危险。
Vals AI 于 2026 年 7 月 31 日更新的公开快照收录了 32 个模型。前三名全部来自美国:Anthropic 的 Claude Opus 5 以 55.29% 领跑,Claude Fable 5 以 49.52% 居次,OpenAI 的 GPT-5.6 Sol 以 48.08% 列第三。
25.48% → 47.60%:接近翻倍,但排名放大进步
Qwen3.8-Max 的前代模型 Qwen 3.7 Max 在该基准上仅得 25.48%,排名第 22。Qwen3.8-Max 将成绩提升至 47.60%,排名第 4,与第 3 名 GPT-5.6 Sol(48.08%)仅差 0.48 个百分点。
这意味着 Qwen3.8-Max 超越了此前排名最高的中国模型 Kimi K3(Moonshot AI,44.23%),以及 Meta 的 Muse Spark 1.2(43.75%)、Anthropic 的 Claude Opus 4.8(43.75%)和 Claude Sonnet 5(41.83%)。
但排名本身放大了进步的视觉冲击。X 用户 在原帖下回复:"得分跃升是真实的,从 25.5 到 47.6 接近翻倍。不过排名框架做了更多工作——距第一名仍有近 8 分之差,榜单越往上排名越密。"另一用户 则直言:"前三名和后面的差距太大了——这个基准本身就不太公平。"
Vals AI 的基准说明也印证了"顶部压缩"现象:Claude Opus 5 在部分通过(partial-credit)评分下达到 90.58%,但全通过标准下仅为 55.29%。所有模型的回答都远长于标准答案——标准答案平均 536 词,最啰嗦的模型输出约 2300 词——但准确度并不与长度成正比。
从执业领域看,医疗和行政监管是得分最高的领域,家庭法和移民法对所有模型都是硬骨头,平均全通过率分别只有 13.8% 和 23.2%。跨司法管辖区的法源协调(reconciliation)被 Vals AI 标记为最可靠的失败模式:每处理一道需要综合多法域或多判例的题,各模型得分下降 6 到 17 个百分点。
2.4 万亿参数的一个月:从 Agentic Index 到法律研究
Legal Research Bench 是 Qwen3.8-Max 发布以来拿下的又一高调基准成绩。该模型于 8 月初以 2.4 万亿参数规模推出,阿里承诺后续开放完整权重和一款 27B 小模型的权重。此前模型已在 Artificial Analysis 的 Agentic Index 上登顶,发布当日阿里巴巴港股应声上涨, 将其列为一周中国 AI 头条。
但法律研究的排名跃升意义不同:这是 Qwen3.8-Max 首次在专业法律领域亮相,且面对的是一份以美国法律为核心、由美国律师出题和审核的基准。从第 22 名升至第 4 名,表明模型在需要多步骤推理、判例检索和跨法规综合的任务上出现了实质性的能力提升。
47.60% 的全通过率也意味着,即使是最好的模型,每两道法律研究题中就有一道无法完全答对。Vals AI 将"协调冲突法源"标记为基准中最一致的短板——所有模型在需要跨司法管辖区或跨判例体系综合的题目上,表现都明显低于不需要此类协调的题目。对于一家中国公司开发的、面向美国法律体系的模型而言,这个方向或许是下一阶段最值得关注的改进空间。