AREX Feed Article
信通院 MCP 评测:StartLux-27B 39.25 分居第二、导航第一
8月31日报道,中国信息通信研究院(中国信通院)人工智能研究所近日公布可信AI大模型基准测试——MCP专项测试检验报告。上海原点星辉科学技术有限公司(StartLux)的本地大模型 StartLux-V1.0-27B-Preview 综合得分 39.25,总体排名第二,以约1个百分点之差仅次于1.6T参数的 DeepSeek-V4-Pro。
该模型在位置导航任务中排名第一,新华网以"StartLux-27B打平万亿参数模型"为题,称这是我国本地大模型首次国家级测评。同日独立报道同一结果,补充了新华网报道中没有的基座细节:该模型以 Qwen3.6-27B 为基座、用"AI 训练 AI"(Auto Research)方式做后训练,比同尺寸的 Qwen3.6-27B 高出 5.34 分。
7 项检验、693 个任务:MCP 专项测什么
这份测试依据可信AI大模型基准测试——MCP专项测试,涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务及综合评估,共7项检验项目。新华网报道称,测试重点考察模型在真实工作场景中的工具调用、多步规划和任务完成能力。
AIbase 配发的 MCP-UNIVERSE 榜单图给出了更细的口径:测试始于8月3日,以当日市场上各大模型的最新版本为测试样本,为保证公正性,信通院进行了三轮完整测试取平均值。六类任务合计693道题:网络搜索165、地点导航135、金融分析120、浏览器自动化117、仓库管理99、3D设计57。
参测模型共6个——除 DeepSeek-V4-Pro、DeepSeek-V4-Flash-0731、Step-3.7-Flash、Qwen3.6-27B 和 StartLux-V1.0-27B-Preview 外,还有4B参数的 AgentCPM-Explore。
39.25 分背后:导航第一,金融与浏览器并列第一
综合榜上,DeepSeek-V4-Pro 以 40.55%(281/693)居首,StartLux 39.25%(272/693)紧随其后,DeepSeek-V4-Flash-0731 38.24%(265/693)排第三,Qwen3.6-27B 33.91%(235/693)、Step-3.7-Flash 29.29%(203/693)、AgentCPM-Explore 8.08%(56/693)依次在后。693道题里,StartLux 答对272道,比榜首少9道。
StartLux 的领先集中在三个单项。位置导航 33.33%(45/135),超过 DeepSeek-V4-Pro 的 32.59%(44/135),独占第一;金融分析 68.33%(82/120)与浏览器自动化 28.21%(33/117),均与 DeepSeek-V4-Pro 并列第一。新华网的说法是:"浏览器自动化、金融分析等任务中也与1.6T参数的DeepSeek-V4-Pro并列第一或独占第一"。
其余任务仍由 DeepSeek 系占优。网页搜索中 DeepSeek-V4-Flash-0731 以 56.36%(93/165)领先,StartLux 42.42%(70/165);仓库管理 Flash-0731 27.27%(27/99)最高,StartLux 17.17%(17/99);3D 设计 DeepSeek-V4-Pro 与 Flash-0731 并列 45.61%(26/57),StartLux 43.86%(25/57)。这个"第二"的成分是导航一项独占第一、金融与浏览器两项并列第一,其余任务与头部模型的差距仍然存在。
以 Qwen3.6-27B 为基座,"AI 训练 AI"做后训练
新华网报道没有涉及训练方式,这部分细节来自 AIbase 一家:StartLux 以 Qwen3.6-27B 为基座进行后训练定向增强,团队独立设计了新的、多维度的、可验证、可扩展的模型优化与升级技术;训练中采用"AI 训练 AI"(Auto Research)方式自主开展训练实验,并通过反馈持续优化策略。AIbase 称,这是国内首个以该方式进行后训练的本地智能体模型。
AIbase 还提到,团队正在推进后续训练,并对扩散语言模型等新架构进行研究优化。基座与训练方法目前只见于 AIbase 的报道,新华网同期报道未提及。
27B 打平 1.6T:本地模型从参数竞赛里另开一条线
榜单图标注了参测模型的架构:DeepSeek-V4-Pro 是总参数1.6T、激活49B的模型,StartLux-V1.0-27B-Preview 是27B的 Dense 模型。27B稠密模型在综合分上逼近激活49B的1.6T模型,是这轮测试里最直观的反差。
两类模型的差别在部署位置上。新华网解释,与传统云端大模型相比,本地模型把AI推理能力部署在用户个人设备上,数据无需上传云端,在隐私保护、降低使用成本以及扩展本地数据应用边界等方面具有现实意义。StartLux CTO 郭权玮博士介绍,StartLux-V1.0-27B-Preview 可在消费级个人电脑上运行,普通消费者无需昂贵的专业设备即可使用具备较强能力的AI。
产业语境也在向本地侧移动。新华网援引业内观点称,大模型产业正从技术能力展示转向应用价值验证,超大规模基础模型与更高效、更易部署的本地模型并行发展:不久前 Meta 发布30B本地模型 Muse Glimmer,Google 推出 Gemma 4 31B,StartLux 的测试结果被视为这一趋势的产业侧验证。AIbase 的判断更直接:基础模型能力跨过实用门槛后,过去两年以参数规模为中心的军备竞赛进入同质化阶段,企业用户更关心实际解决问题能力、数据安全与可控成本,Google、Meta、NVIDIA 都在加速布局30B级本地模型。
新华网还援引全球最大开源AI模型平台2026年春季报告称,中国研发的开源模型下载量已占全球总量的41%,累计下载量突破100亿次,全球主流大模型调用榜单前六名全部来自中国团队。新华网在报道结尾写道:"当竞争从'谁的模型更大'延伸到'谁能解决更多真实问题',模型效率、数据安全、部署成本和应用需求将成为新的关键变量。"
年内推出首款本地产品,权重尚未公开
StartLux 的下一步已经明确:计划年内推出第一代本地智能解决方案,用户可直接下载使用,无需复杂的部署和调试。AIbase 的报道与之一致,并补充该模型目前已能在消费级 PC 上运行。
两家报道都没有给出模型权重下载渠道,也没有附上模型卡。39.25 分的成绩、Qwen3.6-27B 基座与"AI 训练 AI"的后训练方式,目前均来自两家媒体报道;独立验证要等 StartLux 把权重放出来。
参考链接
- 新华网《我国本地大模型首次国家级测评出炉 StartLux-27B打平万亿参数模型》:
- AIbase《Domestic Dark Horse Local Large Model StartLux-27B Faces DeepSeek Head-On, Pioneering a New Era of Edge AI》: