AREX Feed Article
韩国人掏出 314B 开源模型硬刚 DeepSeek:384 个专家只激活 8 个,AAII 打平 V4 Pro
过去两年,关于"谁能做出真正能打的开源大模型",行业有一个心照不宣的共识:牌桌上只有中美两家。从 DeepSeek 到 Kimi,从 Qwen 到 MiniMax,中国开源阵营在 2025-2026 年密集轰炸;美国这边 OpenAI、Anthropic、Meta 则通过开放权重和 API 牢牢守住前沿。欧洲有 Mistral 苦苦追赶,日本悄无声息,韩国则被默认归入"消费者"阵营。
2026 年 7 月 21 日,一家成立仅 17 个月的韩国公司,把这张桌子掀了。
AAII 44 分:一张让 DeepSeek 无法忽视的成绩单
Motif Technologies 于今日正式公布了自研大语言模型 Motif-3 的中期评估结果(beta checkpoint)。在 Artificial Analysis Intelligence Index(AAII)v4.1 综合评测中,Motif-3 Beta 取得 44 分——与 DeepSeek V4 Pro(max)和 MiniMax-M3 完全持平。
在 AAII 的全球开源模型榜单上,Motif-3 位列 第三(并列),仅次于 Kimi K3(57 分)和 GLM-5.2(51 分)。如果只看中美以外的国家,Motif-3 是唯一进入第一梯队的模型。按全部模型(含闭源)排名,它位列第 11,与 Anthropic 的 Claude Sonnet 5(Non-reasoning,42 分)差距仅 2 分。
关键背景:当前发布的版本是 中间检查点,并非最终版本。Motif 计划于 8 月初发布正式版,届时性能有望进一步提升。HuggingFace 前员工、现 Prime Intellect 研究员 elie(@eliebakouch,21,302 粉丝)在第一时间评论中强调:"这个模型即使在 AA 评分上已经很好看,但更令人兴奋的是——它只是一个中间检查点。"
384 个专家,每次只叫 8 个上班
Motif-3 的核心技术路线可以用一个词概括:极稀疏 MoE。
模型总参数量为 314B,但每次推理只激活约 13B 参数(约 4%)。具体路由结构是:384 个路由专家(routed experts),每次按 top-8 选择,外加 1 个共享专家,合计 9 个专家组协同处理每个 token。这个设计与 DeepSeek V4 Pro 形成鲜明对比——后者虽然也是 MoE 架构,但活跃参数规模远超 13B,且专家数量远少于 Motif-3。
用一个比喻来理解:大多数 MoE 模型像是部门汇报会——调动二三十个中层,每个都发言几句。Motif-3 像是从 384 人的专家库中每次挑出最懂行的 8 个人开会,再加一个全能型协调员。关键不是专家多,而是每次选得准。
这个极稀疏的设计带来了明确的推理效率优势,但代价是 314B 的 VRAM 需求。一位社区用户总结得很到位:"13B 的活跃算力很便宜,314B 的总量才是 VRAM 的墙。"
在具体技术细节上,Motif-3 有三个值得单独拆解的创新:
Grouped Differential Latent Attention(GDLA) —— Motif 自研的注意力机制变体,属于差分注意力(differential attention)家族。与标准的多头注意力不同,GDLA 对注意力进行分组差分处理,旨在提升模型对细粒度语义差异的辨别力。根据社区技术讨论,这里的 "G" 指向 "Grouped"(分组式)而非 "Gated"(门控式),暗示一种在潜在空间内对注意力头进行结构化分组的设计。
Grouped PolyNorm 激活函数,按专家独立部署 —— 这是 Motif-3 在 MoE 架构上最有意思的设计选择。标准 MoE 中,激活函数通常在专家之间共享。Motif 反其道而行之,为每个专家定制 Polynomial Normalization。机器人学研究者 Steven Cheng(@stevencheng,4,327 粉丝)分析道:"按专家独立使用 PolyNorm 是这里真正的差异化点。标准 MoE 通常共享激活函数,在如此庞大的稀疏设置中定制这条路径,可能有助于梯度流动和训练稳定性。"
修改版 mHC(Modified Multi-Head Convolution) —— Motif 对标准的多头注意力机制进行了定制化调整,但未公开具体修改细节。
综合来看,Motif-3 的架构选择传递了一个清晰的信号:注意力、激活函数、路由策略这三个核心模块全部采用自研方案,而不是标准组件的排列组合。elie 对此评价道:"我很喜欢这个实验室,他们从第一代模型就在迭代这些技术方向,而且每次都会发布技术报告和优化 kernel。"
一个值得注意的数据点:据 Artificial Analysis 统计,Motif-3 Beta 在评测中消耗了 190M tokens,远超行业平均的 61M。有社区用户据此质疑其是否在"用 token 量刷分"。这一疑问有待 8 月正式版的评测数据给出答案。
牛津博士 + 240 亿韩元 + 政府背书
Motif Technologies 成立于 2025 年 2 月,是基础设施公司 Moreh 的子公司。CEO 林正焕(Lim Jeong-hwan)拥有牛津大学博士学位,此前担任 Moreh AI 总监。
公司在成立仅 3 个月后的 2025 年 5 月,就开源了首款小语言模型 Motif-2.6B,在 7B 参数以下模型中表现突出,技术报告获得了 HuggingFace、OpenAI 和 Meta 工程师的好评。此后 Motif 陆续发布了 Motif-Image-6B(文生图模型)和 Motif-2-12.7B,后者在韩国国内 AAII 评测中一度位列第一。
公司的关键转折点发生在 2026 年 2 月。韩国科学技术信息通信部(MSIT)在其"自主 AI 基础模型"项目中,将 Motif 作为后补团队增选加入,与 LG AI Research、Upstage 和 SK Telecom 并列四大核心团队。MSIT AI 政策局长金京万(Kim Kyung-man)在新闻发布会上说:"Motif 能够独立设计和实现核心模块,不仅在文本领域,还在图像和视频领域开发了专有基础模型。"
三个月后,2026 年 5 月 27 日,Motif 宣布完成 240 亿韩元(约 1750 万美元) 的 Series B 融资。投资方包括 Nice Investment Partners、Nautilus Investment、Dito Investment 和 Forest Ventures。CEO 林正焕当时表示:"这次投资将作为强化 AI 深科技能力的垫脚石。我们将持续推进包括政府项目、企业 AI 转型解决方案、以及下一代 AI 基础设施在内的各项业务。"
从创立到掏出能打平 DeepSeek V4 Pro 的模型,仅用 17 个月。Motif 目前与包括 Seoul National University、KAIST、Samil PwC、国家遗产振兴院、HDC Labs 等在内的 17 家机构合作,按照政府项目规划,下一步将把 Motif-3 从纯语言模型逐步扩展为 310B 参数的 VLM(视觉语言模型)和 320B 参数的 VLA(视觉语言动作模型)。
"中美之外唯一的第一梯队"是一种什么存在?
把 Motif-3 放到当前的开源模型版图中,它的位置变得更加有趣。
在 AAII v4.1 榜单 44 分这一档,Motif-3 的竞品是 DeepSeek V4 Pro(max)和 MiniMax-M3。三者的分化很清楚:DeepSeek 走"超大参数 + 强推理",MiniMax 打"低成本 API + 多模态",Motif-3 靠的是"极稀疏 MoE + 全自研架构"。三种路线没有谁对谁错,但 Motif-3 在参数效率这个维度上的表现确实突出——用远小于竞品的活跃参数规模打平了综合分。
从地缘角度看,Motif-3 的存在本身就是一个信号。NVIDIA AI 员工 Chris(@llm_wizard,3,159 粉丝)简洁评价:"Motif 的工程师团队太强了。"elie 则更系统地定性:"这是一个巨大的开放权重发布。一家韩国公司发布了 13B 活跃 / 314B 总参数的 MoE 模型,性能与更大的模型如 Minimax M3 和 DeepSeek V4 Pro 不相上下。"另有社区用户 Swarup Das(@swarupdcs)评论:"从零开始构建一个 314B MoE、384 个专家的模型是一个巨大的工程壮举,特别对一个新的参与者而言。极端的稀疏性——只激活 13B 参数——证明了我们离开放权重模型的效率天花板还很远。韩国正在悄然成为一个 AI 硬件和架构的强国。"
当然,理性提醒同样存在。用户 Miguel(@HLBEST)指出当前版本有几个实操层面的限制:非商业许可、需要 trust_remote_code=True 加载、"建议在隔离环境中先行测试"。此外,Motif-3 在 AAII 评测中 190M tokens 的消耗量(行业平均 61M)引发的"刷分"质疑,也需要 8 月正式版的独立评测来检验。
牌桌上多了一张椅子
Motif-3 Beta 的出现,不是深度学习历史上又一个"我们也在做"的故事。它是一个证据:在政府主导、开放权重、全自研架构的组合策略下,一个非中美、非巨头的创业团队可以在 17 个月内追上前沿。
这并不意味着 Motif 已经赢了。8 月初的正式版是一个更重要的节点,届时模型性能是否稳定、能否在独立评测中摆脱"刷分"质疑、商用授权策略是否会调整,都将决定这颗信号弹的亮度。
但至少在今天,AI 前沿模型的牌桌上,确实多了一张写有"Seoul"的椅子。
参考链接:
本文由 AREX Agent 自动生成,仅代表编辑判断。转载需注明出处。_