AREX Feed Article
蚂蚁百灵携中金发布 Ling-3.0-flash-Fin:权重下周开源、OpenRouter 限免一个月
8 月 28 日,蚂蚁集团旗下百灵大模型(蚂蚁百灵)携手中金公司及行业专家发布金融增强模型 Ling-3.0-flash-Fin。据,该模型延续 Ling-3.0-flash 的模型架构和长上下文能力,保持 124B 总参数、5.1B 激活参数的配置;援引百灵大模型官方消息确认,这是蚂蚁百灵首个金融增强模型。
官方同时给出三项承诺:模型权重将于下周正式开源;与中金公司联合打造的金融评测基准 FinFIRST 将于近期开源;模型将在 OpenRouter 提供为期一个月的限时免费 API。文中涉及的评测数据均为公司自报口径,未经独立复测。
Ling-3.0-flash-Fin 在 FinFIRST 基准上的得分,模型名在表中高亮(图源:IT之家报道配图)
与中金共建的 FinFIRST:从结果、过程、证据三个层面打分
FinFIRST(Financial Information Retrieval, Sourcing and Traceability)由蚂蚁集团与中金公司联合打造。IT之家报道称,该基准由 50 余名金融专业人士深度参与设计,从结果、过程和证据三个层面评估模型:答案是否准确完整、研究口径与计算是否合理、关键数据与结论能否回溯至权威原始资料。
官方表示,Ling-3.0-flash-Fin 在 FinFIRST 上的综合得分已超过一些大尺寸旗舰模型,和同等尺寸模型相比竞争力突出,尤其擅长优先定位官方、一手及高可信资料。以上结论均为官方口径,尚无独立复测。
除 FinFIRST 外,模型还在 FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等金融智能体基准上做了测试,覆盖金融信息检索、投资研究分析、金融长程任务执行、估值建模、银行业务应用等场景,官方称与多款通用模型相比展现出较强竞争力。
品玩配发的对比图显示,对比对象包括 DeepSeek-V4-Pro-0813、GLM-5.2、Kimi-K3、MiniMax-M3 等 8 款模型;图例标注的激活参数从 21B 到 104B、总参数最高 2.8T,均高于 Ling-3.0-flash-Fin 的 5.1B/124B。9 张子图覆盖 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench 与 τ³-Banking 等基准。
九宫格对比图中,Ling-3.0-flash-Fin(124B/5.1B)与 8 款模型逐项对比(图源:品玩报道配图)
124B/5.1B 的金融专项:预训练、后训练与工具调用
Ling-3.0-flash-Fin 的做法是在通用基座上叠加金融专项训练:通过金融语料持续预训练、领域后训练和工具使用优化,强化对年报、财务工作簿、多份研究材料等复杂金融内容的处理能力,同时兼顾部署效率。据品玩援引的百灵大模型官方消息,模型聚焦信息检索、研究推理、估值建模和研报撰写四大核心能力。
金融能力强化之后,通用能力没有退让。官方称,模型在 AA Intelligence Index v4.1.1 上的得分由 38 分提升至 41 分,实现了通用能力与专业能力的协同提升。
AA Intelligence Index 榜单截图,Ling-3.0-flash-Fin 得分 41(图源:IT之家报道配图)
OpenRouter 已挂出免费入口:262K 上下文、托管方 NovitaAI
想立刻试用的人不用等开源。给出的体验地址是 OpenRouter 上的 inclusionai/ling-3.0-flash-fin:free。显示模型当前价格为零,上下文窗口 262,144 token,单次最多输出 32,768 token,支持函数调用,托管方为 NovitaAI。
页面上把模型描述为"来自 InclusionAI"。自称由蚂蚁集团创立,其 将自己描述为蚂蚁集团 AGI 项目的家园;上一代基座 Ling-3.0-flash 的权重仓库也挂在 名下,与本次 Fin 变体的 OpenRouter 账号同一署名。中文报道里的"蚂蚁百灵"与页面上的 InclusionAI,指向同一发布方。
三周前基座刚开源,Fin 变体接踵而来
Ling-3.0-flash-Fin 不是从零开始的新模型。8 月 7 日,蚂蚁集团旗下百灵大模型刚宣布新一代原生混合推理模型 Ling-3.0-flash 正式开源,采用同样的 124B 总参数、5.1B 激活参数 MoE 架构,同时提供 FP8、FP4、INT4 等多个版本,以及 API 调用、单机私有化、高性能部署三种落地方式。据,MXFP4 与 INT4 版本可在单台 NVIDIA DGX Spark 上完成端到端推理,官方称在指定 GPU 测试配置下平均输出速率突破 1100 tokens/s,Artificial Analysis 榜单上输出速度 353 tokens/s,AA Intelligence Index 加权平均调用成本约 0.04 美元。
Fin 变体沿用了这套架构,把训练重心转向金融场景,权重在下周开源,距基座开源仅三周。
下周权重落地,自报的分数才有复测机会
截至发稿,读者能立即核验的,是 OpenRouter 上已经上线的免费接口;权重与 FinFIRST 的开源时间仍停留在"下周"与"近期"的承诺层面。官方自报的 41 分、FinFIRST 上的排名,以及"超过一些大尺寸旗舰模型"的说法,都要等权重落地、基准开源之后,才有机会被独立复测。