AREX Feed Article
蚂蚁集团开源金融增强模型 Ling-3.0-flash-Fin,FinFIRST 金融搜索基准同步发布
蚂蚁集团 AGI 项目旗下的语言模型系列 Ant Ling,于北京时间 9 月 3 日 23 时 25 分通过官方 X 账号(@AntLingAGI)宣布开源 Ling-3.0-flash-Fin,并同步发布金融搜索智能体基准 FinFIRST。 按官方表述,前者是“面向真实工作流的金融增强模型”(finance-enhanced model for real-world workflows),后者是“由专家构建、用于评测金融搜索智能体的基准”;帖文把两次发布归为同一个目标:“让金融 AI 更可及、更可验证”(making financial AI more accessible and verifiable)。
随后的两条帖文给出落点:模型权重与 FinFIRST 数据集分别上架 Hugging Face 与 ModelScope, 并披露 FinFIRST 由蚂蚁集团构建、中金公司(CICC)投行团队提供专业支持,V1 含 123 道专家任务、701 条原子评分标准、12,300 分评分权重。这距离 ,约一周。以下性能与评测数据均出自蚂蚁官方模型卡与数据集文档,属官方口径。
Ant Ling 家族的首个金融增强版本
据 Hugging Face 介绍,Ling-3.0-flash-Fin 是“Ant Ling 家族首个金融增强模型”,在 Ling-3.0-flash 基础上用高质量金融数据继续训练,由蚂蚁集团与头部金融机构、领域专家共同开发。模型为 MoE(混合专家)架构:124B 总参数,每个 token 激活 5.1B 参数,256K 上下文窗口,参数规模与此前预告一致。
能力的官方表述落在一组具体工作流上:在长报告、研究材料与复杂工作簿上做信息检索、研究、估值建模与报告撰写。开源权重意味着团队可以私有化部署,把模型接到搜索、Python、数据库和电子表格上,再适配自己的金融工作流。当前发布的是 BF16 检查点,与 Ling-3.0-flash 同架构,可直接复用 SGLang 和 vLLM 运行时;模型默认开启思考模式,官方建议采样参数 temperature=1.0、top_p=0.95、top_k=20。
官方自报的评测覆盖九个基准:FinFIRST、FinSearchComp Verified、FinCRAFT、FinanceAgent v1.1/v2、APEX-Agents、SpreadsheetBench v1/v2 与 τ³-Banking,称其“与同规模以及规模大得多的通用模型相比具有竞争力”,强项在信源选择与工具密集的金融任务。预告当天,Ant Ling 还给出一个通用能力数字:AA Intelligence Index v4.1.1 上得 41 分,高于基础版 flash 的 38 分。 模型卡公布的评测图把比较对象列在一起:GLM-5.2、Kimi-K3、DeepSeek-V4-Pro-0813、MiniMax-M3、Hy3,以及 GPT-5.6-Sol、Claude-Opus-5、Gemini-3.7-Flash。
123 道任务、701 条标准:FinFIRST 拆开打分
FinFIRST 的评分对象是研究过程,不只是最终答案。开宗明义:金融研究的答案必须由权威、及时、可验证的证据支撑,智能体还要核对主体、报告期、币种、单位、定义和数据版本,因此基准“用原子评分标准评估完整研究过程,而不是只比对最终答案”。
结构上,每个标准答案被拆成可独立判分的原子标准,按三个维度归组:原始信息获取、信源核验、计算与作答。这样既给有效的中间步骤计分,也能把失败定位到具体环节。V1 的 123 道题由 50 多名金融专业人士出题并核验,覆盖中、美等市场,研究对象包括公司、行业、区域经济与金融工具,全部使用公开信源。数据集里中文题 74 道(60.2%)、英文题 49 道;超过 80% 的题目含多个关联子问题,61.8% 需要显式计算,32.5% 需要多个信源,75.6% 不预设信源。
打开数据集能看到任务的形态。第 1 题要求按 2025 年 7 月 31 日收盘价、以最小买入单位分别买入中芯国际(688981.SH)与比亚迪(002594.SZ),算共需多少人民币;评分标准把过程拆成 6 条:查出两家公司的最小买入单位(各 20 分)、查出当日收盘价(各 20 分)、算出并写对最终金额 28,424 元(20 分),任何一条漏掉都拿不全分。质量控制同样严格:候选任务要经过价值与范围评审、独立重解、交叉验证与评分审计,最终接受率只有 9.78%。数据集以 Apache-2.0 协议发布,官方帖还附了技术报告 PDF。
官方披露的评估协议是:15 个模型配置在相同的 ReAct 式智能体框架下、用同一组 Web Search、Visit、Python 工具评测,GLM-5.1 担任自动裁判;在 8 名金融专家标注与裁定的 50 个随机样本上,裁判与人工标签在原子标准层面的 Cohen's κ 为 0.816。公布的结果里,GPT-5.6-Sol 的 Strict Pass(全部原子标准通过才算过)最高,为 71.54%;Claude-Opus-5 的 Loose Pass 达 87.61%,Strict Pass 却只有 69.11%。在参评的开源权重模型中,Ling-3.0-flash-Fin 的“无证据正确率”(答案对但证据不全的比例,UCR)最低,信源核验分最高。全部参评模型的 1,150 个答案正确样本中,201 个证据不完整,UCR 为 17.48%。
密集开源一个月,Fin 分两步放出
Ling-3.0-flash-Fin 之前,Ant Ling 的开源已经排了整整一个月(时间均为北京时间,按帖文时间戳换算):8 月 4 日晚开放 Ling-3.0-flash 的 BF16 与 FP8 权重,;8 月 7 日凌晨发布 7.9B 参数、1.3B 激活的 Ling-3.0-tiny,;8 月 19 日晚开源 6 个未经后训练的 base checkpoint,;8 月 22 日凌晨放出针对 flash 的 DSpark 草稿模型。
Fin 的开源没有随模型展示同时进行:8 月 28 日凌晨的预告帖先亮出参数与评测对象,权重到 9 月 3 日深夜才公开。
发布一个半小时后,SGLang 宣布 Day-0 支持
开源约 1.5 小时后,(LLM 推理与服务引擎项目)即转发官宣,称“Day-0 支持已在 SGLang 上线”,并复述模型定位:为研究、检索、估值建模与报告准备调优,“在 FinFIRST、FinanceAgent、APEX-Agents、SpreadsheetBench 和 τ³-Banking 上有竞争力的结果”。(高吞吐推理引擎项目)在北京时间 9 月 4 日上午道贺:“开源模型和专家构建的基准,是迈向更可及、更可验证的金融 AI 的重要一步”,并表示期待这些工作流“在 vLLM 上规模化运行”。
量化一侧跟进得更快。本地推理引擎 在发布约 6 小时后贴出 ,并演示在本地解析一份 .xlsx 费用报表、生成按月汇总的 Markdown 表格。曾被 Ant Ling 公开致谢、在单台 DGX Spark 上连测一周 Ling-3.0-flash 的本地大模型开发者 则评论:“还是那颗我在自己桌面上跑的 124B MoE、5.1B 激活,只是为金融工作流调过……开源权重和开源评测一次放出,我们希望更多这样的动作。” 截至 9 月 4 日发稿,官宣帖浏览量已超过 13.5 万。
官方标出的边界:估值结论须专业复核
模型卡把边界写在“局限与未来工作”一节:作为家族首个金融增强发布,模型“仍需在复杂、长程工作流中进一步验证”;关键假设、估值结果和投资结论需要专业人士复核,不构成投资建议。
同一节还写明下一站:未来发布将探索更大规模的金融增强模型,以进一步改进复杂推理与长程任务执行。
参考链接
注:链接标题中的日期为帖文自带的 X 平台时间戳(UTC);正文中的时间已换算为北京时间。