AREX Feed Article
OpenRouter 上线 Ling 3.0 Flash VL:124B MoE、原生图像与视频输入,由 Novita 提供推理服务
OpenRouter 在 中宣布,InclusionAI 的 Ling 3.0 Flash VL 已在其平台上线,由 Novita AI(@novita_labs)提供推理服务。推文给出的规格是:124B 总参数、每 token 激活 5.5B 的 MoE(混合专家)模型;在文本之外新增原生图像与视频输入和视觉 agent(智能体)能力;采用即时(instant)与推理(reasoning)混合模式,并支持工具调用。同一线程的补充称,VL 版是对 InclusionAI Ling 3.0 Flash 的延伸:语言性能更强,同时新增原生视觉感知与高级视觉 agent 能力。
这条上线的入口与限制都写在页面上:免费版模型 ID 为 inclusionai/ling-3.0-flash-vl:free,其 标价 $0、上下文窗口 262,144 token、单次最多输出 32,768 token,接受文本、图像和视频输入并返回文本,页面标注的发布日期为 9 月 10 日;免费端点有速率限制。
两条端点路线:Novita 的免费端点与 DeepInfra 的付费端点
推文点名的是 Novita,而 OpenRouter 上这个模型有两条端点路线。免费端点只由 Novita 一家提供,OpenRouter 在页面上说明会把请求直接转发过去、不做路由选择;而不带 :free 后缀的显示,付费端点由 DeepInfra 提供,上下文 131,072 token,标价每百万 token 输入 $0.06、输出 $0.18。两个端点都支持用 tools 和 tool_choice 做工具调用,也都提供 reasoning 参数;区别之一是免费端点不支持 response_format,JSON 输出不会被强制。
Novita 这边,已经把同一模型列为自己平台上的无服务器(serverless)多模态端点:模型 ID 同为 inclusionai/ling-3.0-flash-vl,规格与 OpenRouter 免费页一致,支持 reasoning 与 function calling,提供 chat/completions 和 Anthropic 兼容端点,默认档的目录配额为每分钟 30 次请求,定价同样标为 $0。
视觉如何进入推理链路:ViT、VideoRoPE 与 42 层混合骨干
据 InclusionAI 在 Hugging Face 发布的,VL 版继承 Ling 3.0 Flash 的语言、推理与长上下文能力,再把视觉接进整条链路:ViT 视觉编码器从图像和视频中抽取特征,再经两层 MLP 投影器与文本表示对齐;VideoRoPE 同时编码空间位置与时间顺序,让模型理解画面随时间的变化,覆盖事件定位、长视频问答、视频片段编辑这类任务;42 层混合骨干中,KDA 与 Gated MLA 两种注意力层按 5:1 交替,配合稀疏 MoE,在 124B 总容量下每 token 激活 5.5B 参数。
模型卡把这种设计概括为让视觉参与「理解、推理、规划、行动、验证」的完整过程,并把能力分成三个方向:理解复杂画面(如物体计数、复杂排版、图表与文档)、用视觉证据做多步推理与外部信息验证、理解网页与软件界面并把画面转成操作序列。思考模式默认开启,也可以在单次请求中关闭。
从文本版延伸:激活参数 5.1B 与 5.5B
InclusionAI 是 Ling 系列的开发方,称机构由 Ant Group 创立。文本版 给出的数字是 124B 总参数、5.1B 激活;VL 版把每 token 激活参数写为 5.5B,并沿用 5:1 交替的 KDA 与 Gated MLA 混合骨干。VL 的模型卡还称,它在 Artificial Analysis 智能指数 v4.1.1 上得 42 分,比 Ling-3.0-flash 的 38 分高 4 分。
自托管:模型卡给出的推荐配方是 4 张 141GB 级 GPU
想自己部署的话,模型卡也给了路径。目标为 256K 上下文(YaRN 扩展)时,SGLang 的推荐配方是 4 张 141GB 级 GPU(如 H20-3e、H200)或 4 卡 Blackwell 节点(B300、GB300);如果只有 80GB 卡(H100、H800),则要把张量并行扩到 8 路。模型卡同时给出了 vLLM 的安装与 4 卡启动示例。对不想碰硬件的团队,走 OpenRouter 或 Novita 的托管端点则不需要准备这类节点。
限时免费,以及这些数字的来源
上面提到的参数、上下文、定价与评测分数,分别来自 OpenRouter 的模型页、InclusionAI 的模型卡和 Novita 的博客,均为发布方口径。此外,Novita 在博客里把这份免费标注为限时,给生产团队的建议是:记录当前价格、加上预算护栏,并提前决定促销窗口结束后由哪个模型或队列接流量。