AREX Feed Article
OpenRouter 独家上线 Inception Mercury 2.5 Preview,官方称 1,107 tokens/s
OpenRouter 官方 X 账号于 UTC 时间 9 月 1 日 14:21(北京时间 22:21),Inception 的 Mercury 2.5 Preview 已在其平台独家上线,并称这是「最快的推理 LLM」:通过并行 token 生成(parallel token generation)达到 1,107 tokens/s,支持可调推理强度(tunable reasoning)、并行工具调用(parallel tool calls)与 schema 对齐 JSON(schema-aligned JSON)输出,面向延迟敏感型工作负载。
32 分钟后,转发确认「Mercury 2.5 Preview 已在 OpenRouter 独家上线」,并宣布 80% off 促销价(相当于原价两折)。显示,该模型发布于 8 月 31 日。上述性能与质量表述均为发布方口径。
65,536 完成 token 与单一供应商托管
模型页列出的规格包括:260,000 token 上下文窗口、最多 65,536 个完成 token;输入、输出价格分别为每百万 token $0.04 与 $0.15(原价 $0.20 与 $0.75),折扣期内缓存读取价格为每百万 token $0.004。函数调用支持 tools 与 tool_choice 参数,结构化输出通过 response_format 传入 JSON schema 实现,即官方所称的 schema 对齐 JSON。限时 80% off 折扣由 Inception 提供,模型页标注截至 UTC 时间 9 月 8 日 07:00(北京时间 9 月 8 日 15:00)结束。
托管方面,模型页注明该模型由单一 provider(供应商)承载,OpenRouter 将每个请求直接转发给 Inception,不做路由选择。Inception 官网同步挂出「Mercury 2.5 (Preview) is live on OpenRouter」横幅,标注列表价为输入 $0.20、输出 $0.75 每百万 token。 自称是覆盖 400 多个模型的统一 API 接口。
不逐个出词:扩散模型如何把速度提上去
Mercury 2.5 与 Mercury 2 同属扩散语言模型(diffusion LLM,dLLM)。模型页的解释是:Mercury 2.5 不按顺序生成 token,而是并行产出并精炼多个 token。Inception 在 Mercury 2 上线 Azure Foundry 时同一套机制:不按顺序解码,而是通过「并行精炼」生成回复,同时产出多个 token,在少量步骤内收敛。其用「从串行到并行」的对比说明这一点:其他 LLM 一次生成一个 token,Mercury 系列并行生成 token,「提高速度并最大化 GPU 利用率」。
模型页将 1,107 tokens/s 标注为「标准 GPU 上的并行生成速率」,适用场景是「延迟会累积的生产负载」:搜索 agent(智能体)、语音管线与编码 subagent(子智能体)。
比 Mercury 2 更聪明,首发价反而更低
Mercury 2.5 是 Inception 扩散模型产品线的最新一代。显示,2025 年 4 月与 6 月先后发布 Mercury Coder 与 Mercury,2026 年 3 月发布 Mercury 2,Mercury 2.5 Preview 于 2026 年 8 月 31 日发布。
按 OpenRouter 模型页的表述,Mercury 2 是首个 reasoning 扩散模型,速度超过 1,000 tokens/s,比 Claude 4.5 Haiku 和 GPT 5 Mini 快 5 倍以上。Mercury 2.5 的官方增量是:智能水平比 Mercury 2 高出 10+ 分,质量与 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等成本优化前沿模型相当。
价格反而更低:Mercury 2.5 列表输入价 $0.20,低于 Mercury 2 的 $0.25,输出同为 $0.75。Inception 官网称它是「最智能的推理 LLM,也是最低的价格」。分发方式也变了:Mercury 2 此前通过 Azure Foundry 与 等渠道提供,这一次 Mercury 2.5 Preview 由 OpenRouter 独家承载。
14.5 亿 tokens 与一句「谁拿到了 benchmark」
截至本文写作时,OpenRouter 的 Inception 模型页显示 Mercury 2.5 Preview 已累计处理 14.5 亿 tokens;模型页的「Apps」榜单显示,Panwright(1.6 亿 tokens)、omp、编码 agent 应用 pi、Ante 与交易策略应用 NexusTrade 等公开应用已在向该模型发送大量请求。
Inception 团队的三名成员先后转推了公告。联合创始人兼 CTO Aditya Grover(UCLA 人工智能教授)的称「为即将推出的扩散语言模型 Mercury 2.5 的预览感到兴奋,它面向交互式 agent,继续跑出 1,000+ tokens/秒」;联合创始人兼首席科学家 Volodymyr Kuleshov(康奈尔大学教授)的称「Mercury 2.5 在 agentic 工作负载上有大幅提升,生产中仍保持 1,000+ tok/s」。
创始团队成员 Samar Khanna 的称「再一次帕累托超越了上一代,质量(尤其是 agentic 任务)大幅提升而且更快,达到 1,100 tok/s」。团队之外,NVIDIA AI 产品合作负责人、曾任 Groq 合作业务负责人的 Jacob Loewenstein 称大家「别走,跑着去试这个 80% off 的模型」;另一名用户 joply 则在中直接问:「谁拿到了 benchmarks?」目前官方推文与模型页对质量的表述是「与 GPT-5.6 Luna (Low) 等成本优化前沿模型质量相当」这类定性对比。
同一模型页上的两组速度
同一张模型页的监控面板给出了另一组数字:OpenRouter 实测该模型吞吐 P50 为 166 tok/s,端到端延迟 P50 为 1.03 秒(模型页对吞吐的定义是「模型写入速度」,即每秒 token 数)。
官方宣传的 1,107 tokens/s 标注为「标准 GPU 上的并行生成速率」,与监控面板的 166 tok/s 并排出现在同一张模型页上,两者之间没有对照说明。「最快的推理 LLM」的头衔,目前由发布方自己的口径支撑。