AREX Feed Article
Qwen 发布 Qwen3.8-Omni-Flash:官方称其为 Qwen 首个围绕 agentic 能力构建的全模态模型,并开源 Qwen-MM-Plugins
9 月 18 日,阿里 Qwen 的官方 X 账号 宣布推出全模态(omni-modal)模型 Qwen3.8-Omni-Flash,称其是 Qwen 首个围绕 agentic(智能体)能力构建的全模态模型:原生音视频理解、推理与工具使用合于一体,能理解内容、规划任务、调用工具执行并交付结果。官方列出的场景包括自动剪辑 vlog、翻译短视频、把电影做成 recap(解说视频)。
官方同日还宣布开源多模态插件库 Qwen-MM-Plugins,并称模型通过 QwenCloud、Qwen Studio 与 API 提供。官方同时给出了一组性能与价格对比数据,未经独立核实。
从理解素材到交付成片:三个官方演示的工作流
称,这次发布的目标是推动全模态模型从「理解全模态内容」走向「规划任务、调用工具并完成创作」,并把 agentic 能力从编程、文本知识工作与图形界面(GUI)操作扩展到以音视频为中心的场景。
博客里的三个演示展示了具体流程。在 Music2MV 场景中,模型先理解歌曲的结构、节奏、情绪、人声与器乐变化,再据此设计人物、场景与镜头,并输出带时间戳的句级歌词,让歌声、字幕与画面对齐。短剧翻译场景中,用户用一句话描述需求,agent 完成区分角色的台词识别、口语化翻译、角色音色克隆配音、音轨重混与成片质检。长电影解说场景中,输入一部两三个小时的影片,agent 负责关键情节提炼、解说脚本、配音配乐与剪辑渲染,还会在电影原声与解说之间自动调节语速和音量。
支撑这些流程的是官方所称的 agentic 感知:面对数小时的视频,模型不逐帧处理,而是从问题出发决定看什么、听什么,通过由粗到细的多轮取证定位关键信息,把计算与 token 预算集中在相关片段上。
19.5 分、51.8% 和 89%:官方数字与口径差异
官方博客称,在累计 29 项评测中,Qwen3.8-Omni-Flash 的平均得分比上一代 Qwen3.5-Omni-Plus 提升超过 25%。推文强调,在 WildClawBench-MM 与 UniClawBench 上,agent 性能平均提升 19.5 分。对照博客的评测表,WildClawBench-MM 上为 71.0 对 34.5,UniClawBench 上为 69.6 对 67.1,两组差值(36.5 与 2.5)的平均数正好是 19.5;表格把两者都归入「多模态工具使用」方向的评测,脚注还注明,两个基准分别以 Claude Code 与 OpenClaw 作为运行框架。
推文称其音视频能力「接近 Gemini 3.8 Flash」,博客补充称音频能力整体超过对方。官方图表中两者的分数各有高低:WildClawBench-MM 上 Qwen3.8-Omni-Flash 为 71.0、Gemini 3.8 Flash 为 58.9;OmniVideoBench 上是 63.4 对 65.2,Qwen 落后。
官方材料在 OmniVideoBench 上给出了两个不同的 token 降幅数字。推文称模型比静态理解少用 51.8% 的 token;官方博客页面上的同一项表述是,token 消耗从 145,736 降至 79,117、「降幅约为 45.7%」。价格方面,推文称视频输入成本较 Qwen3.5-Omni-Plus 降低约 89%;博客的对比图把音视频输入价格列为每小时 0.20 美元,Qwen3.5-Omni-Plus 为 3.27 美元。
规格与接入:1M 上下文、文本输出与六个可用区域
给出规格:输入支持文本、图像、音频与视频,只输出文本;上下文 1M token,最大输入 991K、最大输出 131K,thinking 模式最大推理 262K token;速率上限为每分钟 200 万 token、3 万次请求。价格为输入 $0.15、输出 $0.47(每百万 token),隐式缓存命中 $0.016。页面还注明模型基于 Qwen3.8-Flash-Next 架构构建,支持双声道与四声道空间音频理解,兼容 DashScope 与 OpenAI 协议。
列出了接入信息:支持函数调用(Function Calling)与联网搜索(Responses API 目前内置的搜索工具只有 web_search);可用区域包括北京、新加坡、中国香港、东京、法兰克福与美国弗吉尼亚;音频输入支持 113 种语言和方言。文档同时注明,旧的 Qwen-Omni-Turbo 系列不再更新,文本分析场景建议迁移到 Qwen3.8-Omni-Flash。
Qwen-MM-Plugins:为智能体框架补上多模态
Qwen-MM-Plugins 的代码托管在 ,采用 Apache-2.0 许可,目标是让各类 agent harness(智能体框架)具备原生的多模态能力。它为 agent 提供图片、音频、视频与文档理解,以及长视频记忆与内容创作能力;安装器支持 Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code 与 Gemini CLI 等 agent harness。
插件按能力拆分:通用的 core、api、search 之外,面向 Qwen Omni 系列的包括 omni-chatcut(制作 MV、影视解说与视频翻译)、omni-video2note(把教程视频变成带截图的 PDF 笔记)、omni-skill-creator(把演示视频变成可复用的 Agent Skill)与 omni-memory(为长视频建立音视频记忆)。官方博客称,这次扩展的方向是长音视频的按需感知、工具调用与工作流执行。
安装可以走一行脚本,也可以在办公 agent 里直接用自然语言提出请求;README 里也标注了一条限制:目前多数 agent harness 还不能把音频原生传给主模型,音频要经由 API 处理。
Qwen-Live Harness 尚未开放
在 Hacker News 上,围绕官方博客的截至发稿获得 333 points 与 135 条评论。
公告里提到的另一件工具 Qwen-Live Harness 尚未开放:推文只在链接列表里把它标注为「coming soon」(即将推出)。