AREX Feed Article
Qwen 给 Claude Code 装上眼睛和 Blender,但没让你换 Agent
8 月 10 日,,一个 Apache 2.0 协议的多模态插件系统,代码,截至发稿收获 694 颗星。
这是一套 skill + MCP server,可以直接装进 Claude Code、Codex、Gemini CLI、Qoder、OpenClaw、Qwen Code 等已有的 agent harness 里。装完之后,这些原本只能处理文本和代码的 Agent,就能读取图片、视频、文档、3D 模型,做 OCR 和视觉定位,甚至直接操控一台正在运行的 Blender 或 FreeCAD。
「眼角膜到货了」:社区最先看清的是分发意图
公告推文发布后,中文开发者社区最先抓住的不是技术细节,而是分发逻辑。独立开发者、AI 博主 在引用中直接喊话 DeepSeek 和 GLM:「你们的眼角膜到货了。」这条调侃背后是一个简单的事实:Qwen 的多模态能力现在可以被装进任何一家模型的 Agent 里。
拥有 2.5 万关注者的科技博主 在引用中拆解了这套架构:「Agent Harness 负责干活,Skill 负责告诉模型什么时候该用什么能力,MCP 负责把真正的工具接进来。」他总结道:「以后很多能力可能都没必要重新做一个 Agent,做成 Plugin 挂进去就行。」
拥有 4.6 万关注者的 则点出了这次发布与以往 Qwen 模型发布的区别:「以前很多 Agent 只能处理文本,遇到图像、视频或三维文件就要额外接工具。现在这些能力被封装成插件,直接挂到现有 harness 上就能用。」
日本开发者 的评论指向了一个被打破的前提:「多模态是模型侧的功能,这个前提已经崩塌了。」
也有开发者提出了更冷的观察。 指出,模态越多,Agent 面临的路由决策就越复杂:「未来的 Agent 不会因为看不见文件而失败。它会失败,是因为选了错误的方式来处理它。」
一周前开源 2.4T 参数,现在开的是工具层
Qwen-MM-Plugins 不是孤立的一步。回顾过去一周:
8 月 3 日,,一个 2.4 万亿参数的旗舰模型,承诺「下周」开放权重,同时预告了更小的 Qwen3.8-27B 也将一并开源。该模型在多个基准测试中进入全球前列。
8 月 7 日,阿里正计划对 Qwen3.8-Max 的大型商业用户引入收入分成条款,效仿 Moonshot AI 在 Kimi K3 上的做法。阿里在开源策略上从「免费获客」走向「分层变现」。
而现在,Qwen-MM-Plugins 将这一周的叙事从「模型参数竞赛」推到了「Agent 工具层竞赛」。它不再回答「我的模型有多强」,而是回答「我的能力能在多少种 Agent 里被调用」。
七个能力模块,从 OCR 到驱动一台正在运行的 Blender
Qwen-MM-Plugins 将每种能力拆成两个部分:一个 skill(告诉模型有哪些工具可用),以及一个可选的 MCP server(工具本体,通过 uvx 按需拉起)。装好的 Agent 引用文件直接提问,模型自动选择对应工具。
七个模块各司其职:
core 是基础视觉层。动态分辨率读取图片、视频、文档和 3D 模型:每张图、每帧视频、每页文档会自动缩放到视觉语言模型的 patch grid,4K 截图上的小字和缩略图都能以各需的精度读入。此外提供 OCR、视觉定位(grounding)、图像分割、语音识别、视觉对话和联网搜索。
video-memory 处理长视频。用四层层次化图记忆结构(Root → SuperEvent → MacroEvent → Subgraph)配合嵌入语义搜索,让 Agent 可以对一个两小时的讲座视频做带时间戳的要点提取,首次提问时自动构建记忆图。
omni-av 面向短音视频理解。通过 Qwen-Omni 实现带说话人标注和时间戳的转录、时序描述与定位、事件计数和音乐标签。
video-edit 提供视频剪辑工作流和图片/视频/音频生成能力,底层调用 DashScope。
blender 驱动一台正在运行的 Blender。通过瘦客户端发送 Python 指令,提供 22 个 MCP 工具:建模、材质、灯光、渲染,以及 PolyHaven/Sketchfab/Hyper3D/Hunyuan3D 素材库调用。
freecad 同理驱动一台正在运行的 FreeCAD,提供 14 个工具:参数化建模、属性修改、STEP/STL 导入导出、CalculiX 有限元分析。
edu-agent 是纯 skill(无 MCP server),将一道数学或理科题变成一步步讲解的中文视频或交互页面。
基础读取功能,如图片、视频和文档,不需要 API key。但 vision_chat、OCR、grounding、语音识别、生成和 video-memory 构建需要阿里 DashScope API key;联网搜索和图片搜索需要 Serper key。视频和音频功能依赖 ffmpeg,文档可视化可选 LibreOffice、Blender、LaTeX 或 Chromium。Windows 仅支持 WSL2,原生 Windows 未经验证。
多模态不再是模型自己的事情
以前,一个 Agent 能不能看图、能不能理解视频,取决于它背后的模型是否原生支持多模态。Claude 的用户用 Claude 的视觉,Gemini 的用户用 Gemini 的视觉。多模态是模型内置的功能,也是各家的护城河。
Qwen-MM-Plugins 做的事情,是把这堵墙拆了。
它把 Qwen 的多模态能力,包括视觉理解、OCR、视频记忆、3D 建模,封装成独立于模型的 MCP 工具。一个 Claude Code 用户不需要切换到 Qwen Code,就能在自己的 Agent 里调用 Qwen 的视频记忆能力来分析一段两小时的会议录像。一个 Codex 用户可以继续用 OpenAI 的模型做代码生成,同时让 Qwen 的 FreeCAD 插件帮他导出 STEP 文件。
Runway 此前也推出了 MCP 连接器,让 Claude、ChatGPT 和 Cursor 可以在对话中生成视觉素材。但 Qwen-MM-Plugins 覆盖的模态种类更广,从 OCR、视频记忆到 3D 建模和 CAD 有限元分析,并且一次性打包成共享的安装器和配置系统。两个项目尚未经过独立的可靠性与输出质量对比。正如 :「Qwen-MM-Plugins 让阿里获得了一条通过竞争对手 Agent 产品分发的路径。开发者无需将 Qwen Code 作为主要界面,就能添加 Qwen 构建的媒体和 CAD 能力。」
谁的插件能在最多 harness 里跑,谁就留在工作流里
Qwen-MM-Plugins 不是一次模型发布。它是一次关于分发逻辑的声明:在 Agent 时代,多模态能力正在从模型的内置功能变成可插拔的基础设施。而基础设施的竞争规则和模型竞争完全不同:不是你跑分更高别人就换用你,而是你的工具能在多少个已有的工作环境里无缝挂载。
阿里选择了不建围墙。Qwen-MM-Plugins 的 guided installer 覆盖六种 harness,manual 模式覆盖更多。Claude Code、Codex、Gemini CLI 的用户各用各的模型,但可以共用同一套 Qwen 的多模态工具。这条路径如果走通,「谁的多模态模型更强」就不再是唯一的问题。真正的问题是:谁的插件被更多 Agent 调用。