AREX Feed Article
千问创作上线 Agent Teams,多角色 Agent 协作生成视频
8 月 31 日,阿里千问宣布千问创作上线 Agent Teams(智能体团队)功能,支持 Wan3.0 视频生成模型,已在千问创作 PC 端和千问 App 上线。官方介绍,用户只需描述创意想法,Agent Teams 便会自主规划任务,由编剧、导演、美术、视频生成等不同角色的 Agent 分工协作,完成创意策划、脚本撰写、角色设定、分镜设计、画面生成、配音配乐到成片制作的全流程( 8 月 31 日消息)。
千问方面表示,这次更新把创作方式从以「写提示词」为主,扩展为用户提出创意,Agent 主动思考、拆解并执行任务,召集不同分工的专家 Agent 完成视频制作()。官方称,用户可以利用画布工作流和各类专业 Agent,一站式创作 AI 短剧、漫剧、营销广告、图像设计等多种类型内容;同日报道称,该功能面向全部用户开放。
从一句创意到成片:Agent 自动组队
Agent Teams 的交互起点是一句自然语言。用户提出创作想法后,系统自主拆解任务,把不同环节分派给承担导演、编剧、视觉设计、分镜师等角色的子 Agent,围绕剧情、人物、视觉风格和镜头表达展开协作,千问创作称之为「自动组队」()。
组队的人手来自千问创作内置的「人才市场」:机器之心 Pro 实测发现,这里预置了 59 个 Agent,包含不同风格的导演、美术、编剧、歌手等,用户也可以按需求自行创建新 Agent。
协作不是一次跑完。从策划、脚本到画面、配音、成片,由这组 Agent 接力完成,用户可以在对话框里随时介入、修改创作方向。PC 端、Web 端(c.qianwen.com)和千问 App 的创作资产与项目互通,可以中途换设备继续。
从「写提示词」到「派活」
千问创作汇集 Wan3.0、Wan3.0 Prime、Qwen-Image-3.0 等模型,Agent Teams 根据不同创作环节,规划并调用相应模型进行输出()。视频画面交给 Wan3.0,角色与场景的视觉资产由图像模型产出。
机器之心 Pro 在实测中观察到这套流程的关键设计:Agent 之间传递的是一份份可读、可改、可回滚的结构化中间产物,包括讲戏本、角色资产、镜头提示词表。每个工位都有明确交付物,且每份交付物都对人开放。
「先出提示词、再等确认」的逻辑同样来自实测:视频生成是全流程里最贵、最慢的一步,把人的判断插在生成之前,比等镜头全部跑完才发现方向偏了再返工更省成本。此外,网页链接和文档可以直接作为参考进入项目,附件支持 PDF、Word、TXT、Markdown 和 Excel。
Wan3.0 刚上线一周,短剧制作卡在「搬运」
Wan3.0 于 8 月 24 日在阿里云百炼正式上线:单次可原生生成 30 秒、最高 1080P 视频,支持原生音画生成,并支持图像、文本、音频、视频、文档与网页多模态输入,最高可组合 10 张图像、5 个视频、5 个音频作为参考()。API 按秒计费,480P/720P/1080P 分别为 0.3/0.6/1.2 元/秒,失败不计费。
千问创作是千问近期上线的、面向专业内容生产者的 AI 创作平台,首发接入 Wan3.0 及其 Prime 版(网易科技)。一周后的这次更新属于产品层功能,不是新模型发布。
机器之心 Pro 对过去 AI 短剧制作流程的描述,解释了为什么模型之外还需要 Agent 层:一部三分钟的短剧要拆成三四十个镜头,剧本在聊天窗口里写,角色四视图在生图工具里抽卡,分镜表落在表格里,再逐条把镜头描述翻译成提示词喂进视频模型;配音配乐在另外两个软件里,最后还要进剪辑软件对时间线。
「生成不难,难的是让几十次生成之间保持连续性」,而模型能力上限的提高,「并没有等比例地转化成生产效率」。
实测:剧本加一句话,跑出完整成片
机器之心 Pro 发布了一篇题为《刚刚,我们用千问创作做了一部「JoJo 的奇幻买瓜」》的实测文章。输入只有一段「华强买瓜」的文字剧本,外加一句提示词:「将这个剧本做成视频,视频风格参考《JoJo 的奇妙冒险》」。没有分镜,没有角色设定,没有画幅要求。
创作助手先做了一轮任务分析,抛出一个问题:视频要什么画幅比例?然后给出组队方案,这部片子需要四个工位:导演、插画师、视频师、剪辑师。导演把原始剧本拆成 11 个剧情点,写出一份讲戏本;插画师产出角色与场景的视觉资产;视频师没有直接开始生成,而是先写了 12 条镜头提示词,摆到用户面前等待审阅和修改。
机器之心 Pro 在流程中强行加戏:把「华强骑乘的重型摩托车改成有些残破的小电驴」,丢进一张参考图,同时把视频模型从 Wan3.0-720P 切换成 Wan3.0-1080P。三个变量同时变动,这个 Agent 团队都接住了。12 条片段全部生成后,由剪辑师拼接成完整影片;成品并不完美,但可以退回镜头生成环节,直接 @ 对应的智能体单独重做某一段,微调三个片段之后,效果明显改善。
机器之心 Pro 的结论是:这套流程确实能把一个只有剧本和一句话的需求,推到一部结构完整、风格统一的成片,中间不需要在多个软件之间来回搬运资产;但它不是「一键成片」,从「能跑通」到「能交付」,仍然隔着人的验证和多轮优化。
竞争重心从模型指标转向流程组织
机器之心 Pro 认为,过去两年 AI 视频的竞争一直围绕模型指标展开:谁的时长更长、一致性更好、单秒更便宜。当单条视频的质量逐渐逼近可用线,差距会转移到流程的组织方式上。
它把千问创作看作这条路线的最新样本:昆仑万维和字节跳动都在做把完整内容生产组织起来的平台,竞争的重心正转向「把一次完整的内容生产组织起来」,千问创作把自研视频模型、自研图像模型和 Agent 编排装进同一个产品。
它同时指出,视频场景天然适合多 Agent 协作:编剧、导演、美术、摄影、剪辑的职责边界、交付物格式和上下游接口,在电影工业里已经打磨了一个世纪,Agent 的分工不需要重新设计,照抄剧组编制就行。
但视频也有特有的难处:一个镜头「好不好」是主观判断,没有可量化的验收标准,错误会一路向下游传导,直到人在成片阶段才发现。这正是 Agent Teams 把讲戏本和镜头提示词摆到用户面前等确认的原因。
机器之心 Pro 把专业成片拆成三层:技术可用性、叙事完整性、商业可交付性。第一层由模型基本解决,第二层是 Agent Teams 这类产品正在解决的地方,第三层(符合品牌规范、能过审、按时按预算交付)目前仍高度依赖人。
「把编剧、导演、美术打包成一支可以被一句话调度的队伍,是对这个问题的一种回答。它还有很多没有被验证的边界。」
参考链接