AREX Feed Article
腾讯混元官推发布 Hy Agent:面向视频生成的 Agent Harness
8 月 21 日 20:10(北京时间),腾讯混元官方 X 账号 (显示名 Tencent Hy,简介为"腾讯面向文本、图像、视频与 3D 生成的基础模型")发布了一条只有一句话的推文:"Hy Agent Harness For Video Generation."——Hy Agent,一个用于视频生成的 Agent Harness(智能体工具链)。
这条官宣没有配图、没有链接、没有技术细节,也没有提及开源状态、上线渠道与时间。截至 8 月 22 日核验时,它获得约 2.1 万次浏览、218 个赞、19 次转推和 116 次收藏。而更完整的口径在同一天稍早已出现:腾讯官方 AI 新闻账号与混元团队研究员先后以 HyCreator 之名发布了措辞几乎一致的介绍,并开放了早期访问申请。
一句话官宣:没有链接,也没有开源口径
的这条推文是当晚 20:10 发布的独立消息,正文只有标题式的一句话,没有任何展开。官方账号既没有给出项目页面,也没有回答最基础的问题:代码是否开源、面向谁开放、什么时候能用。
评论区目前唯一的回复,是 8 月 22 日凌晨 4:11(北京时间)用户 Chamu(@chakrisimply)问的一句 ,截至本文核验时没有官方回答。与之形成对比的是,腾讯官方 AI 新闻账号 (简介自称 The official @Tencentglobal newsroom,即腾讯全球官方 AI 新闻室)当天 16:41 发布的 HyCreator 介绍拿到了约 7.4 万次浏览和 722 个赞,是官推这条消息的三倍多。
HyCreator:同一口径下的产品全貌
的推文写道:"Introducing HyCreator, our agent harness for long video generation. Most video models hand you a clip and wish you luck. This one runs the whole thing end to end, and lets you cut in at any point instead of re-rolling the prompt"——大多数视频模型丢给你一段片段就撒手不管,HyCreator 则端到端跑完整条流程,并且允许你在任意节点切入修改,而不是重新抽卡。有用户追问"有没有机会试用"时,该账号,指向 。
更早一天,8 月 20 日 22:04(北京时间), 已经在个人账号公布了 HyCreator。他的 X 简介标注为腾讯混元多模态强化学习技术负责人(Tech Lead of Multimodal RL at @TencentHunyuan),推文列出三项能力:"End2end Auto Mode"(端到端自动模式)、"Generate 10-minute scale films with zero human intervention"(零人工干预生成 10 分钟量级影片)、"Switch to real-time interactive editing whenever you want"(随时切换实时交互编辑),并附上早期访问申请链接。
官推没有点名 HyCreator,但三处口径的措辞几乎逐字对应:@TencentHunyuan 说 "Hy Agent Harness For Video Generation",@TencentAI_News 和庞天宇都说 "agent harness for (long) video generation"。官推发布后,两位个人简介标注为腾讯混元团队成员的用户先后转推:Yunlong Lin(@ling_yunlong,简介为 LLM agents、Embodied AI,曾任字节跳动 Seed、现 Tencent Hy)在 20:49 转推称 ,Chen-Hao(Leo) Chang(@Chenhao_Zhang5,简介为 Build @TencentHunyuan)在 23:56 转推称 。据此判断,Hy Agent 与 HyCreator 指向同一款工具链,这是编辑观察;官方账号本身没有给出这层对应关系的说明。
10 分钟长片是这样拆开生成的
HyCreator 的定位,据 转述,是"面向长视频生成的 agent harness(把模型、工具和制作流程串起来的智能体框架)"。按 ,它交付的不是一段视频,而是一部完整影片:系统自主完成从故事、分镜到片段生成与组装的全流程,用户可以在任意环节切入修改。
ChooseAI 整理的官方博客与站点演示显示,用户给出一段简报后,系统依次完成创意理解、故事与剧本开发、生成备料、执行生成、分层审阅、组装交付六个步骤。备料阶段建立角色、场景、片段之间的引用关系;审阅阶段先检查文本层面的规划,再检查视觉结果,不合格的部分单独重做,而不是整片重来。
官网画廊已经放出实际作品。据 BlockBeats 及其刊载的官网截图,其中最长的一部标注为 10 分 27 秒,另有 9 分 45 秒、9 分 59 秒的长片;每部作品都可以查看 Agent 的生成 Trace(轨迹),一个公开案例中 Pro 模式共执行 13 个步骤、产生 45 项中间产出,最后检查片段质量、镜头衔接和全片连贯性再合成。HyCreator 提供 Lite 和 Pro 两种成片模式。站内演示案例《黑胶裂痕》(Vinyl Fracture)则显示,一部 4 分 02 秒的影片被拆为 15 个场景、16 项资产和 25 个片段,每个片段独立生成后组装。
"10 分钟级、零人工干预"目前只有官方口径支撑。ChooseAI 在报道中特别提示,站内公开展示的演示影片仍为 4 分钟级,这一主张尚无第三方实测或独立报道验证。
混元为什么要造一个"编排层"
ChooseAI 在报道中解释,分钟级以上的影片无法靠单次模型调用完成,必须由多个独立生成的片段拼合,角色、场景、风格和声音的一致性会在片段之间漂移;HyCreator 的流程设计正是围绕这个问题:规划整体、生成分片、在漂移出现时回到相应环节重做,文本规划和视觉结果分开审阅、只重做漂移部分。
腾讯在视频生成上并非从零开始。腾讯云文档显示, 已是一项提供视频生成和视频处理能力的 API 技术服务,基于腾讯视频生成大模型。在混元账号近期的智能体发布中,Hy Agent 是第一个落在视频方向的:此前 混元发布了研究智能体 Hyra-1.0, 发布了从文本生成 3D 开放世界的 agentic 工作流 Hy3D WorldClaw。
社区对"编排层"这个思路的反应并不一致。中文用户 Nokia04(@Nokia0421,简介"做 AI 产品")在 HyCreator 介绍下评论:"" 也有开发者追问机制细节,用户 basedcapital(@thebasedcapital,简介 ml、local llm enjoyer)问的是""。质疑声同样存在:产品经理 Axi(@Xxi5olc)对比称 "",把视频生成模型 Seedance 拉来做参照;用户 Rich(@atomtanstudio)则评论""(该说法未获官方证实,更多是调侃)。
开源、成本、底层模型:都还没有答案
目前能确认的只有产品形态和早期访问入口。准入条件、排队机制和收费方式,官方均未披露;底层调用哪些视频模型、完整生成耗时与成本,同样没有公开说明。官网页面内嵌数据里,作品分享路径共有 19 处带有 models/seedance-2-5 子目录字样,若按字面理解这指向一个名为 Seedance 2.5 的模型,但腾讯没有披露底层模型,这个路径名的含义无法从公开信息证实。
而在官推那一边, 除了那句 "Hy Agent Harness For Video Generation." 什么都没有说。评论区里唯一的回复,是用户 Chamu 问的 "Opensource?"——截至本文核验时,官方没有回答。