AREX Feed Article
Imagine 2.0 摘下 Arena 双榜第二,xAI 把生图模型做成了编辑台
8 月 7 日,xAI 将 Imagine Image 2.0 作为 grok.com/imagine 及 iOS、Android 端的 Quality Mode 正式上线。同一天,:该模型在 以 Elo 1320 空降第二,在 以 Elo 1439 同样排名第二,两项均仅次于 OpenAI 的 gpt-image-2。
但排名只是新闻的钩子。Image 2.0 真正改变的是产品形态:它打包了魔棒局部编辑、分割选区、背景移除、最多 5 张参考图的多图融合、智能比例重绘和模板工作流,是一整条编辑工具链,而不再只是"输入 prompt、吐出一张图"的生成器。
xAI 在中把它定位为"为真实工作而建的图像工具",重心从一次性出图挪到了迭代编辑。
Musk 连发三条,社区把分割面板玩出了花
Elon Musk 在 8 月 8 日连发三条推文。第一条直说"",第二条跟进"",第三条直接甩链接:。三条合计超过 800 万次浏览、1.3 万点赞。
Arena.ai 官方账号发帖祝贺,列出了 Image 2.0 的分类排名:在 Art、Portraits、Text Rendering、Cartoon/Anime/Fantasy、Photorealistic & Cinematic Imagery 五个类别均排第二,Product、Branding & Commercial Design 类别排第三。
xAI 团队成员 Frank Hu()发帖透露"non-agentic yet, more to come in a week or two",暗示 agentic 能力即将接入。另一位成员 Jiachen Li :"这是 Imagine Image 2.0 的第一个版本,我们还在努力改进,更多内容即将到来。"
SpaceXAI 官方创意大使 Dogan Ural(@doganuraldesign):"Segments 面板太疯狂了,几乎所有元素都能单独编辑。我知道这东西会走向哪里。"
社区反应并非全部正面。的 735 条 X 平台反应中,正面意见占 68.6%,负面占 31.4%。负面集中在更严格的审核、部分场景下图像质量下降以及速率限制。
从"一次性出图"到"迭代编辑",图像模型在经历什么
图像模型的竞争正在从"谁出图更漂亮"转向"谁能嵌入工作流"。这个转变在过去半年加速。
OpenAI 的 gpt-image-2 在此前的 Arena 排名中已确立了图像编辑赛道的领先地位。xAI 的 Grok Imagine 此前也已具备编辑能力,Image 2.0 将其扩展为一套完整的工具链。Grok Imagine Quality Mode 的 API 此前已上线,按每张 $0.05 计价。
更大的背景是 SpaceX 对 xAI 的收购整合。指出,模型在 Arena 上的厂商名已从"xAI"变为"SpaceXAI",源自母公司的收购。Image 2.0 是整合后推出的重要消费产品。
Arena 公开数据佐证了升级幅度:Image 2.0 的前身 grok-imagine-image-quality 在 Text-to-Image Arena 排名第 14(Elo 1228),Image 2.0 跳到了第 2(Elo 1320)。Image Edit Arena 上,旧模型排第 13(Elo 1362),Image 2.0 以 1439 分跃升至第 2。Arena.ai 称这是"从 #14 到 #2 的显著跃升"。
魔棒点哪里改哪里,五张参考图一次融合
Image 2.0 的核心能力集中在编辑。Magic Wand(魔棒)指向画面中任意区域并单独修改,其余部分纹丝不动。Segmentation(分割)自动识别图像中的独立元素——人物、物体、背景,支持逐层编辑。背景移除一键输出透明背景的素材,可直接接入其他设计工具。
多图参考编辑(Multi-ref)是本次最激进的功能:一次生成最多输入 5 张参考图,将产品、风格参考和构图版式融合为一张图像,省去手动合成步骤。Smart Resize 支持九种宽高比,从 1:2 竖幅到 2:1 横幅,模型自行填充新画幅所需内容,而非简单裁切。
文字渲染是另一个重点。扩散模型长期在小字和复杂排版上表现不稳。xAI 称 Image 2.0"像设计师一样规划字体和版式",在密集的多元素构图中保持小字锐利。
模板(Templates)把常见商业任务打包为预设:产品摄影、专业头像、电商图片、游戏资产、图标、营销海报。用户提供输入即可获得接近成品的输出。
但 暴露了两个硬伤。在六组相同 prompt 的对决中,Image 2.0 在写实肖像上确实领先:手部解剖正确,皮肤细节到了毛孔级别,身份保持一致。
但在简体中文海报任务中,模型输出了繁体字,测试方将其定性为"对任何本地化或出版管线的硬性否决"。风格迁移任务中,要求将人像融合为水彩画,模型却返回了一张仅带轻微绘画纹理的写实照片,测试方称为"类别级失败"。
离 GPT Image 2 还差 60 分 Elo,但定价逻辑完全不同
Image 2.0 把竞争拉到了编辑工作流层面。魔棒、分割、多图融合、智能重绘如果稳定运行,可以直接替代一部分手动修图操作。模板工作流瞄准了电商、营销、游戏资产等高频商业场景。这些场景的痛点不是"能不能生成一张好图",而是"能不能在十轮修改后还保持一致性"。
定价模式构成另一个差异。xAI 的图像 API 按张计价:标准模型 $0.02/张,Quality 模式 $0.05/张,1K 和 2K 分辨率同价。OpenAI 的 gpt-image-2 按 token 计价:图像输入 $8/百万 token,图像输出 $30/百万 token。一张 1024×1024 图像的成本从低质量约 $0.006 到高质量约 $0.21,波动约 35 倍。
OrcaRouter 指出,固定每张价格对于需要做成本预测的商业管线"远比一个随 prompt 长度、质量等级和输出分辨率波动的 token 账单容易预算"。
但限制同样明确。Arena 上的 Image 2.0 标注为"Preliminary"(初步结果),仅 2,722 票,而第一名 gpt-image-2 有 69,194 票,Elo 差距约 60 分。
更根本的是,独立测试揭示的两个硬伤——简体中文合规性失败和风格迁移不稳定——恰好击中了商业用户最常需要的功能。OrcaRouter 的判断直白:如果你生成写实图像并需要在多次编辑中保持主体身份,可以立刻试用;如果你的管线输出本地化文本或风格化素材,等下一版或更多独立测试再说。
排名是真的,硬伤也是真的
Image 2.0 的双榜第二排名是真实的 Arena 快照,不是营销话术。但它和 GPT Image 2 之间差的不只是 60 分 Elo,而是国际化文本的可靠性和风格控制的稳定性,这两个问题不是靠加模板能绕开的。
编辑工具链的方向锚得很准,但"为真实工作而建"这句话,要等到简体中文不再输出繁体、水彩不再变成照片的那天,才算兑现。API 即将推出,agentic 能力也在路上。Frank Hu 说的"a week or two",才是下一个值得盯住的时间窗口。