AREX Feed Article
Grok Imagine Image 2.0 杀入全球第二,xAI 把图像生成从「炫技」推进「交付」
8 月 8 日,Grok 宣布推出下一代图像生成模型 Imagine Image 2.0。新模型在 Arena 的文本生图和图像编辑两项排行榜上同时空降第二名——文本生图从旧版的第 14 名跃升至 1320 分,图像编辑从第 7 名升至 1439 分。
Grok 在中给了 Image 2.0 一句直白的定位:「为真实工作而生。」这次更新的重点不是画面更精美,而是让人能把 AI 生成的图像真正放进工作流:精准编辑局部而不破坏其余区域、渲染可读的文字、以及保持跨代生成的一致性。
Arena 官方盖章,社区连夜开测
独立评测平台 在模型上线后数小时内即确认了两项排名。Arena 在推文中列出 Image 2.0 的分类成绩:产品与商业设计排名第三,艺术、人像、文字渲染、动漫与幻想、照片级与电影级画面五项全部排名第二。
「Grok Imagine Image 2.0 一出场就在两项 Arena 上排名第二,」拥有 143 万粉丝的 Tesla Owners Silicon Valley ,「精准生成、清晰文字、复杂版面。SpaceXAI 的发货速度很难忽视。」
xAI 团队成员 Long Zhao——前 Google DeepMind、现任 xAI Member of Technical Staff——在 X 上:「认识一下 Grok Imagine Image 2.0。」Grok Imagine 团队的 Andy Chang(此前在 Google)则:「能在真实工作中使用的图像。试试 Image 2.0,更多更新在路上。」
社区反应集中在两点。一是惊叹——用户 @FrancoE114696 「Holy shit Grok Imagine Image 2.0 is REALLY good」。另一类则更冷静。X 用户 Dimm :「AI 图像的有趣战场正在从'谁画得最酷'转向'谁能替换真实创意工作中最多的步骤'。」另一位用户 ericsocrat 的更精炼:「图像模型终于变成了真正的设计工具,而不只是'看我生成了什么'。」
Grok Imagine 半年三次换代
Image 2.0 并非凭空出现。根据 ,Grok 2 于 2024 年 8 月首次发布,同年 12 月推出代号 Aurora 的图像生成模型,用户在聊天界面中即可直接生成图像。2026 年 1 月底,xAI 发布 Grok Imagine API,将图像与视频生成作为独立产品线运作。5 月,Grok Imagine Quality Mode API 上线,官方将其描述为「更高的真实感、更强的文字渲染、更好的创意控制」——这几乎就是 Image 2.0 三大卖点的雏形。
这次的 Image 2.0 是这条产品线上第一个直面「生产工具」定位的版本。它不再满足于「能生成」,而是试图回答一个更苛刻的问题:生成的图像能不能直接用在海报、广告、产品图里?
2.0 目前仅通过 以及 iOS 和 Android 应用提供,需要用户在 Imagine 中切换到「高质量模式」使用。API 尚未开放,Grok 在推文中只给了一句「API access coming soon」。
Magic Wand、文字渲染、五图合成——三个让设计师认真对待的理由
Image 2.0 的技术升级围绕一个核心逻辑:把编辑当作一等公民,而不是生图的附属功能。
Magic Wand(魔术棒)让用户指向图像中的某个区域,模型只修改该区域,其余部分原封不动。传统生图模型的「局部重绘」往往模糊边界或重新解释整张图,Magic Wand 的做法是把编辑范围收缩到用户指定的精确区域。
文字渲染方面,海报、信息图、广告里的小字终于不再乱码。xAI 在中解释,Image 2.0 会像设计师一样规划排版和版面,保证密集、多部分的视觉内容结构完整、小字清晰可读。Arena 的文字渲染分类排名第二,侧面验证了这一点。
多参考图编辑(Multi-ref)一次生成最多可输入 5 张参考图,模型据此进行组合编辑,免去手工合成。配合智能抠图(自动去背景输出透明 PNG)和 Smart Resize(选定宽高比后模型自动补全画面),Image 2.0 覆盖了从生成到精修到交付的完整链路。
xAI 还一次性放出 20 套模板,,覆盖头像、商品换色、房间布置、电商图、周边设计、图标、Hero 产品展示等常见工作流。每套模板已经预配好流程,用户只需提供输入即可得到成品。
图像生成正在从「能看」转向「能用」
一年前,AI 生图的衡量标准是画面是否惊艳、细节是否丰富。如今这个逻辑正在被改写。
Arena 的排行榜上,GPT Image 2(OpenAI)以 1380 分暂居文本生图第一,Image 2.0 以 1320 分紧随其后;图像编辑方面,Image 2.0 的 1439 分同样是第二。Image 2.0 超越的竞争对手包括 Meta 的 Muse Image、Google 的 Gemini 系列、微软的 MAI Image、阿里巴巴的 Qwen Image 和字节跳动的 Seedream——这些模型背后都是资源充沛的巨头团队。
三天前(8 月 5 日),xAI 刚将 grok-voice-think-fast-2.0 设为 Grok Voice 的默认路由模型。从语音到图像,xAI 的产品节奏在 2026 年下半年明显加速。Image 2.0 的模板系统进一步表明,xAI 在有意将 Grok Imagine 从「生成一张图」推向「完整的图片设计工具」。
拥有 165 万粉丝的 Autism Capital 在 Grok 公告下:「这应该集成进 X 的 SuperGrok 功能。把它和一切都结合起来。人们在 X 上让 Grok 创建图像、视频时,应该使用这些工具,并且在一个地方完成所有操作。」
模板就位,API 还在路上
Image 2.0 把 Grok Imagine 推到了一条新赛道的起跑线上:从 AI 生成转向 AI 制作。Magic Wand、清晰文字、多图合成和 20 套模板合在一起,意味着一个设计师或运营人员理论上可以在 Grok Imagine 里走完从构思到交付的完整流程。
但 API 尚未开放,意味着企业用户还不能将 2.0 嵌入自动化流水线。Grok 在产品线程中只写了一句「API access coming soon」——没有日期,没有定价,没有速率限制说明。对于一批已经习惯通过 API 调用 Flux、Seedream 或 GPT Image 的开发者来说,这是 Image 2.0 目前最明显的缺口。