Grok Imagine 2 解析:Image 2.0 到底上線了什麼
Grok Imagine 2 就是 xAI 的 Imagine Image 2.0。這次上線了什麼:精準編輯、五張參考圖、智慧調整尺寸、範本、跑分和限制。

很多人搜尋的關鍵字是 Grok Imagine 2,但 xAI 的官方名稱是 Imagine Image 2.0。它在 2026 年 8 月 7 日推出,是 Grok Imagine 的 Quality Mode 裡一個全新的圖片生成與編輯模型——不是 Grok 聊天機器人的升級,也不是影片用的 Grok Imagine 2.0。
實際的改變在於控制力。Image 2.0 是為密集版面、看得懂的文字、針對性的編輯、透明背景素材、多參考圖構成,以及把一張已定案的圖片改成新畫面比例而打造的。它現在已在 xAI 的消費端產品全面開放;xAI 說 API 存取還要再等一下。
這篇指南要把這次發布和坊間簡稱分開:Grok Imagine Image 2.0 是什麼、實際上線了什麼、xAI 的跑分說法代表什麼,以及當你需要 API 或多模型流程時,今天有什麼可以用。
Grok Imagine 2 是什麼?
Grok Imagine 2 通常指的是 Imagine Image 2.0,也就是 xAI 目前的圖片生成與編輯模型。它以全新的 Quality Mode 形式,在 Grok.com Imagine 和 Grok 行動 App 上推出。8 月的公告談的是靜態圖片和圖片編輯;Grok Imagine 的影片模型仍然是另一條產品線。
| 發布細節 | xAI 公布的內容 |
|---|---|
| 官方名稱 | Imagine Image 2.0 |
| 常見搜尋名稱 | Grok Imagine 2、Grok Image 2、Grok Imagine Image 2 |
| 推出日期 | 2026 年 8 月 7 日 |
| 目前可用管道 | Grok.com Imagine、iOS 和 Android 上的 Quality Mode |
| 主要任務 | 文字生成圖片與圖片編輯 |
| 參考輸入 | 單次生成最多 5 張圖片 |
| 介面提供的比例 | 1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 和 2:1 |
| API 狀態 | 即將推出 |
名字之所以重要,是因為「Grok Imagine 2」很容易被誤會成 Grok Imagine 1.5 影片的後繼版本。它不是。如果你的需求是一段有動作和聲音的片子,你要比的仍然是影片模型。如果你的需求是海報、產品圖、插畫素材或有控制的照片編輯,那 Image 2.0 才是相關的這一次發布。
Grok Imagine Image 2.0 實際上線了什麼
xAI 把 Image 2.0 圍著生產工作組織起來,而不是一次性的生成。這次發布有六個具體部分:更強的指令服從度、文字與版面規劃、精準編輯、多參考輸入、智慧調整尺寸,以及針對特定任務的範本。
更好的指令服從、文字與版面
Image 2.0 的設計目標是讓密集、多段落的提示詞保持連貫。xAI 特別點名小字、字體排版,以及有好幾個視覺元素的版面。這把這個模型放進了海報生成、資訊圖表、教學單張、菜單、包裝概念和編輯風圖像的評比裡——而不只是電影感的單一主體圖片。
關鍵字是規劃。一個模型可以把標題拼對,卻仍然毀掉整張素材:層級塌掉、邊界擠成一團,或每一塊都給同樣的視覺重量。xAI 的說法是,Image 2.0 會把字體排版和構圖一起規劃,讓整個版面站得住。
說明
xAI 在發布文章裡沒有公布文字準確率,沒有原生輸出解析度, 也沒有詳細的字體排版跑分。「小字更銳利」這句話,在能跨語言、 跨字體風格和密集版面實測之前,都只是服務商單方面的說法, 而不是已經驗證的事實。
想留在局部的局部編輯
圖片編輯才是這次發布比單純畫質升級更有用的地方。Image 2.0 多了好幾種指定修改對象的方式:
- 魔術棒編輯把模型指向你想改的區域。
- 分割選取在編輯之前先精準選出某個物件或區塊。
- 去背把主體以透明背景輸出,方便拿去別的地方用。
- 提示詞編輯只改選定的內容,畫面其餘部分保留。
它承諾的不只是「把產品改成紅色」,而是「把這件產品改成紅色,同時不重新設計包裝、不移動鏡頭、不換掉桌子、不改變光線」。那個「保留」,正是圖片生成器和團隊可以反覆使用的編輯步驟之間的差別。
最多五張參考圖
多參考編輯單次生成最多接受 5 張輸入圖片。每張參考圖可以有不同的任務:一張給主體、一張給產品、一張給環境、一張給材質或顏色,還有一張給整體的美術方向。
用角色分工的提示詞,比叫模型「把這些圖片合起來」清楚得多:
Use image 1 for the person's identity and expression. Use image 2 for the jacket's exact shape and lilac color. Use image 3 for the studio background. Use image 4 only for the soft side lighting. Compose a waist-up campaign portrait without copying text or logos from any reference.
五張輸入對很多品牌宣傳、角色和產品合成的需求來說夠用了。但它們本身不等於一致性的證明。真正的考驗是:同樣的身分、比例、材質和品牌細節,能不能撐過好幾次輸出和後續編輯。
跨九種畫面比例的智慧調整尺寸
智慧調整尺寸會改變畫布,並把新露出來的畫面填滿,而不是把原圖拉伸或粗暴地裁掉。發布時的介面上有九種比例,從高瘦的 1:2 橫幅到寬的 2:1 構圖。
這讓一張已定案的圖片更容易延伸成一整組交付素材:
- 先在 1:1 或 4:3 定案主構圖。
- 擴成 9:16 當限時動態或 Reel 的封面。
- 重新構成 16:9,給影片、簡報或網頁使用。
- 用 2:1 做寬版的活動橫幅。
- 每個版本輸出前都檢查有沒有憑空生出的物件、複製的四肢和位移的文字。
智慧調整尺寸應該被理解成生成式的向外延伸,而不是可預期的響應式設計。模型會在原本畫面之外創造內容,所以每一種比例都是一張需要重新檢查的新圖。
為可重複任務準備的範本
xAI 同時推出了把常見流程預先設定好的範本。第一批涵蓋照片編輯、產品改色、編輯風產品海報、拼貼、換背景、電商和 UGC 照片、專業形象照、吉祥物、圖示、角色圖素、UI 套件、表情符號和周邊商品。
範本能省下設定時間,特別是對那些知道要什麼結果、但不熟悉提示詞用語的人。它們也透露了目標市場:Image 2.0 被定位成處理可重複的創意任務,而不只是開放式的圖片生成。
小技巧
把範本當成起手流程,不是品質保證。請把最終的提示詞、參考圖的分工、 比例和被接受的輸出存下來,這樣你才能重現結果,而不必依賴一個 隨時會變的預設組合。
為影片鋪路的靜態圖世界觀建構流程
xAI 有一個例子是分開生成角色、場景、道具和第二個角色,同時讓整組素材維持同一套視覺語言。這是圖片生成和影片製作之間很實用的橋樑:先用靜態圖把世界觀立起來,確認素材,再讓選定的影格動起來。
它也比生成五張互不相干的展示圖更誠實地測試一致性。角色的臉、服裝、疤痕、環境和手上的道具,全都得撐過每一顆鏡頭。如果 Image 2.0 能讓這些細節熬過編輯和比例變化,那它在還沒生成任何一格影片之前,就已經對分鏡、關鍵影格和參考素材包很有用了。
Image 2.0 的跑分說法有多強?
根據 xAI 的發布文章,截至 2026 年 8 月 7 日,Image 2.0 在 Arena 的圖片編輯和文字生成圖片兩份排行榜上都排名第二。那是盲測偏好競技場,所以這個結果是有意義的訊號:在混合的提示詞集合裡,使用者比較喜歡它的輸出。
但它不是完整的產品評分。公告沒有公布 Elo 數值、信賴區間、分類別成績、價格調整後的表現、延遲、失敗率,也沒說壓在它上面的是哪個模型。總排名同樣無法告訴你 Image 2.0 在你那件特定任務上是不是第二好,例如多語言包裝、可重複的同一張臉,或透明背景的遊戲素材。
有用的讀法很簡單:Image 2.0 一推出就同時站在生成和編輯兩邊的前段,而不是只專精其中一邊。 下一份有用的證據,會是用同一條提示詞、同一組參考圖、同一個編輯遮罩和同一套驗收標準跨模型跑的獨立測試。
xAI 還沒公布的部分
這次發布把消費端功能講得很具體,對生產基礎設施則交代得比較不完整。截至 2026 年 8 月 8 日,xAI 在公告裡沒有提供這些細節:
- API 的模型 ID 或公開 API 的開放日期
- API 價格或每張圖片的成本
- 原生和最高輸出解析度
- 生成與編輯的延遲目標
- 檔案上限和支援的輸入格式
- Image 2.0 專屬的商業 API 條款
- 詳細的跑分成績或技術報告
也就是說,團隊今天可以評估消費端的 Quality Mode,但還沒辦法從公開的 API 文件去編列預算或自動化一條 Image 2.0 的生產流程。任何在 xAI 公布之前就宣稱確切 API 價格或限制的頁面,都是在自己填空。
API 還沒來之前該用哪個模型?
Grok Imagine Image 2.0 目前不在 OmniArt 的圖片模型選單裡。如果你現在就需要有 API 支撐或多模型的流程,請照 Image 2.0 賣點裡對你最重要的那一項來挑,而不是乾等這個名字。
| 如果你要的是 Image 2.0 的…… | OmniArt 上實際可用的起點 |
|---|---|
| 文字吃重的海報和有秩序的版面 | GPT Image 2 |
| 以參考素材驅動的產品或角色組 | Seedream 5.0 Pro |
| 快速的圖片生成與編輯迭代 | Nano Banana 2 或 Nano Banana 2 Lite |
| 低成本草稿,而且 Seed 可重複 | Qwen Image |
| 把一張已定案的靜態圖變成動態 | Grok Imagine 1.5 或其他圖生影片模型 |
重點不是某個替代品能完整重現 Image 2.0 的每一項功能,而是多數需求都只有一個主要風險。風險在文字,就測文字。風險在身分,就測一組參考素材。風險在活動素材改尺寸,就先做出母版,再逐一評估每個擴出來的比例,而不是比較各家的發布展示圖。
想看版面和擬真度的當前對決,請看 GPT Image 2 對上 Nano Banana 2。多參考編輯的部分,Seedream 5.0 Pro 發布指南整理了它的輸入和控制項。Qwen Image 指南則是早期草稿的低成本路線。
常見問題
Grok Imagine 2 和 Imagine Image 2.0 是同一個東西嗎?
通常是。「Grok Imagine 2」和「Grok Image 2」是 xAI 官方名稱 Imagine Image 2.0 的常見簡稱。官方產品以 Quality Mode 的形式放在 Grok Imagine 裡。
Imagine Image 2.0 是影片模型嗎?
不是。8 月 7 日的公告談的是圖片生成和圖片編輯。Grok Imagine 影片和 Grok Imagine 1.5 是另外的影片模型產品。
我可以在哪裡用 Grok Imagine Image 2.0?
xAI 說它已在 Grok.com Imagine 以及 iOS 和 Android 的 Grok App 上,以 Quality Mode 全面開放。
Grok Imagine Image 2.0 有 API 嗎?
還沒有。xAI 的發布頁面說 API 即將推出,但沒有提供開放日期、模型 ID 或 API 價格。
Image 2.0 支援幾張參考圖?
新的多參考編輯流程單次生成最多接受 5 張輸入圖片。
Image 2.0 最大的升級是什麼?
影響最大的升級,是生成和受控編輯的組合:密集版面與文字、針對區域的修改、參考素材構成、透明背景,以及生成式的改尺寸,全都收在同一條消費端流程裡。
在 OmniArt 上開始
如果你的優先順序是把素材做出來,而不是等一個串接,那就打開 OmniArt 圖片工作台,拿一份驗收用的需求跑兩個現有模型。提示詞、參考圖、畫面比例和過關/不過關的標準都保持一致。這樣你的決定是建立在自己的工作上,而不是別人的發布展示圖。
靜態圖定案之後,把它帶進影片工作台,或照著 Grok Imagine 圖生影片流程走。OmniArt 把圖片和影片模型放在同一個工作台裡,所以靜態圖的模型和動態的模型不必來自同一個服務商。等 Image 2.0 的 API 可以測了,它就能拿同一份需求來爭取自己的位置。
準備好開始創作了嗎?
用 AI 生成精彩內容