Update模型與觀察閱讀時間 17 分鐘

Grok Imagine 2 解析:Image 2.0 到底上線了什麼

Grok Imagine 2 就是 xAI 的 Imagine Image 2.0。這次上線了什麼:精準編輯、五張參考圖、智慧調整尺寸、範本、跑分和限制。

OmniArt 團隊
Grok Imagine 2 解析:Image 2.0 到底上線了什麼

很多人搜尋的關鍵字是 Grok Imagine 2,但 xAI 的官方名稱是 Imagine Image 2.0。它在 2026 年 8 月 7 日推出,是 Grok Imagine 的 Quality Mode 裡一個全新的圖片生成與編輯模型——不是 Grok 聊天機器人的升級,也不是影片用的 Grok Imagine 2.0。

實際的改變在於控制力。Image 2.0 是為密集版面、看得懂的文字、針對性的編輯、透明背景素材、多參考圖構成,以及把一張已定案的圖片改成新畫面比例而打造的。它現在已在 xAI 的消費端產品全面開放;xAI 說 API 存取還要再等一下。

這篇指南要把這次發布和坊間簡稱分開:Grok Imagine Image 2.0 是什麼、實際上線了什麼、xAI 的跑分說法代表什麼,以及當你需要 API 或多模型流程時,今天有什麼可以用。

Grok Imagine 2 是什麼?

Grok Imagine 2 通常指的是 Imagine Image 2.0,也就是 xAI 目前的圖片生成與編輯模型。它以全新的 Quality Mode 形式,在 Grok.com Imagine 和 Grok 行動 App 上推出。8 月的公告談的是靜態圖片和圖片編輯;Grok Imagine 的影片模型仍然是另一條產品線。

發布細節xAI 公布的內容
官方名稱Imagine Image 2.0
常見搜尋名稱Grok Imagine 2、Grok Image 2、Grok Imagine Image 2
推出日期2026 年 8 月 7 日
目前可用管道Grok.com Imagine、iOS 和 Android 上的 Quality Mode
主要任務文字生成圖片與圖片編輯
參考輸入單次生成最多 5 張圖片
介面提供的比例1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9 和 2:1
API 狀態即將推出

名字之所以重要,是因為「Grok Imagine 2」很容易被誤會成 Grok Imagine 1.5 影片的後繼版本。它不是。如果你的需求是一段有動作和聲音的片子,你要比的仍然是影片模型。如果你的需求是海報、產品圖、插畫素材或有控制的照片編輯,那 Image 2.0 才是相關的這一次發布。

Grok Imagine Image 2.0 實際上線了什麼

xAI 把 Image 2.0 圍著生產工作組織起來,而不是一次性的生成。這次發布有六個具體部分:更強的指令服從度、文字與版面規劃、精準編輯、多參考輸入、智慧調整尺寸,以及針對特定任務的範本。

更好的指令服從、文字與版面

Image 2.0 的設計目標是讓密集、多段落的提示詞保持連貫。xAI 特別點名小字、字體排版,以及有好幾個視覺元素的版面。這把這個模型放進了海報生成、資訊圖表、教學單張、菜單、包裝概念和編輯風圖像的評比裡——而不只是電影感的單一主體圖片。

關鍵字是規劃。一個模型可以把標題拼對,卻仍然毀掉整張素材:層級塌掉、邊界擠成一團,或每一塊都給同樣的視覺重量。xAI 的說法是,Image 2.0 會把字體排版和構圖一起規劃,讓整個版面站得住。

說明

xAI 在發布文章裡沒有公布文字準確率,沒有原生輸出解析度, 也沒有詳細的字體排版跑分。「小字更銳利」這句話,在能跨語言、 跨字體風格和密集版面實測之前,都只是服務商單方面的說法, 而不是已經驗證的事實。

想留在局部的局部編輯

圖片編輯才是這次發布比單純畫質升級更有用的地方。Image 2.0 多了好幾種指定修改對象的方式:

  • 魔術棒編輯把模型指向你想改的區域。
  • 分割選取在編輯之前先精準選出某個物件或區塊。
  • 去背把主體以透明背景輸出,方便拿去別的地方用。
  • 提示詞編輯只改選定的內容,畫面其餘部分保留。

它承諾的不只是「把產品改成紅色」,而是「把這件產品改成紅色,同時不重新設計包裝、不移動鏡頭、不換掉桌子、不改變光線」。那個「保留」,正是圖片生成器和團隊可以反覆使用的編輯步驟之間的差別。

最多五張參考圖

多參考編輯單次生成最多接受 5 張輸入圖片。每張參考圖可以有不同的任務:一張給主體、一張給產品、一張給環境、一張給材質或顏色,還有一張給整體的美術方向。

用角色分工的提示詞,比叫模型「把這些圖片合起來」清楚得多:

Use image 1 for the person's identity and expression. Use image 2 for the jacket's exact shape and lilac color. Use image 3 for the studio background. Use image 4 only for the soft side lighting. Compose a waist-up campaign portrait without copying text or logos from any reference.

五張輸入對很多品牌宣傳、角色和產品合成的需求來說夠用了。但它們本身不等於一致性的證明。真正的考驗是:同樣的身分、比例、材質和品牌細節,能不能撐過好幾次輸出和後續編輯。

跨九種畫面比例的智慧調整尺寸

智慧調整尺寸會改變畫布,並把新露出來的畫面填滿,而不是把原圖拉伸或粗暴地裁掉。發布時的介面上有九種比例,從高瘦的 1:2 橫幅到寬的 2:1 構圖。

這讓一張已定案的圖片更容易延伸成一整組交付素材:

  1. 先在 1:1 或 4:3 定案主構圖。
  2. 擴成 9:16 當限時動態或 Reel 的封面。
  3. 重新構成 16:9,給影片、簡報或網頁使用。
  4. 用 2:1 做寬版的活動橫幅。
  5. 每個版本輸出前都檢查有沒有憑空生出的物件、複製的四肢和位移的文字。

智慧調整尺寸應該被理解成生成式的向外延伸,而不是可預期的響應式設計。模型會在原本畫面之外創造內容,所以每一種比例都是一張需要重新檢查的新圖。

為可重複任務準備的範本

xAI 同時推出了把常見流程預先設定好的範本。第一批涵蓋照片編輯、產品改色、編輯風產品海報、拼貼、換背景、電商和 UGC 照片、專業形象照、吉祥物、圖示、角色圖素、UI 套件、表情符號和周邊商品。

範本能省下設定時間,特別是對那些知道要什麼結果、但不熟悉提示詞用語的人。它們也透露了目標市場:Image 2.0 被定位成處理可重複的創意任務,而不只是開放式的圖片生成。

小技巧

把範本當成起手流程,不是品質保證。請把最終的提示詞、參考圖的分工、 比例和被接受的輸出存下來,這樣你才能重現結果,而不必依賴一個 隨時會變的預設組合。

為影片鋪路的靜態圖世界觀建構流程

xAI 有一個例子是分開生成角色、場景、道具和第二個角色,同時讓整組素材維持同一套視覺語言。這是圖片生成和影片製作之間很實用的橋樑:先用靜態圖把世界觀立起來,確認素材,再讓選定的影格動起來。

它也比生成五張互不相干的展示圖更誠實地測試一致性。角色的臉、服裝、疤痕、環境和手上的道具,全都得撐過每一顆鏡頭。如果 Image 2.0 能讓這些細節熬過編輯和比例變化,那它在還沒生成任何一格影片之前,就已經對分鏡、關鍵影格和參考素材包很有用了。

Image 2.0 的跑分說法有多強?

根據 xAI 的發布文章,截至 2026 年 8 月 7 日,Image 2.0 在 Arena 的圖片編輯和文字生成圖片兩份排行榜上都排名第二。那是盲測偏好競技場,所以這個結果是有意義的訊號:在混合的提示詞集合裡,使用者比較喜歡它的輸出。

但它不是完整的產品評分。公告沒有公布 Elo 數值、信賴區間、分類別成績、價格調整後的表現、延遲、失敗率,也沒說壓在它上面的是哪個模型。總排名同樣無法告訴你 Image 2.0 在你那件特定任務上是不是第二好,例如多語言包裝、可重複的同一張臉,或透明背景的遊戲素材。

有用的讀法很簡單:Image 2.0 一推出就同時站在生成和編輯兩邊的前段,而不是只專精其中一邊。 下一份有用的證據,會是用同一條提示詞、同一組參考圖、同一個編輯遮罩和同一套驗收標準跨模型跑的獨立測試。

xAI 還沒公布的部分

這次發布把消費端功能講得很具體,對生產基礎設施則交代得比較不完整。截至 2026 年 8 月 8 日,xAI 在公告裡沒有提供這些細節:

  • API 的模型 ID 或公開 API 的開放日期
  • API 價格或每張圖片的成本
  • 原生和最高輸出解析度
  • 生成與編輯的延遲目標
  • 檔案上限和支援的輸入格式
  • Image 2.0 專屬的商業 API 條款
  • 詳細的跑分成績或技術報告

也就是說,團隊今天可以評估消費端的 Quality Mode,但還沒辦法從公開的 API 文件去編列預算或自動化一條 Image 2.0 的生產流程。任何在 xAI 公布之前就宣稱確切 API 價格或限制的頁面,都是在自己填空。

API 還沒來之前該用哪個模型?

Grok Imagine Image 2.0 目前不在 OmniArt 的圖片模型選單裡。如果你現在就需要有 API 支撐或多模型的流程,請照 Image 2.0 賣點裡對你最重要的那一項來挑,而不是乾等這個名字。

如果你要的是 Image 2.0 的……OmniArt 上實際可用的起點
文字吃重的海報和有秩序的版面GPT Image 2
以參考素材驅動的產品或角色組Seedream 5.0 Pro
快速的圖片生成與編輯迭代Nano Banana 2 或 Nano Banana 2 Lite
低成本草稿,而且 Seed 可重複Qwen Image
把一張已定案的靜態圖變成動態Grok Imagine 1.5 或其他圖生影片模型

重點不是某個替代品能完整重現 Image 2.0 的每一項功能,而是多數需求都只有一個主要風險。風險在文字,就測文字。風險在身分,就測一組參考素材。風險在活動素材改尺寸,就先做出母版,再逐一評估每個擴出來的比例,而不是比較各家的發布展示圖。

想看版面和擬真度的當前對決,請看 GPT Image 2 對上 Nano Banana 2。多參考編輯的部分,Seedream 5.0 Pro 發布指南整理了它的輸入和控制項。Qwen Image 指南則是早期草稿的低成本路線。

常見問題

Grok Imagine 2 和 Imagine Image 2.0 是同一個東西嗎?

通常是。「Grok Imagine 2」和「Grok Image 2」是 xAI 官方名稱 Imagine Image 2.0 的常見簡稱。官方產品以 Quality Mode 的形式放在 Grok Imagine 裡。

Imagine Image 2.0 是影片模型嗎?

不是。8 月 7 日的公告談的是圖片生成和圖片編輯。Grok Imagine 影片和 Grok Imagine 1.5 是另外的影片模型產品。

我可以在哪裡用 Grok Imagine Image 2.0?

xAI 說它已在 Grok.com Imagine 以及 iOS 和 Android 的 Grok App 上,以 Quality Mode 全面開放。

Grok Imagine Image 2.0 有 API 嗎?

還沒有。xAI 的發布頁面說 API 即將推出,但沒有提供開放日期、模型 ID 或 API 價格。

Image 2.0 支援幾張參考圖?

新的多參考編輯流程單次生成最多接受 5 張輸入圖片。

Image 2.0 最大的升級是什麼?

影響最大的升級,是生成和受控編輯的組合:密集版面與文字、針對區域的修改、參考素材構成、透明背景,以及生成式的改尺寸,全都收在同一條消費端流程裡。

在 OmniArt 上開始

如果你的優先順序是把素材做出來,而不是等一個串接,那就打開 OmniArt 圖片工作台,拿一份驗收用的需求跑兩個現有模型。提示詞、參考圖、畫面比例和過關/不過關的標準都保持一致。這樣你的決定是建立在自己的工作上,而不是別人的發布展示圖。

靜態圖定案之後,把它帶進影片工作台,或照著 Grok Imagine 圖生影片流程走。OmniArt 把圖片和影片模型放在同一個工作台裡,所以靜態圖的模型和動態的模型不必來自同一個服務商。等 Image 2.0 的 API 可以測了,它就能拿同一份需求來爭取自己的位置。

準備好開始創作了嗎?

用 AI 生成精彩內容

免費開始