怎麼用 AI 圖片做出一整套品牌視覺
生成一張 AI 圖片很簡單,難的是第五張看起來還是同一個品牌。這裡是一套做出一致產品視覺的流程,以及規模一拉大就會出現的那個失敗模式。

生成一張有說服力的產品圖,已經不是難的部分了。難的是生成第五張,而它看起來還是同一個品牌——一樣的標誌結構、一樣的字體、一樣的標籤文案、一樣的材質、一樣的光。
Microsoft 在 MAI-Image-2.5 的頁面上,放了一組虛構蠟燭品牌 ORVA 的範例圖。當成行銷來看,那就是五張好看的圖。當成證據來看,它有用得多:它是一個實作範例,示範了一整組圖裡什麼守得住、什麼會悄悄走鐘,以及走鐘會落在哪裡。這讓它很適合當成一條你可以在任何夠強的圖片模型上跑的流程的骨架。
這份指南談的是怎麼做出一整套品牌視覺:生成的順序、每一顆鏡頭要怎麼寫才能讓品牌活下來,以及一整組圖變大時一定會出現的那個失敗模式。
一整套視覺必須守住什麼
一張圖只要好看就好。一整組圖必須自己跟自己一致。在生成任何東西之前,先寫下每一張都必須一模一樣的東西——這就是你的驗收清單:
| 不可變的部分 | ORVA 這一組的內容 |
|---|---|
| 字標 | 高對比襯線體的「ORVA」,字距很寬 |
| 次要文案 | 「SCENTED CANDLE / BOUGIE PARFUMÉE」 |
| 小字說明 | 「NET WT. 8.5 OZ | 240 G」 |
| 容器 | 琥珀色玻璃杯,霧面,底部一圈黑色色帶 |
| 色彩 | 琥珀色、黑色字、暖白色檯面 |
| 光線 | 硬質的方向性日光,加上柔和的樹葉陰影 |
清單以外的東西都可以變——正是這一點讓它成為一整組,而不是五張複製品。清單短是刻意的。不可變的清單有多長,模型可以搞砸的東西就有多長。
步驟 1:在最單純的表面上把識別鎖死
從干擾元素最少的那一張開始。對品牌標記來說,就是它單獨躺在一種素材上:

這張圖只有一個任務:把字形做對。沒有產品、沒有場景,也沒有次要文案來搶保真度。壓凸在這裡是個好用的招數,因為它逼模型對單一而一致的字形結構做出承諾——壓凹的邊緣必須沿著真正的字形走,錯誤就會浮出來,而不是躲在平面文字裡。
這張一旦定案,它就是後面每一張的參考圖。不要在後續提示詞裡再用文字把標誌推導一次;把它帶著走。
小技巧
在生成任何一張產品圖之前,先讓識別樣張定案。後面每一張都會繼承它的錯誤,而在第五張才修字標,意味著第一到第四張都要重做才能對上。
步驟 2:做出主視覺產品圖
第二張圖加進容器和完整標籤,一樣放在中性檯面上,配可控的光線:

這張圖必須完美,因為之後每一張都要拿它來對照。有三個細節特別值得檢查:
- 帶重音的字元。 「PARFUMÉE」裡有一個 É。重音符號、連字和非拉丁文字,是圖上文字最先失守的地方——而蠟燭標籤上的一行法文,正是那種印出來之前沒有人會校對的小字。
- 單位那一行。 「NET WT. 8.5 OZ | 240 G」裡混了小數點、兩套單位制和一個直線符號。如果你的標籤有法規或法定資訊,就在這裡驗證模型守不守得住。
- 文字層級。 字標最大、產品說明次之、小字說明最小。一個把每個字都拼對、卻讓三塊文字視覺份量相同的模型,做出來的是一張不能用的標籤。
步驟 3:把產品放進場景
主視覺定案之後,這一組就往場景展開。每一張新圖換掉環境,同時繼承產品:

這種鏡頭的提示詞,應該讀起來像環境加上繼承而來的產品,而不是一段全新的描述。場景寫細節,產品用參考來指:
Place the approved candle on a light oak coffee table in a sunlit living room. Keep the label, glass colour, and black base band exactly as in the reference. Blurred mid-century armchair and woven vase in the background, hard morning light, soft shadows across the table.
形容詞全部給環境。產品拿到的是一句保留指示。反過來做——每一張都把蠟燭重新描述一次——就是一整組圖走鐘的原因,因為每一段新描述,都是模型重新詮釋標籤的一次新機會。
步驟 4:加上動態和氛圍鏡頭
不是每一張都得清晰可讀。有些存在的意義是節奏:

這張值得仔細看,因為它示範了可接受的柔化和走鐘之間的差別。字標仍然清楚,小字說明不清楚。在一張動態圖裡,這在物理上是對的——一個翻滾中的罐子,小字本來就該讀不出來。判準是:這個讀不出來,在畫面裡有沒有被說明的成因。動態造成的模糊是一種風格;鏡頭固定、產品靜止卻模糊,那是缺陷。
步驟 5:合照,以及一整組圖真正崩掉的地方
最後一張把產品放進同伴之中——每個品牌都需要的產品組合圖:

看左邊那支壓瓶。它的標籤上滿是像文字的痕跡,但那不是任何語言裡的字。然後回頭看同一張圖裡蠟燭自己的小字說明——「SCENTED CANDLE / BOUGIE PARFUMÉE」和單位那一行,都明顯比主視覺圖裡更軟、更歪。
這就是值得內化的失敗模式,而且它不是隨機的:保真度跟著注意力走。 提示詞點名的元素會被畫對,只是「順便在畫面裡」的元素,則會在該有文字的地方拿到看起來合理的紋理。當你往畫面裡加東西,模型分給任何單一物件的預算就變少——所以道具最多的那張,最容易在你沒想到的某張標籤上長出亂碼。
注意
品牌視覺組就是在合照上崩掉的,而且崩得很安靜——標誌畫錯很明顯,但背景裡一支寫著偽文字的瓶子,在有人放大之前都只讀作「一支瓶子」。合照定案之前,請用完整解析度檢查畫面裡每一個讀得到的表面,不要只看主角產品。
實際的對策不是不拍合照,而是為它做規劃:
- 次要物件乾脆不要有文字。 沒有品牌、沒有標籤的同伴,在平拍裡既更真實,也不可能畫錯。
- 每一張只指定一個主角。 明講哪一個物件必須帶正確的品牌資訊,其他的就用通用的形狀和材質描述。
- 先做構圖,標籤留到第二次編輯。 先把擺法生成出來,再用一次針對性的編輯,把正確的文字放到那一件真正需要的產品上。
- 裁切當備案。 如果背景標籤變成雜訊、但構圖其他地方都對,裁得緊一點比重新生成快得多。
讓這套流程成立的順序
整條流程只是同一個原則做了五次——先立起不能變的東西,再把它周圍的一切都換掉:
- 識別樣張。 標記單獨放在單純素材上,先確認字形。
- 主視覺產品。 完整標籤、中性檯面、可控光線。檢查重音、單位和層級。
- 生活情境。 換環境,產品靠參考圖和保留指示帶過去。
- 氛圍與動態。 只要畫面說明了成因,柔化就沒問題。
- 合照。 一個被指定的主角、沒有品牌的同伴,以及完整解析度的檢查。
每一步都繼承上一步,而不是重新開始。這就是「一整組」和「五張長得有點像的蠟燭圖」之間的差別。
常見問題
我要怎麼讓標誌在多張 AI 生成圖片之間保持一致?
先讓單一張識別圖定案,然後把它當成參考圖帶著走,而不是在每一條提示詞裡把標誌重新描述一次。每一段新的文字描述,都是模型重新詮釋字形的一次新機會。
為什麼 AI 圖片裡的文字會變成亂碼?
最常見的原因,是承載那段文字的元素沒有被提示詞點名。模型會把保真度分配給被問到的東西;沒被點名的物件,拿到的是像文字的紋理。字太小、有重音或非拉丁字元,以及畫面太擠,也都會造成同樣的結果。
一整組產品圖該用幾張參考圖?
先從一張定案的識別圖或主視覺圖開始,只為那些真的必須延續的東西加參考——通常就是產品和它的標籤。參考圖不是越多越好,每一張都在搶對結果的影響力。
一整組品牌視覺應該用一條提示詞還是好幾條生成?
好幾條。一條提示詞做一顆鏡頭,每一張都繼承已定案的產品,這樣每張圖之後都有一個檢查點,出問題時也找得到明確的兇手。用一條提示詞一次要五張,你就沒辦法把失敗隔離出來。
產品圖定案之前該檢查什麼?
至少要看:字標結構、標籤上每一行文案(包含重音和單位)、文字層級、容器的材質和顏色,以及次要物件上任何讀得到的文字。要用完整解析度檢查,不是看縮圖。
AI 產品圖可以商業使用嗎?
這取決於模型的條款、你對上傳參考素材所擁有的權利,以及輸出有沒有侵害第三方的商標或設計。為一個不屬於你的品牌生成品牌感的圖像,帶有實際的風險——發布之前,先確認服務商的商業使用條款。
在 OmniArt 上開始
打開 OmniArt 圖片工作台,拿你自己的品牌跑前兩個步驟:一張識別樣張,然後一張帶完整標籤的主視覺產品圖。做到這裡先停下來,用完整尺寸檢查小字說明再往下走——這兩張圖會決定剩下三張值不值得生成。
每一步背後的提示詞技巧,可以看 Microsoft 公布的那四條提示詞,裡面談了怎麼點名一個物件讓編輯留在局部;Seedream 5.0 Pro 發布指南則談了它的參考圖控制項。靜態圖定案之後,OmniArt 把圖片和影片模型放在同一個工作台裡,所以一張定案的主視覺可以直接接上動態,不必到別的地方把品牌再蓋一次。
準備好開始創作了嗎?
用 AI 生成精彩內容