怎麼用 AI 把一個人合成進照片:一步一步做
用 AI 把人合成進照片:在 OmniArt 上靠多圖融合、參考照片、局部修改和對上的光線,把一個人自然地放進一張圖裡。

要用 AI 把一個人加進照片,你其實不是在貼一張去背圖——你是在要求一個圖片模型重新算過一張照片,好讓第二個人真的屬於那個畫面。模型必須把人放在一個合理的位置、依場景調整大小、重新打光讓他融進去,還要在他腳下放一道影子。這四件事做對了,結果讀起來就是一張照片。少一件,它讀起來就是一張貼紙。
在 OmniArt 上,這是圖片模型的工作,不是圖層編輯器的工作。你上傳底圖、上傳那個人的參考照片,然後在提示詞裡描述這個合成。Seedream 5.0 Pro 很擅長這件事,因為它支援多圖融合——最多 10 張參考圖融進一張輸出——再加上可以精準控制修改落點的區域和錨點用語。GPT Image 2 吃自然語言的修改指令;如果你想對同一組輸入拿到第二種詮釋,Nano Banana 2 也能做靠參考圖引導的修改。
這份指南照順序走完整套流程:挑照片、挑模型、寫定位提示詞、修掉不對的地方,最後鎖定成品。裡面有三組可以直接貼上的提示詞。
模型實際上在做什麼
在寫提示詞之前先理解機制會有幫助。當你餵進兩張圖和一道指令,模型不是在合成像素——它是在以這兩張圖為條件生成一張新圖。這件事有兩個實務後果。
第一,就算是你沒提到的區域,底圖也可能有些微變化。背景會位移、桌緣會挪動、招牌上的字會亂掉。你可以在提示詞裡明確保護畫面的其他部分來降低這種情況,這和讓局部修改成立的紀律是同一套。
第二,識別完全來自那張參考照片。如果參考照太小、模糊、濾鏡下太重,或者拍攝角度離你想要的輸出角度很遠,模型就會自己補上那個差距——而被補出來的臉會走鐘。在這件事上,參考照做的工比提示詞多。
步驟一:挑底圖和人物參考照
爛的輸入比爛的提示詞更花迭代次數,所以請在這裡多花一分鐘。
底圖應該要有一塊明顯可以站人或坐人的空位、看得出來的光線方向,以及看得見的地面或地板,好讓影子有地方落。避開那種所有合理位置都被家具擋住的照片,也避開極端廣角——透視變形很難對上。
人物參考照應該是一張乾淨、光線良好的照片,理想上拍攝角度和距離要接近你要的成品。成品要全身,參考照就要全身。平淡的光勝過戲劇性的光,因為平光比帶硬陰影的肖像更好重新打光。如果這個人必須穿某一套衣服出現,參考照裡就該已經穿著那套衣服。
小技巧
如果你手上有同一個人的好幾張可用照片,就上傳兩三張,不要只上傳一張。Seedream 5.0 Pro 最多吃 10 張參考圖,多一個角度對臉部一致性有可測量的幫助。不過要保持一致——把 2019 年的照片和最近的照片混在一起,等於給了模型兩個身分去平均。
步驟二:挑模型
這三個模型都在 OmniArt 的圖片工作台裡,而且都能在提示詞之外接受上傳的參考圖。
| 模型 | 在這件事上的強項 | 什麼時候用它 |
|---|---|---|
| Seedream 5.0 Pro | 多圖融合、區域與錨點用語、精確的材質和顏色指示 | 合成本身就是主要工作——多張參考圖、精準定位,或指定的服裝顏色 |
| GPT Image 2 | 自然語言修改,很貼近對話式指令 | 你想用平鋪直敘的句子描述改動,用聊天的方式迭代 |
| Nano Banana 2 | 靠參考圖引導的修改,出圖快 | 在下決定之前,想用同一組輸入拿一個便宜的第二種詮釋 |
一個合理的預設:定位和識別兩件事都重要時,先用 Seedream 5.0 Pro。如果合成很單純——一個人、位置明顯、光線寬容——GPT Image 2 通常用更少的字就到位了。
步驟三:寫定位提示詞
在這件事上有效的提示詞有四個部分,順序如下:
- 指令——把參考照裡的人加進底圖。
- 位置和比例——他站在哪裡、在做什麼、相對於畫面裡某個已知物件有多大。
- 光線和陰影的對接——底圖裡光的方向和質地,以及影子落在哪裡。
- 保護——底圖裡所有必須維持不變的東西。
這是一個可以拿去改的可用版本:
Add the woman from the second reference photo into the first photo. Place her standing on the left side of the wooden deck, facing the camera, weight on her right leg, with her head roughly level with the top of the deck railing behind her. Match the base photo's lighting exactly: late-afternoon sun from the upper right, warm tone, soft-edged shadows. Cast her shadow down and to the left across the deck boards. Keep the deck, railing, plants, sky, and every other element of the base photo unchanged.
注意 "her head roughly level with the top of the deck railing" 對比例的幫助,遠遠大過「中等大小」這種說法。把人錨定在畫面裡已經可以量的東西上,是這類提示詞裡最有用的比例技巧。
一個坐姿的變體,合成範圍比較小,通常也比較好做:
Insert the man from the reference photos into the café scene, seated in the empty chair on the right side of the table, three-quarter view turned slightly toward the window, hands resting on the table. Scale him so his shoulders sit just below the top of the chair back. Light him from the window on the left with soft diffused daylight matching the base image, with a faint contact shadow where his forearms meet the table. Do not alter the table, cups, other people, or the background.
步驟四:用區域指定的修改來打磨
第一次算出來的圖很少就是成品,而多數人犯的錯是把整組提示詞重跑一次。不要。拿那張定位對了的輸出,用限定區域的指令一次修一件事。Seedream 5.0 Pro 就是為這個設計的——用人講話的方式點名一個區域、一個錨點或一個位置(「左下角」、「右邊數來第二個」),修改就會留在局部。
Using this image, adjust only the added figure: soften the edge along her right shoulder so it blends with the background wall, warm her skin tones slightly to match the surrounding light, and extend her shadow another twenty percent to the left. Change nothing else in the frame.
兩三次這種指定修改,通常勝過十次整組重跑,而且更便宜。想再往前推的話,Seedream 5.0 Pro 提示詞指南更深入談了區域、錨點和十六進位色碼的寫法。
說明
OmniArt 提供標準的圖片生成和參考圖生成。座標框、草圖疊層和錨點釘選是上游 API 的工作流,不是 OmniArt 專屬的介面控制項——在工作台裡,你把它們寫成提示詞裡的文字。這樣做行得通,只是負責指路的變成精準的語言。
步驟五:鎖定最終成品
等定位、識別和光線都守住了,就直接用你真正需要的解析度跑最後一次,不要繼續在一張小草稿上改。把通過的合成用模型支援的最大尺寸重新算一次——如果輸出解析度是決定性因素,Seedream 5.0 Lite 提供原生 4K——並且在交件前用 100% 的比例檢查結果。邊緣光暈和對不上的顆粒在縮圖尺寸看不見,放到原尺寸就一目了然。
對上光線、透視、比例和陰影
大部分看起來怪、但觀眾又說不出哪裡怪的合成,都出在這四種失敗模式。
- 光的方向。 先讀底圖的陰影,再把方向寫進提示詞("from the upper right"、"from the window on the left")。如果人物參考照是從相反方向打光的,就明說:「把人物從右側重新打光;參考照左側的光不要帶過來。」
- 光的質地。 硬太陽給你邊緣銳利的影子;陰天和室內光給你柔和的影子。一個柔光的人放進硬太陽的場景裡,看起來就是貼上去的。要指名質地,不能只講方向。
- 透視和機位高度。 如果底圖是從腰部高度拍的,而參考照是手機舉在眼睛高度拍的,這個人在畫面裡就會坐得不對。加上「對上底圖的低機位,略帶仰角」,模型就會調整人物的透視縮短。
- 比例。 永遠把身高綁在畫面裡的某個東西上——一道門框、一根欄杆、一張椅背、另一個人的肩膀。絕對的描述沒辦法安全地翻譯成像素。
- 接觸陰影。 身體和表面相接的那一小塊暗部,才是賣出物理存在感的東西。直接點名要它:「兩隻鞋和地面相接的地方各有一道柔和的接觸陰影。」
- 顆粒和顏色。 要求模型對上底圖的顆粒、色溫和任何鏡頭上的柔化。一個乾淨的人站在有顆粒的照片裡,一眼就露餡。
疑難排解
臉不像那個人。 你的參考照出的力太少。多上傳同一個人的其他角度、優先選解析度高的,並且把濾鏡下太重的照片拿掉。然後明確要求:「保留參考照裡的五官、髮際線和髮色,不要風格化。」
背景變了。 你的保護句寫得太籠統。把元素一個一個列出來,不要只說「保持背景不變」。然後跑一次限定區域的修正,而不是重新生成。
人在飄。 少了接觸陰影,或是腳被裁得很模糊。直接要求接觸陰影,並且確認你放人的那個位置看得見地面。
大小不對。 把所有絕對尺寸的說法,換成和畫面裡既有物件的比較。
邊緣看起來像剪下來的。 要求沿著人物輪廓做邊界柔化和顆粒對接,並且檢查參考照是不是硬去背的背景——白底去背圖會鼓勵模型產出看起來像剪貼的結果。
姿勢很僵。 描述重心分配和手的位置。"Weight on her right leg, one hand in her jacket pocket" 產生的站姿,比 "standing naturally" 自然得多。
注意
把一個真實、可辨識的人加進一張他本來不在的照片裡,等於做出一張暗示了不實內容的圖。生成之前、發布之前,都要取得那個人明確的同意。不要在沒有同意的情況下,把公眾人物、同事、前任或兒童合成進場景裡。不要做出暗示某人出席某個活動、代言某個產品,或人在某個地方的圖。查一下你要發布的平台規則——很多平台要求揭露經 AI 修改的真人影像——並且在遵守 OmniArt 條款之外,也遵守當地關於肖像權的法律。
在 OmniArt 上開始
挑一張有明顯空位的底圖,和一張乾淨、光線良好的人物參考照。打開 OmniArt 圖片工作台,選 Seedream 5.0 Pro,兩張都傳上去,把步驟三那組露臺提示詞換成你自己的細節跑一次。第一張出來時只評判定位和比例——識別和光線是後面打磨那幾輪的事。
然後用小修正推進,不要每次都寫新的提示詞。兩次限定區域的修改加上一次全解析度的最終輸出,是正常的路徑,而且它能在人物慢慢到位的同時,把底圖保持完整。
準備好開始創作了嗎?
用 AI 生成精彩內容