如何用 AI 把一个人加进照片里:完整分步教程
用 AI 把人物合成进照片:在 OmniArt 上借助多图融合、参考照片、区域定向编辑和匹配光影比例,一步步把人自然地放进画面,而不是看起来像贴纸。

用 AI 把一个人加进照片,你做的其实不是贴一张抠图,而是让图片模型把一张照片重新渲染一遍,好让第二个人真的属于这个画面。模型得把这个人放在一个合理的位置、按场景调好大小、重新打光以匹配环境,再在脚下投一道影子。这四件事都做对,结果读起来就是一张照片;漏掉一件,它读起来就是一张贴纸。
在 OmniArt 上,这是一件图片模型的活,不是图层编辑器的活。你上传底图、上传那个人的参考照片,再在提示词里描述这次合成。Seedream 5.0 Pro 处理这类任务很好,因为它支持多图融合——最多 10 张参考图融进一次输出——再加上用来精确控制编辑落点的区域和锚点语言。GPT Image 2 接受自然语言的编辑指令,而当你想对同一组输入拿到第二种解读时,Nano Banana 2 可以做参考引导的编辑。
这篇指南按顺序走完整个流程:选照片、选模型、写放置提示词、修掉不对的地方,最后定稿输出。文中包含三条可直接复制的提示词。
模型实际上在做什么
写提示词之前先理解机制会很有帮助。当你喂进两张图和一条指令时,模型并不是在合成像素,而是在以这两个输入为条件生成一张新图。这带来两个实际后果。
第一,底图在你没提到的区域也可能发生轻微变化。背景会挪动,桌沿会偏移,招牌上的文字会变成乱码。要减少这种情况,就在提示词里明确保护画面的其余部分——这和让区域编辑生效的是同一套纪律。
第二,人物的身份完全来自那张参考照片。如果参考图很小、很模糊、加了很重的滤镜,或者拍摄角度离你想要的输出角度差得很远,模型就会自己发明这中间的差额——而被发明出来的脸会飘。在这件事上,参考照片起的作用比提示词更大。
第一步:挑好底图和人物参考照
糟糕的输入比糟糕的提示词更花迭代次数,所以在这里多花一分钟。
底图 应该有一处明显能站人或坐人的空位、一个读得出来的光线方向,以及可见的地面或地板,好让影子有地方落。避开那些每个合理位置都被家具挡住的照片,也避开极端广角的照片——那种透视变形很难匹配。
人物参考照 应该是一张干净、光线充足的照片,最好拍摄角度和距离大致就是你想要的成图效果。如果这个人在成图里是全身,参考照就用全身。中性的光线胜过戏剧性的光线,因为平光比硬阴影的人像更容易重新打光。如果这个人需要穿某一套衣服,参考照里就应该已经穿着那套衣服。
提示
如果你有同一个人的好几张可用照片,就上传两三张而不是一张。Seedream 5.0 Pro 最多接受 10 张参考图,而多一个角度能明显提升面部一致性。但要保持它们彼此一致——把 2019 年的照片和现在的照片混在一起,等于给模型两个身份让它去取平均。
第二步:挑模型
这三个模型都在 OmniArt 图片工作台里,也都能在提示词之外接受上传的参考图。
| 模型 | 在这件任务上的强项 | 什么时候选它 |
|---|---|---|
| Seedream 5.0 Pro | 多图融合、区域与锚点语言、精确的材质与颜色指令 | 合成本身就是主任务——参考图不止一张、放置位置要精确,或者衣服颜色有明确要求 |
| GPT Image 2 | 自然语言编辑,能紧跟对话式指令 | 你想用日常句子描述改动,靠聊天式来回迭代 |
| Nano Banana 2 | 参考引导的编辑,出图快 | 在正式投入之前,想用低成本换一个对同样输入的第二种解读 |
一个合理的默认选择:只要放置位置和人物身份都重要,就从 Seedream 5.0 Pro 开始。如果这次合成很简单——一个人、位置明显、光线宽容——GPT Image 2 往往用更少的字就能到位。
第三步:写放置提示词
一条在这类任务上有效的提示词有四个部分,顺序如下:
- 指令 —— 把参考照片里的人加进底图。
- 位置与比例 —— 他站在哪里、在做什么、相对画面里某个已知物体有多大。
- 光影匹配 —— 底图光线的方向和质感,以及影子落在哪里。
- 保护 —— 底图里所有必须保持一模一样的东西。
下面是一个你可以直接改用的版本:
Add the woman from the second reference photo into the first photo. Place her standing on the left side of the wooden deck, facing the camera, weight on her right leg, with her head roughly level with the top of the deck railing behind her. Match the base photo's lighting exactly: late-afternoon sun from the upper right, warm tone, soft-edged shadows. Cast her shadow down and to the left across the deck boards. Keep the deck, railing, plants, sky, and every other element of the base photo unchanged.
注意“头顶大致与露台栏杆顶端齐平”对比例的作用,远超过“中等大小”这种说法。把人物锚定在画面里某个已经可以量的东西上,是这类提示词里最有用的比例技巧。
再来一个坐姿版本,这种合成通常更小、也更容易:
Insert the man from the reference photos into the café scene, seated in the empty chair on the right side of the table, three-quarter view turned slightly toward the window, hands resting on the table. Scale him so his shoulders sit just below the top of the chair back. Light him from the window on the left with soft diffused daylight matching the base image, with a faint contact shadow where his forearms meet the table. Do not alter the table, cups, other people, or the background.
第四步:用区域定向的编辑来修
第一次渲染很少就是终稿,而大多数人犯的错是把整条提示词重新跑一遍。别这样。拿那张位置放对了的输出,用限定区域的指令一次只改一处。Seedream 5.0 Pro 就是为这个而生的——按人会读出来的方式指名一个区域、一个锚点或一个位置(“左下角”、“右边第二个”),编辑就会留在局部。
Using this image, adjust only the added figure: soften the edge along her right shoulder so it blends with the background wall, warm her skin tones slightly to match the surrounding light, and extend her shadow another twenty percent to the left. Change nothing else in the frame.
两三轮这样的定向修改,通常胜过十次整条重跑,而且更便宜。如果你想往更深处推,Seedream 5.0 Pro 提示词指南 更详细地讲了区域、锚点和十六进制色值的写法。
说明
OmniArt 提供标准图片生成和带参考图的生成。坐标框、草图叠加和锚点标记属于上游接口的流程,不是 OmniArt 界面里专门的控件——在工作台内,你把它们表达成提示词里的文字。这样一样能用,只不过承担“指向”这个动作的是精确的语言。
第五步:定稿输出
一旦位置、身份和光线都站得住了,就按你真正需要的分辨率做最后一次输出,而不是继续在一张小尺寸草稿上修。把确认过的合成结果用模型支持的最大尺寸重新渲染一遍——如果输出分辨率是决定性因素,Seedream 5.0 Lite 提供原生 4K——然后以 100% 比例检查结果再交付。边缘光晕和不匹配的噪点在缩略图上看不见,放到满尺寸就一目了然。
匹配光线、透视、比例和影子
这四种失败方式,解释了大多数“看着不对但说不出哪里不对”的合成图。
- 光线方向。 先读底图的影子,然后在提示词里说明方向(“来自右上方”、“来自左侧窗户”)。如果人物参考照的光是从相反一侧打来的,就明确讲出来:“对人物重新打光,改为从右侧打来;参考照里左侧的光线不要带过来。”
- 光线质感。 硬阳光给出边缘锐利的影子,阴天和室内光给出柔和的影子。一个柔光下的人放进硬阳光场景里,看起来就是贴上去的。要说明质感,而不只是方向。
- 透视与相机高度。 如果底图是在腰部高度拍的,而参考照是手机举到眼睛高度拍的,这个人放进画面就会不对劲。加上“匹配底图较低的相机角度,略微仰视”,模型就会调整人物的透视缩短关系。
- 比例。 永远把身高绑定到画面里的某个东西上——一道门、一根栏杆、一个椅背、另一个人的肩膀。绝对尺寸的描述换算成像素之后就活不下来了。
- 接触阴影。 身体与表面相接处那一小块暗区,正是卖出“物理存在感”的关键。要直接点名要它:“双脚与路面接触处各有一道柔和的接触阴影。”
- 噪点与色彩。 让模型匹配底图的噪点、色温和任何镜头的柔化感。一个干净的人物出现在一张有颗粒的照片里,一眼就看破。
排查常见问题
脸不像那个人。 你的参考图承担的工作太少了。上传同一个人的更多角度,优先用更高分辨率的,并剔除任何加了重滤镜的照片。然后明确要求:“保留参考照片中的面部特征、发际线和发色,不要做风格化处理。”
背景变了。 你的保护条款写得太笼统。把元素逐个列出来,而不是只说“保持背景不变”。然后跑一轮限定区域的修正,而不是整张重新生成。
人像是浮着的。 缺少接触阴影,或者双脚被含糊地裁掉了。直接索要接触阴影,并确认你放人的那个位置地面是可见的。
大小不对。 把所有绝对尺寸的说法换成与画面里已有物体的对比。
边缘像抠出来的。 要求柔化人物轮廓的边界并匹配噪点,同时检查参考照片是不是本来就有一个硬边抠图背景——白底抠图很容易导致抠图感的结果。
姿态很僵。 描述重心分配和手的位置。“重心落在右腿上,一只手插在夹克口袋里”会得到比“自然地站着”更自然的站姿。
警告
把一个真实、可辨认的人加进他原本不在的照片里,等于造出一张暗示了不实内容的图片。生成之前和发布之前,都要取得这个人的明确许可。不要在未经同意的情况下把公众人物、同事、前任或儿童合成进任何场景。不要制作暗示某人出席过某个活动、为某个产品代言,或出现在某个地点的图片。发布前请核对你所在平台的规则——很多平台要求披露涉及真人的 AI 修改图片——同时遵守 OmniArt 的服务条款以及当地关于肖像权的法律。
在 OmniArt 上开始
挑一张有明显空位的底图,再挑一张这个人干净、光线充足的参考照。打开 OmniArt 图片工作台,选择 Seedream 5.0 Pro,把两张图都上传,然后用第三步里的露台提示词,把细节换成你自己的。第一次渲染只评判位置和比例——身份和光线是留给后面几轮修改解决的。
然后用小幅修正推进,而不是换新提示词。两轮限定区域的修改加一次全分辨率定稿输出,是正常的路径,它能在人物逐渐成形的同时保住底图不被破坏。
准备好创作了吗?
开始用 AI 生成精彩内容