如何用 AI 生成一整套品牌视觉
生成一张好图已经不难,难的是第五张还看得出是同一个品牌。这里是一套做品牌视觉的流程,以及规模变大时必然出现的那种失败。

生成一张有说服力的产品图,已经不再是难点。难点是生成第五张时,它看上去仍然属于同一个品牌——同样的 logo 几何、同样的字体、同样的标签文案、同样的材质、同样的光。
微软在 MAI-Image-2.5 的页面上公开了一组虚构蜡烛品牌 ORVA 的样例图。当营销素材看,它是五张好看的图;当证据看,它更有用:这是一个实打实的例子,展示了一组图里什么能保住、什么会悄悄漂移、以及漂移最后落在哪里。这让它成了一套流程的好骨架,而这套流程你可以用在任何一款够格的图片模型上。
本文讲怎么搭一套品牌视觉:生成的顺序、每张图该怎么写才能让品牌活下来,以及套图变大时必然冒出来的那一种失败。
一套图必须守住什么
单张图只需要好看,一套图必须自洽。在生成任何东西之前,先写下每张图里都必须逐字一致的东西——这份清单就是你的验收单:
| 不变项 | ORVA 这一套的取值 |
|---|---|
| 字标 | ORVA,高对比衬线体,字距放宽 |
| 次级文案 | SCENTED CANDLE / BOUGIE PARFUMÉE |
| 小字 | NET WT. 8.5 OZ | 240 G |
| 容器 | 琥珀色玻璃杯,哑光质感,底部一圈黑色 |
| 色板 | 琥珀、黑色字、暖调米白表面 |
| 光 | 硬质直射日光,配柔和的枝叶投影 |
不在这份清单上的东西都允许变化——正是这一点让它成为一套图,而不是五张复制品。清单刻意写得短。不变项列得越长,能被模型破坏的东西就越多。
第一步:在最简单的载体上锁定识别
从竞争元素最少的那张图开始。对一个品牌标记来说,就是这个标记单独出现在一种朴素材质上:

这张图只有一个任务:把字形做对。没有产品、没有场景、没有次级文案来抢保真度。这里用压印是个好办法,因为它逼着模型对唯一一套字形几何做出承诺——压凹的边缘必须沿着真实的字形轮廓走,于是错误会暴露出来,而不是藏在平面字里。
这张通过之后,它就是下游一切的参考图。不要在后面的提示词里再从文字重新推导 logo,把它带过去。
提示
在生成任何一张产品图之前,先把识别底板定下来。后面每一张图都会继承它的错误,而到第五张才发现字标不对,意味着前四张全都要重做来对齐。
第二步:搭出主图
第二张图加入容器和完整标签,依然放在中性表面和可控光线下:

这张图必须做到位,因为之后每一张都要拿它来对。有三处细节值得专门审:
- **那个带音符的字母。**PARFUMÉE 里有一个 É。重音符、连字和非拉丁文字,是图内文字最先失败的地方——而蜡烛标签上的一行法语,恰恰是那种没人校对、直到印出来才发现问题的小字。
- **计量行。**NET WT. 8.5 OZ | 240 G 里混了小数、两套单位制和一个竖线字符。如果你的标签上有法规或合规行,就在这里验证模型撑不撑得住。
- **字级层次。**字标主导,产品描述次之,小字最小。一个拼写全对、却把三块文字给了同等视觉重量的模型,产出的仍然是没法用的标签。
第三步:把产品放进场景
主图通过后,套图开始向场景扩张。每张新图更换环境,同时继承产品:

这类图的提示词应该读作环境加上被继承的产品,而不是一份全新的描述。场景写细,产品用引用来指:
Place the approved candle on a light oak coffee table in a sunlit living room. Keep the label, glass colour, and black base band exactly as in the reference. Blurred mid-century armchair and woven vase in the background, hard morning light, soft shadows across the table.
形容词都给环境。产品只拿到一条保留指令。反过来做——每张图都把蜡烛重新描述一遍——正是套图漂移的原因,因为每一次新的描述,都是模型重新解释标签的一次新机会。
第四步:加入动态与氛围图
不是每张图都必须可读。有些的存在是为了节奏:

这张值得仔细读,因为它展示了可接受的模糊和漂移之间的区别。字标仍然清晰,小字不清晰。在一张动态图里这在物理上是对的——一个翻滚的罐子,小字本就该读不出来。判据是这种不可读在画面里有没有一个明确的成因。运动带来的模糊是一种风格;相机不动、产品静止却糊了,那是缺陷。
第五步:合影图,以及套图真正崩掉的地方
最后一张把产品放进同伴之中——每个品牌都需要的那张组合图:

看左边那个泵瓶。它的标签上布满了形似文字的笔画,但那不是任何一种语言的词。再回头看同一张图里蜡烛自己的小字——SCENTED CANDLE / BOUGIE PARFUMÉE 和那行单位,明显比主图里更软、更变形。
这就是值得记住的失败模式,而且它不是随机的:**保真度跟着注意力走。**被提示词点名的元素会被正确渲染。仅仅"在场"的元素,会在本该是文字的位置得到看起来合理的纹理。你往画面里加的物体越多,模型分给其中任何一个的预算就越少——所以道具最多的那张图,最可能在你根本没想到的某个标签上产出乱码。
警告
合影图是品牌套图崩掉的地方,而且崩得很安静——logo 错了很显眼,但背景里一瓶伪文字在有人放大之前,读起来就只是"一个瓶子"。审合影图时要按原图分辨率检查每一个可读表面,而不只是检查主产品。
实际的应对不是回避合影图,而是为它做规划:
- **不给次要物体任何文字。**没有品牌、没有标签的同伴物,在平铺图里既更真实,也不可能出错。
- **每张画面只点名一个主角。**明确说出哪个物体必须携带准确的品牌信息,其余的用通用形状和材质来描述。
- **先构图,再把标签作为第二次编辑加上去。**先生成这组排布,然后用一次定向编辑,把准确的字放到那个唯一需要它的产品上。
- **裁切作为兜底。**如果背景某个标签出成了噪点而构图其余部分是对的,收紧裁切比重新生成快。
让这套流程成立的顺序
整个工作流就是同一个原则用了五次——先确立不能变的东西,再改变它周围的一切:
- **识别底板。**标记单独放在朴素材质上,先把字形定下来。
- **产品主图。**完整标签、中性表面、可控光线。审音符、单位和层次。
- **生活场景。**换环境,产品靠参考图和保留指令带过去。
- **氛围与动态。**当画面自己交代了成因时,模糊是可以的。
- **合影图。**一个被点名的主角、不带品牌的同伴、按原图分辨率审一遍。
每一步都继承上一步,而不是从头再来。这就是"一套图"和"五张相似的蜡烛照片"之间的区别。
常见问题
怎么让 logo 在多张 AI 生成的图里保持一致?
先定下一张识别图,然后把它作为参考图带下去,而不是在每条提示词里重新描述 logo。每一次新的文字描述,都是模型重新解释字形的一次新机会。
为什么 AI 图片里的文字会变成乱码?
最常见的原因是承载那段文字的元素没有在提示词里被点名。模型把保真度分配给它被问到的东西;没被点名的物体会得到形似文字的纹理。极小的字号、带音符或非拉丁的字符,以及拥挤的画面,也会导致这个问题。
一套产品图该用几张参考图?
从一张通过的识别图或主图开始,只在确实需要延续的东西上再加参考——通常就是产品和它的标签。参考图不是越多越好,每一张都在争夺对结果的影响力。
一套品牌图该用一条提示词还是多条?
多条。一张图一条提示词,每条都继承已通过的产品,这样每生成一张就有一个检查点,出问题时也能定位到具体元凶。用一条提示词要五张图,等于放弃了隔离故障的能力。
通过一张产品图之前该检查什么?
至少要看:字标几何、标签上每一行文案(含音符与单位)、字级层次、容器的材质与颜色,以及次要物体上任何可读的文字。要按原图分辨率检查,不要看缩略图。
AI 产品图可以商用吗?
这取决于模型的条款、你对上传素材所拥有的权利,以及产出是否侵犯第三方的商标或外观设计。为一个不属于你的品牌生成品牌化图像带有真实风险——发布前先核对服务商的商用条款。
在 OmniArt 上开始
打开 OmniArt 图片工作台,拿你自己的一个品牌把前两步跑一遍:一张识别底板,然后一张带完整标签的产品主图。到这里先停下,按原图尺寸审一遍小字再往下走——这两张图决定了剩下三张值不值得生成。
每一步背后的提示词写法,可以看微软公开的四条提示词里关于"给物体命名让编辑保持局部"的部分,以及 Seedream 5.0 Pro 发布指南里的参考图控制。静态图通过之后,OmniArt 把图片和视频模型放在同一个工作台里,通过的主图可以直接进入动态环节,不必换个地方重建品牌。
准备好创作了吗?
开始用 AI 生成精彩内容