TutorialTutoriales y guías12 min de lectura

Cómo crear un set visual de marca completo con imágenes IA

Una imagen con IA es fácil. Que la quinta siga pareciendo la misma marca es el trabajo de verdad. Aquí tienes un flujo para construir un set de producto coherente y el fallo que aparece al escalarlo.

Equipo OmniArt
Cómo crear un set visual de marca completo con imágenes IA

Generar una imagen de producto convincente ya no es la parte difícil. La parte difícil es generar la quinta y que siga pareciendo de la misma marca: la misma geometría de logotipo, la misma tipografía, el mismo texto de etiqueta, el mismo material, la misma luz.

Microsoft publicó en su página de MAI-Image-2.5 un conjunto de imágenes de ejemplo para una marca ficticia de velas, ORVA. Leído como marketing son cinco imágenes bonitas. Leído como evidencia es algo más útil: un ejemplo trabajado de qué se sostiene a lo largo de una serie, qué se desvía en silencio y dónde acaba aterrizando esa desviación. Eso lo convierte en una buena columna vertebral para un flujo que puedes ejecutar con cualquier modelo de imagen solvente.

Esta guía trata de construir un set visual de marca: en qué orden generar, cómo escribir cada toma para que la marca sobreviva y el único modo de fallo que aparece sin falta cuando el set crece.

Qué tiene que sostener un set

Una imagen suelta solo tiene que verse bien. Un set tiene que estar de acuerdo consigo mismo. Antes de generar nada, escribe lo que debe ser idéntico carácter a carácter en todas las tomas: eso se convierte en tu lista de aceptación.

El invarianteEn el set de ORVA
LogotipoORVA en serif de alto contraste, con interletraje amplio
Texto secundarioSCENTED CANDLE / BOUGIE PARFUMÉE
Letra pequeñaNET WT. 8.5 OZ | 240 G
RecipienteVaso de vidrio ámbar, acabado mate, franja negra en la base
PaletaÁmbar, texto negro, superficies blanco roto cálidas
LuzLuz de día dura y direccional con sombras suaves de hojas

Todo lo que no está en esa lista puede cambiar: eso es justo lo que lo convierte en un set y no en cinco copias. La lista es corta a propósito. Una lista larga de invariantes es una lista larga de cosas que un modelo puede romper.

Paso 1: fija la identidad en la superficie más simple posible

Empieza por la toma con menos elementos compitiendo. Para una marca gráfica, eso es el logotipo solo sobre un material sobrio:

La palabra ORVA repujada en una serif elegante de alto contraste sobre papel blanco roto texturizado, con sombras rasantes suaves cruzando la superficie
Primero la plancha de identidad. Sin nada más en el encuadre, las formas de las letras reciben toda la atención del modelo, y esta imagen se convierte en la referencia de todas las siguientes. Fuente: microsoft.ai.

Esta imagen tiene un único trabajo: acertar con las formas de las letras. Sin producto, sin escena, sin texto secundario compitiendo por fidelidad. El repujado es un truco útil aquí porque obliga al modelo a comprometerse con una geometría de letra única y consistente: el borde hundido tiene que seguir la silueta real del glifo, así que los errores se hacen visibles en lugar de esconderse en una tipografía plana.

Una vez aprobada, es tu imagen de referencia para todo lo que venga después. No vuelvas a derivar el logotipo desde texto en los prompts posteriores; arrástralo.

Consejo

Aprueba la plancha de identidad antes de generar una sola toma de producto. Todas las imágenes posteriores heredan sus errores, y corregir un logotipo en la quinta toma significa regenerar de la primera a la cuarta para que encajen.

Paso 2: construye la toma protagonista del producto

La segunda imagen añade el recipiente y la etiqueta completa, todavía sobre una superficie neutra y con luz controlada:

Una vela ORVA encendida en vidrio ámbar sobre una superficie clara; se leen el logotipo, las líneas SCENTED CANDLE y BOUGIE PARFUMÉE y NET WT. 8.5 OZ 240 G, con luz dura proyectando sombras de hojas
La toma protagonista carga con la etiqueta completa. Fíjate en la É acentuada de BOUGIE PARFUMÉE y en la línea de contenido: los dos detalles que se rompen primero. Fuente: microsoft.ai.

Esta imagen tiene que ser perfecta, porque es contra la que vas a comparar todas las demás. Hay tres detalles que conviene auditar en concreto:

  • El carácter acentuado. PARFUMÉE lleva una É. Los acentos, las ligaduras y los alfabetos no latinos son el punto donde el texto dentro de la imagen falla primero, y una línea en francés en la etiqueta de una vela es exactamente el tipo de letra pequeña que nadie corrige hasta que está impresa.
  • La línea de contenido. NET WT. 8.5 OZ | 240 G mezcla un decimal, dos sistemas de unidades y una barra vertical. Si tu etiqueta lleva una línea legal o regulatoria, aquí es donde compruebas si el modelo la sostiene.
  • La jerarquía tipográfica. Logotipo dominante, descriptor de producto secundario, letra pequeña la más pequeña. Un modelo que escribe todo bien pero da el mismo peso visual a los tres bloques ha producido una etiqueta inservible.

Paso 3: pon el producto en contexto

Con la toma protagonista aprobada, el set se expande a escenas. Cada toma nueva cambia el entorno y hereda el producto:

La misma vela ORVA encendida sobre una mesa de madera clara en un salón soleado, con un sillón, un jarrón trenzado y una alfombra desenfocados al fondo
Una toma de estilo de vida. La etiqueta, el recipiente y la franja negra de la base sobreviven al cambio de entorno; lo que cambia es la dirección de la luz, no la marca. Fuente: microsoft.ai.

El prompt de una toma así debería leerse como entorno más producto heredado, no como una descripción nueva. La escena se lleva el detalle; el producto se señala por referencia:

Place the approved candle on a light oak coffee table in a sunlit living room. Keep the label, glass colour, and black base band exactly as in the reference. Blurred mid-century armchair and woven vase in the background, hard morning light, soft shadows across the table.

Los adjetivos van al entorno. El producto recibe una instrucción de conservación. Invertir eso —volver a describir la vela en cada toma— es justo la forma en que un set se desvía, porque cada descripción nueva es una oportunidad nueva para que el modelo reinterprete la etiqueta.

Paso 4: añade tomas de movimiento y ambiente

No todas las imágenes de un set tienen que ser legibles. Algunas existen por el ritmo:

El tarro de la vela ORVA cae girando en el aire sobre un fondo gris pálido, con hojas de eucalipto desenfocadas flotando alrededor y desenfoque de movimiento sobre la etiqueta
Una toma de movimiento. El logotipo sigue siendo legible mientras la letra pequeña se difumina, y aquí eso es correcto, porque el desenfoque de movimiento es el motivo. Fuente: microsoft.ai.

Esta merece una lectura atenta, porque muestra la diferencia entre una suavidad aceptable y una desviación. El logotipo aún se lee; la letra pequeña no. En una toma de movimiento eso es físicamente correcto: un tarro girando debe tener el texto pequeño ilegible. La prueba es si esa ilegibilidad tiene una causa declarada dentro de la imagen. El desenfoque por movimiento es una decisión estética. El desenfoque con cámara fija y producto quieto es un defecto.

Paso 5: la toma de grupo, y dónde se rompen de verdad los sets

La última toma coloca el producto entre compañeros: la imagen de surtido que toda marca necesita.

La vela ORVA encendida sobre una bandeja de piedra junto a un frasco con dosificador esmerilado, un frasco cuentagotas ámbar y un tarro pequeño con tapa de madera, con luz suave y sombras de palmera
La toma de grupo. El logotipo ORVA aguanta, pero la etiqueta del frasco con dosificador de la izquierda está renderizada como pseudotexto ilegible, y la propia letra pequeña de la vela se ha degradado. Fuente: microsoft.ai.

Mira el frasco con dosificador de la izquierda. Su etiqueta está cubierta de marcas con forma de letra que no son palabras en ningún idioma. Y ahora vuelve a la letra pequeña de la propia vela en esa misma imagen: SCENTED CANDLE / BOUGIE PARFUMÉE y la línea de unidades están notablemente más blandas y distorsionadas que en la toma protagonista.

Este es el modo de fallo que conviene interiorizar, y no es aleatorio: la fidelidad sigue a la atención. El elemento que el prompt nombra se renderiza correctamente. Los elementos que simplemente están presentes reciben una textura verosímil donde debería haber texto. Cuanto más objetos añades a un encuadre, menos presupuesto le queda al modelo para cada uno, así que la toma con más atrezo es la que más probabilidades tiene de producir galimatías en una etiqueta en la que ni siquiera estabas pensando.

Advertencia

Las tomas de grupo son donde fallan los sets de marca, y fallan en silencio: un logotipo mal hecho salta a la vista, pero un frasco lleno de pseudotexto al fondo se lee como un frasco hasta que alguien amplía. Audita cada superficie legible de una toma de grupo a resolución completa antes de aprobarla, no solo el producto protagonista.

La respuesta práctica no es evitar las tomas de grupo, sino planificarlas:

  • No des ningún texto a los objetos secundarios. Los acompañantes sin marca ni etiqueta son más realistas en un flatlay y, a la vez, imposibles de estropear.
  • Nombra un protagonista por encuadre. Di explícitamente qué objeto debe llevar el branding correcto y describe el resto como formas y materiales genéricos.
  • Compón el grupo y añade la etiqueta en una segunda edición. Genera primero la disposición y luego, con una edición dirigida, coloca el texto correcto en el único producto que lo necesita.
  • El recorte como plan B. Si una etiqueta del fondo ha salido como ruido pero la composición está bien, un encuadre más cerrado es más rápido que regenerar.

El orden que hace que esto funcione

Todo el flujo es un principio aplicado cinco veces: establece lo que no puede cambiar y luego cambia todo lo demás a su alrededor.

  1. Plancha de identidad. Logotipo solo sobre material sobrio. Aprueba las formas de las letras.
  2. Producto protagonista. Etiqueta completa, superficie neutra, luz controlada. Audita acentos, unidades y jerarquía.
  3. Contexto de estilo de vida. Entorno nuevo, producto arrastrado por referencia e instrucción de conservación.
  4. Ambiente y movimiento. La suavidad está bien cuando la imagen declara su causa.
  5. Toma de grupo. Un protagonista nombrado, acompañantes sin marca, auditoría a resolución completa.

Cada paso hereda del anterior en lugar de empezar de cero. Esa es la diferencia entre un set y cinco imágenes de una vela parecida.

Preguntas frecuentes

¿Cómo mantengo un logotipo coherente en varias imágenes generadas con IA?

Aprueba primero una única imagen de identidad y arrástrala como imagen de referencia, en lugar de volver a describir el logotipo en cada prompt. Cada descripción nueva en texto es una oportunidad nueva para que el modelo reinterprete las formas de las letras.

¿Por qué el texto de las imágenes IA sale como galimatías?

Casi siempre porque el elemento que lleva ese texto no se nombró en el prompt. Los modelos reparten fidelidad entre aquello por lo que se les pregunta; los objetos sin nombrar reciben una textura que se parece a la escritura. También ocurre con cuerpos muy pequeños, con caracteres acentuados o no latinos y en encuadres abarrotados.

¿Cuántas imágenes de referencia debería usar para un set de producto?

Empieza con una imagen de identidad o una toma protagonista aprobada y añade referencias solo para lo que de verdad tiene que persistir, normalmente el producto y su etiqueta. Más referencias no es automáticamente mejor: cada una compite por influir en el resultado.

¿Debería generar un set de marca en un prompt o en varios?

En varios. Una toma por prompt, cada una heredando el producto aprobado, te da un punto de control después de cada imagen y un culpable claro cuando algo se desvía. Un solo prompt pidiendo cinco imágenes no te deja forma de aislar un fallo.

¿Qué debería revisar antes de aprobar una imagen de producto?

Como mínimo: geometría del logotipo, cada línea del texto de la etiqueta incluidos acentos y unidades, jerarquía tipográfica, material y color del recipiente, y cualquier texto legible en objetos secundarios. Revísalo a resolución completa, no en tamaño miniatura.

¿Puedo usar comercialmente imágenes de producto hechas con IA?

Depende de las condiciones del modelo, de tus derechos sobre el material de referencia que hayas subido y de si el resultado infringe marcas o diseños de terceros. Generar imágenes con aspecto de marca para una marca que no es tuya conlleva un riesgo real: revisa las condiciones comerciales del proveedor antes de publicar.

Empezar en OmniArt

Abre el espacio de imagen de OmniArt y ejecuta los dos primeros pasos con una marca propia: una plancha de identidad y después una toma protagonista con la etiqueta completa. Párate ahí y audita la letra pequeña a tamaño real antes de seguir: esas dos imágenes deciden si merece la pena generar las tres restantes.

Para las técnicas de prompt detrás de cada paso, los cuatro prompts que publicó Microsoft cubren cómo nombrar un objeto para que una edición se quede local, y la guía de lanzamiento de Seedream 5.0 Pro cubre sus controles de imagen de referencia. Cuando las imágenes fijas están aprobadas, OmniArt mantiene los modelos de imagen y de vídeo en el mismo espacio, así que una toma protagonista aprobada puede pasar directamente al movimiento sin reconstruir la marca en otro sitio.

¿Listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis