Audio espacial en Veo 3.1: buenas prácticas para un sonido que encaje con el plano
Veo 3.1 genera diálogo, ambiente y efectos junto con el video, con profundidad direccional real. Cómo pedir cada capa de audio de forma deliberada para que el sonido encaje con el plano, dentro de OmniArt.

La mayor parte del audio de video con IA suena puesto encima en lugar de presente. Un clip de un mercado concurrido recibe ruido de gente; un clip de bosque recibe canto de pájaros. Los dos son técnicamente correctos y ninguno convence, porque el sonido no sabe dónde está cada cosa en el cuadro. Veo 3.1 cambia esto con audio espacial nativo: el modelo genera el sonido junto con el video, consciente de qué está cerca, qué está lejos, qué queda apagado y qué corta por encima. Una puerta que se cierra detrás del sujeto suena distinto a una puerta que se cierra en primer plano. El tráfico tres pisos más abajo es más bajo y más difuso que el tráfico a nivel de calle. Esta guía explica cómo funciona la generación conjunta de audio de Veo, cómo pensar por separado en las tres capas de audio y cómo escribir prompts que produzcan profundidad espacial en la primera corrida, con tres escenas trabajadas que puedes adaptar de inmediato.
Cómo funciona el audio nativo de Veo 3.1
Veo 3.1 genera audio y video en una sola pasada conjunta. A diferencia de un proceso de dos pasos —donde se exporta un video mudo y después un modelo de audio intenta calzarlo— Veo construye el paisaje sonoro al mismo tiempo que construye los fotogramas. El modelo conoce la disposición espacial de la escena que está generando: qué elementos están cerca de la cámara, cuáles están al fondo, qué tan denso es el entorno, si las superficies absorberían o reflejarían el sonido.
El efecto práctico es la direccionalidad. Los elementos de campo cercano (los pasos del sujeto, una mano tocando una superficie, la respiración) se ubican a una distancia aparente distinta que los elementos de fondo (ruido de calle, zumbido ambiental, murmullo de gente). El modelo puede superponerlos en los niveles relativos adecuados porque está construyendo la escena espacial, no infiriéndola después.
Nota
Veo 3.1 también trae salida 4K nativa, lo que importa para el prompting de audio en un aspecto específico: más fidelidad visual significa más detalle ambiental en el cuadro, y más detalle al que el modelo de audio puede responder. Un primer plano de una calle empedrada cubierta de lluvia en 4K le da al modelo más material que un render suave en 720p de la misma escena.
Las tres capas de audio en las que hay que pensar por separado
La forma más confiable de obtener un resultado útil de la generación de audio de Veo 3.1 es separar mentalmente tus instrucciones de audio en tres capas antes de escribir una sola palabra del prompt. Cada capa tiene características distintas y responde a patrones de prompt distintos.
Diálogo
El diálogo es la capa que se puede controlar con más precisión. El modelo necesita información explícita: qué se dice, quién lo dice y cómo debe interpretarse. A diferencia del sonido ambiente —donde el modelo puede inferir mucho del contexto visual— el diálogo no tiene un correlato visual que el modelo pueda leer. Un personaje que camina y habla se ve igual esté recitando la lista del súper o entregando un monólogo.
Escribe la línea textual y después acompáñala con una nota de interpretación. Un solo adjetivo conciso de interpretación suele ser más efectivo que dos o tres. Notas de interpretación que funcionan de forma confiable: warm and unhurried, flat and exhausted, urgent, just above a whisper, soft but careful. Notas que tienden a producir resultados promediados: apilar opuestos como relaxed but tense o quiet but intense.
El contexto espacial también importa para el diálogo. Voice close-mic'd, room barely audible produce un resultado distinto que voice slightly distant, reverberant room. El modelo va a ajustar el entorno acústico al nivel de espacio ambiental que describas.
Ambiente y entorno
El ambiente es la capa que Veo 3.1 maneja de forma más distintiva. Como el modelo conoce la disposición espacial que está generando, puedes describir un entorno en términos de capas y distancias, y el modelo de verdad puede actuar sobre esa descripción.
Un modelo mental útil: piensa en tres zonas concéntricas, el primer plano inmediato (al alcance del brazo desde la cámara), el plano medio (el espacio activo de la escena) y el fondo (lo que se oiría a través de las ventanas o en el borde del cuadro). Nombrar elementos en cada zona e indicar su nivel relativo le da al modelo un objetivo de mezcla espacial.
| Zona | Elementos de ejemplo | Redacción del prompt |
|---|---|---|
| Primer plano | Roce de tela, respiración, manos sobre una superficie | "close fabric rustle", "subject's quiet breathing" |
| Plano medio | Pasos, conversación, herramientas, sonidos de cocina | "footsteps on concrete nearby", "clink of cups on the counter" |
| Fondo | Tráfico de calle, murmullo de gente, zumbido ambiental | "traffic muffled behind glass", "distant crowd, barely audible" |
No necesitas llenar las tres zonas. Una escena de interior minimalista puede necesitar solo un elemento de plano medio y un tono de sala sutil. Sobreespecificar zonas que no deberían tener sonido ensucia la mezcla.
Efectos de sonido (SFX)
Los SFX son eventos de audio discretos atados a momentos visuales específicos: una puerta que se abre, un objeto que se apoya, un sonido de notificación, un vehículo que pasa. Como Veo genera audio junto con el video, los SFX que corresponden a acciones visibles en pantalla tienden a sincronizarse de forma natural: el modelo sabe que una mano se está estirando hacia un vaso antes de que haga contacto.
Para los SFX que tienen que caer con precisión, descríbelos como eventos visuales y no como eventos de audio. "She sets the phone face-down on the desk" pide a la vez la acción visual y el sonido que produce; "a clunk as the phone hits the desk" describe el sonido de forma abstracta y le cuesta más al modelo sincronizarlo.
Cuando necesites un SFX que no está atado a una acción en pantalla —un sonido desde fuera de cuadro, una puntuación ambiental— trátalo como tratarías una indicación de diálogo: nómbralo de forma explícita y dale contexto espacial. "A car alarm starts briefly in the distance, off-frame right" es más preciso que "random street noise includes a car alarm."
Tres escenas trabajadas
Estos ejemplos muestran el patrón de prompt completo aplicado a tres escenarios de audio distintos. Cada uno demuestra un desafío de audio principal diferente.
Escena 1: capas espaciales de cerca y lejos en una calle
Brief: Un sujeto camina por una calle comercial hacia la entrada de un local. El audio tiene que mostrar la diferencia espacial entre los elementos cercanos (los pasos del sujeto, la respiración ambiente) y el entorno alrededor (el tráfico, la puerta del local).
Prompt:
"Medium shot following a person walking along a busy city street toward a café entrance, overcast daylight. Audio: subject's footsteps on wet pavement close and clear; street traffic — buses, cars — sitting further back, diffuse and slightly muffled; as the subject reaches for the café door, the door's hinge and the muffled interior sound briefly audible, then the street noise dropping away as they step inside. No music."
Qué esperar: los pasos deberían quedar en el campo cercano, claramente separados del tráfico de fondo. La transición en la puerta —de exterior a interior apagado— es el evento espacial al que apunta el prompt, y la generación conjunta de Veo implica que el modelo conoce la puesta en escena visual de ese momento.
Palancas de ajuste: si el tráfico queda demasiado alto respecto de los pasos, agrega traffic well back, not competing with footsteps. Si la transición de la puerta es demasiado abrupta, agrega gradual acoustic shift as the door opens.
Escena 2: plano de atmósfera sin diálogo, sostenido solo por el ambiente
Brief: Un plano general de interior al atardecer, sin diálogo ni acción evidente. El audio debe cargar todo el registro emocional de la escena solo con capas ambientales.
Prompt:
"Wide shot of an empty apartment living room at dusk, warm orange light through venetian blinds making stripe patterns across the floor. No person present. Audio: distant traffic hum from outside (well back, through glass), occasional creak of the building settling, a single car passing slowly on the street below — its engine present then gone — faint hiss of an old radiator in the foreground right. No music. The overall room feel should be quiet enough to hear the silence between sounds."
Qué esperar: una mezcla ambiental en capas donde las pausas entre eventos son tan audibles como los eventos mismos. El modelo debería tratar quiet enough to hear the silence between sounds como una instrucción de nivel de mezcla, manteniendo todos los elementos lo bastante bajos como para que el tono de sala se perciba.
Palancas de ajuste: la frase quiet enough to hear the silence se puede reforzar agregando each element appearing only briefly, not constant. Agrega a phone buzzing once on a surface, off-frame para introducir una puntuación narrativa sin romper la atmósfera.
Consejo
Escena 3: entonación a nivel de frase en el diálogo
Brief: Un personaje le hace una sola pregunta a la cámara. La interpretación necesita entonación natural a nivel de frase —en específico, el alza audible al final de una pregunta— y no una lectura plana de metrónomo.
Prompt:
"Close-up of a man in his 40s at a wooden desk, warm desk lamp, bookshelves behind him. He looks directly at camera, slight pause, then says 'Did you really think I wouldn't find out?' — delivery quiet, genuinely confused rather than angry, voice rising slightly on 'find out'. Room: light ambient hum from an unseen HVAC, no reverb, no music."
Qué esperar: la nota de interpretación rising slightly on 'find out' y genuinely confused rather than angry deberían dar forma tanto a la onda de audio como al contorno de tono de la interpretación. Las instrucciones de tono de sala (no reverb) establecen el entorno acústico para que el diálogo no suene como grabado en otro espacio.
Palancas de ajuste: si la interpretación queda demasiado plana, reemplaza quiet por controlled but emotionally present. Si la entonación de la frase no aparece, separa la nota de interpretación de la nota emocional: primero declara la emoción y después la instrucción específica de entonación.
Antes de volver a generar: cómo leer un resultado plano o mecánico
No toda generación necesita una revisión del prompt. Algunos resultados solo necesitan más duración o una semilla distinta. Pero hay patrones específicos que indican que el problema es el prompt mismo:
Resultado plano (sin profundidad espacial): todos los elementos de audio quedan a la misma distancia aparente, sin distinción entre primer plano y fondo. Arreglo: agrega lenguaje espacial explícito a por lo menos dos elementos, uno marcado como cercano y otro como distante o apagado. El modelo necesita un contraste sobre el cual actuar.
Diálogo mecánico: la interpretación va a ritmo parejo, sin pausas, sin variación de tono, sin entonación en la sílaba final. Arreglo: escribe una instrucción concreta de entonación dentro del prompt (subir al final de una pregunta, frenar en un beat emocional, bajar al cerrar una afirmación). Las notas de interpretación abstractas como natural o realistic son demasiado vagas para cambiar el resultado.
Mezcla sobrecargada: demasiados elementos de audio peleando por presencia y ninguno queda claro. Arreglo: reduce a los dos o tres elementos más importantes y describe sus niveles relativos de forma explícita. Es mejor tener tres sonidos bien ubicados que siete compitiendo.
Entorno acústico equivocado: la sala suena demasiado reverberante o demasiado seca para lo visual. Arreglo: nombra directamente el carácter acústico: dry, close-mic'd room, medium reverb, concrete walls, outdoor, open air, no reflections.
| Síntoma | Causa probable | Arreglo |
|---|---|---|
| Sin profundidad espacial | Falta lenguaje de cerca y lejos | Agrega calificadores de distancia explícitos a 2 elementos o más |
| Diálogo mecánico | Notas de interpretación vagas | Agrega una instrucción específica de entonación |
| Mezcla saturada | Demasiadas fuentes | Reduce a 2–3 elementos con niveles relativos |
| Acústica de sala equivocada | No se dio contexto acústico | Nombra el carácter de la sala de forma explícita |
Resumen de buenas prácticas
| Qué hacer | Por qué |
|---|---|
| Separa mentalmente diálogo, ambiente y SFX antes de escribir | Cada capa responde a patrones de prompt distintos |
| Nombra los elementos ambientales por zona: primer plano, medio, fondo | Le da al modelo un objetivo de mezcla espacial, no una descripción plana |
| Escribe las líneas de diálogo textuales con una nota de interpretación | El modelo necesita el texto exacto y una dirección de tono |
| Describe los SFX como eventos visuales, no como eventos de audio | Sincronizar con la acción en pantalla es más fácil de modelar que un tiempo abstracto |
Usa no music cuando quieras solo efectos | Evita que la musicalización automática agregue una pista de fondo |
| Mantén bajo el número de elementos nombrados | Tres sonidos bien ubicados le ganan a siete compitiendo |
| Nombra el entorno acústico | El carácter de la sala define cómo se acomodan todos los demás elementos |
Cómo empezar en OmniArt
Las tres variantes de Veo 3.1 —veo-3.1-standard, veo-3.1-fast y veo-3.1-lite— están disponibles en el espacio de video de OmniArt con el mismo saldo de créditos y la misma interfaz de prompt, sin necesidad de una cuenta de Google aparte ni de una clave de API. La forma más rápida de calibrar tu prompting de audio es empezar con un solo contraste de cerca y lejos en una escena simple, ver qué produce el modelo y después agregar capas de a una hasta que la mezcla quede donde la quieres.
Para un tratamiento más amplio de la fotografía y la estructura de prompt de Veo 3.1, mira la guía de prompts y cinematografía de Veo 3.1. Si estás trabajando con un modelo que genera audio en una sola pasada conjunta sobre otro proceso, los patrones de la guía de audio nativo de Grok Imagine cubren una lógica de prompting similar para el sistema de audio nativo de xAI.
¿Todo listo para crear?
Empieza a generar contenido increíble con IA