TutorialTutoriales y guías10 min de lectura

Audio tags de Eleven v3: cómo dirigir voces expresivas con IA

Aprende a usar los audio tags de ElevenLabs v3 —señales de emoción, interpretación, acento y personaje entre corchetes— para dirigir actuaciones de voz expresivas con IA en OmniArt.

Equipo OmniArt
Audio tags de Eleven v3: cómo dirigir voces expresivas con IA

La mayoría de las herramientas de texto a voz leen un guion igual todas las veces: plano, medido y un poco robótico. Eleven v3 es distinto. Entiende la textura emocional de tu guion y, con los audio tags, puedes darle dirección explícita, igual que un director de voces le indicaría a un actor antes de una toma.

Los audio tags son palabras o frases cortas entre corchetes, incrustadas directamente en tu guion. Le dicen al modelo cómo interpretar la línea siguiente: susurrarla, gritarla, teñirla con acento británico o quebrarla a mitad de frase con un suspiro. Esta guía cubre todo el vocabulario de tags disponible en OmniArt, cómo escribir guiones con varios personajes que los usen y cómo decidir cuándo Eleven v3 es el modelo adecuado para el trabajo.

¿Qué son los audio tags?

Los audio tags son señales de dirección en línea, puestas entre corchetes —[whispers], [excited], [British accent]— en el punto del guion donde quieres que cambie la interpretación. Eleven v3 los analiza como instrucciones y no como palabras que hay que decir, y ajusta el tono, el ritmo y el afecto en consecuencia.

La diferencia clave con el texto a voz antiguo es que v3 interpreta el contexto. No aplica un filtro parejo: pesa el tag contra la frase que lo rodea, así que [sighs] antes de "I suppose you're right" produce un resultado distinto que [sighs] antes de "Fine, let's go." Esa sensibilidad al contexto es lo que hace que un guion con tags se sienta dirigido en lugar de procesado.

Consejo

Coloca el tag justo antes de la frase que debe afectar. Un tag al inicio de un párrafo gobierna la interpretación hasta el próximo tag o hasta un reinicio tonal natural.

El vocabulario de audio tags

La tabla de abajo organiza todas las categorías principales de tags con ejemplos. Estas son las señales a las que Eleven v3 responde de forma confiable en OmniArt.

Tags de emoción

TagEfecto
[excited]Más energía, ritmo más rápido, tono más brillante
[sad]Interpretación más lenta, más grave, más contenida
[angry]Cortante, contundente, con más volumen
[nervous]Ritmo algo irregular, más bajo en general
[happy]Cálido, animado, con resonancia abierta
[tired]Más lento, más plano, con menos esfuerzo
[afraid]Tenso, contenido, con menos aire
[disgusted]Afecto plano con un dejo de desdén
[surprised]Ataque más agudo, frase más corta

Tags de interpretación

TagEfecto
[whispers]Aireado, de bajo volumen, íntimo
[shouting]Volumen alto, proyectado, resonancia amplia
[pause]Inserta aquí una pausa o un corte natural
[slowly]Tempo estirado sin cambio de tono
[fast]Tempo comprimido, más energía
[sighs]Exhalación audible entretejida al inicio de la frase
[laughs]Agrega una risa natural corta antes o durante la línea
[crying]Da a la interpretación una calidad quebrada y húmeda

Tags de personaje y persona

TagEfecto
[pirate voice]Teatral, gutural, con cadencia exagerada
[robot voice]Cortante, monótono, con calidad sintética
[narrator]Con autoridad, medido, registro documental
[announcer]Proyectado, formal, calidad de transmisión
[childlike]Tono más agudo, frases más cortas, juguetón

Tags de acento

TagEfecto
[British accent]Calidad de Received Pronunciation
[Southern US accent]Vocales cálidas y alargadas
[Australian accent]Entonación ascendente al final
[Irish accent]Melódico, con redondeo vocálico distintivo
[New York accent]Consonantes cortantes, medios nasales

Nota

Los tags de acento se superponen al preset de voz base. Los resultados varían según el preset: algunas voces responden con más fuerza que otras. Genera una línea corta de prueba antes de comprometerte con un guion completo.

Hoja de referencia de tags

PropósitoTags de ejemplo
Emoción — positiva[excited], [happy], [surprised]
Emoción — negativa[sad], [angry], [tired], [afraid], [nervous]
Volumen y proyección[whispers], [shouting]
Tempo[slowly], [fast]
Sonidos naturales[sighs], [laughs], [crying], [pause]
Registro de personaje[pirate voice], [robot voice], [narrator], [announcer], [childlike]
Acento[British accent], [Southern US accent], [Australian accent], [Irish accent], [New York accent]

Cómo escribir un guion con tags: dos ejemplos

Ejemplo 1 — narración emocional

Esta es una apertura corta para un capítulo de audiolibro. Los tags cambian el ánimo a medida que cambia la escena.

[narrator] The city had been quiet for three days.

[slowly] Not the quiet of peace — [pause] the quiet of waiting.

[tired] Maya poured her fourth cup of coffee and stared at the map pinned to the wall.

[whispers] They had to be out there somewhere.

[sighs] She just needed one more lead.

El tag de narrador fija un registro medido desde el inicio. [slowly] con un [pause] crea espacio dramático. [tired] deja caer la interpretación antes de que [whispers] la lleve a un lugar bajo e íntimo. [sighs] agrega una respiración física que hace que la línea final se sienta ganada.

Ejemplo 2 — diálogo de dos personajes

Eleven v3 puede manejar lecturas de varios hablantes desde un solo prompt. Usa etiquetas de personaje y tags de interpretación para distinguir cada voz.

CAPTAIN (VOICE A): [excited] We found it. [pause] The actual coordinates — right where the old chart said they'd be.

FIRST MATE (VOICE B): [nervous] Sir, that chart is four hundred years old. Half of it is sea monsters drawn by someone who'd never left port.

CAPTAIN (VOICE A): [laughs] Exactly! [fast] Which means no one else thought it was worth following. Get the crew up.

FIRST MATE (VOICE B): [sighs] [slowly] Aye, captain.

Consejo

Para guiones con varios personajes, elige dos presets de voz con registros base claramente distintos —uno más grave, uno más liviano— para que la diferencia entre personajes se note incluso sin etiquetas visuales de hablante en el audio de salida.

Cómo usar los audio tags en OmniArt

  1. Entra a modo Audio y selecciona la pestaña de voz.
  2. Elige Eleven v3 en el menú de modelos. Está disponible en el nivel STARTER y superiores.
  3. Selecciona un preset de voz. OmniArt ofrece 353 voces curadas entre los modelos de habla. Explóralas por género y estilo: los presets más graves y con más autoridad funcionan bien para narración; los presets más brillantes de rango medio responden bien a los tags de emoción fuerte.
  4. Pega tu guion con tags en el campo del prompt. Eleven v3 acepta hasta 5,000 caracteres por generación.
  5. Ajusta el idioma para que coincida con tu guion.
  6. Genera y escucha. Si un tag se aplica de más o de menos, ajusta su posición, agrega otro tag para reiniciar la interpretación o prueba con otro preset de voz.

El cobro corre a 1 crédito por cada bloque iniciado de 50 caracteres. Un guion de 500 caracteres cuesta 10 créditos; uno de 5,000 caracteres cuesta 100 créditos. Los bloques parciales de 50 caracteres se redondean hacia arriba.

Advertencia

OmniArt no ofrece clonación de voz, controles de velocidad ni controles de tono para Eleven v3. Toda la variación de interpretación viene del texto del guion y de los audio tags.

Cuándo usar Eleven v3 frente a otros modelos de habla

En OmniArt hay tres modelos de ElevenLabs disponibles. Esto es cuándo ir por cada uno.

EscenarioMejor modeloMotivo
Interpretación con variedad emocional: un personaje que ríe, llora, gritaEleven v3Los audio tags y la conciencia del contexto dan el rango más expresivo
Narración multilingüe estable (más de 50 idiomas)Eleven Multilingual v2Interpretación pareja y consistente entre idiomas; 10,000 caracteres por generación
Guiones largos con entrega rápidaEleven Turbo v2.5Baja latencia; 40,000 caracteres por generación a 1 crédito por cada 100 caracteres
Generación con presupuesto ajustado o en el nivel FREEMiniMax Speech 2.8 HD / TurboDisponible en el nivel FREE; HD para calidad final, Turbo para borradores

Un modelo mental útil: usa v3 cuando el guion pide una actuación y la interpretación misma carga significado. Usa Multilingual v2 cuando la meta es una narración clara y fácil de seguir en muchos idiomas. Usa Turbo v2.5 cuando tienes un guion largo y relativamente neutro y necesitas resultados rápido.

Consulta las páginas de cada modelo para ver las especificaciones completas: Eleven v3, Eleven Multilingual v2, Eleven Turbo v2.5.

Errores comunes al poner tags

Poner demasiados tags: agregar un tag a cada frase aplana la variación. Los tags de emoción pegan más fuerte cuando llegan después de un tramo de interpretación natural y sin marcar. Úsalos para los picos y las transiciones, no como una capa constante.

Tags contradictorios: [shouting] seguido de inmediato por [whispers] sin ninguna frase en medio puede confundir al modelo. Deja una frase de interpretación neutra entre contrastes fuertes.

Tags de acento sin prueba: el acento depende del preset de voz base. Corre una línea de prueba de 50 caracteres antes de aplicar un tag de acento a lo largo de un guion largo.

Tags a mitad de palabra: los tags tienen que ir entre palabras completas o signos de puntuación, no dentro de una palabra. Incre[excited]dible no se va a analizar bien; escribe [excited] Incredible en su lugar.

Los casos de uso que más se benefician

Audiolibros con varios personajes: la combinación de presets de voz y tags de interpretación te deja distinguir al narrador del personaje y darle a cada personaje una firma emocional consistente. Mira cómo armar una producción de audio completa en la guía de locución con MiniMax Speech para un flujo comparable.

Diálogo de videojuegos y ficción interactiva: líneas cortas y contundentes con tags fuertes —[afraid] Stay back!, [laughs] You call that a plan?— crean personajes no jugables creíbles sin actores de voz a medida.

Narración de YouTube con rango emocional: un documental o un explicativo que se mueve entre revelaciones dramáticas, comentarios humorísticos y reflexión callada se beneficia de los cambios de interpretación. Marca las transiciones con tags y el ritmo se escribe solo.

Piezas y tráileres movidos por el diálogo: dos o tres lecturas de personaje desde una sola generación, cada una distinguida por su preset de voz y sus tags, comprimen una escena de diálogo en un solo paso del flujo.

Cómo empezar en OmniArt

La forma más rápida de desarrollar oído para lo que v3 puede hacer es tomar un guion que conozcas bien —un monólogo, la apertura de un cuento, unas líneas de diálogo de videojuego— y marcarlo dos veces: una con tags ligeros y otra con cambios de interpretación agresivos. Genera las dos y compara. La diferencia entre un guion levemente dirigido y uno dirigido a fondo suele ser evidente ya en la primera frase.

Abre Eleven v3 en OmniArt y pega tu primer guion con tags. Empieza con el ejemplo de narración emocional de arriba, cambia el preset de voz y observa qué cambia. Una vez que el vocabulario de tags se sienta natural, el modelo se vuelve tan receptivo como una sesión de grabación real, pero sin el estudio.

Para una mirada más amplia a todos los modelos de audio disponibles en OmniArt, incluidos música y efectos de sonido, mira la guía completa del espacio de audio.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis