TutorialTutoriales y guías9 min de lectura

Voz en off con IA para videos de YouTube: el flujo de un creador

Usa los modelos de voz con IA de OmniArt para convertir tu guion en narración pulida para YouTube: elección de modelo, doblaje multilingüe, consejos de ritmo y un ejemplo de costo en créditos.

Equipo OmniArt
Voz en off con IA para videos de YouTube: el flujo de un creador

Conseguir una voz en off pulida antes significaba reservar un estudio, contratar a un locutor o conformarse con un robot de texto a voz de 2012. Ninguna de esas opciones escala. Los modelos de voz con IA de OmniArt te dan narración con calidad de estudio a partir de un prompt de texto: eliges un preajuste de voz, pegas tu guion y tienes un archivo de audio terminado en segundos. Esta guía recorre el flujo completo: escribir un guion para el oído, elegir el modelo correcto, controlar la entrega y terminar tu video sin salir de la plataforma.

La versión corta: escribe oraciones breves, elige un modelo de voz de alta fidelidad, genera en el espacio de audio de OmniArt, itera con puntuación y señales dentro del texto, y luego coloca el audio debajo de tus imágenes. La versión larga está abajo.

Paso 1: escribe el guion para el oído

Un guion de YouTube no es un ensayo. El espectador no puede releer una oración: o te sigue o no. Eso significa:

  • Oraciones cortas. Una idea por oración. Menos de 15 palabras cuando se pueda.
  • Usa señales de ruta. “Primero… después… por último…” le permite al oyente ubicarse sin un índice.
  • Evita las cláusulas incrustadas. “El modelo, que fue entrenado con datos multilingües y admite interjecciones dentro del texto, maneja bien el tono” es una pesadilla para seguir a 1.25×. Divídela.
  • Léelo en voz alta. Si tú te trabas, el modelo también. Reescribe hasta que fluya al hablarlo.
  • Escríbele a tu oyente, no sobre tu tema. “Te conviene elegir el modelo HD” se siente más cercano que “Los creadores deberían considerar el modelo HD”.

Un guion de Shorts de 1,500 caracteres equivale a unos 90 segundos de narración. Es una buena referencia para calibrar.

Paso 2: elige un modelo

OmniArt te da cinco modelos de voz afinados para trabajos distintos. Elige el modelo por el trabajo, no por costumbre.

ModeloPlanLímite de caracteresCostoIdeal para
MiniMax Speech 2.8 HDFree10,000 caracteres1 crédito por bloque iniciado de 50 caracteresNarración pulida, ensayos largos
MiniMax Speech 2.8 TurboFree10,000 caracteres1 crédito por bloque de 100 caracteresBorradores rápidos, probar líneas alternativas
Eleven Multilingual v2Starter10,000 caracteres50 créditos por solicitudDoblaje multilingüe, canales localizados
Eleven v3Starter5,000 caracteres50 créditos por solicitudEntrega expresiva con etiquetas de audio
Eleven Turbo v2.5Starter40,000 caracteres100 créditos por solicitudVideoensayos completos en una sola pasada

MiniMax Speech 2.8 HD es la opción por defecto para narración pulida de YouTube. Sale bien parado en comparaciones de escucha a ciegas y maneja el contenido largo sin ensuciarse. Úsalo para tus tomas finales.

MiniMax Speech 2.8 Turbo cuesta la mitad de créditos y es lo bastante rápido como para probar veinte aperturas alternativas en una sesión. Haz el borrador con Turbo y cierra con HD.

Eleven Multilingual v2 es el modelo correcto cuando estás doblando contenido para audiencias internacionales. Mantiene la entrega estable entre idiomas, algo útil si estás armando versiones localizadas del mismo video.

Eleven v3 habilita etiquetas de audio entre corchetes como [excited] o [whispers], que moldean la entrega más allá de la puntuación. Recúrrelo cuando el guion necesite un rango emocional que los otros modelos no alcanzan.

Eleven Turbo v2.5 admite guiones de hasta 40,000 caracteres en una sola pasada: eso es la narración de un documental de 45 minutos. Si tu videoensayo se alarga, este es el único modelo que lo resuelve sin partir el guion en pedazos.

Consejo

OmniArt tiene 353 preajustes de voz curados repartidos entre los modelos de voz. Recórrelos antes de fijar una voz: el preajuste correcto hace más por la entrega que cualquier ajuste de prompt.

Paso 3: genera en el espacio de audio

  1. Abre el espacio de audio de OmniArt.
  2. Selecciona un modelo de voz en el selector de modelos.
  3. Elige un preajuste de voz. Escucha varios; el preajuste es la variable que más pesa en cómo se siente el resultado.
  4. Pega tu guion en el campo del prompt.
  5. Genera y escucha.

La primera toma es una base, no un resultado final. Estás escuchando el ritmo, los énfasis y las pausas poco naturales, y todo eso se corrige en el paso siguiente.

Paso 4: itera la entrega con puntuación e interjecciones

No hay un botón de “haz que suene menos plano”, pero sí puedes editar el guion para dirigir la entrega.

La puntuación moldea el ritmo. Las comas crean beats breves. Las rayas —como esta— agregan una media pausa con una sensación distinta a la de una coma. Los puntos suspensivos… generan titubeo. Un punto cierra una idea por completo. Úsalos con intención, no por gramática.

Los signos de interrogación disparan una entonación ascendente natural. Si una oración debe levantar al final, formúlala como pregunta aunque el contenido sea declarativo: “¿Te preguntas qué modelo usar?” en lugar de “Esta sección cubre la elección de modelo”.

Las mayúsculas señalan el acento. “Esto es IMPORTANTE” o “Necesitas elegir la voz CORRECTA” hará que la mayoría de los modelos enfatice la palabra en mayúsculas. Úsalo con moderación o se leerá como gritos.

Las interjecciones dentro del texto de MiniMax HD te dejan insertar señales emocionales a media narración usando paréntesis: (laughs), (sighs), (clears throat). Estas provocan un sonido natural antes de la siguiente oración.

Las etiquetas de audio de Eleven v3 usan corchetes: [excited], [whispers], [dramatic pause]. Colócalas justo antes de la oración a la que deben afectar.

Nota

Ni las interjecciones ni las etiquetas de audio son universales: dependen del modelo. Las interjecciones funcionan en MiniMax Speech 2.8 HD; las etiquetas entre corchetes funcionan en Eleven v3. Usar la notación equivocada en el modelo equivocado produce un resultado enredado. Consulta la guía de etiquetas de audio de Eleven v3 y la guía de voz en off de MiniMax Speech 2.8 para ver la sintaxis completa.

Ejemplo resuelto: costo en créditos de un guion para Shorts

Una narración típica de YouTube Shorts ronda los 1,500 caracteres. Así sale la cuenta de créditos en MiniMax Speech 2.8 HD, que cobra 1 crédito por cada bloque iniciado de 50 caracteres:

  • 1,500 caracteres ÷ 50 caracteres por bloque = 30 bloques
  • 30 bloques × 1 crédito = 30 créditos por la narración completa del Short

Si haces el borrador con Turbo (1 crédito por bloque de 100 caracteres), ese mismo guion cuesta 15 créditos por pasada de borrador. Haz diez borradores, elige el mejor y cierra con HD por 30 créditos más. Total: alrededor de 180 créditos para encontrar y terminar una narración pulida.

Doblaje multilingüe para audiencias internacionales

Hacer crecer un canal de YouTube más allá de un idioma es una apuesta compuesta: el mismo video, doblado al español, al portugués o al japonés, llega a otra audiencia sin más costo de producción que la narración.

El flujo es el mismo:

  1. Traduce tu guion (con una herramienta de traducción, un colaborador bilingüe o una pasada generada por un modelo y revisada por alguien que hable el idioma).
  2. Vuelve al audio de OmniArt y selecciona Eleven Multilingual v2.
  3. Elige un preajuste de voz adecuado para el idioma de destino: varios preajustes vienen etiquetados por idioma o región.
  4. Pega el guion traducido y genera.

Eleven Multilingual v2 conserva un ritmo y una entrega consistentes entre idiomas, algo que importa cuando el audio doblado debe sincronizar con imágenes montadas al tiempo original.

Advertencia

Las políticas de monetización de YouTube exigen que el contenido incluya un aporte real del creador: una voz en off generada con IA por sí sola no exime a un video de las políticas de la plataforma sobre divulgación de contenido sintético. Revisa siempre los lineamientos vigentes de YouTube y agrega una divulgación en la descripción de tu video cuando uses voz generada con IA.

Termina el video dentro de OmniArt

Una vez que tienes la narración, el resto de la producción puede quedarse en el mismo espacio.

  • Imágenes — genera clips de apoyo con cualquiera de los modelos de video de OmniArt. Córtalos al ritmo de la narración: un plano nuevo por oración, o sostenido más tiempo en los puntos más complejos.
  • Música — agrega una base musical con MiniMax Music 2.6 o Lyria 3 Pro. Una cama musical a unos −18 dB por debajo de la narración suma presencia sin competir.
  • Efectos de sonido — genera efectos para transiciones y momentos de énfasis. Consulta la guía del generador de efectos de sonido con IA para ver el flujo.

La ventaja central de trabajar con varias modalidades en un mismo lugar es la iteración: cambias la narración, regeneras los efectos que la enmarcan y ajustas la entrada musical en la misma sesión, en vez de ir y volver entre tres herramientas separadas y sus exportaciones.

Para formato corto en particular, revisa video con IA para TikTok y YouTube Shorts, el flujo de video vertical que hace pareja con este.

Cómo empezar en OmniArt

Escribe un guion de 1,500 caracteres, es decir, una narración del largo de un Short. Abre el espacio de audio de OmniArt, elige MiniMax Speech 2.8 HD, recorre los preajustes de voz y genera una primera toma. Escucha el ritmo y los énfasis, edita el guion con puntuación y haz una segunda pasada. La mayoría de las narraciones queda lista en dos o tres tomas. De ahí en adelante, genera las imágenes que la acompañen, agrega una cama musical y ya tienes un video completo hecho en un solo lugar.

¿Todo listo para crear?

Empieza a generar contenido increíble con IA

Empezar gratis