Por qué está escrito así
Al preparar un guion para locución con IA, el error más común es copiar y pegar un texto escrito directamente en el generador de voz. Sin embargo, lo que funciona al leer con los ojos no siempre funciona al oído. Las oraciones largas con paréntesis hacen que el motor de síntesis no sepa dónde pausar y lea todo de corrido sin respirar, y formatos como "1/3~14/3" pueden pronunciarse de forma extraña o incorrecta.
Las reglas de la sección de la tarea están pensadas exclusivamente para el oído: frases breves, una idea por oración, eliminar paréntesis y escribir números en palabras. Dejar las cifras y siglas transcritas fonéticamente evita tener que lidiar con la interpretación errática de la herramienta. Es mucho más efectivo corregir el texto base que ajustar mil parámetros en el software de voz.
En el formato, solicitar el tiempo estimado por párrafo permite sincronizar el guion con la duración real del video. Si el audio final dura 10 segundos más de lo previsto, habrá que rehacer la edición de video. Además, ver la lista de cambios ayuda a confirmar rápidamente que no se haya alterado el sentido original durante la adaptación para TTS.
Las restricciones impiden que la IA agregue eslóganes o datos inventados. Por último, la instrucción de revisión obliga al modelo a evaluar la cadencia oral, detectando tropiezos fonéticos que a simple vista parecían correctos.
¿Términos desconocidos? Consulta Aha AI: output-format, self-consistency
Comparado con un mal ejemplo
Voy a usar este texto para un TTS, adáptalo para que suene natural. (pegar texto)
Pedir simplemente que "suene natural" suele traducirse en recortar apenas unas palabras. Las fechas, números, paréntesis y siglas permanecen intactos, provocando tropiezos en la pronunciación de la IA. Tampoco se calcula el tiempo, por lo que recién al editar el video se descubre que el audio es demasiado largo.
Variaciones
Para un guion con diálogo entre dos voces
Quiero montar dos voces de IA alternadas para un video de {{duración del video}}. Transforma el siguiente manuscrito original en un guion conversacional entre un presentador y un especialista. Separa una línea cada vez que cambie de interlocutor e indica su nombre al inicio. Procura que ninguna intervención supere tres oraciones continuas y añade el tiempo estimado de lectura en cada bloque.
Manuscrito original: """ {{manuscrito original}} """
Una sola voz explicando un tema largo puede volverse monótona. El formato de diálogo dinámico mantiene la atención del oyente con mayor facilidad.
Para ajustar estrictamente a la duración del video
Reduce el siguiente manuscrito original para que pueda leerse cómodamente dentro de {{duración del video}}. Calcula primero la cantidad límite de palabras según el tiempo indicado y luego adapta el texto a ese margen. En lugar de condensar las frases volviéndolas densas, elimina párrafos completos de menor importancia e incluye una lista con los puntos descartados.
Manuscrito original: """ {{manuscrito original}} """
Condensar demasiado las oraciones vuelve el audio difícil de procesar. Reducir la cantidad de frases garantiza que lo que quede se escuche con calma y claridad.
Notas por modelo
Cada motor de síntesis de voz gestiona las pausas en comas y puntos de manera distinta, y la velocidad varía según la voz seleccionada. Los cálculos de tiempo son aproximados; lo ideal es generar el audio del primer párrafo para calibrar la velocidad real antes de producir el resto. Aunque algunas plataformas admiten etiquetas SSML para velocidad o entonación, su sintaxis cambia según el proveedor, por lo que es más seguro y limpio ajustar esos detalles desde la interfaz de la herramienta.
Prompts relacionados
Última actualización 2026-09-02 · ¿Has visto un error? Avísanos