Fuentes
Hazla tuya
¿Te inspiró esta historia? Convierte la idea en tu propio arte con IA en segundos: empieza gratis, sin tarjeta.
Empieza gratis
Elias explica la investigación detrás de los titulares en lenguaje claro.
¿Te inspiró esta historia? Convierte la idea en tu propio arte con IA en segundos: empieza gratis, sin tarjeta.
Empieza gratisElige un compañero y descubre su opinión sobre esta noticia
Suno, la plataforma de música con IA, ha lanzado una función en beta pública llamada Speech que genera audio de voz hablada a partir de un guion o descripción de texto y lo superpone con música de fondo compuesta por IA, convirtiendo lo que antes era un flujo de trabajo de dos herramientas en un único prompt.
Suno Speech acepta dos tipos de entrada: un guion directo (las palabras que deseas que se digan) o un prompt descriptivo («un narrador tranquilo que explica el cielo nocturno»). El modelo genera entonces una voz que se ajuste y, simultáneamente, compone música instrumental para situarla por debajo. Según The Verge, las dos capas de audio se generan juntas en lugar de ensamblarse en posproducción, lo que significa que el tempo y la dinámica de la música se moldean en torno al habla desde el principio, no se añaden después.
Esa distinción importa para cualquiera que haya dedicado tiempo a sincronizar manualmente una narración con una pista musical generada por separado. La fricción habitual —ajustar el tempo, recortar silencios, desplazar los fundidos de entrada— desaparece cuando ambos elementos comparten un único proceso de generación.

La función Speech de Suno genera audio hablado y música de acompañamiento a partir de un único prompt de texto, mostrado aquí en ejemplos de salida de la beta pública.
Imagen: The Verge / The Verge AI
El estilo de voz en Suno Speech se controla mediante prompts, siguiendo la misma lógica que el modo de música de la plataforma. Describir «un narrador de voz ronca y ritmo lento» o «un animado presentador de podcast» moldea el resultado de forma similar a como especificar «lo-fi hip-hop con un piano melancólico» da forma a una pista musical. En la beta actual no existe clonación de voz a partir de una muestra cargada: las voces se generan de nuevo a partir de la descripción, lo que mantiene la función alejada del territorio legalmente más comprometido que ocupan las herramientas de clonación de voz.
Para los creadores que construyen personajes de IA o escenas narradas, este es un punto de partida significativo: puedes iterar sobre la personalidad vocal únicamente mediante texto, sin grabar audio de referencia ni licenciar una voz específica. La contrapartida es un control menos preciso en comparación con las plataformas dedicadas de texto a voz — el ranking abierto de TTS de Hugging Face compara varias alternativas si la calidad de voz detallada es la prioridad.

La interfaz Speech de Suno permite a los usuarios introducir un guion o descripción en prompt para generar una pista con voz y música de fondo simultánea.
Imagen: The Verge / The Verge AI
El caso de uso más directo es la narración de vídeo de formato corto: el tipo de base de audio de 30 a 90 segundos que los creadores ensamblan actualmente generando música en Suno (o un competidor), generando voz en una herramienta TTS separada y editando ambas en un DAW o editor de vídeo. Suno Speech comprime todo eso en un solo paso.
El propio enfoque de Suno, según informa The Verge, es cuidadoso: «La música siempre estará en el núcleo de lo que hacemos», lo que indica que Speech es una extensión del producto musical, no un reposicionamiento hacia la IA de voz general. Ese enfoque también sugiere que la función se orientará hacia contextos musicales (intros, pistas narradas, canciones de palabra hablada) en lugar de la producción de audiolibros o podcasts de larga duración.
Para los creadores de imágenes y vídeo con IA que ya usan Suno para el audio de fondo, la incorporación de narración sincronizada elimina una dependencia externa más. Un creador que construye una presentación narrada por IA o un cortometraje animado dispone ahora de un plausible flujo de audio en una sola plataforma: genera la voz y la música juntas, exporta y las incorpora al editor de vídeo.
La beta está disponible ahora en web y móvil. Como ocurre con la mayoría de las betas de Suno, la calidad de salida y el alcance de las funciones probablemente cambiarán antes del lanzamiento completo, por lo que vale la pena probar la versión actual para evaluar su idoneidad, pero aún no es el momento de reconstruir un flujo de producción en torno a ella.