Suno lanza la función 'Speech' para generar locuciones con IA y música de fondo
La plataforma de música con IA Suno ha lanzado una herramienta en beta pública llamada Speech, que permite a los usuarios generar voces sintéticas acompañadas de música de fondo cohesiva.

La plataforma de audio generativo Suno se expande más allá de la creación de canciones con el lanzamiento de "Speech", una nueva herramienta diseñada para generar voces habladas a partir de guiones escritos o descripciones en texto. La función ya se encuentra disponible en beta pública a través de las aplicaciones móviles y web de Suno.
A diferencia de los motores convencionales de texto a voz, el principal factor diferenciador de Suno es su capacidad para producir simultáneamente locuciones sintéticas y música de fondo dentro de una misma pista de audio cohesiva.
Combinando voz y música
De acuerdo con Suno, la nueva herramienta busca cerrar la brecha entre la locución hablada y el acompañamiento musical. Los usuarios pueden acceder a ella seleccionando la pestaña "Create" en la interfaz y navegando hacia la opción "Speech".
“La música siempre estará en el corazón de Suno y de lo que construimos. Al mismo tiempo, nuestra visión siempre se ha extendido hacia otras formas de expresión humana”, señaló en el anuncio Jack Brody, Chief Product Officer de Suno. “Hoy estamos expandiendo lo que es posible en Suno con Speech: el primer modelo de audio que genera voz y música juntas en una sola pista cohesiva”.
Aunque el sistema está diseñado para sincronizar la voz con un fondo musical —como melodías relajantes para poesía o pistas de alta energía para discursos dramáticos—, la música de fondo es opcional. Los creadores que solo necesiten grabaciones de voz limpias pueden desactivar la pista de acompañamiento mediante un interruptor integrado.
La entrada a un mercado concurrido
La síntesis de voz mediante deep learning es un sector consolidado. Google DeepMind ha explorado la generación de voz durante cerca de una década, Adobe ofrece capacidades dedicadas de texto a voz y plataformas especializadas como ElevenLabs han conseguido una adopción masiva desde su lanzamiento en 2023.
Con la introducción de Speech, Suno amplía su catálogo de productos hacia la actuación de voz, la narración de historias y las locuciones. Esta diversificación llega mientras la compañía sigue enfrentando presiones legales continuas, dado que su motor principal de generación de música mediante IA ha provocado múltiples demandas por derechos de autor por parte de la industria discográfica.



