Suno Ahora Genera Voces Habladas, No Solo Canciones
La plataforma de música AI lanza una versión beta pública de síntesis de voz, permitiendo a los creadores producir voces en off y pistas de acompañamiento en la misma sesión. Es un giro real para una empresa que, hasta hace dos semanas, solo hacía música.

Puntos clave
- Suno lanzó una función de voz en beta pública en sus plataformas web y móvil, permitiendo a los usuarios generar voces en off habladas y música de fondo juntas.
- La función acepta un guión escrito o una descripción de texto de una voz deseada, luego sintetiza audio de cualquiera de las dos opciones.
- Suno v6, lanzado el 9 de septiembre de 2026, fue el primer modelo de música AI entrenado con canciones licenciadas de sellos discográficos.
- Suno no ha publicado detalles sobre qué datos se utilizaron para entrenar el modelo de voz.
- La herramienta de voz está en beta pública, lo que significa que está disponible para probar pero no es un producto terminado.
Suno, la plataforma de música AI mejor conocida por convertir un mensaje de texto en una canción completa, ahora puede generar voces habladas que suenan humanas. La función, llamada Speech, se lanzó esta semana en beta pública en su sitio web y aplicaciones móviles, según reportó primero The Verge AI.
¿Qué hace esto realmente?
Los usuarios escriben un guión o describen el tipo de voz que desean, y Suno produce audio hablado. El agregado clave es que funciona junto con la generación de música de la plataforma, por lo que un creador puede obtener una voz en off y una pista de acompañamiento en una sola sesión en lugar de unir archivos de diferentes herramientas. Las introducciones de podcasts y la narración de video de formato corto son los usos obvios. Si la calidad de la voz se mantiene frente a herramientas de voz dedicadas es lo que el período beta pretende probar.
¿Por qué importa esto para la posición de Suno?
Este es un cambio genuino de dirección. Hasta esta semana, todo el producto de Suno era música. La empresa se ha movido rápido: Suno v6 se convirtió en el primer modelo de música AI entrenado con canciones licenciadas de sellos discográficos hace solo dos semanas, un cambio legal significativo después de años de disputas con Sony, Universal y otros.
Agregar síntesis de voz pone a Suno en una nueva categoría competitiva. Ya no compite solo con herramientas de música AI; ahora se superpone con plataformas de voz como ElevenLabs y las funciones de voz integradas en asistentes de IA de propósito general.
La cuestión de las licencias también importa aquí. El entrenamiento de música de Suno generó suficientes preocupaciones de derechos de autor para que los sellos discográficos demandaran antes de eventualmente licenciar sus catálogos para v6. La síntesis de voz conlleva sus propios riesgos legales en torno al consentimiento y el uso de voces de artistas reales como datos de entrenamiento, y Suno aún no ha dicho qué datos se utilizaron para entrenar el modelo de voz. Cubrimos el patrón más amplio de presión legal sobre Suno en nuestro informe de agosto sobre medidas de marca de agua y detección de derechos de autor.
Para los usuarios ordinarios, la ventaja práctica es más simple: la producción. Generar un video explicativo corto o un demo reel ya no requiere herramientas separadas para voz y música. Esa conveniencia es real, y probablemente sea lo que la mayoría de las personas notará primero.
Preguntas frecuentes
¿Es la función de voz gratuita?
Suno no ha anunciado precios separados para Speech. Como beta pública, aparece dentro de los niveles de plataforma existentes, pero la empresa puede cambiar los términos de acceso antes de un lanzamiento completo.
¿Puede la herramienta clonar la voz de una persona específica?
El anuncio de Suno describe la generación de voces a partir de descripciones de texto o guiones, no de cargar una muestra de una voz existente. El clonaje de voz no parece ser parte de esta función.
¿Quién se ve afectado primero?
Cualquiera con una cuenta de Suno en web o móvil puede acceder a la beta ahora. Los creadores profesionales que producen video de formato corto o contenido de podcast se beneficiarán más del flujo de trabajo combinado de voz y música.



