Hogar
Tencent y Tsinghua lanzan SongGeneration 2, con una tasa de error del 8,55 %, lo que intensifica la presión sobre Suno
El panorama de la música generada por IA experimentó otro cambio significativo a principios de 2026. El 9 de marzo se presentó oficialmente el modelo base musical SongGeneration2, desarrollado conjuntamente por Tencent y el Laboratorio de Interacción Voz-Ordenador de la Universidad de Tsinghua . Este modelo no solo supuso un salto cualitativo en la arquitectura técnica, sino que también superó a los modelos de código abierto más extendidos actualmente en múltiples aspectos fundamentales, llegando incluso a rivalizar con los mejores modelos comerciales en cuanto a calidad general.

Tres avances decisivos: se acabó la música generada por IA «artificial»
Las principales ventajas de SongGeneration2 provienen de una actualización integral de su arquitectura subyacente, que aborda tres puntos débiles clave que afectaban a la música generada por IA anteriormente:
Alta musicalidad: a diferencia de la simple superposición de melodías, este modelo gestiona arreglos complejos de varias pistas con una profundidad espacial impresionante.
Alta precisión en las letras: la pronunciación poco clara y los cambios de tono «alucinados» ya son cosa del pasado. Su tasa de error de fonemas (PER) es de tan solo el 8,55 %, superando notablemente al modelo comercial líder, Suno v5 (12,4 %), y solo por detrás de MiniMax2.5 .
Gran capacidad de control: ya sea a través de descripciones de texto o indicaciones de audio, sigue las instrucciones con precisión, lo que permite una personalización profunda del estilo y la emoción.

Impulso «Dual-Core»: una colaboración de ensueño entre los modelos LLM y de difusión
Desde el punto de vista arquitectónico, SongGeneration2 emplea una innovadora arquitectura híbrida de LLM y difusión:
Composing Brain (LeLM): se encarga de la planificación de la estructura global y de los detalles vocales, resolviendo el reto de «cómo cantar».
Renderizador de alta fidelidad (difusión): sintetiza detalles acústicos extremadamente complejos bajo la guía del modelo de lenguaje.
Representación jerárquica: es el primero en adoptar el modelado paralelo de representaciones mixtas y multipista, equilibrando la estabilidad melódica con el refinamiento de la calidad del sonido.
Verdadero código abierto, fácil acceso: incluso los ordenadores normales pueden «escribir canciones»
Lo que más entusiasmó a los desarrolladores fue la notable apertura de Tencent. El modelo SongGeneration-v2-large, con 4.000 millones de parámetros, es ahora totalmente de código abierto y admite la generación multilingüe, incluyendo el chino y el inglés. Sorprendentemente, funciona a la perfección en hardware de consumo con tan solo 22 GB de VRAM, lo que permite la creación musical local y privada.
Para que los usuarios puedan probarlo de inmediato, el equipo también ha lanzado la versión SongGeneration-v2-Fast en HuggingFace, que sacrifica una mínima pérdida de calidad de audio a cambio de una generación ultrarrápida, capaz de producir una canción completa en menos de un minuto.
A juzgar por el rendimiento de SongGeneration2 , la música generada por IA ha pasado oficialmente de ser un «juguete para frikis» a entrar en el ámbito de las «aplicaciones de nivel comercial». Con la próxima publicación en código abierto de un modelo Medium compatible con 12 GB de VRAM y un marco de evaluación automatizado, la era en la que todo el mundo se convierta en «compositor» podría estar finalmente a la vuelta de la esquina.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
El panorama de la música generada por IA experimentó otro cambio significativo a principios de 2026. El 9 de marzo se presentó oficialmente el modelo base musical SongGeneration2, desarrollado conjuntamente por

Tres avances decisivos: se acabó la música generada por IA «artificial»
Las principales ventajas de
Alta musicalidad: a diferencia de la simple superposición de melodías, este modelo gestiona arreglos complejos de varias pistas con una profundidad espacial impresionante.
Alta precisión en las letras: la pronunciación poco clara y los cambios de tono «alucinados» ya son cosa del pasado. Su tasa de error de fonemas (PER) es de tan solo el 8,55 %, superando notablemente al modelo comercial líder,
Gran capacidad de control: ya sea a través de descripciones de texto o indicaciones de audio, sigue las instrucciones con precisión, lo que permite una personalización profunda del estilo y la emoción.

Impulso «Dual-Core»: una colaboración de ensueño entre los modelos LLM y de difusión
Desde el punto de vista arquitectónico,
Composing Brain (LeLM): se encarga de la planificación de la estructura global y de los detalles vocales, resolviendo el reto de «cómo cantar».
Renderizador de alta fidelidad (difusión): sintetiza detalles acústicos extremadamente complejos bajo la guía del modelo de lenguaje.
Representación jerárquica: es el primero en adoptar el modelado paralelo de representaciones mixtas y multipista, equilibrando la estabilidad melódica con el refinamiento de la calidad del sonido.
Verdadero código abierto, fácil acceso: incluso los ordenadores normales pueden «escribir canciones»
Lo que más entusiasmó a los desarrolladores fue la notable apertura de Tencent. El modelo SongGeneration-v2-large, con 4.000 millones de parámetros, es ahora totalmente de código abierto y admite la generación multilingüe, incluyendo el chino y el inglés. Sorprendentemente, funciona a la perfección en hardware de consumo con tan solo 22 GB de VRAM, lo que permite la creación musical local y privada.
Para que los usuarios puedan probarlo de inmediato, el equipo también ha lanzado la versión SongGeneration-v2-Fast en HuggingFace, que sacrifica una mínima pérdida de calidad de audio a cambio de una generación ultrarrápida, capaz de producir una canción completa en menos de un minuto.
A juzgar por el rendimiento de
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











