Дом
Tencent и Цинхуа запустили SongGeneration 2 с уровнем ошибок 8,55 %, усилив давление на Suno
В начале 2026 года в сфере музыки, создаваемой с помощью искусственного интеллекта, произошёл очередной значительный сдвиг. 9 марта была официально представлена базовая модель для генерации музыки SongGeneration2, разработанная совместно компанией Tencent и Лабораторией взаимодействия человека и компьютера в области речи при Университете Цинхуа . Эта модель не только ознаменовала качественный скачок в технической архитектуре, но и превзошла существующие основные модели с открытым исходным кодом по целому ряду ключевых показателей, а по общему качеству даже не уступала ведущим коммерческим моделям.

Три прорыва: конец «неживой» музыке, созданной ИИ
Основные преимущества SongGeneration2 обусловлены комплексным обновлением базовой архитектуры, устраняющим три ключевые проблемы, которые мешали развитию ИИ-музыки ранее:
Высокая музыкальность: в отличие от простого наложения мелодий, эта модель обрабатывает сложные многодорожечные аранжировки с впечатляющей пространственной глубиной.
Высокая точность текстов: нечеткое произношение и хаотичные изменения высоты тона теперь остались в прошлом. Показатель ошибок фонем (PER) составляет всего 8,55%, что значительно превосходит показатель ведущей коммерческой модели Suno v5 (12,4%) и уступает лишь MiniMax2.5 .
Высокая управляемость: будь то текстовые описания или аудиоподсказки, модель точно следует инструкциям, что позволяет глубоко настраивать стиль и эмоциональную окраску.

«Двухъядерный» привод: идеальное сотрудничество между LLM и диффузионными моделями
С архитектурной точки зрения SongGeneration2 использует инновационную гибридную архитектуру LLM-диффузии:
«Композиторский мозг» (LeLM): отвечает за планирование общей структуры и вокальные детали, решая задачу «как петь».
High-Fidelity Renderer (диффузия): синтезирует чрезвычайно сложные акустические детали под руководством языковой модели.
Иерархическое представление: первая система, использующая параллельное моделирование смешанных и многодорожечных представлений, обеспечивающая баланс между стабильностью мелодии и усовершенствованием качества звука.
Настоящий открытый исходный код, низкий порог входа: даже обычные компьютеры могут «сочинять песни»
Больше всего разработчиков воодушевила замечательная открытость Tencent. Модель SongGeneration-v2-large с 4 миллиардами параметров теперь полностью открыта, поддерживая многоязычное генерацию, включая китайский и английский языки. Примечательно, что она плавно работает на потребительском оборудовании с всего лишь 22 ГБ видеопамяти, что позволяет создавать музыку локально и в частном режиме.
Чтобы пользователи могли сразу же опробовать эту технологию, команда также выпустила версию SongGeneration-v2-Fast на HuggingFace, в которой минимальное снижение качества звука компенсируется сверхбыстрым генерацией — создание полной песни занимает менее минуты.
Судя по производительности SongGeneration2 , музыка на базе ИИ официально превратилась из «игрушки для гиков» в сферу «приложений коммерческого уровня». С предстоящим открытием исходного кода модели Medium, поддерживающей 12 ГБ видеопамяти, и появлением автоматизированной системы оценки, эра, когда каждый сможет стать «композитором», возможно, наконец-то наступит.
Связанная статья
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Рекомендации по связанным специальным темам
Комментарии (0)
В начале 2026 года в сфере музыки, создаваемой с помощью искусственного интеллекта, произошёл очередной значительный сдвиг. 9 марта была официально представлена базовая модель для генерации музыки SongGeneration2, разработанная совместно компанией

Три прорыва: конец «неживой» музыке, созданной ИИ
Основные преимущества
Высокая музыкальность: в отличие от простого наложения мелодий, эта модель обрабатывает сложные многодорожечные аранжировки с впечатляющей пространственной глубиной.
Высокая точность текстов: нечеткое произношение и хаотичные изменения высоты тона теперь остались в прошлом. Показатель ошибок фонем (PER) составляет всего 8,55%, что значительно превосходит показатель ведущей коммерческой модели
Высокая управляемость: будь то текстовые описания или аудиоподсказки, модель точно следует инструкциям, что позволяет глубоко настраивать стиль и эмоциональную окраску.

«Двухъядерный» привод: идеальное сотрудничество между LLM и диффузионными моделями
С архитектурной точки зрения
«Композиторский мозг» (LeLM): отвечает за планирование общей структуры и вокальные детали, решая задачу «как петь».
High-Fidelity Renderer (диффузия): синтезирует чрезвычайно сложные акустические детали под руководством языковой модели.
Иерархическое представление: первая система, использующая параллельное моделирование смешанных и многодорожечных представлений, обеспечивающая баланс между стабильностью мелодии и усовершенствованием качества звука.
Настоящий открытый исходный код, низкий порог входа: даже обычные компьютеры могут «сочинять песни»
Больше всего разработчиков воодушевила замечательная открытость Tencent. Модель SongGeneration-v2-large с 4 миллиардами параметров теперь полностью открыта, поддерживая многоязычное генерацию, включая китайский и английский языки. Примечательно, что она плавно работает на потребительском оборудовании с всего лишь 22 ГБ видеопамяти, что позволяет создавать музыку локально и в частном режиме.
Чтобы пользователи могли сразу же опробовать эту технологию, команда также выпустила версию SongGeneration-v2-Fast на HuggingFace, в которой минимальное снижение качества звука компенсируется сверхбыстрым генерацией — создание полной песни занимает менее минуты.
Судя по производительности
Meta удаляет функцию редактирования фотографий с помощью ИИ после негативной реакции пользователей
Meta, гигант социальных сетей, вновь оказалась в центре публичной дискуссии о хрупком балансе между искусственным интеллектом и конфиденциальностью пользователей. Согласно TechCrunch, подразделение Meta Superintelligence Labs представило новый генера
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











