Дом
StepZen представляет серию голосовых моделей StepAudio 3, обеспечивая несколько мировых первенств

15 сентября StepXingchen официально выпустила новую серию голосовых больших моделей StepAudio3. Этот запуск включает пять различных продуктов: StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen и StepAudio3Music. Несколько из этих моделей заняли первые места в глобальном рейтинге авторитетной платформы Artificial Analysis. Эти пять моделей теперь полностью доступны на открытой платформе StepXingchen, охватывая пять ключевых сценариев применения: реалистичную генерацию голоса, создание комплексного аудиоконтента, голосовое взаимодействие в реальном времени, понимание речи в сложных сценариях и музыкальное производство.
Для взаимодействия в реальном времени StepAudio3Realtime разработан для обеспечения полнодуплексных нативных разговоров. Он занял первое место в глобальном рейтинге Artificial Analysis Conversational Dynamics с общим баллом 98,9%, а также лидирует в рейтинге Artificial Analysis Speech Reasoning с точностью 99,7%. Модель точно улавливает ритм разговора, обрабатывает прерывания пользователя и непрерывную обратную связь, а также поддерживает понимание семантики, тона, эмоций, паралингвистических элементов и фоновых звуков. Кроме того, она обеспечивает параллельное рассуждение и генерацию голоса, а также асинхронные вызовы инструментов (Tool Call) и выполнение длительных задач, гарантируя непрерывность голосового общения.
Что касается распознавания речи, StepAudio3ASR сочетает высокоточную транскрипцию с возможностями логического вывода больших языковых моделей, превосходя традиционные методы транскрипции только аудио. Он поддерживает разнообразные сценарии, включая китайский, английский, диалекты, смешанные языки, длинные аудиофайлы и специализированные области. Модель отлично справляется с медицинскими, юридическими, финансовыми, автомобильными и программистскими контекстами, а также эффективно обрабатывает сложные входные среды, такие как низкая громкость, высокая скорость речи, нечеткое произношение, пение и фоновая музыка. Показатель ошибки распознавания слов (WER) для нерастяжимого распознавания речи составляет всего 1,7%, что делит первое место в мире.
В области генерации голоса StepAudio3TTS — это реалистичная модель, предназначенная для взаимодействия в реальном времени. Она идеально соответствует естественным паттернам человеческой речи с точки зрения базового тона, интонации, ритма и пауз. Модель воспроизводит паралингвистические выражения, такие как смех, колебания, заикание, повторения и исправления, а также может автономно корректировать эмоциональные тона в зависимости от семантического содержания. Используя архитектуру потоковой генерации, модель синхронизирует процесс генерации и воспроизведения.
Для комплексного создания аудиоконтента StepAudio3Gen упрощает традиционный длительный процесс производства, редактирования и сведения. Пользователи могут одновременно генерировать вокал, звуковые эффекты, фоновые звуки и музыку, используя описания на естественном языке и эталонные аудиофайлы. Модель позволяет тонко контролировать паралингвистические характеристики, такие как голос персонажа, стиль речи, эмоции, диалекты и смех. Она также позволяет пользователям указывать время и последовательность диалогов, звуковых эффектов и фоновой музыки, напрямую влияя на звуковой дизайн и временную последовательность всего контента.
В области музыкального творчества StepAudio3Music поддерживает как генерацию с нуля (zero-shot), так и многоэтапное интерактивное создание на основе нотации ABC. Пользователи могут вводить тексты песен, акапеллу, эталонные песни или нотацию и использовать естественный язык для управления жанром, вокалом, мелодией, ритмом, инструментами и эмоциями. Модель глубоко понимает структуру песни, развитие мелодии между куплетами и изменения энергии. Особенно в сценариях сопровождения акапеллы один трек акапеллы может автоматически генерировать гармонии, ритм, инструменты и полные аранжировки, облегчая настоящее музыкальное производство.
Связанная статья
Набор Kimi K3, предназначенный для запуска в этом месяце с 2,5 триллионами параметров
Ландшафт крупных моделей усложнился во второй половине 2026 года. Наряду с DeepSeek V4, Moonshot AI подтвердила выпуск Kimi K3 в этом месяце.Хотя конкретные даты остаются нераскрытыми, инсайдеры сообщают, что Kimi K3 обладает до 2,5 триллиона параме
«Мама из Дуньхуана» Чжан Кэцзяна: Зарегистрирована. Одинокая мать влюбляется в ИИ и путешествует по Китаю
В июле 2026 года Национальное управление по делам кино утвердило сценарный план будущего фильма Чжан Кэцзя «Мама из Дуньхуана». Сюжет рассказывает о современной истории одинокой матери в Дуньхуане, которая постепенно обращается к искусственному интел
Deezer сообщает, что более 50 % ежедневных загрузок приходится на музыку, созданную с помощью ИИ, и планирует удалять непрослушанный контент по истечении шести месяцев
Deezer, один из крупнейших сервисов потоковой передачи музыки, недавно обнародовал тревожные статистические данные: треки, созданные с помощью искусственного интеллекта, теперь составляют более полови
Рекомендации по связанным специальным темам
Комментарии (0)

15 сентября StepXingchen официально выпустила новую серию голосовых больших моделей StepAudio3. Этот запуск включает пять различных продуктов: StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen и StepAudio3Music. Несколько из этих моделей заняли первые места в глобальном рейтинге авторитетной платформы Artificial Analysis. Эти пять моделей теперь полностью доступны на открытой платформе StepXingchen, охватывая пять ключевых сценариев применения: реалистичную генерацию голоса, создание комплексного аудиоконтента, голосовое взаимодействие в реальном времени, понимание речи в сложных сценариях и музыкальное производство.
Для взаимодействия в реальном времени StepAudio3Realtime разработан для обеспечения полнодуплексных нативных разговоров. Он занял первое место в глобальном рейтинге Artificial Analysis Conversational Dynamics с общим баллом 98,9%, а также лидирует в рейтинге Artificial Analysis Speech Reasoning с точностью 99,7%. Модель точно улавливает ритм разговора, обрабатывает прерывания пользователя и непрерывную обратную связь, а также поддерживает понимание семантики, тона, эмоций, паралингвистических элементов и фоновых звуков. Кроме того, она обеспечивает параллельное рассуждение и генерацию голоса, а также асинхронные вызовы инструментов (Tool Call) и выполнение длительных задач, гарантируя непрерывность голосового общения.
Что касается распознавания речи, StepAudio3ASR сочетает высокоточную транскрипцию с возможностями логического вывода больших языковых моделей, превосходя традиционные методы транскрипции только аудио. Он поддерживает разнообразные сценарии, включая китайский, английский, диалекты, смешанные языки, длинные аудиофайлы и специализированные области. Модель отлично справляется с медицинскими, юридическими, финансовыми, автомобильными и программистскими контекстами, а также эффективно обрабатывает сложные входные среды, такие как низкая громкость, высокая скорость речи, нечеткое произношение, пение и фоновая музыка. Показатель ошибки распознавания слов (WER) для нерастяжимого распознавания речи составляет всего 1,7%, что делит первое место в мире.
В области генерации голоса StepAudio3TTS — это реалистичная модель, предназначенная для взаимодействия в реальном времени. Она идеально соответствует естественным паттернам человеческой речи с точки зрения базового тона, интонации, ритма и пауз. Модель воспроизводит паралингвистические выражения, такие как смех, колебания, заикание, повторения и исправления, а также может автономно корректировать эмоциональные тона в зависимости от семантического содержания. Используя архитектуру потоковой генерации, модель синхронизирует процесс генерации и воспроизведения.
Для комплексного создания аудиоконтента StepAudio3Gen упрощает традиционный длительный процесс производства, редактирования и сведения. Пользователи могут одновременно генерировать вокал, звуковые эффекты, фоновые звуки и музыку, используя описания на естественном языке и эталонные аудиофайлы. Модель позволяет тонко контролировать паралингвистические характеристики, такие как голос персонажа, стиль речи, эмоции, диалекты и смех. Она также позволяет пользователям указывать время и последовательность диалогов, звуковых эффектов и фоновой музыки, напрямую влияя на звуковой дизайн и временную последовательность всего контента.
В области музыкального творчества StepAudio3Music поддерживает как генерацию с нуля (zero-shot), так и многоэтапное интерактивное создание на основе нотации ABC. Пользователи могут вводить тексты песен, акапеллу, эталонные песни или нотацию и использовать естественный язык для управления жанром, вокалом, мелодией, ритмом, инструментами и эмоциями. Модель глубоко понимает структуру песни, развитие мелодии между куплетами и изменения энергии. Особенно в сценариях сопровождения акапеллы один трек акапеллы может автоматически генерировать гармонии, ритм, инструменты и полные аранжировки, облегчая настоящее музыкальное производство.
Набор Kimi K3, предназначенный для запуска в этом месяце с 2,5 триллионами параметров
Ландшафт крупных моделей усложнился во второй половине 2026 года. Наряду с DeepSeek V4, Moonshot AI подтвердила выпуск Kimi K3 в этом месяце.Хотя конкретные даты остаются нераскрытыми, инсайдеры сообщают, что Kimi K3 обладает до 2,5 триллиона параме
«Мама из Дуньхуана» Чжан Кэцзяна: Зарегистрирована. Одинокая мать влюбляется в ИИ и путешествует по Китаю
В июле 2026 года Национальное управление по делам кино утвердило сценарный план будущего фильма Чжан Кэцзя «Мама из Дуньхуана». Сюжет рассказывает о современной истории одинокой матери в Дуньхуане, которая постепенно обращается к искусственному интел
Deezer сообщает, что более 50 % ежедневных загрузок приходится на музыку, созданную с помощью ИИ, и планирует удалять непрослушанный контент по истечении шести месяцев
Deezer, один из крупнейших сервисов потоковой передачи музыки, недавно обнародовал тревожные статистические данные: треки, созданные с помощью искусственного интеллекта, теперь составляют более полови











