Дом
Alibaba Tongyi представляет голосовую модель с управлением на естественном языке «FreeStyle»
Сегодня команда Alibaba Tongyi Lab по разработке речевых технологий представила две революционные модели генерации голоса: Fun-CosyVoice3.5 и Fun-AudioGen-VD. Отличительной особенностью этих моделей является поддержка команд «FreeStyle». Вместо сложной настройки параметров пользователи могут точно контролировать стили вокального выражения или создавать сложные аудиосцены с нуля, используя простые описания на естественном языке.

Каждая модель служит определенным целям:
Fun-CosyVoice3.5: многоязычное воспроизведение и тонкое управление
Эта усовершенствованная версия CosyVoice достигает прорыва в понимании нюансов речевой экспрессии.
Генерация на основе команд: пользователи могут вводить инструкции, такие как «говорить более уверенно» или «замедлить речь с эмоциональными колебаниями», для корректировки голоса в режиме реального времени.
Расширение языкового диапазона: добавлена поддержка тайского, индонезийского, португальского и вьетнамского языков, что позволяет сохранить лидирующие в отрасли показатели точности транскрипции (WER) и схожести голоса на 13 языках.
Оптимизация редких символов: специальное обучение снизило уровень ошибок для редких символов с 15,2% до 5,3%.
Повышение производительности: задержка первого пакета уменьшилась на 35%, что значительно улучшило плавность взаимодействия в реальном времени.
Fun-AudioGen-VD: комплексное звуковое проектирование
Эта модель действует как «аудиорежиссер», генерируя интегрированный звук, сочетающий «персонажей + окружение».
Настройка голоса: Укажите пол, возраст, акцент и подробные характеристики, такие как «хриплый, глубокий или низкий» голос.
Эмоции и ролевые игры: имитирует роли, включая агентов службы поддержки клиентов, дикторов и детей, даже передавая сложные состояния, такие как «внешнее спокойствие с внутренним напряжением».
Иммерсивные среды: добавляет фоновые звуки (хаос на поле боя, шум в кафе) и пространственные эффекты (реверберация собора, подводная акустика) для полной пространственной симуляции.
Tongyi Lab отмечает, что эти модели демократизируют создание высококачественного голоса, предлагая мощную поддержку ИИ для подкастинга, разработки игр и постпродакшна фильмов.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
Сегодня команда Alibaba Tongyi Lab по разработке речевых технологий представила две революционные модели генерации голоса: Fun-CosyVoice3.5 и Fun-AudioGen-VD. Отличительной особенностью этих моделей является поддержка команд «FreeStyle». Вместо сложной настройки параметров пользователи могут точно контролировать стили вокального выражения или создавать сложные аудиосцены с нуля, используя простые описания на естественном языке.

Каждая модель служит определенным целям:
Fun-CosyVoice3.5: многоязычное воспроизведение и тонкое управление
Эта усовершенствованная версия CosyVoice достигает прорыва в понимании нюансов речевой экспрессии.
Генерация на основе команд: пользователи могут вводить инструкции, такие как «говорить более уверенно» или «замедлить речь с эмоциональными колебаниями», для корректировки голоса в режиме реального времени.
Расширение языкового диапазона: добавлена поддержка тайского, индонезийского, португальского и вьетнамского языков, что позволяет сохранить лидирующие в отрасли показатели точности транскрипции (WER) и схожести голоса на 13 языках.
Оптимизация редких символов: специальное обучение снизило уровень ошибок для редких символов с 15,2% до 5,3%.
Повышение производительности: задержка первого пакета уменьшилась на 35%, что значительно улучшило плавность взаимодействия в реальном времени.
Fun-AudioGen-VD: комплексное звуковое проектирование
Эта модель действует как «аудиорежиссер», генерируя интегрированный звук, сочетающий «персонажей + окружение».
Настройка голоса: Укажите пол, возраст, акцент и подробные характеристики, такие как «хриплый, глубокий или низкий» голос.
Эмоции и ролевые игры: имитирует роли, включая агентов службы поддержки клиентов, дикторов и детей, даже передавая сложные состояния, такие как «внешнее спокойствие с внутренним напряжением».
Иммерсивные среды: добавляет фоновые звуки (хаос на поле боя, шум в кафе) и пространственные эффекты (реверберация собора, подводная акустика) для полной пространственной симуляции.
Tongyi Lab отмечает, что эти модели демократизируют создание высококачественного голоса, предлагая мощную поддержку ИИ для подкастинга, разработки игр и постпродакшна фильмов.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











