вариант
Дом
Срочные новости
Содержание
FrankRoberts
FrankRoberts
17 июля 2026 г.

Tongyi Lab выпустила Wan-Streamer v0.2 — сквозную мультимодальную модель искусственного интеллекта, обеспечивающую задержку отклика в 550 мс для личного взаимодействия в режиме реального времени. Она объединяет функции слушания, зрения, речи и выполнения действий в одном трансформере, при этом разрешение видео повышено до 640x368. Потоковая архитектура обеспечивает время обработки 160 мс и поддерживает цифровых людей в полном росте для таких приложений, как репетиторство и консультирование.

Tongyi Lab выпустила Wan-Streamer v0.2 — сквозную мультимодальную модель искусственного интеллекта, обеспечивающую задержку отклика в 550 мс для личного взаимодействия в режиме реального времени. Она объединяет функции слушания, зрения, речи и выполнения действий в одном трансформере, при этом разрешение видео повышено до 640x368. Потоковая архитектура обеспечивает время обработки 160 мс и поддерживает цифровых людей в полном росте для таких приложений, как репетиторство и консультирование.
Автор CarlPerez CarlPerez 23 сентября 2026 г.
Alibaba Qwen представила Qwen-Audio-3.1, включившую пять моделей, охватывающих распознавание речи, синтез речи, взаимодействие в реальном времени и генерацию контента. Обновление позволяет снизить цены на 70–95 %, делая голосовые технологии широко доступными. Ключевые функции включают контекстно-зависимое распознавание речи (ASR) с встроенной корректировкой транскрипции, поддержку 30 языков и 16 китайских диалектов, а также сверхнизкую задержку. Модель TTS-Next позволяет генерировать аудио общего назначения, комбинируя голоса, звуковые эффекты и фоновые шумы. Взаимодействие в реальном времени поддерживает полнодуплексный диалог с распознаванием эмоций и интеграцией инструментов. Этот комплексный набор решений значительно снижает затраты, одновременно повышая точность, расширяя многоязычную поддержку и расширяя возможности для творческого создания аудиоконтента.
/ru/live/7579
OR