Дом
Qwen3.8-LiveTranslate запускает модель перевода в реальном времени с задержкой 2,3 секунды
Qwen3.8-LiveTranslate, последняя модель Alibaba Qwen для перевода речи в реальном времени, переосмысляет синхронный перевод благодаря своей единой архитектуре Interleave. Это нововведение повышает точность, плавность и лаконичность, сокращая среднюю задержку на символ (LAAL) с 2,8 до 2,3 секунды — критическое улучшение на 0,5 секунды, которое обеспечивает естественное восприятие на слух в области, где даже небольшая задержка может нарушить поток речи.
Расширяя поддержку 60 языков, обновленная модель внедряет три практических улучшения для перевода в реальном времени. Во-первых, она поддерживает разделение говорящих в реальном времени, точно распределяя каждое предложение по соответствующему говорящему, сохраняя при этом стабильность клонирования голоса, тем самым предотвращая перекрестные помехи или путаницу между говорящими. Во-вторых, она отображает исходный и переведенный текст рядом, позволяя слушателям визуально следить за переводом одновременно с его восприятием на слух. В-третьих, улучшается разрешение неоднозначности в длинном контексте, позволяя модели использовать предыдущий контекст для повышения точности — особенно в отношении имен и специализированной терминологии, которые являются типичными источниками ошибок.

В основе Qwen3.8-LiveTranslate лежит двухмодульная конструкция «Мыслитель–Говорящий», построенная на базе гибридной архитектуры MoE. Механизм Interleave бесшовно интегрирует потоковое понимание, генерацию текста и синтез речи в единый конвейер. «Мыслитель» обрабатывает видео, аудио, исходный текст и результаты перевода в единую причинно-следственную последовательность, упорядочивая их хронологически для получения сквозных результатов, которые одновременно обрабатывают «понимание» и «перевод». Затем «Говорящий» преобразует переведенный текст, ориентируясь на исходное аудио, в речь, сохраняющую голосовую идентичность оригинального говорящего.

Связанная статья
OpenAI представляет фильтр конфиденциальности для контекста 128K с восемью режимами распознавания
OpenAI представила Privacy Filter, передовую модель анонимизации персональных данных (PII). Теперь доступная по лицензии Apache 2.0 на платформах Hugging Face и GitHub, этот инструмент предоставляет разработчикам локальное, высоконастраиваемое решени
NewCore привлекает $66 млн для оснащения ИИ-агентов идентичностями по мере их перехода в роли сотрудников
Стартап в области кибербезопасности NewCore официально вышел из тени, привлекши в понедельник 66 миллионов долларов инвестиций. Компания нацелена на решение критической проблемы, с которой столкнутся многие организации в ближайшем будущем при интегра
Microsoft и Mistral заключили многомиллиардное партнерство в сфере искусственного интеллекта в Европе
В основе этого сотрудничества лежит многомиллиардное соглашение, призванное укрепить инфраструктуру искусственного интеллекта по всей Европе. Источник: MicrosoftMicrosoft и Mistral, ведущая французска
Рекомендации по связанным специальным темам
Комментарии (0)
Qwen3.8-LiveTranslate, последняя модель Alibaba Qwen для перевода речи в реальном времени, переосмысляет синхронный перевод благодаря своей единой архитектуре Interleave. Это нововведение повышает точность, плавность и лаконичность, сокращая среднюю задержку на символ (LAAL) с 2,8 до 2,3 секунды — критическое улучшение на 0,5 секунды, которое обеспечивает естественное восприятие на слух в области, где даже небольшая задержка может нарушить поток речи.
Расширяя поддержку 60 языков, обновленная модель внедряет три практических улучшения для перевода в реальном времени. Во-первых, она поддерживает разделение говорящих в реальном времени, точно распределяя каждое предложение по соответствующему говорящему, сохраняя при этом стабильность клонирования голоса, тем самым предотвращая перекрестные помехи или путаницу между говорящими. Во-вторых, она отображает исходный и переведенный текст рядом, позволяя слушателям визуально следить за переводом одновременно с его восприятием на слух. В-третьих, улучшается разрешение неоднозначности в длинном контексте, позволяя модели использовать предыдущий контекст для повышения точности — особенно в отношении имен и специализированной терминологии, которые являются типичными источниками ошибок.

В основе Qwen3.8-LiveTranslate лежит двухмодульная конструкция «Мыслитель–Говорящий», построенная на базе гибридной архитектуры MoE. Механизм Interleave бесшовно интегрирует потоковое понимание, генерацию текста и синтез речи в единый конвейер. «Мыслитель» обрабатывает видео, аудио, исходный текст и результаты перевода в единую причинно-следственную последовательность, упорядочивая их хронологически для получения сквозных результатов, которые одновременно обрабатывают «понимание» и «перевод». Затем «Говорящий» преобразует переведенный текст, ориентируясь на исходное аудио, в речь, сохраняющую голосовую идентичность оригинального говорящего.

OpenAI представляет фильтр конфиденциальности для контекста 128K с восемью режимами распознавания
OpenAI представила Privacy Filter, передовую модель анонимизации персональных данных (PII). Теперь доступная по лицензии Apache 2.0 на платформах Hugging Face и GitHub, этот инструмент предоставляет разработчикам локальное, высоконастраиваемое решени
NewCore привлекает $66 млн для оснащения ИИ-агентов идентичностями по мере их перехода в роли сотрудников
Стартап в области кибербезопасности NewCore официально вышел из тени, привлекши в понедельник 66 миллионов долларов инвестиций. Компания нацелена на решение критической проблемы, с которой столкнутся многие организации в ближайшем будущем при интегра
Microsoft и Mistral заключили многомиллиардное партнерство в сфере искусственного интеллекта в Европе
В основе этого сотрудничества лежит многомиллиардное соглашение, призванное укрепить инфраструктуру искусственного интеллекта по всей Европе. Источник: MicrosoftMicrosoft и Mistral, ведущая французска











