Qwen представляет модель распознавания речи в реальном времени Fun-ASR-Realtime

В области голосового взаимодействия происходит новый технологический прорыв. Недавно крупная модель Qwen объявила об обновлении своих основных аудиовозможностей, представив новую модель распознавания речи в реальном времени под названием Fun-ASR-Realtime.
Модель демонстрирует значительный прорыв в производительности: задержка распознавания первого символа точно контролируется в пределах сотен миллисекунд, что обеспечивает пользователям плавный опыт «скажи — и сразу получи ответ». Её точность превосходна и приближается к уровню ведущих в отрасли автономных моделей, эффективно сочетая производительность в режиме реального времени с высоким качеством.
Для удовлетворения разнообразных потребностей приложений Fun-ASR-Realtime обеспечивает широкий языковой охват. Модель поддерживает распознавание и обработку до 30 языков, при этом особое внимание уделено пониманию китайских диалектов — в настоящее время она способна обрабатывать сложные голосовые вводы на 16 диалектах.
Данное обновление не только обеспечивает более мощную базовую поддержку сценариев взаимодействия в реальном времени, таких как голосовые помощники и ведение протоколов встреч, но и расширяет границы применения общих крупных моделей в многоязычных и многодиалектных средах. С официальным запуском модели разработчики и корпоративные пользователи смогут с большей лёгкостью создавать интеллектуальные голосовые приложения с высокой чувствительностью и точностью, делая взаимодействие с ИИ более естественным и похожим на человеческое.
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)

В области голосового взаимодействия происходит новый технологический прорыв. Недавно крупная модель Qwen объявила об обновлении своих основных аудиовозможностей, представив новую модель распознавания речи в реальном времени под названием Fun-ASR-Realtime.
Модель демонстрирует значительный прорыв в производительности: задержка распознавания первого символа точно контролируется в пределах сотен миллисекунд, что обеспечивает пользователям плавный опыт «скажи — и сразу получи ответ». Её точность превосходна и приближается к уровню ведущих в отрасли автономных моделей, эффективно сочетая производительность в режиме реального времени с высоким качеством.
Для удовлетворения разнообразных потребностей приложений Fun-ASR-Realtime обеспечивает широкий языковой охват. Модель поддерживает распознавание и обработку до 30 языков, при этом особое внимание уделено пониманию китайских диалектов — в настоящее время она способна обрабатывать сложные голосовые вводы на 16 диалектах.
Данное обновление не только обеспечивает более мощную базовую поддержку сценариев взаимодействия в реальном времени, таких как голосовые помощники и ведение протоколов встреч, но и расширяет границы применения общих крупных моделей в многоязычных и многодиалектных средах. С официальным запуском модели разработчики и корпоративные пользователи смогут с большей лёгкостью создавать интеллектуальные голосовые приложения с высокой чувствительностью и точностью, делая взаимодействие с ИИ более естественным и похожим на человеческое.
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства





Дом






