A Qwen apresenta o modelo de reconhecimento de fala em tempo real Fun-ASR-Realtime

A interação por voz está passando por um novo avanço tecnológico. Recentemente, o modelo de grande escala Qwen anunciou uma atualização em seus recursos centrais de áudio, apresentando um novo modelo de reconhecimento de fala em tempo real chamado Fun-ASR-Realtime.
O modelo alcança avanços significativos de desempenho, com o atraso no reconhecimento do primeiro caractere controlado com precisão na faixa de cem milissegundos, proporcionando aos usuários uma experiência fluida de “falar e receber feedback imediato”. Sua precisão é excelente, aproximando-se do nível dos modelos offline líderes do setor, combinando efetivamente desempenho em tempo real com alta qualidade.
Para atender às diversas necessidades de aplicação, o Fun-ASR-Realtime oferece ampla cobertura de idiomas. Ele suporta o reconhecimento e o processamento de até 30 idiomas, com aprimoramentos especiais para a compreensão de dialetos chineses — atualmente capaz de lidar com entradas de voz complexas em 16 dialetos.
Essa atualização não apenas oferece um suporte subjacente mais robusto para cenários de interação em tempo real, como assistentes de voz e anotações de reuniões, mas também amplia os limites de aplicação de modelos gerais de grande porte em ambientes multilíngues e com vários dialetos. Com o lançamento oficial do modelo, desenvolvedores e usuários corporativos podem criar com mais facilidade aplicativos de voz inteligentes com alta sensibilidade e precisão, tornando as interações de IA mais naturais e semelhantes às humanas.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)

A interação por voz está passando por um novo avanço tecnológico. Recentemente, o modelo de grande escala Qwen anunciou uma atualização em seus recursos centrais de áudio, apresentando um novo modelo de reconhecimento de fala em tempo real chamado Fun-ASR-Realtime.
O modelo alcança avanços significativos de desempenho, com o atraso no reconhecimento do primeiro caractere controlado com precisão na faixa de cem milissegundos, proporcionando aos usuários uma experiência fluida de “falar e receber feedback imediato”. Sua precisão é excelente, aproximando-se do nível dos modelos offline líderes do setor, combinando efetivamente desempenho em tempo real com alta qualidade.
Para atender às diversas necessidades de aplicação, o Fun-ASR-Realtime oferece ampla cobertura de idiomas. Ele suporta o reconhecimento e o processamento de até 30 idiomas, com aprimoramentos especiais para a compreensão de dialetos chineses — atualmente capaz de lidar com entradas de voz complexas em 16 dialetos.
Essa atualização não apenas oferece um suporte subjacente mais robusto para cenários de interação em tempo real, como assistentes de voz e anotações de reuniões, mas também amplia os limites de aplicação de modelos gerais de grande porte em ambientes multilíngues e com vários dialetos. Com o lançamento oficial do modelo, desenvolvedores e usuários corporativos podem criar com mais facilidade aplicativos de voz inteligentes com alta sensibilidade e precisão, tornando as interações de IA mais naturais e semelhantes às humanas.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri





Lar






