Maison
Qwen dévoile son modèle de reconnaissance vocale en temps réel « Fun-ASR-Realtime »

L'interaction vocale connaît actuellement une nouvelle avancée technologique majeure. Récemment, le grand modèle Qwen a annoncé une mise à niveau de ses capacités audio fondamentales, en introduisant un nouveau modèle de reconnaissance vocale en temps réel baptisé Fun-ASR-Realtime.
Ce modèle réalise des progrès significatifs en termes de performances, avec un délai de reconnaissance du premier caractère contrôlé avec précision à moins de cent millisecondes, offrant ainsi aux utilisateurs une expérience fluide où « parler et recevoir une réponse immédiate » va de pair. Sa précision est excellente, se rapprochant du niveau des modèles hors ligne leaders du secteur, alliant ainsi efficacement performances en temps réel et haute qualité.
Afin de répondre aux divers besoins des applications, Fun-ASR-Realtime offre une couverture linguistique étendue. Il prend en charge la reconnaissance et le traitement de jusqu’à 30 langues, avec des améliorations spécifiques pour la compréhension des dialectes chinois — il est actuellement capable de traiter des entrées vocales complexes dans 16 dialectes.
Cette mise à jour offre non seulement un soutien technique renforcé pour les scénarios d’interaction en temps réel tels que les assistants vocaux et la prise de notes lors de réunions, mais elle élargit également les limites d’application des grands modèles généraux dans des environnements multilingues et multi-dialectaux. Avec le lancement officiel du modèle, les développeurs et les utilisateurs professionnels peuvent plus facilement créer des applications vocales intelligentes dotées d’une sensibilité et d’une précision élevées, rendant ainsi les interactions avec l’IA plus naturelles et plus proches de celles entre humains.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)

L'interaction vocale connaît actuellement une nouvelle avancée technologique majeure. Récemment, le grand modèle Qwen a annoncé une mise à niveau de ses capacités audio fondamentales, en introduisant un nouveau modèle de reconnaissance vocale en temps réel baptisé Fun-ASR-Realtime.
Ce modèle réalise des progrès significatifs en termes de performances, avec un délai de reconnaissance du premier caractère contrôlé avec précision à moins de cent millisecondes, offrant ainsi aux utilisateurs une expérience fluide où « parler et recevoir une réponse immédiate » va de pair. Sa précision est excellente, se rapprochant du niveau des modèles hors ligne leaders du secteur, alliant ainsi efficacement performances en temps réel et haute qualité.
Afin de répondre aux divers besoins des applications, Fun-ASR-Realtime offre une couverture linguistique étendue. Il prend en charge la reconnaissance et le traitement de jusqu’à 30 langues, avec des améliorations spécifiques pour la compréhension des dialectes chinois — il est actuellement capable de traiter des entrées vocales complexes dans 16 dialectes.
Cette mise à jour offre non seulement un soutien technique renforcé pour les scénarios d’interaction en temps réel tels que les assistants vocaux et la prise de notes lors de réunions, mais elle élargit également les limites d’application des grands modèles généraux dans des environnements multilingues et multi-dialectaux. Avec le lancement officiel du modèle, les développeurs et les utilisateurs professionnels peuvent plus facilement créer des applications vocales intelligentes dotées d’une sensibilité et d’une précision élevées, rendant ainsi les interactions avec l’IA plus naturelles et plus proches de celles entre humains.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











