Maison
Le grand modèle de traitement de la parole d'Alibaba se hisse en tête des classements mondiaux et remporte la « triple couronne » nationale en matière d'IA

Le 28 mai 2026, Artificial Analysis, une plateforme de référence dans l’évaluation de l’IA, a publié son dernier classement « Speech Arena ». Alibaba a réalisé une percée remarquable grâce à son grand modèle vocal « Fun-Realtime-TTS-Preview », se classant à la cinquième place mondiale et à la première place en Chine avec un score Elo de 1 190.
1. Leadership global : en tête dans trois catégories vocales clés
Lors de cette évaluation, le système de technologie vocale d’Alibaba a affiché de solides performances globales, se classant premier en Chine dans trois catégories clés de l’IA vocale :
ASR (reconnaissance vocale automatique) : elle a obtenu le meilleur classement national en termes de précision et de robustesse pour la conversion de la parole en texte, démontrant ainsi la capacité d’Alibaba à comprendre des environnements audio complexes.
Chat (compréhension de la parole et dialogue de bout en bout) : il a obtenu la première place au niveau national en matière de fluidité, de logique et de rapidité de réponse dans les conversations vocales en temps réel, reflétant ainsi les capacités de pointe d’Alibaba en matière d’interaction avec les assistants intelligents.
TTS (synthèse vocale) : dans ce domaine concurrentiel clé, Fun-Realtime-TTS-Preview a non seulement établi de nouveaux records nationaux en matière de naturel, d’expression émotionnelle et de vitesse de rendu, mais a également posé une référence mondiale.
2. Percée technologique : avancées en temps réel avec Fun-Realtime
Acteur phare de ce classement,Fun-Realtime-TTS-Previewmarque une avancée majeure de l’équipe vocale d’Alibaba en matière de synthèse vocale en temps réel.
Auparavant, la synthèse vocale peinait souvent à concilier un haut niveau de naturel et une réponse rapide. Le modèle d’Alibaba a toutefois réussi à produire une sortie vocale avec une intonation quasi humaine et une latence de l’ordre de la milliseconde grâce à une architecture profonde de bout en bout. Cette capacité en temps réel est essentielle pour les applications où le temps est un facteur critique, telles que les interactions dans les voitures connectées, le streaming en direct avec des avatars numériques, la traduction en temps réel et le service client.
3. Perspectives du secteur : les technologies vocales chinoises progressent vers la « Deep Intelligence »
En tant que pionnier dans le domaine de l’IA, Artificial Analysis utilise un système de notation très rigoureux qui évalue les performances des modèles sur des ensembles de test et, surtout, met l’accent sur l’expérience utilisateur dans des scénarios concrets. Les « trois titres de champion » d’Alibaba vont au-delà de simples scores et révèlent les enseignements clés suivants :
L’IA vocale entre dans « l’ère des grands modèles » : les technologies vocales antérieures reposaient en grande partie sur des méthodes statistiques traditionnelles ou des modèles de petite taille. Le succès d’Alibaba démontre que l’intégration du traitement de la parole dans une infrastructure de grands modèles d’apprentissage profond peut permettre un bond en avant significatif en matière de qualité de perception.
La « vitesse chinoise » dans la mise en œuvre des scénarios : Alibaba étant à la pointe tant en matière de compréhension que de génération vocales, les futurs écosystèmes de matériel intelligent et de grands modèles en Chine bénéficieront d’une compétitivité mondiale renforcée dans le domaine clé de l’« interaction vocale ».
Illustration des capacités en boucle fermée : de la reconnaissance (ASR) à la compréhension (Chat), puis à la synthèse (TTS), Alibaba a mis en place un pipeline complet d’interaction vocale, offrant une base solide pour le développement d’agents IA (Agents) fluides.
Grâce à un développement technique ascendant continu et à l’itération des modèles dans le domaine vocal, l’IA en Chine s’aventure de plus en plus en eaux profondes, passant de la simple « capacité à reconnaître » à la « compréhension des émotions humaines et de la logique d’interaction » à un niveau plus profond.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (0)

Le 28 mai 2026, Artificial Analysis, une plateforme de référence dans l’évaluation de l’IA, a publié son dernier classement « Speech Arena ». Alibaba a réalisé une percée remarquable grâce à son grand modèle vocal « Fun-Realtime-TTS-Preview », se classant à la cinquième place mondiale et à la première place en Chine avec un score Elo de 1 190.
1. Leadership global : en tête dans trois catégories vocales clés
Lors de cette évaluation, le système de technologie vocale d’Alibaba a affiché de solides performances globales, se classant premier en Chine dans trois catégories clés de l’IA vocale :
ASR (reconnaissance vocale automatique) : elle a obtenu le meilleur classement national en termes de précision et de robustesse pour la conversion de la parole en texte, démontrant ainsi la capacité d’Alibaba à comprendre des environnements audio complexes.
Chat (compréhension de la parole et dialogue de bout en bout) : il a obtenu la première place au niveau national en matière de fluidité, de logique et de rapidité de réponse dans les conversations vocales en temps réel, reflétant ainsi les capacités de pointe d’Alibaba en matière d’interaction avec les assistants intelligents.
TTS (synthèse vocale) : dans ce domaine concurrentiel clé, Fun-Realtime-TTS-Preview a non seulement établi de nouveaux records nationaux en matière de naturel, d’expression émotionnelle et de vitesse de rendu, mais a également posé une référence mondiale.
2. Percée technologique : avancées en temps réel avec Fun-Realtime
Acteur phare de ce classement,Fun-Realtime-TTS-Previewmarque une avancée majeure de l’équipe vocale d’Alibaba en matière de synthèse vocale en temps réel.
Auparavant, la synthèse vocale peinait souvent à concilier un haut niveau de naturel et une réponse rapide. Le modèle d’Alibaba a toutefois réussi à produire une sortie vocale avec une intonation quasi humaine et une latence de l’ordre de la milliseconde grâce à une architecture profonde de bout en bout. Cette capacité en temps réel est essentielle pour les applications où le temps est un facteur critique, telles que les interactions dans les voitures connectées, le streaming en direct avec des avatars numériques, la traduction en temps réel et le service client.
3. Perspectives du secteur : les technologies vocales chinoises progressent vers la « Deep Intelligence »
En tant que pionnier dans le domaine de l’IA, Artificial Analysis utilise un système de notation très rigoureux qui évalue les performances des modèles sur des ensembles de test et, surtout, met l’accent sur l’expérience utilisateur dans des scénarios concrets. Les « trois titres de champion » d’Alibaba vont au-delà de simples scores et révèlent les enseignements clés suivants :
L’IA vocale entre dans « l’ère des grands modèles » : les technologies vocales antérieures reposaient en grande partie sur des méthodes statistiques traditionnelles ou des modèles de petite taille. Le succès d’Alibaba démontre que l’intégration du traitement de la parole dans une infrastructure de grands modèles d’apprentissage profond peut permettre un bond en avant significatif en matière de qualité de perception.
La « vitesse chinoise » dans la mise en œuvre des scénarios : Alibaba étant à la pointe tant en matière de compréhension que de génération vocales, les futurs écosystèmes de matériel intelligent et de grands modèles en Chine bénéficieront d’une compétitivité mondiale renforcée dans le domaine clé de l’« interaction vocale ».
Illustration des capacités en boucle fermée : de la reconnaissance (ASR) à la compréhension (Chat), puis à la synthèse (TTS), Alibaba a mis en place un pipeline complet d’interaction vocale, offrant une base solide pour le développement d’agents IA (Agents) fluides.
Grâce à un développement technique ascendant continu et à l’itération des modèles dans le domaine vocal, l’IA en Chine s’aventure de plus en plus en eaux profondes, passant de la simple « capacité à reconnaître » à la « compréhension des émotions humaines et de la logique d’interaction » à un niveau plus profond.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés











