Maison
iFlytek Xinghuo dévoile un modèle de parole encodeur 0,65B avec 30B MoE, construit sur une puissance de calcul entièrement nationale
iFLYTEK a lancé Spark-Audio-1.0-Preview, un grand modèle de base pour l'audio construit entièrement sur une infrastructure informatique nationale.
Auparavant, le traitement audio avec des grands modèles reposait sur une méthode en cascade : convertir d'abord la parole en texte, puis le transmettre au modèle pour analyse. Cette approche présente deux défauts majeurs : une perte d'information, car le texte ne parvient pas à capturer le ton, l'émotion et les sons ambiants, ce qui conduit à un contexte incomplet ; et des workflows fragmentés, où des modules indépendants pour la transcription, l'identification de l'orateur et la traduction fonctionnent en série, entraînant une accumulation d'erreurs, une latence et une mauvaise expérience utilisateur.

Au-delà de la transcription : Compréhension directe de la parole
Ce modèle de base pour la parole va au-delà de la simple transcription pour interpréter directement l'audio. Il peut distinguer les voix humaines, le bruit ambiant et la musique, tout en saisissant la sémantique, les émotions et les indices contextuels présents dans le son.
La version initiale de Spark-Audio-1.0-Preview comprend un encodeur audio de 0,65 milliard de paramètres (structure Dense) et un grand modèle de langage de 30 milliards de paramètres avec 3 milliards de paramètres actifs (structure MoE). Entraîné sur 13 millions d'heures d'audio et d'importantes données textuelles à l'aide d'un cluster informatique entièrement national, le modèle accepte à la fois des entrées textuelles et audio. Il prend en charge des tâches telles que la transcription de la parole, la traduction multilingue, la reconnaissance de multiples dialectes, l'identification des sons ambiants, la reconnaissance de l'orateur, l'analyse des sentiments et les questions-réponses audio complexes, permettant aux machines de passer d'une « écoute claire » à une « compréhension ». Semblable au système « 1+N » des grands modèles Spark d'iFLYTEK, les utilisateurs peuvent affiner ce modèle de base pour la parole afin de créer des systèmes spécialisés pour la reconnaissance vocale, la traduction en temps réel et les applications interactives de parole.
Prend en charge 99 langues et 202 dialectes, excellant dans des scénarios complexes
Selon les données officielles, Spark-Audio-1.0-Preview obtient des performances comparables ou supérieures à celles des concurrents sur diverses tâches d'évaluation de la parole, en particulier dans des scénarios réels difficiles tels que les niveaux de bruit élevés et les voix basses. Ses performances sont également étroitement alignées avec celles de grands modèles de base pour la parole fermés et plus importants.
Le modèle prend en charge la reconnaissance de 99 langues et 202 dialectes. Il démontre des performances moyennes supérieures en reconnaissance de la parole multilingue et multi-dialectale par rapport à Qwen3.5-omni-flash (35B-A3B) de taille similaire, et égale les performances de Qwen3.5-omni-plus, nettement plus grand. Dans des évaluations telles que Fleurs, Kespeech et LibriSpeech pour la reconnaissance de la parole chinois-anglais, multilingue et multi-dialectale, il surpasse Gemini-3.1 Pro et atteint l'état de l'art (SOTA) sur l'ensemble de test chinois de Fleurs.
iFLYTEK reconnaît que, bien que cette version maintienne des performances solides dans les tâches de connaissances générales, de mathématiques et de codage, il existe des marges d'amélioration en matière de suivi des instructions, de dialogue et de compréhension audio. Les futures mises à jour se concentreront sur le renforcement de ces domaines. Spark-Audio-1.0-Preview est désormais disponible pour une expérience publique, avec un accès API qui sera bientôt publié sur la Plateforme Ouverte d'iFLYTEK.
Article connexe
Suno dévoile une mise à jour majeure avec une séparation avancée des pistes et un support pour les voitures
Suno a déployé des mises à jour majeures sur sa plateforme de génération musicale par intelligence artificielle, améliorant à la fois les expériences web et mobile afin de simplifier la création et d’optimiser l’utilisabilité. La plateforme progresse
Joëlle Pineau, de Cohere, s'exprime sur l'IA souveraine et la sécurité des entreprises
Une étude IDC commanditée par Cohere se penche sur l’IA souveraine, et Joëlle Pineau, directrice de l’IA, y présente les stratégies essentielles pour la sécurité du cloud d’entreprise et la gouvernanc
Les startups asiatiques en intelligence artificielle dévoilent des modèles de type Mythos alors que la prohibition d’exportation d’Anthropic se poursuit
Mercredi, le cabinet chinois de cybersécurité 360 aurait dévoilé Tulongfeng, un outil d’IA qu’il affirme capable de rivaliser directement avec Mythos d’Anthropic. Il s’agit du modèle d’IA axé sur la cybersécurité qui serait si puissant que l’administ
Recommandations de sujets spéciaux liés
commentaires (0)
iFLYTEK a lancé Spark-Audio-1.0-Preview, un grand modèle de base pour l'audio construit entièrement sur une infrastructure informatique nationale.
Auparavant, le traitement audio avec des grands modèles reposait sur une méthode en cascade : convertir d'abord la parole en texte, puis le transmettre au modèle pour analyse. Cette approche présente deux défauts majeurs : une perte d'information, car le texte ne parvient pas à capturer le ton, l'émotion et les sons ambiants, ce qui conduit à un contexte incomplet ; et des workflows fragmentés, où des modules indépendants pour la transcription, l'identification de l'orateur et la traduction fonctionnent en série, entraînant une accumulation d'erreurs, une latence et une mauvaise expérience utilisateur.

Au-delà de la transcription : Compréhension directe de la parole
Ce modèle de base pour la parole va au-delà de la simple transcription pour interpréter directement l'audio. Il peut distinguer les voix humaines, le bruit ambiant et la musique, tout en saisissant la sémantique, les émotions et les indices contextuels présents dans le son.
La version initiale de Spark-Audio-1.0-Preview comprend un encodeur audio de 0,65 milliard de paramètres (structure Dense) et un grand modèle de langage de 30 milliards de paramètres avec 3 milliards de paramètres actifs (structure MoE). Entraîné sur 13 millions d'heures d'audio et d'importantes données textuelles à l'aide d'un cluster informatique entièrement national, le modèle accepte à la fois des entrées textuelles et audio. Il prend en charge des tâches telles que la transcription de la parole, la traduction multilingue, la reconnaissance de multiples dialectes, l'identification des sons ambiants, la reconnaissance de l'orateur, l'analyse des sentiments et les questions-réponses audio complexes, permettant aux machines de passer d'une « écoute claire » à une « compréhension ». Semblable au système « 1+N » des grands modèles Spark d'iFLYTEK, les utilisateurs peuvent affiner ce modèle de base pour la parole afin de créer des systèmes spécialisés pour la reconnaissance vocale, la traduction en temps réel et les applications interactives de parole.
Prend en charge 99 langues et 202 dialectes, excellant dans des scénarios complexes
Selon les données officielles, Spark-Audio-1.0-Preview obtient des performances comparables ou supérieures à celles des concurrents sur diverses tâches d'évaluation de la parole, en particulier dans des scénarios réels difficiles tels que les niveaux de bruit élevés et les voix basses. Ses performances sont également étroitement alignées avec celles de grands modèles de base pour la parole fermés et plus importants.
Le modèle prend en charge la reconnaissance de 99 langues et 202 dialectes. Il démontre des performances moyennes supérieures en reconnaissance de la parole multilingue et multi-dialectale par rapport à Qwen3.5-omni-flash (35B-A3B) de taille similaire, et égale les performances de Qwen3.5-omni-plus, nettement plus grand. Dans des évaluations telles que Fleurs, Kespeech et LibriSpeech pour la reconnaissance de la parole chinois-anglais, multilingue et multi-dialectale, il surpasse Gemini-3.1 Pro et atteint l'état de l'art (SOTA) sur l'ensemble de test chinois de Fleurs.
iFLYTEK reconnaît que, bien que cette version maintienne des performances solides dans les tâches de connaissances générales, de mathématiques et de codage, il existe des marges d'amélioration en matière de suivi des instructions, de dialogue et de compréhension audio. Les futures mises à jour se concentreront sur le renforcement de ces domaines. Spark-Audio-1.0-Preview est désormais disponible pour une expérience publique, avec un accès API qui sera bientôt publié sur la Plateforme Ouverte d'iFLYTEK.
Suno dévoile une mise à jour majeure avec une séparation avancée des pistes et un support pour les voitures
Suno a déployé des mises à jour majeures sur sa plateforme de génération musicale par intelligence artificielle, améliorant à la fois les expériences web et mobile afin de simplifier la création et d’optimiser l’utilisabilité. La plateforme progresse
Joëlle Pineau, de Cohere, s'exprime sur l'IA souveraine et la sécurité des entreprises
Une étude IDC commanditée par Cohere se penche sur l’IA souveraine, et Joëlle Pineau, directrice de l’IA, y présente les stratégies essentielles pour la sécurité du cloud d’entreprise et la gouvernanc
Les startups asiatiques en intelligence artificielle dévoilent des modèles de type Mythos alors que la prohibition d’exportation d’Anthropic se poursuit
Mercredi, le cabinet chinois de cybersécurité 360 aurait dévoilé Tulongfeng, un outil d’IA qu’il affirme capable de rivaliser directement avec Mythos d’Anthropic. Il s’agit du modèle d’IA axé sur la cybersécurité qui serait si puissant que l’administ











