Maison
StepZen dévoile le modèle vocal StepAudio 3 Series, remportant plusieurs premières mondiales

Le 15 septembre, StepXingchen a officiellement lancé la nouvelle série de modèles de langage vocal StepAudio3. Ce lancement comprend cinq produits distincts : StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen et StepAudio3Music. Plusieurs de ces modèles ont obtenu la première place mondiale sur la liste d’évaluation authoritative d’Artificial Analysis. Ces cinq modèles sont désormais entièrement accessibles sur la plateforme ouverte StepXingchen, couvrant cinq scénarios d’application principaux : génération de voix réalistes, création complète de contenu audio, interaction vocale en temps réel, compréhension vocale dans des scénarios complexes et production musicale.
Pour l’interaction en temps réel, StepAudio3Realtime est conçu pour offrir des conversations natives en duplex intégral. Il a obtenu la première place mondiale avec un score global de 98,9 % dans le classement Conversational Dynamics d’Artificial Analysis, et a également pris la tête du classement Speech Reasoning d’Artificial Analysis avec une précision de 99,7 %. Le modèle capture avec précision le rythme conversationnel, gère les interruptions et les retours continus des utilisateurs, et prend en charge la compréhension de la sémantique, du ton, des émotions, des paralinguistiques et des sons ambiants. De plus, il permet un raisonnement parallèle et une génération vocale simultanés, ainsi que des appels d’outils asynchrones (Tool Call) et des tâches longues, garantissant ainsi des conversations vocales sans interruption.
En matière de reconnaissance vocale, StepAudio3ASR combine une transcription de haute précision avec les capacités de raisonnement par connaissances des grands modèles de langage, surpassant les méthodes traditionnelles de transcription audio uniquement. Il prend en charge divers scénarios incluant le chinois, l’anglais, les dialectes, les langues mixtes, les fichiers audio longs et les domaines spécialisés. Le modèle excelle dans les contextes médical, juridique, financier, automobile et de programmation, et gère efficacement des environnements d’entrée complexes tels que le faible volume, les débits de parole rapides, les prononciations floues, le chant et la musique d’ambiance. Son taux d’erreur de mots (WER) en reconnaissance vocale non en streaming est de seulement 1,7 %, partageant la première place mondiale.
En génération vocale, StepAudio3TTS est un modèle réaliste conçu pour l’interaction en temps réel. Il s’aligne parfaitement sur les schémas naturels de la parole humaine en ce qui concerne la base vocale, l’intonation, le rythme et les pauses. Le modèle reproduit les expressions paralinguistiques telles que le rire, les hésitations, les bégaiements, les répétitions et les corrections, et peut ajuster automatiquement les tons émotionnels en fonction du contenu sémantique. Grâce à une architecture de génération en streaming, le modèle synchronise la génération et la lecture.
Pour la génération complète de contenu audio, StepAudio3Gen simplifie le processus traditionnel de production longue, d’édition et de mixage. Les utilisateurs peuvent générer simultanément des voix, des effets sonores, des sons ambiants et de la musique d’arrière-plan à l’aide de descriptions en langage naturel et d’extraits audio de référence. Le modèle permet un contrôle fin des caractéristiques paralinguistiques telles que la voix des personnages, le style de parole, les émotions, les dialectes et le rire. Il permet également aux utilisateurs de spécifier le moment et la séquence des dialogues, des effets sonores et de la musique d’arrière-plan, influençant directement la conception sonore et le séquencement temporel de l’ensemble du contenu.
En création musicale, StepAudio3Music prend en charge à la fois la génération en zéro shot et la création interactive multi-tours basée sur la notation ABC. Les utilisateurs peuvent entrer des paroles, des chants a cappella, des chansons de référence ou des notations, et utiliser le langage naturel pour contrôler le genre, les voix, la mélodie, le rythme, les instruments et les émotions. Le modèle comprend en profondeur la structure des chansons, le développement mélodique inter-paragraphe et les variations d’énergie. Particulièrement dans les scénarios d’accompagnement a cappella, une seule piste a cappella peut générer automatiquement l’harmonie, le rythme, les instruments et des arrangements complets, facilitant ainsi une véritable production musicale.
Article connexe
Kimi K3 Set for Launch This Month With 2.5 Trillion Parameters
Le paysage des grands modèles s’est intensifié au cours du second semestre 2026. Aux côtés de DeepSeek V4, Kimi K3 de Moonshot AI est confirmé pour une sortie ce mois-ci.Bien que les dates spécifiques restent non divulguées, des sources internes ind
«Maman de Dunhuang» de Jia Zhangke Enregistré : Une mère célibataire tombe amoureuse de l'IA, voyage en Chine
En juillet 2026, l'Administration nationale du cinéma a approuvé le synopsis du prochain film de Jia Zhangke, « Dunhuang Mama ». Le synopsis décrit une histoire contemporaine d'une mère célibataire à Dunhuang qui se tourne progressivement vers l'inte
Deezer indique que plus de 50 % des fichiers mis en ligne chaque jour sont des morceaux générés par IA et prévoit de supprimer les contenus non écoutés au bout de six mois
Deezer, l'un des principaux services de streaming musical, a récemment révélé des statistiques alarmantes : les morceaux générés par l'IA représentent désormais plus de la moitié des mises en ligne qu
Recommandations de sujets spéciaux liés
commentaires (0)

Le 15 septembre, StepXingchen a officiellement lancé la nouvelle série de modèles de langage vocal StepAudio3. Ce lancement comprend cinq produits distincts : StepAudio3Realtime, StepAudio3ASR, StepAudio3TTS, StepAudio3Gen et StepAudio3Music. Plusieurs de ces modèles ont obtenu la première place mondiale sur la liste d’évaluation authoritative d’Artificial Analysis. Ces cinq modèles sont désormais entièrement accessibles sur la plateforme ouverte StepXingchen, couvrant cinq scénarios d’application principaux : génération de voix réalistes, création complète de contenu audio, interaction vocale en temps réel, compréhension vocale dans des scénarios complexes et production musicale.
Pour l’interaction en temps réel, StepAudio3Realtime est conçu pour offrir des conversations natives en duplex intégral. Il a obtenu la première place mondiale avec un score global de 98,9 % dans le classement Conversational Dynamics d’Artificial Analysis, et a également pris la tête du classement Speech Reasoning d’Artificial Analysis avec une précision de 99,7 %. Le modèle capture avec précision le rythme conversationnel, gère les interruptions et les retours continus des utilisateurs, et prend en charge la compréhension de la sémantique, du ton, des émotions, des paralinguistiques et des sons ambiants. De plus, il permet un raisonnement parallèle et une génération vocale simultanés, ainsi que des appels d’outils asynchrones (Tool Call) et des tâches longues, garantissant ainsi des conversations vocales sans interruption.
En matière de reconnaissance vocale, StepAudio3ASR combine une transcription de haute précision avec les capacités de raisonnement par connaissances des grands modèles de langage, surpassant les méthodes traditionnelles de transcription audio uniquement. Il prend en charge divers scénarios incluant le chinois, l’anglais, les dialectes, les langues mixtes, les fichiers audio longs et les domaines spécialisés. Le modèle excelle dans les contextes médical, juridique, financier, automobile et de programmation, et gère efficacement des environnements d’entrée complexes tels que le faible volume, les débits de parole rapides, les prononciations floues, le chant et la musique d’ambiance. Son taux d’erreur de mots (WER) en reconnaissance vocale non en streaming est de seulement 1,7 %, partageant la première place mondiale.
En génération vocale, StepAudio3TTS est un modèle réaliste conçu pour l’interaction en temps réel. Il s’aligne parfaitement sur les schémas naturels de la parole humaine en ce qui concerne la base vocale, l’intonation, le rythme et les pauses. Le modèle reproduit les expressions paralinguistiques telles que le rire, les hésitations, les bégaiements, les répétitions et les corrections, et peut ajuster automatiquement les tons émotionnels en fonction du contenu sémantique. Grâce à une architecture de génération en streaming, le modèle synchronise la génération et la lecture.
Pour la génération complète de contenu audio, StepAudio3Gen simplifie le processus traditionnel de production longue, d’édition et de mixage. Les utilisateurs peuvent générer simultanément des voix, des effets sonores, des sons ambiants et de la musique d’arrière-plan à l’aide de descriptions en langage naturel et d’extraits audio de référence. Le modèle permet un contrôle fin des caractéristiques paralinguistiques telles que la voix des personnages, le style de parole, les émotions, les dialectes et le rire. Il permet également aux utilisateurs de spécifier le moment et la séquence des dialogues, des effets sonores et de la musique d’arrière-plan, influençant directement la conception sonore et le séquencement temporel de l’ensemble du contenu.
En création musicale, StepAudio3Music prend en charge à la fois la génération en zéro shot et la création interactive multi-tours basée sur la notation ABC. Les utilisateurs peuvent entrer des paroles, des chants a cappella, des chansons de référence ou des notations, et utiliser le langage naturel pour contrôler le genre, les voix, la mélodie, le rythme, les instruments et les émotions. Le modèle comprend en profondeur la structure des chansons, le développement mélodique inter-paragraphe et les variations d’énergie. Particulièrement dans les scénarios d’accompagnement a cappella, une seule piste a cappella peut générer automatiquement l’harmonie, le rythme, les instruments et des arrangements complets, facilitant ainsi une véritable production musicale.
Kimi K3 Set for Launch This Month With 2.5 Trillion Parameters
Le paysage des grands modèles s’est intensifié au cours du second semestre 2026. Aux côtés de DeepSeek V4, Kimi K3 de Moonshot AI est confirmé pour une sortie ce mois-ci.Bien que les dates spécifiques restent non divulguées, des sources internes ind
«Maman de Dunhuang» de Jia Zhangke Enregistré : Une mère célibataire tombe amoureuse de l'IA, voyage en Chine
En juillet 2026, l'Administration nationale du cinéma a approuvé le synopsis du prochain film de Jia Zhangke, « Dunhuang Mama ». Le synopsis décrit une histoire contemporaine d'une mère célibataire à Dunhuang qui se tourne progressivement vers l'inte
Deezer indique que plus de 50 % des fichiers mis en ligne chaque jour sont des morceaux générés par IA et prévoit de supprimer les contenus non écoutés au bout de six mois
Deezer, l'un des principaux services de streaming musical, a récemment révélé des statistiques alarmantes : les morceaux générés par l'IA représentent désormais plus de la moitié des mises en ligne qu











