Maison
Qwen3.8-LiveTranslate lance un modèle de traduction en temps réel avec un délai de 2,3s
Qwen3.8-LiveTranslate, le dernier modèle de traduction vocale en temps réel d’Alibaba Qwen, redéfinit l’interprétation simultanée grâce à son architecture Unifiée Interleave. Cette innovation améliore la précision, la fluidité et la concision, réduisant la latence moyenne par caractère (LAAL) de 2,8 à 2,3 secondes – une amélioration critique de 0,5 seconde qui garantit une expérience d’écoute naturelle dans un domaine où même un léger délai peut perturber le flux.
Élargissant le support pour 60 langues, le modèle mis à jour introduit trois améliorations pratiques pour l’interprétation en temps réel. Premièrement, il prend en charge la séparation des locuteurs en temps réel, attribuant avec précision chaque phrase au bon locuteur tout en maintenant une clonage vocal stable, empêchant ainsi les chevauchements ou les confusions entre les locuteurs. Deuxièmement, il affiche le texte source et le texte traduit côte à côte, permettant aux auditeurs de suivre visuellement pendant qu’ils entendent la traduction. Troisièmement, il améliore la désambiguïsation à long contexte, permettant au modèle d’exploiter le contexte antérieur pour une précision accrue – particulièrement pour les noms et la terminologie spécialisée, qui sont des points d’erreur courants.

Au cœur de Qwen3.8-LiveTranslate se trouve une conception à double module Thinker–Talker basée sur l’architecture MoE hybride. Le mécanisme Interleave intègre de manière transparente la compréhension en flux continu, la génération de texte et la synthèse vocale dans un seul pipeline. Le Thinker traite la vidéo, l’audio, le texte source et les sorties de traduction en une séquence causale unifiée, les ordonnant chronologiquement pour produire des résultats de bout en bout qui gèrent simultanément la « compréhension » et la « traduction ». Le Talker convertit ensuite le texte traduit, guidé par l’audio original, en parole qui préserve l’identité vocale du locuteur source.

Article connexe
Pike, psychologue de Harvard : concentrez-vous sur l’ingénierie de la sécurité de l’IA, pas sur les rumeurs d’apocalypse
Le psychologue de Harvard Steven Pinker soutient que les craintes concernant l’extinction humaine par l’intelligence artificielle sont considérablement exagérées, une position qu’il a détaillée dans une lettre ouverte adressée à Quillette et destinée
Le fondateur de Rivian, Mind Robotics, lève 500 millions de dollars pour faire progresser l’IA industrielle
Tandis que le monde de la technologie s’obsède des robots humanoïdes, une startup trace une voie différente — ignorant le battage médiatique tout en obtenant le soutien massif d’un fonds de capital-risque d’élite. Le 12 mars, Mind Robotics, une entre
Comment corriger les Core Web Vitals pour de meilleurs classements SEO ?
Construire un bot d'e-mail personnalisé pour automatiser vos messagesIntroductionConfiguration de l'environnement PythonDéveloppement d'un bot d'envoi d'e-mailsActivation de l'accès pour les applications externesImplémentation de la synthèse voc
Recommandations de sujets spéciaux liés
commentaires (0)
Qwen3.8-LiveTranslate, le dernier modèle de traduction vocale en temps réel d’Alibaba Qwen, redéfinit l’interprétation simultanée grâce à son architecture Unifiée Interleave. Cette innovation améliore la précision, la fluidité et la concision, réduisant la latence moyenne par caractère (LAAL) de 2,8 à 2,3 secondes – une amélioration critique de 0,5 seconde qui garantit une expérience d’écoute naturelle dans un domaine où même un léger délai peut perturber le flux.
Élargissant le support pour 60 langues, le modèle mis à jour introduit trois améliorations pratiques pour l’interprétation en temps réel. Premièrement, il prend en charge la séparation des locuteurs en temps réel, attribuant avec précision chaque phrase au bon locuteur tout en maintenant une clonage vocal stable, empêchant ainsi les chevauchements ou les confusions entre les locuteurs. Deuxièmement, il affiche le texte source et le texte traduit côte à côte, permettant aux auditeurs de suivre visuellement pendant qu’ils entendent la traduction. Troisièmement, il améliore la désambiguïsation à long contexte, permettant au modèle d’exploiter le contexte antérieur pour une précision accrue – particulièrement pour les noms et la terminologie spécialisée, qui sont des points d’erreur courants.

Au cœur de Qwen3.8-LiveTranslate se trouve une conception à double module Thinker–Talker basée sur l’architecture MoE hybride. Le mécanisme Interleave intègre de manière transparente la compréhension en flux continu, la génération de texte et la synthèse vocale dans un seul pipeline. Le Thinker traite la vidéo, l’audio, le texte source et les sorties de traduction en une séquence causale unifiée, les ordonnant chronologiquement pour produire des résultats de bout en bout qui gèrent simultanément la « compréhension » et la « traduction ». Le Talker convertit ensuite le texte traduit, guidé par l’audio original, en parole qui préserve l’identité vocale du locuteur source.

Pike, psychologue de Harvard : concentrez-vous sur l’ingénierie de la sécurité de l’IA, pas sur les rumeurs d’apocalypse
Le psychologue de Harvard Steven Pinker soutient que les craintes concernant l’extinction humaine par l’intelligence artificielle sont considérablement exagérées, une position qu’il a détaillée dans une lettre ouverte adressée à Quillette et destinée
Le fondateur de Rivian, Mind Robotics, lève 500 millions de dollars pour faire progresser l’IA industrielle
Tandis que le monde de la technologie s’obsède des robots humanoïdes, une startup trace une voie différente — ignorant le battage médiatique tout en obtenant le soutien massif d’un fonds de capital-risque d’élite. Le 12 mars, Mind Robotics, une entre
Comment corriger les Core Web Vitals pour de meilleurs classements SEO ?
Construire un bot d'e-mail personnalisé pour automatiser vos messagesIntroductionConfiguration de l'environnement PythonDéveloppement d'un bot d'envoi d'e-mailsActivation de l'accès pour les applications externesImplémentation de la synthèse voc











