Maison
Tencent reorganise son équipe de grands modèles alors que Yao Shunyu prend la direction des modèles de base

L’équipe multimodale de Hunyuan chez Tencent a récemment achevé une restructuration majeure et un pivot stratégique. Lu Xudong, qui dirigeait auparavant les efforts de compréhension multimodale chez xAI, a rejoint Hunyuan pour diriger les algorithmes de génération de contenu multimodal. Ce changement coïncide avec des modifications clés du personnel, notamment le départ de l’ancien responsable de la compréhension multimodale, Hu Han, pour entreprendre une activité entrepreneuriale, et l’arrivée de Tian Yonglong, ancien chercheur chez OpenAI. Ces mouvements signalent un réalignement important de l’approche de Tencent en matière de développement de grands modèles multimodaux.
L’évolution multimodale de Tencent Hunyuan s’est concentrée sur plusieurs produits clés. À la fin de l’année 2024, l’équipe a lancé HunyuanVideo, le plus grand modèle open source de génération de vidéos à partir de texte, suivi en 2025 par des extensions vers la génération d’images en vidéos, la génération personnalisée et l’animation d’humains numériques. Les capacités de génération d’images sont passées de HunyuanImage à la version 2.1, qui prend en charge la résolution native 2K, et à la version 3.0, dotée de 80 milliards de paramètres, marquant un tournant vers des performances de niveau industriel. Parallèlement, Hy3D, un modèle 3D unifié, est largement utilisé dans le commerce électronique et la conception de produits. En matière d’intelligence spatiale, Tencent a présenté Hy World 1.0, le premier modèle open source de génération 3D immersive prêt pour la simulation, avec des versions ultérieures poursuivant l’avancement de la recherche sur l’intelligence spatiale.
Alors que Tencent a consolidé ses divisions de grands modèles de langage et de modèles multimodaux au sein du « Département des modèles de base » sous la direction de Yao Shunyu, sa stratégie de R&D a subi un changement fondamental. La feuille de route technique actuelle reflète le débat de l’industrie sur le rôle des systèmes multimodaux dans la trajectoire principale de l’IA. Fei-Fei Li, de World Labs, soutient que les modèles du monde, en tant que composants de l’intelligence spatiale, sont centraux pour atteindre l’AGI. En revanche, DeepSeek préconise l’utilisation des modalités visuelles comme outils pour soutenir les modèles de langage, en minimisant le développement autonome de modèles 3D ou de modèles du monde.
Les récentes initiatives stratégiques de Yao Shunyu, notamment le produit phare Hy3, suggèrent une préférence pour cette dernière approche. Il a constamment déclaré que le prochain avantage concurrentiel de l’IA réside dans la gestion du contexte et le raisonnement, et non simplement dans le nombre de paramètres. En intégrant la compréhension multimodale dans l’architecture centrale du modèle et en améliorant la stabilité de l’appel d’outils et le support des longs contextes, Tencent vise à augmenter l’efficacité des modèles dans les environnements de bureau réels et les applications d’agents GUI. L’ajout de Lu Xudong renforce la compréhension multimodale, en répondant à des problèmes courants tels que l’incohérence de la génération et l’instabilité spatiale. Cette restructuration met en évidence l’évolution stratégique interne de Tencent et son engagement à se concentrer sur la productivité et les capacités fondamentales lors de la prochaine phase de développement de l’AGI.
Article connexe
La stratégie de Trump en matière d’IA : quelle suite pour la politique américaine ?
Le 3 août, cinq sénateurs démocrates ont exhorté l’administration Trump à clarifier sa politique de surveillance des modèles d’IA de pointe, soulignant leurs inquiétudes quant à la menace concurrentie
Lancement de la Plateforme Ouverte Tongyi Qianwen, apportant la conversation en tant que service au quotidien
La plateforme ouverte Tongyi Qianwen a officiellement lancé, offrant aux développeurs l’accès à des services sur les appareils mobiles, les ordinateurs de bureau et les lunettes intelligentes. Les utilisateurs n’ont plus besoin de basculer entre les
Paquets Swiftlet 80B Qwen dans Mac avec 4,3 Go de mémoire ; iPhone 17 exécutera nativement 35B
Un runtime Swift + Metal nommé Swiftlet redéfinit la notion de « là où les grands modèles peuvent s'exécuter ». Il est spécifiquement conçu pour la famille de modèles MoE (Mixture of Experts) Qwen3-Next et Qwen3.5/3.6. L'idée centrale est assez ingén
Recommandations de sujets spéciaux liés
commentaires (0)

L’équipe multimodale de Hunyuan chez Tencent a récemment achevé une restructuration majeure et un pivot stratégique. Lu Xudong, qui dirigeait auparavant les efforts de compréhension multimodale chez xAI, a rejoint Hunyuan pour diriger les algorithmes de génération de contenu multimodal. Ce changement coïncide avec des modifications clés du personnel, notamment le départ de l’ancien responsable de la compréhension multimodale, Hu Han, pour entreprendre une activité entrepreneuriale, et l’arrivée de Tian Yonglong, ancien chercheur chez OpenAI. Ces mouvements signalent un réalignement important de l’approche de Tencent en matière de développement de grands modèles multimodaux.
L’évolution multimodale de Tencent Hunyuan s’est concentrée sur plusieurs produits clés. À la fin de l’année 2024, l’équipe a lancé HunyuanVideo, le plus grand modèle open source de génération de vidéos à partir de texte, suivi en 2025 par des extensions vers la génération d’images en vidéos, la génération personnalisée et l’animation d’humains numériques. Les capacités de génération d’images sont passées de HunyuanImage à la version 2.1, qui prend en charge la résolution native 2K, et à la version 3.0, dotée de 80 milliards de paramètres, marquant un tournant vers des performances de niveau industriel. Parallèlement, Hy3D, un modèle 3D unifié, est largement utilisé dans le commerce électronique et la conception de produits. En matière d’intelligence spatiale, Tencent a présenté Hy World 1.0, le premier modèle open source de génération 3D immersive prêt pour la simulation, avec des versions ultérieures poursuivant l’avancement de la recherche sur l’intelligence spatiale.
Alors que Tencent a consolidé ses divisions de grands modèles de langage et de modèles multimodaux au sein du « Département des modèles de base » sous la direction de Yao Shunyu, sa stratégie de R&D a subi un changement fondamental. La feuille de route technique actuelle reflète le débat de l’industrie sur le rôle des systèmes multimodaux dans la trajectoire principale de l’IA. Fei-Fei Li, de World Labs, soutient que les modèles du monde, en tant que composants de l’intelligence spatiale, sont centraux pour atteindre l’AGI. En revanche, DeepSeek préconise l’utilisation des modalités visuelles comme outils pour soutenir les modèles de langage, en minimisant le développement autonome de modèles 3D ou de modèles du monde.
Les récentes initiatives stratégiques de Yao Shunyu, notamment le produit phare Hy3, suggèrent une préférence pour cette dernière approche. Il a constamment déclaré que le prochain avantage concurrentiel de l’IA réside dans la gestion du contexte et le raisonnement, et non simplement dans le nombre de paramètres. En intégrant la compréhension multimodale dans l’architecture centrale du modèle et en améliorant la stabilité de l’appel d’outils et le support des longs contextes, Tencent vise à augmenter l’efficacité des modèles dans les environnements de bureau réels et les applications d’agents GUI. L’ajout de Lu Xudong renforce la compréhension multimodale, en répondant à des problèmes courants tels que l’incohérence de la génération et l’instabilité spatiale. Cette restructuration met en évidence l’évolution stratégique interne de Tencent et son engagement à se concentrer sur la productivité et les capacités fondamentales lors de la prochaine phase de développement de l’AGI.
La stratégie de Trump en matière d’IA : quelle suite pour la politique américaine ?
Le 3 août, cinq sénateurs démocrates ont exhorté l’administration Trump à clarifier sa politique de surveillance des modèles d’IA de pointe, soulignant leurs inquiétudes quant à la menace concurrentie
Lancement de la Plateforme Ouverte Tongyi Qianwen, apportant la conversation en tant que service au quotidien
La plateforme ouverte Tongyi Qianwen a officiellement lancé, offrant aux développeurs l’accès à des services sur les appareils mobiles, les ordinateurs de bureau et les lunettes intelligentes. Les utilisateurs n’ont plus besoin de basculer entre les
Paquets Swiftlet 80B Qwen dans Mac avec 4,3 Go de mémoire ; iPhone 17 exécutera nativement 35B
Un runtime Swift + Metal nommé Swiftlet redéfinit la notion de « là où les grands modèles peuvent s'exécuter ». Il est spécifiquement conçu pour la famille de modèles MoE (Mixture of Experts) Qwen3-Next et Qwen3.5/3.6. L'idée centrale est assez ingén











