Maison
ByteDance et HKUST dévoilent MMProLong pour améliorer l'entraînement des LMM sur les longs documents

Le 24 mai, l’équipe ByteDance Seed a collaboré avec l’Université des sciences et technologies de Hong Kong pour dévoiler une avancée majeure dans l’entraînement de documents longs pour les grands modèles de langage multimodaux (LMM). En s’appuyant sur le modèle open-source Qwen2.5-VL d’Alibaba, l’équipe a développé un nouveau modèle nommé MMProLong, atteignant des gains significatifs en efficacité de traitement. Cette recherche remet en question les méthodes conventionnelles d’entraînement de textes longs pour les modèles multimodaux, soulignant comment une organisation stratégique des données est cruciale pour améliorer les capacités de contexte long.
En abordant les défis clés de l’entraînement des LMM, l’étude révèle que l’entraînement par questions-réponses (QA) adapté à des tâches spécifiques est bien plus efficace que la transcription par reconnaissance optique de caractères (OCR) traditionnelle. Bien que s’appuyer uniquement sur la transcription de texte ne permette pas d’améliorer la récupération de contenu dans des contextes longs – et puisse même dégrader les performances – l’entraînement avec des paires de questions-réponses de contexte long générées par un modèle indépendant tel que ByteDance Seed2.0 permet au modèle de localiser avec précision les paragraphes cibles au milieu d’informations longues et distractives.
Avec une stratégie optimisée et un budget d’entraînement modeste de seulement 128 000 tokens, MMProLong maintient une stabilité robuste des textes longs, performant efficacement même lorsque les longueurs d’entrée atteignent 256 000 ou 512 000 tokens. Il surpasse des modèles open-source plus grands tels que InternVL3-38B et Gemma3-27B sur les benchmarks MMLongBench et MM-NIAH (Needle-in-a-Haystack). De plus, les capacités multimodales de MMProLong s’étendent aux tâches de compréhension de vidéos longues sans entraînement spécifique, une stratégie également validée sur le modèle Qwen3-VL-8B .
Cette étude offre une voie de développement alternative pour l’industrie des grands modèles, contrastant avec des approches telles que celles de DeepSeek, qui se concentrent sur la mise à niveau des architectures par des données visuelles hautement compressées et réorganisées. Elle démontre que les capacités de contexte long peuvent être significativement améliorées par l’optimisation de la structure des données d’entraînement plutôt que par la modification de l’architecture sous-jacente, ouvrant la voie à des solutions techniques plus économiques et efficaces pour les futurs systèmes multimodaux et les agents multi-étapes.
Article connexe
Microsoft relance sa stratégie en matière d’intelligence artificielle avec un nouveau modèle de codage alors que les coûts de Claude augmentent
La programmation assistée par l’IA est devenue un élément incontournable du développement logiciel moderne, mais même les géants de la technologie comme Microsoft ressentent le poids des abonnements coûteux aux grands modèles de langage tiers. Pour r
Un autre client de la startup en difficulté Delve, touchée par une importante violation de sécurité
Le startup de conformité Delle continue de faire face à une série de controverses croissantes.TechCrunch a vérifié que Delle a réalisé les certifications de sécurité pour Context AI, une entreprise de formation d’agents IA qui a récemment signalé un
Google dévoile Gemini 3.8 Flash TTS, permettant une personnalisation naturelle de la voix et une réplication en 30 secondes
La synthèse vocale atteint de nouveaux sommets de précision. Le 23 septembre, Google a dévoilé deux modèles avancés de synthèse vocale à partir de texte — Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS — conçus pour répondre aux exigences variées
Recommandations de sujets spéciaux liés
commentaires (0)

Le 24 mai, l’équipe ByteDance Seed a collaboré avec l’Université des sciences et technologies de Hong Kong pour dévoiler une avancée majeure dans l’entraînement de documents longs pour les grands modèles de langage multimodaux (LMM). En s’appuyant sur le modèle open-source Qwen2.5-VL d’Alibaba, l’équipe a développé un nouveau modèle nommé MMProLong, atteignant des gains significatifs en efficacité de traitement. Cette recherche remet en question les méthodes conventionnelles d’entraînement de textes longs pour les modèles multimodaux, soulignant comment une organisation stratégique des données est cruciale pour améliorer les capacités de contexte long.
En abordant les défis clés de l’entraînement des LMM, l’étude révèle que l’entraînement par questions-réponses (QA) adapté à des tâches spécifiques est bien plus efficace que la transcription par reconnaissance optique de caractères (OCR) traditionnelle. Bien que s’appuyer uniquement sur la transcription de texte ne permette pas d’améliorer la récupération de contenu dans des contextes longs – et puisse même dégrader les performances – l’entraînement avec des paires de questions-réponses de contexte long générées par un modèle indépendant tel que
Avec une stratégie optimisée et un budget d’entraînement modeste de seulement 128 000 tokens, MMProLong maintient une stabilité robuste des textes longs, performant efficacement même lorsque les longueurs d’entrée atteignent 256 000 ou 512 000 tokens. Il surpasse des modèles open-source plus grands tels que InternVL3-38B et
Cette étude offre une voie de développement alternative pour l’industrie des grands modèles, contrastant avec des approches telles que celles de DeepSeek, qui se concentrent sur la mise à niveau des architectures par des données visuelles hautement compressées et réorganisées. Elle démontre que les capacités de contexte long peuvent être significativement améliorées par l’optimisation de la structure des données d’entraînement plutôt que par la modification de l’architecture sous-jacente, ouvrant la voie à des solutions techniques plus économiques et efficaces pour les futurs systèmes multimodaux et les agents multi-étapes.
Microsoft relance sa stratégie en matière d’intelligence artificielle avec un nouveau modèle de codage alors que les coûts de Claude augmentent
La programmation assistée par l’IA est devenue un élément incontournable du développement logiciel moderne, mais même les géants de la technologie comme Microsoft ressentent le poids des abonnements coûteux aux grands modèles de langage tiers. Pour r
Un autre client de la startup en difficulté Delve, touchée par une importante violation de sécurité
Le startup de conformité Delle continue de faire face à une série de controverses croissantes.TechCrunch a vérifié que Delle a réalisé les certifications de sécurité pour Context AI, une entreprise de formation d’agents IA qui a récemment signalé un
Google dévoile Gemini 3.8 Flash TTS, permettant une personnalisation naturelle de la voix et une réplication en 30 secondes
La synthèse vocale atteint de nouveaux sommets de précision. Le 23 septembre, Google a dévoilé deux modèles avancés de synthèse vocale à partir de texte — Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS — conçus pour répondre aux exigences variées











