Heim
ByteDance und HKUST stellen MMProLong vor, um das Training von Langdokumenten-LMMs zu verbessern

Am 24. Mai hat das ByteDance Seed-Team in Zusammenarbeit mit der Hong Kong University of Science and Technology einen Durchbruch im Training langer Dokumente für multimodale große Sprachmodelle (LMMs) vorgestellt. Unter Nutzung von Alibaba’s quelloffenem Qwen2.5-VL entwickelte das Team ein neues Modell namens MMProLong, das erhebliche Verbesserungen in der Verarbeitungseffizienz erzielte. Diese Forschung stellt herkömmliche Trainingsmethoden für lange Texte bei multimodalen Modellen in Frage und unterstreicht, wie wichtig eine strategische Datenorganisation für die Verbesserung der Langkontext-Fähigkeiten ist.
Die Studie adressiert zentrale Herausforderungen beim LMM-Training und zeigt, dass Frage-Antwort (QA)-Training, das auf spezifische Aufgaben zugeschnitten ist, weitaus effektiver ist als traditionelle Optical Character Recognition (OCR)-Transkription. Während sich alleinige Texttranskription nicht zur Verbesserung der Inhaltsabfrage in langen Kontexten bewährt – und die Leistung sogar verschlechtern kann – ermöglicht das Training mit Langkontext-QA-Paaren, die von einem unabhängigen Modell wie ByteDance Seed2.0 generiert wurden, dem Modell, Zielabschnitte auch bei umfangreichen, ablenkenden Informationen präzise zu lokalisieren.
Mit einer optimierten Strategie und einem bescheidenen Trainingsbudget von nur 128.000 Token behält MMProLong eine robuste Langtextstabilität bei und funktioniert effektiv, selbst wenn die Eingabelängen 256.000 oder 512.000 Token erreichen. Es übertrifft größere quelloffene Modelle wie InternVL3-38B und Gemma3-27B in den MMLongBench- und MM-NIAH-Tests (Needle-in-a-Haystack). Darüber hinaus erstrecken sich die multimodalen Fähigkeiten von MMProLong auch auf Langvideo-Verständnisaufgaben ohne spezifisches Training, eine Strategie, die ebenfalls am Qwen3-VL-8B-Modell validiert wurde.
Diese Studie bietet einen alternativen Entwicklungspfad für die große Modellindustrie und steht im Gegensatz zu Ansätzen wie denen von DeepSeek, die sich auf die Verbesserung der Architektur durch hochkomprimierte und neu angeordnete visuelle Daten konzentrieren. Sie zeigt, dass Langkontext-Fähigkeiten erheblich verbessert werden können, indem die Struktur der Trainingsdaten optimiert wird, anstatt die zugrunde liegende Architektur zu ändern, und ebnet den Weg für kostengünstigere und effizientere technische Lösungen für zukünftige multimodale Systeme und Multi-Step-Agenten.
Verwandter Artikel
Ein weiterer Kunde des angeschlagenen Startups Delve ist von einem schweren Sicherheitsvorfall betroffen
Das Compliance-Startup Delve sieht sich weiterhin einer Reihe eskalierender Kontroversen ausgesetzt.TechCrunch hat bestätigt, dass Delve die Sicherheitszertifizierungen für Context AI durchgeführt hat, ein Unternehmen, das sich auf das Training von K
Google stellt Gemini 3.8 Flash TTS vor und ermöglicht so die natürliche Sprachanpassung sowie eine 30-Sekunden-Replikation
Die Sprachsynthese erreicht neue Höhen der Präzision. Am 23. September stellte Google zwei fortschrittliche Text-zu-Sprache-Modelle vor – Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS –, die darauf ausgelegt sind, den vielfältigen Anforderungen
MiniMax Code 2.0 Desktop veröffentlicht: Lange Aufgaben frieren nicht mehr ein, Fernsteuerung und Browser-Übernahme kommen diesen Monat
Entwickler, die sich mit langkettigen Codierungsaufgaben befassen, kennen die Frustration nur zu gut, dass Agenten plötzlich den Kontext verlieren oder ohne Reaktion einfrieren, was zu verschwendeter Mühe und der Notwendigkeit manueller Bereinigung f
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Am 24. Mai hat das ByteDance Seed-Team in Zusammenarbeit mit der Hong Kong University of Science and Technology einen Durchbruch im Training langer Dokumente für multimodale große Sprachmodelle (LMMs) vorgestellt. Unter Nutzung von Alibaba’s quelloffenem Qwen2.5-VL entwickelte das Team ein neues Modell namens MMProLong, das erhebliche Verbesserungen in der Verarbeitungseffizienz erzielte. Diese Forschung stellt herkömmliche Trainingsmethoden für lange Texte bei multimodalen Modellen in Frage und unterstreicht, wie wichtig eine strategische Datenorganisation für die Verbesserung der Langkontext-Fähigkeiten ist.
Die Studie adressiert zentrale Herausforderungen beim LMM-Training und zeigt, dass Frage-Antwort (QA)-Training, das auf spezifische Aufgaben zugeschnitten ist, weitaus effektiver ist als traditionelle Optical Character Recognition (OCR)-Transkription. Während sich alleinige Texttranskription nicht zur Verbesserung der Inhaltsabfrage in langen Kontexten bewährt – und die Leistung sogar verschlechtern kann – ermöglicht das Training mit Langkontext-QA-Paaren, die von einem unabhängigen Modell wie
Mit einer optimierten Strategie und einem bescheidenen Trainingsbudget von nur 128.000 Token behält MMProLong eine robuste Langtextstabilität bei und funktioniert effektiv, selbst wenn die Eingabelängen 256.000 oder 512.000 Token erreichen. Es übertrifft größere quelloffene Modelle wie InternVL3-38B und
Diese Studie bietet einen alternativen Entwicklungspfad für die große Modellindustrie und steht im Gegensatz zu Ansätzen wie denen von DeepSeek, die sich auf die Verbesserung der Architektur durch hochkomprimierte und neu angeordnete visuelle Daten konzentrieren. Sie zeigt, dass Langkontext-Fähigkeiten erheblich verbessert werden können, indem die Struktur der Trainingsdaten optimiert wird, anstatt die zugrunde liegende Architektur zu ändern, und ebnet den Weg für kostengünstigere und effizientere technische Lösungen für zukünftige multimodale Systeme und Multi-Step-Agenten.
Ein weiterer Kunde des angeschlagenen Startups Delve ist von einem schweren Sicherheitsvorfall betroffen
Das Compliance-Startup Delve sieht sich weiterhin einer Reihe eskalierender Kontroversen ausgesetzt.TechCrunch hat bestätigt, dass Delve die Sicherheitszertifizierungen für Context AI durchgeführt hat, ein Unternehmen, das sich auf das Training von K
Google stellt Gemini 3.8 Flash TTS vor und ermöglicht so die natürliche Sprachanpassung sowie eine 30-Sekunden-Replikation
Die Sprachsynthese erreicht neue Höhen der Präzision. Am 23. September stellte Google zwei fortschrittliche Text-zu-Sprache-Modelle vor – Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS –, die darauf ausgelegt sind, den vielfältigen Anforderungen
MiniMax Code 2.0 Desktop veröffentlicht: Lange Aufgaben frieren nicht mehr ein, Fernsteuerung und Browser-Übernahme kommen diesen Monat
Entwickler, die sich mit langkettigen Codierungsaufgaben befassen, kennen die Frustration nur zu gut, dass Agenten plötzlich den Kontext verlieren oder ohne Reaktion einfrieren, was zu verschwendeter Mühe und der Notwendigkeit manueller Bereinigung f











