ByteDanceとHKUSTは、長文書LMMトレーニングを強化するMMProLongを発表しました

5月24日、ByteDance Seedチームは香港科技大学と提携し、マルチモーダル大規模言語モデル(LMM)における長文書トレーニングの画期的な進歩を発表した。アリババのオープンソースQwen2.5-VLを活用し、チームはMMProLongという新モデルを開発し、処理効率の大幅な向上を実現した。この研究は、マルチモーダルモデルの従来の長文トレーニング方法に挑戦し、戦略的なデータ整理が長文コンテキスト能力の向上においていかに重要かを示している。
LMMトレーニングにおける主要な課題に対処する際、本研究は、特定のタスクに最適化された質問応答(QA)トレーニングが、従来の光学文字認識(OCR)文字起こしよりもはるかに効果的であることを明らかにした。テキスト文字起こしのみを頼りにすると、長文コンテキストにおけるコンテンツ検索の改善にはつながらず、むしろパフォーマンスが低下する場合があるが、ByteDance Seed2.0 のような独立したモデルによって生成された長文コンテキストのQAペアでトレーニングを行うことで、モデルは長く紛らわしい情報の中から対象の段落を正確に見つけることができる。
最適化された戦略とわずか128,000トークンという控えめなトレーニング予算で、MMProLongは堅牢な長文安定性を維持し、入力長が256,000または512,000トークンに達しても効果的に機能する。これは、MMLongBenchおよびMM-NIAH(Haystackの中の針)ベンチマークにおいて、InternVL3-38BやGemma3-27B などのより大きなオープンソースモデルを上回る結果である。さらに、MMProLongのマルチモーダル能力は、特定のトレーニングなしに長動画理解タスクにも拡張され、この戦略はQwen3-VL-8B モデルでも検証されている。
本研究は、DeepSeekのような、高度に圧縮され再順序付けられた視覚データを通じてアーキテクチャのアップグレードに焦点を当てるアプローチとは対照的に、大規模モデル業界への代替的な開発パスを提供する。これは、基盤となるアーキテクチャを変更するのではなく、トレーニングデータの構造を最適化することで長文コンテキスト能力を大幅に強化できることを示しており、将来のマルチモーダルシステムやマルチステップエージェントのためのより費用対効果が高く効率的な技術ソリューションへの道を開くものである。
関連記事
もう一つの顧客である struggling startup Delve が、大規模なセキュリティ侵害を受けた
コンプライアンス分野のスタートアップであるDelveは、一連のエスカレートする論争に引き続き直面している。TechCrunchは、最近、著名なアプリおよびウェブサイトホスティングプラットフォームであるVercelにおいてデータ漏洩を引き起こすセキュリティインシデが発生したAIエージェント訓練企業Context AIのセキュリティ認証をDelveが実施したことを確認した。一方、独自のセキュリティインシデを経験したLovableは、もはやDelveのサービスを利用していない。要約すると:先月、
Google、Gemini 3.8 Flash TTSを発表、自然な音声のカスタマイズと30秒での複製を可能に
音声合成は精度の新たな高みに達しつつある。9月23日、Googleは、開発者やクリエイターがパーソナライズされた声優演技や大規模な音声制作に対して有する多様なニーズに応えるために設計された、2つの高度なテキスト読み上げモデル——Gemini 3.8 Flash TTS および Gemini 3.8 Flash-Lite TTS——を発表した。各モデルは明確な目的を担っている。Gemini 3.8 Flash TTS は声とキャラクターの設計に特化しており、自然言語のプロンプトを使用してカスタム
MiniMax Code 2.0 デスクトップ版リリース:長時間タスクのフリーズが解消、今月中にリモート操作とブラウザ乗っ取り機能を搭載
長期のコーディングタスクに取り組む開発者は、エージェントが突然コンテキストを失ったり応答なしでフリーズしたりする挫折に頻繁に直面しており、その結果、労力の無駄遣いや手動でのクリーンアップが必要になることがよくあります。7月16日、MiniMaxはこれらの課題に対応するため、MiniMax Code 2.0のデスクトップ版を正式に公開し、ダウンロードを開始しました。このアップデートは、長期タスク実行における3つの重要な課題——待機、中断、コンテキストの連続性——を対象としています。基盤システムの
関連特集おすすめ
コメント (0)
0/500

5月24日、ByteDance Seedチームは香港科技大学と提携し、マルチモーダル大規模言語モデル(LMM)における長文書トレーニングの画期的な進歩を発表した。アリババのオープンソースQwen2.5-VLを活用し、チームはMMProLongという新モデルを開発し、処理効率の大幅な向上を実現した。この研究は、マルチモーダルモデルの従来の長文トレーニング方法に挑戦し、戦略的なデータ整理が長文コンテキスト能力の向上においていかに重要かを示している。
LMMトレーニングにおける主要な課題に対処する際、本研究は、特定のタスクに最適化された質問応答(QA)トレーニングが、従来の光学文字認識(OCR)文字起こしよりもはるかに効果的であることを明らかにした。テキスト文字起こしのみを頼りにすると、長文コンテキストにおけるコンテンツ検索の改善にはつながらず、むしろパフォーマンスが低下する場合があるが、
最適化された戦略とわずか128,000トークンという控えめなトレーニング予算で、MMProLongは堅牢な長文安定性を維持し、入力長が256,000または512,000トークンに達しても効果的に機能する。これは、MMLongBenchおよびMM-NIAH(Haystackの中の針)ベンチマークにおいて、InternVL3-38Bや
本研究は、DeepSeekのような、高度に圧縮され再順序付けられた視覚データを通じてアーキテクチャのアップグレードに焦点を当てるアプローチとは対照的に、大規模モデル業界への代替的な開発パスを提供する。これは、基盤となるアーキテクチャを変更するのではなく、トレーニングデータの構造を最適化することで長文コンテキスト能力を大幅に強化できることを示しており、将来のマルチモーダルシステムやマルチステップエージェントのためのより費用対効果が高く効率的な技術ソリューションへの道を開くものである。
もう一つの顧客である struggling startup Delve が、大規模なセキュリティ侵害を受けた
コンプライアンス分野のスタートアップであるDelveは、一連のエスカレートする論争に引き続き直面している。TechCrunchは、最近、著名なアプリおよびウェブサイトホスティングプラットフォームであるVercelにおいてデータ漏洩を引き起こすセキュリティインシデが発生したAIエージェント訓練企業Context AIのセキュリティ認証をDelveが実施したことを確認した。一方、独自のセキュリティインシデを経験したLovableは、もはやDelveのサービスを利用していない。要約すると:先月、
Google、Gemini 3.8 Flash TTSを発表、自然な音声のカスタマイズと30秒での複製を可能に
音声合成は精度の新たな高みに達しつつある。9月23日、Googleは、開発者やクリエイターがパーソナライズされた声優演技や大規模な音声制作に対して有する多様なニーズに応えるために設計された、2つの高度なテキスト読み上げモデル——Gemini 3.8 Flash TTS および Gemini 3.8 Flash-Lite TTS——を発表した。各モデルは明確な目的を担っている。Gemini 3.8 Flash TTS は声とキャラクターの設計に特化しており、自然言語のプロンプトを使用してカスタム
MiniMax Code 2.0 デスクトップ版リリース:長時間タスクのフリーズが解消、今月中にリモート操作とブラウザ乗っ取り機能を搭載
長期のコーディングタスクに取り組む開発者は、エージェントが突然コンテキストを失ったり応答なしでフリーズしたりする挫折に頻繁に直面しており、その結果、労力の無駄遣いや手動でのクリーンアップが必要になることがよくあります。7月16日、MiniMaxはこれらの課題に対応するため、MiniMax Code 2.0のデスクトップ版を正式に公開し、ダウンロードを開始しました。このアップデートは、長期タスク実行における3つの重要な課題——待機、中断、コンテキストの連続性——を対象としています。基盤システムの





家






