位元組跳動與香港科技大學釋出 MMProLong,以增強長文件 LMM 訓練

5月24日,位元組跳動種子團隊與香港科技大學合作,釋出了一項關於多模態大語言模型(LMMs)長文件訓練的突破性成果。該團隊基於阿里巴巴開源的 Qwen2.5-VL,開發了一款名為 MMProLong 的新模型,在處理效率方面取得了顯著提升。這項研究挑戰了多模態模型傳統的長文字訓練方法,強調了戰略性資料組織對於增強長上下文能力的關鍵作用。
針對 LMM 訓練中的關鍵挑戰,研究發現,針對特定任務定製的問答(QA)訓練遠比傳統的光學字元識別(OCR)轉錄更為有效。雖然僅依賴文字轉錄無法改善長上下文中的內容檢索,甚至可能降低效能,但使用由獨立模型如 位元組跳動種子2.0 生成的長上下文 QA 對進行訓練,使模型能夠在冗長且充滿干擾資訊的文字中準確定位目標段落。
憑藉最佳化的策略以及僅 128,000 個 token 的適度訓練預算,MMProLong 保持了強大的長文字穩定性,即使在輸入長度達到 256,000 或 512,000 個 token 時也能有效執行。它在 MMLongBench 和 MM-NIAH(大海撈針)基準測試中超越了 InternVL3-38B 和 Gemma3-27B 等更大的開源模型。此外,MMProLong 的多模態能力還延伸至無需特定訓練的長影片理解任務,這一策略也在 Qwen3-VL-8B 模型上得到了驗證。
這項研究為大模型行業提供了一種替代發展路徑,與 DeepSeek 等專注於透過高度壓縮和重新排序視覺資料來升級架構的方法形成對比。它表明,透過最佳化訓練資料結構而非改變底層架構,可以顯著增強長上下文能力,為未來多模態系統和多步代理提供了更具成本效益和高效性的技術解決方案。
相關文章
另一位客戶是陷入困境的初創公司Delve,該公司遭受了重大安全漏洞攻擊
合規初創公司 Delve 繼續面臨一系列不斷升級的爭議。TechCrunch 已核實,Delve 為 Context AI 進行了安全認證。Context AI 是一家 AI 智慧體培訓公司,該公司最近報告了一起安全事件,導致知名應用和網站託管平臺 Vercel 發生資料洩露。與此同時,自身也遭遇安全事件的 Lovable 已不再使用 Delve 的服務。回顧一下:上個月,Delve 在一名匿名舉報人聲稱該初創公司偽造客戶資料並利用“橡皮圖章”審計機構進行合規認證後,遭受了嚴厲審查。Del
谷歌釋出 Gemini 3.8 Flash TTS,實現自然語言語音定製與30秒克隆
語音合成正達到前所未有的精準高度。9月23日,谷歌推出了兩款先進的文字轉語音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,旨在滿足開發者和創作者在個性化配音及大規模音訊製作方面的多樣化需求。每款模型各有側重。Gemini 3.8 Flash TTS 專注於聲音與角色設計,允許使用者使用自然語言提示生成定製語音。它支援在句子級別精確控制語調、語速和口音,並能透過僅30秒的音訊樣本高效實現聲音克隆。與此同時,Gemini 3.8 Flash
MiniMax Code 2.0 桌面版上線:長任務不再卡死,遠端控制及瀏覽器接管功能本月即將推出
面對長鏈編碼任務時,開發者們再熟悉不過那種因智慧體突然丟失上下文或無響應而陷入停滯的挫敗感,這不僅導致前期努力付諸東流,還不得不進行手動清理。7月16日,MiniMax 針對這些痛點,正式釋出了 MiniMax Code 2.0 桌面版的下載。此次更新旨在解決長任務執行中的三大關鍵挑戰:等待、中斷以及上下文連續性。透過最佳化底層系統,MiniMax 確保智慧體在長時間操作中保持穩定的上下文連貫性,從而大幅減少因任務中途斷開而導致的返工。其目標不僅僅是生成更多程式碼,而是確保整個自動化工作流從開始到
相關專題推薦
評論 (0)
0/500

5月24日,位元組跳動種子團隊與香港科技大學合作,釋出了一項關於多模態大語言模型(LMMs)長文件訓練的突破性成果。該團隊基於阿里巴巴開源的 Qwen2.5-VL,開發了一款名為 MMProLong 的新模型,在處理效率方面取得了顯著提升。這項研究挑戰了多模態模型傳統的長文字訓練方法,強調了戰略性資料組織對於增強長上下文能力的關鍵作用。
針對 LMM 訓練中的關鍵挑戰,研究發現,針對特定任務定製的問答(QA)訓練遠比傳統的光學字元識別(OCR)轉錄更為有效。雖然僅依賴文字轉錄無法改善長上下文中的內容檢索,甚至可能降低效能,但使用由獨立模型如
憑藉最佳化的策略以及僅 128,000 個 token 的適度訓練預算,MMProLong 保持了強大的長文字穩定性,即使在輸入長度達到 256,000 或 512,000 個 token 時也能有效執行。它在 MMLongBench 和 MM-NIAH(大海撈針)基準測試中超越了 InternVL3-38B 和
這項研究為大模型行業提供了一種替代發展路徑,與 DeepSeek 等專注於透過高度壓縮和重新排序視覺資料來升級架構的方法形成對比。它表明,透過最佳化訓練資料結構而非改變底層架構,可以顯著增強長上下文能力,為未來多模態系統和多步代理提供了更具成本效益和高效性的技術解決方案。
另一位客戶是陷入困境的初創公司Delve,該公司遭受了重大安全漏洞攻擊
合規初創公司 Delve 繼續面臨一系列不斷升級的爭議。TechCrunch 已核實,Delve 為 Context AI 進行了安全認證。Context AI 是一家 AI 智慧體培訓公司,該公司最近報告了一起安全事件,導致知名應用和網站託管平臺 Vercel 發生資料洩露。與此同時,自身也遭遇安全事件的 Lovable 已不再使用 Delve 的服務。回顧一下:上個月,Delve 在一名匿名舉報人聲稱該初創公司偽造客戶資料並利用“橡皮圖章”審計機構進行合規認證後,遭受了嚴厲審查。Del
谷歌釋出 Gemini 3.8 Flash TTS,實現自然語言語音定製與30秒克隆
語音合成正達到前所未有的精準高度。9月23日,谷歌推出了兩款先進的文字轉語音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,旨在滿足開發者和創作者在個性化配音及大規模音訊製作方面的多樣化需求。每款模型各有側重。Gemini 3.8 Flash TTS 專注於聲音與角色設計,允許使用者使用自然語言提示生成定製語音。它支援在句子級別精確控制語調、語速和口音,並能透過僅30秒的音訊樣本高效實現聲音克隆。與此同時,Gemini 3.8 Flash
MiniMax Code 2.0 桌面版上線:長任務不再卡死,遠端控制及瀏覽器接管功能本月即將推出
面對長鏈編碼任務時,開發者們再熟悉不過那種因智慧體突然丟失上下文或無響應而陷入停滯的挫敗感,這不僅導致前期努力付諸東流,還不得不進行手動清理。7月16日,MiniMax 針對這些痛點,正式釋出了 MiniMax Code 2.0 桌面版的下載。此次更新旨在解決長任務執行中的三大關鍵挑戰:等待、中斷以及上下文連續性。透過最佳化底層系統,MiniMax 確保智慧體在長時間操作中保持穩定的上下文連貫性,從而大幅減少因任務中途斷開而導致的返工。其目標不僅僅是生成更多程式碼,而是確保整個自動化工作流從開始到





首頁






