字节跳动与香港科技大学发布 MMProLong,以增强长文档 LMM 训练

5月24日,字节跳动种子团队与香港科技大学合作,发布了一项关于多模态大语言模型(LMMs)长文档训练的突破性成果。该团队基于阿里巴巴开源的 Qwen2.5-VL,开发了一款名为 MMProLong 的新模型,在处理效率方面取得了显著提升。这项研究挑战了多模态模型传统的长文本训练方法,强调了战略性数据组织对于增强长上下文能力的关键作用。
针对 LMM 训练中的关键挑战,研究发现,针对特定任务定制的问答(QA)训练远比传统的光学字符识别(OCR)转录更为有效。虽然仅依赖文本转录无法改善长上下文中的内容检索,甚至可能降低性能,但使用由独立模型如 字节跳动种子2.0 生成的长上下文 QA 对进行训练,使模型能够在冗长且充满干扰信息的文本中准确定位目标段落。
凭借优化的策略以及仅 128,000 个 token 的适度训练预算,MMProLong 保持了强大的长文本稳定性,即使在输入长度达到 256,000 或 512,000 个 token 时也能有效运行。它在 MMLongBench 和 MM-NIAH(大海捞针)基准测试中超越了 InternVL3-38B 和 Gemma3-27B 等更大的开源模型。此外,MMProLong 的多模态能力还延伸至无需特定训练的长视频理解任务,这一策略也在 Qwen3-VL-8B 模型上得到了验证。
这项研究为大模型行业提供了一种替代发展路径,与 DeepSeek 等专注于通过高度压缩和重新排序视觉数据来升级架构的方法形成对比。它表明,通过优化训练数据结构而非改变底层架构,可以显著增强长上下文能力,为未来多模态系统和多步代理提供了更具成本效益和高效性的技术解决方案。
相关文章
微软推出新编码模型,重启内部AI战略,因Claude成本飙升
AI辅助编码已成为现代软件开发中的常态,然而,即使是微软这样的科技巨头,也感受到了昂贵的第三方大型语言模型订阅带来的压力。为了减少对外部依赖和运营开销,微软正准备推出自己的AI模型套件,直接瞄准AI编码领域。飙升的成本推动微软转向内部解决方案微软最近要求内部团队从商业Claude模型迁移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本过高。此前,与OpenAI的独家协议限制了微软在某些高级领域开发竞争技术的能力。然而,最近对这一合作伙伴关系的调整恢复了微软的研究
另一位客户是陷入困境的初创公司Delve,该公司遭受了重大安全漏洞攻击
合规初创公司 Delve 继续面临一系列不断升级的争议。TechCrunch 已核实,Delve 为 Context AI 进行了安全认证。Context AI 是一家 AI 智能体培训公司,该公司最近报告了一起安全事件,导致知名应用和网站托管平台 Vercel 发生数据泄露。与此同时,自身也遭遇安全事件的 Lovable 已不再使用 Delve 的服务。回顾一下:上个月,Delve 在一名匿名举报人声称该初创公司伪造客户数据并利用“橡皮图章”审计机构进行合规认证后,遭受了严厉审查。Del
谷歌发布 Gemini 3.8 Flash TTS,实现自然语言语音定制与30秒克隆
语音合成正达到前所未有的精准高度。9月23日,谷歌推出了两款先进的文本转语音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,旨在满足开发者和创作者在个性化配音及大规模音频制作方面的多样化需求。每款模型各有侧重。Gemini 3.8 Flash TTS 专注于声音与角色设计,允许用户使用自然语言提示生成定制语音。它支持在句子级别精确控制语调、语速和口音,并能通过仅30秒的音频样本高效实现声音克隆。与此同时,Gemini 3.8 Flash
相关专题推荐
评论 (0)
0/500

5月24日,字节跳动种子团队与香港科技大学合作,发布了一项关于多模态大语言模型(LMMs)长文档训练的突破性成果。该团队基于阿里巴巴开源的 Qwen2.5-VL,开发了一款名为 MMProLong 的新模型,在处理效率方面取得了显著提升。这项研究挑战了多模态模型传统的长文本训练方法,强调了战略性数据组织对于增强长上下文能力的关键作用。
针对 LMM 训练中的关键挑战,研究发现,针对特定任务定制的问答(QA)训练远比传统的光学字符识别(OCR)转录更为有效。虽然仅依赖文本转录无法改善长上下文中的内容检索,甚至可能降低性能,但使用由独立模型如
凭借优化的策略以及仅 128,000 个 token 的适度训练预算,MMProLong 保持了强大的长文本稳定性,即使在输入长度达到 256,000 或 512,000 个 token 时也能有效运行。它在 MMLongBench 和 MM-NIAH(大海捞针)基准测试中超越了 InternVL3-38B 和
这项研究为大模型行业提供了一种替代发展路径,与 DeepSeek 等专注于通过高度压缩和重新排序视觉数据来升级架构的方法形成对比。它表明,通过优化训练数据结构而非改变底层架构,可以显著增强长上下文能力,为未来多模态系统和多步代理提供了更具成本效益和高效性的技术解决方案。
微软推出新编码模型,重启内部AI战略,因Claude成本飙升
AI辅助编码已成为现代软件开发中的常态,然而,即使是微软这样的科技巨头,也感受到了昂贵的第三方大型语言模型订阅带来的压力。为了减少对外部依赖和运营开销,微软正准备推出自己的AI模型套件,直接瞄准AI编码领域。飙升的成本推动微软转向内部解决方案微软最近要求内部团队从商业Claude模型迁移到其自己的GitHub Copilot,主要原因是租用和使用Claude的成本过高。此前,与OpenAI的独家协议限制了微软在某些高级领域开发竞争技术的能力。然而,最近对这一合作伙伴关系的调整恢复了微软的研究
另一位客户是陷入困境的初创公司Delve,该公司遭受了重大安全漏洞攻击
合规初创公司 Delve 继续面临一系列不断升级的争议。TechCrunch 已核实,Delve 为 Context AI 进行了安全认证。Context AI 是一家 AI 智能体培训公司,该公司最近报告了一起安全事件,导致知名应用和网站托管平台 Vercel 发生数据泄露。与此同时,自身也遭遇安全事件的 Lovable 已不再使用 Delve 的服务。回顾一下:上个月,Delve 在一名匿名举报人声称该初创公司伪造客户数据并利用“橡皮图章”审计机构进行合规认证后,遭受了严厉审查。Del
谷歌发布 Gemini 3.8 Flash TTS,实现自然语言语音定制与30秒克隆
语音合成正达到前所未有的精准高度。9月23日,谷歌推出了两款先进的文本转语音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,旨在满足开发者和创作者在个性化配音及大规模音频制作方面的多样化需求。每款模型各有侧重。Gemini 3.8 Flash TTS 专注于声音与角色设计,允许用户使用自然语言提示生成定制语音。它支持在句子级别精确控制语调、语速和口音,并能通过仅30秒的音频样本高效实现声音克隆。与此同时,Gemini 3.8 Flash





首页






