Lar
ByteDance e HKUST apresentam o MMProLong para aprimorar o treinamento de LMMs para documentos longos

Em 24 de maio, a equipe ByteDance Seed, em parceria com a Universidade de Ciência e Tecnologia de Hong Kong, apresentou um avanço no treinamento de documentos longos para modelos de linguagem grande multimodais (LMMs). Utilizando o Qwen2.5-VL de código aberto do Alibaba, a equipe desenvolveu um novo modelo chamado MMProLong, alcançando ganhos significativos em eficiência de processamento. Esta pesquisa desafia os métodos convencionais de treinamento de textos longos para modelos multimodais, destacando como a organização estratégica de dados é crucial para aprimorar as capacidades de contexto longo.
Ao abordar os principais desafios no treinamento de LMMs, o estudo revela que o treinamento por perguntas e respostas (QA) adaptado a tarefas específicas é muito mais eficaz do que a transcrição por reconhecimento óptico de caracteres (OCR) tradicional. Embora confiar apenas na transcrição de texto não melhore a recuperação de conteúdo em contextos longos — podendo até degradar o desempenho —, o treinamento com pares de QA de contexto longo gerados por um modelo independente, como ByteDance Seed2.0 , permite que o modelo localize com precisão os parágrafos alvo em meio a informações longas e distrativas.
Com uma estratégia otimizada e um orçamento de treinamento modesto de apenas 128.000 tokens, o MMProLong mantém uma estabilidade robusta em textos longos, performando eficazmente mesmo quando os comprimentos de entrada atingem 256.000 ou 512.000 tokens. Ele supera modelos de código aberto maiores, como InternVL3-38B e Gemma3-27B , nos benchmarks MMLongBench e MM-NIAH (Needle-in-a-Haystack). Além disso, as capacidades multimodais do MMProLong se estendem a tarefas de compreensão de vídeos longos sem treinamento específico, uma estratégia também validada no modelo Qwen3-VL-8B .
Este estudo oferece um caminho de desenvolvimento alternativo para a indústria de grandes modelos, contrastando com abordagens como as da DeepSeek, que focam na atualização de arquiteturas por meio de dados visuais altamente compactados e reordenados. Ele demonstra que as capacidades de contexto longo podem ser significativamente aprimoradas por meio da otimização da estrutura dos dados de treinamento em vez de alterar a arquitetura subjacente, abrindo caminho para soluções técnicas mais econômicas e eficientes para sistemas multimodais futuros e agentes de múltiplos passos.
Artigo relacionado
Microsoft revive estratégia de IA própria com novo modelo de codificação, à medida que os custos do Claude disparam
O código assistido por IA tornou-se um elemento fundamental no desenvolvimento de software moderno, mas mesmo gigantes da tecnologia como a Microsoft estão sentindo o impacto das caras assinaturas de modelos de linguagem grandes de terceiros. Para re
Outro cliente da startup em dificuldades Delve é atingido por uma grave violação de segurança
A startup de conformidade Delve continua a enfrentar uma série de controvérsias crescentes.A TechCrunch verificou que a Delve realizou as certificações de segurança para a Context AI, uma empresa de treinamento de agentes de IA que recentemente rela
Google Apresenta o Gemini 3.8 Flash TTS, Permitindo Personalização Natural de Voz por Linguagem e Replicação em 30 Segundos
A síntese de voz está alcançando novos patamares de precisão. Em 23 de setembro, a Google apresentou dois modelos avançados de texto para fala — Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS — projetados para atender às diversas demandas de desenv
Recomendações de tópicos especiais relacionados
Comentários (0)

Em 24 de maio, a equipe ByteDance Seed, em parceria com a Universidade de Ciência e Tecnologia de Hong Kong, apresentou um avanço no treinamento de documentos longos para modelos de linguagem grande multimodais (LMMs). Utilizando o Qwen2.5-VL de código aberto do Alibaba, a equipe desenvolveu um novo modelo chamado MMProLong, alcançando ganhos significativos em eficiência de processamento. Esta pesquisa desafia os métodos convencionais de treinamento de textos longos para modelos multimodais, destacando como a organização estratégica de dados é crucial para aprimorar as capacidades de contexto longo.
Ao abordar os principais desafios no treinamento de LMMs, o estudo revela que o treinamento por perguntas e respostas (QA) adaptado a tarefas específicas é muito mais eficaz do que a transcrição por reconhecimento óptico de caracteres (OCR) tradicional. Embora confiar apenas na transcrição de texto não melhore a recuperação de conteúdo em contextos longos — podendo até degradar o desempenho —, o treinamento com pares de QA de contexto longo gerados por um modelo independente, como
Com uma estratégia otimizada e um orçamento de treinamento modesto de apenas 128.000 tokens, o MMProLong mantém uma estabilidade robusta em textos longos, performando eficazmente mesmo quando os comprimentos de entrada atingem 256.000 ou 512.000 tokens. Ele supera modelos de código aberto maiores, como InternVL3-38B e
Este estudo oferece um caminho de desenvolvimento alternativo para a indústria de grandes modelos, contrastando com abordagens como as da DeepSeek, que focam na atualização de arquiteturas por meio de dados visuais altamente compactados e reordenados. Ele demonstra que as capacidades de contexto longo podem ser significativamente aprimoradas por meio da otimização da estrutura dos dados de treinamento em vez de alterar a arquitetura subjacente, abrindo caminho para soluções técnicas mais econômicas e eficientes para sistemas multimodais futuros e agentes de múltiplos passos.
Microsoft revive estratégia de IA própria com novo modelo de codificação, à medida que os custos do Claude disparam
O código assistido por IA tornou-se um elemento fundamental no desenvolvimento de software moderno, mas mesmo gigantes da tecnologia como a Microsoft estão sentindo o impacto das caras assinaturas de modelos de linguagem grandes de terceiros. Para re
Outro cliente da startup em dificuldades Delve é atingido por uma grave violação de segurança
A startup de conformidade Delve continua a enfrentar uma série de controvérsias crescentes.A TechCrunch verificou que a Delve realizou as certificações de segurança para a Context AI, uma empresa de treinamento de agentes de IA que recentemente rela
Google Apresenta o Gemini 3.8 Flash TTS, Permitindo Personalização Natural de Voz por Linguagem e Replicação em 30 Segundos
A síntese de voz está alcançando novos patamares de precisão. Em 23 de setembro, a Google apresentou dois modelos avançados de texto para fala — Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS — projetados para atender às diversas demandas de desenv











