Hogar
ByteDance y HKUST presentan MMProLong para mejorar el entrenamiento de LMM en documentos largos

El 24 de mayo, el equipo ByteDance Seed colaboró con la Universidad de Ciencia y Tecnología de Hong Kong para presentar un avance en el entrenamiento de documentos largos para modelos de lenguaje grande multimodales (LMM). Aprovechando el código abierto de Alibaba Qwen2.5-VL, el equipo desarrolló un nuevo modelo llamado MMProLong, logrando mejoras significativas en la eficiencia del procesamiento. Esta investigación desafía los métodos convencionales de entrenamiento de textos largos para modelos multimodales, destacando cómo la organización estratégica de datos es fundamental para mejorar las capacidades de contexto largo.
Abordando los principales desafíos en el entrenamiento de LMM, el estudio revela que el entrenamiento de preguntas y respuestas (QA) adaptado a tareas específicas es mucho más efectivo que la transcripción de reconocimiento óptico de caracteres (OCR) tradicional. Si bien depender únicamente de la transcripción de texto no mejora la recuperación de contenido en contextos largos e incluso puede degradar el rendimiento, el entrenamiento con pares de QA de contexto largo generados por un modelo independiente como ByteDance Seed2.0 permite al modelo localizar con precisión los párrafos objetivo entre información extensa y distractora.
Con una estrategia optimizada y un modesto presupuesto de entrenamiento de solo 128,000 tokens, MMProLong mantiene una sólida estabilidad en textos largos, funcionando eficazmente incluso cuando las longitudes de entrada alcanzan 256,000 o 512,000 tokens. Supera a modelos de código abierto más grandes como InternVL3-38B y Gemma3-27B en las pruebas MMLongBench y MM-NIAH (Needle-in-a-Haystack). Además, las capacidades multimodales de MMProLong se extienden a tareas de comprensión de videos largos sin entrenamiento específico, una estrategia también validada en el modelo Qwen3-VL-8B .
Este estudio ofrece una ruta de desarrollo alternativa para la industria de modelos grandes, en contraste con enfoques como los de DeepSeek, que se centran en actualizar arquitecturas mediante datos visuales altamente comprimidos y reordenados. Demuestra que las capacidades de contexto largo pueden mejorarse significativamente optimizando la estructura de los datos de entrenamiento en lugar de alterar la arquitectura subyacente, allanando el camino para soluciones técnicas más rentables y eficientes para futuros sistemas multimodales y agentes de múltiples pasos.
Artículo relacionado
Otro cliente de la startup en dificultades Delve, afectada por una importante brecha de seguridad
El startup de cumplimiento normativo Delve continúa enfrentando una serie de controversias en aumento.TechCrunch ha verificado que Delve realizó las certificaciones de seguridad para Context AI, una empresa de formación de agentes de inteligencia ar
Google Desvela Gemini 3.8 Flash TTS, Permitizando Personalización Natural del Voz y Replicación de 30 Segundos
La síntesis de voz está alcanzando nuevas cotas de precisión. El 23 de septiembre, Google presentó dos modelos avanzados de texto a voz: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, diseñados para satisfacer las diversas necesidades de desarroll
Lanzamiento de MiniMax Code 2.0 para escritorio: las tareas largas ya no se congelan, control remoto y toma de control del navegador llegan este mes
Los desarrolladores que abordan tareas de codificación de cadenas largas están demasiado familiarizados con la frustración de que los agentes pierdan repentinamente el contexto o se congelen sin respuesta, lo que conlleva un esfuerzo desperdiciado y
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

El 24 de mayo, el equipo ByteDance Seed colaboró con la Universidad de Ciencia y Tecnología de Hong Kong para presentar un avance en el entrenamiento de documentos largos para modelos de lenguaje grande multimodales (LMM). Aprovechando el código abierto de Alibaba Qwen2.5-VL, el equipo desarrolló un nuevo modelo llamado MMProLong, logrando mejoras significativas en la eficiencia del procesamiento. Esta investigación desafía los métodos convencionales de entrenamiento de textos largos para modelos multimodales, destacando cómo la organización estratégica de datos es fundamental para mejorar las capacidades de contexto largo.
Abordando los principales desafíos en el entrenamiento de LMM, el estudio revela que el entrenamiento de preguntas y respuestas (QA) adaptado a tareas específicas es mucho más efectivo que la transcripción de reconocimiento óptico de caracteres (OCR) tradicional. Si bien depender únicamente de la transcripción de texto no mejora la recuperación de contenido en contextos largos e incluso puede degradar el rendimiento, el entrenamiento con pares de QA de contexto largo generados por un modelo independiente como
Con una estrategia optimizada y un modesto presupuesto de entrenamiento de solo 128,000 tokens, MMProLong mantiene una sólida estabilidad en textos largos, funcionando eficazmente incluso cuando las longitudes de entrada alcanzan 256,000 o 512,000 tokens. Supera a modelos de código abierto más grandes como InternVL3-38B y
Este estudio ofrece una ruta de desarrollo alternativa para la industria de modelos grandes, en contraste con enfoques como los de DeepSeek, que se centran en actualizar arquitecturas mediante datos visuales altamente comprimidos y reordenados. Demuestra que las capacidades de contexto largo pueden mejorarse significativamente optimizando la estructura de los datos de entrenamiento en lugar de alterar la arquitectura subyacente, allanando el camino para soluciones técnicas más rentables y eficientes para futuros sistemas multimodales y agentes de múltiples pasos.
Otro cliente de la startup en dificultades Delve, afectada por una importante brecha de seguridad
El startup de cumplimiento normativo Delve continúa enfrentando una serie de controversias en aumento.TechCrunch ha verificado que Delve realizó las certificaciones de seguridad para Context AI, una empresa de formación de agentes de inteligencia ar
Google Desvela Gemini 3.8 Flash TTS, Permitizando Personalización Natural del Voz y Replicación de 30 Segundos
La síntesis de voz está alcanzando nuevas cotas de precisión. El 23 de septiembre, Google presentó dos modelos avanzados de texto a voz: Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, diseñados para satisfacer las diversas necesidades de desarroll
Lanzamiento de MiniMax Code 2.0 para escritorio: las tareas largas ya no se congelan, control remoto y toma de control del navegador llegan este mes
Los desarrolladores que abordan tareas de codificación de cadenas largas están demasiado familiarizados con la frustración de que los agentes pierdan repentinamente el contexto o se congelen sin respuesta, lo que conlleva un esfuerzo desperdiciado y











