Дом
ByteDance и HKUST представляют MMProLong для улучшения обучения длинных документов в LMM

24 мая команда ByteDance Seed совместно с Гонконгским научно-техническим университетом представила прорыв в области обучения длинных документов для мультимодальных больших языковых моделей (LMM). Используя открытую модель Alibaba Qwen2.5-VL, команда разработала новую модель под названием MMProLong, достигнув значительного повышения эффективности обработки. Это исследование бросает вызов традиционным методам обучения длинных текстов для мультимодальных моделей, подчеркивая, что стратегическая организация данных имеет решающее значение для улучшения работы с длинным контекстом.
Рассматривая ключевые проблемы обучения LMM, исследование показывает, что обучение на основе вопросов и ответов (QA), адаптированное под конкретные задачи, значительно эффективнее традиционной транскрипции с помощью оптического распознавания символов (OCR). Хотя использование только текстовой транскрипции не улучшает извлечение информации в длинных контекстах и может даже ухудшить производительность, обучение с использованием пар QA с длинным контекстом, сгенерированных независимой моделью, такой как ByteDance Seed2.0 , позволяет модели точно находить целевые абзацы среди длинных и отвлекающих данных.
Благодаря оптимизированной стратегии и скромному бюджету обучения всего в 128 000 токенов, MMProLong сохраняет стабильность при работе с длинными текстами, эффективно справляясь даже при длине входных данных до 256 000 или 512 000 токенов. Она превосходит более крупные открытые модели, такие как InternVL3-38B и Gemma3-27B , на бенчмарках MMLongBench и MM-NIAH (Needle-in-a-Haystack). Кроме того, мультимодальные возможности MMProLong распространяются на задачи понимания длинных видео без специальной подготовки, что также было проверено на модели Qwen3-VL-8B .
Это исследование предлагает альтернативный путь развития для индустрии больших моделей, контрастирующий с подходами, такими как DeepSeek, которые сосредоточены на улучшении архитектур за счет высоко сжатых и переупорядоченных визуальных данных. Оно демонстрирует, что возможности работы с длинным контекстом можно значительно улучшить путем оптимизации структуры обучающих данных, а не изменения базовой архитектуры, открывая путь к более экономичным и эффективным техническим решениям для будущих мультимодальных систем и многошаговых агентов.
Связанная статья
Microsoft возрождает собственную стратегию в области ИИ с новой моделью для программирования на фоне резкого роста цен на Claude
Искусственный интеллект в программировании стал неотъемлемой частью современной разработки программного обеспечения, однако даже технологические гиганты, такие как Microsoft, ощущают давление из-за высоких затрат на подписки сторонних больших языковы
Ещё один клиент стартапа Delve, столкнувшегося с серьёзным нарушением безопасности
Стартап в сфере комплаенса Delve продолжает сталкиваться с серией эскалирующих скандалов.TechCrunch подтвердил, что Delve проводил сертификацию безопасности для Context AI, компании по обучению ИИ-агентов, которая недавно сообщила о инциденте с безо
Google представила Gemini 3.8 Flash TTS, обеспечивающую естественную настройку голосового интерфейса и 30-секундное воспроизведение
Синтез речи достигает новых высот точности. 23 сентября Google представила две продвинутые модели преобразования текста в речь — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, — разработанные для удовлетворения разнообразных потребностей разработч
Рекомендации по связанным специальным темам
Комментарии (0)

24 мая команда ByteDance Seed совместно с Гонконгским научно-техническим университетом представила прорыв в области обучения длинных документов для мультимодальных больших языковых моделей (LMM). Используя открытую модель Alibaba Qwen2.5-VL, команда разработала новую модель под названием MMProLong, достигнув значительного повышения эффективности обработки. Это исследование бросает вызов традиционным методам обучения длинных текстов для мультимодальных моделей, подчеркивая, что стратегическая организация данных имеет решающее значение для улучшения работы с длинным контекстом.
Рассматривая ключевые проблемы обучения LMM, исследование показывает, что обучение на основе вопросов и ответов (QA), адаптированное под конкретные задачи, значительно эффективнее традиционной транскрипции с помощью оптического распознавания символов (OCR). Хотя использование только текстовой транскрипции не улучшает извлечение информации в длинных контекстах и может даже ухудшить производительность, обучение с использованием пар QA с длинным контекстом, сгенерированных независимой моделью, такой как
Благодаря оптимизированной стратегии и скромному бюджету обучения всего в 128 000 токенов, MMProLong сохраняет стабильность при работе с длинными текстами, эффективно справляясь даже при длине входных данных до 256 000 или 512 000 токенов. Она превосходит более крупные открытые модели, такие как InternVL3-38B и
Это исследование предлагает альтернативный путь развития для индустрии больших моделей, контрастирующий с подходами, такими как DeepSeek, которые сосредоточены на улучшении архитектур за счет высоко сжатых и переупорядоченных визуальных данных. Оно демонстрирует, что возможности работы с длинным контекстом можно значительно улучшить путем оптимизации структуры обучающих данных, а не изменения базовой архитектуры, открывая путь к более экономичным и эффективным техническим решениям для будущих мультимодальных систем и многошаговых агентов.
Microsoft возрождает собственную стратегию в области ИИ с новой моделью для программирования на фоне резкого роста цен на Claude
Искусственный интеллект в программировании стал неотъемлемой частью современной разработки программного обеспечения, однако даже технологические гиганты, такие как Microsoft, ощущают давление из-за высоких затрат на подписки сторонних больших языковы
Ещё один клиент стартапа Delve, столкнувшегося с серьёзным нарушением безопасности
Стартап в сфере комплаенса Delve продолжает сталкиваться с серией эскалирующих скандалов.TechCrunch подтвердил, что Delve проводил сертификацию безопасности для Context AI, компании по обучению ИИ-агентов, которая недавно сообщила о инциденте с безо
Google представила Gemini 3.8 Flash TTS, обеспечивающую естественную настройку голосового интерфейса и 30-секундное воспроизведение
Синтез речи достигает новых высот точности. 23 сентября Google представила две продвинутые модели преобразования текста в речь — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, — разработанные для удовлетворения разнообразных потребностей разработч











