ByteDance와 HKUST는 장기 문서 LMM 학습을 강화하기 위한 MMProLong을 공개했습니다

5월 24일, 바이트댄스 시드(ByteDance Seed) 팀은 홍콩과학기술대학교(HKUST)와 협력하여 다중모태 대형 언어 모델(LMMs)의 장문 문서 학습 분야에서 돌파구를 마련했습니다. 알리바바의 오픈소스 Qwen2.5-VL을 활용하여 개발된 새로운 모델 MMProLong은 처리 효율성에서 상당한 향상을 이루었습니다. 이 연구는 다중모태 모델의 기존 장문 학습 방식을 도전하며, 전략적인 데이터 조직화가 장문 컨텍스트 능력을 향상시키는 데 얼마나 중요한지 강조합니다.
LMM 학습의 주요 과제를 해결하기 위해, 본 연구는 특정 작업에 맞춘 질문-답변(QA) 학습이 전통적인 광학 문자 인식(OCR) 전사보다 훨씬 효과적임을 밝혀냈습니다. 텍스트 전사에만 의존하면 장문 컨텍스트에서 콘텐츠 검색이 개선되지 않을 뿐만 아니라 성능이 저하될 수 있지만, ByteDance Seed2.0 과 같은 독립적인 모델이 생성한 장문 QA 쌍으로 학습하면 모델이 길고 산만한 정보 속에서 대상 단락을 정확하게 찾아낼 수 있습니다.
최적화된 전략과 단 128,000 토큰이라는 작은 학습 예산으로 MMProLong은 강력한 장문 안정성을 유지하며, 입력 길이가 256,000 또는 512,000 토큰에 달해도 효과적으로 작동합니다. 이는 MMLongBench 및 MM-NIAH(Needle-in-a-Haystack) 벤치마크에서 InternVL3-38B 및 Gemma3-27B 과 같은 더 큰 오픈소스 모델들을 능가합니다. 또한 MMProLong의 다중모태 능력은 특정 학습 없이도 장문 비디오 이해 작업으로 확장되며, 이 전략은 Qwen3-VL-8B 모델에서도 검증되었습니다.
본 연구는 DeepSeek과 같이 압축되고 재배열된 시각 데이터를 통해 아키텍처를 업그레이드하는 데 중점을 둔 접근법과 대비되는 대형 모델 산업의 대안 개발 경로를 제시합니다. 이는 기본 아키텍처를 변경하는 대신 학습 데이터 구조를 최적화함으로써 장문 컨텍스트 능력을 크게 향상시킬 수 있음을 보여주며, 향후 다중모태 시스템 및 다단계 에이전트를 위한 더 비용 효율적이고 효율적인 기술 솔루션의 길을 엽니다.
관련 기사
주요 보안 침해 사고로 타격을 입은 스타트업 델브(Delve)의 다른 고객
준법 스타트업 델브(Delve)는 계속되는 일련의 격화되는 논란에 직면하고 있습니다.테크크런치는 델브가 최근 prominent 앱 및 웹사이트 호스팅 플랫폼인 버셀(Vercel)에서 데이터 유출을 초래한 보안 사고를 보고한 AI 에이전트 교육 기업 컨텍스트 AI(Context AI)의 보안 인증을 수행했다는 사실을 확인했습니다.한편, 자체적인 보안 사고를 겪은 로버블(Lovable)은 더 이상 델브의 서비스를 사용하지 않고 있습니다.요약하
구글, Gemini 3.8 Flash TTS 공개, 자연어 음성 사용자 정의 및 30초 복제 기능 제공
음성 합성은 새로운 정밀도의 높이에 도달하고 있습니다. 9월 23일, 구글은 개발자와 크리에이터들이 개인화된 성우 작업과 대규모 오디오 제작에 대해 다양하게 요구하는 사항을 충족하도록 설계된 두 가지 고급 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다.각 모델은 고유한 목적을 가지고 있습니다. Gemini 3.8 Flash TTS는 음성 및 캐릭터 디자인에
MiniMax Code 2.0 데스크톱 출시: 장시간 작업으로 인한 멈춤 현상 해소, 이번 달 원격 제어 및 브라우저 장악 기능 예정
긴 체인 코딩 작업을 다루는 개발자들은 에이전트가 갑자기 컨텍스트를 잃거나 응답 없이 멈추는 좌절감을 너무 잘 알고 있으며, 이는 낭비된 노력과 수동 정리 필요성으로 이어집니다. 7월 16일, MiniMax는 MiniMax Code 2.0의 데스크톱 버전을 공식적으로 다운로드 가능하게 출시하여 이러한 고통 지점들을 해결했습니다.이 업데이트는 긴 작업 실행의 세 가지 핵심 과제인 대기, 중단, 컨텍스트 연속성에 초점을 맞춥니다. MiniMax는
관련 특별 주제 추천
의견 (0)
0/500

5월 24일, 바이트댄스 시드(ByteDance Seed) 팀은 홍콩과학기술대학교(HKUST)와 협력하여 다중모태 대형 언어 모델(LMMs)의 장문 문서 학습 분야에서 돌파구를 마련했습니다. 알리바바의 오픈소스 Qwen2.5-VL을 활용하여 개발된 새로운 모델 MMProLong은 처리 효율성에서 상당한 향상을 이루었습니다. 이 연구는 다중모태 모델의 기존 장문 학습 방식을 도전하며, 전략적인 데이터 조직화가 장문 컨텍스트 능력을 향상시키는 데 얼마나 중요한지 강조합니다.
LMM 학습의 주요 과제를 해결하기 위해, 본 연구는 특정 작업에 맞춘 질문-답변(QA) 학습이 전통적인 광학 문자 인식(OCR) 전사보다 훨씬 효과적임을 밝혀냈습니다. 텍스트 전사에만 의존하면 장문 컨텍스트에서 콘텐츠 검색이 개선되지 않을 뿐만 아니라 성능이 저하될 수 있지만,
최적화된 전략과 단 128,000 토큰이라는 작은 학습 예산으로 MMProLong은 강력한 장문 안정성을 유지하며, 입력 길이가 256,000 또는 512,000 토큰에 달해도 효과적으로 작동합니다. 이는 MMLongBench 및 MM-NIAH(Needle-in-a-Haystack) 벤치마크에서 InternVL3-38B 및
본 연구는 DeepSeek과 같이 압축되고 재배열된 시각 데이터를 통해 아키텍처를 업그레이드하는 데 중점을 둔 접근법과 대비되는 대형 모델 산업의 대안 개발 경로를 제시합니다. 이는 기본 아키텍처를 변경하는 대신 학습 데이터 구조를 최적화함으로써 장문 컨텍스트 능력을 크게 향상시킬 수 있음을 보여주며, 향후 다중모태 시스템 및 다단계 에이전트를 위한 더 비용 효율적이고 효율적인 기술 솔루션의 길을 엽니다.
주요 보안 침해 사고로 타격을 입은 스타트업 델브(Delve)의 다른 고객
준법 스타트업 델브(Delve)는 계속되는 일련의 격화되는 논란에 직면하고 있습니다.테크크런치는 델브가 최근 prominent 앱 및 웹사이트 호스팅 플랫폼인 버셀(Vercel)에서 데이터 유출을 초래한 보안 사고를 보고한 AI 에이전트 교육 기업 컨텍스트 AI(Context AI)의 보안 인증을 수행했다는 사실을 확인했습니다.한편, 자체적인 보안 사고를 겪은 로버블(Lovable)은 더 이상 델브의 서비스를 사용하지 않고 있습니다.요약하
구글, Gemini 3.8 Flash TTS 공개, 자연어 음성 사용자 정의 및 30초 복제 기능 제공
음성 합성은 새로운 정밀도의 높이에 도달하고 있습니다. 9월 23일, 구글은 개발자와 크리에이터들이 개인화된 성우 작업과 대규모 오디오 제작에 대해 다양하게 요구하는 사항을 충족하도록 설계된 두 가지 고급 텍스트 음성 변환(TTS) 모델인 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 공개했습니다.각 모델은 고유한 목적을 가지고 있습니다. Gemini 3.8 Flash TTS는 음성 및 캐릭터 디자인에
MiniMax Code 2.0 데스크톱 출시: 장시간 작업으로 인한 멈춤 현상 해소, 이번 달 원격 제어 및 브라우저 장악 기능 예정
긴 체인 코딩 작업을 다루는 개발자들은 에이전트가 갑자기 컨텍스트를 잃거나 응답 없이 멈추는 좌절감을 너무 잘 알고 있으며, 이는 낭비된 노력과 수동 정리 필요성으로 이어집니다. 7월 16일, MiniMax는 MiniMax Code 2.0의 데스크톱 버전을 공식적으로 다운로드 가능하게 출시하여 이러한 고통 지점들을 해결했습니다.이 업데이트는 긴 작업 실행의 세 가지 핵심 과제인 대기, 중단, 컨텍스트 연속성에 초점을 맞춥니다. MiniMax는





집






