MiniCPM-V 4.6의 1.3B 모델 치수 축소 전략, 엣지 멀티모달 기술의 새로운 기준을 제시하다
5월 11일, Mingshi Intelligence는 칭화대학교 및 OpenBMB 오픈소스 커뮤니티와 협력하여 새로운 엣지 측 다중 모달 대규모 모델인 MiniCPM-V4.6을 공개했습니다. 단 13억 개의 파라미터로 구성된 컴팩트한 규모임에도 불구하고, 이 경량 모델은 탁월한 지능 밀도와 크로스 플랫폼 적응성을 통해 대규모 모델의 한계를 뛰어넘으며, 엣지 측 AI의 실제 현장 배포를 가속화합니다.

1. 최고 성능: 13억 개의 파라미터가 탁월한 결과를 선사
MiniCPM-V4.6은 ‘Instruct’와 ‘Thinking’ 두 가지 버전으로 제공되며, 두 버전 모두 유사한 규모의 모델과 비교했을 때 다양한 벤치마크에서 인상적인 추론 및 이해 능력을 보여줍니다.
글로벌 리더십: 인공 분석(AA) 리더보드에서 MiniCPM-V4.6은 13점이라는 인상적인 점수를 기록하며, 비슷한 규모의 경쟁 모델(예: 알리바바의 Qwen3.5-0.8B, 구글의 Gemma4-E2B-it)을 훨씬 능가하는 동시에 Qwen3.5-2B와 같은 더 큰 모델의 성능에 근접했습니다. 이는 1B 매개변수 모델에 대한 새로운 기준을 제시합니다.
고급 기능: 일반적인 이미지-텍스트 이해와 복잡한 STEM 수학 추론부터 까다로운 문서 OCR 및 동영상 시간적 이해에 이르기까지, 이 모델은 뛰어난 지능을 보여줍니다. 특히 ‘Thinking’ 버전은 다중 이미지 추론과 환각 억제에서 탁월한 성능을 발휘합니다.
2. 효율성의 획기적 발전: 엣지 환경에서의 극한의 지능 밀도
엣지 배포 시 발생하는 메모리 제약을 해결하기 위해, MiniCPM-V4.6은 추론 속도와 자원 효율성을 위해 심도 있게 최적화되었습니다.
낮은 메모리 사용량: 메모리 요구량이 6GB로 줄어들어 일반 스마트폰, PC 및 스마트 홈 기기에서 원활하게 작동합니다.
추론 효율성: vLLM을 기반으로 하여 추론 처리량이 경쟁 모델 대비 1.5배 높습니다. 엣지에서 3136² 초고해상도 이미지를 처리할 때 첫 응답 지연 시간은 단 75.7ms로, 경쟁 모델보다 2.2배 빠릅니다.
처리량: 단일 GPU로 초당 7,013 토큰의 텍스트 생성이 가능하며, 초당 54.79장의 속도로 1,344² 크기의 이미지를 처리할 수 있어 뛰어난 효율성을 입증합니다.
3. 핵심 기술: LLaVA-UHD v4, 오버헤드 최소화
이 모델의 경량화된 설계는 Mingshi Intelligence와 칭화대학교가 공동 개발한 LLaVA-UHD v4 덕분에 가능해졌습니다.
인코딩 재설계: 개선된 ViT 이미지 인코딩 및 얕은 압축 모듈을 통해 이미지 인코딩 오버헤드를 50%, 고해상도 부동소수점 연산을 55.8% 줄였습니다 .
하이브리드 압축: 성능 우선 모드와 속도 우선 모드 간 유연한 전환을 가능하게 하는 4×/16× 하이브리드 토큰 압축을 도입했습니다. 이 기술은 방대한 트래픽을 처리하는 Kuaishou의 추천 모델 OneRec에서 그 효과가 검증되었습니다.
4. 생태계 적용: 연구실에서 산업 현장으로
MiniCPM-V4.6의 오픈소스 공개는 기술적 측면과 생태계 측면 모두에서 중요한 이정표가 됩니다.
간편한 개발: ms-swift 및 LLaMA-Factory와 같은 미세 조정 프레임워크와 원활하게 통합되어, 단일 RTX 4090 GPU에서 본격적인 미세 조정이 가능합니다.
크로스 플랫폼 지원: vLLM, Ollama 및 기타 주요 프레임워크와 호환되며, iOS, Android, HarmonyOS용 테스트 버전을 제공하여 더 광범위한 하드웨어에 AI를 적용할 수 있게 합니다.
실생활에 미치는 영향: 이 모델 시리즈는 이미 자동차, PC, 스마트 홈, 산업용 검사 분야에 배포되어 있으며, 레노버, 지리, SAIC 폭스바겐, 샤오미, OPPO 등이 파트너로 참여하고 있습니다.
관련 기사
리 페이페이 연구팀, 단일 영상으로 무한한 로봇 훈련장을 생성하는 방법 공개
체화 지능 분야에서, 시뮬레이션과 현실 간의 격차를 해소하는 일—일명 “Sim2Real”—은 오랫동안 해결되지 않은 난제로 남아 있었습니다. 시뮬레이션 환경 구축에는 막대한 비용이 소요되며, 모델은 실제 환경에 적용될 때 성능이 저하되는 경우가 빈번합니다. 리 페이페이(Li Fei-Fei) 연구팀, NVIDIA GEAR Lab, 조지아 공과대학교(Georg
어도비 크리에이터 보고서: 응답자의 80%가 AI가 팬층 확대와 비즈니스 성장을 주도한다고 답함
인공지능이 전 세계적으로 빠르게 확산됨에 따라 콘텐츠 제작 분야는 근본적인 변화를 겪고 있습니다. 창의적 AI 도구는 더 이상 단순한 업무 효율화 수단에 그치지 않고, 비즈니스 성장을 주도하며 크리에이터들이 더 많은 시청자를 확보할 수 있도록 돕고 있습니다.생산성 및 경쟁력 강화어도비(Adobe)가 최근 발표한 ‘2026 크리에이터 툴킷 보고서(2026 C
구글, AI 디자인 분야 주요 플레이어임을 선언
매년 열리는 I/O 컨퍼런스 화요일, 구글은 Google Workspace용 새로운 AI 기반 디자인 및 이미지 생성 도구인 Pics를 공개했다. 이 앱은 교육자부터 소규모 사업자까지 모든 사용자를 위해 접근성을 고려해 설계되었다고 회사는 밝혔다.Pics는 간단한 텍스트 프롬프트를 사용해 소셜 미디어 그래픽, 초대장, 마케팅 자료, 목업 등을 생성할 수 있게 하며, 고급 편집 기술이나 전문 소프트웨어가 필요하지 않다. 시각적 창작을 단순화함으
관련 특별 주제 추천
의견 (0)
0/500
5월 11일, Mingshi Intelligence는 칭화대학교 및 OpenBMB 오픈소스 커뮤니티와 협력하여 새로운 엣지 측 다중 모달 대규모 모델인 MiniCPM-V4.6을 공개했습니다. 단 13억 개의 파라미터로 구성된 컴팩트한 규모임에도 불구하고, 이 경량 모델은 탁월한 지능 밀도와 크로스 플랫폼 적응성을 통해 대규모 모델의 한계를 뛰어넘으며, 엣지 측 AI의 실제 현장 배포를 가속화합니다.

1. 최고 성능: 13억 개의 파라미터가 탁월한 결과를 선사
MiniCPM-V4.6은 ‘Instruct’와 ‘Thinking’ 두 가지 버전으로 제공되며, 두 버전 모두 유사한 규모의 모델과 비교했을 때 다양한 벤치마크에서 인상적인 추론 및 이해 능력을 보여줍니다.
글로벌 리더십: 인공 분석(AA) 리더보드에서 MiniCPM-V4.6은 13점이라는 인상적인 점수를 기록하며, 비슷한 규모의 경쟁 모델(예: 알리바바의 Qwen3.5-0.8B, 구글의 Gemma4-E2B-it)을 훨씬 능가하는 동시에 Qwen3.5-2B와 같은 더 큰 모델의 성능에 근접했습니다. 이는 1B 매개변수 모델에 대한 새로운 기준을 제시합니다.
고급 기능: 일반적인 이미지-텍스트 이해와 복잡한 STEM 수학 추론부터 까다로운 문서 OCR 및 동영상 시간적 이해에 이르기까지, 이 모델은 뛰어난 지능을 보여줍니다. 특히 ‘Thinking’ 버전은 다중 이미지 추론과 환각 억제에서 탁월한 성능을 발휘합니다.
2. 효율성의 획기적 발전: 엣지 환경에서의 극한의 지능 밀도
엣지 배포 시 발생하는 메모리 제약을 해결하기 위해, MiniCPM-V4.6은 추론 속도와 자원 효율성을 위해 심도 있게 최적화되었습니다.
낮은 메모리 사용량: 메모리 요구량이 6GB로 줄어들어 일반 스마트폰, PC 및 스마트 홈 기기에서 원활하게 작동합니다.
추론 효율성: vLLM을 기반으로 하여 추론 처리량이 경쟁 모델 대비 1.5배 높습니다. 엣지에서 3136² 초고해상도 이미지를 처리할 때 첫 응답 지연 시간은 단 75.7ms로, 경쟁 모델보다 2.2배 빠릅니다.
처리량: 단일 GPU로 초당 7,013 토큰의 텍스트 생성이 가능하며, 초당 54.79장의 속도로 1,344² 크기의 이미지를 처리할 수 있어 뛰어난 효율성을 입증합니다.
3. 핵심 기술: LLaVA-UHD v4, 오버헤드 최소화
이 모델의 경량화된 설계는 Mingshi Intelligence와 칭화대학교가 공동 개발한 LLaVA-UHD v4 덕분에 가능해졌습니다.
인코딩 재설계: 개선된 ViT 이미지 인코딩 및 얕은 압축 모듈을 통해 이미지 인코딩 오버헤드를 50%, 고해상도 부동소수점 연산을 55.8% 줄였습니다 .
하이브리드 압축: 성능 우선 모드와 속도 우선 모드 간 유연한 전환을 가능하게 하는 4×/16× 하이브리드 토큰 압축을 도입했습니다. 이 기술은 방대한 트래픽을 처리하는 Kuaishou의 추천 모델 OneRec에서 그 효과가 검증되었습니다.
4. 생태계 적용: 연구실에서 산업 현장으로
MiniCPM-V4.6의 오픈소스 공개는 기술적 측면과 생태계 측면 모두에서 중요한 이정표가 됩니다.
간편한 개발: ms-swift 및 LLaMA-Factory와 같은 미세 조정 프레임워크와 원활하게 통합되어, 단일 RTX 4090 GPU에서 본격적인 미세 조정이 가능합니다.
크로스 플랫폼 지원: vLLM, Ollama 및 기타 주요 프레임워크와 호환되며, iOS, Android, HarmonyOS용 테스트 버전을 제공하여 더 광범위한 하드웨어에 AI를 적용할 수 있게 합니다.
실생활에 미치는 영향: 이 모델 시리즈는 이미 자동차, PC, 스마트 홈, 산업용 검사 분야에 배포되어 있으며, 레노버, 지리, SAIC 폭스바겐, 샤오미, OPPO 등이 파트너로 참여하고 있습니다.
리 페이페이 연구팀, 단일 영상으로 무한한 로봇 훈련장을 생성하는 방법 공개
체화 지능 분야에서, 시뮬레이션과 현실 간의 격차를 해소하는 일—일명 “Sim2Real”—은 오랫동안 해결되지 않은 난제로 남아 있었습니다. 시뮬레이션 환경 구축에는 막대한 비용이 소요되며, 모델은 실제 환경에 적용될 때 성능이 저하되는 경우가 빈번합니다. 리 페이페이(Li Fei-Fei) 연구팀, NVIDIA GEAR Lab, 조지아 공과대학교(Georg
어도비 크리에이터 보고서: 응답자의 80%가 AI가 팬층 확대와 비즈니스 성장을 주도한다고 답함
인공지능이 전 세계적으로 빠르게 확산됨에 따라 콘텐츠 제작 분야는 근본적인 변화를 겪고 있습니다. 창의적 AI 도구는 더 이상 단순한 업무 효율화 수단에 그치지 않고, 비즈니스 성장을 주도하며 크리에이터들이 더 많은 시청자를 확보할 수 있도록 돕고 있습니다.생산성 및 경쟁력 강화어도비(Adobe)가 최근 발표한 ‘2026 크리에이터 툴킷 보고서(2026 C
구글, AI 디자인 분야 주요 플레이어임을 선언
매년 열리는 I/O 컨퍼런스 화요일, 구글은 Google Workspace용 새로운 AI 기반 디자인 및 이미지 생성 도구인 Pics를 공개했다. 이 앱은 교육자부터 소규모 사업자까지 모든 사용자를 위해 접근성을 고려해 설계되었다고 회사는 밝혔다.Pics는 간단한 텍스트 프롬프트를 사용해 소셜 미디어 그래픽, 초대장, 마케팅 자료, 목업 등을 생성할 수 있게 하며, 고급 편집 기술이나 전문 소프트웨어가 필요하지 않다. 시각적 창작을 단순화함으





집






