DeepSeek, AI 에이전트 전용으로 설계된 최초의 오픈소스 다중 모달 모델 공개
DeepSeek은 Hugging Face에 DeepSeek-V4-Flash-Vision-Exp를 공개하며, MIT 라이선스 하에 V4 시리즈 최초의 실험용 다중 모달 모델을 선보였습니다. 305B 매개변수를 갖추고 V4-Flash-0731 기반을 바탕으로 구축된 이 모델은 핵심 언어 아키텍처에 시각 인코더와 Aligner를 통합하여, 지속적인 훈련을 통해 강력한 이미지 이해 능력을 발휘합니다.

단순한 이미지 설명이 아닌, 다중 모달 에이전트를 목표로
시각적 질문 응답에 중점을 둔 기존의 다중 모달 모델과 달리, DeepSeek은 Vision 버전의 목적을 재정의하여 다중 모달 에이전트 기능을 최우선으로 삼았습니다. 공식 문서에 따르면, 에이전트는 웹 스크린샷, 소프트웨어 인터페이스, 차트와 같은 시각적 입력을 직접 해석하고 도구를 호출하여 작업을 수행할 수 있습니다. 본질적으로 이 “눈”은 인간 사용자가 아닌 기계 에이전트를 위해 설계되었습니다.
이 오픈소스 패키지는 모델 가중치, 토케나이저, 프롬프트 인코딩 참조 구현, 최소한의 PyTorch 추론 설정 등을 포함하여 포괄적입니다. 또한 시각 인코더, Aligner, DFlash Attention, MoE, Hyper-Connections 등 필수 모듈을 다룹니다. 커뮤니티의 반응은 신속했으며, Hugging Face에서는 이미 llama.cpp, LM Studio, Ollama용 양자화 버전 7개가 제공되고 있습니다.
주목할 만한 일정을 살펴보면 전략적인 출시 과정을 엿볼 수 있습니다. 이 모델은 8월 21일 DeepSeek API에 처음 등장했으며, 당시에는 가중치 배포 없이 API를 통해서만 접근할 수 있었습니다. 개발자들은 텍스트와 이미지를 동시에 입력할 수 있었으며, 이미지 처리 비용은 토큰 단위로 청구되었습니다. 10일 후, 가중치가 공식적으로 공개되어 로컬 배포 및 2차 개발이 가능해졌습니다. 이러한 “API 우선, 그 다음 오픈소스” 전략은 DeepSeek이 API 서비스 제공업체로서 주된 위치를 차지하고 있음을 강조합니다.

Claude Opus 4.8에 근접한 성능, 공식 측정 결과 확인
벤치마크 결과에 따르면 시각적 기능이 추가되어도 순수 텍스트 에이전트의 성능이 크게 저하되지 않는 것으로 나타났습니다. Terminal Bench 2.1 점수는 82.7에서 83.9로 상승했으며, DeepSWE는 54.4에서 59.3으로 향상되어 Opus 4.8의 58.0을 넘어섰습니다. 다중 모드 에이전트의 성능 향상은 더욱 두드러집니다. ApexBench Pass@1은 36.5를 기록했으며, 에이전트의 Last Exam 점수는 27.3을 기록해(Opus 4.8의 25.7을 상회), ZeroBench Pass@5는 35.0을 기록하며 경쟁사의 34.0을 능가했다.
그러나 DeepSeek은 “전반적인 우위”를 주장하는 것을 피하고 있다: NL2Repo 프로젝트에서 57.7점을 기록해 Opus 4.8의 69.7점에 미치지 못했다. 공식 성명은 여전히 신중한 태도를 유지하며, “다중 모달 에이전트 성능이 Claude Opus 4.8에 근접한다”는 점만을 언급하고 있다. 최근 업데이트에 따르면 DeepSeek은 완전한 에이전트 기술 스택을 구축하고 있는 것으로 나타납니다. 모델은 추론과 도구 호출을 처리하고, Harness는 지속적인 작업 실행을 관리하며, Vision은 에이전트가 컴퓨터 시각 정보를 직접 해석할 수 있도록 지원합니다. 이번 오픈소스 공개는 이러한 생태계를 완성하는 데 있어 중요한 단계입니다.
관련 기사
미국 보건 당국, OpenAI와 Anthropic의 AI 모델 평가
전국 각지의 공중보건 기관들은 ‘건강 AI 연합(Coalition for Health AI)’이 주도하고 OpenAI, Anthropic, Accenture가 협력하는 새로운 이니셔티브를 통해 생성형 AI를 평가할 예정이다.‘공중보건 활용 사례 및 학습 확장 엔진(PULSE)’은 10개 주, 지방, 부족 및 영토 관할 구역에서 진행될 시범 사업에 자금을 지
알리페이의 ‘터치 앤 페이(Touch and Pay)’, 3,000만 개의 오프라인 접점을 AI 기반 비즈니스 네트워크로 전환
풀스택 AI 결제 시스템과 AI 기반 알리페이 어시스턴트 ‘아바오(Abao)’를 출시한 데 이어, 알리페이는 7월 8일 자사의 ‘터치 앤 페이(Touch and Pay)’ 솔루션이 포괄적인 AI 업그레이드를 거쳤다고 발표했다. 가맹점에 배치된 수백만 대의 ‘터치 앤 페이’ 기기가 ‘터치 디바이스 에이전트’로 탈바꿈했으며, 알리페이는 동시에 중소기업을 위한
Tealium: RAG 품질이 실시간 데이터에 좌우되는 이유
Tealium의 응용 AI 부문 수석 제품 관리자 프레디 베를란티(Freddy Berlanti)가 검색 강화 생성(RAG) 기술을 살펴봅니다. 이미지: 게티 이미지티알리움(Tealium)의 응용 AI 부문 수석 제품 매니저인 프레디 베를란티가, 가치를 제공하는 RAG 시스템과 사용자 신뢰를 은연중에 훼손하는 시스템 사이의 결정적인 차이를 분석한다대부분의 기
관련 특별 주제 추천
의견 (0)
0/500
DeepSeek은 Hugging Face에 DeepSeek-V4-Flash-Vision-Exp를 공개하며, MIT 라이선스 하에 V4 시리즈 최초의 실험용 다중 모달 모델을 선보였습니다. 305B 매개변수를 갖추고 V4-Flash-0731 기반을 바탕으로 구축된 이 모델은 핵심 언어 아키텍처에 시각 인코더와 Aligner를 통합하여, 지속적인 훈련을 통해 강력한 이미지 이해 능력을 발휘합니다.

단순한 이미지 설명이 아닌, 다중 모달 에이전트를 목표로
시각적 질문 응답에 중점을 둔 기존의 다중 모달 모델과 달리, DeepSeek은 Vision 버전의 목적을 재정의하여 다중 모달 에이전트 기능을 최우선으로 삼았습니다. 공식 문서에 따르면, 에이전트는 웹 스크린샷, 소프트웨어 인터페이스, 차트와 같은 시각적 입력을 직접 해석하고 도구를 호출하여 작업을 수행할 수 있습니다. 본질적으로 이 “눈”은 인간 사용자가 아닌 기계 에이전트를 위해 설계되었습니다.
이 오픈소스 패키지는 모델 가중치, 토케나이저, 프롬프트 인코딩 참조 구현, 최소한의 PyTorch 추론 설정 등을 포함하여 포괄적입니다. 또한 시각 인코더, Aligner, DFlash Attention, MoE, Hyper-Connections 등 필수 모듈을 다룹니다. 커뮤니티의 반응은 신속했으며, Hugging Face에서는 이미 llama.cpp, LM Studio, Ollama용 양자화 버전 7개가 제공되고 있습니다.
주목할 만한 일정을 살펴보면 전략적인 출시 과정을 엿볼 수 있습니다. 이 모델은 8월 21일 DeepSeek API에 처음 등장했으며, 당시에는 가중치 배포 없이 API를 통해서만 접근할 수 있었습니다. 개발자들은 텍스트와 이미지를 동시에 입력할 수 있었으며, 이미지 처리 비용은 토큰 단위로 청구되었습니다. 10일 후, 가중치가 공식적으로 공개되어 로컬 배포 및 2차 개발이 가능해졌습니다. 이러한 “API 우선, 그 다음 오픈소스” 전략은 DeepSeek이 API 서비스 제공업체로서 주된 위치를 차지하고 있음을 강조합니다.

Claude Opus 4.8에 근접한 성능, 공식 측정 결과 확인
벤치마크 결과에 따르면 시각적 기능이 추가되어도 순수 텍스트 에이전트의 성능이 크게 저하되지 않는 것으로 나타났습니다. Terminal Bench 2.1 점수는 82.7에서 83.9로 상승했으며, DeepSWE는 54.4에서 59.3으로 향상되어 Opus 4.8의 58.0을 넘어섰습니다. 다중 모드 에이전트의 성능 향상은 더욱 두드러집니다. ApexBench Pass@1은 36.5를 기록했으며, 에이전트의 Last Exam 점수는 27.3을 기록해(Opus 4.8의 25.7을 상회), ZeroBench Pass@5는 35.0을 기록하며 경쟁사의 34.0을 능가했다.
그러나 DeepSeek은 “전반적인 우위”를 주장하는 것을 피하고 있다: NL2Repo 프로젝트에서 57.7점을 기록해 Opus 4.8의 69.7점에 미치지 못했다. 공식 성명은 여전히 신중한 태도를 유지하며, “다중 모달 에이전트 성능이 Claude Opus 4.8에 근접한다”는 점만을 언급하고 있다. 최근 업데이트에 따르면 DeepSeek은 완전한 에이전트 기술 스택을 구축하고 있는 것으로 나타납니다. 모델은 추론과 도구 호출을 처리하고, Harness는 지속적인 작업 실행을 관리하며, Vision은 에이전트가 컴퓨터 시각 정보를 직접 해석할 수 있도록 지원합니다. 이번 오픈소스 공개는 이러한 생태계를 완성하는 데 있어 중요한 단계입니다.
미국 보건 당국, OpenAI와 Anthropic의 AI 모델 평가
전국 각지의 공중보건 기관들은 ‘건강 AI 연합(Coalition for Health AI)’이 주도하고 OpenAI, Anthropic, Accenture가 협력하는 새로운 이니셔티브를 통해 생성형 AI를 평가할 예정이다.‘공중보건 활용 사례 및 학습 확장 엔진(PULSE)’은 10개 주, 지방, 부족 및 영토 관할 구역에서 진행될 시범 사업에 자금을 지
알리페이의 ‘터치 앤 페이(Touch and Pay)’, 3,000만 개의 오프라인 접점을 AI 기반 비즈니스 네트워크로 전환
풀스택 AI 결제 시스템과 AI 기반 알리페이 어시스턴트 ‘아바오(Abao)’를 출시한 데 이어, 알리페이는 7월 8일 자사의 ‘터치 앤 페이(Touch and Pay)’ 솔루션이 포괄적인 AI 업그레이드를 거쳤다고 발표했다. 가맹점에 배치된 수백만 대의 ‘터치 앤 페이’ 기기가 ‘터치 디바이스 에이전트’로 탈바꿈했으며, 알리페이는 동시에 중소기업을 위한
Tealium: RAG 품질이 실시간 데이터에 좌우되는 이유
Tealium의 응용 AI 부문 수석 제품 관리자 프레디 베를란티(Freddy Berlanti)가 검색 강화 생성(RAG) 기술을 살펴봅니다. 이미지: 게티 이미지티알리움(Tealium)의 응용 AI 부문 수석 제품 매니저인 프레디 베를란티가, 가치를 제공하는 RAG 시스템과 사용자 신뢰를 은연중에 훼손하는 시스템 사이의 결정적인 차이를 분석한다대부분의 기





집






