마이크로소프트 빙 팀, 27B 임베딩 모델 ‘해리어(Harrier)’를 오픈소스로 공개하며 다국어 벤치마크에서 선두를 달리고 있다
4월 7일, 마이크로소프트의 빙(Bing) 팀은 전 세계적인 검색, 정보 검색 및 AI 에이전트의 기본 논리를 재구축하기 위해 설계된 “해리어(Harrier)”라는 새로운 단어 임베딩 모델 시리즈를 오픈소스로 공개한다고 발표했다. 해리어 시리즈는 세 가지 버전으로 구성되어 있으며, 그 중 주력 모델인 27B 모델은 다국어 MTEB v2 벤치마크에서 OpenAI, 아마존, 구글 제미니의 주요 독점 모델들을 제치고 1위를 차지했습니다.

이 모델의 기술적 기반은 강력한 산업 표준을 반영하고 있습니다. 해리어는 최대 32,000개의 토큰으로 구성된 컨텍스트 윈도우를 통해 100개 이상의 언어를 지원합니다. 훈련 과정에서 마이크로소프트는 20억 개 이상의 실제 사례를 활용했으며, 강화 학습을 위해 GPT-5의 합성 데이터를 통합했습니다. 이러한 고품질 데이터 조합 덕분에 해리어는 복잡한 문맥을 이해하고 긴 텍스트를 처리하는 데 뚜렷한 이점을 갖습니다. 마이크로소프트는 27B 매개변수 풀 버전과 더불어 다양한 컴퓨팅 환경에 대응하기 위해 더 작은 규모의 0.6B 및 2.7B 변형 모델도 출시했으며, 이 모든 모델은 MIT 라이선스 하에 Hugging Face에 오픈소스로 공개되었습니다.
임베딩 모델은 AI 시스템에서 정보를 구성하고 검색하는 데 필수적이며, 그 성능은 RAG(Retrieval-Augmented Generation, 검색 강화 생성) 시스템의 정확도에 직접적인 영향을 미칩니다. 마이크로소프트는 이 기술을 Bing 검색 엔진과 새로운 AI 에이전트 그라운딩 서비스에 통합할 계획입니다. AI가 더욱 자율적이고 다단계적인 작업으로 발전함에 따라, Harrier의 오픈소스화는 개발자들에게 독점 모델에 대한 고성능 대안을 제공할 뿐만 아니라, 의미 표현 분야의 오픈소스 생태계에 있어 중요한 이정표가 되며, 다국어 글로벌 환경에서의 AI 에이전트 배포를 더욱 가속화할 것입니다.
관련 기사
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
관련 특별 주제 추천
의견 (1)
0/500
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
4월 7일, 마이크로소프트의 빙(Bing) 팀은 전 세계적인 검색, 정보 검색 및 AI 에이전트의 기본 논리를 재구축하기 위해 설계된 “해리어(Harrier)”라는 새로운 단어 임베딩 모델 시리즈를 오픈소스로 공개한다고 발표했다. 해리어 시리즈는 세 가지 버전으로 구성되어 있으며, 그 중 주력 모델인 27B 모델은 다국어 MTEB v2 벤치마크에서 OpenAI, 아마존, 구글 제미니의 주요 독점 모델들을 제치고 1위를 차지했습니다.

이 모델의 기술적 기반은 강력한 산업 표준을 반영하고 있습니다. 해리어는 최대 32,000개의 토큰으로 구성된 컨텍스트 윈도우를 통해 100개 이상의 언어를 지원합니다. 훈련 과정에서 마이크로소프트는 20억 개 이상의 실제 사례를 활용했으며, 강화 학습을 위해 GPT-5의 합성 데이터를 통합했습니다. 이러한 고품질 데이터 조합 덕분에 해리어는 복잡한 문맥을 이해하고 긴 텍스트를 처리하는 데 뚜렷한 이점을 갖습니다. 마이크로소프트는 27B 매개변수 풀 버전과 더불어 다양한 컴퓨팅 환경에 대응하기 위해 더 작은 규모의 0.6B 및 2.7B 변형 모델도 출시했으며, 이 모든 모델은 MIT 라이선스 하에 Hugging Face에 오픈소스로 공개되었습니다.
임베딩 모델은 AI 시스템에서 정보를 구성하고 검색하는 데 필수적이며, 그 성능은 RAG(Retrieval-Augmented Generation, 검색 강화 생성) 시스템의 정확도에 직접적인 영향을 미칩니다. 마이크로소프트는 이 기술을 Bing 검색 엔진과 새로운 AI 에이전트 그라운딩 서비스에 통합할 계획입니다. AI가 더욱 자율적이고 다단계적인 작업으로 발전함에 따라, Harrier의 오픈소스화는 개발자들에게 독점 모델에 대한 고성능 대안을 제공할 뿐만 아니라, 의미 표현 분야의 오픈소스 생태계에 있어 중요한 이정표가 되며, 다국어 글로벌 환경에서의 AI 에이전트 배포를 더욱 가속화할 것입니다.
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀





집






