Lar
A equipe do Microsoft Bing torna o modelo de incorporação Harrier, de 27 bilhões de parâmetros, de código aberto, liderando os benchmarks multilíngues
Em 7 de abril, a equipe do Bing da Microsoft anunciou o lançamento em código aberto de uma nova série de modelos de embedding de palavras chamada “Harrier”, projetada para redefinir a lógica subjacente à pesquisa global, à recuperação de informações e aos agentes de IA. A série Harrier inclui três versões, sendo que o modelo principal, o 27B, superou os principais modelos proprietários da OpenAI, Amazon e Google Gemini no benchmark multilíngue MTEB v2, garantindo o primeiro lugar.

A base técnica desse modelo reflete sólidos padrões industriais: o Harrier suporta mais de 100 idiomas com uma janela de contexto de até 32.000 tokens. Para o treinamento, a Microsoft utilizou mais de 2 bilhões de exemplos do mundo real e incorporou dados sintéticos do GPT-5 para o aprendizado por reforço. Essa combinação de dados de alta qualidade confere ao Harrier uma vantagem distinta na compreensão de contextos complexos e no tratamento de textos longos. Além da versão completa com 27 bilhões de parâmetros, a Microsoft também lançou variantes menores, de 0,6 bilhão e 2,7 bilhões, para se adequar a diferentes ambientes de computação, todas disponibilizadas como código aberto no Hugging Face sob a licença MIT.
Modelos de embedding são essenciais para organizar e recuperar informações em sistemas de IA, e seu desempenho afeta diretamente a precisão dos sistemas RAG (Retrieval-Augmented Generation). A Microsoft pretende integrar essa tecnologia ao mecanismo de busca Bing e a novos serviços de grounding de agentes de IA. À medida que a IA avança em direção a tarefas mais autônomas e com várias etapas, a disponibilização do Harrier como código aberto não apenas oferece aos desenvolvedores uma alternativa de alto desempenho aos modelos proprietários, mas também marca um marco significativo para o ecossistema de código aberto na representação semântica, acelerando ainda mais a implantação de agentes de IA em ambientes globais multilíngues.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (1)
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
Em 7 de abril, a equipe do Bing da Microsoft anunciou o lançamento em código aberto de uma nova série de modelos de embedding de palavras chamada “Harrier”, projetada para redefinir a lógica subjacente à pesquisa global, à recuperação de informações e aos agentes de IA. A série Harrier inclui três versões, sendo que o modelo principal, o 27B, superou os principais modelos proprietários da OpenAI, Amazon e Google Gemini no benchmark multilíngue MTEB v2, garantindo o primeiro lugar.

A base técnica desse modelo reflete sólidos padrões industriais: o Harrier suporta mais de 100 idiomas com uma janela de contexto de até 32.000 tokens. Para o treinamento, a Microsoft utilizou mais de 2 bilhões de exemplos do mundo real e incorporou dados sintéticos do GPT-5 para o aprendizado por reforço. Essa combinação de dados de alta qualidade confere ao Harrier uma vantagem distinta na compreensão de contextos complexos e no tratamento de textos longos. Além da versão completa com 27 bilhões de parâmetros, a Microsoft também lançou variantes menores, de 0,6 bilhão e 2,7 bilhões, para se adequar a diferentes ambientes de computação, todas disponibilizadas como código aberto no Hugging Face sob a licença MIT.
Modelos de embedding são essenciais para organizar e recuperar informações em sistemas de IA, e seu desempenho afeta diretamente a precisão dos sistemas RAG (Retrieval-Augmented Generation). A Microsoft pretende integrar essa tecnologia ao mecanismo de busca Bing e a novos serviços de grounding de agentes de IA. À medida que a IA avança em direção a tarefas mais autônomas e com várias etapas, a disponibilização do Harrier como código aberto não apenas oferece aos desenvolvedores uma alternativa de alto desempenho aos modelos proprietários, mas também marca um marco significativo para o ecossistema de código aberto na representação semântica, acelerando ainda mais a implantação de agentes de IA em ambientes globais multilíngues.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀











