Maison
L'équipe Microsoft Bing open source le modèle d'intégration « Harrier » (27 milliards de paramètres), qui arrive en tête des tests de performance multilingues
Le 7 avril, l'équipe Bing de Microsoft a annoncé la mise à disposition en open source d'une nouvelle série de modèles d'embedding de mots baptisée « Harrier », conçue pour redéfinir la logique sous-jacente de la recherche globale, de l'extraction d'informations et des agents d'IA. La série Harrier comprend trois versions, dont le modèle phare 27B qui surpasse les principaux modèles propriétaires d’OpenAI, d’Amazon et de Google Gemini dans le benchmark multilingue MTEB v2, s’adjugeant ainsi la première place.

Les fondements techniques de ce modèle reflètent des normes industrielles rigoureuses : Harrier prend en charge plus de 100 langues avec une fenêtre contextuelle pouvant atteindre 32 000 tokens. Pour l’entraînement, Microsoft a utilisé plus de 2 milliards d’exemples issus du monde réel et a intégré des données synthétiques provenant de GPT-5 pour l’apprentissage par renforcement. Ce mélange de données de haute qualité confère à Harrier un avantage certain pour comprendre des contextes complexes et traiter des textes longs. Outre la version complète à 27 milliards de paramètres, Microsoft a également publié des variantes plus légères à 0,6 milliard et 2,7 milliards de paramètres afin de s’adapter à différents environnements informatiques ; toutes sont disponibles en open source sur Hugging Face sous licence MIT.
Les modèles d’encodage sont essentiels pour organiser et extraire des informations dans les systèmes d’IA, et leurs performances ont un impact direct sur la précision des systèmes RAG (Retrieval-Augmented Generation). Microsoft a l’intention d’intégrer cette technologie au moteur de recherche Bing et à de nouveaux services d’ancrage d’agents IA. Alors que l’IA évolue vers des tâches plus autonomes et comportant plusieurs étapes, la mise en open source de Harrier offre non seulement aux développeurs une alternative haute performance aux modèles propriétaires, mais marque également une étape importante pour l’écosystème open source dans le domaine de la représentation sémantique, accélérant ainsi davantage le déploiement d’agents IA dans des environnements multilingues à l’échelle mondiale.
Article connexe
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Conformité des véhicules autonomes en Californie : une nouvelle ère marquée par les amendes, les zones de géolocalisation et 1 million de miles
Guident exploite une navette AuveTech dans le sud de la Floride, gérant un parcours de quatre miles à West Palm Beach et un parcours d’un mile à Boca Raton grâce à sa technologie de surveillance à dis
Recommandations de sujets spéciaux liés
commentaires (1)
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
Le 7 avril, l'équipe Bing de Microsoft a annoncé la mise à disposition en open source d'une nouvelle série de modèles d'embedding de mots baptisée « Harrier », conçue pour redéfinir la logique sous-jacente de la recherche globale, de l'extraction d'informations et des agents d'IA. La série Harrier comprend trois versions, dont le modèle phare 27B qui surpasse les principaux modèles propriétaires d’OpenAI, d’Amazon et de Google Gemini dans le benchmark multilingue MTEB v2, s’adjugeant ainsi la première place.

Les fondements techniques de ce modèle reflètent des normes industrielles rigoureuses : Harrier prend en charge plus de 100 langues avec une fenêtre contextuelle pouvant atteindre 32 000 tokens. Pour l’entraînement, Microsoft a utilisé plus de 2 milliards d’exemples issus du monde réel et a intégré des données synthétiques provenant de GPT-5 pour l’apprentissage par renforcement. Ce mélange de données de haute qualité confère à Harrier un avantage certain pour comprendre des contextes complexes et traiter des textes longs. Outre la version complète à 27 milliards de paramètres, Microsoft a également publié des variantes plus légères à 0,6 milliard et 2,7 milliards de paramètres afin de s’adapter à différents environnements informatiques ; toutes sont disponibles en open source sur Hugging Face sous licence MIT.
Les modèles d’encodage sont essentiels pour organiser et extraire des informations dans les systèmes d’IA, et leurs performances ont un impact direct sur la précision des systèmes RAG (Retrieval-Augmented Generation). Microsoft a l’intention d’intégrer cette technologie au moteur de recherche Bing et à de nouveaux services d’ancrage d’agents IA. Alors que l’IA évolue vers des tâches plus autonomes et comportant plusieurs étapes, la mise en open source de Harrier offre non seulement aux développeurs une alternative haute performance aux modèles propriétaires, mais marque également une étape importante pour l’écosystème open source dans le domaine de la représentation sémantique, accélérant ainsi davantage le déploiement d’agents IA dans des environnements multilingues à l’échelle mondiale.
PDG de DeepMind, Hassabis : Je dors six heures par jour et je me sens généralement plein d’énergie vers 1 h du matin.
Fortune a récemment publié une interview avec Demis Hassabis, PDG de Google DeepMind, révélant son approche non conventionnelle du repos et de la productivité. Hassabis a divulgué qu’il dort très peu, structurant ses heures d’éveil en deux blocs de t
OpenAI et Anthropic se disputent des parts de marché malgré des résultats en deçà des attentes
Bien que des informations récentes laissent entendre qu’OpenAI n’aurait pas atteint ses objectifs de chiffre d’affaires, ce qui a pesé sur les valeurs technologiques ce mardi, les investisseurs privés
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀











