Hogar
El equipo de Microsoft Bing publica en código abierto el modelo de incrustación «Harrier», de 27 mil millones de parámetros, que lidera las pruebas comparativas multilingües
El 7 de abril, el equipo de Bing de Microsoft anunció el lanzamiento en código abierto de una nueva serie de modelos de incrustación de palabras denominada «Harrier», diseñada para redefinir la lógica subyacente de la búsqueda global, la recuperación de información y los agentes de IA. La serie Harrier incluye tres versiones, y su modelo insignia, el 27B, ha superado a los principales modelos propietarios de OpenAI, Amazon y Google Gemini en la prueba de rendimiento multilingüe MTEB v2, asegurándose el primer puesto.

La base técnica de este modelo refleja unos sólidos estándares industriales: Harrier admite más de 100 idiomas con una ventana de contexto de hasta 32 000 tokens. Para el entrenamiento, Microsoft utilizó más de 2 000 millones de ejemplos del mundo real e incorporó datos sintéticos de GPT-5 para el aprendizaje por refuerzo. Esta combinación de datos de alta calidad confiere a Harrier una ventaja distintiva a la hora de comprender contextos complejos y gestionar textos largos. Además de la versión completa de 27 000 millones de parámetros, Microsoft también ha lanzado variantes más pequeñas de 600 millones y 2 700 millones para adaptarse a diferentes entornos informáticos, todas ellas de código abierto en Hugging Face bajo la licencia MIT.
Los modelos de incrustación son esenciales para organizar y recuperar información en los sistemas de IA, y su rendimiento influye directamente en la precisión de los sistemas RAG (Retrieval-Augmented Generation, o generación aumentada por recuperación). Microsoft tiene la intención de integrar esta tecnología en el motor de búsqueda Bing y en los nuevos servicios de contextualización de agentes de IA. A medida que la IA avanza hacia tareas más autónomas y de varios pasos, la publicación de Harrier como código abierto no solo ofrece a los desarrolladores una alternativa de alto rendimiento a los modelos propietarios, sino que también supone un hito significativo para el ecosistema de código abierto en el ámbito de la representación semántica, lo que acelera aún más el despliegue de agentes de IA en entornos globales multilingües.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
El 7 de abril, el equipo de Bing de Microsoft anunció el lanzamiento en código abierto de una nueva serie de modelos de incrustación de palabras denominada «Harrier», diseñada para redefinir la lógica subyacente de la búsqueda global, la recuperación de información y los agentes de IA. La serie Harrier incluye tres versiones, y su modelo insignia, el 27B, ha superado a los principales modelos propietarios de OpenAI, Amazon y Google Gemini en la prueba de rendimiento multilingüe MTEB v2, asegurándose el primer puesto.

La base técnica de este modelo refleja unos sólidos estándares industriales: Harrier admite más de 100 idiomas con una ventana de contexto de hasta 32 000 tokens. Para el entrenamiento, Microsoft utilizó más de 2 000 millones de ejemplos del mundo real e incorporó datos sintéticos de GPT-5 para el aprendizaje por refuerzo. Esta combinación de datos de alta calidad confiere a Harrier una ventaja distintiva a la hora de comprender contextos complejos y gestionar textos largos. Además de la versión completa de 27 000 millones de parámetros, Microsoft también ha lanzado variantes más pequeñas de 600 millones y 2 700 millones para adaptarse a diferentes entornos informáticos, todas ellas de código abierto en Hugging Face bajo la licencia MIT.
Los modelos de incrustación son esenciales para organizar y recuperar información en los sistemas de IA, y su rendimiento influye directamente en la precisión de los sistemas RAG (Retrieval-Augmented Generation, o generación aumentada por recuperación). Microsoft tiene la intención de integrar esta tecnología en el motor de búsqueda Bing y en los nuevos servicios de contextualización de agentes de IA. A medida que la IA avanza hacia tareas más autónomas y de varios pasos, la publicación de Harrier como código abierto no solo ofrece a los desarrolladores una alternativa de alto rendimiento a los modelos propietarios, sino que también supone un hito significativo para el ecosistema de código abierto en el ámbito de la representación semántica, lo que acelera aún más el despliegue de agentes de IA en entornos globales multilingües.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀











