微软必应团队将27B嵌入式模型“Harrier”开源,在多语言基准测试中名列前茅
4月7日,微软Bing团队宣布开源了一款名为“Harrier”的新词向量模型系列,旨在重塑全球搜索、检索和AI代理的基础逻辑。 Harrier系列包含三个版本,其中旗舰型号27B在多语言MTEB v2基准测试中超越了OpenAI、亚马逊和谷歌Gemini的主要专有模型,稳居榜首。

该模型的技术基础体现了严格的行业标准:Harrier支持100多种语言,上下文窗口长度可达32,000个令牌。在训练过程中,微软使用了超过20亿个真实世界示例,并整合了来自GPT-5的合成数据用于强化学习。 这种高质量的数据组合使 Harrier 在理解复杂语境和处理长文本方面具有显著优势。除完整的 27B 参数版本外,微软还发布了 0.6B 和 2.7B 两个较小规模的变体,以适应不同的计算环境,所有版本均已根据 MIT 许可证在 Hugging Face 上开源。
嵌入模型对于AI系统中的信息组织和检索至关重要,其性能直接影响RAG(检索增强生成)系统的准确性。微软计划将这项技术集成到Bing搜索引擎和新的AI代理接地服务中。 随着人工智能向更自主、多步骤的任务发展,Harrier的开源不仅为开发者提供了替代专有模型的高性能选择,也标志着语义表示领域开源生态系统的一个重要里程碑,将进一步加速AI代理在多语言全球环境中的部署。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (1)
0/500
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀
4月7日,微软Bing团队宣布开源了一款名为“Harrier”的新词向量模型系列,旨在重塑全球搜索、检索和AI代理的基础逻辑。 Harrier系列包含三个版本,其中旗舰型号27B在多语言MTEB v2基准测试中超越了OpenAI、亚马逊和谷歌Gemini的主要专有模型,稳居榜首。

该模型的技术基础体现了严格的行业标准:Harrier支持100多种语言,上下文窗口长度可达32,000个令牌。在训练过程中,微软使用了超过20亿个真实世界示例,并整合了来自GPT-5的合成数据用于强化学习。 这种高质量的数据组合使 Harrier 在理解复杂语境和处理长文本方面具有显著优势。除完整的 27B 参数版本外,微软还发布了 0.6B 和 2.7B 两个较小规模的变体,以适应不同的计算环境,所有版本均已根据 MIT 许可证在 Hugging Face 上开源。
嵌入模型对于AI系统中的信息组织和检索至关重要,其性能直接影响RAG(检索增强生成)系统的准确性。微软计划将这项技术集成到Bing搜索引擎和新的AI代理接地服务中。 随着人工智能向更自主、多步骤的任务发展,Harrier的开源不仅为开发者提供了替代专有模型的高性能选择,也标志着语义表示领域开源生态系统的一个重要里程碑,将进一步加速AI代理在多语言全球环境中的部署。
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
Finally, an open-source embedding model that actually challenges the big players! Harrier's 27B parameters look promising for multilingual tasks, especially if it improves retrieval accuracy without the usual proprietary lock-in. Microsoft is pushing boundaries here, but let's see how it performs in real-world edge cases. Excited to test it out on some niche datasets! 🚀





首页






