谷歌发布Gemini Embedding2:原生多模态模型实现语义空间统一
谷歌近日发布了其全新的原生多模态嵌入模型——Gemini Embedding2。该模型能够将文本、图像、视频、音频和PDF文档映射到一个共享的语义向量空间中,旨在简化复杂的AI数据工作流,并提升多模态检索与理解能力。这标志着谷歌在嵌入技术领域取得了一项重大突破,实现了从单模态文本向统一多模态语义建模的转变。

此前,在2025年7月,谷歌推出了gemini-embedding-001文本嵌入模型。该模型支持100多种语言,并在MTEB多语言基准测试中取得了顶尖成绩。 全新的 Gemini Embedding2 在 Gemini 架构基础上进行了显著扩展。它现可处理文本、图像、视频、音频和 PDF 这五种不同模态,并将它们映射到单一向量空间中。这使得不同类型媒体之间能够进行直接的语义比较,无需多个专用模型或额外的处理步骤。这一能力对于语义搜索、检索增强生成(RAG)、情感分析和数据聚类等应用尤为宝贵。
在输入能力方面,新模型支持多达 8192 个文本令牌,是此前 2048 个令牌限制的四倍。它每条请求可处理多达六张 PNG 或 JPEG 图片、最长 120 秒的视频,以及最多六页的 PDF 文档。 值得注意的是,Gemini Embedding2原生支持音频处理,无需进行语音转文本转换,从而避免了转录过程中可能造成的信息丢失。谷歌还引入了“交错输入”技术,允许开发者在单次请求中混合多种模态——例如将图像与描述性文本结合——以更好地捕捉它们之间的语义关系。

在架构上,该模型继续采用“套娃式表征学习”(MRL)。该技术利用分层结构动态调整向量维度。默认嵌入维度为 3072,并提供 1536 和 768 两种可选配置,使开发者能够灵活地在检索准确性和存储效率之间取得平衡。
谷歌的基准测试结果表明,Gemini Embedding2 在文本、图像、视频和语音任务中均表现优异。例如,在文本-视频检索任务中,其得分达到 68.8,超越了亚马逊 Nova2 多模态嵌入(60.3)和 Voyage Multimodal3.5(55.2)。 在文本-图像检索方面,其得分达到93.4,显著领先于亚马逊模型84.0的得分。
开发者目前可通过Gemini API和Vertex AI 访问 Gemini Embedding2。该模型已集成至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 和 Vector Search 等主流框架及向量数据库。为帮助开发者快速入门,Google 提供了交互式 Colab 笔记本和轻量级多模态语义搜索演示。

多模态嵌入领域的竞争日益白热化。值得注意的是,今年2月下旬,AI搜索引擎Perplexity发布了其开源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (0)
0/500
谷歌近日发布了其全新的原生多模态嵌入模型——Gemini Embedding2。该模型能够将文本、图像、视频、音频和PDF文档映射到一个共享的语义向量空间中,旨在简化复杂的AI数据工作流,并提升多模态检索与理解能力。这标志着谷歌在嵌入技术领域取得了一项重大突破,实现了从单模态文本向统一多模态语义建模的转变。

此前,在2025年7月,谷歌推出了gemini-embedding-001文本嵌入模型。该模型支持100多种语言,并在MTEB多语言基准测试中取得了顶尖成绩。 全新的 Gemini Embedding2 在 Gemini 架构基础上进行了显著扩展。它现可处理文本、图像、视频、音频和 PDF 这五种不同模态,并将它们映射到单一向量空间中。这使得不同类型媒体之间能够进行直接的语义比较,无需多个专用模型或额外的处理步骤。这一能力对于语义搜索、检索增强生成(RAG)、情感分析和数据聚类等应用尤为宝贵。
在输入能力方面,新模型支持多达 8192 个文本令牌,是此前 2048 个令牌限制的四倍。它每条请求可处理多达六张 PNG 或 JPEG 图片、最长 120 秒的视频,以及最多六页的 PDF 文档。 值得注意的是,Gemini Embedding2原生支持音频处理,无需进行语音转文本转换,从而避免了转录过程中可能造成的信息丢失。谷歌还引入了“交错输入”技术,允许开发者在单次请求中混合多种模态——例如将图像与描述性文本结合——以更好地捕捉它们之间的语义关系。

在架构上,该模型继续采用“套娃式表征学习”(MRL)。该技术利用分层结构动态调整向量维度。默认嵌入维度为 3072,并提供 1536 和 768 两种可选配置,使开发者能够灵活地在检索准确性和存储效率之间取得平衡。
谷歌的基准测试结果表明,Gemini Embedding2 在文本、图像、视频和语音任务中均表现优异。例如,在文本-视频检索任务中,其得分达到 68.8,超越了亚马逊 Nova2 多模态嵌入(60.3)和 Voyage Multimodal3.5(55.2)。 在文本-图像检索方面,其得分达到93.4,显著领先于亚马逊模型84.0的得分。
开发者目前可通过Gemini API和Vertex AI 访问 Gemini Embedding2。该模型已集成至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 和 Vector Search 等主流框架及向量数据库。为帮助开发者快速入门,Google 提供了交互式 Colab 笔记本和轻量级多模态语义搜索演示。

多模态嵌入领域的竞争日益白热化。值得注意的是,今年2月下旬,AI搜索引擎Perplexity发布了其开源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强





首页






