Google Gemini Embedding 2 作为首个全多模态模型正式亮相
谷歌于2026年3月10日左右正式发布了Gemini Embedding 2。这是该公司首个基于Gemini架构构建的完全多模态嵌入模型。该模型现已通过Gemini API和Vertex AI开放公测,开发者可立即调用并进行测试。
打破模态壁垒的统一嵌入空间
Gemini Embedding 2 的核心创新在于其能够将多种数据类型——包括文本、图像、视频、音频以及 PDF 等文档——映射到单一、统一的嵌入向量空间中。这种设计全面支持跨模态检索和分类,支持超过 100 种语言,并使不同类型的数据能够真正“通晓同一语言”。

混合输入能力实现精准语义理解
该模型原生支持混合模态输入,例如图像与文本的组合,或视频与音频的结合。它能够深度理解不同媒体类型之间的语义关系,而非仅仅并行处理,从而在多媒体内容理解方面实现了质的飞跃。
无需ASR转录的原生音频处理
另一项重大突破是其直接音频嵌入功能。用户可直接输入原始音频文件,模型无需事先进行语音转文本(ASR)转换,即可输出高质量的嵌入向量。这显著简化了多模态数据工作流,同时降低了延迟和计算成本。
广泛的应用场景开启RAG新时代
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (0)
0/500
谷歌于2026年3月10日左右正式发布了Gemini Embedding 2。这是该公司首个基于Gemini架构构建的完全多模态嵌入模型。该模型现已通过Gemini API和Vertex AI开放公测,开发者可立即调用并进行测试。
打破模态壁垒的统一嵌入空间
Gemini Embedding 2 的核心创新在于其能够将多种数据类型——包括文本、图像、视频、音频以及 PDF 等文档——映射到单一、统一的嵌入向量空间中。这种设计全面支持跨模态检索和分类,支持超过 100 种语言,并使不同类型的数据能够真正“通晓同一语言”。

混合输入能力实现精准语义理解
该模型原生支持混合模态输入,例如图像与文本的组合,或视频与音频的结合。它能够深度理解不同媒体类型之间的语义关系,而非仅仅并行处理,从而在多媒体内容理解方面实现了质的飞跃。
无需ASR转录的原生音频处理
另一项重大突破是其直接音频嵌入功能。用户可直接输入原始音频文件,模型无需事先进行语音转文本(ASR)转换,即可输出高质量的嵌入向量。这显著简化了多模态数据工作流,同时降低了延迟和计算成本。
广泛的应用场景开启RAG新时代
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






