谷歌借助先进的多模态RAG功能增强了Gemini API的文件搜索能力
谷歌对其Gemini API的文件搜索功能进行了重大升级,为开发者提供了增强型多模态检索增强生成(RAG)能力。此次更新突破了传统纯文本检索的局限,使人工智能能够解读图像并与复杂文档深度融合——这是企业级人工智能在信息检索准确性方面迈出的关键一步。
从技术角度来看,新的文件搜索功能基于 Gemini Embedding2 模型。与仅限于文本向量搜索的早期系统不同,升级后的系统采用了统一的多模态嵌入技术,能够识别和处理 PDF、文档以及各类图像中的视觉内容。 这意味着开发者无需再构建复杂的向量数据库或文档分割系统;他们可直接在 Gemini API 内实现完整的 RAG 工作流——从数据上传到信息检索。

在实际应用中,这一进步解决了常见的痛点:传统 RAG 系统往往无法处理非文本内容。此前,文档中的图表、设计图或产品截图都是 AI 的盲区,导致关键上下文信息被遗漏。 如今,Gemini API 已原生支持这些视觉元素。例如,当企业上传包含技术架构图或销售趋势图表的 PDF 文件时,AI 能够将图表数据与文本描述相结合,从而提供准确的洞察,这极大地提升了客户服务机器人和文档分析系统的实用性。
为了改进大型知识库的管理,谷歌新增了自定义元数据过滤功能。开发者可以按部门、时间或类别对文件进行标记,并在检索时使用预定义条件过滤掉无关信息,从而确保 AI 生成的答案更加精准。
此外,为解决信息可追溯性方面的担忧,Gemini API 现已支持页面级引用。在生成答案时,AI 会明确标注每条信息的具体页码,而非仅引用整个文件。这种透明度有助于用户快速验证准确性,并促进更深入的阅读。
这项增强的文件搜索功能现已面向全球开发者开放。用户可通过 Google AI Studio 或 Google Cloud 平台访问该功能,亲身体验多模态 RAG 带来的开发便利与效率提升。
相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
评论 (0)
0/500
谷歌对其Gemini API的文件搜索功能进行了重大升级,为开发者提供了增强型多模态检索增强生成(RAG)能力。此次更新突破了传统纯文本检索的局限,使人工智能能够解读图像并与复杂文档深度融合——这是企业级人工智能在信息检索准确性方面迈出的关键一步。
从技术角度来看,新的文件搜索功能基于 Gemini Embedding2 模型。与仅限于文本向量搜索的早期系统不同,升级后的系统采用了统一的多模态嵌入技术,能够识别和处理 PDF、文档以及各类图像中的视觉内容。 这意味着开发者无需再构建复杂的向量数据库或文档分割系统;他们可直接在 Gemini API 内实现完整的 RAG 工作流——从数据上传到信息检索。

在实际应用中,这一进步解决了常见的痛点:传统 RAG 系统往往无法处理非文本内容。此前,文档中的图表、设计图或产品截图都是 AI 的盲区,导致关键上下文信息被遗漏。 如今,Gemini API 已原生支持这些视觉元素。例如,当企业上传包含技术架构图或销售趋势图表的 PDF 文件时,AI 能够将图表数据与文本描述相结合,从而提供准确的洞察,这极大地提升了客户服务机器人和文档分析系统的实用性。
为了改进大型知识库的管理,谷歌新增了自定义元数据过滤功能。开发者可以按部门、时间或类别对文件进行标记,并在检索时使用预定义条件过滤掉无关信息,从而确保 AI 生成的答案更加精准。
此外,为解决信息可追溯性方面的担忧,Gemini API 现已支持页面级引用。在生成答案时,AI 会明确标注每条信息的具体页码,而非仅引用整个文件。这种透明度有助于用户快速验证准确性,并促进更深入的阅读。
这项增强的文件搜索功能现已面向全球开发者开放。用户可通过 Google AI Studio 或 Google Cloud 平台访问该功能,亲身体验多模态 RAG 带来的开发便利与效率提升。
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护
彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业





首页






