腾讯发布OpenSearch-VL:开源多模态深度搜索代理
随着多模态大型语言模型(MLLM)的快速发展,人工智能竞赛中的关键挑战正从单纯的“被动理解图像”转向主动寻找证据和进行推理。 然而,由于缺乏高质量的训练数据、自动化的轨迹合成管道以及详细的训练方案,开源社区难以复现顶尖的多模态搜索代理。
为突破这一瓶颈,腾讯混元研究团队联合加州大学洛杉矶分校(UCLA)和香港中文大学,共同推出了OpenSearch-VL。这一完全开源的蓝图,为通过强化学习(RL)构建最先进的深度搜索代理提供了路径。

创新的数据管道突破搜索瓶颈
研究团队将高质量训练数据视为模型进步的主要瓶颈。为了训练能够进行多步推理(而非简单的单击图像识别)的模型,他们设计了一条细致的数据整合管道。
该管道从维基百科的超链接图中采样路径,将复杂的实体关系转换为多跳问答对。为防止“捷径学习”,研究人员采用了模糊实体重写技术来隐藏直接答案,并集成了锚定于源代码的视觉定位功能。 这种方法迫使模型首先检测视觉信号,然后利用外部工具迭代检索信息,从而防止在检索过程中技能退化。 最终,该团队构建了SearchVL-SFT数据库(包含36,000条指令微调轨迹)和SearchVL-RL数据库(包含8,000条强化学习轨迹)。
超越简单搜索的多功能工具集
OpenSearch-VL 超越了基本的文本搜索。在实际应用中,用户提供的图像往往模糊、失真或分辨率较低,导致传统搜索工具无法有效工作。
为解决这一问题,该项目整合了一套丰富的工具:网页搜索、反向图像搜索、OCR、图像裁剪、锐化、超分辨率和透视校正。该智能体在查询外部知识之前,会像人类一样主动感知并纠正不完美的视觉信息,从而确保后续搜索的可靠性。
故障感知算法实现从错误中学习
在长周期任务中,工具调用可能引发连锁故障。一次超时或错误就可能导致整个任务脱轨。传统的强化学习(RL)通常会丢弃这些失败的轨迹,从而浪费训练资源。
OpenSearch-VL 引入了多轮故障感知 GRPO(Multi-round Fault-Aware GRPO)训练算法,该算法能够识别工具调用中的关键故障点。它利用掩码技术过滤掉故障后的无效信息,并应用单侧优势裁剪,以保留早期步骤中有用的逻辑。 这样,即使最终结果是失败,模型仍能从前阶段学习到有效的搜索路径和探索策略。
实验结果可与商业专有模型媲美
评估结果表明,该模型在七个主流多模态深度搜索基准测试中均表现优异,平均提升幅度超过 10 个百分点。在某些特定任务上,OpenSearch-VL 已经可与顶尖的闭源商业模型媲美。
研究团队计划将 OpenSearch-VL 的所有训练数据、代码和模型权重完全开源,为全球开发者提供一个可复现且可改进的基础,从而推动多模态智能体研究迈向更深层次。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
随着多模态大型语言模型(MLLM)的快速发展,人工智能竞赛中的关键挑战正从单纯的“被动理解图像”转向主动寻找证据和进行推理。 然而,由于缺乏高质量的训练数据、自动化的轨迹合成管道以及详细的训练方案,开源社区难以复现顶尖的多模态搜索代理。
为突破这一瓶颈,腾讯混元研究团队联合加州大学洛杉矶分校(UCLA)和香港中文大学,共同推出了OpenSearch-VL。这一完全开源的蓝图,为通过强化学习(RL)构建最先进的深度搜索代理提供了路径。

创新的数据管道突破搜索瓶颈
研究团队将高质量训练数据视为模型进步的主要瓶颈。为了训练能够进行多步推理(而非简单的单击图像识别)的模型,他们设计了一条细致的数据整合管道。
该管道从维基百科的超链接图中采样路径,将复杂的实体关系转换为多跳问答对。为防止“捷径学习”,研究人员采用了模糊实体重写技术来隐藏直接答案,并集成了锚定于源代码的视觉定位功能。 这种方法迫使模型首先检测视觉信号,然后利用外部工具迭代检索信息,从而防止在检索过程中技能退化。 最终,该团队构建了SearchVL-SFT数据库(包含36,000条指令微调轨迹)和SearchVL-RL数据库(包含8,000条强化学习轨迹)。
超越简单搜索的多功能工具集
OpenSearch-VL 超越了基本的文本搜索。在实际应用中,用户提供的图像往往模糊、失真或分辨率较低,导致传统搜索工具无法有效工作。
为解决这一问题,该项目整合了一套丰富的工具:网页搜索、反向图像搜索、OCR、图像裁剪、锐化、超分辨率和透视校正。该智能体在查询外部知识之前,会像人类一样主动感知并纠正不完美的视觉信息,从而确保后续搜索的可靠性。
故障感知算法实现从错误中学习
在长周期任务中,工具调用可能引发连锁故障。一次超时或错误就可能导致整个任务脱轨。传统的强化学习(RL)通常会丢弃这些失败的轨迹,从而浪费训练资源。
OpenSearch-VL 引入了多轮故障感知 GRPO(Multi-round Fault-Aware GRPO)训练算法,该算法能够识别工具调用中的关键故障点。它利用掩码技术过滤掉故障后的无效信息,并应用单侧优势裁剪,以保留早期步骤中有用的逻辑。 这样,即使最终结果是失败,模型仍能从前阶段学习到有效的搜索路径和探索策略。
实验结果可与商业专有模型媲美
评估结果表明,该模型在七个主流多模态深度搜索基准测试中均表现优异,平均提升幅度超过 10 个百分点。在某些特定任务上,OpenSearch-VL 已经可与顶尖的闭源商业模型媲美。
研究团队计划将 OpenSearch-VL 的所有训练数据、代码和模型权重完全开源,为全球开发者提供一个可复现且可改进的基础,从而推动多模态智能体研究迈向更深层次。
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






