学术团队凭借SFT终结科技巨头的垄断;OpenSeeker-v2荣登搜索代理排行榜榜首
在不断演变的大型语言模型(LLMs)领域,深度搜索能力已成为先进智能代理的决定性优势。然而,这一领域长期以来一直由资金雄厚的行业巨头所掌控。 传统的开发方法通常依赖于资源密集型管道,其中包括预训练、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。
一支学术研究团队最近发布了他们的最新成果OpenSeeker-v2,从根本上挑战了这一既定观点。根据他们的报告,在高质量、高难度的任务轨迹上进行训练,即使采用简单的监督微调(SFT)方法,也能生成顶级搜索代理。

该团队概述了数据合成方面的三项关键优化策略:首先,扩展知识图谱以创造更广阔的探索空间;其次,大幅扩充工具集以突破功能极限;最后,应用严格的低步长过滤机制,以确保训练数据的质量和效率。
实验结果表明,仅基于 10,600 个数据点训练的OpenSeeker-v2(拥有 300 亿参数,采用 ReAct 架构)在四个核心基准测试中均展现出卓越性能:在 BrowseComp 上得分 46.0%,在 BrowseComp-ZH 上得分 58.1%, 在“Humanity’s Last Exam”上达到34.6%,在xbench上达到78.0%。这些数据不仅创下了新纪录,而且全面超越了依赖于CPT、SFT和RL组合的复杂管道的行业模型——例如Tongyi DeepResearch。

值得注意的是,这是首个由纯学术团队仅使用SFT技术开发、且在相同模型规模和架构下达到最先进水平(SOTA)的搜索代理。 该团队现已将OpenSeeker-v2 的模型权重开源。这一突破显著降低了先进搜索代理的研发门槛,并为学术界和开源社区提供了更易获取、更轻量级的开发路径。
论文:https://arxiv.org/pdf/2605.04036
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
在不断演变的大型语言模型(LLMs)领域,深度搜索能力已成为先进智能代理的决定性优势。然而,这一领域长期以来一直由资金雄厚的行业巨头所掌控。 传统的开发方法通常依赖于资源密集型管道,其中包括预训练、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。
一支学术研究团队最近发布了他们的最新成果OpenSeeker-v2,从根本上挑战了这一既定观点。根据他们的报告,在高质量、高难度的任务轨迹上进行训练,即使采用简单的监督微调(SFT)方法,也能生成顶级搜索代理。

该团队概述了数据合成方面的三项关键优化策略:首先,扩展知识图谱以创造更广阔的探索空间;其次,大幅扩充工具集以突破功能极限;最后,应用严格的低步长过滤机制,以确保训练数据的质量和效率。
实验结果表明,仅基于 10,600 个数据点训练的OpenSeeker-v2(拥有 300 亿参数,采用 ReAct 架构)在四个核心基准测试中均展现出卓越性能:在 BrowseComp 上得分 46.0%,在 BrowseComp-ZH 上得分 58.1%, 在“Humanity’s Last Exam”上达到34.6%,在xbench上达到78.0%。这些数据不仅创下了新纪录,而且全面超越了依赖于CPT、SFT和RL组合的复杂管道的行业模型——例如Tongyi DeepResearch。

值得注意的是,这是首个由纯学术团队仅使用SFT技术开发、且在相同模型规模和架构下达到最先进水平(SOTA)的搜索代理。 该团队现已将OpenSeeker-v2 的模型权重开源。这一突破显著降低了先进搜索代理的研发门槛,并为学术界和开源社区提供了更易获取、更轻量级的开发路径。
论文:https://arxiv.org/pdf/2605.04036
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






