學術團隊憑藉 SFT 終結科技巨頭的壟斷;OpenSeeker-v2 榮登搜尋代理程式排行榜榜首
在大規模語言模型(LLMs)不斷演進的領域中,深度搜尋能力已成為先進智慧代理人的決定性優勢。然而,這個領域長期以來一直由資金雄厚的產業巨頭所掌控。 傳統的開發方法通常依賴於資源密集型的流程,其中包含預訓練、持續預訓練(CPT)、監督式微調(SFT)以及強化學習(RL)。
一支學術研究團隊最近發表了他們的最新成果「OpenSeeker-v2」,從根本上挑戰了這一既定觀點。根據他們的報告,透過在高品質、高難度的任務軌跡上進行訓練,即使是簡單的監督式微調(SFT)方法,也能打造出頂級的搜尋代理。

該團隊闡述了三項關鍵的資料合成優化策略:首先,擴展知識圖譜以創造更廣闊的探索空間;其次,大幅擴充工具庫的種類以突破功能極限;最後,採用嚴格的低步數過濾機制,以確保訓練資料的品質與效率。
實驗結果顯示,OpenSeeker-v2(具備 300 億個參數並採用 ReAct 架構)僅憑 10,600 個數據點進行訓練,便在四大核心基準測試中展現出壓倒性的表現:在 BrowseComp 上獲得 46.0%、在 BrowseComp-ZH 上獲得 58.1%、 在「Humanity’s Last Exam」上達 34.6%,以及在 xbench 上達 78.0%。這些數值不僅創下新紀錄,更全面超越了依賴結合 CPT、SFT 和 RL 的繁複處理流程的業界模型——例如 Tongyi DeepResearch。

值得注意的是,這標誌著首個由純學術團隊開發、僅採用 SFT 技術,且在相同模型規模與架構下達成的最先進(SOTA)搜尋代理。 該團隊現已將OpenSeeker-v2 的模型權重開源。這項突破顯著降低了先進搜尋代理的研發門檻,並為學術界與開源社群提供了更易於取得且輕量化的開發途徑。
論文:https://arxiv.org/pdf/2605.04036
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500
在大規模語言模型(LLMs)不斷演進的領域中,深度搜尋能力已成為先進智慧代理人的決定性優勢。然而,這個領域長期以來一直由資金雄厚的產業巨頭所掌控。 傳統的開發方法通常依賴於資源密集型的流程,其中包含預訓練、持續預訓練(CPT)、監督式微調(SFT)以及強化學習(RL)。
一支學術研究團隊最近發表了他們的最新成果「OpenSeeker-v2」,從根本上挑戰了這一既定觀點。根據他們的報告,透過在高品質、高難度的任務軌跡上進行訓練,即使是簡單的監督式微調(SFT)方法,也能打造出頂級的搜尋代理。

該團隊闡述了三項關鍵的資料合成優化策略:首先,擴展知識圖譜以創造更廣闊的探索空間;其次,大幅擴充工具庫的種類以突破功能極限;最後,採用嚴格的低步數過濾機制,以確保訓練資料的品質與效率。
實驗結果顯示,OpenSeeker-v2(具備 300 億個參數並採用 ReAct 架構)僅憑 10,600 個數據點進行訓練,便在四大核心基準測試中展現出壓倒性的表現:在 BrowseComp 上獲得 46.0%、在 BrowseComp-ZH 上獲得 58.1%、 在「Humanity’s Last Exam」上達 34.6%,以及在 xbench 上達 78.0%。這些數值不僅創下新紀錄,更全面超越了依賴結合 CPT、SFT 和 RL 的繁複處理流程的業界模型——例如 Tongyi DeepResearch。

值得注意的是,這標誌著首個由純學術團隊開發、僅採用 SFT 技術,且在相同模型規模與架構下達成的最先進(SOTA)搜尋代理。 該團隊現已將OpenSeeker-v2 的模型權重開源。這項突破顯著降低了先進搜尋代理的研發門檻,並為學術界與開源社群提供了更易於取得且輕量化的開發途徑。
論文:https://arxiv.org/pdf/2605.04036
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






