Meitun LongCat 推出 LoHoSearch,而 BrowseComp 的得分已跌至 30% 以下
過去一年中,搜尋智慧體(Search Agent)的能力在很大程度上由 BrowseComp 基準測試所定義。然而,該基準測試正逐漸失去其相關性——它在短短十個月內將模型效能從 30% 提升至 90%,但其價值正在迅速衰減。7 月 17 日,美團旗下 LongCat 推出了更為嚴格的評估標準 LoHoSearch,旨在重新激發搜尋智慧體開發領域的實質性進展。

LoHoSearch 的挑戰並非人工構建,而是從包含 762 萬個實體的維基百科知識圖譜中自動生成。由於這些任務是機器生成的,它們達到了人類標註員無法一致複製的搜尋空間和結構複雜性的水平。簡而言之,之前的基準測試受限於人為設計的上限,而 LoHoSearch 將問題生成委託給知識圖譜,從而有效地消除了這一上限。

結果令人震驚。在 11 個領先模型中,最高分僅為 34.74%,緊隨其後的三個模型得分在 15% 至 16% 之間。相比之下,這些相同的模型在 BrowseComp 上的得分約為 90%。這一差距凸顯了當前搜尋智慧體的真正侷限性。值得注意的是,上下文策略的收益遞減:在 LoHoSearch 上表現最佳的上下文方法僅使分數提高了 6.8 個百分點,而在 BrowseComp 上則提高了 14 個百分點。這表明,在這個新基準測試下,依靠提示工程和上下文工程來彌補能力差距在很大程度上是無效的。
LoHoSearch 包含涵蓋 11 個領域的 544 個問題,以樹狀圖和圖狀圖格式呈現,並已開源。隨著舊基準測試趨於停滯,搜尋智慧體的真正挑戰才剛剛開始,而 LoHoSearch 可能很快將成為不可或缺的評估標準。
相關文章
Senspeech X2.5 雙星:首個在端側實現百萬級 Token 上下文,完全使用國產算力訓練
9月1日,科大訊飛全資子公司思元星火正式推出並開源兩款端側通用大模型:星火X2.5-4B和星火X2.5-1.7B。這兩款模型是業界首批原生支援高達100萬Token上下文長度的模型,並完全開放模型權重、程式碼倉庫及部署文件。百萬級上下文支援,小模型也能“讀完一本書”兩款模型均採用混合注意力架構,針對智慧體、程式碼、數學及指令遵循等核心能力進行了最佳化,在同類規模的行業級開源模型中展現出領先的綜合效能。在上下文能力方面,星火X2.5-4B和星火X2.5-1.7B基於萬億級Token的高質量資料進行了訓練
MiniMax 釋出 M3,一款超越 GPT-5.5 的國產 AI 大模型
中國的AI領域迎來了重大技術飛躍,隨著稀宇科技(Xiyu Technology)最新大型語言模型MiniMax M3的正式推出。這一先進系統結合了最先進的編碼能力,並支援高達100萬token的超長上下文視窗。值得注意的是,它原生支援多模態輸入,包括影象和影片處理,以及計算機桌面互動,使其成為中國首個整合這三項關鍵能力的開源模型。標準化基準測試中的卓越表現在嚴格的SWE-Bench Pro程式設計評估中,MiniMax M3獲得了59.0%的分數,超越了GPT-5.5和Gemini 3.1 Pro,
印度要求來電顯示應用程式與電信運營商共享垃圾資料
印度擴大了其反垃圾簡訊法規,要求來電顯示和電話管理應用程式與電信運營商共享使用者垃圾報告,這一舉措導致知名垃圾阻止應用程式提供商 Truecaller 將該政策標記為反競爭。週五,印度電信監管機構印度電信管理局(TRAI)更新了規範商業通訊的規則。這些更新強制要求允許使用者將電話標記為垃圾或 junk 的來電 ID 和電話管理應用程式,將這些報告傳輸到由電信運營商運營的基於區塊鏈的平臺。該平臺監控商業通訊並執行反垃圾協議。根據 TRAI 的說法,這一修改旨在擴大可用於打擊垃圾簡訊傳送者的垃圾報告
相關專題推薦
評論 (0)
0/500
過去一年中,搜尋智慧體(Search Agent)的能力在很大程度上由 BrowseComp 基準測試所定義。然而,該基準測試正逐漸失去其相關性——它在短短十個月內將模型效能從 30% 提升至 90%,但其價值正在迅速衰減。7 月 17 日,美團旗下 LongCat 推出了更為嚴格的評估標準 LoHoSearch,旨在重新激發搜尋智慧體開發領域的實質性進展。

LoHoSearch 的挑戰並非人工構建,而是從包含 762 萬個實體的維基百科知識圖譜中自動生成。由於這些任務是機器生成的,它們達到了人類標註員無法一致複製的搜尋空間和結構複雜性的水平。簡而言之,之前的基準測試受限於人為設計的上限,而 LoHoSearch 將問題生成委託給知識圖譜,從而有效地消除了這一上限。

結果令人震驚。在 11 個領先模型中,最高分僅為 34.74%,緊隨其後的三個模型得分在 15% 至 16% 之間。相比之下,這些相同的模型在 BrowseComp 上的得分約為 90%。這一差距凸顯了當前搜尋智慧體的真正侷限性。值得注意的是,上下文策略的收益遞減:在 LoHoSearch 上表現最佳的上下文方法僅使分數提高了 6.8 個百分點,而在 BrowseComp 上則提高了 14 個百分點。這表明,在這個新基準測試下,依靠提示工程和上下文工程來彌補能力差距在很大程度上是無效的。
LoHoSearch 包含涵蓋 11 個領域的 544 個問題,以樹狀圖和圖狀圖格式呈現,並已開源。隨著舊基準測試趨於停滯,搜尋智慧體的真正挑戰才剛剛開始,而 LoHoSearch 可能很快將成為不可或缺的評估標準。
Senspeech X2.5 雙星:首個在端側實現百萬級 Token 上下文,完全使用國產算力訓練
9月1日,科大訊飛全資子公司思元星火正式推出並開源兩款端側通用大模型:星火X2.5-4B和星火X2.5-1.7B。這兩款模型是業界首批原生支援高達100萬Token上下文長度的模型,並完全開放模型權重、程式碼倉庫及部署文件。百萬級上下文支援,小模型也能“讀完一本書”兩款模型均採用混合注意力架構,針對智慧體、程式碼、數學及指令遵循等核心能力進行了最佳化,在同類規模的行業級開源模型中展現出領先的綜合效能。在上下文能力方面,星火X2.5-4B和星火X2.5-1.7B基於萬億級Token的高質量資料進行了訓練
MiniMax 釋出 M3,一款超越 GPT-5.5 的國產 AI 大模型
中國的AI領域迎來了重大技術飛躍,隨著稀宇科技(Xiyu Technology)最新大型語言模型MiniMax M3的正式推出。這一先進系統結合了最先進的編碼能力,並支援高達100萬token的超長上下文視窗。值得注意的是,它原生支援多模態輸入,包括影象和影片處理,以及計算機桌面互動,使其成為中國首個整合這三項關鍵能力的開源模型。標準化基準測試中的卓越表現在嚴格的SWE-Bench Pro程式設計評估中,MiniMax M3獲得了59.0%的分數,超越了GPT-5.5和Gemini 3.1 Pro,
印度要求來電顯示應用程式與電信運營商共享垃圾資料
印度擴大了其反垃圾簡訊法規,要求來電顯示和電話管理應用程式與電信運營商共享使用者垃圾報告,這一舉措導致知名垃圾阻止應用程式提供商 Truecaller 將該政策標記為反競爭。週五,印度電信監管機構印度電信管理局(TRAI)更新了規範商業通訊的規則。這些更新強制要求允許使用者將電話標記為垃圾或 junk 的來電 ID 和電話管理應用程式,將這些報告傳輸到由電信運營商運營的基於區塊鏈的平臺。該平臺監控商業通訊並執行反垃圾協議。根據 TRAI 的說法,這一修改旨在擴大可用於打擊垃圾簡訊傳送者的垃圾報告





首頁






