美團旗下的LongCat推出了LoHoSearch這一更嚴格的測試基準,用以替代BrowseComp。該測試工具能夠從762萬個維基百科實體中自動生成問題,從而消除了難度上限的限制。在LoHoSearch上的得分情況顯示,頂級模型的準確率僅為34.74%,而其在BrowseComp上的準確率為90%,這充分暴露了搜尋智慧體的真實弱點。即便採用上下文相關策略,提升效果也極為有限。這個包含544道題目的測試基準已開源。
評論 (0)
0/300





首頁
