选项
首页
快讯
内容
RonaldRoberts
RonaldRoberts
2026-07-20

美团旗下的LongCat推出了LoHoSearch这一更严格的测试基准,用以替代BrowseComp。该测试工具能够从762万个维基百科实体中自动生成问题,从而消除了难度上限的限制。在LoHoSearch上的得分情况显示,顶级模型的准确率仅为34.74%,而其在BrowseComp上的准确率为90%,这充分暴露了搜索智能体的真实弱点。即便采用上下文相关策略,提升效果也极为有限。这个包含544道题目的测试基准已开源。

美团旗下的LongCat推出了LoHoSearch这一更严格的测试基准,用以替代BrowseComp。该测试工具能够从762万个维基百科实体中自动生成问题,从而消除了难度上限的限制。在LoHoSearch上的得分情况显示,顶级模型的准确率仅为34.74%,而其在BrowseComp上的准确率为90%,这充分暴露了搜索智能体的真实弱点。即便采用上下文相关策略,提升效果也极为有限。这个包含544道题目的测试基准已开源。 美团旗下的LongCat推出了LoHoSearch这一更严格的测试基准,用以替代BrowseComp。该测试工具能够从762万个维基百科实体中自动生成问题,从而消除了难度上限的限制。在LoHoSearch上的得分情况显示,顶级模型的准确率仅为34.74%,而其在BrowseComp上的准确率为90%,这充分暴露了搜索智能体的真实弱点。即便采用上下文相关策略,提升效果也极为有限。这个包含544道题目的测试基准已开源。
评论 (0)
0/300
OR