オプション
速報
コンテンツ
RonaldRoberts
RonaldRoberts
2026年7月20日

メイタウアンのLongCatは、BrowseCompに代わるより厳しいベンチマークであるLoHoSearchを公開しました。このベンチマークはウィキペディアに掲載されている762万件のエンティティから自動的に質問を生成するため、難易度の上限がなくなっています。トップクラスのモデルであっても得点率はBrowseCompの90%に対しわずか34.74%にとどまり、検索エージェントの真の弱点が浮き彫りになりました。コンテキスト戦略を用いても得られる改善幅はごくわずかです。この544問からなるベンチマークはオープンソースとして公開されています。

メイタウアンのLongCatは、BrowseCompに代わるより厳しいベンチマークであるLoHoSearchを公開しました。このベンチマークはウィキペディアに掲載されている762万件のエンティティから自動的に質問を生成するため、難易度の上限がなくなっています。トップクラスのモデルであっても得点率はBrowseCompの90%に対しわずか34.74%にとどまり、検索エージェントの真の弱点が浮き彫りになりました。コンテキスト戦略を用いても得られる改善幅はごくわずかです。この544問からなるベンチマークはオープンソースとして公開されています。 メイタウアンのLongCatは、BrowseCompに代わるより厳しいベンチマークであるLoHoSearchを公開しました。このベンチマークはウィキペディアに掲載されている762万件のエンティティから自動的に質問を生成するため、難易度の上限がなくなっています。トップクラスのモデルであっても得点率はBrowseCompの90%に対しわずか34.74%にとどまり、検索エージェントの真の弱点が浮き彫りになりました。コンテキスト戦略を用いても得られる改善幅はごくわずかです。この544問からなるベンチマークはオープンソースとして公開されています。
コメント (0)
0/300
OR