option
Maison
Flash info
Contenu
RonaldRoberts
RonaldRoberts
20 juillet 2026

LongCat de Meituan a lancé LoHoSearch, un nouveau critère d’évaluation plus exigeant qui remplace BrowseComp. Ce dernier génère automatiquement des questions à partir de 7,62 millions d’entités Wikipédia, éliminant ainsi les limites liées au niveau de difficulté. Les meilleurs modèles n’ont obtenu que 34,74 % de réussite contre 90 % sur BrowseComp, ce qui met en évidence les véritables faiblesses des agents de recherche. Les stratégies basées sur le contexte ne procurent que des améliorations minimes. Ce corpus de 544 questions est mis à disposition en source ouverte.

LongCat de Meituan a lancé LoHoSearch, un nouveau critère d’évaluation plus exigeant qui remplace BrowseComp. Ce dernier génère automatiquement des questions à partir de 7,62 millions d’entités Wikipédia, éliminant ainsi les limites liées au niveau de difficulté. Les meilleurs modèles n’ont obtenu que 34,74 % de réussite contre 90 % sur BrowseComp, ce qui met en évidence les véritables faiblesses des agents de recherche. Les stratégies basées sur le contexte ne procurent que des améliorations minimes. Ce corpus de 544 questions est mis à disposition en source ouverte. LongCat de Meituan a lancé LoHoSearch, un nouveau critère d’évaluation plus exigeant qui remplace BrowseComp. Ce dernier génère automatiquement des questions à partir de 7,62 millions d’entités Wikipédia, éliminant ainsi les limites liées au niveau de difficulté. Les meilleurs modèles n’ont obtenu que 34,74 % de réussite contre 90 % sur BrowseComp, ce qui met en évidence les véritables faiblesses des agents de recherche. Les stratégies basées sur le contexte ne procurent que des améliorations minimes. Ce corpus de 544 questions est mis à disposition en source ouverte.
commentaires (0)
0/300
OR