Maison
Meitun LongCat lance LoHoSearch alors que les scores de BrowseComp chutent en dessous de 30 %
Les capacités des agents de recherche ont été largement définies par BrowseComp au cours de la dernière année. Pourtant, ce benchmark perd de sa pertinence : il a fait passer les performances des modèles de 30 % à 90 % en seulement dix mois, et sa valeur diminue rapidement. Le 17 juillet, LongCat de Meituan a lancé une évaluation plus rigoureuse, LoHoSearch, conçue pour raviver une progression significative dans le développement des agents de recherche.

Les défis de LoHoSearch ne sont pas conçus manuellement, mais générés automatiquement à partir d’un graphe de connaissances Wikipedia contenant 7,62 millions d’entités. Étant générés par machine, ces tâches atteignent des niveaux d’espace de recherche et de complexité structurelle que les annotateurs humains ne pourraient jamais reproduire de manière cohérente. En bref, tandis que les benchmarks précédents étaient limités par des plafonds conçus par l’humain, LoHoSearch délègue la génération des questions au graphe de connaissances, éliminant ainsi cette limite supérieure.

Les résultats sont sans équivoque. Parmi 11 modèles leaders, le score le plus élevé n’a atteint que 34,74 %, les trois suivants se situant entre 15 % et 16 %. En revanche, ces mêmes modèles obtiennent environ 90 % sur BrowseComp. Cet écart met en lumière les véritables limites des agents de recherche actuels. Il est notable que les stratégies contextuelles offrent des rendements décroissants : la meilleure approche contextuelle sur LoHoSearch a amélioré les scores de seulement 6,8 points de pourcentage, contre 14 points de pourcentage sur BrowseComp. Cela suggère que s’appuyer sur l’ingénierie des invites et du contexte pour combler les écarts de capacités est largement inefficace sous ce nouveau benchmark.
LoHoSearch comprend 544 questions couvrant 11 domaines, structurées sous forme d’arbres et de graphes, et a été open-sourcée. Alors que les anciens benchmarks stagnent, les vrais défis pour les agents de recherche font à peine leur apparition, et LoHoSearch pourrait bientôt devenir une norme d’évaluation essentielle.
Article connexe
MiniMax dévoile M3, un grand modèle d'IA national qui surpasse GPT-5.5
Le secteur de l'intelligence artificielle en Chine a connu un bond technologique majeur avec le lancement officiel du dernier grand modèle de langage de Xiyu Technology, MiniMax M3. Ce système avancé combine une maîtrise du codage de pointe avec la p
L'Inde oblige les applications d'identification des appels à partager des données sur les appels indésirables avec les opérateurs de télécommunications
L’Inde a élargi sa réglementation anti-spam pour obliger les applications d’identification de l’appelant et de gestion des appels à partager avec les opérateurs de télécommunications les signalements d’abus reçus des utilisateurs, une mesure qui a co
La plateforme Qwen AI élargit sa matrice de modèles avec le lancement officiel de GLM-5.3 et DeepSeek-V4-Pro
La plateforme d’IA Qwen d’Alibaba Cloud (MaaS) a récemment élargi sa matrice de services de modèles, en intégrant le modèle phare GLM-5.3 de Zhipu et la version officielle de DeepSeek-V4-Pro. Les services API correspondants sont désormais accessibles
Recommandations de sujets spéciaux liés
commentaires (0)
Les capacités des agents de recherche ont été largement définies par BrowseComp au cours de la dernière année. Pourtant, ce benchmark perd de sa pertinence : il a fait passer les performances des modèles de 30 % à 90 % en seulement dix mois, et sa valeur diminue rapidement. Le 17 juillet, LongCat de Meituan a lancé une évaluation plus rigoureuse, LoHoSearch, conçue pour raviver une progression significative dans le développement des agents de recherche.

Les défis de LoHoSearch ne sont pas conçus manuellement, mais générés automatiquement à partir d’un graphe de connaissances Wikipedia contenant 7,62 millions d’entités. Étant générés par machine, ces tâches atteignent des niveaux d’espace de recherche et de complexité structurelle que les annotateurs humains ne pourraient jamais reproduire de manière cohérente. En bref, tandis que les benchmarks précédents étaient limités par des plafonds conçus par l’humain, LoHoSearch délègue la génération des questions au graphe de connaissances, éliminant ainsi cette limite supérieure.

Les résultats sont sans équivoque. Parmi 11 modèles leaders, le score le plus élevé n’a atteint que 34,74 %, les trois suivants se situant entre 15 % et 16 %. En revanche, ces mêmes modèles obtiennent environ 90 % sur BrowseComp. Cet écart met en lumière les véritables limites des agents de recherche actuels. Il est notable que les stratégies contextuelles offrent des rendements décroissants : la meilleure approche contextuelle sur LoHoSearch a amélioré les scores de seulement 6,8 points de pourcentage, contre 14 points de pourcentage sur BrowseComp. Cela suggère que s’appuyer sur l’ingénierie des invites et du contexte pour combler les écarts de capacités est largement inefficace sous ce nouveau benchmark.
LoHoSearch comprend 544 questions couvrant 11 domaines, structurées sous forme d’arbres et de graphes, et a été open-sourcée. Alors que les anciens benchmarks stagnent, les vrais défis pour les agents de recherche font à peine leur apparition, et LoHoSearch pourrait bientôt devenir une norme d’évaluation essentielle.
MiniMax dévoile M3, un grand modèle d'IA national qui surpasse GPT-5.5
Le secteur de l'intelligence artificielle en Chine a connu un bond technologique majeur avec le lancement officiel du dernier grand modèle de langage de Xiyu Technology, MiniMax M3. Ce système avancé combine une maîtrise du codage de pointe avec la p
L'Inde oblige les applications d'identification des appels à partager des données sur les appels indésirables avec les opérateurs de télécommunications
L’Inde a élargi sa réglementation anti-spam pour obliger les applications d’identification de l’appelant et de gestion des appels à partager avec les opérateurs de télécommunications les signalements d’abus reçus des utilisateurs, une mesure qui a co
La plateforme Qwen AI élargit sa matrice de modèles avec le lancement officiel de GLM-5.3 et DeepSeek-V4-Pro
La plateforme d’IA Qwen d’Alibaba Cloud (MaaS) a récemment élargi sa matrice de services de modèles, en intégrant le modèle phare GLM-5.3 de Zhipu et la version officielle de DeepSeek-V4-Pro. Les services API correspondants sont désormais accessibles











