Meitun LongCat startet LoHoSearch, während die BrowseComp-Werte unter 30 % fallen
Die Fähigkeiten von Search Agents wurden im letzten Jahr maßgeblich durch BrowseComp definiert. Doch dieses Benchmark-Verfahren verliert an Relevanz – es trieb die Modellleistung in nur zehn Monaten von 30 % auf 90 %, und sein Wert schwindet rasch. Am 17. Juli stellte LongCat von Meituan eine strengere Evaluierung vor, LoHoSearch, die darauf abzielt, sinnvolle Fortschritte in der Entwicklung von Search Agents wieder voranzubringen.

Die Herausforderungen von LoHoSearch werden nicht manuell erstellt, sondern automatisch aus einem Wissensgraphen von Wikipedia generiert, der 7,62 Millionen Entitäten enthält. Da diese Aufgaben maschinengeneriert sind, erreichen sie ein Ausmaß an Suchraum und struktureller Komplexität, das menschliche Annotatoren niemals konsistent replizieren könnten. Kurz gesagt: Während frühere Benchmarks durch menschlich festgelegte Obergrenzen begrenzt waren, überlässt LoHoSearch die Generierung der Fragen dem Wissensgraphen und hebt diese Obergrenze effektiv auf.

Die Ergebnisse sind drastisch. Unter 11 führenden Modellen erreichte das höchste Ergebnis lediglich 34,74 %, während die nächsten drei Modelle zwischen 15 % und 16 % erzielten. Im Gegensatz dazu erreichen dieselben Modelle auf BrowseComp etwa 90 %. Diese Lücke verdeutlicht die wahren Grenzen aktueller Search Agents. Bemerkenswerterweise bringen Kontextstrategien immer geringere Mehrwerte: Die beste Kontextstrategie auf LoHoSearch verbesserte die Ergebnisse um lediglich 6,8 Prozentpunkte, im Vergleich zu 14 Prozentpunkten auf BrowseComp. Dies deutet darauf hin, dass es weitgehend unwirksam ist, sich unter diesem neuen Benchmark auf Prompting und Kontextengineering zu verlassen, um Fähigkeitslücken zu schließen.
LoHoSearch umfasst 544 Fragen, die 11 Domänen abdecken, in Baum- und Graphformaten strukturiert sind und open-source verfügbar sind. Während ältere Benchmarks ins Stocken geraten, beginnen die echten Herausforderungen für Search Agents erst jetzt, und LoHoSearch wird bald zu einem unverzichtbaren Evaluierungsstandard werden.
Verwandter Artikel
MiniMax stellt M3 vor, ein inländisches KI-Großmodell, das GPT-5.5 übertrifft.
Chinas KI-Branche hat einen bedeutenden technologischen Sprung vollzogen, mit der offiziellen Einführung des neuesten Large-Language-Modells von Xiyu Technology, MiniMax M3. Dieses fortschrittliche System kombiniert modernste Programmierfähigkeiten m
Indien verpflichtet Caller-ID-Apps zur Weitergabe von Spam-Daten an Telekommunikationsanbieter
Indien hat seine Anti-Spam-Vorschriften erweitert, um vorzuschreiben, dass Caller-ID- und Call-Management-Anwendungen Nutzer-Spamberichte mit Telekommunikationsanbietern teilen, ein Schritt, der dazu geführt hat, dass Truecaller, ein bekannter Anbiet
Qwen-KI-Plattform erweitert Modellmatrix mit offizieller Einführung von GLM-5.3 und DeepSeek-V4-Pro
Die Alibaba Cloud Qwen AI-Plattform (MaaS) hat kürzlich ihre Modellservicematrix erweitert und das Flaggschiff-Großmodell GLM-5.3 von Zhipu sowie die offizielle Veröffentlichung von DeepSeek-V4-Pro integriert. Die entsprechenden API-Dienste sind nun
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Die Fähigkeiten von Search Agents wurden im letzten Jahr maßgeblich durch BrowseComp definiert. Doch dieses Benchmark-Verfahren verliert an Relevanz – es trieb die Modellleistung in nur zehn Monaten von 30 % auf 90 %, und sein Wert schwindet rasch. Am 17. Juli stellte LongCat von Meituan eine strengere Evaluierung vor, LoHoSearch, die darauf abzielt, sinnvolle Fortschritte in der Entwicklung von Search Agents wieder voranzubringen.

Die Herausforderungen von LoHoSearch werden nicht manuell erstellt, sondern automatisch aus einem Wissensgraphen von Wikipedia generiert, der 7,62 Millionen Entitäten enthält. Da diese Aufgaben maschinengeneriert sind, erreichen sie ein Ausmaß an Suchraum und struktureller Komplexität, das menschliche Annotatoren niemals konsistent replizieren könnten. Kurz gesagt: Während frühere Benchmarks durch menschlich festgelegte Obergrenzen begrenzt waren, überlässt LoHoSearch die Generierung der Fragen dem Wissensgraphen und hebt diese Obergrenze effektiv auf.

Die Ergebnisse sind drastisch. Unter 11 führenden Modellen erreichte das höchste Ergebnis lediglich 34,74 %, während die nächsten drei Modelle zwischen 15 % und 16 % erzielten. Im Gegensatz dazu erreichen dieselben Modelle auf BrowseComp etwa 90 %. Diese Lücke verdeutlicht die wahren Grenzen aktueller Search Agents. Bemerkenswerterweise bringen Kontextstrategien immer geringere Mehrwerte: Die beste Kontextstrategie auf LoHoSearch verbesserte die Ergebnisse um lediglich 6,8 Prozentpunkte, im Vergleich zu 14 Prozentpunkten auf BrowseComp. Dies deutet darauf hin, dass es weitgehend unwirksam ist, sich unter diesem neuen Benchmark auf Prompting und Kontextengineering zu verlassen, um Fähigkeitslücken zu schließen.
LoHoSearch umfasst 544 Fragen, die 11 Domänen abdecken, in Baum- und Graphformaten strukturiert sind und open-source verfügbar sind. Während ältere Benchmarks ins Stocken geraten, beginnen die echten Herausforderungen für Search Agents erst jetzt, und LoHoSearch wird bald zu einem unverzichtbaren Evaluierungsstandard werden.
MiniMax stellt M3 vor, ein inländisches KI-Großmodell, das GPT-5.5 übertrifft.
Chinas KI-Branche hat einen bedeutenden technologischen Sprung vollzogen, mit der offiziellen Einführung des neuesten Large-Language-Modells von Xiyu Technology, MiniMax M3. Dieses fortschrittliche System kombiniert modernste Programmierfähigkeiten m
Indien verpflichtet Caller-ID-Apps zur Weitergabe von Spam-Daten an Telekommunikationsanbieter
Indien hat seine Anti-Spam-Vorschriften erweitert, um vorzuschreiben, dass Caller-ID- und Call-Management-Anwendungen Nutzer-Spamberichte mit Telekommunikationsanbietern teilen, ein Schritt, der dazu geführt hat, dass Truecaller, ein bekannter Anbiet
Qwen-KI-Plattform erweitert Modellmatrix mit offizieller Einführung von GLM-5.3 und DeepSeek-V4-Pro
Die Alibaba Cloud Qwen AI-Plattform (MaaS) hat kürzlich ihre Modellservicematrix erweitert und das Flaggschiff-Großmodell GLM-5.3 von Zhipu sowie die offizielle Veröffentlichung von DeepSeek-V4-Pro integriert. Die entsprechenden API-Dienste sind nun





Heim






