Meitun LongCat lanza LoHoSearch mientras BrowseComp cae por debajo del 30%
Las capacidades de los agentes de búsqueda han sido definidas en gran medida por BrowseComp durante el último año. Sin embargo, este benchmark está perdiendo relevancia: impulsó el rendimiento de los modelos del 30% al 90% en solo diez meses, y su valor disminuye rápidamente. El 17 de julio, LongCat de Meituan lanzó una evaluación más rigurosa, LoHoSearch, diseñada para reavivar el progreso significativo en el desarrollo de agentes de búsqueda.

Los desafíos de LoHoSearch no están elaborados manualmente, sino generados automáticamente a partir de un grafo de conocimiento de Wikipedia que contiene 7,62 millones de entidades. Dado que son generados por máquinas, estas tareas alcanzan niveles de espacio de búsqueda y complejidad estructural que los anotadores humanos nunca podrían replicar de manera consistente. En resumen, mientras que los benchmarks anteriores estaban limitados por techos diseñados por humanos, LoHoSearch delega la generación de preguntas al grafo de conocimiento, eliminando efectivamente ese límite superior.

Los resultados son contundentes. Entre 11 modelos líderes, la puntuación más alta alcanzó solo el 34,74%, con los siguientes tres obteniendo puntuaciones entre el 15% y el 16%. En contraste, estos mismos modelos logran aproximadamente el 90% en BrowseComp. Esta brecha resalta las verdaderas limitaciones de los agentes de búsqueda actuales. Cabe destacar que las estrategias de contexto ofrecen rendimientos decrecientes: la mejor estrategia de contexto en LoHoSearch mejoró las puntuaciones solo en 6,8 puntos porcentuales, en comparación con 14 puntos porcentuales en BrowseComp. Esto sugiere que confiar en ingeniería de prompts y contexto para cerrar las brechas de capacidad es en gran medida ineficaz bajo este nuevo benchmark.
LoHoSearch comprende 544 preguntas que abarcan 11 dominios, estructuradas en formatos de árbol y grafo, y ha sido de código abierto. A medida que los benchmarks más antiguos se estancan, los verdaderos desafíos para los agentes de búsqueda apenas comienzan, y LoHoSearch podría pronto convertirse en un estándar de evaluación esencial.
Artículo relacionado
Senspeech X2.5 Twin Stars: Primer contexto de un millón de tokens en el borde, completamente entrenado con potencia de computación nacional
El 1 de septiembre, la filial de propiedad total de iFLYTEK, Ciyuan Xinghuo, lanzó oficialmente y abrió al código fuente dos modelos grandes generales de borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B. Estos modelos son los primeros en su tipo en admitir
MiniMax presenta M3, un modelo de inteligencia artificial de gran escala nacional que supera a GPT-5.5
El sector de inteligencia artificial de China ha experimentado un importante avance tecnológico con el lanzamiento oficial del último modelo de lenguaje grande de Xiyu Technology, MiniMax M3. Este sistema avanzado combina una competencia de codificac
India obliga a las aplicaciones de identificación de llamadas a compartir datos de spam con los operadores de telecomunicaciones
India ha ampliado sus regulaciones contra el spam para obligar a las aplicaciones de identificación de llamadas y gestión de llamadas a compartir los informes de spam de los usuarios con las operadoras de telecomunicaciones, una medida que ha llevado
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Las capacidades de los agentes de búsqueda han sido definidas en gran medida por BrowseComp durante el último año. Sin embargo, este benchmark está perdiendo relevancia: impulsó el rendimiento de los modelos del 30% al 90% en solo diez meses, y su valor disminuye rápidamente. El 17 de julio, LongCat de Meituan lanzó una evaluación más rigurosa, LoHoSearch, diseñada para reavivar el progreso significativo en el desarrollo de agentes de búsqueda.

Los desafíos de LoHoSearch no están elaborados manualmente, sino generados automáticamente a partir de un grafo de conocimiento de Wikipedia que contiene 7,62 millones de entidades. Dado que son generados por máquinas, estas tareas alcanzan niveles de espacio de búsqueda y complejidad estructural que los anotadores humanos nunca podrían replicar de manera consistente. En resumen, mientras que los benchmarks anteriores estaban limitados por techos diseñados por humanos, LoHoSearch delega la generación de preguntas al grafo de conocimiento, eliminando efectivamente ese límite superior.

Los resultados son contundentes. Entre 11 modelos líderes, la puntuación más alta alcanzó solo el 34,74%, con los siguientes tres obteniendo puntuaciones entre el 15% y el 16%. En contraste, estos mismos modelos logran aproximadamente el 90% en BrowseComp. Esta brecha resalta las verdaderas limitaciones de los agentes de búsqueda actuales. Cabe destacar que las estrategias de contexto ofrecen rendimientos decrecientes: la mejor estrategia de contexto en LoHoSearch mejoró las puntuaciones solo en 6,8 puntos porcentuales, en comparación con 14 puntos porcentuales en BrowseComp. Esto sugiere que confiar en ingeniería de prompts y contexto para cerrar las brechas de capacidad es en gran medida ineficaz bajo este nuevo benchmark.
LoHoSearch comprende 544 preguntas que abarcan 11 dominios, estructuradas en formatos de árbol y grafo, y ha sido de código abierto. A medida que los benchmarks más antiguos se estancan, los verdaderos desafíos para los agentes de búsqueda apenas comienzan, y LoHoSearch podría pronto convertirse en un estándar de evaluación esencial.
Senspeech X2.5 Twin Stars: Primer contexto de un millón de tokens en el borde, completamente entrenado con potencia de computación nacional
El 1 de septiembre, la filial de propiedad total de iFLYTEK, Ciyuan Xinghuo, lanzó oficialmente y abrió al código fuente dos modelos grandes generales de borde: Xinghuo X2.5-4B y Xinghuo X2.5-1.7B. Estos modelos son los primeros en su tipo en admitir
MiniMax presenta M3, un modelo de inteligencia artificial de gran escala nacional que supera a GPT-5.5
El sector de inteligencia artificial de China ha experimentado un importante avance tecnológico con el lanzamiento oficial del último modelo de lenguaje grande de Xiyu Technology, MiniMax M3. Este sistema avanzado combina una competencia de codificac
India obliga a las aplicaciones de identificación de llamadas a compartir datos de spam con los operadores de telecomunicaciones
India ha ampliado sus regulaciones contra el spam para obligar a las aplicaciones de identificación de llamadas y gestión de llamadas a compartir los informes de spam de los usuarios con las operadoras de telecomunicaciones, una medida que ha llevado





Hogar






