opción
Hogar
Última hora
Contenido
RonaldRoberts
RonaldRoberts
20 de julio de 2026

LongCat de Meituan lanzó LoHoSearch, una prueba de referencia más exigente que sustituye a BrowseComp. Esta herramienta genera automáticamente preguntas a partir de 7,62 millones de entidades de Wikipedia, eliminando así los límites en cuanto al nivel de dificultad. Los modelos más avanzados obtuvieron un 34,74 % de acierto frente al 90 % logrado en BrowseComp, lo que pone de manifiesto las verdaderas debilidades de los agentes de búsqueda. Las estrategias basadas en el contexto solo generan beneficios mínimos. La prueba de referencia, compuesta por 544 preguntas, está disponible bajo licencia de código abierto.

LongCat de Meituan lanzó LoHoSearch, una prueba de referencia más exigente que sustituye a BrowseComp. Esta herramienta genera automáticamente preguntas a partir de 7,62 millones de entidades de Wikipedia, eliminando así los límites en cuanto al nivel de dificultad. Los modelos más avanzados obtuvieron un 34,74 % de acierto frente al 90 % logrado en BrowseComp, lo que pone de manifiesto las verdaderas debilidades de los agentes de búsqueda. Las estrategias basadas en el contexto solo generan beneficios mínimos. La prueba de referencia, compuesta por 544 preguntas, está disponible bajo licencia de código abierto. LongCat de Meituan lanzó LoHoSearch, una prueba de referencia más exigente que sustituye a BrowseComp. Esta herramienta genera automáticamente preguntas a partir de 7,62 millones de entidades de Wikipedia, eliminando así los límites en cuanto al nivel de dificultad. Los modelos más avanzados obtuvieron un 34,74 % de acierto frente al 90 % logrado en BrowseComp, lo que pone de manifiesto las verdaderas debilidades de los agentes de búsqueda. Las estrategias basadas en el contexto solo generan beneficios mínimos. La prueba de referencia, compuesta por 544 preguntas, está disponible bajo licencia de código abierto.
comentario (0)
0/300
OR