Meitun LongCat запускает LoHoSearch, пока оценки BrowseComp падают ниже 30%
Возможности поисковых агентов в значительной степени определялись benchmarkом BrowseComp на протяжении последнего года. Однако этот тест теряет свою актуальность: он обеспечил рост производительности моделей с 30% до 90% всего за десять месяцев, и его ценность стремительно снижается. 17 июля компания Meituan представила более строгую систему оценки LoHoSearch, разработанную для того, чтобы заново стимулировать значимый прогресс в разработке поисковых агентов.

Задачи LoHoSearch не создаются вручную, а генерируются автоматически на основе графа знаний Wikipedia, содержащего 7,62 миллиона сущностей. Поскольку они создаются машиной, эти задачи достигают такого уровня пространства поиска и структурной сложности, который человеческие аннотаторы не могли бы воспроизвести последовательно. Короче говоря, если предыдущие benchmarkы ограничивались «потолком», заданным человеком, то LoHoSearch делегирует генерацию вопросов графу знаний, эффективно устраняя это верхнее ограничение.

Результаты впечатляют. Среди 11 ведущих моделей максимальный балл составил лишь 34,74%, а следующие три модели набрали от 15% до 16%. Для сравнения, те же самые модели показывают около 90% на BrowseComp. Этот разрыв подчеркивает истинные ограничения современных поисковых агентов. Примечательно, что стратегии контекста дают убывающую отдачу: лучший подход к использованию контекста в LoHoSearch улучшил результаты всего на 6,8 процентных пункта, по сравнению с 14 процентными пунктами на BrowseComp. Это указывает на то, что полагаться на промпты и инженерную настройку контекста для преодоления разрыва в возможностях в основном неэффективно в рамках этого нового benchmarkа.
LoHoSearch включает 544 вопроса, охватывающих 11 областей знаний, структурированных в виде дерева и графа, и был опубликован с открытым исходным кодом. По мере того как старые benchmarkы достигают плато, реальные вызовы для поисковых агентов только начинаются, и LoHoSearch может вскоре стать необходимым стандартом оценки.
Связанная статья
Senspeech X2.5 Twin Stars: первый миллион токенов контекста на периферии, полностью обученный с использованием отечественных вычислительных мощностей
1 сентября wholly-owned дочерняя компания iFLYTEK, Ciyuan Xinghuo, официально запустила и открыла исходный код двух краевых общих больших моделей: Xinghuo X2.5-4B и Xinghuo X2.5-1.7B. Эти модели первыми в своем роде нативно поддерживают длину контекс
MiniMax представляет M3, отечественную большую языковую модель, превосходящую GPT-5.5
В секторе искусственного интеллекта Китая произошел значительный технологический скачок с официальным запуском новейшей большой языковой модели MiniMax M3 от компании Xiyu Technology. Эта передовая система сочетает в себе современные возможности прог
В Индии обязывает приложения для определения номера телефона передавать данные о спаме операторам связи
Индия расширила свои правила борьбы со спамом, обязав приложения для определения номера и управления звонками передавать операторам связи данные о спам-звонках от пользователей. Это решение привело к тому, что Truecaller, известный поставщик приложен
Рекомендации по связанным специальным темам
Комментарии (0)
Возможности поисковых агентов в значительной степени определялись benchmarkом BrowseComp на протяжении последнего года. Однако этот тест теряет свою актуальность: он обеспечил рост производительности моделей с 30% до 90% всего за десять месяцев, и его ценность стремительно снижается. 17 июля компания Meituan представила более строгую систему оценки LoHoSearch, разработанную для того, чтобы заново стимулировать значимый прогресс в разработке поисковых агентов.

Задачи LoHoSearch не создаются вручную, а генерируются автоматически на основе графа знаний Wikipedia, содержащего 7,62 миллиона сущностей. Поскольку они создаются машиной, эти задачи достигают такого уровня пространства поиска и структурной сложности, который человеческие аннотаторы не могли бы воспроизвести последовательно. Короче говоря, если предыдущие benchmarkы ограничивались «потолком», заданным человеком, то LoHoSearch делегирует генерацию вопросов графу знаний, эффективно устраняя это верхнее ограничение.

Результаты впечатляют. Среди 11 ведущих моделей максимальный балл составил лишь 34,74%, а следующие три модели набрали от 15% до 16%. Для сравнения, те же самые модели показывают около 90% на BrowseComp. Этот разрыв подчеркивает истинные ограничения современных поисковых агентов. Примечательно, что стратегии контекста дают убывающую отдачу: лучший подход к использованию контекста в LoHoSearch улучшил результаты всего на 6,8 процентных пункта, по сравнению с 14 процентными пунктами на BrowseComp. Это указывает на то, что полагаться на промпты и инженерную настройку контекста для преодоления разрыва в возможностях в основном неэффективно в рамках этого нового benchmarkа.
LoHoSearch включает 544 вопроса, охватывающих 11 областей знаний, структурированных в виде дерева и графа, и был опубликован с открытым исходным кодом. По мере того как старые benchmarkы достигают плато, реальные вызовы для поисковых агентов только начинаются, и LoHoSearch может вскоре стать необходимым стандартом оценки.
Senspeech X2.5 Twin Stars: первый миллион токенов контекста на периферии, полностью обученный с использованием отечественных вычислительных мощностей
1 сентября wholly-owned дочерняя компания iFLYTEK, Ciyuan Xinghuo, официально запустила и открыла исходный код двух краевых общих больших моделей: Xinghuo X2.5-4B и Xinghuo X2.5-1.7B. Эти модели первыми в своем роде нативно поддерживают длину контекс
MiniMax представляет M3, отечественную большую языковую модель, превосходящую GPT-5.5
В секторе искусственного интеллекта Китая произошел значительный технологический скачок с официальным запуском новейшей большой языковой модели MiniMax M3 от компании Xiyu Technology. Эта передовая система сочетает в себе современные возможности прог
В Индии обязывает приложения для определения номера телефона передавать данные о спаме операторам связи
Индия расширила свои правила борьбы со спамом, обязав приложения для определения номера и управления звонками передавать операторам связи данные о спам-звонках от пользователей. Это решение привело к тому, что Truecaller, известный поставщик приложен





Дом






