Meitun LongCat lança LoHoSearch enquanto a pontuação do BrowseComp cai abaixo de 30%
As capacidades dos agentes de pesquisa foram amplamente definidas pelo BrowseComp ao longo do último ano. No entanto, este benchmark está perdendo sua relevância — ele impulsionou o desempenho dos modelos de 30% para 90% em apenas dez meses, e seu valor está diminuindo rapidamente. Em 17 de julho, o LongCat da Meituan lançou uma avaliação mais rigorosa, o LoHoSearch, projetada para reacender o progresso significativo no desenvolvimento de agentes de pesquisa.

Os desafios do LoHoSearch não são elaborados manualmente, mas gerados automaticamente a partir de um grafo de conhecimento da Wikipedia contendo 7,62 milhões de entidades. Como são gerados por máquina, essas tarefas alcançam níveis de espaço de busca e complexidade estrutural que os anotadores humanos nunca poderiam replicar consistentemente. Em resumo, enquanto os benchmarks anteriores eram limitados por tetos projetados por humanos, o LoHoSearch delega a geração de perguntas ao grafo de conhecimento, eliminando efetivamente esse limite superior.

Os resultados são contundentes. Entre 11 modelos líderes, a pontuação mais alta atingiu apenas 34,74%, com os três seguintes marcando entre 15% e 16%. Em contraste, esses mesmos modelos alcançam aproximadamente 90% no BrowseComp. Essa lacuna destaca as verdadeiras limitações dos agentes de pesquisa atuais. Notavelmente, as estratégias de contexto apresentam retornos decrescentes: a melhor abordagem de contexto no LoHoSearch melhorou as pontuações em apenas 6,8 pontos percentuais, comparado a 14 pontos percentuais no BrowseComp. Isso sugere que confiar em prompts e engenharia de contexto para preencher lacunas de capacidade é, em grande parte, ineficaz sob este novo benchmark.
O LoHoSearch compreende 544 perguntas abrangendo 11 domínios, estruturadas em formatos de árvore e grafo, e foi disponibilizado como código aberto. À medida que os benchmarks mais antigos estagnam, os verdadeiros desafios para os agentes de pesquisa estão apenas começando, e o LoHoSearch pode logo se tornar um padrão essencial de avaliação.
Artigo relacionado
MiniMax apresenta o M3, um modelo de IA doméstico que supera o GPT-5.5
O setor de inteligência artificial da China testemunhou um grande salto tecnológico com o lançamento oficial do mais recente modelo de linguagem de grande escala da Xiyu Technology, o MiniMax M3. Este sistema avançado combina proficiência em codifica
A Índia obriga aplicativos de identificação de chamadas a compartilhar dados de spam com operadoras de telecomunicações
A Índia ampliou suas regulamentações contra spam para obrigar aplicativos de identificação de chamadas e gerenciamento de chamadas a compartilhar relatórios de spam dos usuários com operadoras de telecomunicações, uma medida que levou a Truecaller, u
A plataforma de IA Qwen amplia sua matriz de modelos com o lançamento oficial do GLM-5.3 e do DeepSeek-V4-Pro
A plataforma de IA Qwen da Alibaba Cloud (MaaS) expandiu recentemente sua matriz de serviços de modelos, integrando o modelo principal GLM-5.3 da Zhipu e o lançamento oficial do DeepSeek-V4-Pro. Os serviços de API correspondentes estão agora disponív
Recomendações de tópicos especiais relacionados
Comentários (0)
As capacidades dos agentes de pesquisa foram amplamente definidas pelo BrowseComp ao longo do último ano. No entanto, este benchmark está perdendo sua relevância — ele impulsionou o desempenho dos modelos de 30% para 90% em apenas dez meses, e seu valor está diminuindo rapidamente. Em 17 de julho, o LongCat da Meituan lançou uma avaliação mais rigorosa, o LoHoSearch, projetada para reacender o progresso significativo no desenvolvimento de agentes de pesquisa.

Os desafios do LoHoSearch não são elaborados manualmente, mas gerados automaticamente a partir de um grafo de conhecimento da Wikipedia contendo 7,62 milhões de entidades. Como são gerados por máquina, essas tarefas alcançam níveis de espaço de busca e complexidade estrutural que os anotadores humanos nunca poderiam replicar consistentemente. Em resumo, enquanto os benchmarks anteriores eram limitados por tetos projetados por humanos, o LoHoSearch delega a geração de perguntas ao grafo de conhecimento, eliminando efetivamente esse limite superior.

Os resultados são contundentes. Entre 11 modelos líderes, a pontuação mais alta atingiu apenas 34,74%, com os três seguintes marcando entre 15% e 16%. Em contraste, esses mesmos modelos alcançam aproximadamente 90% no BrowseComp. Essa lacuna destaca as verdadeiras limitações dos agentes de pesquisa atuais. Notavelmente, as estratégias de contexto apresentam retornos decrescentes: a melhor abordagem de contexto no LoHoSearch melhorou as pontuações em apenas 6,8 pontos percentuais, comparado a 14 pontos percentuais no BrowseComp. Isso sugere que confiar em prompts e engenharia de contexto para preencher lacunas de capacidade é, em grande parte, ineficaz sob este novo benchmark.
O LoHoSearch compreende 544 perguntas abrangendo 11 domínios, estruturadas em formatos de árvore e grafo, e foi disponibilizado como código aberto. À medida que os benchmarks mais antigos estagnam, os verdadeiros desafios para os agentes de pesquisa estão apenas começando, e o LoHoSearch pode logo se tornar um padrão essencial de avaliação.
MiniMax apresenta o M3, um modelo de IA doméstico que supera o GPT-5.5
O setor de inteligência artificial da China testemunhou um grande salto tecnológico com o lançamento oficial do mais recente modelo de linguagem de grande escala da Xiyu Technology, o MiniMax M3. Este sistema avançado combina proficiência em codifica
A Índia obriga aplicativos de identificação de chamadas a compartilhar dados de spam com operadoras de telecomunicações
A Índia ampliou suas regulamentações contra spam para obrigar aplicativos de identificação de chamadas e gerenciamento de chamadas a compartilhar relatórios de spam dos usuários com operadoras de telecomunicações, uma medida que levou a Truecaller, u
A plataforma de IA Qwen amplia sua matriz de modelos com o lançamento oficial do GLM-5.3 e do DeepSeek-V4-Pro
A plataforma de IA Qwen da Alibaba Cloud (MaaS) expandiu recentemente sua matriz de serviços de modelos, integrando o modelo principal GLM-5.3 da Zhipu e o lançamento oficial do DeepSeek-V4-Pro. Os serviços de API correspondentes estão agora disponív





Lar






