Lar
Equipe acadêmica acaba com o monopólio das gigantes da tecnologia com o SFT; OpenSeeker-v2 lidera o ranking de agentes de busca
No cenário em constante evolução dos grandes modelos de linguagem (LLMs), os recursos de pesquisa profunda tornaram-se a vantagem decisiva para agentes inteligentes avançados. No entanto, esse campo tem sido controlado há muito tempo por gigantes do setor com recursos financeiros consideráveis. As abordagens convencionais de desenvolvimento geralmente dependem de fluxos de trabalho que exigem muitos recursos e abrangem pré-treinamento, pré-treinamento contínuo (CPT), ajuste fino supervisionado (SFT) e aprendizado por reforço (RL).
Uma equipe de pesquisadores acadêmicos divulgou recentemente seu trabalho mais recente, o OpenSeeker-v2, que desafia fundamentalmente essa visão estabelecida. De acordo com o relatório, o treinamento em trajetórias de tarefas de alta qualidade e alta dificuldade permite que até mesmo uma abordagem simples de ajuste fino supervisionado (SFT) produza um agente de busca de primeira linha.

A equipe delineou três estratégias-chave de otimização para a síntese de dados: primeiro, ampliar o grafo de conhecimento para criar um espaço de exploração mais amplo; segundo, expandir substancialmente o repertório de ferramentas para ultrapassar os limites funcionais; e, finalmente, aplicar uma filtragem rigorosa de baixos passos para garantir a qualidade e a eficiência dos dados de treinamento.
Os resultados experimentais revelam que o OpenSeeker-v2 (com 30 bilhões de parâmetros e uma arquitetura ReAct), treinado com apenas 10.600 pontos de dados, apresentou desempenho impressionante em quatro benchmarks principais: obteve 46,0% no BrowseComp, 58,1% no BrowseComp-ZH, 34,6% no “Humanity’s Last Exam” e 78,0% no xbench. Esses números não apenas estabeleceram novos recordes, mas também superaram amplamente os modelos do setor que dependiam de pipelines pesados combinando CPT, SFT e RL — como o Tongyi DeepResearch.

Notavelmente, isso marca o primeiro agente de busca de última geração (SOTA) desenvolvido por uma equipe inteiramente acadêmica utilizando apenas SFT, na mesma escala e arquitetura de modelo. A equipe disponibilizou agora em código aberto os pesos do modelo para o OpenSeeker-v2. Esse avanço reduz significativamente as barreiras de P&D para agentes de busca avançados e oferece um caminho de desenvolvimento mais acessível e leve tanto para a comunidade acadêmica quanto para a comunidade de código aberto.
Artigo: https://arxiv.org/pdf/2605.04036
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
No cenário em constante evolução dos grandes modelos de linguagem (LLMs), os recursos de pesquisa profunda tornaram-se a vantagem decisiva para agentes inteligentes avançados. No entanto, esse campo tem sido controlado há muito tempo por gigantes do setor com recursos financeiros consideráveis. As abordagens convencionais de desenvolvimento geralmente dependem de fluxos de trabalho que exigem muitos recursos e abrangem pré-treinamento, pré-treinamento contínuo (CPT), ajuste fino supervisionado (SFT) e aprendizado por reforço (RL).
Uma equipe de pesquisadores acadêmicos divulgou recentemente seu trabalho mais recente, o OpenSeeker-v2, que desafia fundamentalmente essa visão estabelecida. De acordo com o relatório, o treinamento em trajetórias de tarefas de alta qualidade e alta dificuldade permite que até mesmo uma abordagem simples de ajuste fino supervisionado (SFT) produza um agente de busca de primeira linha.

A equipe delineou três estratégias-chave de otimização para a síntese de dados: primeiro, ampliar o grafo de conhecimento para criar um espaço de exploração mais amplo; segundo, expandir substancialmente o repertório de ferramentas para ultrapassar os limites funcionais; e, finalmente, aplicar uma filtragem rigorosa de baixos passos para garantir a qualidade e a eficiência dos dados de treinamento.
Os resultados experimentais revelam que o OpenSeeker-v2 (com 30 bilhões de parâmetros e uma arquitetura ReAct), treinado com apenas 10.600 pontos de dados, apresentou desempenho impressionante em quatro benchmarks principais: obteve 46,0% no BrowseComp, 58,1% no BrowseComp-ZH, 34,6% no “Humanity’s Last Exam” e 78,0% no xbench. Esses números não apenas estabeleceram novos recordes, mas também superaram amplamente os modelos do setor que dependiam de pipelines pesados combinando CPT, SFT e RL — como o Tongyi DeepResearch.

Notavelmente, isso marca o primeiro agente de busca de última geração (SOTA) desenvolvido por uma equipe inteiramente acadêmica utilizando apenas SFT, na mesma escala e arquitetura de modelo. A equipe disponibilizou agora em código aberto os pesos do modelo para o OpenSeeker-v2. Esse avanço reduz significativamente as barreiras de P&D para agentes de busca avançados e oferece um caminho de desenvolvimento mais acessível e leve tanto para a comunidade acadêmica quanto para a comunidade de código aberto.
Artigo: https://arxiv.org/pdf/2605.04036
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri











