Lar
A Tencent apresenta o OpenSearch-VL: um agente de pesquisa profunda multimodal de código aberto
À medida que os modelos de linguagem multimodais de grande porte (MLLMs) avançam rapidamente, o principal desafio na competição em IA está mudando de simplesmente “compreender imagens de forma passiva” para buscar ativamente evidências e raciocinar. No entanto, a falta de dados de treinamento de alta qualidade, de pipelines automatizados de síntese de trajetórias e de orientações detalhadas de treinamento tem dificultado que a comunidade de código aberto reproduza os melhores agentes de busca multimodal.
Para superar esse gargalo, uma equipe de pesquisa da Tencent Hunyuan, em parceria com a UCLA e a Universidade Chinesa de Hong Kong, lançou o OpenSearch-VL. Esse projeto totalmente de código aberto oferece um caminho para a construção de um agente de busca profunda de última geração por meio do aprendizado por reforço (RL).

Fluxo de dados inovador supera atalhos na pesquisa
A equipe identificou os dados de treinamento de alta qualidade como o principal gargalo para o avanço dos modelos. Para treinar modelos para raciocínio em múltiplas etapas — além do simples reconhecimento de imagens com um clique —, eles projetaram um pipeline meticuloso de consolidação de dados.
Esse pipeline amostra caminhos a partir do grafo de hiperlinks da Wikipédia, convertendo relações complexas entre entidades em pares de perguntas e respostas com múltiplos saltos. Para evitar o aprendizado por atalhos, os pesquisadores aplicaram reescrita difusa de entidades para ocultar respostas diretas e integraram a localização visual ancorada ao código-fonte. Essa abordagem obriga o modelo a primeiro detectar sinais visuais e, em seguida, recuperar informações de forma iterativa usando ferramentas externas, evitando a degradação da habilidade durante a recuperação. Como resultado, a equipe construiu o banco de dados SearchVL-SFT (36.000 trajetórias de ajuste fino por instrução) e o banco de dados SearchVL-RL (8.000 trajetórias de aprendizado por reforço).
Conjunto de ferramentas versátil que vai além da simples pesquisa
O OpenSearch-VL vai além da pesquisa básica de texto. No uso no mundo real, as imagens fornecidas pelos usuários costumam estar desfocadas, distorcidas ou com baixa resolução, tornando as ferramentas de pesquisa convencionais ineficazes.
Para lidar com isso, o projeto incorpora um rico conjunto de ferramentas: pesquisa na web, pesquisa reversa de imagens, OCR, recorte de imagens, nitidez, super-resolução e correção de perspectiva. O agente percebe e corrige ativamente elementos visuais imperfeitos — assim como um ser humano — antes de consultar conhecimentos externos, garantindo pesquisas subsequentes confiáveis.
Algoritmo sensível a falhas permite aprender com os erros
Em tarefas de longo prazo, as chamadas de ferramentas podem gerar falhas em cascata. Um único tempo limite excedido ou erro pode comprometer toda a tarefa. O RL tradicional frequentemente descarta essas trajetórias malsucedidas, desperdiçando recursos de treinamento.
O OpenSearch-VL apresenta o GRPO sensível a falhas em múltiplas rodadas, um algoritmo de treinamento que identifica pontos críticos de falha nas chamadas de ferramentas. Ele usa mascaramento para filtrar informações inválidas pós-falha e aplica um recorte unilateral de vantagem para preservar a lógica útil das etapas anteriores. Dessa forma, mesmo quando o resultado final é uma falha, o modelo ainda aprende caminhos de busca e estratégias de exploração eficazes a partir das etapas anteriores.
Resultados experimentais rivalizam com modelos comerciais proprietários
Os resultados da avaliação demonstram forte desempenho em sete benchmarks convencionais de pesquisa profunda multimodal, com uma melhoria média superior a 10 pontos percentuais. Em certas tarefas específicas, o OpenSearch-VL já se equipara aos principais modelos comerciais de código fechado.
A equipe planeja disponibilizar totalmente em código aberto todos os dados de treinamento, o código-fonte e os pesos do modelo do OpenSearch-VL, oferecendo aos desenvolvedores globais uma base reproduzível e aprimorável que leva a pesquisa de agentes multimodais a um território mais profundo.
Artigo: https://arxiv.org/pdf/2605.05185
Artigo relacionado
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Recomendações de tópicos especiais relacionados
Comentários (0)
À medida que os modelos de linguagem multimodais de grande porte (MLLMs) avançam rapidamente, o principal desafio na competição em IA está mudando de simplesmente “compreender imagens de forma passiva” para buscar ativamente evidências e raciocinar. No entanto, a falta de dados de treinamento de alta qualidade, de pipelines automatizados de síntese de trajetórias e de orientações detalhadas de treinamento tem dificultado que a comunidade de código aberto reproduza os melhores agentes de busca multimodal.
Para superar esse gargalo, uma equipe de pesquisa da Tencent Hunyuan, em parceria com a UCLA e a Universidade Chinesa de Hong Kong, lançou o OpenSearch-VL. Esse projeto totalmente de código aberto oferece um caminho para a construção de um agente de busca profunda de última geração por meio do aprendizado por reforço (RL).

Fluxo de dados inovador supera atalhos na pesquisa
A equipe identificou os dados de treinamento de alta qualidade como o principal gargalo para o avanço dos modelos. Para treinar modelos para raciocínio em múltiplas etapas — além do simples reconhecimento de imagens com um clique —, eles projetaram um pipeline meticuloso de consolidação de dados.
Esse pipeline amostra caminhos a partir do grafo de hiperlinks da Wikipédia, convertendo relações complexas entre entidades em pares de perguntas e respostas com múltiplos saltos. Para evitar o aprendizado por atalhos, os pesquisadores aplicaram reescrita difusa de entidades para ocultar respostas diretas e integraram a localização visual ancorada ao código-fonte. Essa abordagem obriga o modelo a primeiro detectar sinais visuais e, em seguida, recuperar informações de forma iterativa usando ferramentas externas, evitando a degradação da habilidade durante a recuperação. Como resultado, a equipe construiu o banco de dados SearchVL-SFT (36.000 trajetórias de ajuste fino por instrução) e o banco de dados SearchVL-RL (8.000 trajetórias de aprendizado por reforço).
Conjunto de ferramentas versátil que vai além da simples pesquisa
O OpenSearch-VL vai além da pesquisa básica de texto. No uso no mundo real, as imagens fornecidas pelos usuários costumam estar desfocadas, distorcidas ou com baixa resolução, tornando as ferramentas de pesquisa convencionais ineficazes.
Para lidar com isso, o projeto incorpora um rico conjunto de ferramentas: pesquisa na web, pesquisa reversa de imagens, OCR, recorte de imagens, nitidez, super-resolução e correção de perspectiva. O agente percebe e corrige ativamente elementos visuais imperfeitos — assim como um ser humano — antes de consultar conhecimentos externos, garantindo pesquisas subsequentes confiáveis.
Algoritmo sensível a falhas permite aprender com os erros
Em tarefas de longo prazo, as chamadas de ferramentas podem gerar falhas em cascata. Um único tempo limite excedido ou erro pode comprometer toda a tarefa. O RL tradicional frequentemente descarta essas trajetórias malsucedidas, desperdiçando recursos de treinamento.
O OpenSearch-VL apresenta o GRPO sensível a falhas em múltiplas rodadas, um algoritmo de treinamento que identifica pontos críticos de falha nas chamadas de ferramentas. Ele usa mascaramento para filtrar informações inválidas pós-falha e aplica um recorte unilateral de vantagem para preservar a lógica útil das etapas anteriores. Dessa forma, mesmo quando o resultado final é uma falha, o modelo ainda aprende caminhos de busca e estratégias de exploração eficazes a partir das etapas anteriores.
Resultados experimentais rivalizam com modelos comerciais proprietários
Os resultados da avaliação demonstram forte desempenho em sete benchmarks convencionais de pesquisa profunda multimodal, com uma melhoria média superior a 10 pontos percentuais. Em certas tarefas específicas, o OpenSearch-VL já se equipara aos principais modelos comerciais de código fechado.
A equipe planeja disponibilizar totalmente em código aberto todos os dados de treinamento, o código-fonte e os pesos do modelo do OpenSearch-VL, oferecendo aos desenvolvedores globais uma base reproduzível e aprimorável que leva a pesquisa de agentes multimodais a um território mais profundo.
Artigo: https://arxiv.org/pdf/2605.05185
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais











