Lar
O Google aprimora a pesquisa de arquivos da API Gemini com recursos avançados de RAG multimodal
O Google lançou uma atualização significativa no recurso de busca de arquivos da API Gemini, oferecendo aos desenvolvedores recursos aprimorados de geração aumentada por recuperação multimodal (RAG). Essa atualização vai além da recuperação tradicional apenas de texto, permitindo que a IA interprete imagens e se integre profundamente a documentos complexos — um passo fundamental para a precisão da IA em nível corporativo na recuperação de informações.
Tecnicamente, a nova função de pesquisa de arquivos utiliza o modelo Gemini Embedding2. Ao contrário dos sistemas anteriores, limitados à pesquisa por vetores de texto, o sistema atualizado apresenta uma incorporação multimodal unificada, permitindo que ele reconheça e processe conteúdo visual em PDFs, documentos e vários tipos de imagens. Isso significa que os desenvolvedores não precisam mais criar bancos de dados vetoriais complexos ou sistemas de segmentação de documentos; eles podem obter um fluxo de trabalho RAG completo — desde o upload de dados até a recuperação de informações — diretamente na API do Gemini.

Na prática, esse avanço resolve um problema comum: os sistemas RAG tradicionais muitas vezes não conseguem processar conteúdo não textual. Anteriormente, gráficos, diagramas de projeto ou capturas de tela de produtos em documentos eram pontos cegos para a IA, fazendo com que contextos essenciais fossem perdidos. Agora, a API do Gemini compreende nativamente esses elementos visuais. Por exemplo, quando uma empresa carrega um PDF com diagramas de arquitetura técnica ou gráficos de tendências de vendas, a IA pode combinar os dados dos gráficos com descrições de texto para fornecer insights precisos, aumentando significativamente a utilidade dos bots de atendimento ao cliente e dos sistemas de análise de documentos.
Para melhorar o gerenciamento de grandes bases de conhecimento, o Google adicionou filtragem personalizada de metadados. Os desenvolvedores podem marcar arquivos por departamento, data ou categoria e, durante a recuperação, filtrar informações irrelevantes usando condições predefinidas, garantindo que as respostas geradas pela IA sejam mais focadas.
Além disso, para atender às preocupações sobre a rastreabilidade das informações, a API Gemini agora oferece suporte a citações no nível da página. Ao gerar respostas, a IA indica claramente o número específico da página para cada informação, em vez de apenas fazer referência ao arquivo inteiro. Essa transparência ajuda os usuários a verificar rapidamente a precisão e facilita uma leitura mais aprofundada.
O recurso aprimorado de busca de arquivos já está disponível para desenvolvedores em todo o mundo. Os usuários podem acessá-lo pelo Google AI Studio ou pela plataforma Google Cloud para experimentar a conveniência no desenvolvimento e os ganhos de eficiência oferecidos pelo RAG multimodal.
Artigo relacionado
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais
Recomendações de tópicos especiais relacionados
Comentários (0)
O Google lançou uma atualização significativa no recurso de busca de arquivos da API Gemini, oferecendo aos desenvolvedores recursos aprimorados de geração aumentada por recuperação multimodal (RAG). Essa atualização vai além da recuperação tradicional apenas de texto, permitindo que a IA interprete imagens e se integre profundamente a documentos complexos — um passo fundamental para a precisão da IA em nível corporativo na recuperação de informações.
Tecnicamente, a nova função de pesquisa de arquivos utiliza o modelo Gemini Embedding2. Ao contrário dos sistemas anteriores, limitados à pesquisa por vetores de texto, o sistema atualizado apresenta uma incorporação multimodal unificada, permitindo que ele reconheça e processe conteúdo visual em PDFs, documentos e vários tipos de imagens. Isso significa que os desenvolvedores não precisam mais criar bancos de dados vetoriais complexos ou sistemas de segmentação de documentos; eles podem obter um fluxo de trabalho RAG completo — desde o upload de dados até a recuperação de informações — diretamente na API do Gemini.

Na prática, esse avanço resolve um problema comum: os sistemas RAG tradicionais muitas vezes não conseguem processar conteúdo não textual. Anteriormente, gráficos, diagramas de projeto ou capturas de tela de produtos em documentos eram pontos cegos para a IA, fazendo com que contextos essenciais fossem perdidos. Agora, a API do Gemini compreende nativamente esses elementos visuais. Por exemplo, quando uma empresa carrega um PDF com diagramas de arquitetura técnica ou gráficos de tendências de vendas, a IA pode combinar os dados dos gráficos com descrições de texto para fornecer insights precisos, aumentando significativamente a utilidade dos bots de atendimento ao cliente e dos sistemas de análise de documentos.
Para melhorar o gerenciamento de grandes bases de conhecimento, o Google adicionou filtragem personalizada de metadados. Os desenvolvedores podem marcar arquivos por departamento, data ou categoria e, durante a recuperação, filtrar informações irrelevantes usando condições predefinidas, garantindo que as respostas geradas pela IA sejam mais focadas.
Além disso, para atender às preocupações sobre a rastreabilidade das informações, a API Gemini agora oferece suporte a citações no nível da página. Ao gerar respostas, a IA indica claramente o número específico da página para cada informação, em vez de apenas fazer referência ao arquivo inteiro. Essa transparência ajuda os usuários a verificar rapidamente a precisão e facilita uma leitura mais aprofundada.
O recurso aprimorado de busca de arquivos já está disponível para desenvolvedores em todo o mundo. Os usuários podem acessá-lo pelo Google AI Studio ou pela plataforma Google Cloud para experimentar a conveniência no desenvolvimento e os ganhos de eficiência oferecidos pelo RAG multimodal.
Dentro dos Detalhes Revelados Sobre o Gemini de Próxima Geração: Poder de Cálculo Sobrecarregado, Equipes Internas Discordaram Sobre Prioridades de Desenvolvimento e Alocação de Recursos
Os relatórios indicam que o lançamento do tão aguardado modelo Gemini de próxima geração do Google foi adiado. Desentendimentos internos sobre prioridades de desenvolvimento e alocação de recursos, combinados com capacidade computacional limitada e p
A OpenAI descarta preocupações com a desaceleração do crescimento e afirma que múltiplas unidades de negócio estão acelerando.
Em resposta à escrutínio externo sobre o desaceleramento do crescimento das vendas e o não cumprimento de metas internas, o líder em inteligência artificial, OpenAI, emitiu uma declaração confiante na terça-feira, 28 de abril. A empresa esclareceu qu
Alibaba Super Cup: Qwen3.8-Max estreia com aprimoramento nas ferramentas de programação e escritório
A Alibaba revelou oficialmente o Qwen3.8-Max, um modelo de base de próxima geração com 2,4 trilhão de parâmetros. Este avanço significativo em IA oferece ganhos substanciais de desempenho em áreas principais, como programação e tarefas profissionais











