Maison
Google améliore la recherche de fichiers via l'API Gemini grâce à des fonctionnalités RAG multimodales avancées
Google a déployé une mise à jour majeure de la fonctionnalité de recherche de fichiers de son API Gemini, offrant ainsi aux développeurs des capacités améliorées de génération augmentée par la recherche multimodale (RAG). Cette mise à jour va au-delà de la recherche traditionnelle limitée au texte, permettant à l’IA d’interpréter des images et de s’intégrer en profondeur à des documents complexes — une avancée majeure pour la précision de l’IA en matière de recherche d’informations au niveau de l’entreprise.
D’un point de vue technique, la nouvelle fonction de recherche de fichiers s’appuie sur le modèle Gemini Embedding2. Contrairement aux systèmes antérieurs limités à la recherche vectorielle de texte, le système mis à jour dispose d’un encodage multimodal unifié, ce qui lui permet de reconnaître et de traiter le contenu visuel présent dans les PDF, les documents et divers types d’images. Cela signifie que les développeurs n’ont plus besoin de créer des bases de données vectorielles complexes ni des systèmes de segmentation de documents ; ils peuvent mettre en place un workflow RAG complet — du téléchargement des données à la recherche d’informations — directement au sein de l’API Gemini.

En pratique, cette avancée résout un problème courant : les systèmes RAG traditionnels ne parviennent souvent pas à traiter les contenus non textuels. Auparavant, les graphiques, les schémas de conception ou les captures d’écran de produits présents dans les documents constituaient des angles morts pour l’IA, ce qui entraînait la perte d’éléments contextuels essentiels. Désormais, l’API Gemini comprend nativement ces éléments visuels. Par exemple, lorsqu’une entreprise télécharge un PDF contenant des schémas d’architecture technique ou des graphiques de tendances de ventes, l’IA peut combiner les données des graphiques avec les descriptions textuelles pour fournir des informations précises, ce qui améliore considérablement l’utilité des bots de service client et des systèmes d’analyse de documents.
Pour améliorer la gestion des bases de connaissances volumineuses, Google a ajouté un filtrage personnalisé des métadonnées. Les développeurs peuvent baliser les fichiers par service, date ou catégorie, puis, lors de la recherche, filtrer les informations non pertinentes à l’aide de conditions prédéfinies, garantissant ainsi que les réponses générées par l’IA soient plus ciblées.
De plus, pour répondre aux préoccupations concernant la traçabilité des informations, l’API Gemini prend désormais en charge les citations au niveau de la page. Lors de la génération de réponses, l’IA indique clairement le numéro de page spécifique pour chaque information, plutôt que de se contenter de faire référence à l’ensemble du fichier. Cette transparence aide les utilisateurs à vérifier rapidement l’exactitude des informations et facilite une lecture plus approfondie.
La fonctionnalité améliorée de recherche de fichiers est désormais accessible aux développeurs du monde entier. Les utilisateurs peuvent y accéder via Google AI Studio ou la plateforme Google Cloud pour profiter de la facilité de développement et des gains d’efficacité offerts par le RAG multimodal.
Article connexe
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi
Coupe Super d'Alibaba : Qwen3.8-Max fait ses débuts avec des outils de codage et de bureautique améliorés
Alibaba a officiellement dévoilé Qwen3.8-Max, un modèle fondamental de nouvelle génération disposant de 2,4 billions de paramètres. Cette avancée majeure en intelligence artificielle offre des gains de performance substantiels dans des domaines clés
Recommandations de sujets spéciaux liés
commentaires (0)
Google a déployé une mise à jour majeure de la fonctionnalité de recherche de fichiers de son API Gemini, offrant ainsi aux développeurs des capacités améliorées de génération augmentée par la recherche multimodale (RAG). Cette mise à jour va au-delà de la recherche traditionnelle limitée au texte, permettant à l’IA d’interpréter des images et de s’intégrer en profondeur à des documents complexes — une avancée majeure pour la précision de l’IA en matière de recherche d’informations au niveau de l’entreprise.
D’un point de vue technique, la nouvelle fonction de recherche de fichiers s’appuie sur le modèle Gemini Embedding2. Contrairement aux systèmes antérieurs limités à la recherche vectorielle de texte, le système mis à jour dispose d’un encodage multimodal unifié, ce qui lui permet de reconnaître et de traiter le contenu visuel présent dans les PDF, les documents et divers types d’images. Cela signifie que les développeurs n’ont plus besoin de créer des bases de données vectorielles complexes ni des systèmes de segmentation de documents ; ils peuvent mettre en place un workflow RAG complet — du téléchargement des données à la recherche d’informations — directement au sein de l’API Gemini.

En pratique, cette avancée résout un problème courant : les systèmes RAG traditionnels ne parviennent souvent pas à traiter les contenus non textuels. Auparavant, les graphiques, les schémas de conception ou les captures d’écran de produits présents dans les documents constituaient des angles morts pour l’IA, ce qui entraînait la perte d’éléments contextuels essentiels. Désormais, l’API Gemini comprend nativement ces éléments visuels. Par exemple, lorsqu’une entreprise télécharge un PDF contenant des schémas d’architecture technique ou des graphiques de tendances de ventes, l’IA peut combiner les données des graphiques avec les descriptions textuelles pour fournir des informations précises, ce qui améliore considérablement l’utilité des bots de service client et des systèmes d’analyse de documents.
Pour améliorer la gestion des bases de connaissances volumineuses, Google a ajouté un filtrage personnalisé des métadonnées. Les développeurs peuvent baliser les fichiers par service, date ou catégorie, puis, lors de la recherche, filtrer les informations non pertinentes à l’aide de conditions prédéfinies, garantissant ainsi que les réponses générées par l’IA soient plus ciblées.
De plus, pour répondre aux préoccupations concernant la traçabilité des informations, l’API Gemini prend désormais en charge les citations au niveau de la page. Lors de la génération de réponses, l’IA indique clairement le numéro de page spécifique pour chaque information, plutôt que de se contenter de faire référence à l’ensemble du fichier. Cette transparence aide les utilisateurs à vérifier rapidement l’exactitude des informations et facilite une lecture plus approfondie.
La fonctionnalité améliorée de recherche de fichiers est désormais accessible aux développeurs du monde entier. Les utilisateurs peuvent y accéder via Google AI Studio ou la plateforme Google Cloud pour profiter de la facilité de développement et des gains d’efficacité offerts par le RAG multimodal.
À l’intérieur des détails révélés sur le prochain Gemini : une puissance de calcul mise à rude épreuve, des équipes internes en désaccord sur les priorités de développement et l’allocation des ressources
Les rapports indiquent que le lancement du modèle Gemini de nouvelle génération, tant attendu par Google, a été repoussé. Des désaccords internes concernant les priorités de développement et l'allocation des ressources, combinés à une capacité de cal
OpenAI rejette les inquiétudes concernant un ralentissement de la croissance, affirmant que plusieurs unités commerciales accélèrent
En réponse aux critiques externes concernant la décélération de la croissance des ventes et le non-respect des objectifs internes, le leader de l'IA, OpenAI, a publié une déclaration rassurante le mardi 28 avril. L'entreprise a précisé que ses produi
Coupe Super d'Alibaba : Qwen3.8-Max fait ses débuts avec des outils de codage et de bureautique améliorés
Alibaba a officiellement dévoilé Qwen3.8-Max, un modèle fondamental de nouvelle génération disposant de 2,4 billions de paramètres. Cette avancée majeure en intelligence artificielle offre des gains de performance substantiels dans des domaines clés











