Maison
Google Gemini Embedding 2 fait son apparition en tant que premier modèle entièrement multimodal
Google a officiellement lancé Gemini Embedding 2 vers le 10 mars 2026. Il s'agit du premier modèle d'encodage entièrement multimodal de l'entreprise, basé sur l'architecture Gemini. Il est désormais disponible en préversion publique via l'API Gemini et Vertex AI, ce qui permet aux développeurs de commencer immédiatement à l'utiliser et à le tester.
Un espace d'embedding unifié qui abolit les barrières modales
La principale innovation de Gemini Embedding 2 réside dans sa capacité à mapper divers types de données — notamment du texte, des images, des vidéos, de l'audio et des documents tels que des PDF — dans un espace vectoriel d'embedding unique et unifié. Cette conception permet une recherche et une classification intermodales complètes, prend en charge plus de 100 langues et permet à différents types de données de véritablement « parler la même langue ».

Capacités d'entrée mixte pour une compréhension sémantique précise
Le modèle prend en charge nativement les entrées multimodales, telles que des images associées à du texte ou des vidéos combinées à de l'audio. Il est capable de comprendre en profondeur les relations sémantiques entre différents types de médias, plutôt que de simplement les traiter en parallèle, ce qui se traduit par un bond qualitatif dans la compréhension des contenus multimédias.
Traitement audio natif sans transcription ASR
Une autre avancée majeure réside dans sa fonctionnalité d'intégration audio directe. Les utilisateurs peuvent entrer directement des fichiers audio bruts, et le modèle génère des vecteurs d'intégration de haute qualité sans nécessiter de conversion préalable de la parole en texte (ASR). Cela rationalise considérablement les flux de travail des données multimodales tout en réduisant la latence et les coûts de calcul.
De vastes scénarios d'application ouvrent une nouvelle ère pour le RAG
Article connexe
L'application Lingguang redynamise sa communauté « Circle » avec un classement des tendances, des fonctionnalités de suivi et la prise en charge sur PC
Le 16 juillet, AIBase a découvert que l’assistant IA en mode plein écran d’Ant Group, l’« application Lingguang », avait mis à jour sa communauté d’applications instantanées, « Lingguang Circle ». Cet
Horizon dévoile un modèle de licence « white-box » pour les processeurs Core i7, accélérant ainsi la production en série des modèles d'IA L3 et L4
Horizon Robotics, qui était jusqu'à présent un innovateur chinois dans le domaine de la conduite autonome, est en train de devenir le « cerveau » de la conduite intelligente d'un leader mondial de l'a
Le co-fondateur de xAI démissionne, alors qu'il ne reste plus que cinq membres fondateurs
xAI, la filiale d’intelligence artificielle d’Elon Musk, a connu une nouvelle vague importante de départs de personnel. Le cofondateur Toby Pohlen a officiellement annoncé sa sortie. Partageant ses réflexions sur X, Pohlen s’est penché sur ses trois
Recommandations de sujets spéciaux liés
commentaires (0)
Google a officiellement lancé Gemini Embedding 2 vers le 10 mars 2026. Il s'agit du premier modèle d'encodage entièrement multimodal de l'entreprise, basé sur l'architecture Gemini. Il est désormais disponible en préversion publique via l'API Gemini et Vertex AI, ce qui permet aux développeurs de commencer immédiatement à l'utiliser et à le tester.
Un espace d'embedding unifié qui abolit les barrières modales
La principale innovation de Gemini Embedding 2 réside dans sa capacité à mapper divers types de données — notamment du texte, des images, des vidéos, de l'audio et des documents tels que des PDF — dans un espace vectoriel d'embedding unique et unifié. Cette conception permet une recherche et une classification intermodales complètes, prend en charge plus de 100 langues et permet à différents types de données de véritablement « parler la même langue ».

Capacités d'entrée mixte pour une compréhension sémantique précise
Le modèle prend en charge nativement les entrées multimodales, telles que des images associées à du texte ou des vidéos combinées à de l'audio. Il est capable de comprendre en profondeur les relations sémantiques entre différents types de médias, plutôt que de simplement les traiter en parallèle, ce qui se traduit par un bond qualitatif dans la compréhension des contenus multimédias.
Traitement audio natif sans transcription ASR
Une autre avancée majeure réside dans sa fonctionnalité d'intégration audio directe. Les utilisateurs peuvent entrer directement des fichiers audio bruts, et le modèle génère des vecteurs d'intégration de haute qualité sans nécessiter de conversion préalable de la parole en texte (ASR). Cela rationalise considérablement les flux de travail des données multimodales tout en réduisant la latence et les coûts de calcul.
De vastes scénarios d'application ouvrent une nouvelle ère pour le RAG
L'application Lingguang redynamise sa communauté « Circle » avec un classement des tendances, des fonctionnalités de suivi et la prise en charge sur PC
Le 16 juillet, AIBase a découvert que l’assistant IA en mode plein écran d’Ant Group, l’« application Lingguang », avait mis à jour sa communauté d’applications instantanées, « Lingguang Circle ». Cet
Horizon dévoile un modèle de licence « white-box » pour les processeurs Core i7, accélérant ainsi la production en série des modèles d'IA L3 et L4
Horizon Robotics, qui était jusqu'à présent un innovateur chinois dans le domaine de la conduite autonome, est en train de devenir le « cerveau » de la conduite intelligente d'un leader mondial de l'a
Le co-fondateur de xAI démissionne, alors qu'il ne reste plus que cinq membres fondateurs
xAI, la filiale d’intelligence artificielle d’Elon Musk, a connu une nouvelle vague importante de départs de personnel. Le cofondateur Toby Pohlen a officiellement annoncé sa sortie. Partageant ses réflexions sur X, Pohlen s’est penché sur ses trois











