Googleが「Gemini Embedding2」を発表:ネイティブのマルチモーダルモデルが意味空間を統合
Googleは最近、新しいネイティブマルチモーダル埋め込みモデル「Gemini Embedding2」を発表しました。このモデルは、テキスト、画像、動画、音声、PDF文書を共通のセマンティックベクトル空間にマッピングすることができ、複雑なAIデータワークフローを効率化し、マルチモーダル検索と理解を向上させるように設計されています。これは、埋め込み技術におけるGoogleの重要な進歩であり、単一モダリティのテキストから統一されたマルチモーダルセマンティックモデリングへの移行を意味します。

これに先立ち、2025年7月にGoogleはテキスト埋め込みモデル「gemini-embedding-001」を発表していました。同モデルは100以上の言語に対応し、多言語ベンチマーク「MTEB」において最高の結果を達成しました。 新しい「Gemini Embedding2」は、Geminiアーキテクチャを基盤としつつ、その適用範囲を大幅に拡大しています。現在では、テキスト、画像、動画、音声、PDFという5つの異なるモダリティを処理し、それらを単一のベクトル空間に投影します。これにより、複数の専用モデルや余分な処理ステップを必要とせずに、異なる種類のメディア間で直接的な意味論的比較が可能になります。この機能は、セマンティック検索、検索強化生成(RAG)、感情分析、データクラスタリングなどのアプリケーションにおいて特に有用です。
入力機能に関しては、新モデルは最大8192トークンのテキストに対応しており、従来の2048トークンという制限の4倍となっています。また、1回のリクエストにつき最大6枚のPNGまたはJPEG画像、最大120秒の動画、最大6ページのPDF文書を処理可能です。 注目すべき機能として、Gemini Embedding2は音声処理をネイティブにサポートしており、音声からテキストへの変換が不要になるため、文字起こしによる情報の損失を防ぐことができます。また、Googleは「インターリーブ入力」技術を導入しました。これにより、開発者は画像と説明文を組み合わせるなど、1つのリクエスト内で複数のモダリティを統合し、それらの間の意味的な関係をより的確に捉えることが可能になります。

アーキテクチャ面では、本モデルは引き続きMatryoshka Representation Learning(MRL)を採用しています。この手法は階層構造を用いてベクトルの次元を動的に調整します。デフォルトの埋め込み次元は3072ですが、1536および768のオプション設定も利用可能であり、開発者は検索精度とストレージ効率のバランスを柔軟に調整できます。
Googleのベンチマーク結果によると、Gemini Embedding2はテキスト、画像、動画、音声の各タスクにおいて業界トップクラスの性能を発揮しています。例えば、テキスト・動画検索では68.8点を記録し、Amazon Nova2Multimodal Embeddings(60.3点)やVoyage Multimodal3.5(55.2点)を上回っています。 テキストと画像の比較では、93.4というスコアを達成し、Amazonのモデルスコア84.0を大幅に上回っています。
Gemini Embedding2は現在、Gemini APIおよびVertex AIを通じて開発者が利用可能です。LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB、Vector Searchなどの主要なフレームワークやベクトルデータベースと統合されています。開発者の導入を支援するため、GoogleはインタラクティブなColabノートブックや、軽量なマルチモーダルセマンティック検索のデモを提供しています。

マルチモーダル・エンベディング分野での競争は激化しています。特に、今年2月下旬には、AI検索エンジンのPerplexityが、オープンソースのエンベディングモデルであるpplx-embed-v1およびpplx -embed-context-v 1を公開しました。
関連記事
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ
関連特集おすすめ
コメント (0)
0/500
Googleは最近、新しいネイティブマルチモーダル埋め込みモデル「Gemini Embedding2」を発表しました。このモデルは、テキスト、画像、動画、音声、PDF文書を共通のセマンティックベクトル空間にマッピングすることができ、複雑なAIデータワークフローを効率化し、マルチモーダル検索と理解を向上させるように設計されています。これは、埋め込み技術におけるGoogleの重要な進歩であり、単一モダリティのテキストから統一されたマルチモーダルセマンティックモデリングへの移行を意味します。

これに先立ち、2025年7月にGoogleはテキスト埋め込みモデル「gemini-embedding-001」を発表していました。同モデルは100以上の言語に対応し、多言語ベンチマーク「MTEB」において最高の結果を達成しました。 新しい「Gemini Embedding2」は、Geminiアーキテクチャを基盤としつつ、その適用範囲を大幅に拡大しています。現在では、テキスト、画像、動画、音声、PDFという5つの異なるモダリティを処理し、それらを単一のベクトル空間に投影します。これにより、複数の専用モデルや余分な処理ステップを必要とせずに、異なる種類のメディア間で直接的な意味論的比較が可能になります。この機能は、セマンティック検索、検索強化生成(RAG)、感情分析、データクラスタリングなどのアプリケーションにおいて特に有用です。
入力機能に関しては、新モデルは最大8192トークンのテキストに対応しており、従来の2048トークンという制限の4倍となっています。また、1回のリクエストにつき最大6枚のPNGまたはJPEG画像、最大120秒の動画、最大6ページのPDF文書を処理可能です。 注目すべき機能として、Gemini Embedding2は音声処理をネイティブにサポートしており、音声からテキストへの変換が不要になるため、文字起こしによる情報の損失を防ぐことができます。また、Googleは「インターリーブ入力」技術を導入しました。これにより、開発者は画像と説明文を組み合わせるなど、1つのリクエスト内で複数のモダリティを統合し、それらの間の意味的な関係をより的確に捉えることが可能になります。

アーキテクチャ面では、本モデルは引き続きMatryoshka Representation Learning(MRL)を採用しています。この手法は階層構造を用いてベクトルの次元を動的に調整します。デフォルトの埋め込み次元は3072ですが、1536および768のオプション設定も利用可能であり、開発者は検索精度とストレージ効率のバランスを柔軟に調整できます。
Googleのベンチマーク結果によると、Gemini Embedding2はテキスト、画像、動画、音声の各タスクにおいて業界トップクラスの性能を発揮しています。例えば、テキスト・動画検索では68.8点を記録し、Amazon Nova2Multimodal Embeddings(60.3点)やVoyage Multimodal3.5(55.2点)を上回っています。 テキストと画像の比較では、93.4というスコアを達成し、Amazonのモデルスコア84.0を大幅に上回っています。
Gemini Embedding2は現在、Gemini APIおよびVertex AIを通じて開発者が利用可能です。LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB、Vector Searchなどの主要なフレームワークやベクトルデータベースと統合されています。開発者の導入を支援するため、GoogleはインタラクティブなColabノートブックや、軽量なマルチモーダルセマンティック検索のデモを提供しています。

マルチモーダル・エンベディング分野での競争は激化しています。特に、今年2月下旬には、AI検索エンジンのPerplexityが、オープンソースのエンベディングモデルであるpplx-embed-v1およびpplx -embed-context-v 1を公開しました。
元OpenAIのチーフサイエンティストであるイリヤによるSSIが初のモデルを公開
AIは新たな主要なマイルストーンを達成した。OpenAIを去った後、元チーフサイエンティストのイリヤ・スツケルはSafe Superintelligence Inc.(SSI)を設立し、同社は最近、初代モデルに関する詳細を明らかにした。海外のソーシャルメディアからの報告によれば、チームはTTT(Testing While Training)を活用したコンパクトな推論エンジンを開発中であり、これは安全なスーパーインテリジェンス追求における重要な進展である。この新しいアーキテクチャは、モデルが「学
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日、AIアプリケーション開発プラットフォームのLovableは、デンマークのハードウェアスタートアップであるAtechの80万ドルのシード資金調達ラウンドへの参加を発表した。Lovableがリードするこのラウンドには、a16zスカウトファンド、シークイアスカウトファンド、Nordic Makersなど、トップクラスのベンチャーキャピタル企業が参加した。この投資は、Lovableが「Vibeコーディング」の概念を純粋なソフトウェア開発からハードウェアエンジニアリングの領域へと戦略
Anthropic、ClaudeのAIコーディングツールを日本に拡大し、海外成長を促進
Anthropic、米国の主要な人工知能企業は、グローバルな展開を強化している。水曜日、同社は東京で「Code with Claude」と題された大規模な開発者向けイベントを開催し、約500人のソフトウェアエンジニアが集まった。この取り組みは、Claude AIツールおよび関連製品を日本市場に積極的に導入することを目的としており、自律的なコーディング機能による企業生産性の向上という中核的な利点を強調している。自動化されたコード生成への重点本イベントにおいて、Anthropicは複雑なプログラ





家






