Google 推出 Gemini Embedding2:原生多模態模型整合語義空間
Google 近期推出了其全新的原生多模態嵌入模型「Gemini Embedding2」。該模型能將文字、圖像、影片、音訊及 PDF 文件映射至一個共享的語義向量空間,旨在簡化複雜的 AI 資料工作流程,並提升多模態檢索與理解能力。這代表著 Google 在嵌入技術上的重大進展,從單一模態的文字處理邁向統一的多模態語義建模。

此前,在 2025 年 7 月,Google 推出了gemini-embedding-001文字嵌入模型。該模型支援超過 100 種語言,並在 MTEB 多語言基準測試中取得頂尖成績。 全新的 Gemini Embedding2 基於 Gemini 架構,但大幅擴展了其應用範圍。它現在可處理五種不同模態——文字、圖像、影片、音訊和 PDF——並將其投影至單一向量空間。這使得不同類型媒體之間能夠進行直接的語義比較,無需使用多個專用模型或額外的處理步驟。此功能對於語義搜尋、檢索增強生成(RAG)、情緒分析及資料聚類等應用尤為寶貴。
在輸入能力方面,新模型支援多達 8192 個文字標記,是先前 2048 個標記限制的四倍。它每筆請求可處理多達六張 PNG 或 JPEG 圖片、長度達 120 秒的影片,以及最多六頁的 PDF 文件。 值得注意的是,Gemini Embedding2 原生支援音訊處理,無需進行語音轉文字轉換,從而避免了轉錄過程中的潛在資訊損失。Google 還推出了「交錯輸入」技術,讓開發者能在單次請求中結合多種模態——例如將圖片與描述性文字混合——以更精準地捕捉它們之間的語義關聯。

在架構上,該模型持續採用「套娃式表徵學習」(MRL)。此技術利用分層結構動態調整向量維度。預設嵌入維度為 3072,並提供 1536 和 768 兩種可選配置,讓開發者能靈活地在檢索準確度與儲存效率之間取得平衡。
Google 的基準測試結果顯示,Gemini Embedding2 在文字、圖像、影片和語音任務中均展現領先的表現。例如,在文字-影片檢索任務中,其得分達 68.8,超越了 Amazon Nova2 多模態嵌入模型(60.3)和 Voyage Multimodal3.5(55.2)。 在文字-圖像對比中,其得分達 93.4,顯著領先於亞馬遜模型的 84.0 分。
開發者目前可透過Gemini API和Vertex AI 存取 Gemini Embedding2。該模型已整合至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 及 Vector Search 等熱門框架與向量資料庫。為協助開發者快速上手,Google 提供了互動式 Colab 筆記本及輕量級多模態語義搜尋示範。

多模態嵌入技術的競爭日趨白熱化。值得注意的是,今年二月底,AI 搜尋引擎 Perplexity 釋出了其開源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
評論 (0)
0/500
Google 近期推出了其全新的原生多模態嵌入模型「Gemini Embedding2」。該模型能將文字、圖像、影片、音訊及 PDF 文件映射至一個共享的語義向量空間,旨在簡化複雜的 AI 資料工作流程,並提升多模態檢索與理解能力。這代表著 Google 在嵌入技術上的重大進展,從單一模態的文字處理邁向統一的多模態語義建模。

此前,在 2025 年 7 月,Google 推出了gemini-embedding-001文字嵌入模型。該模型支援超過 100 種語言,並在 MTEB 多語言基準測試中取得頂尖成績。 全新的 Gemini Embedding2 基於 Gemini 架構,但大幅擴展了其應用範圍。它現在可處理五種不同模態——文字、圖像、影片、音訊和 PDF——並將其投影至單一向量空間。這使得不同類型媒體之間能夠進行直接的語義比較,無需使用多個專用模型或額外的處理步驟。此功能對於語義搜尋、檢索增強生成(RAG)、情緒分析及資料聚類等應用尤為寶貴。
在輸入能力方面,新模型支援多達 8192 個文字標記,是先前 2048 個標記限制的四倍。它每筆請求可處理多達六張 PNG 或 JPEG 圖片、長度達 120 秒的影片,以及最多六頁的 PDF 文件。 值得注意的是,Gemini Embedding2 原生支援音訊處理,無需進行語音轉文字轉換,從而避免了轉錄過程中的潛在資訊損失。Google 還推出了「交錯輸入」技術,讓開發者能在單次請求中結合多種模態——例如將圖片與描述性文字混合——以更精準地捕捉它們之間的語義關聯。

在架構上,該模型持續採用「套娃式表徵學習」(MRL)。此技術利用分層結構動態調整向量維度。預設嵌入維度為 3072,並提供 1536 和 768 兩種可選配置,讓開發者能靈活地在檢索準確度與儲存效率之間取得平衡。
Google 的基準測試結果顯示,Gemini Embedding2 在文字、圖像、影片和語音任務中均展現領先的表現。例如,在文字-影片檢索任務中,其得分達 68.8,超越了 Amazon Nova2 多模態嵌入模型(60.3)和 Voyage Multimodal3.5(55.2)。 在文字-圖像對比中,其得分達 93.4,顯著領先於亞馬遜模型的 84.0 分。
開發者目前可透過Gemini API和Vertex AI 存取 Gemini Embedding2。該模型已整合至 LangChain、LlamaIndex、Haystack、Weaviate、Qdrant、ChromaDB 及 Vector Search 等熱門框架與向量資料庫。為協助開發者快速上手,Google 提供了互動式 Colab 筆記本及輕量級多模態語義搜尋示範。

多模態嵌入技術的競爭日趨白熱化。值得注意的是,今年二月底,AI 搜尋引擎 Perplexity 釋出了其開源嵌入模型pplx-embed-v1和pplx-embed-context-v1。
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業





首頁






