谷歌Gemma4的速度提升了三倍,這標誌著離線大型模型的真正誕生。

在開源模型領域取得重大突破僅幾周後,谷歌再次對其最強大的開源模型Gemma4進行了顯著升級。當地時間5月5日,谷歌正式推出了針對Gemma4系列的多令牌預測生成器草案。這一技術突破採用了推測性解碼架構,使模型的推理速度提高了多達三倍,同時並未犧牲輸出質量或邏輯能力。
作為全球範圍內應用最廣泛的開源模型之一,Gemma4自發布以來已經獲得了超過6000萬的下載量。此次升級的主要目的是解決大型語言模型中長期存在的推理瓶頸問題,並進一步提升計算效率。
技術細節:在推理加速方面實現“預見性”
傳統的語言模型推理往往受到記憶體頻寬的限制。簡單來說,當處理器生成文字時,將數百億個引數從記憶體傳輸到計算單元會消耗大量時間。這種資料傳輸速度遠低於處理速度,導致硬體資源大部分時間處於閒置狀態,從而造成明顯的響應延遲。
為了解決這一問題,谷歌引入了推測性解碼技術。其原理可以理解為“主從”配置:系統將像Gemma 4 31B這樣的重型目標模型與輕量級的多令牌預測生成器結合使用。生成器利用閒置的計算資源提前預測多個即將出現的令牌,而更強大的主模型則同時進行並行驗證。當預測結果一致時,模型就可以在一次計算中確定整個序列,從而大幅減少文字生成所需的時間。
測試結果:蘋果晶片和消費級顯示卡取得了顯著提升
根據官方測試資料,在本地裝置上這種加速效果尤為明顯。在蘋果晶片環境中,當批次大小介於4到8之間時,Gemma 4 26B模型的本地推理速度提高了大約2.2倍。
這意味著開發者現在可以在個人電腦和普通的消費級顯示卡上更順暢地執行復雜的離線程式設計助手或智慧代理工作流程。此外,提升的推理效率還顯著降低了邊緣裝置的能耗,為移動人工智慧的更廣泛應用鋪平了道路。
人工智慧應用的邊界正在不斷拓展
此次技術升級主要針對那些對低延遲有嚴格要求的場景,例如實時聊天機器人、自動化程式設計工具以及各種自主代理。藉助多令牌預測生成器,谷歌證明了即使在資源有限的硬體環境中,開發者也能部署最先進的語言模型,而不會影響響應速度或計算精度。
隨著推理成本的不斷下降和技術障礙的逐步消除,Gemma4及其相關技術的不斷發展正在推動人工智慧從雲端走向更多的個人計算裝置。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500

在開源模型領域取得重大突破僅幾周後,谷歌再次對其最強大的開源模型Gemma4進行了顯著升級。當地時間5月5日,谷歌正式推出了針對Gemma4系列的多令牌預測生成器草案。這一技術突破採用了推測性解碼架構,使模型的推理速度提高了多達三倍,同時並未犧牲輸出質量或邏輯能力。
作為全球範圍內應用最廣泛的開源模型之一,Gemma4自發布以來已經獲得了超過6000萬的下載量。此次升級的主要目的是解決大型語言模型中長期存在的推理瓶頸問題,並進一步提升計算效率。
技術細節:在推理加速方面實現“預見性”
傳統的語言模型推理往往受到記憶體頻寬的限制。簡單來說,當處理器生成文字時,將數百億個引數從記憶體傳輸到計算單元會消耗大量時間。這種資料傳輸速度遠低於處理速度,導致硬體資源大部分時間處於閒置狀態,從而造成明顯的響應延遲。
為了解決這一問題,谷歌引入了推測性解碼技術。其原理可以理解為“主從”配置:系統將像Gemma 4 31B這樣的重型目標模型與輕量級的多令牌預測生成器結合使用。生成器利用閒置的計算資源提前預測多個即將出現的令牌,而更強大的主模型則同時進行並行驗證。當預測結果一致時,模型就可以在一次計算中確定整個序列,從而大幅減少文字生成所需的時間。
測試結果:蘋果晶片和消費級顯示卡取得了顯著提升
根據官方測試資料,在本地裝置上這種加速效果尤為明顯。在蘋果晶片環境中,當批次大小介於4到8之間時,Gemma 4 26B模型的本地推理速度提高了大約2.2倍。
這意味著開發者現在可以在個人電腦和普通的消費級顯示卡上更順暢地執行復雜的離線程式設計助手或智慧代理工作流程。此外,提升的推理效率還顯著降低了邊緣裝置的能耗,為移動人工智慧的更廣泛應用鋪平了道路。
人工智慧應用的邊界正在不斷拓展
此次技術升級主要針對那些對低延遲有嚴格要求的場景,例如實時聊天機器人、自動化程式設計工具以及各種自主代理。藉助多令牌預測生成器,谷歌證明了即使在資源有限的硬體環境中,開發者也能部署最先進的語言模型,而不會影響響應速度或計算精度。
隨著推理成本的不斷下降和技術障礙的逐步消除,Gemma4及其相關技術的不斷發展正在推動人工智慧從雲端走向更多的個人計算裝置。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






