谷歌透過將原生計算機操作整合至 Gemini 3.5 Flash 中,打破了多模態切換的壁壘。

Google DeepMind 團隊宣佈取得了重大突破,他們將原生計算機操作能力直接整合到了 Gemini 3.5 Flash 模型中。如今,開發者只需使用同一個模型,就能構建出能夠在瀏覽器、移動裝置和桌面端上自主檢視螢幕內容並執行相應操作的 AI 智慧體。
此前,這項功能僅作為獨立的模型提供,開發者不得不處理不同模型之間的複雜切換與上下文傳遞問題。透過原生整合後,AI 在執行跨平臺的長時任務時無需再手動傳遞資訊,從而大幅簡化了開發流程。
避免上下文丟失以提高智慧體可靠性
Google 的團隊認為,AI 智慧體的核心瓶頸並非單個工具的侷限性,而是在切換不同工具時會出現的上下文資訊丟失問題。透過將搜尋、地圖和計算機操作統一在同一個模型架構中,上下文能夠實現連續流轉,進而顯著降低複雜任務出錯的可能性。
這種“多工具整合”的設計類似於建造一座內部設有連線通道的單一建築,從而避免了多座獨立建築之間繁瑣且易出錯的通訊過程。這樣的架構變革有望大幅提升基於智慧體的任務的可靠性與響應速度。
針對三種核心場景構建多層安全防護體系
這項原生能力將主要應用於三種核心場景:需要連續執行數小時或數天的自動化任務、用於自動驗證 UI 一致性的持續軟體測試,以及涉及多款應用程式的知識密集型工作。這些場景高度依賴任務間的上下文連貫性,能夠有效替代人類執行重複性、高強度的操作。
在安全性方面,Google 採用了多層防禦策略,包括針對性的對抗性訓練、針對敏感操作的企業級安全防護措施,以及間接提示注入檢測功能。這些機制共同幫助企業使用者在開放且缺乏管控的計算機環境中建立起較為完善的安全屏障。
相關文章
中國啟動大模型與IPv6專項行動:生成式AI應用將全面擁抱下一代網路
雄安新區正式啟動面向智慧時代網路基礎設施升級的重大舉措第一階段。中國國家網際網路資訊辦公室(CAC)聯合北京、上海、浙江、深圳等地的地方網信部門,以及五家頭部大模型開發者,共同啟動“人工智慧大模型IPv6能力增強專項行動”。此次協同行動旨在確保生成式大模型應用在IPv6網路上的全面支援,為智慧時代的未來發展奠定堅實的網路基礎。IPv6是由網際網路工程任務組(IETF)制定的下一代網際網路協議,旨在取代IPv4。其採用128位地址,地址空間高達2^128——這一規模之大,理論上可為地球上的每一粒沙子分
全球人工智慧監管轉向釋出前強制測試
隨著大型人工智慧模型的快速發展,全球監管框架正從自願指南轉向由政府主導、基於證據的強制性要求。這一轉變標誌著實用化人工智慧監管新時代的開啟。1. 新標準:誰負責審計人工智慧模型?此前,開發者主要依賴內部紅隊測試或自行釋出的安全報告。這種自我評估方式已不再滿足國家安全要求。引領這一轉變的是英國人工智慧安全研究所(AISI)和美國商務部的人工智慧標準與創新中心(CAISI)。釋出前的國家安全評估現已成為行業標準要求。測試內容是什麼? 重點已從廣泛的原則轉向具體的技術風險:大規模網路攻擊的潛力
阿里巴巴的馬雲、曹興信:人工智慧將成為無形基礎設施,知識工作者總可尋市場達50萬億美元
阿里巴巴集團主席馬雲最近在“Vento 2026”(義大利技術與投資峰會)上發表演講,預測人工智慧將在五年內從獨立話題轉變為跨行業的嵌入式基礎設施。馬雲指出,儘管當前的人工智慧在節省時間方面表現出色,但其增強我們時間利用方式的潛力仍 largely 未被挖掘。他將提升知識型工作者的生產力視為最具可行性的應用場景,估計總可觸達市場規模為 50 萬億美元。此外,人工智慧有望加速醫療和科學研究的突破。關於阿里巴巴的戰略路線圖,馬雲將公司的發展劃分為“公元前”(BC)和“公元后”(AD)兩個階段,以
相關專題推薦
評論 (0)
0/500

Google DeepMind 團隊宣佈取得了重大突破,他們將原生計算機操作能力直接整合到了 Gemini 3.5 Flash 模型中。如今,開發者只需使用同一個模型,就能構建出能夠在瀏覽器、移動裝置和桌面端上自主檢視螢幕內容並執行相應操作的 AI 智慧體。
此前,這項功能僅作為獨立的模型提供,開發者不得不處理不同模型之間的複雜切換與上下文傳遞問題。透過原生整合後,AI 在執行跨平臺的長時任務時無需再手動傳遞資訊,從而大幅簡化了開發流程。
避免上下文丟失以提高智慧體可靠性
Google 的團隊認為,AI 智慧體的核心瓶頸並非單個工具的侷限性,而是在切換不同工具時會出現的上下文資訊丟失問題。透過將搜尋、地圖和計算機操作統一在同一個模型架構中,上下文能夠實現連續流轉,進而顯著降低複雜任務出錯的可能性。
這種“多工具整合”的設計類似於建造一座內部設有連線通道的單一建築,從而避免了多座獨立建築之間繁瑣且易出錯的通訊過程。這樣的架構變革有望大幅提升基於智慧體的任務的可靠性與響應速度。
針對三種核心場景構建多層安全防護體系
這項原生能力將主要應用於三種核心場景:需要連續執行數小時或數天的自動化任務、用於自動驗證 UI 一致性的持續軟體測試,以及涉及多款應用程式的知識密集型工作。這些場景高度依賴任務間的上下文連貫性,能夠有效替代人類執行重複性、高強度的操作。
在安全性方面,Google 採用了多層防禦策略,包括針對性的對抗性訓練、針對敏感操作的企業級安全防護措施,以及間接提示注入檢測功能。這些機制共同幫助企業使用者在開放且缺乏管控的計算機環境中建立起較為完善的安全屏障。
中國啟動大模型與IPv6專項行動:生成式AI應用將全面擁抱下一代網路
雄安新區正式啟動面向智慧時代網路基礎設施升級的重大舉措第一階段。中國國家網際網路資訊辦公室(CAC)聯合北京、上海、浙江、深圳等地的地方網信部門,以及五家頭部大模型開發者,共同啟動“人工智慧大模型IPv6能力增強專項行動”。此次協同行動旨在確保生成式大模型應用在IPv6網路上的全面支援,為智慧時代的未來發展奠定堅實的網路基礎。IPv6是由網際網路工程任務組(IETF)制定的下一代網際網路協議,旨在取代IPv4。其採用128位地址,地址空間高達2^128——這一規模之大,理論上可為地球上的每一粒沙子分
全球人工智慧監管轉向釋出前強制測試
隨著大型人工智慧模型的快速發展,全球監管框架正從自願指南轉向由政府主導、基於證據的強制性要求。這一轉變標誌著實用化人工智慧監管新時代的開啟。1. 新標準:誰負責審計人工智慧模型?此前,開發者主要依賴內部紅隊測試或自行釋出的安全報告。這種自我評估方式已不再滿足國家安全要求。引領這一轉變的是英國人工智慧安全研究所(AISI)和美國商務部的人工智慧標準與創新中心(CAISI)。釋出前的國家安全評估現已成為行業標準要求。測試內容是什麼? 重點已從廣泛的原則轉向具體的技術風險:大規模網路攻擊的潛力
阿里巴巴的馬雲、曹興信:人工智慧將成為無形基礎設施,知識工作者總可尋市場達50萬億美元
阿里巴巴集團主席馬雲最近在“Vento 2026”(義大利技術與投資峰會)上發表演講,預測人工智慧將在五年內從獨立話題轉變為跨行業的嵌入式基礎設施。馬雲指出,儘管當前的人工智慧在節省時間方面表現出色,但其增強我們時間利用方式的潛力仍 largely 未被挖掘。他將提升知識型工作者的生產力視為最具可行性的應用場景,估計總可觸達市場規模為 50 萬億美元。此外,人工智慧有望加速醫療和科學研究的突破。關於阿里巴巴的戰略路線圖,馬雲將公司的發展劃分為“公元前”(BC)和“公元后”(AD)兩個階段,以





首頁






