GPT-5.4 展現原生駭客能力,OSWorld 在 AI 突破性進展中表現超越人類

領先競爭對手:GPT-5.4 開啟原生電腦控制時代
2026年3月,OpenAI 意外發布了GPT-5.4,徹底重塑了 AI 代理人的競爭格局。作為 OpenAI 首個具備原生電腦操作能力的通用模型,GPT-5.4 不再依賴外部轉接器。取而代之的是,它能直接解讀螢幕截圖、模擬滑鼠點擊與鍵盤輸入,並像人類使用者一樣操作桌面軟體。
在衡量真實世界桌面操作能力的OSWorld驗證基準測試中,GPT-5.4 的成功率飆升至75.0%。 作為對照,人類平均基準為 72.4%,而前一代的 GPT-5.2 僅獲得 47.3% 的成績。這表明,在歷史上首次,人工智慧在電腦操控方面的流暢度已超越了普通人類使用者的水準。
實境測試:專業人士的「數位分身」成為現實
目前可透過網頁版及 Codex 平台使用,實境測試顯示 GPT-5.4 幾乎能處理所有電腦操作:
深度應用掌握:它能啟動日曆應用程式並自主請求權限以設定提醒;還能精準定位並開啟「小遊洲」等第三方應用程式來播放特定內容。
系統級存取權限:使用者可指示其直接更改電腦桌布,或在終端機中熟練運用各類開發工具。
原生運算邏輯:不僅止於提供答案,更能直接在系統原生計算機應用程式中執行模擬運算。
這種「原生體驗」標誌著 AI 從「對話助理」進化為「執行實體」。
完美搭配:GPT-5.4 解決 OpenClaw 的核心挑戰
在 2026 年初人氣飆升(獲得超過 25 萬顆星)的開源專案OpenClaw,已找到其「理想模型」。OpenClaw 的核心理念是「真正好用的 AI」,而 GPT-5.4 在以下四個關鍵維度上與之完美契合:
原生控制對齊:透過與 GPT-5.4 整合,OpenClaw 無需複雜的變通方案即可實現桌面自動化,帶來顯著的效能提升。
100 萬字元上下文:超長上下文視窗解決了代理程式在執行長時間任務時面臨的「健忘」問題,為 OpenClaw 提供龐大的「工作區」以處理複雜檔案。
工具搜尋成本革命:GPT-5.4 的隨需使用機制將標記消耗降低 47%,大幅削減全天候運行代理程式所產生的 API 成本。
推理能力飛躍:在專業工作任務上,GPT-5.4 的表現超越 83% 的人類專家,使 OpenClaw 得以從基礎的「腳本執行者」進化為能處理財務分析與投資備忘錄的高階專家。
產業洞察:高技能職位的自動化奇點已然來臨
HyperWriteAI 執行長 Matt Shumer 將 GPT-5.4 的程式設計能力形容為「近乎完美」;Mercor AI 執行長 Brenda 則認為,該模型已瀕臨超越頂尖顧問公司、投資銀行及律師事務所專業水準的門檻。這預示著那些曾被視為獨具人類特質且不可取代的職位,如今正面臨來自 AI 代理人的全面挑戰。
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (1)
0/500

領先競爭對手:GPT-5.4 開啟原生電腦控制時代
2026年3月,OpenAI 意外發布了GPT-5.4,徹底重塑了 AI 代理人的競爭格局。作為 OpenAI 首個具備原生電腦操作能力的通用模型,GPT-5.4 不再依賴外部轉接器。取而代之的是,它能直接解讀螢幕截圖、模擬滑鼠點擊與鍵盤輸入,並像人類使用者一樣操作桌面軟體。
在衡量真實世界桌面操作能力的OSWorld驗證基準測試中,GPT-5.4 的成功率飆升至75.0%。 作為對照,人類平均基準為 72.4%,而前一代的 GPT-5.2 僅獲得 47.3% 的成績。這表明,在歷史上首次,人工智慧在電腦操控方面的流暢度已超越了普通人類使用者的水準。
實境測試:專業人士的「數位分身」成為現實
目前可透過網頁版及 Codex 平台使用,實境測試顯示 GPT-5.4 幾乎能處理所有電腦操作:
深度應用掌握:它能啟動日曆應用程式並自主請求權限以設定提醒;還能精準定位並開啟「小遊洲」等第三方應用程式來播放特定內容。
系統級存取權限:使用者可指示其直接更改電腦桌布,或在終端機中熟練運用各類開發工具。
原生運算邏輯:不僅止於提供答案,更能直接在系統原生計算機應用程式中執行模擬運算。
這種「原生體驗」標誌著 AI 從「對話助理」進化為「執行實體」。
完美搭配:GPT-5.4 解決 OpenClaw 的核心挑戰
在 2026 年初人氣飆升(獲得超過 25 萬顆星)的開源專案OpenClaw,已找到其「理想模型」。OpenClaw 的核心理念是「真正好用的 AI」,而 GPT-5.4 在以下四個關鍵維度上與之完美契合:
原生控制對齊:透過與 GPT-5.4 整合,OpenClaw 無需複雜的變通方案即可實現桌面自動化,帶來顯著的效能提升。
100 萬字元上下文:超長上下文視窗解決了代理程式在執行長時間任務時面臨的「健忘」問題,為 OpenClaw 提供龐大的「工作區」以處理複雜檔案。
工具搜尋成本革命:GPT-5.4 的隨需使用機制將標記消耗降低 47%,大幅削減全天候運行代理程式所產生的 API 成本。
推理能力飛躍:在專業工作任務上,GPT-5.4 的表現超越 83% 的人類專家,使 OpenClaw 得以從基礎的「腳本執行者」進化為能處理財務分析與投資備忘錄的高階專家。
產業洞察:高技能職位的自動化奇點已然來臨
HyperWriteAI 執行長 Matt Shumer 將 GPT-5.4 的程式設計能力形容為「近乎完美」;Mercor AI 執行長 Brenda 則認為,該模型已瀕臨超越頂尖顧問公司、投資銀行及律師事務所專業水準的門檻。這預示著那些曾被視為獨具人類特質且不可取代的職位,如今正面臨來自 AI 代理人的全面挑戰。
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






