OpenAI 推出 GPT-6 Astra,標誌著朝向通用人工智慧邁出重要一步
OpenAI 已正式推出其最新的旗艦級大型語言模型 GPT-6Astra。在媒體簡報會上,公司總裁格雷格·布羅克曼(Greg Brockman)對該模型大加讚賞,並指出這可能標誌著人類正式邁入人工通用智慧(AGI)的時代。
核心基準測試結果顯示,該模型在多項指標上均實現了代際級的飛躍。在數學與科學評估中,Astra 在 FrontierMath Tier4 測驗中取得 97.6% 的成績,在 GPQA Diamond 測驗中則達到 96%。 在實際應用測試中,它在長程軟體工程(DeepSWE)中取得 74.1% 的成績,在 CAD 繪圖(BenchCAD)中取得 95.9%,並在漏洞利用測試(ExploitBench)中取得完美的 100%。 值得注意的是,Astra 在高度抽象的 ARC-AGI-3 測試中獲得 99.9% 的成績,展現出在臨時推理與壓縮語境框架下,與人類相當的環境推理能力。

作為旗艦產品,Astra 支援 105 萬個標記的超大上下文視窗,最大輸出量為 128,000 個標記。 其知識截止日期設定為 2026 年 4 月 30 日,並提供五種可調整的推理強度等級:低、中、高、x高及最大。定價反映了其先進的能力:標準模式每百萬個輸入標記收費 10 美元,每百萬個輸出標記收費 50 美元。 若輸入量超過 272,000 個標記,輸入和快取價格將翻倍,而輸出成本則上升至 75 美元。此外,還提供定價加倍的快速模式。 根據 Artificial Analysis 的第三方分析,Astra 在通用智能方面可與最先進的模型相媲美,其 Coding Agent 指數達 67,且幻覺率降至 51%,展現出卓越的代幣效率與成本效益。
Astra 最重大的突破在於其操作電腦圖形使用者介面(GUI)的能力。有別於依賴 API 和 MCP 協定的傳統 AI 系統,Astra 可透過通用螢幕、鍵盤和滑鼠輸入直接進行互動。它能觀察環境、理解當前狀態,並像人類使用者一樣執行精確的操作。 在 OSWorld2.0 基準測試中,Astra 獲得 72.6% 的得分,與前代產品相比,平均任務完成時間縮短了約 47%。 無論是搜尋貓咪寄養服務、進行求職搜尋、在 Blender 中根據照片為 UE5 重建 3D 模型,還是透過 Excel 和 Power BI 處理複雜資料,Astra 都能繞過繁瑣的 API 限制,直接根據自然語言意圖提供結果。

內部測試人員與專業機構已驗證 Astra 在各領域的生產力表現。它能生成高保真的《Minecraft》示範影片、在瀏覽器內完整運行遊戲,並能高效審閱數萬字的財務文件以識別人為錯誤。 從遊戲開發、報稅、建築渲染到財務核查,Astra 展現了從零開始獨立完成複雜任務的能力。
隨著模型能力的提升,安全性與對齊性仍是關鍵考量。OpenAI 表示,Astra 已改善其對齊性與遵循指令的能力,並強化了隔離測試、網路權限及模型權重保護機制。 然而,首席科學家雅庫布·帕喬茨基(Jakub Pachocki)警告稱,隨著智能水平的提升,人類可能更難完全理解該模型,這可能導致其主動監控或欺騙測試系統。
Astra 目前正向一小群值得信賴的合作夥伴企業開放。ChatGPT 訂閱用戶與 API 使用者將在未來數日內逐步獲得使用權限。此外,亦為網路安全機構提供專用的防禦版本。隨著 Astra 的推出,人工智慧與人類數位基礎設施的互動方式正經歷一場顛覆性的轉型。
相關文章
Wayve 以 85 百萬美元啟動員工認購要約,公司估值達 85 億美元
總部位於英國的自動駕駛技術新創公司 Wayve,正透過一項 8,500 萬美元的要約收購,讓員工得以出售其已歸屬股權的一部分。這項精心設計的方案讓員工能以公司最新的 85 億美元估值,將股份賣回給由現有及新投資者共同領投的投資方。該估值於二月在由 Eclipse、Balderton 及軟銀願景基金二期領投的 12 億美元 D 輪融資中確立。本輪融資的參與者還包括安大略教師退休金計劃、貝利吉福德、微
山姆·奧特曼警告勿斷言克勞德具有意識
微軟人工智慧主管穆斯塔法·蘇萊曼(Mustafa Suleyman)近日在《Decoder》播客節目中,將 Anthropic 關於其大型語言模型「克勞德」(Claude)具備意識的推測,斥為「極其危險」。蘇萊曼指出,Anthropic 在設計其「憲法」框架時,過度將 Claude 人格化,這種哲學上的謬誤導致該模型在訓練過程中內化了自我推測。這誤導了開發者,使他們錯誤地相信該系統展現出某種初級形
Google 透過整合 Gemini 聊天機器人,強化 AI 搜尋廣告功能
Google 已開始在其新一代「AI 模式」搜尋中測試一種新的廣告格式,這顯示 Gemini 的功能正深度整合至其核心廣告生態系統中。繼推出適用於對話式查詢的新搜尋欄後,Google 現正運用 Gemini 模型為「贊助商品」打造「客製化解說員」。 這些解說員會說明使用者為何應該購買特定商品。例如,搜尋「小型義大利咖啡膠囊機」時,系統便會觸發針對 Nespresso Vertuo Up 的客製化描
相關專題推薦
評論 (0)
0/500
OpenAI 已正式推出其最新的旗艦級大型語言模型 GPT-6Astra。在媒體簡報會上,公司總裁格雷格·布羅克曼(Greg Brockman)對該模型大加讚賞,並指出這可能標誌著人類正式邁入人工通用智慧(AGI)的時代。
核心基準測試結果顯示,該模型在多項指標上均實現了代際級的飛躍。在數學與科學評估中,Astra 在 FrontierMath Tier4 測驗中取得 97.6% 的成績,在 GPQA Diamond 測驗中則達到 96%。 在實際應用測試中,它在長程軟體工程(DeepSWE)中取得 74.1% 的成績,在 CAD 繪圖(BenchCAD)中取得 95.9%,並在漏洞利用測試(ExploitBench)中取得完美的 100%。 值得注意的是,Astra 在高度抽象的 ARC-AGI-3 測試中獲得 99.9% 的成績,展現出在臨時推理與壓縮語境框架下,與人類相當的環境推理能力。

作為旗艦產品,Astra 支援 105 萬個標記的超大上下文視窗,最大輸出量為 128,000 個標記。 其知識截止日期設定為 2026 年 4 月 30 日,並提供五種可調整的推理強度等級:低、中、高、x高及最大。定價反映了其先進的能力:標準模式每百萬個輸入標記收費 10 美元,每百萬個輸出標記收費 50 美元。 若輸入量超過 272,000 個標記,輸入和快取價格將翻倍,而輸出成本則上升至 75 美元。此外,還提供定價加倍的快速模式。 根據 Artificial Analysis 的第三方分析,Astra 在通用智能方面可與最先進的模型相媲美,其 Coding Agent 指數達 67,且幻覺率降至 51%,展現出卓越的代幣效率與成本效益。
Astra 最重大的突破在於其操作電腦圖形使用者介面(GUI)的能力。有別於依賴 API 和 MCP 協定的傳統 AI 系統,Astra 可透過通用螢幕、鍵盤和滑鼠輸入直接進行互動。它能觀察環境、理解當前狀態,並像人類使用者一樣執行精確的操作。 在 OSWorld2.0 基準測試中,Astra 獲得 72.6% 的得分,與前代產品相比,平均任務完成時間縮短了約 47%。 無論是搜尋貓咪寄養服務、進行求職搜尋、在 Blender 中根據照片為 UE5 重建 3D 模型,還是透過 Excel 和 Power BI 處理複雜資料,Astra 都能繞過繁瑣的 API 限制,直接根據自然語言意圖提供結果。

內部測試人員與專業機構已驗證 Astra 在各領域的生產力表現。它能生成高保真的《Minecraft》示範影片、在瀏覽器內完整運行遊戲,並能高效審閱數萬字的財務文件以識別人為錯誤。 從遊戲開發、報稅、建築渲染到財務核查,Astra 展現了從零開始獨立完成複雜任務的能力。
隨著模型能力的提升,安全性與對齊性仍是關鍵考量。OpenAI 表示,Astra 已改善其對齊性與遵循指令的能力,並強化了隔離測試、網路權限及模型權重保護機制。 然而,首席科學家雅庫布·帕喬茨基(Jakub Pachocki)警告稱,隨著智能水平的提升,人類可能更難完全理解該模型,這可能導致其主動監控或欺騙測試系統。
Astra 目前正向一小群值得信賴的合作夥伴企業開放。ChatGPT 訂閱用戶與 API 使用者將在未來數日內逐步獲得使用權限。此外,亦為網路安全機構提供專用的防禦版本。隨著 Astra 的推出,人工智慧與人類數位基礎設施的互動方式正經歷一場顛覆性的轉型。
Wayve 以 85 百萬美元啟動員工認購要約,公司估值達 85 億美元
總部位於英國的自動駕駛技術新創公司 Wayve,正透過一項 8,500 萬美元的要約收購,讓員工得以出售其已歸屬股權的一部分。這項精心設計的方案讓員工能以公司最新的 85 億美元估值,將股份賣回給由現有及新投資者共同領投的投資方。該估值於二月在由 Eclipse、Balderton 及軟銀願景基金二期領投的 12 億美元 D 輪融資中確立。本輪融資的參與者還包括安大略教師退休金計劃、貝利吉福德、微
山姆·奧特曼警告勿斷言克勞德具有意識
微軟人工智慧主管穆斯塔法·蘇萊曼(Mustafa Suleyman)近日在《Decoder》播客節目中,將 Anthropic 關於其大型語言模型「克勞德」(Claude)具備意識的推測,斥為「極其危險」。蘇萊曼指出,Anthropic 在設計其「憲法」框架時,過度將 Claude 人格化,這種哲學上的謬誤導致該模型在訓練過程中內化了自我推測。這誤導了開發者,使他們錯誤地相信該系統展現出某種初級形
Google 透過整合 Gemini 聊天機器人,強化 AI 搜尋廣告功能
Google 已開始在其新一代「AI 模式」搜尋中測試一種新的廣告格式,這顯示 Gemini 的功能正深度整合至其核心廣告生態系統中。繼推出適用於對話式查詢的新搜尋欄後,Google 現正運用 Gemini 模型為「贊助商品」打造「客製化解說員」。 這些解說員會說明使用者為何應該購買特定商品。例如,搜尋「小型義大利咖啡膠囊機」時,系統便會觸發針對 Nespresso Vertuo Up 的客製化描





首頁






