隨著 Sol 和 Luna 加入,OpenAI GPT-6 在各項基準測試中將代幣成本削減一半
![]()
根據 Artificial Analysis 的報告,GPT-6 Sol (max) 在智慧能力方面名列榜首,售價為 48 美元。圖片來源:Getty Images
在 OpenAI 推出 GPT-6 Sol 和 Luna 之後,解決方案工程總監 Matt Weaver 向《AI Magazine》闡述了這些新模型如何為企業提供更強大的營運靈活性。
OpenAI 近期推出了 GPT-6 Astra,並將其描述為「全球最智能且最符合需求模型」。該人工智慧實驗室隨後又宣布推出 GPT-6 Sol 和 GPT-6 Luna,這兩款性價比高的變體模型採用與其旗艦模型 GPT-6 Astra 相似的訓練方法。
隨著對代幣使用成本上漲的擔憂日益加劇,人工智慧公司之間的價格競爭也愈發激烈,尤其是當中國的開放式模型威脅要搶佔企業客戶時。
基準測試公司 Artificial Analysis 指出,GPT-6 Sol 和 Luna 與 GPT-5.6 Sol 及 Luna 相比,成本降低了半數,正「推動成本效益的邊界」。
OpenAI 解決方案工程主管 Matt Weaver 向《AI Magazine》表示:「透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型。」
OpenAI 解決方案工程主管 Matt Weaver。圖片來源:Matt Weaver/LinkedIn
將模型與工作流程相結合
OpenAI 聲稱其 GPT-6 模型引領成本-效能曲線,透過專為高效、大規模部署設計的基礎架構,在所有層級皆能提供卓越的能力。
該公司指出,快取與推論技術的進步使這些模型能以更低的成本提供服務,並透過將 Sol 和 Luna 的 API 價格(相較於 GPT-5.6 的促銷費率)下調 50%,將節省的成本直接回饋給用戶。
在闡述各 AI 模型的獨特角色時,Matt 補充道:「GPT-6 Astra 專為要求最嚴苛的專案而設計,在這些專案中,極致的處理能力至關重要。

Matt 進一步說明:「GPT-6 Sol 專為複雜的專業任務而打造,包括繁複的商業工作流程與程式編寫;而 GPT-6 Luna 則為文件摘要或資訊擷取等大量且定義明確的任務,提供更高效的解決方案。
「Sol 和 Luna 將 Astra 在專業工作、事實準確性、程式碼編寫及電腦應用方面的進展,融入到更快、更經濟實惠的模型中。隨著 AI 從實驗階段過渡到核心業務運作,為每種任務類型選擇合適的模型至關重要。
「我們的目標是讓先進的人工智慧在各組織中得以實際應用——協助團隊加快進度、做出更明智的決策,並將更多時間投入於更高價值的工作。」
關鍵事實
- OpenAI 將 GPT-6 Sol 和 Luna 的 API 價格較 GPT-5.6 調降 50%
- GPT-6 Sol 在 AutomationBench 上的表現超越 Claude Opus 5,成本卻僅為其 9%
- GPT-6 Sol(最高設定)的輸出速度可達每秒 131 個標記
- Intelligence Index 任務成本降至 Sol 每項 1.06 美元、Luna 每項 0.07 美元
- GPT-6 Sol 與 Luna 在 AA-Omniscience 基準測試中均展現出較低的幻覺率。
模型效能分析
OpenAI 強調,在 AutomationBench(一項跨應用程式的商業工作流程測試)中,GPT-6 Sol 採用「xhigh」努力程度時,其表現優於採用「max」努力程度的 Claude Opus 5,且每項任務的成本僅為 Opus 5 的 9%。
該公司指出,在「高」努力程度下,GPT-6 Luna 的表現較前代模型提升了 5.4 個百分點,且每項任務的成本降低了 58%。
OpenAI 指出,在評估代理程式處理複雜專業工作流程能力的「Agents’ Last Exam」測試中,以「max effort」模式運作的 GPT-6 Sol 獲得 56.4% 的得分,超越 Claude Opus 5 在該評估中的最高分,且每項任務的成本降低了 61%。
該公司指出,在評估程式設計代理能否產出可直接合併至真實程式碼庫的變更的「FrontierCode」測試中,GPT-6 Sol 相較於 GPT-5.6 Sol 展現顯著進步,且以遠低於後者的成本達到與 Claude Fable 5.1 xhigh 相當的表現。
這兩款模型在「AA-Omniscience」(Artificial Analysis 用於評估知識與幻覺的基準測試)中,均展現出較低的幻覺發生率。
透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型
——OpenAI 解決方案工程總監Matt Weaver
每項「智慧指數任務」的成本。圖片來源:Artificial Analysis
這家基準測試公司解釋道,GPT-6 Sol 版本包含六種模型,每種模型在智慧水平、效能及定價方面均具有獨特特性。透過比較這六種模型的關鍵指標,Artificial Analysis 發現:
- 就智能而言,GPT-6 Sol 的頂級模型是 GPT-6 Sol (max),數值為 48。
- 就輸出速度而言,最快的模型是 GPT-6 Sol (max),達 131 t/s。
- 就延遲而言,GPT-6 Sol (Non-reasoning) 以 0.93 秒的「首次回答標記時間」表現最優。
- 在定價方面,GPT-6 Sol (low) 每任務成本為 0.13 美元,為最低。各模型間的價格差異最高可達 8 倍。
該公司發現,在各模型中,智慧指數(Intelligence Index)與編碼代理指數(Coding Agent Index)的分數仍與 GPT-5.6 保持一致,部分評估指標有所進步,部分則出現退步。
GPT-6 Sol 專為艱鉅的專業工作而設計——從複雜的商業工作流程到程式碼編寫皆然;而 GPT-6 Luna 則為大量且定義明確的任務(如文件摘要或資訊擷取)提供更高效的選項。
——OpenAI 解決方案工程主管 Matt Weaver
在 FrontierCode 1.1 Main 中,AI 代理所編寫的程式碼不僅會根據正確性進行評分,還會評估其「可合併性」:例如測試品質、範圍規範、程式碼風格以及是否符合程式碼庫標準。圖片來源:OpenAI
成本效益的重要性
圍繞 AI 模型定價的競爭日益白熱化,這往往是由低成本的中國模型所驅動。 正如布魯金斯學會的凱爾·陳(Kyle Chan)在部落格中所指出的,中國模型大多為開源,讓使用者能夠自訂模型,並以較低價格取得具備美國模型 90% 功能的能力。因此,這些模型正在以成本為導向的企業中迅速佔據一席之地。
OpenAI 正積極調整策略以維持競爭力;儘管新模型每項任務產出的標記數量略多,但運行「人工分析智慧指數(Artificial Analysis Intelligence Index)」的成本卻顯著降低:
- GPT-6 Sol(最高設定):每項任務成本為 1.06 美元(較 GPT-5.6 Sol 的 1.99 美元下降約 50%),即使輸出代幣量從 GPT-5.6 的 2.9 萬增加至 3.1 萬。
- GPT-6 Luna(最高設定):每項任務成本為 0.07 美元(較 GPT-5.6 Luna 的 0.18 美元下降約 60%),儘管輸出代幣量從 GPT-5.6 的 4.1 萬增加至 5.1 萬。
Artificial Analysis 指出,這兩項發布使 OpenAI 得以佔據成本效益帕累托前沿(即在不提高價格的情況下無法進一步提升效能的最佳邊界)的顯著部分。
透過在不犧牲效能的前提下降低門檻,OpenAI 正積極因應企業的「代幣疲勞」問題,同時抵禦低成本市場競爭對手的挑戰。
相關文章
Hexagon:超過半數的成年人對機器人感到興奮
機器人正日益融入企業營運。圖片來源:HumanoidHexagon 的數據顯示,59% 的成年人對與機器人共事感到興奮,但日益壯大的「機器人世代」兒童對人工智慧工作環境的期待更是遠超於此Hexagon 最新數據顯示,超過半數的成年人對與機器人共事的展望感到興奮。這項數據將成年人的觀點與兒童的觀點進行了對比,後者持有不同看法,且將引領下一代。數據顯示,五分之四的兒童(80%)表示對機器人感到興奮,而
AI 墳場:一份持續更新的失敗專案與新創公司清單
Relay 是一項以人工智慧驅動的工作流程自動化平台,定位為 Zapier 的替代方案,已於週一停止營運。該服務讓使用者能透過 AI 代理程式自動化電子郵件和任務工作流程,但隨著 OpenAI、Google 及其他主要平台將類似的自動化功能直接整合至其生態系統中,成立五年的 Relay 已難以證明其作為獨立產品的存在價值。Relay 這家被大型平台超越的新創公司,反映了當前產業格局的一面。然而,許
OpenAI 押注家庭,ChatGPT 深入千家萬戶
ChatGPT 將生成式 AI 推向聚光燈下已逾三年,OpenAI 正將其業務範圍從個人使用者擴充套件至整個家庭。OpenAI 正在舊金山招聘一名產品經理,以開發其平臺上的家庭導向體驗,目標受眾包括父母、照護者和老年人。根據職位列表,該職位要求具備為家庭及其他對信任敏感的消費者應用開發產品的背景。此次招聘與 ChatGPT 不斷演變的使用者群體相契合,其使用者年齡已超出最初的年輕群體。Sensor Tower 獨家向 TechCrunch 分享的資料顯示,全球範圍內,35 歲及以上使用者在 Q2 佔 Cha
相關專題推薦
評論 (0)
0/500
根據 Artificial Analysis 的報告,GPT-6 Sol (max) 在智慧能力方面名列榜首,售價為 48 美元。圖片來源:Getty Images
在 OpenAI 推出 GPT-6 Sol 和 Luna 之後,解決方案工程總監 Matt Weaver 向《AI Magazine》闡述了這些新模型如何為企業提供更強大的營運靈活性。
OpenAI 近期推出了 GPT-6 Astra,並將其描述為「全球最智能且最符合需求模型」。該人工智慧實驗室隨後又宣布推出 GPT-6 Sol 和 GPT-6 Luna,這兩款性價比高的變體模型採用與其旗艦模型 GPT-6 Astra 相似的訓練方法。
隨著對代幣使用成本上漲的擔憂日益加劇,人工智慧公司之間的價格競爭也愈發激烈,尤其是當中國的開放式模型威脅要搶佔企業客戶時。
基準測試公司 Artificial Analysis 指出,GPT-6 Sol 和 Luna 與 GPT-5.6 Sol 及 Luna 相比,成本降低了半數,正「推動成本效益的邊界」。
OpenAI 解決方案工程主管 Matt Weaver 向《AI Magazine》表示:「透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型。」
OpenAI 解決方案工程主管 Matt Weaver。圖片來源:Matt Weaver/LinkedIn
將模型與工作流程相結合
OpenAI 聲稱其 GPT-6 模型引領成本-效能曲線,透過專為高效、大規模部署設計的基礎架構,在所有層級皆能提供卓越的能力。
該公司指出,快取與推論技術的進步使這些模型能以更低的成本提供服務,並透過將 Sol 和 Luna 的 API 價格(相較於 GPT-5.6 的促銷費率)下調 50%,將節省的成本直接回饋給用戶。
在闡述各 AI 模型的獨特角色時,Matt 補充道:「GPT-6 Astra 專為要求最嚴苛的專案而設計,在這些專案中,極致的處理能力至關重要。

Matt 進一步說明:「GPT-6 Sol 專為複雜的專業任務而打造,包括繁複的商業工作流程與程式編寫;而 GPT-6 Luna 則為文件摘要或資訊擷取等大量且定義明確的任務,提供更高效的解決方案。
「Sol 和 Luna 將 Astra 在專業工作、事實準確性、程式碼編寫及電腦應用方面的進展,融入到更快、更經濟實惠的模型中。隨著 AI 從實驗階段過渡到核心業務運作,為每種任務類型選擇合適的模型至關重要。
「我們的目標是讓先進的人工智慧在各組織中得以實際應用——協助團隊加快進度、做出更明智的決策,並將更多時間投入於更高價值的工作。」
關鍵事實
- OpenAI 將 GPT-6 Sol 和 Luna 的 API 價格較 GPT-5.6 調降 50%
- GPT-6 Sol 在 AutomationBench 上的表現超越 Claude Opus 5,成本卻僅為其 9%
- GPT-6 Sol(最高設定)的輸出速度可達每秒 131 個標記
- Intelligence Index 任務成本降至 Sol 每項 1.06 美元、Luna 每項 0.07 美元
- GPT-6 Sol 與 Luna 在 AA-Omniscience 基準測試中均展現出較低的幻覺率。
模型效能分析
OpenAI 強調,在 AutomationBench(一項跨應用程式的商業工作流程測試)中,GPT-6 Sol 採用「xhigh」努力程度時,其表現優於採用「max」努力程度的 Claude Opus 5,且每項任務的成本僅為 Opus 5 的 9%。
該公司指出,在「高」努力程度下,GPT-6 Luna 的表現較前代模型提升了 5.4 個百分點,且每項任務的成本降低了 58%。
OpenAI 指出,在評估代理程式處理複雜專業工作流程能力的「Agents’ Last Exam」測試中,以「max effort」模式運作的 GPT-6 Sol 獲得 56.4% 的得分,超越 Claude Opus 5 在該評估中的最高分,且每項任務的成本降低了 61%。
該公司指出,在評估程式設計代理能否產出可直接合併至真實程式碼庫的變更的「FrontierCode」測試中,GPT-6 Sol 相較於 GPT-5.6 Sol 展現顯著進步,且以遠低於後者的成本達到與 Claude Fable 5.1 xhigh 相當的表現。
這兩款模型在「AA-Omniscience」(Artificial Analysis 用於評估知識與幻覺的基準測試)中,均展現出較低的幻覺發生率。
透過 GPT-6 Sol 和 Luna,我們為企業提供了更大的靈活性,使其能根據工作需求選擇合適的模型
——OpenAI 解決方案工程總監Matt Weaver
每項「智慧指數任務」的成本。圖片來源:Artificial Analysis
這家基準測試公司解釋道,GPT-6 Sol 版本包含六種模型,每種模型在智慧水平、效能及定價方面均具有獨特特性。透過比較這六種模型的關鍵指標,Artificial Analysis 發現:
- 就智能而言,GPT-6 Sol 的頂級模型是 GPT-6 Sol (max),數值為 48。
- 就輸出速度而言,最快的模型是 GPT-6 Sol (max),達 131 t/s。
- 就延遲而言,GPT-6 Sol (Non-reasoning) 以 0.93 秒的「首次回答標記時間」表現最優。
- 在定價方面,GPT-6 Sol (low) 每任務成本為 0.13 美元,為最低。各模型間的價格差異最高可達 8 倍。
該公司發現,在各模型中,智慧指數(Intelligence Index)與編碼代理指數(Coding Agent Index)的分數仍與 GPT-5.6 保持一致,部分評估指標有所進步,部分則出現退步。
GPT-6 Sol 專為艱鉅的專業工作而設計——從複雜的商業工作流程到程式碼編寫皆然;而 GPT-6 Luna 則為大量且定義明確的任務(如文件摘要或資訊擷取)提供更高效的選項。
——OpenAI 解決方案工程主管 Matt Weaver
在 FrontierCode 1.1 Main 中,AI 代理所編寫的程式碼不僅會根據正確性進行評分,還會評估其「可合併性」:例如測試品質、範圍規範、程式碼風格以及是否符合程式碼庫標準。圖片來源:OpenAI
成本效益的重要性
圍繞 AI 模型定價的競爭日益白熱化,這往往是由低成本的中國模型所驅動。 正如布魯金斯學會的凱爾·陳(Kyle Chan)在部落格中所指出的,中國模型大多為開源,讓使用者能夠自訂模型,並以較低價格取得具備美國模型 90% 功能的能力。因此,這些模型正在以成本為導向的企業中迅速佔據一席之地。
OpenAI 正積極調整策略以維持競爭力;儘管新模型每項任務產出的標記數量略多,但運行「人工分析智慧指數(Artificial Analysis Intelligence Index)」的成本卻顯著降低:
- GPT-6 Sol(最高設定):每項任務成本為 1.06 美元(較 GPT-5.6 Sol 的 1.99 美元下降約 50%),即使輸出代幣量從 GPT-5.6 的 2.9 萬增加至 3.1 萬。
- GPT-6 Luna(最高設定):每項任務成本為 0.07 美元(較 GPT-5.6 Luna 的 0.18 美元下降約 60%),儘管輸出代幣量從 GPT-5.6 的 4.1 萬增加至 5.1 萬。
Artificial Analysis 指出,這兩項發布使 OpenAI 得以佔據成本效益帕累托前沿(即在不提高價格的情況下無法進一步提升效能的最佳邊界)的顯著部分。
透過在不犧牲效能的前提下降低門檻,OpenAI 正積極因應企業的「代幣疲勞」問題,同時抵禦低成本市場競爭對手的挑戰。
Hexagon:超過半數的成年人對機器人感到興奮
機器人正日益融入企業營運。圖片來源:HumanoidHexagon 的數據顯示,59% 的成年人對與機器人共事感到興奮,但日益壯大的「機器人世代」兒童對人工智慧工作環境的期待更是遠超於此Hexagon 最新數據顯示,超過半數的成年人對與機器人共事的展望感到興奮。這項數據將成年人的觀點與兒童的觀點進行了對比,後者持有不同看法,且將引領下一代。數據顯示,五分之四的兒童(80%)表示對機器人感到興奮,而
AI 墳場:一份持續更新的失敗專案與新創公司清單
Relay 是一項以人工智慧驅動的工作流程自動化平台,定位為 Zapier 的替代方案,已於週一停止營運。該服務讓使用者能透過 AI 代理程式自動化電子郵件和任務工作流程,但隨著 OpenAI、Google 及其他主要平台將類似的自動化功能直接整合至其生態系統中,成立五年的 Relay 已難以證明其作為獨立產品的存在價值。Relay 這家被大型平台超越的新創公司,反映了當前產業格局的一面。然而,許
OpenAI 押注家庭,ChatGPT 深入千家萬戶
ChatGPT 將生成式 AI 推向聚光燈下已逾三年,OpenAI 正將其業務範圍從個人使用者擴充套件至整個家庭。OpenAI 正在舊金山招聘一名產品經理,以開發其平臺上的家庭導向體驗,目標受眾包括父母、照護者和老年人。根據職位列表,該職位要求具備為家庭及其他對信任敏感的消費者應用開發產品的背景。此次招聘與 ChatGPT 不斷演變的使用者群體相契合,其使用者年齡已超出最初的年輕群體。Sensor Tower 獨家向 TechCrunch 分享的資料顯示,全球範圍內,35 歲及以上使用者在 Q2 佔 Cha





首頁






