OpenAI揭曉進階AI推理模型,o3與o4-mini

OpenAI於週三推出o3與o4-mini,這是兩款新型AI模型,設計為在回答前暫停並分析問題。
OpenAI宣稱o3是其迄今最先進的推理模型,在數學、編碼、推理、科學及視覺理解測試中超越先前模型。同時,o4-mini在成本、速度與性能間取得平衡,是開發者打造AI驅動應用的理想選擇。
與早期模型不同,o3與o4-mini利用ChatGPT工具,如網頁瀏覽、Python程式碼執行、圖像處理及圖像生成。從今日起,這些模型連同o4-mini-high(花費額外時間以提升答案準確度)已對OpenAI的Pro、Plus及Team計劃訂閱者開放。
這些模型是OpenAI在全球AI競賽中力求超越Google、Meta、xAI、Anthropic及DeepSeek等競爭對手的舉措。雖然OpenAI以o1開創AI推理,但競爭者隨後推出相當或更優的模型,使推理模型成為AI實驗室的核心焦點。
最初,o3並未計劃用於ChatGPT發佈。OpenAI執行長Sam Altman於二月暗示將專注於使用o3技術的更進階替代方案。然而,競爭壓力可能促使OpenAI推出o3。
OpenAI報告稱,o3在SWE-bench驗證(無自訂結構)中表現頂尖,編碼任務得分69.1%。o4-mini得分68.1%,o3-mini得分49.3%,相比之下,Claude 3.7 Sonnet得分62.3%。
OpenAI宣稱o3與o4-mini是其首批能有效處理圖像的模型。使用者可上傳白板草圖或PDF圖表等圖像,模型在推理過程中進行分析,能處理模糊或低品質圖像,並執行縮放或旋轉等任務。
除了圖像,o3與o4-mini透過ChatGPT的Canvas功能在瀏覽器中執行Python程式碼,並可搜尋網頁以處理即時事件查詢。
所有三款模型—o3、o4-mini及o4-mini-high—均可透過OpenAI的Chat Completions API及Responses API存取,讓開發者能以基於使用的定價將其整合至應用程式中。
OpenAI為o3定價為每百萬輸入token 10美元(約75萬字),輸出token每百萬40美元。o4-mini與o3-mini定價相同,每百萬輸入token 1.10美元,輸出token每百萬4.40美元。
未來幾週,OpenAI計劃推出o3-pro,這是o3的運算密集型版本,僅限ChatGPT Pro訂閱者使用。
執行長Sam Altman暗示,o3與o4-mini可能是OpenAI在ChatGPT中最後的獨立推理模型,之後將推出GPT-5,整合傳統與推理模型功能。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (3)
0/500
Wow, OpenAI's o3 sounds like a game-changer! Pausing to think before answering? That's some next-level AI. Can't wait to see how it stacks up against other models in real-world tasks! 🤯

OpenAI於週三推出o3與o4-mini,這是兩款新型AI模型,設計為在回答前暫停並分析問題。
OpenAI宣稱o3是其迄今最先進的推理模型,在數學、編碼、推理、科學及視覺理解測試中超越先前模型。同時,o4-mini在成本、速度與性能間取得平衡,是開發者打造AI驅動應用的理想選擇。
與早期模型不同,o3與o4-mini利用ChatGPT工具,如網頁瀏覽、Python程式碼執行、圖像處理及圖像生成。從今日起,這些模型連同o4-mini-high(花費額外時間以提升答案準確度)已對OpenAI的Pro、Plus及Team計劃訂閱者開放。
這些模型是OpenAI在全球AI競賽中力求超越Google、Meta、xAI、Anthropic及DeepSeek等競爭對手的舉措。雖然OpenAI以o1開創AI推理,但競爭者隨後推出相當或更優的模型,使推理模型成為AI實驗室的核心焦點。
最初,o3並未計劃用於ChatGPT發佈。OpenAI執行長Sam Altman於二月暗示將專注於使用o3技術的更進階替代方案。然而,競爭壓力可能促使OpenAI推出o3。
OpenAI報告稱,o3在SWE-bench驗證(無自訂結構)中表現頂尖,編碼任務得分69.1%。o4-mini得分68.1%,o3-mini得分49.3%,相比之下,Claude 3.7 Sonnet得分62.3%。
OpenAI宣稱o3與o4-mini是其首批能有效處理圖像的模型。使用者可上傳白板草圖或PDF圖表等圖像,模型在推理過程中進行分析,能處理模糊或低品質圖像,並執行縮放或旋轉等任務。
除了圖像,o3與o4-mini透過ChatGPT的Canvas功能在瀏覽器中執行Python程式碼,並可搜尋網頁以處理即時事件查詢。
所有三款模型—o3、o4-mini及o4-mini-high—均可透過OpenAI的Chat Completions API及Responses API存取,讓開發者能以基於使用的定價將其整合至應用程式中。
OpenAI為o3定價為每百萬輸入token 10美元(約75萬字),輸出token每百萬40美元。o4-mini與o3-mini定價相同,每百萬輸入token 1.10美元,輸出token每百萬4.40美元。
未來幾週,OpenAI計劃推出o3-pro,這是o3的運算密集型版本,僅限ChatGPT Pro訂閱者使用。
執行長Sam Altman暗示,o3與o4-mini可能是OpenAI在ChatGPT中最後的獨立推理模型,之後將推出GPT-5,整合傳統與推理模型功能。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
Wow, OpenAI's o3 sounds like a game-changer! Pausing to think before answering? That's some next-level AI. Can't wait to see how it stacks up against other models in real-world tasks! 🤯





首頁






