選項
首頁
新聞
GPT-5 發表,揭開 OpenAI 下一代 AI 模型的神秘面紗

GPT-5 發表,揭開 OpenAI 下一代 AI 模型的神秘面紗

2025-12-30
161

OpenAI 推出了 GPT-5,這是其新的旗艦 AI 模型,將驅動下一代 ChatGPT。

GPT-5 於週四發佈,是 OpenAI 首款統一的 AI 機型,融合了 o 系列機型的推理優勢與 GPT 系列的快速反應能力。此新一代模型標誌著 ChatGPT 與 OpenAI 的新篇章,突顯該公司建立 AI 系統的雄心,其行為更像主動式代理,而非反應式聊天機器人。

GPT-4 可讓 AI 聊天機器人提供各種主題的智慧型答案,而 GPT-5 則可讓 ChatGPT 代表使用者執行任務,例如開發軟體應用程式、管理排程或編寫研究摘要。

OpenAI 在 GPT-5 中也著重讓 ChatGPT 更容易使用。該模型不需要使用者調整設定,而是包含一個即時路由器,可決定最佳的回應方式,無論是快速回答,或是花更多時間推理答案。

圖片來源:OpenAIOpenAI

在與記者的簡報會中,OpenAI 執行長 Sam Altman 將 GPT-5 描述為「世界上最好的模型」,稱其為朝向開發能在最具經濟價值的工作上勝過人類的人工智能(也稱為人工一般智慧(AGI))邁進的「重要一步」。

Altman 補充:「像 GPT-5 這樣的工具,在歷史上任何其他時刻幾乎都是不可想像的。

自本週四起,GPT-5 將成為所有免費 ChatGPT 使用者的預設模型。根據 OpenAI 的 ChatGPT 副總裁 Nick Turley 所說,此舉首次讓免費使用者可以使用 AI 推理模型。(在此之前,這種先進的模型只保留給付費訂閱者)。

"Turley 表示:「這是我們實現使命的方式之一,確保這些進步能真正造福每個人。

Techcrunch 活動

頂尖科技與創投領袖加入 Disrupt 2025 議程

Netflix、ElevenLabs、Wayve 和 Sequoia Capital 等具影響力的公司加入 Disrupt 2025 議程。他們將分享重要的見解,協助初創公司成長並維持競爭力。不要錯過 TechCrunch Disrupt 20 週年慶,這是向科技領導者學習的機會。現在預訂門票,即可在 8 月 7 日漲價前節省高達 675 美元。

頂尖科技與創投領袖加入 Disrupt 2025 議程

Netflix、ElevenLabs、Wayve 和 Sequoia Capital 等具影響力的公司將加入 Disrupt 2025 議程。他們將分享重要的見解,協助新創公司成長並維持競爭力。不要錯過 TechCrunch Disrupt 20 週年慶,這是向科技領導者學習的機會。現在預訂門票,可在價格上漲前節省高達 675 美元。

舊金山|2025 年 10 月 27-29 日立即預訂

GPT-5 的期望值極高,標誌著 OpenAI 自 2022 年 ChatGPT 使公司嶄露頭角以來最令人期待的發佈之一。從那時起,ChatGPT 已經成為全球使用最廣泛的消費性產品之一,根據該公司的資料,目前每週有超過 7 億名使用者使用 ChatGPT,約佔全球人口的 10%。

許多人認為 GPT-5 是更廣泛的 AI 進展的風向標,它在矽谷的受歡迎程度可能會對 Big Tech、華爾街和科技政策制定者產生重大影響。利害關係人都在觀察 GPT-5 是否能帶來 AI 能力的大幅躍進,就像其前身 GPT-4 重新定義軟體的功能一樣。

GPT-5 遙遙領先競爭對手

OpenAI 宣稱,GPT-5 在多個領域樹立了新標準,在關鍵基準上略勝 Anthropic、Google DeepMind 和 Elon Musk 的 xAI 等領導模型,但在其他領域則略有不足。

該公司強調 GPT-5 的編碼能力出眾;Altman 指出,該模型擅長依需求產生完整的軟體應用程式,這種能力常被稱為「虛擬編碼」(vibe coding)。

在 SWE-bench Verified 測試中,GPT-5 的首次測試得分率為 74.9%,這項測試是基於 GitHub 的實際編碼任務。這讓它僅次於 Anthropic 的 Claude Opus 4.1 (74.5%) 和 Google DeepMind 的 Gemini 2.5 Pro (59.6%)。

在人類最後一次考試(Humanity's Last Exam)中,GPT-5(GPT-5 Pro)的擴展推理版本在使用工具的情況下獲得了 42% 的高分,這是一項涵蓋數學、人文和科學的嚴格評估。這比 xAI 的 Grok 4 Heavy 略低,後者的得分率為 44.4%。

圖片來源:OpenAIOpenAI

在 GPQA Diamond(一個博士級科學問題的基準)上,GPT-5 Pro 第一次嘗試就獲得了 89.4% 的成績,優於 Claude Opus 4.1 (80.9%) 和 Grok 4 Heavy (88.9%)。

OpenAI 也報告指出,GPT-5 在健康相關的查詢上表現較佳。在衡量醫療照護回應準確度的 HealthBench Hard Hallucinations 上,GPT-5 (有思考能力) 只有 1.6% 的時間出現幻覺,遠低於 GPT-4o (12.9%) 和 o3 (15.8%)。

雖然 AI 聊天機器人並非醫療專業人員,但仍有數百萬人向他們尋求健康建議。對此,OpenAI 表示,GPT-5 能更主動地標示潛在的健康問題,並協助使用者解讀醫療資訊。

此外,GPT-5 在創意設計和寫作等主觀性較強的領域也很出色。Turley 指出,與競爭對手的模型相比,GPT-5 在創意任務上的反應更自然,也表現出 「更好的品味」。

"Turley 評論道:「這款機型的氣氛真的很好。

GPT-5 也比 OpenAI 早期的模型更精準,而且幻覺(虛構資訊的傾向)更少。幻覺率在最近的推理模型(如 o3)中一直在增加,OpenAI 之前一直難以解釋這種趨勢。

在回應測試中,GPT-5 (含思考) 提供錯誤資訊的比例為 4.8%,比起 o3 (22%) 和 GPT-4o (20.6%) 有顯著的改善。

在測量 AI 代理完成模擬線上任務能力的 Tau-bench 測試中,GPT-5 的成績好壞參半。它在航空公司網站導覽的得分為 63.5%(略低於 o3 的 64.8%),在零售網站導覽的得分為 81.1%(低於 Claude Opus 4.1 的 82.4%)。

OpenAI 也強調,GPT-5 比前一代產品更安全。雖然推理模型有時可能會出現欺騙行為,但 GPT-5 的欺騙率較低,有助於提供更值得信賴的使用者體驗。

安全研究領導人 Alex Beutel 指出,減少欺騙行為不僅能提高安全性,還能讓模型更「透明、誠實,讓使用者可以信賴」。

Beutel 補充說,GPT-5 更能區分惡意濫用與無害請求,因此對不安全的查詢會有更適當的拒絕,而對良性查詢則會減少不必要的拒絕。

針對消費者與開發人員的新功能

除了 GPT-5 版本之外,ChatGPT 還進行了多項使用者體驗升級。使用者現在可以在設定中選擇四種新的回應方式:Cynic、Robot、Listenener 和 Nerd。這些樣式可調整 ChatGPT 的語氣,而不需要明確的指示。

ChatGPT Plus 訂戶 (20 美元/月) 可獲得 GPT-5 的更高使用限制,而 Pro 訂戶 (200 美元/月) 則可獲得無限制使用權以及 GPT-5 Pro - 一個使用額外計算以獲得更佳答案的增強版。Team、Edu 和 Enterprise 客戶將從下周起獲得 GPT-5 作為預設模式。

對開發人員而言,GPT-5 將可透過 OpenAI 的 API 以三種規格提供 - GPT-5、GPT-5-mini 和 GPT-5-nano - 推理深度各不相同。API 現在也包含了動詞控制功能,讓開發人員可以設定所需的回應長度。

基本 GPT-5 模型的價格為每百萬個輸入字元(約 750,000 個字)1.25 美元,每百萬個輸出字元 10 美元。

GPT-5 的推出,正值 OpenAI 忙碌的時期。該公司最近發佈了 gpt-oss,這是一個免費、開放重量的推理模型,幾乎可以媲美早期的頂級模型,如 o3 和 o4-mini。然而,GPT-5 在編碼等領域建立了新的基準。

不過,GPT-5 在許多基準上仍具有競爭力,而不是主導地位。真實世界的效能與開發人員的採用,將最終決定它是否能真正超越競爭對手的模型。

相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率 正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
評論 (1)
0/500
FrankTaylor
FrankTaylor 2026-07-25 04:00:12

So GPT-5 is finally here? I'm curious if it can actually tell the difference between a joke and a serious statement this time around 😅

OR