選項
首頁
新聞
OpenAI GPT-5 在多項專業領域表現媲美人類水準

OpenAI GPT-5 在多項專業領域表現媲美人類水準

2025-10-31
122

本週四,OpenAI 推出了革命性基準測試 GDPval,旨在評估其人工智慧模型 across 各行業中與人類專業人士的表現對比。這項評估標誌著衡量 OpenAI 系統是否能於經濟影響力工作中超越人類的首步嘗試——此為該公司追求人工通用智慧(AGI)的核心目標。

根據 OpenAI 表示,GPT-5 與 Anthropic 的 Claude Opus 4.1 均展現出接近行業專家水準的輸出品質。

儘管這些發現並不意味著人類工作即將被取代,但它們代表了追蹤進展的重要里程碑。OpenAI 承認 GDPval 目前僅評估現實專業任務的一小部分,這反駁了某些執行長預測人工智慧將在數年內引發廣泛顛覆的觀點。

GDPval 針對美國 GDP 九大關鍵領域進行效能評估——包括醫療保健、金融、製造業與政府部門——測試範圍涵蓋從軟體工程到新聞業等 44 種職業。

在 GDPval-v0 版本中,專業人士將人工智慧生成的報告與人類同業作品進行比較。其中一項範例任務是投資銀行家分析最後一哩物流競爭對手格局,並與人工智慧版本進行對照。OpenAI 透過所有職業類別計算出每個模型相較於人類輸出的「勝率」。

強化版 GPT-5-high 模型在 40.6% 的情況下達到或超越專家輸出,而 Claude Opus 4.1 則取得 49% 的持平率——OpenAI 指出此較高分數可能源於 Claude 更優異的視覺呈現效果,而非實質內容優勢。

在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流

匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。

在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流

匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。

圖片來源:OpenAI

OpenAI 坦承 GDPval-v0 的測試範圍較窄——目前僅針對研究報告生成進行評估——並計劃於未來版本中納入更廣泛的職場互動情境測試。

首席經濟學家 Aaron Chatterji 博士向 TechCrunch 表示,這些結果顯示專業人士將能逐步將常規任務委派給人工智慧,使其更專注於高價值工作。

主導評估工作的 Tejal Patwardhan 指出進展神速:十五個月前 GPT-4o 僅獲得 13.7% 的評分,而 GPT-5 的表現近乎三倍成長——此發展趨勢預計將持續推進。

儘管當前的 AI 評估領域由 AIME 2025 與 GPQA Diamond 等基準測試主導,但多數模型在這些學術測驗中已接近飽和。GDPval 象徵著業界日益重視實際應用與產業相關的評量標準——儘管 OpenAI 仍需進行更全面的測試,才能最終證實其於各專業領域達到人類水準的表現。

相關文章
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具 Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本 在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略 Frontier AI Labs 拒絕透露針對失控模型的管控策略 近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
相關專題推薦
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
評論 (0)
0/500
OR