OpenAI GPT-5 在多項專業領域表現媲美人類水準
本週四,OpenAI 推出了革命性基準測試 GDPval,旨在評估其人工智慧模型 across 各行業中與人類專業人士的表現對比。這項評估標誌著衡量 OpenAI 系統是否能於經濟影響力工作中超越人類的首步嘗試——此為該公司追求人工通用智慧(AGI)的核心目標。
根據 OpenAI 表示,GPT-5 與 Anthropic 的 Claude Opus 4.1 均展現出接近行業專家水準的輸出品質。
儘管這些發現並不意味著人類工作即將被取代,但它們代表了追蹤進展的重要里程碑。OpenAI 承認 GDPval 目前僅評估現實專業任務的一小部分,這反駁了某些執行長預測人工智慧將在數年內引發廣泛顛覆的觀點。
GDPval 針對美國 GDP 九大關鍵領域進行效能評估——包括醫療保健、金融、製造業與政府部門——測試範圍涵蓋從軟體工程到新聞業等 44 種職業。
在 GDPval-v0 版本中,專業人士將人工智慧生成的報告與人類同業作品進行比較。其中一項範例任務是投資銀行家分析最後一哩物流競爭對手格局,並與人工智慧版本進行對照。OpenAI 透過所有職業類別計算出每個模型相較於人類輸出的「勝率」。
強化版 GPT-5-high 模型在 40.6% 的情況下達到或超越專家輸出,而 Claude Opus 4.1 則取得 49% 的持平率——OpenAI 指出此較高分數可能源於 Claude 更優異的視覺呈現效果,而非實質內容優勢。
在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流
匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。
在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流
匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。

圖片來源:OpenAI OpenAI 坦承 GDPval-v0 的測試範圍較窄——目前僅針對研究報告生成進行評估——並計劃於未來版本中納入更廣泛的職場互動情境測試。
首席經濟學家 Aaron Chatterji 博士向 TechCrunch 表示,這些結果顯示專業人士將能逐步將常規任務委派給人工智慧,使其更專注於高價值工作。
主導評估工作的 Tejal Patwardhan 指出進展神速:十五個月前 GPT-4o 僅獲得 13.7% 的評分,而 GPT-5 的表現近乎三倍成長——此發展趨勢預計將持續推進。
儘管當前的 AI 評估領域由 AIME 2025 與 GPQA Diamond 等基準測試主導,但多數模型在這些學術測驗中已接近飽和。GDPval 象徵著業界日益重視實際應用與產業相關的評量標準——儘管 OpenAI 仍需進行更全面的測試,才能最終證實其於各專業領域達到人類水準的表現。
相關文章
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
相關專題推薦
評論 (0)
0/500
本週四,OpenAI 推出了革命性基準測試 GDPval,旨在評估其人工智慧模型 across 各行業中與人類專業人士的表現對比。這項評估標誌著衡量 OpenAI 系統是否能於經濟影響力工作中超越人類的首步嘗試——此為該公司追求人工通用智慧(AGI)的核心目標。
根據 OpenAI 表示,GPT-5 與 Anthropic 的 Claude Opus 4.1 均展現出接近行業專家水準的輸出品質。
儘管這些發現並不意味著人類工作即將被取代,但它們代表了追蹤進展的重要里程碑。OpenAI 承認 GDPval 目前僅評估現實專業任務的一小部分,這反駁了某些執行長預測人工智慧將在數年內引發廣泛顛覆的觀點。
GDPval 針對美國 GDP 九大關鍵領域進行效能評估——包括醫療保健、金融、製造業與政府部門——測試範圍涵蓋從軟體工程到新聞業等 44 種職業。
在 GDPval-v0 版本中,專業人士將人工智慧生成的報告與人類同業作品進行比較。其中一項範例任務是投資銀行家分析最後一哩物流競爭對手格局,並與人工智慧版本進行對照。OpenAI 透過所有職業類別計算出每個模型相較於人類輸出的「勝率」。
強化版 GPT-5-high 模型在 40.6% 的情況下達到或超越專家輸出,而 Claude Opus 4.1 則取得 49% 的持平率——OpenAI 指出此較高分數可能源於 Claude 更優異的視覺呈現效果,而非實質內容優勢。
在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流
匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。
在 Disrupt 2025 大會與超過 10,000 名科技及創投創新者交流
匯集 Netflix、Box、a16z、ElevenLabs、Wayve、Sequoia Capital 及 Elad Gil 等 250+ 行業領袖,舉辦 200+ 聚焦成長的專場論壇。歡慶 TechCrunch 20 週年的同時,向科技界頂尖思想家汲取競爭洞察。9 月 26 日前完成早鳥註冊最高可省 668 美元。

OpenAI 坦承 GDPval-v0 的測試範圍較窄——目前僅針對研究報告生成進行評估——並計劃於未來版本中納入更廣泛的職場互動情境測試。
首席經濟學家 Aaron Chatterji 博士向 TechCrunch 表示,這些結果顯示專業人士將能逐步將常規任務委派給人工智慧,使其更專注於高價值工作。
主導評估工作的 Tejal Patwardhan 指出進展神速:十五個月前 GPT-4o 僅獲得 13.7% 的評分,而 GPT-5 的表現近乎三倍成長——此發展趨勢預計將持續推進。
儘管當前的 AI 評估領域由 AIME 2025 與 GPQA Diamond 等基準測試主導,但多數模型在這些學術測驗中已接近飽和。GDPval 象徵著業界日益重視實際應用與產業相關的評量標準——儘管 OpenAI 仍需進行更全面的測試,才能最終證實其於各專業領域達到人類水準的表現。
Anthropic 推出 Opus 4.8,搭載全新的動態工作流程工具
Anthropic 於週四正式推出 Opus 4.8,這是其旗艦級公開模型的最新版本。此版本定價與前一版本相同,現已於所有平台上線。距離 Opus 4.7 發布僅隔 41 天,Anthropic 顯著加快了開發週期,遠快於近期 Sonnet 和 Haiku 版本所見的三個月及七個月間隔。此次快速更新很可能是為了回應 Opus 4.7 所獲得的冷淡反響,該版本曾讓許多使用者感到失望。與此同時,Ope
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr





首頁






