OpenAI 抨擊 AI 基準測試:近三分之一的題目存在缺陷,通過率在 8 個月內飆升至 80%
OpenAI 在一篇部落格文章中公開質疑業界領先的基準測試 SWE-Bench Pro,聲稱其 731 項公開測試任務中,約有 30% 存在評估缺陷。 由 Scale AI 開發的 SWE-Bench Pro,旨在評估大型語言模型與 AI 代理的編碼能力。由於該基準能精準模擬真實企業開發情境,並實施嚴格的反作弊措施,因此已成為 AI 軟體工程領域廣受信賴的基準。

OpenAI 在該篇部落格文章中指出一個關鍵跡象:頂級模型在此基準測試中的通過率,僅在八個月內便從 23.3% 躍升至 80.3%。如此迅速的進步令人起疑,OpenAI 認為該基準測試已無法準確衡量模型在真實世界中的軟體開發能力。 問題很可能源於評估機制本身的缺陷,而非模型能力真正實現了飛躍。
經兩條相互驗證的審查途徑顯示,近 30% 的任務被判定為「不合格」。
為驗證此現象,OpenAI 啟動了兩項並行的審查流程。數據點分析揭露了 200 項未通過的任務,佔 731 項公開任務的 27.4%;與此同時,人工標註則標記出 249 項未通過的任務,佔比達 34.1%。 透過比對這兩種方法,OpenAI 估計約 30% 的 SWE-Bench Pro 任務存在缺陷,主要分為四類:測試過於嚴格、提示語不完善、測試覆蓋範圍過窄,以及誤導性提示語。
OpenAI 還分享了一個典型案例:某項任務要求將內容轉換為 Markdown 格式時,行首僅需一個空格,但隱藏的測試標準卻預期需有兩個空格。 結果,即使模型遵循了明示的要求,仍會被判定為錯誤。這種明示指示與隱含要求之間的不匹配,直接扭曲了對模型真實能力的評估,也解釋了通過率不合理飆升的原因。
撤回採用建議並呼籲重建 AI 評估系統
基於這項分析,OpenAI 已正式撤回先前對使用 SWE-Bench Pro 的推薦。該公司認為,未來的基準測試應由經驗豐富的軟體開發人員專門為 AI 評估而設計,而非將原本為人類開發人員設計的測試邏輯轉用於 AI 評估。 若某項產業基準測試中近 30% 的任務存在缺陷,整個 AI 評估系統的可信度便會受到質疑。將焦點從追求分數的競賽轉向對真實工程能力的評估,或許將是 AI 軟體工程評估的下一項關鍵步驟。
相關文章
隨著人工智慧支出的增長,OpenAI 在企業市場份額上超越 Anthropic
Ramp(一家企業信用卡和費用管理平臺)釋出的最新資料顯示,OpenAI 已重新奪回超過 40% 的美國企業 AI 市場份額,超越 Anthropic。5 月份,Anthropic 的市場份額為 41%,OpenAI 為 39%;到了 7 月,Anthropic 的份額上升至近 44%,而 OpenAI 則維持在 40% 左右。Ramp 的經濟學家 Ara Kharazian 指出,自第三季度初以來,OpenAI 在該領域的增速已超過其競爭對手。該分析涵蓋超過 70,000 家美國公司,這些公司
愛普生髮布AX6協作機器人,採用緊湊設計並支援無程式碼程式設計
AX6力與功率受限機械臂設計輕巧且易於使用。圖片來源:愛普生愛普生機器人本週擴充套件了其六軸機器人產品線,推出了AX6協作機器人。該公司表示,這款新型協作機器人具備功率和力限制功能,在適當的風險評估下,可在無需傳統安全護欄的情況下與人協同作業。愛普生產品與機器人開發總監Rick Brookshire表示:“協作機器人透過簡化程式設計和整合,降低了眾多新使用者的使用門檻,同時實現了在空間和使用者互動至關重要的場景中應用新任務。隨著AX6的推出,愛普生現在能夠解決這些應用場景,同時為客戶提供完整的機器人安全解決
奧特曼警告,人工智慧可能被少數強大的玩家所壟斷,導致公眾被邊緣化
OpenAI 執行長山姆·奧特曼(Sam Altman)在 8 月 23 日的一集播客中表達了擔憂,指出人工智慧治理權可能集中於少數企業、模型或個人手中,這將使大多數消費者在技術如何影響其生活這方面被噤聲。他主張,最佳途徑是賦予個人實質性的控制權,讓社會與人工智慧模型得以同步演進。以自由換取安全,恐助長壟斷奧特曼指出了一個關鍵的悖論:儘管他擔心人工智慧會脫離人類的監督,但他所倡導的嚴格管控,卻可能
相關專題推薦
評論 (0)
0/500
OpenAI 在一篇部落格文章中公開質疑業界領先的基準測試 SWE-Bench Pro,聲稱其 731 項公開測試任務中,約有 30% 存在評估缺陷。 由 Scale AI 開發的 SWE-Bench Pro,旨在評估大型語言模型與 AI 代理的編碼能力。由於該基準能精準模擬真實企業開發情境,並實施嚴格的反作弊措施,因此已成為 AI 軟體工程領域廣受信賴的基準。

OpenAI 在該篇部落格文章中指出一個關鍵跡象:頂級模型在此基準測試中的通過率,僅在八個月內便從 23.3% 躍升至 80.3%。如此迅速的進步令人起疑,OpenAI 認為該基準測試已無法準確衡量模型在真實世界中的軟體開發能力。 問題很可能源於評估機制本身的缺陷,而非模型能力真正實現了飛躍。
經兩條相互驗證的審查途徑顯示,近 30% 的任務被判定為「不合格」。
為驗證此現象,OpenAI 啟動了兩項並行的審查流程。數據點分析揭露了 200 項未通過的任務,佔 731 項公開任務的 27.4%;與此同時,人工標註則標記出 249 項未通過的任務,佔比達 34.1%。 透過比對這兩種方法,OpenAI 估計約 30% 的 SWE-Bench Pro 任務存在缺陷,主要分為四類:測試過於嚴格、提示語不完善、測試覆蓋範圍過窄,以及誤導性提示語。
OpenAI 還分享了一個典型案例:某項任務要求將內容轉換為 Markdown 格式時,行首僅需一個空格,但隱藏的測試標準卻預期需有兩個空格。 結果,即使模型遵循了明示的要求,仍會被判定為錯誤。這種明示指示與隱含要求之間的不匹配,直接扭曲了對模型真實能力的評估,也解釋了通過率不合理飆升的原因。
撤回採用建議並呼籲重建 AI 評估系統
基於這項分析,OpenAI 已正式撤回先前對使用 SWE-Bench Pro 的推薦。該公司認為,未來的基準測試應由經驗豐富的軟體開發人員專門為 AI 評估而設計,而非將原本為人類開發人員設計的測試邏輯轉用於 AI 評估。 若某項產業基準測試中近 30% 的任務存在缺陷,整個 AI 評估系統的可信度便會受到質疑。將焦點從追求分數的競賽轉向對真實工程能力的評估,或許將是 AI 軟體工程評估的下一項關鍵步驟。
隨著人工智慧支出的增長,OpenAI 在企業市場份額上超越 Anthropic
Ramp(一家企業信用卡和費用管理平臺)釋出的最新資料顯示,OpenAI 已重新奪回超過 40% 的美國企業 AI 市場份額,超越 Anthropic。5 月份,Anthropic 的市場份額為 41%,OpenAI 為 39%;到了 7 月,Anthropic 的份額上升至近 44%,而 OpenAI 則維持在 40% 左右。Ramp 的經濟學家 Ara Kharazian 指出,自第三季度初以來,OpenAI 在該領域的增速已超過其競爭對手。該分析涵蓋超過 70,000 家美國公司,這些公司
愛普生髮布AX6協作機器人,採用緊湊設計並支援無程式碼程式設計
AX6力與功率受限機械臂設計輕巧且易於使用。圖片來源:愛普生愛普生機器人本週擴充套件了其六軸機器人產品線,推出了AX6協作機器人。該公司表示,這款新型協作機器人具備功率和力限制功能,在適當的風險評估下,可在無需傳統安全護欄的情況下與人協同作業。愛普生產品與機器人開發總監Rick Brookshire表示:“協作機器人透過簡化程式設計和整合,降低了眾多新使用者的使用門檻,同時實現了在空間和使用者互動至關重要的場景中應用新任務。隨著AX6的推出,愛普生現在能夠解決這些應用場景,同時為客戶提供完整的機器人安全解決
奧特曼警告,人工智慧可能被少數強大的玩家所壟斷,導致公眾被邊緣化
OpenAI 執行長山姆·奧特曼(Sam Altman)在 8 月 23 日的一集播客中表達了擔憂,指出人工智慧治理權可能集中於少數企業、模型或個人手中,這將使大多數消費者在技術如何影響其生活這方面被噤聲。他主張,最佳途徑是賦予個人實質性的控制權,讓社會與人工智慧模型得以同步演進。以自由換取安全,恐助長壟斷奧特曼指出了一個關鍵的悖論:儘管他擔心人工智慧會脫離人類的監督,但他所倡導的嚴格管控,卻可能





首頁






