OpenAI的o3 AI模型在基準測試中的得分低於最初暗示的水準

為什麼人工智慧的基準差異很重要?
談到人工智能,數字往往能說明一切--有時候,這些數字加起來並不完全吻合。以 OpenAI 的 o3 模型為例。最初的聲稱簡直令人瞠目:據報,o3 可以處理超過 25% 難度極高的 FrontierMath 問題。在當時的情況下,競爭對手只能處理低個位數的問題。但快進到最近的發展,Epoch AI(一個受人尊敬的研究機構)對這種說法提出了質疑。他們的研究結果顯示,o3 的實際表現徘徊在 10% 左右。還不錯,但肯定不是 OpenAI 最初所吹捧的頭條數字。
到底發生了什麼事?
我們來分析一下。OpenAI最初的得分很可能是在最佳條件下取得的--這些條件在現實世界中可能無法完全複製。Epoch 指出,他們的測試環境可能與 OpenAI 的略有不同,甚至他們使用的 FrontierMath 版本也較新。這並不是說 OpenAI 徹底誤導了任何人;他們最初的聲稱與內部測試一致,但這個差異突顯了一個更廣泛的問題。基準並不總是蘋果對蘋果的比較。而且讓我們面對現實吧,公司都有誘因要把自己最好的一面展現出來。
透明度的作用
這種情況帶出了一個重要的問題:AI 公司在分享結果時應該有多透明?雖然 OpenAI 並沒有徹底說謊,但他們的訊息確實讓人產生期望,而這些期望並沒有完全達成。這是一個微妙的平衡。公司想要展示他們的進步,但也需要誠實地說明這些數字的真正意義。隨著人工智能逐漸融入日常生活,消費者和研究人員都會要求更清楚的答案。
業界其他爭議
Benchmarking 的失誤並非 OpenAI 所獨有。人工智能領域的其他廠商也面臨類似的審查。早在 1 月份,Epoch 就因為在 o3 宣佈之前接受了 OpenAI 未公開的資金而身陷水深火熱之中。與此同時,Elon Musk 的 xAI 因為涉嫌調整他們的基準圖表,讓 Grok 3 看起來比實際表現更好而受到抨擊。即使是科技巨頭之一的 Meta,最近也承認根據一個未公開的模型來推廣分數。顯而易見,主宰頭條新聞的競賽正在升溫,而且並非每個人都能公平競爭。
展望未來
雖然這些爭議看似令人沮喪,但實際上卻是進步的跡象。隨著人工智慧領域的成熟,圍繞責任的討論也日趨成熟。消費者和研究人員正在推動提高透明度,這是一件好事。這能迫使公司在呈現成就時更加深思熟慮,也能確保使用者不會被不切實際的炒作所迷惑。歸根結柢,我們的目標不應該是玩弄數字遊戲,而應該是建立能真正推動該領域發展的模型。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
相關專題推薦
評論 (7)
0/500
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎

為什麼人工智慧的基準差異很重要?
談到人工智能,數字往往能說明一切--有時候,這些數字加起來並不完全吻合。以 OpenAI 的 o3 模型為例。最初的聲稱簡直令人瞠目:據報,o3 可以處理超過 25% 難度極高的 FrontierMath 問題。在當時的情況下,競爭對手只能處理低個位數的問題。但快進到最近的發展,Epoch AI(一個受人尊敬的研究機構)對這種說法提出了質疑。他們的研究結果顯示,o3 的實際表現徘徊在 10% 左右。還不錯,但肯定不是 OpenAI 最初所吹捧的頭條數字。
到底發生了什麼事?
我們來分析一下。OpenAI最初的得分很可能是在最佳條件下取得的--這些條件在現實世界中可能無法完全複製。Epoch 指出,他們的測試環境可能與 OpenAI 的略有不同,甚至他們使用的 FrontierMath 版本也較新。這並不是說 OpenAI 徹底誤導了任何人;他們最初的聲稱與內部測試一致,但這個差異突顯了一個更廣泛的問題。基準並不總是蘋果對蘋果的比較。而且讓我們面對現實吧,公司都有誘因要把自己最好的一面展現出來。
透明度的作用
這種情況帶出了一個重要的問題:AI 公司在分享結果時應該有多透明?雖然 OpenAI 並沒有徹底說謊,但他們的訊息確實讓人產生期望,而這些期望並沒有完全達成。這是一個微妙的平衡。公司想要展示他們的進步,但也需要誠實地說明這些數字的真正意義。隨著人工智能逐漸融入日常生活,消費者和研究人員都會要求更清楚的答案。
業界其他爭議
Benchmarking 的失誤並非 OpenAI 所獨有。人工智能領域的其他廠商也面臨類似的審查。早在 1 月份,Epoch 就因為在 o3 宣佈之前接受了 OpenAI 未公開的資金而身陷水深火熱之中。與此同時,Elon Musk 的 xAI 因為涉嫌調整他們的基準圖表,讓 Grok 3 看起來比實際表現更好而受到抨擊。即使是科技巨頭之一的 Meta,最近也承認根據一個未公開的模型來推廣分數。顯而易見,主宰頭條新聞的競賽正在升溫,而且並非每個人都能公平競爭。
展望未來
雖然這些爭議看似令人沮喪,但實際上卻是進步的跡象。隨著人工智慧領域的成熟,圍繞責任的討論也日趨成熟。消費者和研究人員正在推動提高透明度,這是一件好事。這能迫使公司在呈現成就時更加深思熟慮,也能確保使用者不會被不切實際的炒作所迷惑。歸根結柢,我們的目標不應該是玩弄數字遊戲,而應該是建立能真正推動該領域發展的模型。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
NEA的蒂芙尼·拉克:企業仍在努力應對人工智慧的投資回報率
正在載入播放器…今年早些時候,“token最大化”(tokenmaxxing)在矽谷佔據主導地位,執行長們敦促員工最大限度地利用人工智慧。然而,這種熱情很快遭遇了現實。據報道,Uber在幾個月內就超出了其年度人工智慧預算,一些公司跨部門削減了Claude許可證,而Meta則取消了內部績效排名。NEA合夥人蒂芙尼·拉克(Tiffany Luck)每天都在應對這種興奮與實際回報之間的差距。她此前曾成功說服企業電子商務是未來,如今她完全專注於人工智慧,特別是其為消費者創造“神奇時刻”的潛力。
Hmm, so the hype was a bit overblown? 🤔 It's interesting how numbers can be twisted. Reminds me of the old saying: 'There are three kinds of lies: lies, damned lies, and statistics.' Definitely need to look under the hood before believing the headlines. What about reproducibility? #AI #benchmark
Como usuário curioso sobre IA, fico um pouco desconfiado quando os benchmarks não batem. A OpenAI lançou o o3 com uma fanfarra enorme, falando de mais de 25% nos desafios do Frontier, mas agora parece que os resultados reais podem ser bem mais modestos. Isso me faz pensar: deveríamos confiar mais nas métricas das empresas ou em avaliações independentes? A competição entre os modelos está tão acirrada que às vezes a verdade parece ficar em segundo plano... Precisamos de mais transparência! 🤔
Ces écarts sur les benchmarks montrent bien qu'on ne peut pas prendre toutes les déclarations des labos pour argent comptant. Du coup, ça soulève des questions sur la transparence des processus d'évaluation. C'est important pour les chercheurs et les développeurs qui basent leur travail sur ces résultats. 🤔
오픈AI의 벤치마크 수치 조작 논란, 이젠 식상하네요 😅 경쟁이 치열해질수록 회사들이 성과를 부풀리는 건 드문 일이 아니지만... 진실은 결국 밝혀지잖아요. 이번 건으로 인공지능 업계의 신뢰도가 또 한 번 흔들리는 건 아닐지 걱정됩니다.
I was hyped for o3, but these benchmark gaps are a letdown. Makes you wonder if the AI hype train is running on fumes. Still cool tech, tho! 😎





首頁






