OpenAI 和 Google 推進數學領域的 AI,但競爭仍然存在

OpenAI 和 Google DeepMind 的 AI 模型在 2025 年國際數學奧林匹克 (IMO) 中取得了金牌級的成績,這兩家公司最近都宣佈了這一消息,國際數學奧林匹克 (IMO) 是世界上最富盛名且難度最高的高中數學競賽之一。
這些成績突顯了 AI 系統的快速進步,同時也揭示了 Google 與 OpenAI 在 AI 競賽中的緊密程度。AI 公司之間的競爭已超越技術範圍,延伸至公眾觀感 - 一場「氣氛」之戰,大大影響他們吸引頂尖 AI 人才的能力。由於許多 AI 研究人員都有競爭力十足的數學背景,因此 IMO 等基準在這個領域的分量特別重。
去年,Google 使用「正式」系統將問題轉譯為機器可讀格式,獲得銀牌。今年,兩家公司都提交了「非正式」系統,能夠直接處理問題並用自然語言產生證明。兩家公司都宣稱,他們的 AI 模型正確解決了六個競賽問題中的五個,表現優於大多數人類參賽者和 Google 之前的 AI 系統,而且都不需要人類輔助翻譯。
在與 TechCrunch 的討論中,兩家公司的研究人員都形容這些金牌成就是人工智能在不可驗證領域推理的突破。雖然 AI 系統通常擅長於基本數學或編碼等有明確答案的任務,但歷來都難以應付模棱兩可的挑戰,例如選擇最佳家具或協助複雜的研究。
不過,Google 對 OpenAI 公佈 IMO 結果的方式提出了質疑。畢竟,在高中數學比賽中加入 AI 模型時,一些青春期式的爭吵似乎幾乎是意料之中的事。
在 OpenAI 於週六早上公佈結果之後不久,Google DeepMind 的執行長與研究人員利用社群媒體批評 OpenAI 在週五晚上公佈學生優勝者之後,就過早宣佈勝利,而且缺乏 IMO 官方對其模型表現的評估。
Demis Hassabis (@demishassabis) 2025 年 7 月 21 日。
Google DeepMind 領導 IMO 計畫的資深研究員 Thang Luong 向 TechCrunch 解釋,Google 延遲公布是為了表揚學生選手。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本 - 只是加入 Disrupt 2025 議程的幾位重量級人物。他們將在此提供啟發初創公司成長的真知灼見,並激發您的優勢。不要錯過 TechCrunch Disrupt 20 週年紀念,以及向科技界頂尖人士學習的機會 - 立即購買門票,並在價格上漲之前節省高達 675 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本 - 只是加入 Disrupt 2025 議程的幾位重量級人物。他們將在此提供啟發初創公司成長的洞察力,並讓您的優勢更銳利。不要錯過 TechCrunch Disrupt 20 週年紀念,以及向科技界頂尖人士學習的機會 - 立即購買門票,並在價格上漲之前節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名Luong 指出,Google 在過去一年都與 IMO 組織者合作準備測試,在週一早上公佈經核實的結果之前,先尋求 IMO 總裁的正式批准和正式評等。
"Luong 強調:「IMO 組織者維持特定的評等準則。「任何不遵循這些標準的評測,都無法合法地聲稱是金牌級的表現」。
參與 IMO 計畫的 OpenAI 資深研究員 Noam Brown 向 TechCrunch 表示,IMO 在幾個月前就曾與 OpenAI 聯繫,希望參加正式的數學競賽,但 ChatGPT 的創造者拒絕了,而是專注於它認為更有前途的自然語言系統。Brown 表示 OpenAI 並不知道 IMO 正在與 Google 進行非正式測試。
OpenAI 報告聘請了第三方評估人員 (三位熟悉分級系統的前 IMO 獎牌得主) 來評估他們 AI 模型的表現。在得知他們的金牌評比結果後,Brown 表示該公司已聯絡 IMO,但 IMO 要求他們延遲至週五晚上的頒獎典禮之後才公佈結果。
IMO 並未回應 TechCrunch 的置評要求。
儘管 Google 對於適當程序的疑慮有其可取之處 - 因為他們經歷了更正式、更嚴格的評估過程,但這場爭議可能會掩蓋更重要的發展:來自頂尖實驗室的 AI 模型發展迅速。在今年的國際數學大會上,全球最聰明的數學學生中,只有少數人的表現能與 OpenAI 和 Google 的 AI 系統相提並論。
雖然 OpenAI 之前在業界保持明顯的領先優勢,但現在的競爭似乎比任何公司願意承認的要緊張得多。預計在未來幾個月內推出 GPT-5,OpenAI 無疑希望鞏固其作為 AI 業界領先者的地位。
相關文章
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Google 推出虛假來電偵測功能,以防範人工智慧深度偽造(deepfake)冒充詐騙
Google 週二宣布,Android 將推出「虛假來電偵測」功能,以防範利用人工智慧深度偽造技術進行的冒充詐騙。此功能將於本月透過「Phone by Google」在全球範圍內逐步推送至 Android 12 及以上版本的裝置,首先從 Pixel 裝置開始。隨著人們越來越不願接聽未知號碼的來電,詐騙者正改變策略,透過偽造可信賴的電話號碼,並利用 AI 深度偽造技術,讓聲音聽起來像是權威人士、家人
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
相關專題推薦
評論 (2)
0/500
Gold medals at the IMO? That's insane! 🤯 It feels like we're watching sci-fi become reality. But honestly, the 'rivalry' angle in the headline is getting a bit old—can't we just celebrate the collective leap forward? Still, makes me wonder how this will trickle down to actual classroom tools.

OpenAI 和 Google DeepMind 的 AI 模型在 2025 年國際數學奧林匹克 (IMO) 中取得了金牌級的成績,這兩家公司最近都宣佈了這一消息,國際數學奧林匹克 (IMO) 是世界上最富盛名且難度最高的高中數學競賽之一。
這些成績突顯了 AI 系統的快速進步,同時也揭示了 Google 與 OpenAI 在 AI 競賽中的緊密程度。AI 公司之間的競爭已超越技術範圍,延伸至公眾觀感 - 一場「氣氛」之戰,大大影響他們吸引頂尖 AI 人才的能力。由於許多 AI 研究人員都有競爭力十足的數學背景,因此 IMO 等基準在這個領域的分量特別重。
去年,Google 使用「正式」系統將問題轉譯為機器可讀格式,獲得銀牌。今年,兩家公司都提交了「非正式」系統,能夠直接處理問題並用自然語言產生證明。兩家公司都宣稱,他們的 AI 模型正確解決了六個競賽問題中的五個,表現優於大多數人類參賽者和 Google 之前的 AI 系統,而且都不需要人類輔助翻譯。
在與 TechCrunch 的討論中,兩家公司的研究人員都形容這些金牌成就是人工智能在不可驗證領域推理的突破。雖然 AI 系統通常擅長於基本數學或編碼等有明確答案的任務,但歷來都難以應付模棱兩可的挑戰,例如選擇最佳家具或協助複雜的研究。
不過,Google 對 OpenAI 公佈 IMO 結果的方式提出了質疑。畢竟,在高中數學比賽中加入 AI 模型時,一些青春期式的爭吵似乎幾乎是意料之中的事。
在 OpenAI 於週六早上公佈結果之後不久,Google DeepMind 的執行長與研究人員利用社群媒體批評 OpenAI 在週五晚上公佈學生優勝者之後,就過早宣佈勝利,而且缺乏 IMO 官方對其模型表現的評估。
Demis Hassabis (@demishassabis) 2025 年 7 月 21 日。
Google DeepMind 領導 IMO 計畫的資深研究員 Thang Luong 向 TechCrunch 解釋,Google 延遲公布是為了表揚學生選手。
Techcrunch 活動科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本 - 只是加入 Disrupt 2025 議程的幾位重量級人物。他們將在此提供啟發初創公司成長的真知灼見,並激發您的優勢。不要錯過 TechCrunch Disrupt 20 週年紀念,以及向科技界頂尖人士學習的機會 - 立即購買門票,並在價格上漲之前節省高達 675 美元。
科技與創投重量級人物加入 Disrupt 2025 議程
Netflix、ElevenLabs、Wayve、紅杉資本 - 只是加入 Disrupt 2025 議程的幾位重量級人物。他們將在此提供啟發初創公司成長的洞察力,並讓您的優勢更銳利。不要錯過 TechCrunch Disrupt 20 週年紀念,以及向科技界頂尖人士學習的機會 - 立即購買門票,並在價格上漲之前節省高達 675 美元。
舊金山 | 2025 年 10 月 27-29 日 立即報名Luong 指出,Google 在過去一年都與 IMO 組織者合作準備測試,在週一早上公佈經核實的結果之前,先尋求 IMO 總裁的正式批准和正式評等。
"Luong 強調:「IMO 組織者維持特定的評等準則。「任何不遵循這些標準的評測,都無法合法地聲稱是金牌級的表現」。
參與 IMO 計畫的 OpenAI 資深研究員 Noam Brown 向 TechCrunch 表示,IMO 在幾個月前就曾與 OpenAI 聯繫,希望參加正式的數學競賽,但 ChatGPT 的創造者拒絕了,而是專注於它認為更有前途的自然語言系統。Brown 表示 OpenAI 並不知道 IMO 正在與 Google 進行非正式測試。
OpenAI 報告聘請了第三方評估人員 (三位熟悉分級系統的前 IMO 獎牌得主) 來評估他們 AI 模型的表現。在得知他們的金牌評比結果後,Brown 表示該公司已聯絡 IMO,但 IMO 要求他們延遲至週五晚上的頒獎典禮之後才公佈結果。
IMO 並未回應 TechCrunch 的置評要求。
儘管 Google 對於適當程序的疑慮有其可取之處 - 因為他們經歷了更正式、更嚴格的評估過程,但這場爭議可能會掩蓋更重要的發展:來自頂尖實驗室的 AI 模型發展迅速。在今年的國際數學大會上,全球最聰明的數學學生中,只有少數人的表現能與 OpenAI 和 Google 的 AI 系統相提並論。
雖然 OpenAI 之前在業界保持明顯的領先優勢,但現在的競爭似乎比任何公司願意承認的要緊張得多。預計在未來幾個月內推出 GPT-5,OpenAI 無疑希望鞏固其作為 AI 業界領先者的地位。
OpenAI 在青少年開始使用 ChatGPT 數年後,推出了一款更安全的 ChatGPT 版本
在因人工智慧聊天機器人缺乏安全機制——此問題曾導致青少年自殺及其他心理健康危機——而引發一系列訴訟後,OpenAI 於週一正式推出「ChatGPT for Teens」。這項新服務整合了強化版的安全功能,並針對校園中因人工智慧工具而日益嚴重的學術不誠實問題提出解決方案。從教育角度來看,「ChatGPT for Teens」除了推出「學習模式」外,還整合了其他旨在培養好奇心與問題解決能力的工具,鼓勵
Google 推出虛假來電偵測功能,以防範人工智慧深度偽造(deepfake)冒充詐騙
Google 週二宣布,Android 將推出「虛假來電偵測」功能,以防範利用人工智慧深度偽造技術進行的冒充詐騙。此功能將於本月透過「Phone by Google」在全球範圍內逐步推送至 Android 12 及以上版本的裝置,首先從 Pixel 裝置開始。隨著人們越來越不願接聽未知號碼的來電,詐騙者正改變策略,透過偽造可信賴的電話號碼,並利用 AI 深度偽造技術,讓聲音聽起來像是權威人士、家人
Frontier AI Labs 拒絕透露針對失控模型的管控策略
近期研究顯示,極少數頂尖的人工智慧實驗室曾公布或展示過「遏制應變計畫」。遏制計畫旨在界定當人工智慧系統試圖顛覆人類控制時應採取的程序,具體說明應撤銷哪些存取權限,以及何時應完全關閉系統。這些發現來自「Guidelight AI Standards」——一個致力於推動安全前沿人工智慧開發實務的組織,該組織針對五家主要實驗室在此類情境下的應變準備程度進行了評估。 OpenAI 排名最高,而 Anthr
Gold medals at the IMO? That's insane! 🤯 It feels like we're watching sci-fi become reality. But honestly, the 'rivalry' angle in the headline is getting a bit old—can't we just celebrate the collective leap forward? Still, makes me wonder how this will trickle down to actual classroom tools.





首頁






