人工智慧模型在解決高階數學問題方面取得突破

上週末,軟體工程師、前量化研究員暨新創公司創辦人尼爾·索馬尼(Neel Somani)在評估 OpenAI 新模型的數學能力時,意外發現了一個驚人的結果。他在 ChatGPT 中輸入一道題目並讓其運算 15 分鐘後,返回時發現系統已給出完整的解法。他審閱了證明過程,並使用名為 Harmonic 的工具進行驗證——結果一切正確無誤。
「我希望建立一個基準,用以理解大型語言模型何時能有效解決未解的數學問題,以及它們在哪些方面仍面臨挑戰,」索馬尼解釋道。這項出乎意料的發現是,最新模型已將可能性的邊界推向了更遠。
ChatGPT 的推理鏈尤其令人驚豔,它流暢地運用了勒讓德公式、伯特蘭假設以及大衛之星定理等數學原理。該模型最終引用了一篇 2013 年的 Math Overflow 貼文,哈佛大學數學家諾姆·埃爾基斯(Noam Elkies)曾在其中為一個相關問題提供了優雅的解法。 然而,ChatGPT 的最終證明在關鍵方面與埃爾基斯的工作有所不同,它為傳奇數學家保羅·埃爾德什最初提出的變體問題提供了更全面的解決方案。埃爾德什那份龐大的未解問題集,已成為測試人工智慧能力的試金石。
對於那些對機器智能持懷疑態度的人來說,這個結果令人驚嘆——而且這並非孤立案例。AI 工具已在數學領域無所不在,從 Harmonic 的 Aristotle 這種專注於形式化的 LLM,到 OpenAI 的 deep research 這種文獻檢索系統皆然。 自 GPT-5.2 發布以來——索馬尼指出,據傳該版本「在數學推理方面比先前版本更為嫻熟」——已解決的問題數量顯著增加,這引發了關於大型語言模型能否拓展人類知識邊界的全新探討。
索馬尼當時正在研究「埃爾德什問題」——這是一套由匈牙利數學家提出的、在線上被歸檔的超過1,000項猜想。這些問題在主題和難度上差異極大,已成為人工智慧驅動的數學探索的主要目標。首批自主解法於11月由一個名為AlphaEvolve的Gemini驅動模型提出,但最近,索馬尼等人觀察到GPT-5.2在高等數學方面展現出非凡的造詣。
自聖誕節以來,埃爾德什問題網站上已有15道題目從「未解」更新為「已解」——其中11個解法明確標註了AI模型的參與。
著名數學家陶哲軒在其 GitHub 頁面針對這項進展提供了更詳盡的見解,他列舉了八個由 AI 模型做出實質性自主貢獻的獨立問題,以及另外六個透過識別並基於先前研究成果而取得進展的案例。儘管完全自主的 AI 數學推理仍是遙遠的目標,但顯而易見的是,大型模型已開始發揮重要作用。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先購票。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上我們的舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並提升競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先獲得入場資格。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上各舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並強化競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
在 Mastodon 上,Tao 指出,AI 系統的可擴展性使其「特別適合解決那些鮮為人知的『長尾』埃爾德什難題,其中許多其實有很直觀的解法。」
「因此,這些較易入手的埃爾德什問題,如今透過純粹的 AI 方法解決的可能性,已遠高於人類或混合式方法,」陶補充道。
另一個促成因素是近期向形式化發展的轉變——這是一項詳盡的流程,能讓數學推理更容易被驗證與延伸。雖然形式化本身並不必然需要人工智慧或電腦,但新一代的自動化工具已大幅簡化了工作流程。 2013年由微軟研究院開發的開源「證明輔助工具」Lean,已在該領域廣泛應用於證明形式化。像Harmonic公司的Aristotle這類AI工具,如今有望將這項形式化工作的大部分自動化。
對 Harmonic 創辦人 Tudor Achim 而言,埃爾德什難題的解題數量驟增,其意義遠不如頂尖數學家開始認真看待這些工具這件事來得重要。「我更感興趣的是,數學與電腦科學教授們正在使用 [AI 工具],」Achim 表示。「這些人需要維護自己的聲譽,因此當他們證實自己使用 Aristotle 或 ChatGPT 時,這便是極具意義的認可。」
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (0)
0/500

上週末,軟體工程師、前量化研究員暨新創公司創辦人尼爾·索馬尼(Neel Somani)在評估 OpenAI 新模型的數學能力時,意外發現了一個驚人的結果。他在 ChatGPT 中輸入一道題目並讓其運算 15 分鐘後,返回時發現系統已給出完整的解法。他審閱了證明過程,並使用名為 Harmonic 的工具進行驗證——結果一切正確無誤。
「我希望建立一個基準,用以理解大型語言模型何時能有效解決未解的數學問題,以及它們在哪些方面仍面臨挑戰,」索馬尼解釋道。這項出乎意料的發現是,最新模型已將可能性的邊界推向了更遠。
ChatGPT 的推理鏈尤其令人驚豔,它流暢地運用了勒讓德公式、伯特蘭假設以及大衛之星定理等數學原理。該模型最終引用了一篇 2013 年的 Math Overflow 貼文,哈佛大學數學家諾姆·埃爾基斯(Noam Elkies)曾在其中為一個相關問題提供了優雅的解法。 然而,ChatGPT 的最終證明在關鍵方面與埃爾基斯的工作有所不同,它為傳奇數學家保羅·埃爾德什最初提出的變體問題提供了更全面的解決方案。埃爾德什那份龐大的未解問題集,已成為測試人工智慧能力的試金石。
對於那些對機器智能持懷疑態度的人來說,這個結果令人驚嘆——而且這並非孤立案例。AI 工具已在數學領域無所不在,從 Harmonic 的 Aristotle 這種專注於形式化的 LLM,到 OpenAI 的 deep research 這種文獻檢索系統皆然。 自 GPT-5.2 發布以來——索馬尼指出,據傳該版本「在數學推理方面比先前版本更為嫻熟」——已解決的問題數量顯著增加,這引發了關於大型語言模型能否拓展人類知識邊界的全新探討。
索馬尼當時正在研究「埃爾德什問題」——這是一套由匈牙利數學家提出的、在線上被歸檔的超過1,000項猜想。這些問題在主題和難度上差異極大,已成為人工智慧驅動的數學探索的主要目標。首批自主解法於11月由一個名為AlphaEvolve的Gemini驅動模型提出,但最近,索馬尼等人觀察到GPT-5.2在高等數學方面展現出非凡的造詣。
自聖誕節以來,埃爾德什問題網站上已有15道題目從「未解」更新為「已解」——其中11個解法明確標註了AI模型的參與。
著名數學家陶哲軒在其 GitHub 頁面針對這項進展提供了更詳盡的見解,他列舉了八個由 AI 模型做出實質性自主貢獻的獨立問題,以及另外六個透過識別並基於先前研究成果而取得進展的案例。儘管完全自主的 AI 數學推理仍是遙遠的目標,但顯而易見的是,大型模型已開始發揮重要作用。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先購票。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上我們的舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並提升競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
加入 Disrupt 2026 候補名單
加入 Disrupt 2026 候補名單,即可在早鳥票開售時優先獲得入場資格。 過往的 Disrupt 活動曾邀請 Google Cloud、Netflix、Microsoft、Box、Phia、a16z、ElevenLabs、Wayve、Hugging Face、Elad Gil 及 Vinod Khosla 等業界領袖登上各舞台——他們是超過 250 位產業專家中的一員,共同主持逾 200 場專為加速您的成長並強化競爭優勢而設計的講座。此外,您還能與數百家推動各行各業創新的新創公司建立聯繫。
在 Mastodon 上,Tao 指出,AI 系統的可擴展性使其「特別適合解決那些鮮為人知的『長尾』埃爾德什難題,其中許多其實有很直觀的解法。」
「因此,這些較易入手的埃爾德什問題,如今透過純粹的 AI 方法解決的可能性,已遠高於人類或混合式方法,」陶補充道。
另一個促成因素是近期向形式化發展的轉變——這是一項詳盡的流程,能讓數學推理更容易被驗證與延伸。雖然形式化本身並不必然需要人工智慧或電腦,但新一代的自動化工具已大幅簡化了工作流程。 2013年由微軟研究院開發的開源「證明輔助工具」Lean,已在該領域廣泛應用於證明形式化。像Harmonic公司的Aristotle這類AI工具,如今有望將這項形式化工作的大部分自動化。
對 Harmonic 創辦人 Tudor Achim 而言,埃爾德什難題的解題數量驟增,其意義遠不如頂尖數學家開始認真看待這些工具這件事來得重要。「我更感興趣的是,數學與電腦科學教授們正在使用 [AI 工具],」Achim 表示。「這些人需要維護自己的聲譽,因此當他們證實自己使用 Aristotle 或 ChatGPT 時,這便是極具意義的認可。」
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






