2025 年 AGI 推理的最新 LLM 進展與挑戰為何?
人工一般智慧 (Artificial General Intelligence) 的發展勢頭越來越猛。本文將探討致力於增強大型語言模型推理能力的前沿研究,重點介紹來自斯坦福、哈佛、麻省理工、英偉達和卡內基梅隆大學等機構的創新方法。我們將解開核心思想、解決目前的限制,並考慮 AGI 研究的未來軌跡,最終揭開通往真正通用智慧之路的神秘面紗。
重點
最近的研究集中在改善大型語言模型的推理能力。
新興技術包括訓練 LLM 識別抽象概念,以及在模型彙整過程中利用精密資訊。
主要的重點是透過策略性地利用訓練前和訓練後的資料,及早建立推理基礎。
儘管取得了進展,但仍然存在重大障礙,特別是在開放式問題解決方面。
在多機器人系統中超越簡單的多數投票被認為是獲得更強、更可靠結果的關鍵。
嚴格的實驗和高品質的資料集是提高 AGI 模型推理品質的基礎。
在低維模型空間內進行有監督的預訓對於開發多功能模型至關重要。
培養多樣性和消除統計偏差有助於建立更具彈性的人工智能系統。
LLM 推理研究的面貌
人工一般智慧與推理的最新研究
AGI 領域進展迅速,領先的學術與研究機構投入了大量資源。當代的研究致力於縮小專門人工智能與廣泛的類人智能之間的差距。其核心目標是讓 LLM 具備先進的推理能力,以應付複雜的挑戰並形成正確的判斷。
推理的挑戰:雖然 LLM 在文字產生與翻譯方面表現良好,但推理卻是更大的挑戰。它通常需要
- 抽象:將問題縮小為基本原則和概念。
- 推論:從一組給定的資訊中得出合乎邏輯的結論。
- 規劃:制定逐步達成預期目標的方法。
許多目前的模型都發現這些任務很困難,尤其是當需要處理一種格式的資料,並將其輸出為另一種無法預見的格式時。這種複雜性對健全的 AGI 發展構成重大障礙。
主要研究機構及其貢獻
在 LLM 推理研究領域中,著名的研究機構正處於領先地位:
- 斯坦福大學:首創訓練 LLM 的方法,以發掘有助於解決問題的抽象概念。
- 哈佛大學:推進結合高階資料關係的 LLM 彙總技術。
- 麻省理工學院:在協同式人工智慧系統中,開發超越基本多數投票的方法。
- NVIDIA:研究如何最佳化結合訓練前與訓練後的資料,從一開始就建立推理能力。
- 卡內基美隆大學:專注於解決推理問題的訓練方法。
這些合作與多樣化的努力,突顯了實現 AGI 所面臨的多重挑戰。
關鍵論文解析
訓練 LLM 來發現抽象概念

一項重要的研究集中在教導 LLMs 掌握抽象的原則。目的是提升他們解決問題與邏輯推理的能力。研究人員設計了一種技術,讓模型產生抽象概念來解決問題。透過將問題抽象化,LLM 可以更好地理解問題並設計有效的解決方案。卡內基梅隆大學和斯坦福大學的這項合作研究強調的訓練方法,可以揭示問題的基本結構,使解決途徑更加清晰。
訓練細節:
- 此方法著重於了解問題的核心元素。
- 它代表了從單步推理到分層、層次策略的轉變。
- 一個關鍵的創新是將策劃與執行分開。
優點
- 建立分工,使不同的部分都能進行專門的最佳化。
- 促進高效學習,因為每個部分都會對相關資料進行訓練。
- 簡化複雜性,讓模型更容易處理資訊。
超越多數投票:利用高階資訊進行 LLM 彙總

這項研究批判了多機器人系統中僅依賴大多數投票的常見做法。一致意見可能會造成限制。本文建議使用高階資訊來更精確地預測可能的最佳結果。
類似於重視火箭科學家對於航太主題的意見而非一般共識,此方法會根據個別 AI 代理的專業知識以及與他人的關聯性來衡量其貢獻。這項研究由麻省理工學院、哈佛大學和芝加哥大學合作進行。
超越多數的投票:
- 它利用了一階資訊,例如每個模型的已知準確度。
- 它也結合了二階資訊,這關係到模型的答案彼此之間的關係。
- 此方法會評估類似問題:「既然模型 B 和 C 回答了 X,那麼模型 A 回答 Y 的重要性有多大?」以充分運用集體智慧。
前置推理:訓練前和訓練後的資料之間的協同作用

英伟达、卡内基梅隆大学、波士顿大学和斯坦福大学联合探索前置推理以及训练前和训练后数据之间的相互作用。目標是確定引入不同資料類型的最佳時機,以最大化模型效率與效能。
- 在預訓期間導入推理資料可以帶來更持久的改進。
- 監督微調本身是不足夠的;資料品質與多樣性之間的平衡是獲得顯著收益的關鍵。
- 適當的實作讓模型即使在較小的測試集上也能表現良好,顯示出更高的整體效能。
如何應用這些研究結果
實用的實施步驟
雖然全面實施可能需要大量資源,但開發人員可以採用幾項核心原則:
- 優先使用高品質的預訓資料:為初始訓練階段投資於多樣化、精心策劃的資料集。
- 探索分層推理架構:採用可區分策略規劃與戰術執行的模型設計。
- 實施精密的評估指標:除了基本的精確度之外,還要加入能捕捉模型間關係的指標,以進行更真實的效能評估。
應用這些原則可以開發出更強大且更有能力的模型,有助於朝向 AGI 逐步邁進。
探索大型語言模型的抽象產生器
優點
將策略制定與執行分開,可改善效能。
分工有助於專業化和更有效率的學習過程。
有可能取得優異的結果。
減少所需的測試資料量,同時改善結果。
缺點
許多實驗目前僅限於數學推理任務。
需要在涉及類人互動的情境中進一步測試。
模型通常是從頭開始訓練,需要耗費大量資源。
在處理高度複雜的問題時,模型的指導有限。
常見問題
什麼是 AGI?
AGI 或人工智慧 (Artificial General Intelligence),指的是一種理論形式的人工智慧,它擁有理解、學習和應用各種任務知識的能力,達到人類的水準。與專為特定功能所設計的狹隘人工智慧不同,AGI 會展現適應性的問題解決與推理能力。
如何為模型建立高品質的資料集
編輯高品質的資料集是一個資源密集的過程,通常需要人工檢閱與分析。其中一種方法是採用多機器人系統,以評估和平衡各個層面的資料品質。同時具備高品質與多樣性的資料集可產生更穩定、更廣泛的模型,能夠處理更廣泛的輸入。
什麼是「前置推理」?
前置推理」描述了一種在 LLM 的基礎預訓階段嵌入推理能力的策略。這種早期的強調有助於模型從一開始就為抽象思維和複雜問題的解決打下堅實的基礎。
相關問題
多機體 LLM 系統中多數投票的限制為何?
雖然多數投票提供了一個簡單的基線,但它也有缺點。它沒有考慮到個別模型不同的精確度,而且如果模型有類似的架構,它們可能會延續相同的系統錯誤,窒礙創新。利用高階資訊提供了一種方式,可以做出更細微、更精準的決策。
將推理資料注入資料調整的最佳方式是什麼?
最有效的方法是在最初的預訓階段整合以推理為重點的資料。這個基礎步驟對於開發具有進階推理能力的模型而言,可以產生最持久的改善。
相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
評論 (3)
0/500
Honestly, these reasoning benchmarks feel like measuring how well a parrot can mimic logic. Still cool though. 🦜
Die Forschung zu Reasoning-Fähigkeiten bei LLMs ist echt spannend! Besonders interessant finde ich die Frage, ob solche Modelle irgendwann wirklich logische Schlüsse ziehen können oder ob sie nur Muster reproduzieren. Die ethischen Implikationen, wenn solche Systeme in kritischen Bereichen eingesetzt werden, machen mir aber auch etwas Sorgen. 🤔
人工一般智慧 (Artificial General Intelligence) 的發展勢頭越來越猛。本文將探討致力於增強大型語言模型推理能力的前沿研究,重點介紹來自斯坦福、哈佛、麻省理工、英偉達和卡內基梅隆大學等機構的創新方法。我們將解開核心思想、解決目前的限制,並考慮 AGI 研究的未來軌跡,最終揭開通往真正通用智慧之路的神秘面紗。
重點
最近的研究集中在改善大型語言模型的推理能力。
新興技術包括訓練 LLM 識別抽象概念,以及在模型彙整過程中利用精密資訊。
主要的重點是透過策略性地利用訓練前和訓練後的資料,及早建立推理基礎。
儘管取得了進展,但仍然存在重大障礙,特別是在開放式問題解決方面。
在多機器人系統中超越簡單的多數投票被認為是獲得更強、更可靠結果的關鍵。
嚴格的實驗和高品質的資料集是提高 AGI 模型推理品質的基礎。
在低維模型空間內進行有監督的預訓對於開發多功能模型至關重要。
培養多樣性和消除統計偏差有助於建立更具彈性的人工智能系統。
LLM 推理研究的面貌
人工一般智慧與推理的最新研究
AGI 領域進展迅速,領先的學術與研究機構投入了大量資源。當代的研究致力於縮小專門人工智能與廣泛的類人智能之間的差距。其核心目標是讓 LLM 具備先進的推理能力,以應付複雜的挑戰並形成正確的判斷。
推理的挑戰:雖然 LLM 在文字產生與翻譯方面表現良好,但推理卻是更大的挑戰。它通常需要
- 抽象:將問題縮小為基本原則和概念。
- 推論:從一組給定的資訊中得出合乎邏輯的結論。
- 規劃:制定逐步達成預期目標的方法。
許多目前的模型都發現這些任務很困難,尤其是當需要處理一種格式的資料,並將其輸出為另一種無法預見的格式時。這種複雜性對健全的 AGI 發展構成重大障礙。
主要研究機構及其貢獻
在 LLM 推理研究領域中,著名的研究機構正處於領先地位:
- 斯坦福大學:首創訓練 LLM 的方法,以發掘有助於解決問題的抽象概念。
- 哈佛大學:推進結合高階資料關係的 LLM 彙總技術。
- 麻省理工學院:在協同式人工智慧系統中,開發超越基本多數投票的方法。
- NVIDIA:研究如何最佳化結合訓練前與訓練後的資料,從一開始就建立推理能力。
- 卡內基美隆大學:專注於解決推理問題的訓練方法。
這些合作與多樣化的努力,突顯了實現 AGI 所面臨的多重挑戰。
關鍵論文解析
訓練 LLM 來發現抽象概念

一項重要的研究集中在教導 LLMs 掌握抽象的原則。目的是提升他們解決問題與邏輯推理的能力。研究人員設計了一種技術,讓模型產生抽象概念來解決問題。透過將問題抽象化,LLM 可以更好地理解問題並設計有效的解決方案。卡內基梅隆大學和斯坦福大學的這項合作研究強調的訓練方法,可以揭示問題的基本結構,使解決途徑更加清晰。
訓練細節:
- 此方法著重於了解問題的核心元素。
- 它代表了從單步推理到分層、層次策略的轉變。
- 一個關鍵的創新是將策劃與執行分開。
優點
- 建立分工,使不同的部分都能進行專門的最佳化。
- 促進高效學習,因為每個部分都會對相關資料進行訓練。
- 簡化複雜性,讓模型更容易處理資訊。
超越多數投票:利用高階資訊進行 LLM 彙總

這項研究批判了多機器人系統中僅依賴大多數投票的常見做法。一致意見可能會造成限制。本文建議使用高階資訊來更精確地預測可能的最佳結果。
類似於重視火箭科學家對於航太主題的意見而非一般共識,此方法會根據個別 AI 代理的專業知識以及與他人的關聯性來衡量其貢獻。這項研究由麻省理工學院、哈佛大學和芝加哥大學合作進行。
超越多數的投票:
- 它利用了一階資訊,例如每個模型的已知準確度。
- 它也結合了二階資訊,這關係到模型的答案彼此之間的關係。
- 此方法會評估類似問題:「既然模型 B 和 C 回答了 X,那麼模型 A 回答 Y 的重要性有多大?」以充分運用集體智慧。
前置推理:訓練前和訓練後的資料之間的協同作用

英伟达、卡内基梅隆大学、波士顿大学和斯坦福大学联合探索前置推理以及训练前和训练后数据之间的相互作用。目標是確定引入不同資料類型的最佳時機,以最大化模型效率與效能。
- 在預訓期間導入推理資料可以帶來更持久的改進。
- 監督微調本身是不足夠的;資料品質與多樣性之間的平衡是獲得顯著收益的關鍵。
- 適當的實作讓模型即使在較小的測試集上也能表現良好,顯示出更高的整體效能。
如何應用這些研究結果
實用的實施步驟
雖然全面實施可能需要大量資源,但開發人員可以採用幾項核心原則:
- 優先使用高品質的預訓資料:為初始訓練階段投資於多樣化、精心策劃的資料集。
- 探索分層推理架構:採用可區分策略規劃與戰術執行的模型設計。
- 實施精密的評估指標:除了基本的精確度之外,還要加入能捕捉模型間關係的指標,以進行更真實的效能評估。
應用這些原則可以開發出更強大且更有能力的模型,有助於朝向 AGI 逐步邁進。
探索大型語言模型的抽象產生器
優點
將策略制定與執行分開,可改善效能。
分工有助於專業化和更有效率的學習過程。
有可能取得優異的結果。
減少所需的測試資料量,同時改善結果。
缺點
許多實驗目前僅限於數學推理任務。
需要在涉及類人互動的情境中進一步測試。
模型通常是從頭開始訓練,需要耗費大量資源。
在處理高度複雜的問題時,模型的指導有限。
常見問題
什麼是 AGI?
AGI 或人工智慧 (Artificial General Intelligence),指的是一種理論形式的人工智慧,它擁有理解、學習和應用各種任務知識的能力,達到人類的水準。與專為特定功能所設計的狹隘人工智慧不同,AGI 會展現適應性的問題解決與推理能力。
如何為模型建立高品質的資料集
編輯高品質的資料集是一個資源密集的過程,通常需要人工檢閱與分析。其中一種方法是採用多機器人系統,以評估和平衡各個層面的資料品質。同時具備高品質與多樣性的資料集可產生更穩定、更廣泛的模型,能夠處理更廣泛的輸入。
什麼是「前置推理」?
前置推理」描述了一種在 LLM 的基礎預訓階段嵌入推理能力的策略。這種早期的強調有助於模型從一開始就為抽象思維和複雜問題的解決打下堅實的基礎。
相關問題
多機體 LLM 系統中多數投票的限制為何?
雖然多數投票提供了一個簡單的基線,但它也有缺點。它沒有考慮到個別模型不同的精確度,而且如果模型有類似的架構,它們可能會延續相同的系統錯誤,窒礙創新。利用高階資訊提供了一種方式,可以做出更細微、更精準的決策。
將推理資料注入資料調整的最佳方式是什麼?
最有效的方法是在最初的預訓階段整合以推理為重點的資料。這個基礎步驟對於開發具有進階推理能力的模型而言,可以產生最持久的改善。
前OpenAI首席科學家Ilya的SSI首次釋出模型
AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長
Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
Honestly, these reasoning benchmarks feel like measuring how well a parrot can mimic logic. Still cool though. 🦜
Die Forschung zu Reasoning-Fähigkeiten bei LLMs ist echt spannend! Besonders interessant finde ich die Frage, ob solche Modelle irgendwann wirklich logische Schlüsse ziehen können oder ob sie nur Muster reproduzieren. Die ethischen Implikationen, wenn solche Systeme in kritischen Bereichen eingesetzt werden, machen mir aber auch etwas Sorgen. 🤔





首頁






