三星的精巧 AI 模型在推理能力上勝過較大的競爭對手
三星 AI 研究人員的一篇新論文概述了緊湊型網路如何在處理複雜的推理任務時優於大規模的大型語言模型 (LLM)。
在爭奪人工智能主導地位的競賽中,業界普遍的口號是 「越大越好」。當科技巨頭投資數十億美元開發越來越大的模型時,Samsung SAIL Montréal 的 Alexia Jolicoeur-Martineau 提出了另一種更有效率的方法,即使用微小遞歸模型 (TRM)。
TRM 只需 7 百萬個參數 - 少於頂尖 LLM 大小的 0.01%,就能在 ARC-AGI 智慧測試等臭名昭著的挑戰性基準上取得最先進的新結果。Samsung 的研究結果挑戰了一般人認為規模是推進人工智慧的唯一途徑的看法,提出了一個更具永續性、更節省參數的替代方案。
克服規模的限制
雖然 LLM 擅長產生類似人類的文字,但它們處理複雜、多步驟推理的能力往往很脆弱。由於它們會逐個符號產生回應,因此早期的一個錯誤可能會影響整個解決方案,造成不正確的最終答案。
Chain-of-Thought 之類的技術,可以讓模型一步一步地分解問題,目的在於緩解這個問題。然而,這些方法的計算成本很高,通常需要大量高品質的推理資料,而且仍可能產生錯誤的邏輯。即使有了這些改進,LLM 也很難解決需要完美邏輯執行的難題。
Samsung 的研究以最近的層次推理模型 (HRM) 為基礎。HRM 使用兩個小型神經網路,以不同頻率遞迴精煉答案。儘管這個模型很有前途,但卻很複雜,它依賴於不確定的生物論據和定點定理,而這些論據和定理並不總是適用的。
與 HRM 的雙網路架構不同,TRM 採用了單一、精簡的網路,可以遞歸地增強其內部推理和建議的答案。
模型接收問題、初始答案猜測和潛在推理特徵。然後,它會循環多個步驟,根據所有三個輸入來改進其推理。使用此改進的推理,它會更新其最終答案預測。整個過程最多可以重複 16 次,使模型能夠以高度節省參數的方式逐步進行自我修正。
與直覺相反的是,研究發現兩層網路的泛化效果比四層網路好得多。較小的設計似乎可以防止過度適應 - 這是在有限的專門資料集上進行訓練時常見的問題。
TRM 也消除了其前身的複雜數學假設。原始的 HRM 模型必須假設函數收斂到一個固定點,才能證明其訓練的合理性。TRM 繞過了這一點,透過其完整的遞歸過程進行反向傳播 - 這一改變大大提高了性能,在消融測試中,Sudoku-Extreme 基準準準確率從 56.5% 提高到 87.4%。
三星的模型以更少的資源擊敗 AI 基準
結果令人驚訝。在只使用 1,000 個訓練範例的 Sudoku-Extreme 資料集上,TRM 的測試準確度達到 87.4%,相較於 HRM 的 55%,是一大躍進。在 Maze-Hard(需要在 30×30 的迷宮中穿梭長路徑)上,TRM 的測試準確率為 85.3%,HRM 則為 74.5%。
最值得注意的是,TRM 在抽象與推理語料庫(Abstraction and Reasoning Corpus,ARC-AGI)上取得了顯著進步,ARC-AGI 是為評估人工智能中真正的流體智能而設計的基準。僅使用 7M 參數,TRM 就在 ARC-AGI-1 上達到 44.6% 的準確度,在 ARC-AGI-2 上達到 7.8%。這勝過使用 27M 參數的 HRM,甚至超越許多全球最大的 LLM。相較之下,Gemini 2.5 Pro 在 ARC-AGI-2 的得分只有 4.9%。
TRM 的訓練流程也經過最佳化。我們簡化了稱為 ACT 的自適應機制 (該機制可決定模型何時已充分改善答案並可繼續前進),省去了每個訓練步驟中成本高昂的第二次前進。這項調整並未損害整體的泛化能力。
Samsung 的研究有力地反駁了建立越來越大的 AI 模型的趨勢。它證明了透過設計具有迭代推理和自我修正能力的架構,只需使用極小部分的計算資源,就能解決極度困難的問題。
另請參閱:Google 新的 AI 代理可改寫程式碼,自動修補漏洞

有興趣向業界領導者瞭解更多關於 AI 和大資料的資訊嗎?參加在阿姆斯特丹、加州和倫敦舉行的 AI & Big Data Expo。這項綜合活動是 TechEx 的一部分,並與其他主要科技活動 (如網路安全博覽會) 同時舉行。點選此處瞭解詳情。
AI News 由 TechForge Media 提供。在此探索其他即將舉行的企業技術活動和網路研討會。
相關文章
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
亞馬遜推出“Alexa for Shopping”,同時將Rufus邊緣化
亞馬遜推出了“Alexa for Shopping”,將 Rufus 購物聊天機器人 Alexa+ 整合到應用程式、網站和 Echo Show 裝置中。該助手回答產品查詢、比較商品、跟蹤價格,並支援購物提醒。它還處理計劃中的購物操作和符合條件的自動購買。據該公司稱,“Alexa for Shopping”將 Rufus 的產品專業知識與 Alexa+ 的個性化助手上下文相結合。亞馬遜表示,Rufus 在 2025 年協助了超過 3 億客戶進行產品研究、比較和購買。GeekWire 報道稱,
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日
相關專題推薦
評論 (0)
0/500
三星 AI 研究人員的一篇新論文概述了緊湊型網路如何在處理複雜的推理任務時優於大規模的大型語言模型 (LLM)。
在爭奪人工智能主導地位的競賽中,業界普遍的口號是 「越大越好」。當科技巨頭投資數十億美元開發越來越大的模型時,Samsung SAIL Montréal 的 Alexia Jolicoeur-Martineau 提出了另一種更有效率的方法,即使用微小遞歸模型 (TRM)。
TRM 只需 7 百萬個參數 - 少於頂尖 LLM 大小的 0.01%,就能在 ARC-AGI 智慧測試等臭名昭著的挑戰性基準上取得最先進的新結果。Samsung 的研究結果挑戰了一般人認為規模是推進人工智慧的唯一途徑的看法,提出了一個更具永續性、更節省參數的替代方案。
克服規模的限制
雖然 LLM 擅長產生類似人類的文字,但它們處理複雜、多步驟推理的能力往往很脆弱。由於它們會逐個符號產生回應,因此早期的一個錯誤可能會影響整個解決方案,造成不正確的最終答案。
Chain-of-Thought 之類的技術,可以讓模型一步一步地分解問題,目的在於緩解這個問題。然而,這些方法的計算成本很高,通常需要大量高品質的推理資料,而且仍可能產生錯誤的邏輯。即使有了這些改進,LLM 也很難解決需要完美邏輯執行的難題。
Samsung 的研究以最近的層次推理模型 (HRM) 為基礎。HRM 使用兩個小型神經網路,以不同頻率遞迴精煉答案。儘管這個模型很有前途,但卻很複雜,它依賴於不確定的生物論據和定點定理,而這些論據和定理並不總是適用的。
與 HRM 的雙網路架構不同,TRM 採用了單一、精簡的網路,可以遞歸地增強其內部推理和建議的答案。
模型接收問題、初始答案猜測和潛在推理特徵。然後,它會循環多個步驟,根據所有三個輸入來改進其推理。使用此改進的推理,它會更新其最終答案預測。整個過程最多可以重複 16 次,使模型能夠以高度節省參數的方式逐步進行自我修正。
與直覺相反的是,研究發現兩層網路的泛化效果比四層網路好得多。較小的設計似乎可以防止過度適應 - 這是在有限的專門資料集上進行訓練時常見的問題。
TRM 也消除了其前身的複雜數學假設。原始的 HRM 模型必須假設函數收斂到一個固定點,才能證明其訓練的合理性。TRM 繞過了這一點,透過其完整的遞歸過程進行反向傳播 - 這一改變大大提高了性能,在消融測試中,Sudoku-Extreme 基準準準確率從 56.5% 提高到 87.4%。
三星的模型以更少的資源擊敗 AI 基準
結果令人驚訝。在只使用 1,000 個訓練範例的 Sudoku-Extreme 資料集上,TRM 的測試準確度達到 87.4%,相較於 HRM 的 55%,是一大躍進。在 Maze-Hard(需要在 30×30 的迷宮中穿梭長路徑)上,TRM 的測試準確率為 85.3%,HRM 則為 74.5%。
最值得注意的是,TRM 在抽象與推理語料庫(Abstraction and Reasoning Corpus,ARC-AGI)上取得了顯著進步,ARC-AGI 是為評估人工智能中真正的流體智能而設計的基準。僅使用 7M 參數,TRM 就在 ARC-AGI-1 上達到 44.6% 的準確度,在 ARC-AGI-2 上達到 7.8%。這勝過使用 27M 參數的 HRM,甚至超越許多全球最大的 LLM。相較之下,Gemini 2.5 Pro 在 ARC-AGI-2 的得分只有 4.9%。
TRM 的訓練流程也經過最佳化。我們簡化了稱為 ACT 的自適應機制 (該機制可決定模型何時已充分改善答案並可繼續前進),省去了每個訓練步驟中成本高昂的第二次前進。這項調整並未損害整體的泛化能力。
Samsung 的研究有力地反駁了建立越來越大的 AI 模型的趨勢。它證明了透過設計具有迭代推理和自我修正能力的架構,只需使用極小部分的計算資源,就能解決極度困難的問題。
另請參閱:Google 新的 AI 代理可改寫程式碼,自動修補漏洞

有興趣向業界領導者瞭解更多關於 AI 和大資料的資訊嗎?參加在阿姆斯特丹、加州和倫敦舉行的 AI & Big Data Expo。這項綜合活動是 TechEx 的一部分,並與其他主要科技活動 (如網路安全博覽會) 同時舉行。點選此處瞭解詳情。
AI News 由 TechForge Media 提供。在此探索其他即將舉行的企業技術活動和網路研討會。
華納音樂收購AI歸因初創公司Sureel AI
華納音樂集團(WMG)於週三確認,其正在收購Sureel AI,一家專注於人工智慧歸因的初創公司。Sureel的專有技術為音樂曲目生成“AI DNA”,將其分解為各個組成部分,以追蹤人工智慧模型如何利用這些元素。透過此次收購,WMG旨在增強其監控其藝術家和詞曲創作者的作品在人工智慧生成內容中被使用或用於訓練人工智慧模型的能力。“將Sureel整合到WMG中,增強了我們的保護、控制和變現能力,確保創意社羣保留對其智慧財產權、姓名、肖像、形象和聲音的控制權,”WMG執行長Robert Kync
微軟、Azure 與 AI 技術共同對抗加州野火風險
微軟投資於人工智慧驅動的野火偵測技術,其首席副總裁暨首席數據科學家胡安·拉維斯塔·費雷斯(Juan Lavista Ferres)針對減輕環境損害的策略進行了探討。根據美國國家航空暨太空總署(NASA)指出,氣候變遷影響地球上的每個人,其表現為氣溫上升、降雨模式改變以及海平面上升。NASA 指出,有確鑿證據顯示地球正以前所未有的速度變暖,而人類活動是主要驅動因素。隨著全球氣溫上升,野火構成的威脅日





首頁






