三星紧凑型人工智能模型在推理能力上胜过大型竞争对手
三星公司的一位人工智能研究人员发表了一篇新论文,概述了紧凑型网络在处理复杂推理任务时如何超越大规模大型语言模型(LLM)。
在争夺人工智能主导地位的竞赛中,业界的流行口号一直是 "越大越好"。当科技巨头们投资数十亿美元开发越来越大的模型时,三星SAIL蒙特利尔分公司的亚历克西娅-乔利科尔-马丁诺(Alexia Jolicoeur-Martineau)提出了一种不同的、更高效的方法,即使用微小递归模型(TRM)。
TRM只需700万个参数,不到顶级LLM的0.01%,就能在ARC-AGI智力测验等声名狼藉的挑战性基准上取得新的一流结果。三星的研究结果挑战了 "规模是推动人工智能发展的唯一途径 "这一普遍观点,提出了一种更具可持续性和参数效率的替代方案。
克服规模限制
虽然 LLM 擅长生成类似人类的文本,但它们处理复杂、多步骤推理的能力往往比较脆弱。由于 LLM 会逐个标记生成响应,因此早期的一个错误可能会影响整个解决方案,导致最终答案不正确。
思维链(Chain-of-Thought)等技术可以将问题一步步分解,从而缓解这一问题。然而,这些方法的计算成本很高,通常需要大量高质量的推理数据,而且仍然可能产生有缺陷的逻辑。即使有了这些改进,LLM 也难以解决那些要求逻辑执行完美无瑕的难题。
三星的研究建立在最近的分层推理模型(HRM)基础之上。HRM 使用两个小型神经网络,以不同频率递归完善答案。尽管前景看好,但该模型非常复杂,依赖于不确定的生物论据和并非始终适用的定点定理。
与 HRM 的双网络结构不同,TRM 采用了单个紧凑型网络,可递归增强其内部推理和建议答案。
该模型接收问题、初始答案猜测和潜在推理特征。然后,它通过多个步骤来完善基于所有三个输入的推理。利用改进后的推理,它可以更新最终的答案预测。整个过程最多可重复 16 次,从而使模型能够以参数效率极高的方式逐步进行自我修正。
研究发现,与四层网络相比,两层网络的泛化效果要好得多。较小的设计似乎可以防止过度拟合--这是在有限的专业数据集上进行训练时常见的问题。
TRM 还消除了其前身的复杂数学假设。最初的 HRM 模型必须假设函数收敛到一个固定点,才能证明其训练的合理性。TRM 绕过了这一问题,通过其完整的递归过程进行反向传播--这一改变极大地提高了性能,在消融测试中将数独-极限基准准确率从 56.5% 提高到 87.4%。
三星模型以更少的资源刷新人工智能基准
结果令人震惊。在仅使用 1,000 个训练示例的 Sudoku-Extreme 数据集上,TRM 的测试准确率达到了 87.4%,与 HRM 的 55% 相比实现了重大飞跃。在 "迷宫-困难"(Maze-Hard)数据集上,TRM 的测试准确率为 85.3%,而 HRM 为 74.5%。
最值得注意的是,TRM 在抽象与推理语料库(ARC-AGI)上取得了显著进步,该语料库是为评估人工智能中真正的流体智能而设计的基准。仅使用 700 万个参数,TRM 在 ARC-AGI-1 上的准确率就达到了 44.6%,在 ARC-AGI-2 上达到了 7.8%。这超过了使用 2700 万个参数的 HRM,甚至超过了世界上许多最大的 LLM。相比之下,Gemini 2.5 Pro 在 ARC-AGI-2 中的得分率仅为 4.9%。
TRM 的训练过程也得到了优化。简化了称为 ACT 的自适应机制,该机制用于确定模型何时已充分改进了答案,从而可以继续前进,从而消除了在每个训练步骤中进行代价高昂的第二次前向传递的需要。这一调整并未损害整体泛化效果。
三星的研究有力地反驳了建立越来越庞大的人工智能模型的趋势。它表明,通过设计能够进行迭代推理和自我修正的架构,只需使用极少的计算资源,就能解决极其困难的问题。
另请参见:谷歌新人工智能代理重写代码,自动修复漏洞

想从行业领导者那里了解更多有关人工智能和大数据的信息?参加在阿姆斯特丹、加利福尼亚和伦敦举办的人工智能与大数据博览会。这一综合性活动是 TechEx 的一部分,与网络安全博览会等其他主要科技活动同时举行。单击此处了解详情。
AI News 由 TechForge Media 提供技术支持。点击此处了解其他即将举行的企业技术活动和网络研讨会。
相关文章
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
亚马逊推出“Alexa for Shopping”,同时将Rufus边缘化
亚马逊推出了“Alexa for Shopping”,将 Rufus 购物聊天机器人 Alexa+ 整合到应用程序、网站和 Echo Show 设备中。该助手回答产品查询、比较商品、跟踪价格,并支持购物提醒。它还处理计划中的购物操作和符合条件的自动购买。据该公司称,“Alexa for Shopping”将 Rufus 的产品专业知识与 Alexa+ 的个性化助手上下文相结合。亚马逊表示,Rufus 在 2025 年协助了超过 3 亿客户进行产品研究、比较和购买。GeekWire 报道称,
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美
相关专题推荐
评论 (0)
0/500
三星公司的一位人工智能研究人员发表了一篇新论文,概述了紧凑型网络在处理复杂推理任务时如何超越大规模大型语言模型(LLM)。
在争夺人工智能主导地位的竞赛中,业界的流行口号一直是 "越大越好"。当科技巨头们投资数十亿美元开发越来越大的模型时,三星SAIL蒙特利尔分公司的亚历克西娅-乔利科尔-马丁诺(Alexia Jolicoeur-Martineau)提出了一种不同的、更高效的方法,即使用微小递归模型(TRM)。
TRM只需700万个参数,不到顶级LLM的0.01%,就能在ARC-AGI智力测验等声名狼藉的挑战性基准上取得新的一流结果。三星的研究结果挑战了 "规模是推动人工智能发展的唯一途径 "这一普遍观点,提出了一种更具可持续性和参数效率的替代方案。
克服规模限制
虽然 LLM 擅长生成类似人类的文本,但它们处理复杂、多步骤推理的能力往往比较脆弱。由于 LLM 会逐个标记生成响应,因此早期的一个错误可能会影响整个解决方案,导致最终答案不正确。
思维链(Chain-of-Thought)等技术可以将问题一步步分解,从而缓解这一问题。然而,这些方法的计算成本很高,通常需要大量高质量的推理数据,而且仍然可能产生有缺陷的逻辑。即使有了这些改进,LLM 也难以解决那些要求逻辑执行完美无瑕的难题。
三星的研究建立在最近的分层推理模型(HRM)基础之上。HRM 使用两个小型神经网络,以不同频率递归完善答案。尽管前景看好,但该模型非常复杂,依赖于不确定的生物论据和并非始终适用的定点定理。
与 HRM 的双网络结构不同,TRM 采用了单个紧凑型网络,可递归增强其内部推理和建议答案。
该模型接收问题、初始答案猜测和潜在推理特征。然后,它通过多个步骤来完善基于所有三个输入的推理。利用改进后的推理,它可以更新最终的答案预测。整个过程最多可重复 16 次,从而使模型能够以参数效率极高的方式逐步进行自我修正。
研究发现,与四层网络相比,两层网络的泛化效果要好得多。较小的设计似乎可以防止过度拟合--这是在有限的专业数据集上进行训练时常见的问题。
TRM 还消除了其前身的复杂数学假设。最初的 HRM 模型必须假设函数收敛到一个固定点,才能证明其训练的合理性。TRM 绕过了这一问题,通过其完整的递归过程进行反向传播--这一改变极大地提高了性能,在消融测试中将数独-极限基准准确率从 56.5% 提高到 87.4%。
三星模型以更少的资源刷新人工智能基准
结果令人震惊。在仅使用 1,000 个训练示例的 Sudoku-Extreme 数据集上,TRM 的测试准确率达到了 87.4%,与 HRM 的 55% 相比实现了重大飞跃。在 "迷宫-困难"(Maze-Hard)数据集上,TRM 的测试准确率为 85.3%,而 HRM 为 74.5%。
最值得注意的是,TRM 在抽象与推理语料库(ARC-AGI)上取得了显著进步,该语料库是为评估人工智能中真正的流体智能而设计的基准。仅使用 700 万个参数,TRM 在 ARC-AGI-1 上的准确率就达到了 44.6%,在 ARC-AGI-2 上达到了 7.8%。这超过了使用 2700 万个参数的 HRM,甚至超过了世界上许多最大的 LLM。相比之下,Gemini 2.5 Pro 在 ARC-AGI-2 中的得分率仅为 4.9%。
TRM 的训练过程也得到了优化。简化了称为 ACT 的自适应机制,该机制用于确定模型何时已充分改进了答案,从而可以继续前进,从而消除了在每个训练步骤中进行代价高昂的第二次前向传递的需要。这一调整并未损害整体泛化效果。
三星的研究有力地反驳了建立越来越庞大的人工智能模型的趋势。它表明,通过设计能够进行迭代推理和自我修正的架构,只需使用极少的计算资源,就能解决极其困难的问题。
另请参见:谷歌新人工智能代理重写代码,自动修复漏洞

想从行业领导者那里了解更多有关人工智能和大数据的信息?参加在阿姆斯特丹、加利福尼亚和伦敦举办的人工智能与大数据博览会。这一综合性活动是 TechEx 的一部分,与网络安全博览会等其他主要科技活动同时举行。单击此处了解详情。
AI News 由 TechForge Media 提供技术支持。点击此处了解其他即将举行的企业技术活动和网络研讨会。
华纳音乐收购AI归因初创公司Sureel AI
华纳音乐集团(WMG)于周三确认,其正在收购Sureel AI,一家专注于人工智能归因的初创公司。Sureel的专有技术为音乐曲目生成“AI DNA”,将其分解为各个组成部分,以追踪人工智能模型如何利用这些元素。通过此次收购,WMG旨在增强其监控其艺术家和词曲创作者的作品在人工智能生成内容中被使用或用于训练人工智能模型的能力。“将Sureel整合到WMG中,增强了我们的保护、控制和变现能力,确保创意社区保留对其知识产权、姓名、肖像、形象和声音的控制权,”WMG首席执行官Robert Kync
微软、Azure 和人工智能技术共同应对加利福尼亚州野火风险
微软投资于人工智能驱动的山火监测技术,其首席副总裁兼首席数据科学家胡安·拉维斯塔·费雷斯(Juan Lavista Ferres)探讨了减轻环境损害的策略。据美国国家航空航天局(NASA)称,气候变化影响着地球上的每个人,其表现为气温上升、降雨模式改变以及海平面上升。NASA指出,有确凿证据表明地球正以史无前例的速度变暖,而人类活动是其主要驱动因素。随着全球气温上升,野火构成的威胁日益加剧。 在美





首页






