微软研究发现更多人工智能代币会增加推理错误
关于 LLM 推理效率的新见解
微软的最新研究表明,大型语言模型中的高级推理技术并不能在不同的人工智能系统中产生统一的改进。他们的突破性研究分析了九个领先的基础模型在推理过程中对各种扩展方法的反应。
评估推理时间扩展方法
研究团队对三种不同的缩放技术实施了严格的测试方法:
- 传统的思维链提示
- 并行答案生成与汇总
- 通过反馈环路进行顺序改进

评估推理性能的实验框架 八项综合基准提供了跨学科的挑战性测试场景,包括数学、科学推理、复杂问题解决和空间分析。有几项评估采用了难度分级的方法,以考察成绩如何随问题复杂程度的变化而变化。
关于推理能力的重要发现
综合评估为人工智能从业人员提供了一些重要启示:
- 模型架构和任务领域不同,扩展技术带来的性能提升也大相径庭
- 更长的响应时间并不总是与更好的解决方案相关联
- 即使是相同的查询,计算成本也会出现不可预测的波动
- 通过广泛的扩展,传统模型有时可以与专门的推理模型相匹配
- 验证机制有望提高效率

不同模型和任务的性能与计算成本对比 对人工智能发展的实际影响
这些发现对企业实施人工智能具有重要意义:
成本可预测性是一大挑战,即使是正确答案,令牌的使用也会出现很大差异。"微软研究员贝斯米拉-努希(Besmira Nushi)指出:"开发人员需要具有一致计算模式的模型。
研究还发现,响应长度也是衡量模型可信度的一个潜在指标,过长的响应往往意味着超过某些阈值后的解决方案是不正确的。

GPT-4o 性能中的推理缩放模式 高效推理系统的未来
该研究强调了未来发展的多个前景广阔的方向:
"Nushi 解释说:"验证机制可以改变我们处理推理问题的方式。这种整合将允许自然语言界面利用专门的验证逻辑。
这项研究强调,随着人工智能系统承担越来越复杂的现实世界任务,人们越来越需要能在推理准确性与可预测计算成本之间取得平衡的解决方案。
相关文章
Gemini 为美国用户提供免费的个性化 AI 图片生成服务
周一,谷歌宣布,Gemini应用将把由Nano Banana驱动的个性化图像生成功能扩展至更广泛的用户群体。从今天起,美国所有符合条件的用户均可免费使用该功能,此前仅限Plus、Pro和Ultra订阅用户使用的限制已被取消。Gemini的“个人智能”功能于4月首次推出,可帮助用户生成符合其特定兴趣的图片。该功能使AI能够根据对用户偏好的理解来创建视觉内容,从而无需在提示词中明确详细说明这些要素。
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
Gemini的新功能即将集成到Google TV中
周三,谷歌公布了一系列即将登陆谷歌电视(Google TV)的新人工智能驱动功能,其中包括一个专门展示短视频的专区,该专区将把 YouTube Shorts 直接置于主屏幕上。这些更新的核心是围绕Gemini构建的增强功能。在Gemini标签页中,一个“创建”按钮可让用户访问名为Nano Banana和Veo的生成式AI工具。这些工具最初将在美国支持Gemini功能的TCL电视上推出,未来计划支持
相关专题推荐
评论 (1)
0/500
关于 LLM 推理效率的新见解
微软的最新研究表明,大型语言模型中的高级推理技术并不能在不同的人工智能系统中产生统一的改进。他们的突破性研究分析了九个领先的基础模型在推理过程中对各种扩展方法的反应。
评估推理时间扩展方法
研究团队对三种不同的缩放技术实施了严格的测试方法:
- 传统的思维链提示
- 并行答案生成与汇总
- 通过反馈环路进行顺序改进

八项综合基准提供了跨学科的挑战性测试场景,包括数学、科学推理、复杂问题解决和空间分析。有几项评估采用了难度分级的方法,以考察成绩如何随问题复杂程度的变化而变化。
关于推理能力的重要发现
综合评估为人工智能从业人员提供了一些重要启示:
- 模型架构和任务领域不同,扩展技术带来的性能提升也大相径庭
- 更长的响应时间并不总是与更好的解决方案相关联
- 即使是相同的查询,计算成本也会出现不可预测的波动
- 通过广泛的扩展,传统模型有时可以与专门的推理模型相匹配
- 验证机制有望提高效率

对人工智能发展的实际影响
这些发现对企业实施人工智能具有重要意义:
成本可预测性是一大挑战,即使是正确答案,令牌的使用也会出现很大差异。"微软研究员贝斯米拉-努希(Besmira Nushi)指出:"开发人员需要具有一致计算模式的模型。
研究还发现,响应长度也是衡量模型可信度的一个潜在指标,过长的响应往往意味着超过某些阈值后的解决方案是不正确的。

高效推理系统的未来
该研究强调了未来发展的多个前景广阔的方向:
"Nushi 解释说:"验证机制可以改变我们处理推理问题的方式。这种整合将允许自然语言界面利用专门的验证逻辑。
这项研究强调,随着人工智能系统承担越来越复杂的现实世界任务,人们越来越需要能在推理准确性与可预测计算成本之间取得平衡的解决方案。
Gemini 为美国用户提供免费的个性化 AI 图片生成服务
周一,谷歌宣布,Gemini应用将把由Nano Banana驱动的个性化图像生成功能扩展至更广泛的用户群体。从今天起,美国所有符合条件的用户均可免费使用该功能,此前仅限Plus、Pro和Ultra订阅用户使用的限制已被取消。Gemini的“个人智能”功能于4月首次推出,可帮助用户生成符合其特定兴趣的图片。该功能使AI能够根据对用户偏好的理解来创建视觉内容,从而无需在提示词中明确详细说明这些要素。
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性
Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
Gemini的新功能即将集成到Google TV中
周三,谷歌公布了一系列即将登陆谷歌电视(Google TV)的新人工智能驱动功能,其中包括一个专门展示短视频的专区,该专区将把 YouTube Shorts 直接置于主屏幕上。这些更新的核心是围绕Gemini构建的增强功能。在Gemini标签页中,一个“创建”按钮可让用户访问名为Nano Banana和Veo的生成式AI工具。这些工具最初将在美国支持Gemini功能的TCL电视上推出,未来计划支持





首页






