选项
首页
新闻
前Deepseeker和合作者发布了新的培训可靠AI代理的方法:Ragen

前Deepseeker和合作者发布了新的培训可靠AI代理的方法:Ragen

2025-05-04
276

前Deepseeker和合作者发布了新的培训可靠AI代理的方法:Ragen

人工智能代理之年:深入剖析2025年的期望与现实

许多专家预言2025年将是人工智能代理——由OpenAI、Anthropic、Google和DeepSeek等公司开发的高级大型语言和多模态模型驱动的专用AI系统——最终占据核心舞台的一年。然而,根据VentureBeat在社交网络X上进行的最新民意调查,大多数人工智能代理仍处于实验阶段,陷入一种企业困境。

但地平线上仍有一线希望。来自西北大学、微软、斯坦福大学和华盛顿大学的研究人员,包括曾在DeepSeek工作的研究员、现于西北大学攻读计算机科学博士的王子涵,合作推出了一种名为RAGEN的新系统。该系统旨在训练和评估人工智能代理,使其在现实世界和企业应用中更加可靠和适应性强。

RAGEN:训练人工智能代理的新方法

与数学求解或代码生成等静态任务不同,RAGEN专注于动态、多轮交互,代理需要在不确定性中适应、记忆和推理。该系统基于一种名为StarPO(状态-思考-行动-奖励策略优化)的定制强化学习(RL)框架,强调通过经验学习而非死记硬背。StarPO关注整个决策序列,而不仅仅是单步响应。

StarPO分为两个阶段:生成阶段,由大型语言模型在推理指导下生成完整的交互序列;更新阶段,使用归一化的累积奖励优化模型。这种方法相比传统的策略优化方法提供了更稳定和可解释的学习循环。

研究人员使用阿里巴巴的Qwen模型(具体为Qwen 1.5和Qwen 2.5)的微调版本测试了这一框架,这些模型因其开放权重和强大的指令遵循能力而被选中。这一选择便于在符号任务中进行可重复性和一致的基线比较。

回声陷阱:强化学习中的挑战

王子涵在一篇广为流传的X帖子中强调了强化学习训练中的一个关键问题:*为什么你的强化学习训练总是崩溃?* 团队发现,虽然大型语言模型代理最初能生成合理的响应,但强化学习系统往往奖励捷径,导致重复行为并降低性能——他们将这种现象称为“回声陷阱”。

这种退化由反馈循环驱动,某些短语或策略在早期获得高奖励,鼓励过度使用并抑制探索。其症状显而易见:奖励方差骤降、梯度激增和推理痕迹消失。

RAGEN的测试环境

为了在可控环境中研究这些行为,RAGEN在三种符号环境中评估代理:

  • Bandit: 单轮、随机任务,测试符号化的风险-回报推理。
  • Sokoban: 多轮、确定性谜题,涉及不可逆决策。
  • Frozen Lake: 随机、多轮任务,需要适应性规划。

每个环境都旨在最小化现实世界的先验知识,仅关注训练期间发展的决策策略。例如,在Bandit环境中,代理必须通过符号化推理龙和凤凰臂代表不同的奖励分布,将其解读为“力量”和“希望”来预测结果。

使用StarPO-S稳定强化学习

为应对训练崩溃,研究人员推出了StarPO的稳定版本StarPO-S。StarPO-S包括三项关键干预措施:

  1. 基于不确定性的生成筛选: 优先选择代理显示结果不确定性的生成序列。
  2. 移除KL惩罚: 允许模型更自由地偏离其原始策略,探索新行为。
  3. 非对称PPO裁剪: 放大高奖励轨迹的权重,超过低奖励轨迹,以提升学习效果。

这些变化有助于延迟或消除训练崩溃,并提升所有三项任务的性能。正如王子涵所说:“StarPO-S……在所有三个任务中都有效。缓解崩溃。更高奖励。”

什么是优秀的代理型AI模型?

强化学习训练的成功不仅取决于架构,还取决于代理生成的数据质量。团队确定了三个显著影响训练的关键维度:

  • 任务多样性: 让模型接触广泛的初始场景可提高泛化能力。
  • 交互粒度: 每轮允许多个动作可实现更有意义的规划。
  • 生成新鲜度: 保持训练数据与当前模型策略对齐,避免过时的学习信号。

这些因素有助于更稳定和有效的训练过程。Github上的一个交互式演示网站将代理生成序列可视化为完整的对话轮次,不仅包括动作,还包括之前的逐步思考过程。例如,在解决数学问题时,代理可能首先“思考”隔离变量,然后提交答案如“x = 5”。这些中间思考过程可见且可追溯,增加了代理决策的透明度。

当推理耗尽时

虽然显式推理在Bandit等简单单轮任务中能提升性能,但在多轮训练中往往会衰退。尽管使用了结构化提示和标记,推理痕迹通常会缩小或消失,除非直接给予奖励。这凸显了奖励设计的一个局限性:专注于任务完成可能忽视背后过程的质量。团队尝试了基于格式的惩罚以鼓励更好的结构化推理,但承认可能需要更精细的奖励塑造。

开放工具与未来方向

RAGEN及其StarPO和StarPO-S框架现已作为开源项目在https://github.com/RAGEN-AI/RAGEN上提供。然而,在撰写本文时,GitHub仓库中未列明明确的许可证,这可能限制其使用或分发。

该系统为那些希望开发不仅能完成任务,还能思考、规划和进化的AI代理提供了宝贵的基础。随着AI向更高自主性发展,像RAGEN这样的项目有助于阐明如何训练能够从自身行动后果中学习的模型。

企业现实应用的未解问题

尽管RAGEN论文提供了详细的技术路线图,但对于希望在企业环境中应用这些方法的实践者来说,仍有几个实际问题。例如,RAGEN的方法在风格化、符号化任务之外的 transferable 程度如何?企业是否需要为发票处理或客户支持等流程设计全新的环境和奖励函数以使用该系统?

王子涵在X上对VentureBeat的直接消息中表示,增加任务多样性可能有所帮助,因为当前的游戏任务只有相似的网格表示,缺乏语义信息。他还对企业使用RAGEN设计自己的AI代理训练练习表示乐观,指出GitHub链接提供了添加新环境的简单介绍。

另一个关键领域是可扩展性。即使有了StarPO-S的增强,论文承认在更长的时间范围内训练仍会崩溃。这提出了一个问题:是否存在理论或实际路径来维持开放式或持续演变任务序列的推理?

在撰写本文时,RAGEN的GitHub仓库或文档中未列明明确的许可证,留下了使用权方面的未解问题。尽管如此,RAGEN不仅作为技术贡献脱颖而出,还作为迈向更自主、具备推理能力的AI代理的概念性一步。能否成为企业AI堆栈的一部分仍有待观察,但其对代理学习动态的洞察已在重新定义大型语言模型训练的前沿。

相关文章
Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性 Base44 推出专有 AI 模型,以增强其 Vibe Coding 平台的安全性 Base44,这个一年前仅成立六个月、团队规模仅为八人的初创公司,被Wix以8000万美元收购,如今已开始部署其专有AI模型,帮助用户使用自然语言构建应用程序。这一进展正值AI社区争论前沿模型是否适用于所有用例,以及依赖外部模型的企业能否保持长期竞争优势之时。总部位于湾区的Base44的最新战略旨在解决这两方面的担忧。尽管其定制大语言模型(LLM)刚刚推出,Base44的目标是最终超越前沿模型。创始人Maor Shlomo指出,“作为我们整个技术栈的一部分来训练并拥有该模型,使我们能够在延迟
视频生成初创公司PixVerse完成4.39亿美元融资,估值突破20亿美元 视频生成初创公司PixVerse完成4.39亿美元融资,估值突破20亿美元 总部位于新加坡的视频生成初创公司PixVerse今日宣布完成C轮扩充融资,本轮共筹集资金4.39亿美元。据该公司称,此轮融资使其估值超过20亿美元。所筹资金将用于扩展其世界模型产品线,并触达全球客户。PixVerse最初于3月完成了由CDH Investments领投的C轮融资。尽管具体融资金额未予披露,但彭博社报道称其约为3亿美元。 本轮增资的投资者包括阿里巴巴、Lollapalooza Ca
中国的人工智能伴侣管理规定:北京的真正目标 中国的人工智能伴侣管理规定:北京的真正目标 人工智能伴侣这一概念看似带有反乌托邦色彩,却已成为关于生成式人工智能风险的广泛讨论中反复出现的话题。本质上,它指的是旨在与用户保持持续、个性化关系的对话式智能体,该智能体具备记忆功能和一致的人格特征,以确保不同对话会话之间的连贯性。这种设计自然会引发情感依恋,这也已成为其关键卖点。 此类应用大多涉及随意的角色扮演,或是单纯希望拥有一个能记住你的存在;在边缘地带,这一类别与普通助手之间的界限已变得
相关专题推荐
音乐创作 用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具
用于混音制作、采样准备及卡拉OK母带处理的 AI 声部分离工具

2026年最新、最优秀且评分最高的AI音轨分离工具汇总,专为混音制作、采样准备以及卡拉OK音频处理而设计。这些功能强大的创新工具经过实际测试,能够实现精准的音频分离,显著提升工作效率。XIX.AI每周都会更新免费的付费产品对比指南,帮助您找到最适合自身需求的工具。立即探索,发挥您的AI优势。

8 个工具
xix.ai
数据分析 用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手
用于收入看板、转化漏斗分析及产品指标分析的 AI SQL 助手

2026年最新最优秀的AI SQL辅助工具排名揭晓!XIX.AI精心挑选了一系列功能强大的工具,这些工具会定期更新,并通过真实的场景测试来验证其性能。使用这些值得尝试的工具,您可以快速生成精准的收入分析报表、分析销售流程,并追踪产品各项指标,从而大幅提升工作效率。立即探索,找到最适合您的数据驱动决策工具!238个字符

9 个工具
xix.ai
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
评论 (11)
0/500
EricJohnson
EricJohnson 2026-08-30 20:00:30

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 2026-04-09 02:00:57

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 2026-04-05 00:00:41

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 2025-10-12 10:30:38

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 2025-08-13 19:00:59

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 2025-07-23 12:59:29

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR