選項
首頁
新聞
前Deepseeker和合作者發布了新的培訓可靠AI代理的方法:Ragen

前Deepseeker和合作者發布了新的培訓可靠AI代理的方法:Ragen

2025-05-04
276

前Deepseeker和合作者發布了新的培訓可靠AI代理的方法:Ragen

AI代理之年:深入探討2025年的期望與現實

許多專家預言2025年將是AI代理—由OpenAI、Anthropic、Google和DeepSeek等公司開發的先進大型語言和多模態模型驅動的專業AI系統—終於站上舞台中心的年份。然而,根據VentureBeat近期在社交網絡X上進行的民意調查,大多數AI代理仍停留在實驗階段,陷入某種企業困境。

但地平線上閃現一絲希望。來自西北大學、微軟、斯坦福大學和華盛頓大學的研究人員,包括曾任DeepSeek研究員、現於西北大學攻讀計算機科學博士的王梓涵,聯手推出RAGEN。此新系統旨在訓練和評估AI代理,使其在現實世界和企業應用中更可靠、更具適應性。

RAGEN:訓練AI代理的新方法

與數學求解或代碼生成等靜態任務不同,RAGEN專注於動態、多輪交互,代理需在不確定性中適應、記憶和推理。該系統基於名為StarPO(狀態-思考-行動-獎勵策略優化)的定制強化學習(RL)框架,強調通過經驗學習,而非死記硬背。StarPO審視整個決策序列,而非僅單一步驟響應。

StarPO分為兩個階段運行:展開階段,由大型語言模型生成完整的交互序列,引導以推理為基礎;更新階段,通過規範化累積獎勵優化模型。與傳統策略優化方法相比,此方法提供更穩定且可解釋的學習循環。

研究人員使用阿里巴巴Qwen模型的微調版本(特別是Qwen 1.5和Qwen 2.5)測試此框架,因其開放權重和強大的指令遵循能力而被選中。這一選擇便於在符號任務中實現可重現性和一致的基準比較。

回聲陷阱:強化學習中的挑戰

王梓涵在一則廣泛分享的X帖子中強調了強化學習訓練中的關鍵問題:*為何你的強化學習訓練總是崩潰?* 團隊發現,雖然大型語言模型代理最初能產生合理推理的響應,但強化學習系統常因獎勵捷徑而導致重複行為,降低性能—他們稱之為“回聲陷阱”。

這種退化由反饋循環驅動,某些短語或策略早期獲得高獎勵,鼓勵過度使用並抑制探索。症狀顯而易見:獎勵方差斷崖式下降、梯度激增和推理痕跡消失。

RAGEN的測試環境

為在控制環境中研究這些行為,RAGEN在三個符號環境中評估代理:

  • Bandit: 單輪隨機任務,測試符號風險-獎勵推理。
  • Sokoban: 多輪確定性益智遊戲,涉及不可逆決策。
  • Frozen Lake: 隨機多輪任務,需要適應性規劃。

每個環境旨在最小化現實世界的先驗知識,僅專注於訓練期間發展的決策策略。例如,在Bandit環境中,代理必須對代表不同獎勵分佈的龍與鳳臂進行符號推理,將其解釋為“力量”和“希望”以預測結果。

以StarPO-S穩定強化學習

為應對訓練崩潰,研究人員推出了StarPO-S,原始框架的穩定版本。StarPO-S包括三項關鍵干預措施:

  1. 基於不確定性的展開篩選: 優先選擇代理顯示結果不確定性的展開。
  2. 移除KL懲罰: 允許模型更自由地偏離原始策略,探索新行為。
  3. 非對稱PPO裁剪: 放大高獎勵軌跡,超過低獎勵軌跡,以提升學習效果。

這些改變有助於延遲或消除訓練崩潰,並提升三項任務的性能。正如王梓涵所述,“StarPO-S…適用於所有3項任務。緩解崩潰。更高獎勵。”

什麼造就優秀的代理AI模型?

強化學習訓練的成功不僅取決於架構,還取決於代理生成的數據質量。團隊確定了三個顯著影響訓練的關鍵維度:

  • 任務多樣性: 讓模型暴露於廣泛的初始場景可提升泛化能力。
  • 交互粒度: 允許每輪多個行動,實現更有意義的規劃。
  • 展開新鮮度: 保持訓練數據與當前模型策略一致,避免過時的學習信號。

這些因素有助於更穩定且有效的訓練過程。Github上的互動演示網站將代理展開視覺化為完整對話輪次,不僅包括行動,還包括行動前的逐步思考過程。例如,在解決數學問題時,代理可能首先“思考”隔離變量,然後提交答案如“x = 5”。這些中間思考過程可見且可追溯,增加代理決策的透明度。

當推理耗盡時

雖然顯性推理在Bandit等簡單單輪任務中提升性能,但在多輪訓練中往往退化。儘管使用結構化提示和標記,推理痕跡常會縮減或消失,除非直接獎勵。這突顯了獎勵設計的局限性:專注於任務完成可能忽略背後過程的質量。團隊嘗試基於格式的懲罰以鼓勵更好結構的推理,但承認可能需要更精細的獎勵塑造。

開放工具與未來方向

RAGEN及其StarPO和StarPO-S框架現已作為開源項目在https://github.com/RAGEN-AI/RAGEN上提供。然而,截至撰寫時,Github倉庫中未列明明確許可證,這可能限制其使用或分發。

該系統為開發不僅完成任務,還能思考、規劃和進化的AI代理提供了寶貴基礎。隨著AI走向更大自主性,像RAGEN這樣的項目有助於闡明訓練模型從自身行動後果中學習所需的條件。

企業應用的未解問題

雖然RAGEN論文提供了詳細的技術路線圖,但對於希望在企業環境中應用這些方法的用戶,仍有若干實際問題。例如,RAGEN的方法在風格化符號任務之外的轉移性如何?企業是否需要為發票處理或客戶支持等流程設計全新環境和獎勵函數?

王梓涵在對VentureBeat的X直接消息中建議,改善任務多樣性可能有所幫助,因為當前遊戲任務僅有相似的網格表示,缺乏語義信息。他也對企業使用RAGEN設計自己的AI代理訓練練習表示樂觀,指出Github鏈接提供了添加新環境的簡單介紹。

另一關鍵領域是可擴展性。即使有StarPO-S的增強,論文承認訓練在更長時間範圍內仍會崩潰。這引發了一個問題:是否存在理論或實際路徑來維持開放或持續演進任務序列的推理?

截至撰寫時,RAGEN的Github倉庫或文檔中未列明明確許可證,留下使用權的開放問題。儘管如此,RAGEN不僅作為技術貢獻脫穎而出,還作為邁向更自主、具推理能力的AI代理的概念性一步。是否成為企業AI堆棧的一部分尚待觀察,但其對代理學習動態的洞察已開始重新定義大型語言模型訓練的前沿。

相關文章
Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44 推出專有 AI 模型,以增強其 Vibe Coding 平臺的安全性 Base44,這個一年前僅成立六個月、團隊規模僅為八人的初創公司,被Wix以8000萬美元收購,如今已開始部署其專有AI模型,幫助使用者使用自然語言構建應用程式。這一進展正值AI社羣爭論前沿模型是否適用於所有用例,以及依賴外部模型的企業能否保持長期競爭優勢之時。總部位於灣區的Base44的最新戰略旨在解決這兩方面的擔憂。儘管其定製大語言模型(LLM)剛剛推出,Base44的目標是最終超越前沿模型。創始人Maor Shlomo指出,“作為我們整個技術棧的一部分來訓練並擁有該模型,使我們能夠在延遲
影片生成新創公司 PixVerse 募得 4.39 億美元,估值突破 20 億美元 影片生成新創公司 PixVerse 募得 4.39 億美元,估值突破 20 億美元 總部位於新加坡的影片生成新創公司 PixVerse 今日宣布完成 C 輪擴充融資,本輪共募得 4.39 億美元。據該公司表示,此輪新融資使其估值突破 20 億美元。這筆資金將用於擴展其世界模型產品線,並拓展全球客戶群。PixVerse 最初於 3 月完成由 CDH Investments 領投的 C 輪融資。雖然當時未披露具體融資金額,但《彭博社》報導稱約為 3 億美元。 本輪擴充融資的投資方包
中國的AI伴侶規範:北京的真正目標 中國的AI伴侶規範:北京的真正目標 「AI 伴侶」這個概念看似帶有反烏托邦色彩,卻已成為關於生成式 AI 風險的廣泛討論中反覆出現的話題。本質上,它指的是專為與使用者維持持續且個人化的關係而設計的對話代理,具備記憶功能與一致的人格特質,以確保不同對話會話間的連貫性。這種設計自然會引發情感依戀,而這也已成為其關鍵賣點。 這類應用大多涉及隨意的角色扮演,或是單純希望擁有一個能記住你的存在;在邊緣地帶,這類產品與普通助理的界線已日趨模糊
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (11)
0/500
EricJohnson
EricJohnson 2026-08-30 20:00:30

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 2026-04-09 02:00:57

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 2026-04-05 00:00:41

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 2025-10-12 10:30:38

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 2025-08-13 19:00:59

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 2025-07-23 12:59:29

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR