OpenClaw 的 AReaL v1.0 框架可實現人工智慧代理的並行訓練
3月4日,螞蟻集團與清華大學合作,發布了開源強化的學習訓練框架 AReaL v1.0 的穩定版。此次發布的核心目標是實現「代理的一鍵式強化學習訓練接入」。該框架無需修改代碼,相容於多種代理框架,並能讓智能代理立即開始強化學習訓練。
自2026年初以來,智能代理(Agents)持續保持強勁的成長動能。LangChain、Claude Code 和 OpenClaw 等框架雖發展迅速,卻凸顯出兩大關鍵瓶頸。首先,訓練門檻過高:現有智能代理框架採用各異的介面,整合時往往需要大量適配程式碼。 其次,智能代理缺乏持續演進能力:多數依賴初始訓練階段產生的固定模型權重。一旦部署,便無法針對特定情境進一步優化,其能力在發布時即已達到上限。
AReaL 是首個完全異步、訓練與推論解耦的大型強化的學習系統。它使代理能透過與真實世界任務的互動,接收反饋並持續精進決策。v1.0 版本讓任何代理都能無需修改即可連接強化的學習訓練。透過在代理與訓練系統之間插入代理工作層,開發人員只需將單一請求地址重新導向,即可啟用訓練。

(圖:無縫整合至代理程式中的 AReaL 異步訓練架構)
以廣受歡迎的 OpenClaw 框架為例。開發者只需將 OpenClaw 配置中的 `base_url` 和 `api_key` 指向 AReaL 閘道,其 OpenClaw 代理便會連接到強化的學習訓練。代理會繼續正常執行任務,同時使用者會定期對其表現進行評分。AReaL 會自動收集這些訓練資料並在後台更新模型,使代理能夠透過持續使用自主進化。
AReaL v1.0 版本同時推出了原生訓練引擎 Archon。該引擎基於 PyTorch 的原生功能,實現了完整的 5D 並行處理——涵蓋資料、管線、張量、上下文及專家並行處理——從而降低了安裝與除錯的門檻。此外,它還提供多種訓練與推論的後端選項,便於在不同環境中靈活部署。 值得注意的是,這個複雜的分散式系統僅耗費一個人月便從零開始開發並完成驗證。在 32 天內,近百萬行程式碼經過修改,完整實現了 Archon 引擎,使其能夠訓練擁有十億參數的專家混合模型(Mixture-of-Experts, MoE)。
這項效率突破的關鍵在於 AReaL 整合的 AI 輔助開發系統,該系統能自動化處理高度複雜的工程任務。

AReaL v1.0 具備 AI 輔助開發工作流程,提供從規劃、編碼到驗證及 PR 建立的端到端支援。在處理 MoE 並行化、記憶體優化及演算法實作等核心模組時,專用的 AI 程式設計助理將扮演資深專家角色。它在程式碼變更過程中提供及時且精準的指導,確保每項修改的正確性。 AReaL 的 AI 輔助程式設計不僅僅是生產力工具;它能夠在複雜的基礎設施專案中承擔「可交付成果」的研發工作,開創了 AI 基礎設施工程的下一代範式。
AReaL 團隊表示,將持續針對訓練引擎、易用性及多模態代理訓練進行迭代。AReaL v1.0 的程式碼與文件現已於 inclusionAI 社群中開源。
· GitHub 儲存庫:https://github.com/inclusionAI/AReaL
· 相關論文:https://arxiv.org/abs/2505.24298
相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代
Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
評論 (1)
0/500
3月4日,螞蟻集團與清華大學合作,發布了開源強化的學習訓練框架 AReaL v1.0 的穩定版。此次發布的核心目標是實現「代理的一鍵式強化學習訓練接入」。該框架無需修改代碼,相容於多種代理框架,並能讓智能代理立即開始強化學習訓練。
自2026年初以來,智能代理(Agents)持續保持強勁的成長動能。LangChain、Claude Code 和 OpenClaw 等框架雖發展迅速,卻凸顯出兩大關鍵瓶頸。首先,訓練門檻過高:現有智能代理框架採用各異的介面,整合時往往需要大量適配程式碼。 其次,智能代理缺乏持續演進能力:多數依賴初始訓練階段產生的固定模型權重。一旦部署,便無法針對特定情境進一步優化,其能力在發布時即已達到上限。
AReaL 是首個完全異步、訓練與推論解耦的大型強化的學習系統。它使代理能透過與真實世界任務的互動,接收反饋並持續精進決策。v1.0 版本讓任何代理都能無需修改即可連接強化的學習訓練。透過在代理與訓練系統之間插入代理工作層,開發人員只需將單一請求地址重新導向,即可啟用訓練。

(圖:無縫整合至代理程式中的 AReaL 異步訓練架構)
以廣受歡迎的 OpenClaw 框架為例。開發者只需將 OpenClaw 配置中的 `base_url` 和 `api_key` 指向 AReaL 閘道,其 OpenClaw 代理便會連接到強化的學習訓練。代理會繼續正常執行任務,同時使用者會定期對其表現進行評分。AReaL 會自動收集這些訓練資料並在後台更新模型,使代理能夠透過持續使用自主進化。
AReaL v1.0 版本同時推出了原生訓練引擎 Archon。該引擎基於 PyTorch 的原生功能,實現了完整的 5D 並行處理——涵蓋資料、管線、張量、上下文及專家並行處理——從而降低了安裝與除錯的門檻。此外,它還提供多種訓練與推論的後端選項,便於在不同環境中靈活部署。 值得注意的是,這個複雜的分散式系統僅耗費一個人月便從零開始開發並完成驗證。在 32 天內,近百萬行程式碼經過修改,完整實現了 Archon 引擎,使其能夠訓練擁有十億參數的專家混合模型(Mixture-of-Experts, MoE)。
這項效率突破的關鍵在於 AReaL 整合的 AI 輔助開發系統,該系統能自動化處理高度複雜的工程任務。

AReaL v1.0 具備 AI 輔助開發工作流程,提供從規劃、編碼到驗證及 PR 建立的端到端支援。在處理 MoE 並行化、記憶體優化及演算法實作等核心模組時,專用的 AI 程式設計助理將扮演資深專家角色。它在程式碼變更過程中提供及時且精準的指導,確保每項修改的正確性。 AReaL 的 AI 輔助程式設計不僅僅是生產力工具;它能夠在複雜的基礎設施專案中承擔「可交付成果」的研發工作,開創了 AI 基礎設施工程的下一代範式。
AReaL 團隊表示,將持續針對訓練引擎、易用性及多模態代理訓練進行迭代。AReaL v1.0 的程式碼與文件現已於 inclusionAI 社群中開源。
· GitHub 儲存庫:https://github.com/inclusionAI/AReaL
· 相關論文:https://arxiv.org/abs/2505.24298
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。
Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額
儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了





首頁






