選項
首頁
新聞
NVIDIA 將 Polar 框架開源,透過強化學習實現零門檻的 AI 編碼代理演化

NVIDIA 將 Polar 框架開源,透過強化學習實現零門檻的 AI 編碼代理演化

2026-05-31
158

5月28日,NVIDIA 研究團隊將強化學習訓練框架「Polar」開源。其核心創新之處在於,能將現有的主流程式碼代理(例如 Codex、Claude Code 和 Qwen Code)無縫整合至 GRPO(通用相對策略優化)強化學習訓練中,且無需對原始程式碼進行任何修改。

image.png

I. 產業痛點:代理強化學習的障礙

隨著程式碼代理從簡單的單步驟任務,演進至複雜且長期運行的流程——例如倉庫級別的程式碼修改或作業系統互動——開發人員越來越依賴成熟的執行框架(Harness)。然而,將這些複雜的框架整合到傳統的強化學習基礎架構中,卻面臨著巨大的挑戰:

高整合成本:傳統方法需要將程式邏輯重寫為標準環境介面(如 env.init() 和 env.step()),此過程極為繁瑣。

資訊流失:在重構過程中,關鍵細節(例如工具呼叫、多回合對話語境或子代理協作邏輯)往往會遺失,導致模型無法接收高品質的訓練訊號。

image.png

II. 核心解決方案:以「邊界」作為訓練入口點

Polar 無需重寫執行框架,而是將模型 API 邊界視為訓練入口點

黑盒處理:Polar 在程式碼執行框架與模型推論伺服器之間設置了一個透明的代理(Gateway)。無論代理使用的是 Anthropic、OpenAI 還是 Google 的 API,Polar 都能無縫攔截並轉發請求。

追蹤重建:在轉發過程中,Polar 會記錄關鍵的即時資料——例如提示、採樣標記及對數機率——並將其重建為強化學習訓練器所需的「追蹤」資料。

高效異步架構:系統採用 Rollout Server 負責調度與資料持久化,同時由 Gateway Nodes 管理生命週期與資源回收。透過預熱緩衝區(READY buffer)與並行任務處理,有效消除可能阻塞 GPU 訓練的長尾任務。

III. 性能飛躍:轉化程式碼代理

實驗數據顯示,Polar 結合 GRPO 訓練可帶來顯著的性能提升:

經 SWE-Bench 驗證的基準測試:使用相同的 Qwen3.5-4B 基礎模型,不同程式碼框架的表現存在差異:

Codex 框架:pass@1 分數從 3.8% 躍升至 26.4%——暴增594.74%。

Claude Code Framework:從 29.8% 提升至 34.6%。

Pi Framework:從 34.2% 提升至 40.4%。

極致效率:導入 prefix_merging 策略後,相較於傳統的逐次請求模式,訓練總耗時縮短約5.39 倍,且 GPU 利用率從 20.4% 提升至87.7%。

產業評論

NVIDIA 的 Polar 開源計畫,實質上為 AI 代理進入強化的學習訓練領域鋪設了一條「高速公路」。它不僅讓研究人員能利用龐大的開源程式碼框架進行高效訓練,更透過系統層級的優化降低了 GPU 運算門檻。

隨著 Polar 的日益普及,開發者無需再擔心「如何將模型適應於訓練框架」。未來,AI 編碼代理的演進將變得更加標準化與高效。這標誌著 AI 代理訓練正從手動實驗室調校,轉向大規模、系統化的工程化生產。

論文網址:https://arxiv.org/pdf/2605.24220

相關文章
前OpenAI首席科學家Ilya的SSI首次釋出模型 前OpenAI首席科學家Ilya的SSI首次釋出模型 AI 取得了另一項重大里程碑。在從 OpenAI 離職後,前首席科學家伊利亞·蘇茨克弗(Ilya Sutskever)創立了 Safe Superintelligence Inc.(SSI),該公司最近公佈了其首個模型的詳細資訊。海外社交媒體上的報道指出,該團隊正在利用 TTT(測試時訓練)開發一個緊湊的推理引擎,這是他們在追求安全超級智慧過程中的關鍵進展。這種新穎的架構專注於使模型能夠“學習如何學習”。與在推理過程中保持引數靜態的傳統大型語言模型不同,該引擎在處理現實世界任務時會動態更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field 2026年5月14日,AI應用開發平臺Lovable宣佈參與丹麥硬體初創公司Atech的80萬美元種子輪融資。該輪由Lovable領投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在內的頂級風險投資機構。此次投資標誌著Lovable將“Vibe Coding”概念從純軟體開發戰略擴充套件至硬體工程領域。Atech旨在透過AI驅動的互動式平臺簡化複雜的硬體原型製作。使用者購買基礎硬體套件,並透過AI聊天機器人以自然語言描述其設計概念;系統
Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長 Anthropic 將 Claude AI 編碼工具擴充套件至日本,以推動海外增長 Anthropic,一家美國知名的人工智慧公司,正加強其全球推廣力度。週三,該公司在東京舉辦了一場大型開發者活動“Code with Claude”,吸引了近500名軟體工程師參加。該舉措旨在積極將Claude AI工具及相關產品引入日本市場,強調其自主編碼能力在提升企業生產力方面的核心優勢。強調自動化程式碼生成在活動中,Anthropic展示了其先進的自主編碼系統,該系統能夠獨立處理複雜的程式設計任務並最佳化現有程式碼結構。隨著全球對高效開發工具的需求不斷增長,Anthropic希望透過此類活動加強
相關專題推薦
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
設計與藝術 最佳AI創意構思工具,助力藝術家突破視覺瓶頸
最佳AI創意構思工具,助力藝術家突破視覺瓶頸

2026 年最新最佳頂級評分 AI 創意構思工具由 XIX.AI 精心策劃,旨在幫助創作者突破視覺瓶頸並即時提升創造力。這些強大的變革性工具提供真實世界測試、詳細的免費與付費對比以及每週更新的排名。發現您的完美工具,加速內容創作,並立即釋放您的 AI 優勢。立即探索!

14 個工具
xix.ai
評論 (1)
0/500
AlbertWalker
AlbertWalker 2026-06-30 06:00:18

So NVIDIA just dropped Polar as open source? That's huge for AI coding agents - integrating Codex and Claude with reinforcement learning sounds like a game changer. But I wonder how much compute you'd need to actually train it effectively... 🤔

OR