選項
首頁
快訊
內容
ChristopherAllen
ChristopherAllen
2026-05-28

NVIDIA開源了Polar,這是一個強化學習訓練框架,它能夠將Codex、Claude Code和Qwen Code等現有的程式碼代理整合到GRPO訓練中,而無需修改原始程式碼。該框架將模型API的邊界視為訓練入口點,從而實現了黑盒攔截和軌跡重建功能。在SWE-Bench測試中,Codex的pass@1指標從3.8%提升到了26.4%;使用GPU進行訓練時,整體訓練時間縮短了5.39倍,同時GPU的使用效率也從20.4%提高到了87.7%。

NVIDIA開源了Polar,這是一個強化學習訓練框架,它能夠將Codex、Claude Code和Qwen Code等現有的程式碼代理整合到GRPO訓練中,而無需修改原始程式碼。該框架將模型API的邊界視為訓練入口點,從而實現了黑盒攔截和軌跡重建功能。在SWE-Bench測試中,Codex的pass@1指標從3.8%提升到了26.4%;使用GPU進行訓練時,整體訓練時間縮短了5.39倍,同時GPU的使用效率也從20.4%提高到了87.7%。 NVIDIA開源了Polar,這是一個強化學習訓練框架,它能夠將Codex、Claude Code和Qwen Code等現有的程式碼代理整合到GRPO訓練中,而無需修改原始程式碼。該框架將模型API的邊界視為訓練入口點,從而實現了黑盒攔截和軌跡重建功能。在SWE-Bench測試中,Codex的pass@1指標從3.8%提升到了26.4%;使用GPU進行訓練時,整體訓練時間縮短了5.39倍,同時GPU的使用效率也從20.4%提高到了87.7%。
評論 (0)
0/300
OR