选项
首页
快讯
内容
ChristopherAllen
ChristopherAllen
2026-05-28

NVIDIA开源了Polar,这是一个强化学习训练框架,它能够将Codex、Claude Code和Qwen Code等现有的代码代理集成到GRPO训练中,而无需修改原始代码。该框架将模型API的边界视为训练入口点,从而实现了黑盒拦截和轨迹重建功能。在SWE-Bench测试中,Codex的pass@1指标从3.8%提升到了26.4%;使用GPU进行训练时,整体训练时间缩短了5.39倍,同时GPU的使用效率也从20.4%提高到了87.7%。

NVIDIA开源了Polar,这是一个强化学习训练框架,它能够将Codex、Claude Code和Qwen Code等现有的代码代理集成到GRPO训练中,而无需修改原始代码。该框架将模型API的边界视为训练入口点,从而实现了黑盒拦截和轨迹重建功能。在SWE-Bench测试中,Codex的pass@1指标从3.8%提升到了26.4%;使用GPU进行训练时,整体训练时间缩短了5.39倍,同时GPU的使用效率也从20.4%提高到了87.7%。 NVIDIA开源了Polar,这是一个强化学习训练框架,它能够将Codex、Claude Code和Qwen Code等现有的代码代理集成到GRPO训练中,而无需修改原始代码。该框架将模型API的边界视为训练入口点,从而实现了黑盒拦截和轨迹重建功能。在SWE-Bench测试中,Codex的pass@1指标从3.8%提升到了26.4%;使用GPU进行训练时,整体训练时间缩短了5.39倍,同时GPU的使用效率也从20.4%提高到了87.7%。
评论 (0)
0/300
OR