옵션
집
속보
콘텐츠
ChristopherAllen
ChristopherAllen
2026년 5월 28일

NVIDIA가 오픈소스로 공개한 Polar은 기존의 Codex, Claude Code, Qwen Code와 같은 코드 에이전트들을 원본 코드를 수정하지 않고 GRPO 훈련에 통합할 수 있는 강화 학습 훈련 프레임워크입니다. 이 시스템은 모델 API의 경계를 훈련 시작점으로 삼아, 블랙박스 방식의 간섭 및 추적 재구성을 가능하게 합니다. SWE-Bench 테스트에서 Codex의 성능은 3.8%에서 26.4%로 크게 향상되었으며, GPU 활용률도 20.4%에서 87.7%로 증가함에 따라 훈련에 소요되는 시간도 5.39배나 줄어들었습니다.

NVIDIA가 오픈소스로 공개한 Polar은 기존의 Codex, Claude Code, Qwen Code와 같은 코드 에이전트들을 원본 코드를 수정하지 않고 GRPO 훈련에 통합할 수 있는 강화 학습 훈련 프레임워크입니다. 이 시스템은 모델 API의 경계를 훈련 시작점으로 삼아, 블랙박스 방식의 간섭 및 추적 재구성을 가능하게 합니다. SWE-Bench 테스트에서 Codex의 성능은 3.8%에서 26.4%로 크게 향상되었으며, GPU 활용률도 20.4%에서 87.7%로 증가함에 따라 훈련에 소요되는 시간도 5.39배나 줄어들었습니다. NVIDIA가 오픈소스로 공개한 Polar은 기존의 Codex, Claude Code, Qwen Code와 같은 코드 에이전트들을 원본 코드를 수정하지 않고 GRPO 훈련에 통합할 수 있는 강화 학습 훈련 프레임워크입니다. 이 시스템은 모델 API의 경계를 훈련 시작점으로 삼아, 블랙박스 방식의 간섭 및 추적 재구성을 가능하게 합니다. SWE-Bench 테스트에서 Codex의 성능은 3.8%에서 26.4%로 크게 향상되었으며, GPU 활용률도 20.4%에서 87.7%로 증가함에 따라 훈련에 소요되는 시간도 5.39배나 줄어들었습니다.
의견 (0)
0/300
OR