NVIDIA, 강화 학습을 통한 장벽 없는 AI 코딩 에이전트 진화를 위한 ‘Polar’ 프레임워크를 오픈소스로 공개
5월 28일, NVIDIA 연구팀은 강화 학습 훈련 프레임워크인 ‘Polar’를 오픈소스로 공개했습니다. 이 프레임워크의 핵심 혁신은 Codex, Claude Code, Qwen Code와 같은 기존의 주류 코드 에이전트를 원본 코드를 수정할 필요 없이 GRPO(Generalized Relative Policy Optimization) 강화 학습 훈련에 원활하게 통합한다는 점에 있습니다.

I. 업계의 고충: 에이전트 강화 학습의 장벽
코드 에이전트가 단순한 단일 단계 작업에서 창고 수준의 코드 수정이나 OS 상호작용과 같은 복잡하고 장시간 실행되는 프로세스로 진감함에 따라, 개발자들은 점점 더 성숙한 실행 프레임워크(Harness)에 의존하고 있습니다. 그러나 이러한 복잡한 프레임워크를 기존의 강화 학습 인프라에 통합하는 데는 상당한 어려움이 따릅니다:
높은 통합 비용: 기존 방식은 코드 로직을 env.init() 및 env.step()과 같은 표준 환경 인터페이스로 재작성해야 하는데, 이는 매우 번거로운 과정입니다.
정보 손실: 리팩토링 과정에서 도구 호출, 다중 턴 대화 컨텍스트, 하위 에이전트 협업 로직과 같은 중요한 세부 정보가 종종 손실되어, 모델이 고품질의 훈련 신호를 수신하지 못하게 됩니다.

II. 핵심 솔루션: "경계(Boundary)"를 훈련 진입점으로 활용
Polar는 실행 프레임워크를 재작성할 필요가 없도록 합니다. 대신 모델 API 경계를 훈련 진입점으로 취급합니다.
블랙박스 처리: Polar는 코드 실행 프레임워크와 모델 추론 서버 사이에 투명한 프록시(게이트웨이)를 배치합니다. 에이전트가 Anthropic, OpenAI, Google의 API를 사용하든 상관없이, Polar는 요청을 원활하게 가로채어 전달합니다.
추적 재구성: 전달 과정에서 Polar는 프롬프트, 샘플링된 토큰, 로그 확률과 같은 핵심 데이터를 실시간으로 기록하고, 이를 강화 학습 트레이너에 필요한 "추적(trace)" 데이터로 재구성합니다.
효율적인 비동기 아키텍처: 이 시스템은 스케줄링과 지속성을 위해 롤아웃 서버를 활용하며, 게이트웨이 노드는 라이프사이클과 리소스 재활용을 관리합니다. 예열된 버퍼(READY 버퍼)와 병렬 작업 처리를 활용함으로써, GPU 훈련을 차단할 수 있는 롱테일 작업을 효과적으로 제거합니다.
III. 성능의 도약: 코드 에이전트의 변혁
실험 데이터에 따르면, Polar를 GRPO 훈련과 결합할 경우 상당한 성능 향상을 가져옵니다:
SWE-Bench 검증 벤치마크 테스트: 동일한 Qwen3.5-4B 기반 모델을 사용했을 때, 성능은 코드 프레임워크에 따라 차이가 나타납니다:
Codex 프레임워크: pass@1 점수가 3.8%에서 26.4%로 급증하여 594.74%의 향상률을 기록 했습니다.
Claude 코드 프레임워크: 29.8%에서 34.6%로 상승.
Pi 프레임워크: 34.2%에서 40.4%로 상승.
극한의 효율성: prefix_merging 전략을 도입한 후, 훈련 소요 시간은 기존의 요청별 모드에 비해 약 5.39배 단축되었으며, GPU 활용률은 20.4%에서 87.7%로 상승했습니다 .
업계 평론
NVIDIA의 Polar 오픈소스화는 본질적으로 AI 에이전트가 강화 학습 훈련에 진입할 수 있는 "고속도로"를 구축합니다. 이는 연구자들이 방대한 오픈소스 코드 프레임워크를 활용해 효율적으로 훈련할 수 있게 할 뿐만 아니라, 시스템 수준의 최적화를 통해 GPU 컴퓨팅 진입 장벽을 낮춥니다.
Polar의 인기가 높아짐에 따라 개발자들은 더 이상 "모델을 훈련 프레임워크에 어떻게 적용할지"에 대해 고민할 필요가 없습니다. 앞으로 AI 코딩 에이전트의 진화는 더욱 표준화되고 효율화될 것입니다. 이는 AI 에이전트 훈련이 수동적인 실험실 튜닝에서 대규모의 체계적인 엔지니어링 생산으로 전환되는 것을 의미합니다.
논문 URL: https://arxiv.org/pdf/2605.24220
관련 기사
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이
관련 특별 주제 추천
의견 (1)
0/500
5월 28일, NVIDIA 연구팀은 강화 학습 훈련 프레임워크인 ‘Polar’를 오픈소스로 공개했습니다. 이 프레임워크의 핵심 혁신은 Codex, Claude Code, Qwen Code와 같은 기존의 주류 코드 에이전트를 원본 코드를 수정할 필요 없이 GRPO(Generalized Relative Policy Optimization) 강화 학습 훈련에 원활하게 통합한다는 점에 있습니다.

I. 업계의 고충: 에이전트 강화 학습의 장벽
코드 에이전트가 단순한 단일 단계 작업에서 창고 수준의 코드 수정이나 OS 상호작용과 같은 복잡하고 장시간 실행되는 프로세스로 진감함에 따라, 개발자들은 점점 더 성숙한 실행 프레임워크(Harness)에 의존하고 있습니다. 그러나 이러한 복잡한 프레임워크를 기존의 강화 학습 인프라에 통합하는 데는 상당한 어려움이 따릅니다:
높은 통합 비용: 기존 방식은 코드 로직을 env.init() 및 env.step()과 같은 표준 환경 인터페이스로 재작성해야 하는데, 이는 매우 번거로운 과정입니다.
정보 손실: 리팩토링 과정에서 도구 호출, 다중 턴 대화 컨텍스트, 하위 에이전트 협업 로직과 같은 중요한 세부 정보가 종종 손실되어, 모델이 고품질의 훈련 신호를 수신하지 못하게 됩니다.

II. 핵심 솔루션: "경계(Boundary)"를 훈련 진입점으로 활용
Polar는 실행 프레임워크를 재작성할 필요가 없도록 합니다. 대신 모델 API 경계를 훈련 진입점으로 취급합니다.
블랙박스 처리: Polar는 코드 실행 프레임워크와 모델 추론 서버 사이에 투명한 프록시(게이트웨이)를 배치합니다. 에이전트가 Anthropic, OpenAI, Google의 API를 사용하든 상관없이, Polar는 요청을 원활하게 가로채어 전달합니다.
추적 재구성: 전달 과정에서 Polar는 프롬프트, 샘플링된 토큰, 로그 확률과 같은 핵심 데이터를 실시간으로 기록하고, 이를 강화 학습 트레이너에 필요한 "추적(trace)" 데이터로 재구성합니다.
효율적인 비동기 아키텍처: 이 시스템은 스케줄링과 지속성을 위해 롤아웃 서버를 활용하며, 게이트웨이 노드는 라이프사이클과 리소스 재활용을 관리합니다. 예열된 버퍼(READY 버퍼)와 병렬 작업 처리를 활용함으로써, GPU 훈련을 차단할 수 있는 롱테일 작업을 효과적으로 제거합니다.
III. 성능의 도약: 코드 에이전트의 변혁
실험 데이터에 따르면, Polar를 GRPO 훈련과 결합할 경우 상당한 성능 향상을 가져옵니다:
SWE-Bench 검증 벤치마크 테스트: 동일한 Qwen3.5-4B 기반 모델을 사용했을 때, 성능은 코드 프레임워크에 따라 차이가 나타납니다:
Codex 프레임워크: pass@1 점수가 3.8%에서 26.4%로 급증하여 594.74%의 향상률을 기록 했습니다.
Claude 코드 프레임워크: 29.8%에서 34.6%로 상승.
Pi 프레임워크: 34.2%에서 40.4%로 상승.
극한의 효율성: prefix_merging 전략을 도입한 후, 훈련 소요 시간은 기존의 요청별 모드에 비해 약 5.39배 단축되었으며, GPU 활용률은 20.4%에서 87.7%로 상승했습니다 .
업계 평론
NVIDIA의 Polar 오픈소스화는 본질적으로 AI 에이전트가 강화 학습 훈련에 진입할 수 있는 "고속도로"를 구축합니다. 이는 연구자들이 방대한 오픈소스 코드 프레임워크를 활용해 효율적으로 훈련할 수 있게 할 뿐만 아니라, 시스템 수준의 최적화를 통해 GPU 컴퓨팅 진입 장벽을 낮춥니다.
Polar의 인기가 높아짐에 따라 개발자들은 더 이상 "모델을 훈련 프레임워크에 어떻게 적용할지"에 대해 고민할 필요가 없습니다. 앞으로 AI 코딩 에이전트의 진화는 더욱 표준화되고 효율화될 것입니다. 이는 AI 에이전트 훈련이 수동적인 실험실 튜닝에서 대규모의 체계적인 엔지니어링 생산으로 전환되는 것을 의미합니다.
논문 URL: https://arxiv.org/pdf/2605.24220
내부 세부 사항 공개: 차세대 Gemini에 대한Computing Power의 긴장, 내부 팀들은 개발 우선순위와 자원 배분에 대해 의견이 갈렸다
보고에 따르면 구글의 높은 기대를 모았던次世代 제미니 모델의 출시가 연기되었다. 개발 우선순위와 자원 배분에 대한 내부 의견 불일치, 제한된 컴퓨팅 용량, 복잡한 승인 절차가 결합되어 2개월의 지연이 불가피해졌다. 자체 맞춤형 TPU 칩을 보유하고 있음에도 불구하고, 모델 학습, 구글 클라우드 서비스, 수많은 소비자 및 기업용 AI 애플리케이션 간의 경쟁적 수요로 인해 구글은 컴퓨팅 자원 부족에 직면해 있다. 최고 경영진은 이제 조직 개편을 통
OpenAI, 성장 둔화 우려 불식…여러 사업부門 가속화
외부로부터의 판매 성장 둔화 및 내부 목표 미달성에 대한 scrutiny에 대응하여, AI 선도 기업 오픈AI는 4월 28일 화요일에 자신감 있는 성명을 발표했다. 이 회사는 소비자 제품과 기업 서비스의 빠른 진전을 명확히 하며, 최근 제기된 사업 둔화에 대한 추측을 직접적으로 반박했다.동사가 "여러 내부 목표를 놓쳤다"는 주장에 대해, 오픈AI는 이러한 보도를 "전형적인 클릭베이트"로 일축했다. 이 회사는 AI 통합에 대한 강력한 기업 수요
알리바바 슈퍼컵: Qwen3.8-Max, 강화된 코딩 및 오피스 도구로 데뷔
Alibaba는 2.4조 개의 파라미터를 갖춘 차세대 기반 대형 모델인 Qwen3.8-Max를 공식적으로 공개했습니다. 이 중요한 AI 기술 발전은 코딩 및 전문 사무 작업 등 핵심 영역에서 상당한 성능 향상을 제공하며, 강력한 기술 역량을 보여줍니다.권위 있는 Arena 대형 모델 랭킹에서 Qwen3.8-Max는 Anthropic의 Claude 시리즈에 이어 우수한 성적을 거두며 업계 선두 그룹에 자리했습니다. 이 성과는 국내 대형 모델이





집






