텐센트 후위안(Hunyuan)은 PPO 강화학습에 중요 포인트 크기 이론을 통합하여 처리량을 2.29배 향상시키고 GRPO 학습 시간을 29% 단축했습니다.

대규모 GPU 클러스터로 확장되고 더 밀집된 학습 데이터셋을 활용하는 대규모 모델의 강화학습이 확대됨에 따라, 학습 효율성이 중요한 우선 과제로 부상했습니다. 최근 텐센트 환위안(Tencent Huan Yuan) 팀의 연구는 종종 간과되는 한 가지 과제를 다룹니다: 모델이 자체 학습 데이터를 생성할 때, 롤아웃 생성과 학습의 속도가 서로 다를 경우 배치 크기는 어떻게 재정의되어야 할까요?
임계 배치 크기의 고전적 이론을 바탕으로, 이 연구는 온라인 대규모 언어 모델 강화학습에 대해 이 개념을 다시 유도했습니다. 연구 결과는 실용적인 해결책을 제시합니다: 배치 크기가 증가함에 따라 특정 범위 내에서 학습률을 조정함으로써, GRPO와 PPO 알고리즘 모두 각 응답이 희석되지 않고 효과적으로 학습되도록 보장할 수 있습니다. 이는 배치 크기가 단순히 "클수록 좋은" 것도, 고정된 값도 아님을 의미합니다. 오히려 최대 효율을 위해 미세 조정할 수 있는 최적의 범위가 존재합니다.
실제 하드웨어 비용에 미치는 영향은 큽니다. 고정된 하드웨어 구성에서 배치 크기를 증가시키면 PPO의 생성 처리량을 최대 2.29배까지 높일 수 있습니다. 동시에 최적의 GRPO 구성은 검증 목표에 도달하는 데 29% 더 적은 시간을 소요합니다. GPU 자원에 막대한 투자를 한 팀에게 이는 동일한 클러스터로 작업을 더 빠르게 완료하거나, 동일한 시간 내에 더 많은 데이터를 처리할 수 있음을 의미하며, 강화학습의 가장 비용이 많이 드는 단계에서 비용을 효과적으로 절감합니다.
이 연구는 모델이 학생이자 문제 출제자 역할을 하는 온라인 RL의 확장성을 위한 실용적인 레버리를 제공합니다. 생성과 학습 규모 간의 불일치로 인해 발생하는 효율성 격차는, 이 연구가 임계 배치 크기 이론과 학습률 조정을 결합함으로써 해소됩니다. 업계가 가장 큰 모델을 구축하기 위해 경쟁하는 동안, 텐센트 환위안은 기존 하드웨어를 최적화하여 더 높은 비용 효율성을 달성하는 데 집중하고 있습니다.
관련 기사
AI 스타트업들이 수익성 성장을 가속화하고 있다
확립된 기업들과 신생 벤처들이 인공지능을 활용하기 위해 치열하게 경쟁하는 가운데, 다수의 AI 스타트업들은 매출이 단순히 증가하는 것을 넘어 급격히 가속화되고 있으며, 점점 더 짧은 기간 내에 후속 목표 달성을 이루고 있다고 보고합니다.다음 스타트업들은 이러한 플라이휠 성장의 일관된 패턴을 보여줍니다. 이들 기업이 모두 'ARR'이라는 용어를 사용하더라도 근본적인 지표는 각기 다르다는 점에 유의해야 합니다. 일부 기업은 연간 반복 수익(ARR
Replit의 아마드 마사드는 Cursor 인수, 애플과의 경쟁, 그리고 왜 매각을 선호하지 않는지에 대해
아마드 마사드는 지난 10년 동안 Replit을 구축해 왔지만, 지난 18개월은 변혁의 시기였습니다. 이 AI 코딩 플랫폼은 2024년 연간 매출 280만 달러에서 마사드가 ‘연간 10억 달러 수준의 매출’이라고 묘사하는 궤도로 급성장했습니다.목요일 밤 샌프란시스코에서 열린 TechCrunch의 매진된 StrictlyVC 행사에서 우리는 광범위한 주제를 다뤘습니다. 먼저 업계의 시급한 질문으로 시작했습니다. 경쟁사 Cursor가 SpaceX로
AI 에이전트가 MIIT의 경고와 록칩의 대응 속에서 새우 양식을 강화한다
AI 커뮤니티의 대화는 "대규모 모델 학습"에서 "바다가재 키우기"로 전환되었습니다. 만약 소셜 미디어에서 누군가가 "바다가재"의 데이터를 공급하고 매개변수를 조정하는 방법에 대해 논의하는 것을 보게 된다면, 혼란스러워하지 마십시오. 그들은 수생 생물을 양식하는 것이 아니라 "OpenClaw"이라는 오픈소스 AI 에이전트를 배포하는 것입니다. 공식 아이콘이 붉은 바다가재이기 때문에 사용자들은 이 과정을 농담으로 "바다가재 키우기"라고 부릅니다.
관련 특별 주제 추천
의견 (0)
0/500

대규모 GPU 클러스터로 확장되고 더 밀집된 학습 데이터셋을 활용하는 대규모 모델의 강화학습이 확대됨에 따라, 학습 효율성이 중요한 우선 과제로 부상했습니다. 최근 텐센트 환위안(Tencent Huan Yuan) 팀의 연구는 종종 간과되는 한 가지 과제를 다룹니다: 모델이 자체 학습 데이터를 생성할 때, 롤아웃 생성과 학습의 속도가 서로 다를 경우 배치 크기는 어떻게 재정의되어야 할까요?
임계 배치 크기의 고전적 이론을 바탕으로, 이 연구는 온라인 대규모 언어 모델 강화학습에 대해 이 개념을 다시 유도했습니다. 연구 결과는 실용적인 해결책을 제시합니다: 배치 크기가 증가함에 따라 특정 범위 내에서 학습률을 조정함으로써, GRPO와 PPO 알고리즘 모두 각 응답이 희석되지 않고 효과적으로 학습되도록 보장할 수 있습니다. 이는 배치 크기가 단순히 "클수록 좋은" 것도, 고정된 값도 아님을 의미합니다. 오히려 최대 효율을 위해 미세 조정할 수 있는 최적의 범위가 존재합니다.
실제 하드웨어 비용에 미치는 영향은 큽니다. 고정된 하드웨어 구성에서 배치 크기를 증가시키면 PPO의 생성 처리량을 최대 2.29배까지 높일 수 있습니다. 동시에 최적의 GRPO 구성은 검증 목표에 도달하는 데 29% 더 적은 시간을 소요합니다. GPU 자원에 막대한 투자를 한 팀에게 이는 동일한 클러스터로 작업을 더 빠르게 완료하거나, 동일한 시간 내에 더 많은 데이터를 처리할 수 있음을 의미하며, 강화학습의 가장 비용이 많이 드는 단계에서 비용을 효과적으로 절감합니다.
이 연구는 모델이 학생이자 문제 출제자 역할을 하는 온라인 RL의 확장성을 위한 실용적인 레버리를 제공합니다. 생성과 학습 규모 간의 불일치로 인해 발생하는 효율성 격차는, 이 연구가 임계 배치 크기 이론과 학습률 조정을 결합함으로써 해소됩니다. 업계가 가장 큰 모델을 구축하기 위해 경쟁하는 동안, 텐센트 환위안은 기존 하드웨어를 최적화하여 더 높은 비용 효율성을 달성하는 데 집중하고 있습니다.
AI 스타트업들이 수익성 성장을 가속화하고 있다
확립된 기업들과 신생 벤처들이 인공지능을 활용하기 위해 치열하게 경쟁하는 가운데, 다수의 AI 스타트업들은 매출이 단순히 증가하는 것을 넘어 급격히 가속화되고 있으며, 점점 더 짧은 기간 내에 후속 목표 달성을 이루고 있다고 보고합니다.다음 스타트업들은 이러한 플라이휠 성장의 일관된 패턴을 보여줍니다. 이들 기업이 모두 'ARR'이라는 용어를 사용하더라도 근본적인 지표는 각기 다르다는 점에 유의해야 합니다. 일부 기업은 연간 반복 수익(ARR
Replit의 아마드 마사드는 Cursor 인수, 애플과의 경쟁, 그리고 왜 매각을 선호하지 않는지에 대해
아마드 마사드는 지난 10년 동안 Replit을 구축해 왔지만, 지난 18개월은 변혁의 시기였습니다. 이 AI 코딩 플랫폼은 2024년 연간 매출 280만 달러에서 마사드가 ‘연간 10억 달러 수준의 매출’이라고 묘사하는 궤도로 급성장했습니다.목요일 밤 샌프란시스코에서 열린 TechCrunch의 매진된 StrictlyVC 행사에서 우리는 광범위한 주제를 다뤘습니다. 먼저 업계의 시급한 질문으로 시작했습니다. 경쟁사 Cursor가 SpaceX로
AI 에이전트가 MIIT의 경고와 록칩의 대응 속에서 새우 양식을 강화한다
AI 커뮤니티의 대화는 "대규모 모델 학습"에서 "바다가재 키우기"로 전환되었습니다. 만약 소셜 미디어에서 누군가가 "바다가재"의 데이터를 공급하고 매개변수를 조정하는 방법에 대해 논의하는 것을 보게 된다면, 혼란스러워하지 마십시오. 그들은 수생 생물을 양식하는 것이 아니라 "OpenClaw"이라는 오픈소스 AI 에이전트를 배포하는 것입니다. 공식 아이콘이 붉은 바다가재이기 때문에 사용자들은 이 과정을 농담으로 "바다가재 키우기"라고 부릅니다.





집






