옵션
뉴스
고비용의 강화 학습 필요성을 우회하여 LLM 성능을 향상시키는 Google의 GEPA

고비용의 강화 학습 필요성을 우회하여 LLM 성능을 향상시키는 Google의 GEPA

2025년 12월 27일
153

UC 버클리, 스탠포드 대학, 데이터브릭스의 연구원들은 대규모 언어 모델을 특수 작업에 적용하는 데 있어 기존의 강화 학습 기법보다 괄목할 만한 개선을 보여주는 새로운 AI 최적화 방법인 GEPA를 소개했습니다.

GEPA는 단순한 수치 점수로 수천 번의 시행착오를 통해 학습하는 기존 방식에서 벗어났습니다. 대신 LLM의 내부 언어 기능을 사용하여 성능을 분석하고, 실수를 식별하고, 지침을 점진적으로 개선합니다. GEPA는 기존 방식보다 더 높은 정확도를 달성하는 것 외에도 훨씬 더 효율적이며, 최대 35배 더 적은 시험 실행으로 우수한 결과를 제공합니다.

복잡한 AI 에이전트와 워크플로를 개발하는 기업에게 이러한 혁신은 더 빠른 개발, 훨씬 낮은 컴퓨팅 비용, 더 강력하고 신뢰할 수 있는 애플리케이션을 의미합니다.

최신 AI 시스템 최적화에 드는 높은 비용

최신 엔터프라이즈 AI 애플리케이션은 LLM에 대한 단일 호출에 의존하는 경우가 거의 없습니다. 일반적으로 여러 개의 LLM 모듈, 데이터베이스나 코드 인터프리터 같은 외부 도구, 다단계 연구 및 데이터 분석과 같은 복잡한 작업을 실행하기 위한 사용자 지정 로직을 결합한 정교한 워크플로우인 '복합 AI 시스템'이죠.

이러한 시스템의 일반적인 최적화 전략은 고급 추론 모델에 사용되는 그룹 상대 정책 최적화와 같은 기법으로 예시되는 강화 학습입니다. 이러한 방법은 AI 시스템을 블랙박스로 취급하여 기본적인 성공 지표를 통해 작업을 평가합니다. 그런 다음 이 제한된 피드백을 사용하여 더 나은 성능을 위해 모델의 매개변수를 점진적으로 조정합니다.

RL의 가장 큰 한계는 비효율성입니다. 최소한의 수치 점수로 효과적으로 학습하려면 RL은 종종 수만 또는 수십만 번의 시험 실행이 필요합니다. 비용이 많이 드는 도구 호출이나 독점 모델을 사용하는 실제 엔터프라이즈 애플리케이션의 경우, 이 프로세스는 엄청나게 느리고 비용이 많이 듭니다.

이 책의 공동 저자이자 UC 버클리의 박사 과정 학생인 락샤 아그라왈은 이러한 복잡성이 많은 조직에 큰 장애물이라고 설명합니다. "많은 팀에서 비용과 복잡성 때문에 RL은 비실용적이며, 기본 접근 방식은 대부분 수동 프롬프트 엔지니어링입니다."라고 Agrawal은 지적합니다. GEPA는 종종 미세 조정이 불가능한 고성능 모델을 사용하는 팀을 위해 설계되어 특수 하드웨어를 관리하지 않고도 성능을 향상시킬 수 있습니다.

연구팀은 이런 식으로 과제를 설정했습니다: "어떻게 하면 비용이 많이 드는 모든 실험에서 최대 학습 신호를 추출하여 데이터나 예산이 부족한 상황에서 복잡한 모듈형 AI 시스템을 효과적으로 조정할 수 있을까?"

언어를 통해 학습하는 최적화 도구

GEPA 프레임워크 출처: arXiv

GEPA는 희박한 보상 신호를 상세한 자연어 피드백으로 대체하여 이러한 문제를 해결합니다. 이는 추론 단계, 도구 호출, 오류 메시지 등 AI 시스템의 전체 실행을 LLM이 처리할 수 있는 텍스트로 표현할 수 있다는 사실을 활용합니다. 이 방법론은 세 가지 핵심 원칙을 기반으로 합니다.

첫 번째는 '유전적 프롬프트 진화'로, GEPA는 프롬프트 세트를 유전자 풀로 취급하여 반복적으로 수정하여 새롭고 잠재적으로 개선된 버전을 생성합니다. 이 돌연변이 과정은 두 번째 원칙인 "자연어 피드백을 통한 반영"에 따라 진행됩니다. 몇 번의 시험 실행 후 GEPA는 전체 실행 내역과 결과를 LLM에 제공합니다. 그러면 LLM은 이 정보를 분석하여 문제를 진단하고 보다 정확하고 개선된 프롬프트 초안을 작성합니다. 예를 들어, 코드 생성 점수가 낮다고 해서 컴파일러 오류를 검사하고 프롬프트에 특정 라이브러리 버전을 지정해야 한다고 판단할 수 있습니다.

세 번째 원칙은 지능적인 탐색을 촉진하는 '파레토 기반 선택'입니다. GEPA는 차선책에 안주할 위험이 있는 가장 높은 점수를 받은 프롬프트 하나에만 집중하는 대신 다양한 전문 프롬프트 모음을 유지합니다. 다양한 테스트 사례에서 어떤 프롬프트가 뛰어난지 파악하여 주요 후보 명단을 작성합니다. 이렇게 다양한 성공 전략에서 샘플링함으로써 GEPA는 더 넓은 솔루션 공간을 탐색하고 다양한 입력에서 우수한 성능을 발휘하는 프롬프트를 발견할 가능성이 높아집니다.

단일 상위 후보에 집중하면 모델을 로컬 최소값에 가둘 수 있는 반면, 파레토 선택은 더 많은 옵션을 탐색하여 최적의 솔루션을 찾습니다. 출처: arXiv

이 전체 프로세스의 성공 여부는 연구자들이 "피드백 엔지니어링"이라고 부르는 것에 달려 있습니다. 아그라왈은 시스템이 이미 생성하지만 종종 무시하는 풍부한 텍스트 세부 정보를 포착하는 것이 핵심이라고 강조합니다. "기존의 파이프라인은 일반적으로 이러한 정보를 하나의 수치화된 보상으로 압축하여 특정 결과 뒤에 숨은 이유를 숨깁니다."라고 그는 설명합니다. "GEPA의 핵심 접근 방식은 최종 결과뿐만 아니라 인간 전문가가 시스템 동작을 분석할 때 사용하는 것과 동일한 증거인 일반 텍스트로 중간 단계와 오류를 드러내는 피드백을 구성하는 것입니다."

예를 들어, 문서 검색 시스템의 경우 최종 정확도 점수만 보고하는 것이 아니라 어떤 문서가 올바르게 검색되었고 어떤 문서가 누락되었는지를 나열하는 것이 포함됩니다.

실제 GEPA

연구팀은 멀티홉 질문 답변부터 개인정보 보호 쿼리에 이르기까지 네 가지 작업에 걸쳐 GEPA를 평가했습니다. 연구팀은 오픈 소스 모델과 독점 모델을 모두 테스트하여 GEPA를 RL 기반 GRPO 및 고급 프롬프트 최적화 도구인 MIPROv2와 비교했습니다.

모든 평가에서 GEPA는 최대 19%의 점수 향상을 달성하면서 최대 35배 더 적은 시험 실행 횟수를 사용하여 GRPO를 크게 앞질렀습니다. 아그라왈은 구체적인 사례를 통해 이러한 효율성을 설명했습니다: "GEPA로 질문-답변 시스템을 최적화하는 데 약 3시간이 걸린 반면, GRPO는 24시간이 걸렸습니다. 이는 개발 시간을 8배 단축하고 20%의 성능 향상을 달성한 것입니다."라고 그는 설명합니다. "동일한 테스트 시나리오에 대한 RL 기반 최적화는 약 300달러의 GPU 컴퓨팅 비용이 드는 반면, GEPA는 20달러 미만으로 더 나은 결과를 달성하여 실험에서 15배의 비용을 절감했습니다."

주요 성능 지표에서 다른 벤치마크 방법을 능가하는 GEPA 출처: arXiv

연구진은 원시 지표 외에도 "일반화 격차"가 더 작아진 것으로 보아 GEPA에 최적화된 시스템이 보이지 않는 새로운 데이터를 처리할 때 더 안정적이라는 사실을 관찰했습니다. 아그라왈은 이러한 견고성 향상은 GEPA가 더 풍부한 피드백을 통해 학습하기 때문이라고 설명합니다. "GEPA의 일반화 격차가 작아진 것은 단일 수치 점수에 의존하는 대신 각 결과에 대한 상세한 자연어 피드백을 사용하여 무엇이 성공하고 무엇이 실패했으며 그 이유는 무엇인지 명확히 설명하기 때문일 것입니다."라고 그는 말합니다. "이를 통해 시스템은 단순히 훈련 데이터의 패턴을 암기하는 것이 아니라 성공에 대한 포괄적인 이해를 바탕으로 지침과 전략을 개발하도록 장려합니다." 기업 입장에서는 이렇게 향상된 신뢰성을 통해 고객 대면 시나리오에서 더욱 강력하고 적응력 있는 AI 애플리케이션을 활용할 수 있습니다.

GEPA의 최종 지침은 수많은 예제를 포함하는 MIPROv2와 같은 최적화 도구에서 생성되는 프롬프트보다 최대 9.2배 더 짧다는 것이 실질적인 주요 이점입니다. 프롬프트가 짧아지면 API 기반 모델의 지연 시간이 줄어들고 비용이 절감되므로 최종 애플리케이션을 프로덕션 환경에서 더 빠르고 경제적으로 실행할 수 있습니다.

이 백서는 또한 AI를 단일 단계 답변 생성기에서 반복적인 문제 해결자로 전환하는 '추론 시간' 검색 전략으로서 GEPA의 유망한 애플리케이션을 살펴봅니다. 아그라왈은 GEPA가 시스템의 최적화된 여러 버전을 자동으로 생성 및 개선하고, 성능을 테스트하고, 엔지니어링 검토를 위해 최상의 변형을 제출할 수 있는 회사의 개발 파이프라인에 통합될 수 있는 가능성을 설명했습니다. 아그라왈은 "이를 통해 최적화를 지속적이고 자동화된 프로세스로 전환하여 종종 전문가의 수동 튜닝 품질을 충족하거나 능가하는 솔루션을 신속하게 생산할 수 있습니다."라고 덧붙였습니다. CUDA 코드 생성 테스트에서 이 방법은 GPT-4o와 같은 모델을 한 번 시도할 경우 0%에 불과했던 성능을 20%의 작업에서 전문가 수준으로 끌어올렸습니다.

저자들은 GEPA를 AI 개발의 새로운 패러다임을 향한 기초 단계로 보고 있습니다. 그러나 보다 인간과 유사한 AI를 육성하는 것 외에도 가장 즉각적인 영향은 고성능 시스템 개발의 대중화에 있을 수 있습니다.

아그라왈은 "GEPA가 AI 시스템 구축에 긍정적인 변화를 가져올 것으로 기대하며, 작업에 대한 심층적인 도메인 전문 지식을 보유하고 있지만 복잡한 RL 기술을 습득할 시간이나 욕구가 부족한 최종 사용자도 최적화에 접근할 수 있을 것으로 예상합니다."라고 결론을 내립니다. "정확한 업무별 지식을 보유한 이해관계자의 역량을 강화할 수 있습니다."

관련 기사
Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진 Anthropic, 클로드 AI 코딩 도구를 일본으로 확장하여 해외 성장 추진 미국의 대표적인 인공지능 기업인 앤트로픽(Anthropic)이 글로벌 마케팅을 강화하고 있다. 수요일, 이 회사는 도쿄에서 약 500명의 소프트웨어 엔지니어가 참석한 대규모 개발자 행사인 '클로드로 코딩(Code with Claude)'을 개최했다. 이번 행사는 자율적 코딩 기능의 핵심 이점을 강조하며, 클로도 AI 도구와 관련 제품을 일본 시장에 적극적으로 도입하여 기업의 생산성을 높이는 것을 목표로 한다.자동 코드 생성 강조행사 동안 앤
인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음 인도의 소프트웨어 거대 기업이 채용을 축소하고 AI 에이전트 확대에 따라 해고를 약속하지 않음 인공지능이 전통적인 노동집약적 비즈니스 모델을 재편함에 따라, 인도 최고의 소프트웨어 아웃소싱 기업인 타타 컨설팅 서비스스(TCS)는 전략적 대응책을 공개했습니다. 화요일 열린 정기주주총회에서 회장은 인간과 기계의 협력을 비전으로 제시하고, AI 시대의 회사 인력 전략을 명확히 했습니다.해고는 없지만 채용은 느려질 것TCS 회장은 AI 도입으로 인한 직원 해고 계획이 없다고 명시하면서도, 전체 채용 속도는 늦출 것이라고 밝혔습니다. TCS는
중국, 가오카오 기간 중 AI 모델 잠금으로 즉각적인 과제 도움 차단 중국, 가오카오 기간 중 AI 모델 잠금으로 즉각적인 과제 도움 차단 2026년 대학수학능력시험(가오카오)이 임박함에 따라 시험 기간 중 AI 도구 사용 금지에 관한 루머가 온라인상에서 뜨거운 논쟁을 불러일으켰다. 대중의 우려에 대응하여 주요 AI 플랫폼과 교육용 앱들은 총체적인 금지보다는 시험 관련 기능에 대해 시기 한정 잠금 장치를 적용한다는 입장을 명확히 했다.이들 플랫폼은 정밀한 시간 기반 제어 메커니즘을 채택했다. 공식 시험 시간 동안 사진 기반 문제 풀이 및 질문 분석 기능은 일시적으로 비활성화된다.
관련 특별 주제 추천
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
디자인과 예술 아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라
아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라

2026년 최신 최고 인기 AI 창의적 아이디어 도구들은 XIX.AI가 선별한 것으로, 창작자들이 시각적 장벽을 돌파하고 즉각적으로 창의성을 높일 수 있도록 지원합니다. 이러한 강력한 혁신적 도구들은 실제 테스트 결과, 무료와 유료 버전의 상세 비교, 그리고 매주 업데이트되는 순위표를 제공합니다. 콘텐츠 제작을 가속화하고 AI 경쟁력을 발휘할 수 있는 완벽한 도구를 발견하세요. 지금 바로 탐색하세요!

14 도구
xix.ai
음악 작곡 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커
틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 AI 비트 메이커

2026년 틱톡 배경 음악, 릴스 오디오, 크리에이터 홍보용 음악을 위한 최신 최고의 AI 비트 메이커! XIX.AI는 모든 콘텐츠 요구 사항에 맞는 완벽한 음악을 제공하기 위해 실제 테스트를 거친, 업계에 혁신을 일으킬 만한 강력한 도구들의 최고 평점 목록을 엄선했습니다. 창의성과 생산성을 높이는 데 도움이 될 상세한 무료 vs 유료 비교 자료, 매주 업데이트되는 순위, 그리고 꼭 시도해 봐야 할 추천 옵션을 확인하실 수 있습니다. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 찾아보세요!

11 도구
xix.ai
의견 (0)
0/500
OR