옵션
뉴스
전 Deepseeker 및 Collaborators는 신뢰할 수있는 AI 에이전트를 훈련하기위한 새로운 방법을 발표합니다 : Ragen

전 Deepseeker 및 Collaborators는 신뢰할 수있는 AI 에이전트를 훈련하기위한 새로운 방법을 발표합니다 : Ragen

2025년 5월 4일
276

전 Deepseeker 및 Collaborators는 신뢰할 수있는 AI 에이전트를 훈련하기위한 새로운 방법을 발표합니다 : Ragen

AI 에이전트의 해: 2025년의 기대와 현실에 대한 심층 분석

2025년은 OpenAI, Anthropic, Google, DeepSeek과 같은 회사에서 개발한 고급 대형 언어 및 멀티모달 모델로 구동되는 전문 AI 에이전트가 마침내 주목받을 해로 많은 전문가들이 예고했다. 그러나 최근 X 소셜 네트워크에서 VentureBeat가 실시한 설문조사에 따르면, 대부분의 AI 에이전트는 여전히 실험 단계에 머물러 있으며, 일종의 기업적 림보 상태에 갇혀 있다.

하지만 희망의 빛이 지평선에 보인다. 노스웨스턴 대학교, 마이크로소프트, 스탠퍼드 대학교, 워싱턴 대학교의 연구자들로 구성된 협력 팀, 그리고 이전에 DeepSeek 연구원이었으며 현재 노스웨스턴에서 컴퓨터 과학 박사 과정을 밟고 있는 Zihan Wang이 포함된 팀은 RAGEN을 소개했다. 이 새로운 시스템은 AI 에이전트를 훈련시키고 평가하여 실세계 기업 사용에 보다 신뢰할 수 있고 적응력 있게 만들고자 한다.

RAGEN: AI 에이전트 훈련의 새로운 접근법

수학 문제 풀이나 코드 생성과 같은 정적인 작업과 달리, RAGEN은 에이전트가 불확실성 속에서 적응하고, 기억하고, 추론해야 하는 동적이고 다중 턴 상호작용에 초점을 맞춘다. 이 시스템은 StarPO (State-Thinking-Actions-Reward Policy Optimization)라는 맞춤형 강화 학습(RL) 프레임워크를 기반으로 하며, 암기 학습이 아닌 경험을 통한 학습을 강조한다. StarPO는 단일 단계 응답이 아닌 전체 의사결정 시퀀스를 살펴본다.

StarPO는 두 단계로 작동한다: LLM이 추론에 의해 안내된 완전한 상호작용 시퀀스를 생성하는 롤아웃 단계와, 정규화된 누적 보상을 사용하여 모델을 최적화하는 업데이트 단계다. 이 접근법은 전통적인 정책 최적화 방법에 비해 더 안정적이고 해석 가능한 학습 루프를 제공한다.

연구자들은 알리바바의 Qwen 모델, 구체적으로 Qwen 1.5와 Qwen 2.5의 미세 조정된 버전을 사용하여 이 프레임워크를 테스트했다. 이 모델들은 오픈 웨이트와 강력한 지시 따르기 능력으로 선택되었으며, 이는 재현성과 상징적 작업에 걸친 일관된 기준 비교를 용이하게 했다.

에코 트랩: 강화 학습의 도전 과제

Zihan Wang은 널리 공유된 X 스레드에서 RL 훈련의 중요한 문제를 강조했다: *왜 RL 훈련은 항상 붕괴되는가?* 팀은 LLM 에이전트가 처음에는 잘 추론된 응답을 생성하지만, RL 시스템이 종종 단축된 방법을 보상하여 성능을 저하시키는 반복적인 행동으로 이어지는 현상을 발견했다. 이를 그들은 "에코 트랩"이라고 명명했다.

이러한 퇴행은 특정 문구나 전략이 초기에 높은 보상을 받아 과도하게 사용되며 탐색을 억제하는 피드백 루프에 의해 촉진된다. 증상은 명확하다: 보상 분산의 급격한 하락, 그래디언트 스파이크, 그리고 추론 흔적의 소실이다.

RAGEN의 테스트 환경

이러한 행동을 통제된 환경에서 연구하기 위해, RAGEN은 세 가지 상징적 환경에서 에이전트를 평가한다:

  • Bandit: 상징적 위험-보상 추론을 테스트하는 단일 턴, 확률적 작업.
  • Sokoban: 비가역적 결정을 포함하는 다중 턴, 결정적 퍼즐.
  • Frozen Lake: 적응적 계획이 필요한 확률적, 다중 턴 작업.

각 환경은 실세계 사전 지식을 최소화하고 훈련 중 개발된 의사결정 전략에만 초점을 맞추도록 설계되었다. 예를 들어, Bandit 환경에서 에이전트는 서로 다른 보상 분포를 나타내는 Dragon과 Phoenix 팔에 대해 상징적으로 추론하며, 이를 "힘"과 "희망"으로 해석하여 결과를 예측해야 한다.

StarPO-S로 강화 학습 안정화

훈련 붕괴를 방지하기 위해 연구자들은 원래 프레임워크의 안정화된 버전인 StarPO-S를 도입했다. StarPO-S는 세 가지 주요 개입을 포함한다:

  1. 불확실성 기반 롤아웃 필터링: 에이전트가 결과 불확실성을 보이는 롤아웃을 우선시한다.
  2. KL 페널티 제거: 모델이 원래 정책에서 더 자유롭게 벗어나 새로운 행동을 탐색할 수 있도록 한다.
  3. 비대칭 PPO 클리핑: 낮은 보상 궤적보다 높은 보상 궤적을 더 증폭하여 학습을 촉진한다.

이러한 변경은 훈련 붕괴를 지연시키거나 제거하고 세 가지 작업 모두에서 성능을 향상시킨다. Wang이 말했듯이, "StarPO-S… 세 가지 작업 모두에서 작동한다. 붕괴를 완화한다. 더 나은 보상."

훌륭한 에이전틱 AI 모델을 만드는 요소는?

RL 훈련의 성공은 아키텍처뿐만 아니라 에이전트가 생성한 데이터의 품질에 달려 있다. 팀은 훈련에 큰 영향을 미치는 세 가지 중요한 차원을 식별했다:

  • 작업 다양성: 다양한 초기 시나리오에 모델을 노출시키면 일반화가 향상된다.
  • 상호작용 세분성: 턴당 여러 행동을 허용하면 더 의미 있는 계획이 가능해진다.
  • 롤아웃 신선도: 훈련 데이터를 현재 모델 정책과 정렬하여 오래된 학습 신호를 피한다.

이러한 요소들은 더 안정적이고 효과적인 훈련 과정을 만든다. Github의 대화형 데모 사이트는 에이전트 롤아웃을 전체 대화 턴으로 시각화하며, 행동뿐만 아니라 그에 앞선 단계별 사고 과정을 포함한다. 예를 들어, 수학 문제를 푸는 데 있어 에이전트는 답변 'x = 5'를 제출하기 전에 먼저 변수를 분리하는 '생각'을 할 수 있다. 이러한 중간 사고는 가시적이고 추적 가능하여 에이전트의 의사결정 과정을 투명하게 만든다.

추론이 소진될 때

명시적 추론은 Bandit과 같은 단순한 단일 턴 작업에서 성능을 향상시키지만, 다중 턴 훈련 중에는 퇴화하는 경향이 있다. 구조화된 프롬프트와 토큰을 사용함에도 불구하고, 추론 흔적은 직접 보상받지 않으면 종종 축소되거나 사라진다. 이는 보상이 일반적으로 작업 완료에 초점을 맞추어 설계되며, 그 뒤의 과정 품질을 소홀히 할 수 있음을 보여준다. 팀은 더 나은 구조화된 추론을 장려하기 위해 형식 기반 페널티를 실험했지만, 더 정교한 보상 형성이 필요할 가능성이 있다고 인정했다.

오픈 도구와 미래 방향

RAGEN과 StarPO 및 StarPO-S 프레임워크는 이제 https://github.com/RAGEN-AI/RAGEN에서 오픈 소스 프로젝트로 제공된다. 그러나 작성 시점에서 GitHub 저장소에는 명시적 라이선스가 나열되어 있지 않아 다른 사람의 사용 또는 재배포가 제한될 수 있다.

이 시스템은 작업을 완료할 뿐만 아니라 생각하고, 계획하고, 진화하는 AI 에이전트를 개발하려는 이들에게 귀중한 기반을 제공한다. AI가 더 큰 자율성을 향해 나아가면서, RAGEN과 같은 프로젝트는 모델이 자신의 행동의 결과로부터 배우는 데 필요한 것을 조명하는 데 도움을 준다.

실세계 기업 채택을 위한 미해결 질문

RAGEN 논문은 상세한 기술 로드맵을 제공하지만, 기업 환경에서 이러한 방법을 적용하려는 이들에게 몇 가지 실질적인 질문이 남아 있다. 예를 들어, RAGEN의 접근법은 양식화된 상징적 작업을 넘어 얼마나 전이 가능한가? 기업이 송장 처리나 고객 지원과 같은 워크플로우에서 이 시스템을 사용하려면 완전히 새로운 환경과 보상 함수를 설계해야 할까?

Wang은 X에서 VentureBeat에 보낸 직접 메시지에서 작업 다양성을 개선하면 도움이 될 수 있다고 제안했다. 현재 게임 작업은 유사한 격자 표현만을 가지며 의미적 정보가 부족하다. 그는 또한 기업이 RAGEN을 사용하여 AI 에이전트를 위한 자체 훈련 연습을 설계할 수 있다고 낙관적으로 언급하며, GitHub 링크가 새로운 환경을 추가하는 간단한 소개를 제공한다고 밝혔다.

또 다른 중요한 영역은 확장성이다. StarPO-S의 개선에도 불구하고, 논문은 훈련이 장기적으로 결국 붕괴된다고 인정한다. 이는 개방적이거나 지속적으로 진화하는 작업 시퀀스에서 추론을 지속하는 이론적 또는 실제적 경로가 있는지에 대한 질문을 제기한다.

작성 시점에서 RAGEN GitHub 저장소 또는 문서에는 명시적 라이선스가 나열되어 있지 않아 사용 권한에 대한 질문이 열려 있다. 그럼에도 불구하고, RAGEN은 기술적 기여뿐만 아니라 더 자율적이고 추론 능력을 갖춘 AI 에이전트를 향한 개념적 단계로 두드러진다. 기업 AI 스택의 일부가 될지는 아직 미지수지만, 에이전트 학습 역학에 대한 통찰은 이미 LLM 훈련의 새로운 경계를 재정의하는 데 도움을 주고 있다.

관련 기사
Base44, 방어력을 강화하는 고유 AI 모델을 vibe 코딩 플랫폼에 공개 Base44, 방어력을 강화하는 고유 AI 모델을 vibe 코딩 플랫폼에 공개 Base44은 1년 전, 팀이 8명으로 구성되고 설립된 지 불과 6개월 된 상태였을 때 Wix로부터 8,000만 달러에 인수된 vibe 코딩 플랫폼으로, 이제 자연어를 사용하여 애플리케이션을 구축할 수 있도록 자체 AI 모델을 배포하기 시작했습니다.이러한 developments는 최첨단 모델이 모든 사용 사례에 최적인지, 그리고 외부 모델에 의존하는 기업들이 장기적인 방어력을 유지할 수 있는지에 대해 AI 커뮤니티가 논쟁을 벌이는 시점에 이루
영상 생성 스타트업 픽스버스(PixVerse), 4억 3,900만 달러 투자 유치… 기업 가치 20억 달러 돌파 영상 생성 스타트업 픽스버스(PixVerse), 4억 3,900만 달러 투자 유치… 기업 가치 20억 달러 돌파 싱가포르에 본사를 둔 영상 생성 스타트업 픽스버스(PixVerse)는 오늘 시리즈 C 확장 라운드를 마감하고, 이번 라운드에서 총 4억 3,900만 달러를 조달했다고 발표했다. 회사에 따르면, 이번 신규 자금 조달로 기업 가치가 20억 달러를 넘어섰다. 조달된 자금은 월드 모델 제품군을 확장하고 전 세계 고객에게 서비스를 확대하는 데 사용될 예정이다.Pi
중국의 AI 동반자 규제: 베이징의 진정한 목표 중국의 AI 동반자 규제: 베이징의 진정한 목표 AI 동반자라는 개념은 디스토피아적으로 보일 수 있지만, 생성형 AI의 위험성에 대한 광범위한 논의에서 반복적으로 등장하는 주제가 되었습니다. 본질적으로 이는 사용자와 지속적이고 개인적인 관계를 유지하도록 설계된 대화형 에이전트를 의미하며, 세션 간 일관성을 보장하는 기억 기능과 일관된 인격을 갖추고 있습니다.이러한 설계 방식은 자연스럽게 정서적 유대감을
관련 특별 주제 추천
챗봇 면접 연습을 위한 최고의 AI 대화 트레이너 도구
면접 연습을 위한 최고의 AI 대화 트레이너 도구

2026년 최신 최고의 평점 높은 AI 대화 트레이너 도구들이 XIX.AI에서 만나보세요! 면접 연습을 위한 이 엄선된 컬렉션은 강력한, 게임 체인저 도구들을 포함하고 있으며, 엄격한 실제 세계 테스트를 거쳐 정확한 피드백을 제공합니다. 무료 대 유료 비교와 상세한 순위표를 찾을 수 있어 자신감과 기술을 향상시킬 수 있는 꼭 시도해봐야 할 옵션을 선택하는 데 도움이 됩니다. 지금 탐색하여 면접 성공을 위한 완벽한 도구를 발견하세요!

12 도구
xix.ai
디자인과 예술 창의적인 실험을 위한 최고의 AI 스타일 변환 도구
창의적인 실험을 위한 최고의 AI 스타일 변환 도구

2026년 최신, 최고 평점을 받은 창의적 실험을 위한 AI 스타일 변환 도구! XIX.AI는 실제 테스트와 엄격한 평가를 통해 탁월한 결과를 보여주는, 강력하고 판도를 바꿀 만한 ‘꼭 사용해 봐야 할’ 도구들을 엄선했습니다. 이 최고의 솔루션들은 콘텐츠 제작 속도를 높이고 무한한 창의적 가능성을 열어줌으로써 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 탐색하여 나에게 딱 맞는 도구를 찾아보고, 오늘 바로 창작을 시작해 보세요!

9 도구
xix.ai
만화 창작 시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구
시각적 스토리텔링을 위한 최고의 AI 대화 풍선 도구

2026년 시각적 스토리텔링을 위한 최신 최고 평점의 AI 대화 풍선 도구가 XIX.AI에 소개됩니다! 이 엄선된 모음집에는 크리에이터들이 생산성을 높이고 창의적인 난관을 극복하는 데 도움을 주는, 강력하고 획기적인 도구들이 포함되어 있습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 실제 테스트 결과를 살펴보며, 최신 순위를 통해 매력적인 시각적 이야기를 만드는 데 꼭 필요한 솔루션을 찾아보세요. 지금 바로 탐색하여 여러분에게 딱 맞는 도구를 발견해 보세요!

10 도구
xix.ai
회의 도우미 최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요
최고의 AI 회의 요약 도구: 의사 결정 사항과 후속 조치를 명확하게 추적하세요

2026년 최신 최고 평점을 받은 최고의 AI 회의 요약 도구로, 명확한 의사 결정 추적과 손쉬운 후속 조치를 실현하세요. 이 엄선된 목록은 회의록 자동화, 핵심 실행 과제 파악, 모든 프로젝트에 걸친 팀 협업 효율화를 통해 생산성을 획기적으로 높여주는 강력하고 혁신적인 솔루션을 소개합니다. 무료 버전과 유료 버전의 비교 정보, 실제 사용 후기, 매주 업데이트되는 순위 정보를 통해 여러분에게 딱 맞는 도구를 찾아보세요. 지금 바로 살펴보고 AI의 힘을 경험해 보세요!

9 도구
xix.ai
데이터 분석 최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기
최고의 AI 데이터 정제 도구: 누락된 값과 중복 데이터를 신속하게 수정하기

2026년 최신의 우수하고 높은 평가를 받는 AI 데이터 정제 도구들로, 누락된 값과 중복 데이터를 신속하게 수정할 수 있습니다. 이 선별된 목록에는 생산성을 획기적으로 향상시켜 주는 강력한 솔루션이 포함되어 있습니다. 각 도구는 신뢰성을 보장하기 위해 엄격한 실제 환경 테스트를 거쳤습니다. 무료 버전과 유료 버전의 비교 정보를 확인하고, 귀하의 요구사항에 가장 적합한 도구를 발견해 보세요. 지금 바로 XIX.AI에서 자세히 알아보시고 AI 분야에서의 경쟁 우위를 확보하세요.

11 도구
xix.ai
디자인과 예술 아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라
아티스트를 위한 최고의 AI 창의적 아이디어 도구: 시각적 블록을 돌파하라

2026년 최신 최고 인기 AI 창의적 아이디어 도구들은 XIX.AI가 선별한 것으로, 창작자들이 시각적 장벽을 돌파하고 즉각적으로 창의성을 높일 수 있도록 지원합니다. 이러한 강력한 혁신적 도구들은 실제 테스트 결과, 무료와 유료 버전의 상세 비교, 그리고 매주 업데이트되는 순위표를 제공합니다. 콘텐츠 제작을 가속화하고 AI 경쟁력을 발휘할 수 있는 완벽한 도구를 발견하세요. 지금 바로 탐색하세요!

14 도구
xix.ai
의견 (11)
0/500
EricJohnson
EricJohnson 2026년 8월 30일 오후 9시 0분 30초 GMT+09:00

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 2026년 4월 9일 오전 3시 0분 57초 GMT+09:00

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 2026년 4월 5일 오전 1시 0분 41초 GMT+09:00

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 2025년 10월 12일 오전 11시 30분 38초 GMT+09:00

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 2025년 8월 13일 오후 8시 0분 59초 GMT+09:00

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 2025년 7월 23일 오후 1시 59분 29초 GMT+09:00

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR