opção
Lar
Notícias
Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

4 de Maio de 2025
276

Ex -Deepseeker e Collaborators lançam um novo método para treinar agentes de IA confiáveis: Ragen

O Ano dos Agentes de IA: Um Olhar Mais Atento sobre as Expectativas e Realidades de 2025

2025 foi anunciado por muitos especialistas como o ano em que os agentes de IA — sistemas de IA especializados alimentados por modelos de linguagem avançados e multimodais de empresas como OpenAI, Anthropic, Google e DeepSeek — finalmente ocupariam o centro do palco. No entanto, de acordo com uma recente enquete da VentureBeat na rede social X, a maioria dos agentes de IA ainda está em estágios experimentais, presos em uma espécie de limbo corporativo.

Mas há um vislumbre de esperança no horizonte. Um esforço colaborativo de pesquisadores da Northwestern University, Microsoft, Stanford e da University of Washington, incluindo Zihan Wang, ex-pesquisador da DeepSeek e agora doutorando em ciência da computação na Northwestern, apresentou o RAGEN. Este novo sistema visa treinar e avaliar agentes de IA para torná-los mais confiáveis e adaptáveis para uso empresarial no mundo real.

RAGEN: Uma Nova Abordagem para Treinamento de Agentes de IA

Ao contrário de tarefas estáticas, como resolução de problemas matemáticos ou geração de código, o RAGEN foca em interações dinâmicas de múltiplas rodadas, onde os agentes precisam se adaptar, lembrar e raciocinar em meio à incerteza. O sistema é construído sobre um framework personalizado de aprendizado por reforço (RL) chamado StarPO (Otimização de Política de Estado-Pensamento-Ações-Recompensa), que enfatiza o aprendizado por experiência, em vez de memorização mecânica. O StarPO analisa sequências completas de tomada de decisão, não apenas respostas de etapa única.

O StarPO opera em duas fases: uma etapa de rollout, onde o LLM gera sequências completas de interação guiadas por raciocínio, e uma etapa de atualização, onde o modelo é otimizado usando recompensas cumulativas normalizadas. Essa abordagem oferece um ciclo de aprendizado mais estável e interpretável em comparação com métodos tradicionais de otimização de políticas.

Os pesquisadores testaram esse framework usando versões ajustadas dos modelos Qwen da Alibaba, especificamente Qwen 1.5 e Qwen 2.5, escolhidos por seus pesos abertos e fortes capacidades de seguir instruções. Essa escolha facilitou a reprodutibilidade e comparações consistentes de linha de base em tarefas simbólicas.

A Armadilha do Eco: Um Desafio no Aprendizado por Reforço

Zihan Wang destacou um problema crítico no treinamento de RL em uma thread amplamente compartilhada no X: *Por que seu treinamento de RL sempre colapsa?* A equipe identificou que, embora os agentes de LLM inicialmente produzam respostas bem fundamentadas, os sistemas de RL frequentemente recompensam atalhos, levando a comportamentos repetitivos que degradam o desempenho — um fenômeno que eles chamaram de "Armadilha do Eco".

Essa regressão é alimentada por loops de feedback onde certas frases ou estratégias recebem altas recompensas no início, incentivando o uso excessivo e sufocando a exploração Kimberly. Os sintomas são claros: quedas na variância de recompensa, picos de gradiente e rastros de raciocínio que desaparecem.

Ambientes de Teste do RAGEN

Para estudar esses comportamentos em um ambiente controlado, o RAGEN avalia agentes em três ambientes simbólicos:

  • Bandit: Uma tarefa estocástica de turno único que testa o raciocínio simbólico de risco-recompensa.
  • Sokoban: Um quebra-cabeça determinístico de múltiplos turnos envolvendo decisões irreversíveis.
  • Frozen Lake: Uma tarefa estocástica de múltiplos turnos que exige planejamento adaptativo.

Cada ambiente é projetado para minimizar vieses do mundo real e focar exclusivamente nas estratégias de tomada de decisão desenvolvidas durante o treinamento. Por exemplo, no ambiente Bandit, os agentes devem raciocinar simbolicamente sobre os braços Dragon e Phoenix, que representam diferentes distribuições de recompensa, interpretando-os como "força" e "esperança" para prever resultados.

Estabilizando o Aprendizado por Reforço com StarPO-S

Para combater o colapso do treinamento, os pesquisadores apresentaram o StarPO-S, uma versão estabilizada do framework original. O StarPO-S inclui três intervenções principais:

  1. Filtragem de rollout baseada em incerteza: Priorizando rollouts onde o agente demonstra incerteza nos resultados.
  2. Remoção da penalidade KL: Permitindo que o modelo se desvie mais livremente de sua política original e explore novos comportamentos.
  3. Clipping assimétrico de PPO: Amplificando trajetórias de alta recompensa mais do que as de baixa recompensa para impulsionar o aprendizado.

Essas mudanças ajudam a retardar ou eliminar o colapso do treinamento e melhorar o desempenho em todas as três tarefas. Como Wang disse, "StarPO-S… funciona em todas as 3 tarefas. Alivia o colapso. Melhor recompensa."

O que Faz um Bom Modelo de IA Agêntica?

O sucesso do treinamento de RL depende não apenas da arquitetura, mas também da qualidade dos dados gerados pelos agentes. A equipe identificou três dimensões cruciais que impactam significativamente o treinamento:

  • Diversidade de tarefas: Expor o modelo a uma ampla gama de cenários iniciais melhora a generalização.
  • Granularidade de interação: Permitir múltiplas ações por turno possibilita um planejamento mais significativo.
  • Frescor do rollout: Manter os dados de treinamento alinhados com a política atual do modelo evita sinais de aprendizado desatualizados.

Esses fatores contribuem para um processo de treinamento mais estável e eficaz. Um site de demonstração interativa no Github visualiza os rollouts de agentes como turnos completos de diálogo, incluindo não apenas ações, mas também o processo de pensamento passo a passo que os precede. Por exemplo, ao resolver um problema matemático, um agente pode primeiro 'pensar' em isolar uma variável antes de enviar uma resposta como 'x = 5'. Esses pensamentos intermediários são visíveis e rastreáveis, adicionando transparência a como os agentes tomam decisões.

Quando o Raciocínio Acaba

Embora o raciocínio explícito melhore o desempenho em tarefas simples de turno único, como Bandit, ele tende a decair durante o treinamento de múltiplos turnos. Apesar do uso de prompts estruturados e tokens, os rastros de raciocínio frequentemente diminuem ou desaparecem, a menos que sejam diretamente recompensados. Isso destaca uma limitação em como as recompensas são normalmente projetadas: focar na conclusão da tarefa pode negligenciar a qualidade do processo por trás dela. A equipe experimentou penalidades baseadas em formato para encorajar um raciocínio melhor estruturado, mas reconhece que um modelamento de recompensa mais refinado provavelmente é necessário.

Ferramentas Abertas e Direções Futuras

O RAGEN, junto com seus frameworks StarPO e StarPO-S, agora está disponível como um projeto de código aberto em https://github.com/RAGEN-AI/RAGEN. No entanto, no momento da redação, nenhuma licença explícita está listada no repositório do GitHub, o que pode limitar seu uso ou redistribuição por outros.

O sistema fornece uma base valiosa para aqueles interessados em desenvolver agentes de IA que não apenas completem tarefas, mas também pensem, planejem e evoluam. À medida que a IA avança para maior autonomia, projetos como o RAGEN ajudam a iluminar o que é necessário para treinar modelos que aprendem com as consequências de suas próprias ações.

Perguntas Pendentes para Adoção Empresarial no Mundo Real

Embora o artigo do RAGEN ofereça um roteiro técnico detalhado, várias questões práticas permanecem para aqueles que desejam aplicar esses métodos em ambientes empresariais. Por exemplo, quão transferível é a abordagem do RAGEN além de tarefas simbólicas estilizadas? As empresas precisariam projetar ambientes e funções de recompensa completamente novos para usar este sistema em fluxos de trabalho como processamento de faturas ou suporte ao cliente?

Wang, em uma mensagem direta à VentureBeat no X, sugeriu que melhorar a diversidade de tarefas poderia ajudar, já que as tarefas de jogos atuais possuem apenas representações de grade semelhantes, mas carecem de informações semânticas. Ele também expressou otimismo sobre as empresas projetarem seus próprios exercícios de treinamento para agentes de IA usando o RAGEN, observando que o link do GitHub fornece uma introdução simples para adicionar novos ambientes.

Outra área crítica é a escalabilidade. Mesmo com as melhorias fornecidas pelo StarPO-S, o artigo reconhece que o treinamento ainda eventualmente colapsa em horizontes mais longos. Isso levanta a questão: existe um caminho teórico ou prático para sustentar o raciocínio em sequências de tarefas abertas ou em constante evolução?

No momento da redação, nenhuma licença explícita está listada no repositório ou documentação do RAGEN, deixando questões em aberto sobre direitos de uso. Ainda assim, o RAGEN se destaca não apenas como uma contribuição técnica, mas como um passo conceitual em direção a agentes de IA mais autônomos e capazes de raciocínio. Se ele se tornará parte da pilha de IA empresarial ainda está por ser visto, mas suas percepções sobre a dinâmica de aprendizado de agentes já estão ajudando a redefinir a fronteira do treinamento de LLM.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A startup de geração de vídeos PixVerse levanta US$ 439 milhões, com avaliação ultrapassando US$ 2 bilhões A startup de geração de vídeos PixVerse levanta US$ 439 milhões, com avaliação ultrapassando US$ 2 bilhões A PixVerse, uma startup de geração de vídeos com sede em Cingapura, anunciou hoje o fechamento da extensão de sua Rodada da Série C, levantando um total de US$ 439 milhões na rodada. De acordo com a e
Regras da China para assistentes de IA: o verdadeiro alvo de Pequim Regras da China para assistentes de IA: o verdadeiro alvo de Pequim O conceito de um companheiro de IA pode parecer distópico, mas tornou-se um tema recorrente em discussões mais amplas sobre os riscos da IA generativa. Essencialmente, refere-se a um agente conversaci
Recomendações de tópicos especiais relacionados
chatbot Melhores aplicativos de chat de interpretação de papéis com IA para prática de idiomas, preparação para entrevistas e fluência diária
Melhores aplicativos de chat de interpretação de papéis com IA para prática de idiomas, preparação para entrevistas e fluência diária

2026 Últimas Melhores Aplicativos de Chat de Interpretação de Papéis por IA Mais Bem Avaliados para Prática de Idiomas, Preparação para Entrevistas e Fluência Diária! O XIX.AI seleciona uma poderosa coleção revolucionária que oferece comparação entre gratuito e pago, testes do mundo real e classificações atualizadas semanalmente. Essas ferramentas imperdíveis ajudam você a aprimorar suas habilidades de escrita, superar desafios de fluência e melhorar a eficiência da comunicação em todos os cenários diários. Explore agora para descobrir sua ferramenta perfeita para o crescimento do idioma!

10 ferramentas
xix.ai
Composição musical Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê
Ferramentas de separação de stems com IA para produção de remixes, preparação de samples e masters de karaokê

As melhores e mais bem avaliadas ferramentas de separação de faixas com IA de 2026, selecionadas especialmente para produção de remixes, preparação de samples e masters de karaokê. Essas ferramentas poderosas e revolucionárias passaram por testes práticos para oferecer isolamento de áudio preciso, aumentando significativamente a produtividade. A XIX.AI oferece um guia comparativo entre versões gratuitas e pagas, atualizado semanalmente, para ajudá-lo a encontrar a solução imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Análise de dados Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos
Copilotos de IA para SQL voltados para painéis de receita, análise de funis e métricas de produtos

2026: Os melhores copilotos AI para SQL, atualizados e classificados entre os melhores! A XIX.AI reúne uma coleção poderosa e revolucionária, com testes em ambiente real atualizados semanalmente. Essas ferramentas indispensáveis ajudam a gerar painéis de controle de receita precisos, analisar funis de vendas e rastrear métricas de produtos de forma rápida, aumentando significativamente a produtividade. Explore agora e encontre a ferramenta perfeita para tomada de decisões baseadas em dados! 238 caracteres

9 ferramentas
xix.ai
Composição musical Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas
Melhores Ferramentas de IA para Criação de Melodias para Rascunhos de Músicas

2026 Últimas Melhores Ferramentas de Escrita de Melodias por IA Mais Bem Avaliadas para Rascunhos de Músicas! A XIX.AI reuniu uma coleção altamente poderosa e transformadora, que passou por rigorosos testes no mundo real para oferecer a melhor experiência de escrita. Você pode encontrar comparações detalhadas entre as versões gratuita e paga, classificações precisas e opções imperdíveis projetadas para ajudá-lo a criar rascunhos de músicas impressionantes sem esforço e aumentar significativamente sua produtividade criativa. Explore agora para descobrir a ferramenta perfeita para você!

8 ferramentas
xix.ai
chatbot Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas
Melhores ferramentas de treinamento de conversação com IA para prática de entrevistas

As melhores ferramentas de treinamento de conversação com IA mais recentes e altamente avaliadas para 2026, ideais para prática de entrevistas, estão disponíveis no XIX.AI! Esta coleção selecionada apresenta ferramentas poderosas e transformadoras, submetidas a rigorosos testes do mundo real para fornecer feedback preciso. Você encontrará uma comparação entre opções gratuitas e pagas, além de classificações detalhadas, para ajudá-lo a escolher a opção imperdível que aumenta sua confiança e habilidades. Explore agora para descobrir a ferramenta perfeita para o sucesso nas entrevistas!

12 ferramentas
xix.ai
Design e Arte As melhores ferramentas de transferência de estilo com IA para experimentos criativos
As melhores ferramentas de transferência de estilo com IA para experimentos criativos

As melhores e mais bem avaliadas ferramentas de transferência de estilo com IA de 2026 para experimentos criativos! A XIX.AI selecionou uma coleção poderosa e revolucionária de ferramentas imperdíveis, que oferecem resultados excepcionais por meio de testes reais e classificações rigorosas. Essas soluções de ponta ajudam os profissionais criativos a aumentar significativamente a produtividade, acelerando a criação de conteúdo e revelando possibilidades criativas infinitas. Explore agora para descobrir a ferramenta perfeita para você e comece a criar hoje mesmo!

9 ferramentas
xix.ai
Comentários (11)
0/500
EricJohnson
EricJohnson 30 de Agosto de 2026 à30 13:00:30 WEST

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 8 de Abril de 2026 à57 19:00:57 WEST

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 4 de Abril de 2026 à41 17:00:41 WEST

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 12 de Outubro de 2025 à38 03:30:38 WEST

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 13 de Agosto de 2025 à59 12:00:59 WEST

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 23 de Julho de 2025 à29 05:59:29 WEST

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR