opción
Hogar
Noticias
El ex Deepseeker y los colaboradores lanzan un nuevo método para capacitar a los agentes de IA confiables: Ragen

El ex Deepseeker y los colaboradores lanzan un nuevo método para capacitar a los agentes de IA confiables: Ragen

4 de mayo de 2025
276

El ex Deepseeker y los colaboradores lanzan un nuevo método para capacitar a los agentes de IA confiables: Ragen

El año de los agentes de IA: Una mirada más cercana a las expectativas y realidades de 2025

2025 fue anunciado por muchos expertos como el año en que los agentes de IA—sistemas de IA especializados impulsados por modelos de lenguaje y multimodales avanzados de empresas como OpenAI, Anthropic, Google y DeepSeek—tomarían finalmente el centro del escenario. Sin embargo, según una reciente encuesta de VentureBeat en la red social X, la mayoría de los agentes de IA aún languidecen en etapas experimentales, atrapados en una especie de limbo corporativo.

Pero hay un destello de esperanza en el horizonte. Un esfuerzo colaborativo de investigadores de la Universidad de Northwestern, Microsoft, Stanford y la Universidad de Washington, incluyendo a Zihan Wang, un exinvestigador de DeepSeek que ahora cursa un doctorado en ciencias de la computación en Northwestern, ha presentado RAGEN. Este nuevo sistema busca entrenar y evaluar agentes de IA para hacerlos más confiables y adaptables para uso empresarial en el mundo real.

RAGEN: Un nuevo enfoque para entrenar agentes de IA

A diferencia de tareas estáticas como resolver matemáticas o generar código, RAGEN se centra en interacciones dinámicas de múltiples turnos donde los agentes necesitan adaptarse, recordar y razonar en medio de la incertidumbre. El sistema se basa en un marco de aprendizaje por refuerzo (RL) personalizado llamado StarPO (Optimización de Políticas de Estado-Pensamiento-Acciones-Recompensa), que enfatiza el aprendizaje a través de la experiencia en lugar de la memorización mecánica. StarPO analiza secuencias completas de toma de decisiones, no solo respuestas de un solo paso.

StarPO opera en dos fases: una etapa de despliegue donde el LLM genera secuencias de interacción completas guiadas por el razonamiento, y una etapa de actualización donde el modelo se optimiza utilizando recompensas acumulativas normalizadas. Este enfoque ofrece un ciclo de aprendizaje más estable e interpretable en comparación con los métodos tradicionales de optimización de políticas.

Los investigadores probaron este marco utilizando versiones ajustadas de los modelos Qwen de Alibaba, específicamente Qwen 1.5 y Qwen 2.5, elegidos por sus pesos abiertos y fuertes capacidades de seguimiento de instrucciones. Esta elección facilitó la reproducibilidad y comparaciones consistentes de referencia en tareas simbólicas.

La trampa del eco: Un desafío en el aprendizaje por refuerzo

Zihan Wang destacó un problema crítico en el entrenamiento de RL en un hilo ampliamente compartido en X: *¿Por qué tu entrenamiento de RL siempre colapsa?* El equipo identificó que, aunque los agentes de LLM inicialmente producen respuestas bien razonadas, los sistemas de RL a menudo recompensan atajos, lo que lleva a comportamientos repetitivos que degradan el rendimiento—un fenómeno que denominaron la "Trampa del Eco".

Esta regresión es alimentada por bucles de retroalimentación donde ciertas frases o estrategias obtienen altas recompensas al principio, fomentando su sobreuso y frenando la exploración. Los síntomas son claros: caídas en la varianza de las recompensas, picos en los gradientes y rastros de razonamiento que desaparecen.

Entornos de prueba de RAGEN

Para estudiar estos comportamientos en un entorno controlado, RAGEN evalúa agentes en tres entornos simbólicos:

  • Bandit: Una tarea estocástica de un solo turno que prueba el razonamiento simbólico de riesgo-recompensa.
  • Sokoban: Un rompecabezas determinista de múltiples turnos que involucra decisiones irreversibles.
  • Frozen Lake: Una tarea estocástica de múltiples turnos que requiere planificación adaptativa.

Cada entorno está diseñado para minimizar prejuicios del mundo real y centrarse únicamente en las estrategias de toma de decisiones desarrolladas durante el entrenamiento. Por ejemplo, en el entorno Bandit, los agentes deben razonar simbólicamente sobre los brazos Dragón y Fénix que representan diferentes distribuciones de recompensas, interpretándolos como "fuerza" y "esperanza" para predecir resultados.

Estabilizando el aprendizaje por refuerzo con StarPO-S

Para combatir el colapso del entrenamiento, los investigadores presentaron StarPO-S, una versión estabilizada del marco original. StarPO-S incluye tres intervenciones clave:

  1. Filtrado de despliegue basado en incertidumbre: Priorizando despliegues donde el agente muestra incertidumbre en los resultados.
  2. Eliminación de la penalización KL: Permitiendo que el modelo se desvíe más libremente de su política original y explore nuevos comportamientos.
  3. Recorte asimétrico de PPO: Ampliando más las trayectorias de alta recompensa que las de baja recompensa para impulsar el aprendizaje.

Estos cambios ayudan a retrasar o eliminar el colapso del entrenamiento y mejoran el rendimiento en las tres tareas. Como dijo Wang, "StarPO-S… funciona en las 3 tareas. Alivia el colapso. Mejor recompensa."

¿Qué hace un buen modelo de IA agentivo?

El éxito del entrenamiento de RL depende no solo de la arquitectura, sino también de la calidad de los datos generados por los agentes. El equipo identificó tres dimensiones cruciales que impactan significativamente el entrenamiento:

  • Diversidad de tareas: Exponer el modelo a una amplia gama de escenarios iniciales mejora la generalización.
  • Granularidad de interacción: Permitir múltiples acciones por turno permite una planificación más significativa.
  • Frescura de los despliegues: Mantener los datos de entrenamiento alineados con la política actual del modelo evita señales de aprendizaje obsoletas.

Estos factores contribuyen a un proceso de entrenamiento más estable y efectivo. Un sitio de demostración interactivo en Github visualiza los despliegues de agentes como turnos de diálogo completos, incluyendo no solo acciones, sino también el proceso de pensamiento paso a paso que las precede. Por ejemplo, al resolver un problema matemático, un agente podría primero "pensar" en aislar una variable antes de enviar una respuesta como "x = 5". Estos pensamientos intermedios son visibles y rastreables, añadiendo transparencia a cómo los agentes toman decisiones.

Cuando el razonamiento se agota

Aunque el razonamiento explícito mejora el rendimiento en tareas simples de un solo turno como Bandit, tiende a decaer durante el entrenamiento de múltiples turnos. A pesar de usar prompts estructurados y tokens, los rastros de razonamiento a menudo se reducen o desaparecen a menos que se recompensen directamente. Esto resalta una limitación en cómo se diseñan típicamente las recompensas: centrarse en la finalización de tareas puede descuidar la calidad del proceso detrás de ellas. El equipo experimentó con penalizaciones basadas en formato para fomentar un razonamiento mejor estructurado, pero reconoce que probablemente se necesita un modelado de recompensas más refinado.

Herramientas abiertas y direcciones futuras

RAGEN, junto con sus marcos StarPO y StarPO-S, está ahora disponible como un proyecto de código abierto en https://github.com/RAGEN-AI/RAGEN. Sin embargo, al momento de escribir, no se lista ninguna licencia explícita en el repositorio de GitHub, lo que puede limitar su uso o redistribución por parte de otros.

El sistema proporciona una base valiosa para aquellos interesados en desarrollar agentes de IA que no solo completen tareas, sino que también piensen, planifiquen y evolucionen. A medida que la IA avanza hacia una mayor autonomía, proyectos como RAGEN ayudan a iluminar lo que se necesita para entrenar modelos que aprendan de las consecuencias de sus propias acciones.

Preguntas pendientes para la adopción empresarial en el mundo real

Aunque el artículo de RAGEN ofrece una hoja de ruta técnica detallada, varias preguntas prácticas persisten para aquellos que buscan aplicar estos métodos en entornos empresariales. Por ejemplo, ¿cuán transferible es el enfoque de RAGEN más allá de tareas simbólicas estilizadas? ¿Necesitarían las empresas diseñar entornos y funciones de recompensa completamente nuevos para usar este sistema en flujos de trabajo como el procesamiento de facturas o el soporte al cliente?

Wang, en un mensaje directo a VentureBeat en X, sugirió que mejorar la diversidad de tareas podría ayudar, ya que las tareas de juego actuales solo tienen representaciones de cuadrícula similares pero carecen de información semántica. También expresó optimismo sobre las empresas diseñando sus propios ejercicios de entrenamiento para agentes de IA usando RAGEN, señalando que el enlace de GitHub proporciona una introducción simple para agregar nuevos entornos.

Otro aspecto crítico es la escalabilidad. Incluso con las mejoras proporcionadas por StarPO-S, el artículo reconoce que el entrenamiento aún colapsa eventualmente en horizontes más largos. Esto plantea la pregunta: ¿existe un camino teórico o práctico para sostener el razonamiento en secuencias de tareas abiertas o en constante evolución?

Al momento de escribir, no se lista ninguna licencia explícita en el repositorio o documentación de RAGEN en GitHub, dejando preguntas abiertas sobre los derechos de uso. No obstante, RAGEN destaca no solo como una contribución técnica, sino como un paso conceptual hacia agentes de IA más autónomos y capaces de razonar. Si se convertirá en parte de la pila de IA empresarial aún está por verse, pero sus ideas sobre la dinámica de aprendizaje de agentes ya están ayudando a redefinir la frontera del entrenamiento de LLM.

Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
La startup de generación de vídeos PixVerse recauda 439 millones de dólares y su valoración supera los 2.000 millones de dólares La startup de generación de vídeos PixVerse recauda 439 millones de dólares y su valoración supera los 2.000 millones de dólares PixVerse, una startup dedicada a la generación de vídeos con sede en Singapur, ha anunciado hoy el cierre de la ampliación de su ronda de financiación de la Serie C, en la que ha recaudado un total de
Normativa china sobre los asistentes de IA: el verdadero objetivo de Pekín Normativa china sobre los asistentes de IA: el verdadero objetivo de Pekín El concepto de un compañero de IA puede parecer distópico, pero se ha convertido en un tema recurrente en los debates más amplios sobre los riesgos de la IA generativa. Básicamente, se refiere a un ag
Recomendaciones de temas especiales relacionados
chatbot Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas
Mejores herramientas de entrenamiento de conversación con IA para practicar entrevistas

¡Las mejores herramientas de entrenamiento de conversación con IA para prácticas de entrevistas más recientes y mejor valoradas de 2026 ya están disponibles en XIX.AI! Esta colección seleccionada incluye herramientas poderosas y transformadoras que han pasado por rigurosas pruebas en el mundo real para ofrecer retroalimentación precisa. Encontrarás una comparación entre opciones gratuitas y de pago, así como clasificaciones detalladas para ayudarte a elegir la opción imprescindible que aumente tu confianza y habilidades. ¡Explora ahora para descubrir tu herramienta perfecta para el éxito en las entrevistas!

12 herramientas
xix.ai
Diseño y Arte Las mejores herramientas de transferencia de estilos con IA para experimentos creativos
Las mejores herramientas de transferencia de estilos con IA para experimentos creativos

¡Las mejores herramientas de transferencia de estilo con IA de 2026, mejor valoradas para experimentos creativos! XIX.AI ha seleccionado una colección de herramientas potentes y revolucionarias que no te puedes perder, capaces de ofrecer resultados excepcionales según pruebas reales y clasificaciones rigurosas. Estas soluciones de primera categoría ayudan a los creativos a aumentar significativamente su productividad, acelerando la creación de contenidos y abriendo un sinfín de posibilidades creativas. ¡Explora ahora mismo para descubrir tu herramienta perfecta y empieza a crear hoy mismo!

9 herramientas
xix.ai
Creación de cómics Las mejores herramientas de burbujas de diálogo con IA para la narración visual
Las mejores herramientas de burbujas de diálogo con IA para la narración visual

¡Ya están aquí, en XIX.AI, las mejores herramientas de 2026 con las mejores valoraciones para crear bocadillos de diálogo con IA y contar historias visuales! Esta selección incluye potentes herramientas revolucionarias que ayudan a los creadores a aumentar su productividad y superar los bloqueos creativos. Consulta una comparación entre las versiones gratuitas y de pago, echa un vistazo a las pruebas en condiciones reales y revisa las últimas clasificaciones para encontrar las soluciones imprescindibles, perfectas para crear narrativas visuales cautivadoras. ¡Explora ahora mismo y descubre tu herramienta ideal!

10 herramientas
xix.ai
Asistente de reuniones Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento
Las mejores herramientas de resumen de reuniones con IA: realiza un seguimiento claro de las decisiones y las acciones de seguimiento

Las mejores herramientas de resumen de reuniones con IA de 2026, mejor valoradas para un seguimiento claro de las decisiones y un seguimiento posterior sin esfuerzo. Esta lista seleccionada presenta soluciones potentes y revolucionarias que aumentan drásticamente la productividad al automatizar las notas de las reuniones, identificar las acciones clave y agilizar la coordinación del equipo en todos los proyectos. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones actualizadas semanalmente, para ayudarte a encontrar la herramienta perfecta. ¡Explora ahora mismo y aprovecha las ventajas de la IA!

9 herramientas
xix.ai
Análisis de datos Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente
Mejores herramientas de limpieza de datos con IA: corrige valores faltantes y duplicados rápidamente

2026: Las mejores herramientas de limpieza de datos basadas en IA, mejor calificadas y más actualizadas, para corregir rápidamente valores faltantes y duplicados. Esta lista cuidadosamente seleccionada presenta soluciones potentes que transforman el trabajo y aumentan significativamente la productividad. Cada opción ha sido sometida a pruebas rigurosas en entornos reales para garantizar su fiabilidad. Obtenga una comparación gratuita entre las opciones gratuitas y de pago y descubra la herramienta imprescindible que mejor se adapte a sus necesidades. Explore ahora en XIX.AI para darle un vantaje con la inteligencia artificial.

11 herramientas
xix.ai
Diseño y Arte Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales
Mejores herramientas de IA para la ideación creativa de artistas: superar los bloqueos visuales

2026 Últimas Mejores Herramientas de Ideación Creativa con IA Mejor Valoradas para Artistas son seleccionadas por XIX.AI para ayudar a los creadores a superar los bloqueos visuales y potenciar la creatividad al instante. Estas poderosas herramientas que cambian las reglas del juego ofrecen pruebas en el mundo real, una comparación detallada entre versiones gratuitas y de pago, y clasificaciones actualizadas semanalmente. Descubre tu herramienta perfecta para acelerar la creación de contenido y desbloquear tu ventaja con IA hoy mismo. ¡Explora ahora!

14 herramientas
xix.ai
comentario (11)
0/500
EricJohnson
EricJohnson 30 de agosto de 2026 14:00:30 GMT+02:00

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 8 de abril de 2026 20:00:57 GMT+02:00

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 4 de abril de 2026 18:00:41 GMT+02:00

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 12 de octubre de 2025 04:30:38 GMT+02:00

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 13 de agosto de 2025 13:00:59 GMT+02:00

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 23 de julio de 2025 06:59:29 GMT+02:00

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR