Hogar
Por qué los agentes olvidan y se desvían en tareas largas: AWS, Claude Code y Manus desglosan cuatro marcos

Los modelos de lenguaje grandes pierden con frecuencia el enfoque durante operaciones prolongadas, desviándose de sus objetivos originales, un desafío persistente en el sector de los agentes inteligentes. El problema a menudo no proviene del modelo en sí, sino del marco de ejecución circundante. Una guía de diseño reciente de AWS para agentes de programación en la nube destaca esto claramente: los agentes superficiales sufren desbordamiento de contexto, pierden el enfoque durante ciclos largos y no logran mantener el estado. Abordar esto requiere optimizar el arnés, que gestiona todas las operaciones externas al modelo central.
Una revisión exhaustiva de los marcos líderes ha arrojado luz sobre esta capa crítica. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex y Amazon Bedrock AgentCore utilizan cada uno cuatro mecanismos clave: presupuestación de contexto, compresión, gestión del estado de la tarea y memoria entre sesiones, para convertir bucles básicos en agentes robustos capaces de manejar tareas complejas y de larga duración.
El hallazgo más contraintuitivo es que simplemente ampliar la ventana de contexto no resuelve el problema. El informe Context Rot de Chroma, que evaluó 18 modelos grandes, reveló que incluso en tareas de recuperación sencillas, la fiabilidad del modelo disminuye a medida que aumenta la longitud de la entrada. Anthropic explica que los mecanismos de atención generan relaciones por pares cuadráticas para n tokens, lo que significa que cada token adicional consume una parte finita del presupuesto de atención. El contexto es un recurso agotable, no un contenedor infinito. Manus señaló además que las tareas típicas implican aproximadamente 50 llamadas a herramientas, con una proporción de entrada a salida cercana a 100:1. En consecuencia, las instrucciones iniciales se desplazan gradualmente hacia el centro de la ventana, precisamente donde la degradación de la memoria es más pronunciada.
El primer motor se centra en la presupuestación de contexto y la descarga. Deep Agents aplica dos reglas estrictas: si una herramienta devuelve más de 20.000 tokens, los datos se escriben en el sistema de archivos, conservando solo la ruta del archivo y una vista previa de 10 líneas; cuando el contexto de la sesión supera el 85% de la capacidad de la ventana, los comandos de edición más antiguos se reemplazan por punteros. Claude Code aplica una lógica similar antes de la carga, limitando el uso de memoria a 200 líneas o 25 KB, con el modo de herramienta MCP que por defecto enumera los nombres y obtiene los detalles bajo demanda. La implementación de AWS AgentCore es aún más rigurosa: el coordinador genera tres subagentes de navegador en paralelo, cada uno operando dentro de su propia MicroVM. El subagente de análisis recibe solo resultados estructurados, reduciendo la duración esperada a 4-6 minutos, mientras que la ejecución en serie puede tardar hasta tres veces más.
El segundo motor se encarga de la compresión. Cuando la descarga es insuficiente, el marco resume la conversación cerca de los límites de capacidad y reinicia el proceso. La instrucción de compresión de Claude Code preserva las decisiones arquitectónicas y los errores no resueltos, mientras descarta las salidas redundantes. Tras la compresión, vuelve a leer los cinco últimos archivos modificados y reintroduce el texto de habilidad relevante. También archiva el registro original completo en el disco, asegurando que los hechos perdidos durante la resúmen puedan recuperarse más tarde. Deep Agents trata la preservación del objetivo como una característica estructural, organizando los documentos de resumen en intención, salidas generadas y próximos pasos. La compresión también se ha integrado a nivel de API: la API de Respuestas de OpenAI ofrece compresión en el servidor mediante compact\_threshold, que Codex aprovecha para tareas de programación largas. La plataforma Claude proporciona configuraciones de compresión personalizables con instrucciones editables.
El tercer motor gestiona el estado de la tarea y los recordatorios persistentes. Manus emplea un enfoque sencillo: crear un archivo todo.md y marcar los elementos paso a paso, incrustando efectivamente el objetivo al final del contexto para contrarrestar el hecho de estar “sumergido en el medio”. Sin embargo, este método no es universalmente efectivo: Deep Agents hizo opcional su middleware de tareas pendientes en la versión 0.7 (lanzada en julio de 2026), ya que las evaluaciones mostraron que desactivarlo mejoró ligeramente las puntuaciones de recompensa y redujo los costes. LangChain sigue recomendando volver a habilitar esta función para tareas largas, modelos más débiles e interfaces que requieren visibilidad del progreso.
El cuarto motor habilita la memoria entre sesiones. Claude Code vuelve a cargar CLAUDE.md y la memoria automática después de cada ciclo de compresión. AgentCore Memory ejecuta estrategias de extracción en segundo plano, permitiendo que el coordinador recuerde las percepciones anteriores directamente en lugar de volver a analizarlas. Sin embargo, la investigación de la ETH Zurich sugiere precaución: los archivos de contexto como AGENTS.md generalmente no mejoran las tasas de éxito, sino que aumentan los costes de razonamiento entre un 20 % y un 23 %, imponiendo un impuesto fijo al presupuesto de atención con cada recarga. Por lo tanto, Claude Code aconseja mantener CLAUDE.md por debajo de 200 líneas.
El estudio concluye que verificar si un marco realmente “entiende el objetivo” requiere pruebas de compresión forzada. El modo de fallo más peligroso ocurre cuando un agente solicita inmediatamente aclaraciones después de un resumen o declara incorrectamente que una tarea está completa. En última instancia, mantener a un agente en el camino correcto durante viajes largos depende no del tamaño del modelo, sino de la precisión de estos motores de soporte.
Artículo relacionado
La plataforma de IA Qwen amplía su matriz de modelos con el lanzamiento oficial de GLM-5.3 y DeepSeek-V4-Pro
La plataforma de inteligencia artificial Qwen de Alibaba Cloud (MaaS) ha ampliado recientemente su matriz de servicios de modelos, integrando el modelo grande insignia GLM-5.3 de Zhipu y el lanzamiento oficial de DeepSeek-V4-Pro. Los servicios API co
El sector de inteligencia artificial de China registra avances en toda la cadena, acelerando la Ley de Inteligencia Artificial
Las descargas globales de modelos de lenguaje grandes nacionales han superado los 10.000 millones, con la aparición regular de modelos de código abierto con parámetros en el orden de billones. El sector de la inteligencia artificial de China está log
Zhiyuan Innovation presenta Data Acquisition 2.0 para impulsar robots más inteligentes
A medida que el sector de la inteligencia artificial se expande rápidamente, permitir que los robots comprendan y se adapten con precisión a entornos del mundo real complejos se ha convertido en una prioridad crítica de la industria. Durante la Confe
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Los modelos de lenguaje grandes pierden con frecuencia el enfoque durante operaciones prolongadas, desviándose de sus objetivos originales, un desafío persistente en el sector de los agentes inteligentes. El problema a menudo no proviene del modelo en sí, sino del marco de ejecución circundante. Una guía de diseño reciente de AWS para agentes de programación en la nube destaca esto claramente: los agentes superficiales sufren desbordamiento de contexto, pierden el enfoque durante ciclos largos y no logran mantener el estado. Abordar esto requiere optimizar el arnés, que gestiona todas las operaciones externas al modelo central.
Una revisión exhaustiva de los marcos líderes ha arrojado luz sobre esta capa crítica. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex y Amazon Bedrock AgentCore utilizan cada uno cuatro mecanismos clave: presupuestación de contexto, compresión, gestión del estado de la tarea y memoria entre sesiones, para convertir bucles básicos en agentes robustos capaces de manejar tareas complejas y de larga duración.
El hallazgo más contraintuitivo es que simplemente ampliar la ventana de contexto no resuelve el problema. El informe Context Rot de Chroma, que evaluó 18 modelos grandes, reveló que incluso en tareas de recuperación sencillas, la fiabilidad del modelo disminuye a medida que aumenta la longitud de la entrada. Anthropic explica que los mecanismos de atención generan relaciones por pares cuadráticas para n tokens, lo que significa que cada token adicional consume una parte finita del presupuesto de atención. El contexto es un recurso agotable, no un contenedor infinito. Manus señaló además que las tareas típicas implican aproximadamente 50 llamadas a herramientas, con una proporción de entrada a salida cercana a 100:1. En consecuencia, las instrucciones iniciales se desplazan gradualmente hacia el centro de la ventana, precisamente donde la degradación de la memoria es más pronunciada.
El primer motor se centra en la presupuestación de contexto y la descarga. Deep Agents aplica dos reglas estrictas: si una herramienta devuelve más de 20.000 tokens, los datos se escriben en el sistema de archivos, conservando solo la ruta del archivo y una vista previa de 10 líneas; cuando el contexto de la sesión supera el 85% de la capacidad de la ventana, los comandos de edición más antiguos se reemplazan por punteros. Claude Code aplica una lógica similar antes de la carga, limitando el uso de memoria a 200 líneas o 25 KB, con el modo de herramienta MCP que por defecto enumera los nombres y obtiene los detalles bajo demanda. La implementación de AWS AgentCore es aún más rigurosa: el coordinador genera tres subagentes de navegador en paralelo, cada uno operando dentro de su propia MicroVM. El subagente de análisis recibe solo resultados estructurados, reduciendo la duración esperada a 4-6 minutos, mientras que la ejecución en serie puede tardar hasta tres veces más.
El segundo motor se encarga de la compresión. Cuando la descarga es insuficiente, el marco resume la conversación cerca de los límites de capacidad y reinicia el proceso. La instrucción de compresión de Claude Code preserva las decisiones arquitectónicas y los errores no resueltos, mientras descarta las salidas redundantes. Tras la compresión, vuelve a leer los cinco últimos archivos modificados y reintroduce el texto de habilidad relevante. También archiva el registro original completo en el disco, asegurando que los hechos perdidos durante la resúmen puedan recuperarse más tarde. Deep Agents trata la preservación del objetivo como una característica estructural, organizando los documentos de resumen en intención, salidas generadas y próximos pasos. La compresión también se ha integrado a nivel de API: la API de Respuestas de OpenAI ofrece compresión en el servidor mediante compact\_threshold, que Codex aprovecha para tareas de programación largas. La plataforma Claude proporciona configuraciones de compresión personalizables con instrucciones editables.
El tercer motor gestiona el estado de la tarea y los recordatorios persistentes. Manus emplea un enfoque sencillo: crear un archivo todo.md y marcar los elementos paso a paso, incrustando efectivamente el objetivo al final del contexto para contrarrestar el hecho de estar “sumergido en el medio”. Sin embargo, este método no es universalmente efectivo: Deep Agents hizo opcional su middleware de tareas pendientes en la versión 0.7 (lanzada en julio de 2026), ya que las evaluaciones mostraron que desactivarlo mejoró ligeramente las puntuaciones de recompensa y redujo los costes. LangChain sigue recomendando volver a habilitar esta función para tareas largas, modelos más débiles e interfaces que requieren visibilidad del progreso.
El cuarto motor habilita la memoria entre sesiones. Claude Code vuelve a cargar CLAUDE.md y la memoria automática después de cada ciclo de compresión. AgentCore Memory ejecuta estrategias de extracción en segundo plano, permitiendo que el coordinador recuerde las percepciones anteriores directamente en lugar de volver a analizarlas. Sin embargo, la investigación de la ETH Zurich sugiere precaución: los archivos de contexto como AGENTS.md generalmente no mejoran las tasas de éxito, sino que aumentan los costes de razonamiento entre un 20 % y un 23 %, imponiendo un impuesto fijo al presupuesto de atención con cada recarga. Por lo tanto, Claude Code aconseja mantener CLAUDE.md por debajo de 200 líneas.
El estudio concluye que verificar si un marco realmente “entiende el objetivo” requiere pruebas de compresión forzada. El modo de fallo más peligroso ocurre cuando un agente solicita inmediatamente aclaraciones después de un resumen o declara incorrectamente que una tarea está completa. En última instancia, mantener a un agente en el camino correcto durante viajes largos depende no del tamaño del modelo, sino de la precisión de estos motores de soporte.
La plataforma de IA Qwen amplía su matriz de modelos con el lanzamiento oficial de GLM-5.3 y DeepSeek-V4-Pro
La plataforma de inteligencia artificial Qwen de Alibaba Cloud (MaaS) ha ampliado recientemente su matriz de servicios de modelos, integrando el modelo grande insignia GLM-5.3 de Zhipu y el lanzamiento oficial de DeepSeek-V4-Pro. Los servicios API co
El sector de inteligencia artificial de China registra avances en toda la cadena, acelerando la Ley de Inteligencia Artificial
Las descargas globales de modelos de lenguaje grandes nacionales han superado los 10.000 millones, con la aparición regular de modelos de código abierto con parámetros en el orden de billones. El sector de la inteligencia artificial de China está log
Zhiyuan Innovation presenta Data Acquisition 2.0 para impulsar robots más inteligentes
A medida que el sector de la inteligencia artificial se expande rápidamente, permitir que los robots comprendan y se adapten con precisión a entornos del mundo real complejos se ha convertido en una prioridad crítica de la industria. Durante la Confe











