Lar
Por que os Agentes Esquecem e Saiem do Caminho em Tarefas Longas: AWS, Claude Code e Manus Desvendam Quatro Estruturas

Os modelos de linguagem de grande porte frequentemente perdem o foco durante operações prolongadas, desviando-se de seus objetivos originais — um desafio persistente no setor de agentes inteligentes. O problema geralmente não decorre do próprio modelo, mas do framework de execução que o envolve. Um guia de design recente da AWS para agentes de programação em nuvem destaca isso claramente: agentes rasos sofrem com transbordamento de contexto, perdem o foco durante ciclos longos e falham ao manter o estado. Abordar isso requer otimizar o sistema de suporte (harness), que gerencia todas as operações externas ao modelo central.
Uma revisão abrangente dos principais frameworks elucidou essa camada crítica. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex e Amazon Bedrock AgentCore utilizam cada um quatro mecanismos-chave — orçamentação de contexto, compressão, gerenciamento de estado da tarefa e memória entre sessões — para converter loops básicos em agentes robustos capazes de lidar com tarefas complexas e de longa duração.
A descoberta mais contra-intuitiva é que simplesmente ampliar a janela de contexto não resolve o problema. O relatório Context Rot da Chroma, que avaliou 18 grandes modelos, revelou que, mesmo em tarefas de recuperação simples, a confiabilidade do modelo diminui à medida que o comprimento da entrada aumenta. A Anthropic explica que os mecanismos de atenção geram relações de par quadrático para n tokens, o que significa que cada token adicional consome uma parte finita do orçamento de atenção. O contexto é um recurso esgotável, não um recipiente infinito. A Manus observou ainda que tarefas típicas envolvem aproximadamente 50 chamadas de ferramenta, com uma relação entrada-saída próxima de 100:1. Consequentemente, as instruções iniciais gradualmente se deslocam para o centro da janela — precisamente onde a degradação da memória é mais pronunciada.
O primeiro motor foca na orçamentação de contexto e no descarregamento (offloading). Os Deep Agents impõem duas regras estritas: se uma ferramenta retornar mais de 20.000 tokens, os dados são gravados no sistema de arquivos, retendo apenas o caminho do arquivo e um pré-visualização de 10 linhas; quando o contexto da sessão excede 85% da capacidade da janela, os comandos de edição mais antigos são substituídos por ponteiros. O Claude Code aplica lógica semelhante antes do carregamento, limitando o uso de memória a 200 linhas ou 25KB, com o modo de ferramenta MCP definido como listar nomes e buscar detalhes sob demanda. A implementação do AWS AgentCore é ainda mais rigorosa: o coordenador gera três sub-agentes de navegador em paralelo, cada um operando dentro de sua própria MicroVM. O sub-agente de análise recebe apenas resultados estruturados, reduzindo a duração esperada para 4–6 minutos, enquanto a execução serial pode levar até três vezes mais tempo.
O segundo motor lida com a compressão. Quando o descarregamento é insuficiente, o framework resume a conversa próxima aos limites de capacidade e reinicia o processo. O prompt de compressão do Claude Code preside decisões arquiteturais e bugs não resolvidos, enquanto descarta saídas redundantes. Após a compressão, ele relê os cinco arquivos modificados mais recentes e reinjeta o texto de habilidade relevante. Ele também arquivada o registro original completo em disco, garantindo que os fatos perdidos durante a sumarização possam ser recuperados posteriormente. Os Deep Agents tratam a preservação do objetivo como um recurso estrutural, organizando documentos de resumo em intenção, saídas geradas e próximos passos. A compressão também foi integrada ao nível da API: a API de Respostas da OpenAI oferece compressão do lado do servidor via compact\_threshold, que o Codex utiliza para tarefas de programação longas. A plataforma Claude fornece configurações de compressão personalizáveis com instruções graváveis.
O terceiro motor gerencia o estado da tarefa e lembretes persistentes. A Manus emprega uma abordagem direta: criar um arquivo todo.md e marcar os itens passo a passo, incorporando efetivamente o objetivo ao final do contexto para combater o fato de estar “submerso no meio”. No entanto, este método não é universalmente eficaz: os Deep Agents tornaram seu middleware de lista de tarefas opcional na versão 0.7 (lançada em julho de 2026), pois as avaliações mostraram que desativá-lo melhorou ligeiramente as pontuações de recompensa e reduziu os custos. O LangChain ainda recomenda reativar esse recurso para tarefas longas, modelos mais fracos e interfaces que exigem visibilidade do progresso.
O quarto motor habilita a memória entre sessões. O Claude Code recarrega o CLAUDE.md e a memória automática após cada ciclo de compressão. O AgentCore Memory executa estratégias de extração em segundo plano, permitindo que o coordenador recall insights anteriores diretamente, em vez de reanalisá-los. No entanto, pesquisas da ETH Zurich sugerem cautela: arquivos de contexto como AGENTS.md tipicamente não melhoram as taxas de sucesso, mas aumentam os custos de raciocínio em 20% a 23%, impondo um imposto fixo no orçamento de atenção a cada recarga. Portanto, o Claude Code aconselha manter o CLAUDE.md abaixo de 200 linhas.
O estudo conclui que verificar se um framework realmente “compreende o objetivo” requer testes de compressão forçada. O modo de falha mais perigoso ocorre quando um agente solicita imediatamente esclarecimentos após uma sumarização ou declara incorretamente que uma tarefa está completa. Em última análise, manter um agente no caminho certo durante jornadas longas depende não do tamanho do modelo, mas da precisão desses motores de suporte.
Artigo relacionado
O setor de IA da China registra avanços em toda a cadeia, acelerando a Lei de Inteligência Artificial
As downloads globais de modelos de linguagem grandes domésticos ultrapassaram 10 bilhões, com modelos de código aberto de parâmetros trilionários surgindo regularmente. O setor de inteligência artificial da China está alcançando avanços abrangentes e
A Zhiyuan Innovation revela o Data Acquisition 2.0 para impulsionar robôs mais inteligentes
À medida que o setor de inteligência artificial se expande rapidamente, permitir que os robôs compreendam e se adaptem com precisão a ambientes complexos do mundo real tornou-se uma prioridade crítica da indústria. Durante a Conferência de Ecossistem
Snapchat oferece recompensas para conteúdo totalmente gerado por IA no Spotlight
O Snapchat está tomando uma postura firme contra conteúdo gerado por inteligência artificial de baixa qualidade. A plataforma de mídia social deixará de promover vídeos totalmente criados por IA, priorizando o conteúdo feito por seres humanos.Na sex
Recomendações de tópicos especiais relacionados
Comentários (0)

Os modelos de linguagem de grande porte frequentemente perdem o foco durante operações prolongadas, desviando-se de seus objetivos originais — um desafio persistente no setor de agentes inteligentes. O problema geralmente não decorre do próprio modelo, mas do framework de execução que o envolve. Um guia de design recente da AWS para agentes de programação em nuvem destaca isso claramente: agentes rasos sofrem com transbordamento de contexto, perdem o foco durante ciclos longos e falham ao manter o estado. Abordar isso requer otimizar o sistema de suporte (harness), que gerencia todas as operações externas ao modelo central.
Uma revisão abrangente dos principais frameworks elucidou essa camada crítica. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex e Amazon Bedrock AgentCore utilizam cada um quatro mecanismos-chave — orçamentação de contexto, compressão, gerenciamento de estado da tarefa e memória entre sessões — para converter loops básicos em agentes robustos capazes de lidar com tarefas complexas e de longa duração.
A descoberta mais contra-intuitiva é que simplesmente ampliar a janela de contexto não resolve o problema. O relatório Context Rot da Chroma, que avaliou 18 grandes modelos, revelou que, mesmo em tarefas de recuperação simples, a confiabilidade do modelo diminui à medida que o comprimento da entrada aumenta. A Anthropic explica que os mecanismos de atenção geram relações de par quadrático para n tokens, o que significa que cada token adicional consome uma parte finita do orçamento de atenção. O contexto é um recurso esgotável, não um recipiente infinito. A Manus observou ainda que tarefas típicas envolvem aproximadamente 50 chamadas de ferramenta, com uma relação entrada-saída próxima de 100:1. Consequentemente, as instruções iniciais gradualmente se deslocam para o centro da janela — precisamente onde a degradação da memória é mais pronunciada.
O primeiro motor foca na orçamentação de contexto e no descarregamento (offloading). Os Deep Agents impõem duas regras estritas: se uma ferramenta retornar mais de 20.000 tokens, os dados são gravados no sistema de arquivos, retendo apenas o caminho do arquivo e um pré-visualização de 10 linhas; quando o contexto da sessão excede 85% da capacidade da janela, os comandos de edição mais antigos são substituídos por ponteiros. O Claude Code aplica lógica semelhante antes do carregamento, limitando o uso de memória a 200 linhas ou 25KB, com o modo de ferramenta MCP definido como listar nomes e buscar detalhes sob demanda. A implementação do AWS AgentCore é ainda mais rigorosa: o coordenador gera três sub-agentes de navegador em paralelo, cada um operando dentro de sua própria MicroVM. O sub-agente de análise recebe apenas resultados estruturados, reduzindo a duração esperada para 4–6 minutos, enquanto a execução serial pode levar até três vezes mais tempo.
O segundo motor lida com a compressão. Quando o descarregamento é insuficiente, o framework resume a conversa próxima aos limites de capacidade e reinicia o processo. O prompt de compressão do Claude Code preside decisões arquiteturais e bugs não resolvidos, enquanto descarta saídas redundantes. Após a compressão, ele relê os cinco arquivos modificados mais recentes e reinjeta o texto de habilidade relevante. Ele também arquivada o registro original completo em disco, garantindo que os fatos perdidos durante a sumarização possam ser recuperados posteriormente. Os Deep Agents tratam a preservação do objetivo como um recurso estrutural, organizando documentos de resumo em intenção, saídas geradas e próximos passos. A compressão também foi integrada ao nível da API: a API de Respostas da OpenAI oferece compressão do lado do servidor via compact\_threshold, que o Codex utiliza para tarefas de programação longas. A plataforma Claude fornece configurações de compressão personalizáveis com instruções graváveis.
O terceiro motor gerencia o estado da tarefa e lembretes persistentes. A Manus emprega uma abordagem direta: criar um arquivo todo.md e marcar os itens passo a passo, incorporando efetivamente o objetivo ao final do contexto para combater o fato de estar “submerso no meio”. No entanto, este método não é universalmente eficaz: os Deep Agents tornaram seu middleware de lista de tarefas opcional na versão 0.7 (lançada em julho de 2026), pois as avaliações mostraram que desativá-lo melhorou ligeiramente as pontuações de recompensa e reduziu os custos. O LangChain ainda recomenda reativar esse recurso para tarefas longas, modelos mais fracos e interfaces que exigem visibilidade do progresso.
O quarto motor habilita a memória entre sessões. O Claude Code recarrega o CLAUDE.md e a memória automática após cada ciclo de compressão. O AgentCore Memory executa estratégias de extração em segundo plano, permitindo que o coordenador recall insights anteriores diretamente, em vez de reanalisá-los. No entanto, pesquisas da ETH Zurich sugerem cautela: arquivos de contexto como AGENTS.md tipicamente não melhoram as taxas de sucesso, mas aumentam os custos de raciocínio em 20% a 23%, impondo um imposto fixo no orçamento de atenção a cada recarga. Portanto, o Claude Code aconselha manter o CLAUDE.md abaixo de 200 linhas.
O estudo conclui que verificar se um framework realmente “compreende o objetivo” requer testes de compressão forçada. O modo de falha mais perigoso ocorre quando um agente solicita imediatamente esclarecimentos após uma sumarização ou declara incorretamente que uma tarefa está completa. Em última análise, manter um agente no caminho certo durante jornadas longas depende não do tamanho do modelo, mas da precisão desses motores de suporte.
O setor de IA da China registra avanços em toda a cadeia, acelerando a Lei de Inteligência Artificial
As downloads globais de modelos de linguagem grandes domésticos ultrapassaram 10 bilhões, com modelos de código aberto de parâmetros trilionários surgindo regularmente. O setor de inteligência artificial da China está alcançando avanços abrangentes e
A Zhiyuan Innovation revela o Data Acquisition 2.0 para impulsionar robôs mais inteligentes
À medida que o setor de inteligência artificial se expande rapidamente, permitir que os robôs compreendam e se adaptem com precisão a ambientes complexos do mundo real tornou-se uma prioridade crítica da indústria. Durante a Conferência de Ecossistem
Snapchat oferece recompensas para conteúdo totalmente gerado por IA no Spotlight
O Snapchat está tomando uma postura firme contra conteúdo gerado por inteligência artificial de baixa qualidade. A plataforma de mídia social deixará de promover vídeos totalmente criados por IA, priorizando o conteúdo feito por seres humanos.Na sex











