Дом
Почему агенты забывают и отклоняются от курса при выполнении длительных задач: AWS, Claude Code и Manus раскрывают четыре фреймворка

Большие языковые модели часто теряют фокус во время длительных операций, отклоняясь от первоначальных целей — это постоянная проблема в секторе интеллектуальных агентов. Проблема часто заключается не в самой модели, а в окружающей среде выполнения. Недавнее руководство AWS по проектированию облачных программируемых агентов четко это подчеркивает: поверхностные агенты страдают от переполнения контекста, теряют фокус во время длинных циклов и не способны поддерживать состояние. Решение этой проблемы требует оптимизации оболочки (harness), которая управляет всеми операциями, выходящими за рамки основной модели.
Всесторонний анализ ведущих фреймворков пролил свет на этот критический слой. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex и Amazon Bedrock AgentCore используют четыре ключевых механизма — бюджетирование контекста, сжатие, управление состоянием задач и кросс-сессионную память — для преобразования базовых циклов в надежных агентов, способных выполнять сложные и длительные задачи.
Самым контринтуитивным выводом является то, что простое расширение окна контекста не решает проблему. Отчет Chroma о ротации контекста, в котором оценивались 18 больших моделей, показал, что даже в простых задачах извлечения данных надежность модели снижается по мере увеличения длины входных данных. Anthropic объясняет, что механизмы внимания генерируют квадратичные попарные отношения для n токенов, что означает, что каждый дополнительный токен потребляет конечную часть бюджета внимания. Контекст — это истощаемый ресурс, а не бесконечный контейнер. Manus также отметил, что типичные задачи включают около 50 вызовов инструментов, при этом соотношение входных данных к выходным приближается к 100:1. В результате первоначальные инструкции постепенно смещаются к центру окна — именно там деградация памяти наиболее выражена.
Первый механизм фокусируется на бюджетировании контекста и выгрузке данных. Deep Agents навязывает два строгих правила: если инструмент возвращает более 20 000 токенов, данные записываются в файловую систему, сохраняя только путь к файлу и превью на 10 строк; когда контекст сеанса превышает 85% емкости окна, старые команды редактирования заменяются указателями. Claude Code применяет аналогичную логику перед загрузкой, ограничивая использование памяти 200 строками или 25 КБ, при этом режим инструмента MCP по умолчанию предусматривает перечисление имен и получение деталей по запросу. Реализация AWS AgentCore еще более строгая: координатор запускает три подагента браузера параллельно, каждый из которых работает в своей собственной MicroVM. Анализирующий подагент получает только структурированные результаты, что сокращает ожидаемое время выполнения до 4–6 минут, тогда как последовательное выполнение может занимать до трех раз больше времени.
Второй механизм занимается сжатием. Когда выгрузка данных недостаточна, фреймворк суммирует разговор вблизи пределов емкости и перезапускает процесс. Промпт сжатия Claude Code сохраняет архитектурные решения и неразрешенные ошибки, отбрасывая избыточные выходные данные. После сжатия он заново читает последние пять измененных файлов и повторно внедряет соответствующий текст навыков. Он также архивирует полный оригинальный журнал на диск, обеспечивая возможность извлечения фактов, потерянных во время суммирования, в более поздний период. Deep Agents рассматривает сохранение цели как структурную особенность, организуя документы суммирования по категориям: намерение, сгенерированные выходные данные и следующие шаги. Сжатие также было интегрировано на уровне API: API ответов OpenAI предлагает серверное сжатие через compact\_threshold, которое Codex использует для длительных задач программирования. Платформа Claude предоставляет настраиваемые параметры сжатия с записываемыми инструкциями.
Третий механизм управляет состоянием задачи и постоянными напоминаниями. Manus использует простой подход: создание файла todo.md и последовательное отметку пунктов, эффективно закрепляя цель в конце контекста, чтобы противостоять эффекту «погружения в середину». Однако этот метод не является универсально эффективным: Deep Agents сделал свою middleware для списка дел опциональной в версии 0.7 (выпущенной в июле 2026 года), поскольку оценки показали, что ее отключение немного улучшило показатели вознаграждения и снизило затраты. LangChain по-прежнему рекомендует повторно включать эту функцию для длительных задач, более слабых моделей и интерфейсов, требующих видимости прогресса.
Четвертый механизм обеспечивает кросс-сессионную память. Claude Code перезагружает CLAUDE.md и автоматическую память после каждого цикла сжатия. AgentCore Memory запускает стратегии извлечения в фоновом режиме, позволяя координатору напрямую вспоминать предыдущие выводы, а не переанализировать их. Однако исследования ETH Цюриха предполагают осторожность: файлы контекста, такие как AGENTS.md, обычно не повышают уровень успеха, но увеличивают затраты на рассуждение на 20–23%, накладывая фиксированный налог на бюджет внимания при каждой перезагрузке. Поэтому Claude Code рекомендует держать CLAUDE.md в пределах 200 строк.
Исследование приходит к выводу, что проверка того, действительно ли фреймворк «понимает цель», требует принудительных тестов сжатия. Наиболее опасный режим отказа возникает, когда агент сразу запрашивает разъяснение после суммирования или ошибочно объявляет задачу завершенной. В конечном итоге, удержание агента на правильном пути во время длительных путешествий зависит не от размера модели, а от точности этих вспомогательных механизмов.
Связанная статья
В секторе искусственного интеллекта Китая наблюдаются прорывы по всей цепочке создания стоимости, что ускоряет принятие Закона об искусственном интеллекте
Глобальные загрузки отечественных больших языковых моделей превысили 10 миллиардов, при этом регулярно появляются открытые модели с триллионом параметров. Китайский сектор искусственного интеллекта достигает всесторонних прорывов во всей своей цепочк
Zhiyuan Innovation представляет Data Acquisition 2.0 для создания более интеллектуальных роботов
По мере стремительного расширения сектора искусственного интеллекта способность роботов точно понимать и адаптироваться к сложным условиям реального мира стала критически важным приоритетом отрасли. 25 июня на конференции по экосистеме и запуску прод
Snapchat Drops Rewards for Fully AI-Generated Spotlight Content
Snapchat принимает твёрдую позицию против низкокачественного контента, созданного с помощью искусственного интеллекта. Социальная сеть прекратит продвижение полностью сгенерированных ИИ видео, отдавая приоритет контенту, созданному людьми.В пятницу
Рекомендации по связанным специальным темам
Комментарии (0)

Большие языковые модели часто теряют фокус во время длительных операций, отклоняясь от первоначальных целей — это постоянная проблема в секторе интеллектуальных агентов. Проблема часто заключается не в самой модели, а в окружающей среде выполнения. Недавнее руководство AWS по проектированию облачных программируемых агентов четко это подчеркивает: поверхностные агенты страдают от переполнения контекста, теряют фокус во время длинных циклов и не способны поддерживать состояние. Решение этой проблемы требует оптимизации оболочки (harness), которая управляет всеми операциями, выходящими за рамки основной модели.
Всесторонний анализ ведущих фреймворков пролил свет на этот критический слой. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex и Amazon Bedrock AgentCore используют четыре ключевых механизма — бюджетирование контекста, сжатие, управление состоянием задач и кросс-сессионную память — для преобразования базовых циклов в надежных агентов, способных выполнять сложные и длительные задачи.
Самым контринтуитивным выводом является то, что простое расширение окна контекста не решает проблему. Отчет Chroma о ротации контекста, в котором оценивались 18 больших моделей, показал, что даже в простых задачах извлечения данных надежность модели снижается по мере увеличения длины входных данных. Anthropic объясняет, что механизмы внимания генерируют квадратичные попарные отношения для n токенов, что означает, что каждый дополнительный токен потребляет конечную часть бюджета внимания. Контекст — это истощаемый ресурс, а не бесконечный контейнер. Manus также отметил, что типичные задачи включают около 50 вызовов инструментов, при этом соотношение входных данных к выходным приближается к 100:1. В результате первоначальные инструкции постепенно смещаются к центру окна — именно там деградация памяти наиболее выражена.
Первый механизм фокусируется на бюджетировании контекста и выгрузке данных. Deep Agents навязывает два строгих правила: если инструмент возвращает более 20 000 токенов, данные записываются в файловую систему, сохраняя только путь к файлу и превью на 10 строк; когда контекст сеанса превышает 85% емкости окна, старые команды редактирования заменяются указателями. Claude Code применяет аналогичную логику перед загрузкой, ограничивая использование памяти 200 строками или 25 КБ, при этом режим инструмента MCP по умолчанию предусматривает перечисление имен и получение деталей по запросу. Реализация AWS AgentCore еще более строгая: координатор запускает три подагента браузера параллельно, каждый из которых работает в своей собственной MicroVM. Анализирующий подагент получает только структурированные результаты, что сокращает ожидаемое время выполнения до 4–6 минут, тогда как последовательное выполнение может занимать до трех раз больше времени.
Второй механизм занимается сжатием. Когда выгрузка данных недостаточна, фреймворк суммирует разговор вблизи пределов емкости и перезапускает процесс. Промпт сжатия Claude Code сохраняет архитектурные решения и неразрешенные ошибки, отбрасывая избыточные выходные данные. После сжатия он заново читает последние пять измененных файлов и повторно внедряет соответствующий текст навыков. Он также архивирует полный оригинальный журнал на диск, обеспечивая возможность извлечения фактов, потерянных во время суммирования, в более поздний период. Deep Agents рассматривает сохранение цели как структурную особенность, организуя документы суммирования по категориям: намерение, сгенерированные выходные данные и следующие шаги. Сжатие также было интегрировано на уровне API: API ответов OpenAI предлагает серверное сжатие через compact\_threshold, которое Codex использует для длительных задач программирования. Платформа Claude предоставляет настраиваемые параметры сжатия с записываемыми инструкциями.
Третий механизм управляет состоянием задачи и постоянными напоминаниями. Manus использует простой подход: создание файла todo.md и последовательное отметку пунктов, эффективно закрепляя цель в конце контекста, чтобы противостоять эффекту «погружения в середину». Однако этот метод не является универсально эффективным: Deep Agents сделал свою middleware для списка дел опциональной в версии 0.7 (выпущенной в июле 2026 года), поскольку оценки показали, что ее отключение немного улучшило показатели вознаграждения и снизило затраты. LangChain по-прежнему рекомендует повторно включать эту функцию для длительных задач, более слабых моделей и интерфейсов, требующих видимости прогресса.
Четвертый механизм обеспечивает кросс-сессионную память. Claude Code перезагружает CLAUDE.md и автоматическую память после каждого цикла сжатия. AgentCore Memory запускает стратегии извлечения в фоновом режиме, позволяя координатору напрямую вспоминать предыдущие выводы, а не переанализировать их. Однако исследования ETH Цюриха предполагают осторожность: файлы контекста, такие как AGENTS.md, обычно не повышают уровень успеха, но увеличивают затраты на рассуждение на 20–23%, накладывая фиксированный налог на бюджет внимания при каждой перезагрузке. Поэтому Claude Code рекомендует держать CLAUDE.md в пределах 200 строк.
Исследование приходит к выводу, что проверка того, действительно ли фреймворк «понимает цель», требует принудительных тестов сжатия. Наиболее опасный режим отказа возникает, когда агент сразу запрашивает разъяснение после суммирования или ошибочно объявляет задачу завершенной. В конечном итоге, удержание агента на правильном пути во время длительных путешествий зависит не от размера модели, а от точности этих вспомогательных механизмов.
В секторе искусственного интеллекта Китая наблюдаются прорывы по всей цепочке создания стоимости, что ускоряет принятие Закона об искусственном интеллекте
Глобальные загрузки отечественных больших языковых моделей превысили 10 миллиардов, при этом регулярно появляются открытые модели с триллионом параметров. Китайский сектор искусственного интеллекта достигает всесторонних прорывов во всей своей цепочк
Zhiyuan Innovation представляет Data Acquisition 2.0 для создания более интеллектуальных роботов
По мере стремительного расширения сектора искусственного интеллекта способность роботов точно понимать и адаптироваться к сложным условиям реального мира стала критически важным приоритетом отрасли. 25 июня на конференции по экосистеме и запуску прод
Snapchat Drops Rewards for Fully AI-Generated Spotlight Content
Snapchat принимает твёрдую позицию против низкокачественного контента, созданного с помощью искусственного интеллекта. Социальная сеть прекратит продвижение полностью сгенерированных ИИ видео, отдавая приоритет контенту, созданному людьми.В пятницу











