为什么智能体在长任务中会遗忘并偏离轨道:AWS、Claude Code 和 Manus 解析四大框架

大型语言模型在执行长时间操作时经常失去焦点,偏离其最初目标——这是智能体领域的一个持续挑战。该问题通常并非源于模型本身,而是源于周围的执行框架。AWS 最近发布的云编程智能体设计指南清楚地指出了这一点:浅层智能体会因上下文溢出而失去焦点,在长周期中迷失方向,且无法维持状态。解决这一问题需要优化管理核心模型外部所有操作的“框架”(harness)。
对主流框架的全面审查揭示了这一关键层。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 均利用四种关键机制——上下文预算、压缩、任务状态管理和跨会话记忆——将基本循环转化为能够处理复杂、长时间运行任务的强大智能体。
最反直觉的发现是,简单地扩大上下文窗口并不能解决问题。Chroma 的《上下文旋转报告》评估了 18 个大型模型,结果显示,即使在简单的检索任务中,随着输入长度的增加,模型的可靠性也会下降。Anthropic 解释说,注意力机制为 n 个令牌生成二次成对关系,这意味着每个额外的令牌都会消耗注意力预算的有限部分。上下文是一种消耗性资源,而非无限容器。Manus 进一步指出,典型任务涉及大约 50 次工具调用,输入与输出的比率接近 100:1。因此,初始指令逐渐向窗口中心移动——这正是记忆退化最显著的区域。
第一个引擎专注于上下文预算和卸载。Deep Agents 强制执行两条严格规则:如果工具返回超过 20,000 个令牌,数据将写入文件系统,仅保留文件路径和 10 行预览;当会话上下文超过窗口容量的 85% 时,较旧的编辑命令将被指针替换。Claude Code 在加载前应用类似的逻辑,将内存使用限制在 200 行或 25KB,MCP 工具模式默认为列出名称并按需获取详细信息。AWS AgentCore 的实施更为严格:协调器并行生成三个浏览器子智能体,每个子智能体都在自己的 MicroVM 中运行。分析子智能体仅接收结构化结果,将预期持续时间缩短至 4-6 分钟,而串行执行可能需要长达三倍的时间。
第二个引擎处理压缩。当卸载不足时,框架会在接近容量限制时总结对话并重新启动过程。Claude Code 的压缩提示保留了架构决策和未解决的错误,同时丢弃冗余输出。压缩后,它会重新读取最后五个修改过的文件,并重新注入相关的技能文本。它还将完整的原始记录归档到磁盘,确保在总结过程中丢失的事实可以稍后检索。Deep Agents 将目标保留视为一种结构特性,将总结文档组织为意图、生成的输出和下一步。压缩也已集成到 API 层面:OpenAI 的 Responses API 通过 compact\_threshold 提供服务器端压缩,Codex 利用该功能处理长编程任务。Claude 平台提供可自定义的压缩设置,并支持写入指令。
第三个引擎管理任务状态和持久提醒。Manus 采用了一种简单的方法:创建一个 todo.md 文件并逐步勾选项目,有效地将目标嵌入上下文末尾,以对抗“淹没在中间”的情况。然而,这种方法并非普遍有效:Deep Agents 在 0.7 版本(2026 年 7 月发布)中使其待办事项中间件变为可选,因为评估显示禁用它略微提高了奖励分数并降低了成本。LangChain 仍建议在长时间任务、较弱的模型以及需要进度可见性的界面中重新启用此功能。
第四个引擎实现跨会话记忆。Claude Code 在每次压缩周期后重新加载 CLAUDE.md 和自动记忆。AgentCore Memory 在后台运行提取策略,使协调器能够直接回忆之前的见解,而不是重新分析它们。然而,苏黎世联邦理工学院(ETH Zurich)的研究表明需谨慎:AGENTS.md 等上下文文件通常不会提高成功率,但会使推理成本增加 20% 至 23%,每次重新加载都会对注意力预算征收固定税。因此,Claude Code 建议将 CLAUDE.md 保持在 200 行以下。
该研究得出结论,验证框架是否真正“掌握目标”需要进行强制压缩测试。最危险的模式是智能体在总结后立即请求澄清,或错误地宣布任务完成。最终,在漫长旅程中保持智能体不偏离轨道,并不取决于模型的大小,而是取决于这些支持引擎的精确性。
相关文章
中国人工智能领域实现全链条突破,加速推进《人工智能法》
国内大语言模型的全球下载量已突破100亿次,万亿参数级别的开源模型不断涌现。中国人工智能产业在产业链各环节均实现了全面突破。国家发展和改革委员会政策研究室主任、新闻发言人金暐在7月31日的新闻发布会上表示,今年上半年,中国人工智能产业在自主创新方面取得了显著进展。包括DeepSeek和月之暗面(Moonshot AI)在内的国内企业相继推出了参数规模达“万亿”级别的开源大模型。金暐强调,未来工作将统筹高质量发展与高水平安全,确保人工智能快速、稳健发展。重点包括:一是加快自主创新,聚焦基础大模
致远创新发布数据采集2.0,赋能更智能的机器人
随着人工智能领域的快速扩张,使机器人能够准确理解并适应复杂的真实世界环境已成为行业的关键优先事项。6月25日,在成都举行的天府人工智能产业生态与产品发布会上,智元创新(成都)科技有限公司发布了最新的“具身智能数据采集2.0”框架,为机器人发展提供了重要动力。在1.0版本的基础上,该更新系统在数据操作、模型评估和场景部署三个关键领域取得了重大进展。其突出特点是全新的“真机+无体”双轨数据采集方法,在提高效率和适应性的同时,解决了传统方法中常见的训练成本高、样本多样性有限等挑战。此外,该平台建立了
Snapchat 为完全由 AI 生成的 Spotlight 内容提供奖励
Snapchat 正对低质量 AI 生成内容采取强硬立场。该社交媒体平台将停止推广完全由 AI 制作的视频,转而优先推广人类创作的内容。周五,Snapchat 宣布其推荐算法将进行更新,以确保只有由真人制作的视频才有资格入选 Spotlight。Snapchat 在博客文章中表示,其目标是让 Spotlight “成为一个让人们发现来自真人的真实创意的地方,因为我们相信,奖励原创视角、个人叙事以及人们选择创作和分享的瞬间具有持久的价值。”然而,Snapchat 澄清称,它并未全面禁止 AI
相关专题推荐
评论 (0)
0/500

大型语言模型在执行长时间操作时经常失去焦点,偏离其最初目标——这是智能体领域的一个持续挑战。该问题通常并非源于模型本身,而是源于周围的执行框架。AWS 最近发布的云编程智能体设计指南清楚地指出了这一点:浅层智能体会因上下文溢出而失去焦点,在长周期中迷失方向,且无法维持状态。解决这一问题需要优化管理核心模型外部所有操作的“框架”(harness)。
对主流框架的全面审查揭示了这一关键层。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 Amazon Bedrock AgentCore 均利用四种关键机制——上下文预算、压缩、任务状态管理和跨会话记忆——将基本循环转化为能够处理复杂、长时间运行任务的强大智能体。
最反直觉的发现是,简单地扩大上下文窗口并不能解决问题。Chroma 的《上下文旋转报告》评估了 18 个大型模型,结果显示,即使在简单的检索任务中,随着输入长度的增加,模型的可靠性也会下降。Anthropic 解释说,注意力机制为 n 个令牌生成二次成对关系,这意味着每个额外的令牌都会消耗注意力预算的有限部分。上下文是一种消耗性资源,而非无限容器。Manus 进一步指出,典型任务涉及大约 50 次工具调用,输入与输出的比率接近 100:1。因此,初始指令逐渐向窗口中心移动——这正是记忆退化最显著的区域。
第一个引擎专注于上下文预算和卸载。Deep Agents 强制执行两条严格规则:如果工具返回超过 20,000 个令牌,数据将写入文件系统,仅保留文件路径和 10 行预览;当会话上下文超过窗口容量的 85% 时,较旧的编辑命令将被指针替换。Claude Code 在加载前应用类似的逻辑,将内存使用限制在 200 行或 25KB,MCP 工具模式默认为列出名称并按需获取详细信息。AWS AgentCore 的实施更为严格:协调器并行生成三个浏览器子智能体,每个子智能体都在自己的 MicroVM 中运行。分析子智能体仅接收结构化结果,将预期持续时间缩短至 4-6 分钟,而串行执行可能需要长达三倍的时间。
第二个引擎处理压缩。当卸载不足时,框架会在接近容量限制时总结对话并重新启动过程。Claude Code 的压缩提示保留了架构决策和未解决的错误,同时丢弃冗余输出。压缩后,它会重新读取最后五个修改过的文件,并重新注入相关的技能文本。它还将完整的原始记录归档到磁盘,确保在总结过程中丢失的事实可以稍后检索。Deep Agents 将目标保留视为一种结构特性,将总结文档组织为意图、生成的输出和下一步。压缩也已集成到 API 层面:OpenAI 的 Responses API 通过 compact\_threshold 提供服务器端压缩,Codex 利用该功能处理长编程任务。Claude 平台提供可自定义的压缩设置,并支持写入指令。
第三个引擎管理任务状态和持久提醒。Manus 采用了一种简单的方法:创建一个 todo.md 文件并逐步勾选项目,有效地将目标嵌入上下文末尾,以对抗“淹没在中间”的情况。然而,这种方法并非普遍有效:Deep Agents 在 0.7 版本(2026 年 7 月发布)中使其待办事项中间件变为可选,因为评估显示禁用它略微提高了奖励分数并降低了成本。LangChain 仍建议在长时间任务、较弱的模型以及需要进度可见性的界面中重新启用此功能。
第四个引擎实现跨会话记忆。Claude Code 在每次压缩周期后重新加载 CLAUDE.md 和自动记忆。AgentCore Memory 在后台运行提取策略,使协调器能够直接回忆之前的见解,而不是重新分析它们。然而,苏黎世联邦理工学院(ETH Zurich)的研究表明需谨慎:AGENTS.md 等上下文文件通常不会提高成功率,但会使推理成本增加 20% 至 23%,每次重新加载都会对注意力预算征收固定税。因此,Claude Code 建议将 CLAUDE.md 保持在 200 行以下。
该研究得出结论,验证框架是否真正“掌握目标”需要进行强制压缩测试。最危险的模式是智能体在总结后立即请求澄清,或错误地宣布任务完成。最终,在漫长旅程中保持智能体不偏离轨道,并不取决于模型的大小,而是取决于这些支持引擎的精确性。
中国人工智能领域实现全链条突破,加速推进《人工智能法》
国内大语言模型的全球下载量已突破100亿次,万亿参数级别的开源模型不断涌现。中国人工智能产业在产业链各环节均实现了全面突破。国家发展和改革委员会政策研究室主任、新闻发言人金暐在7月31日的新闻发布会上表示,今年上半年,中国人工智能产业在自主创新方面取得了显著进展。包括DeepSeek和月之暗面(Moonshot AI)在内的国内企业相继推出了参数规模达“万亿”级别的开源大模型。金暐强调,未来工作将统筹高质量发展与高水平安全,确保人工智能快速、稳健发展。重点包括:一是加快自主创新,聚焦基础大模
致远创新发布数据采集2.0,赋能更智能的机器人
随着人工智能领域的快速扩张,使机器人能够准确理解并适应复杂的真实世界环境已成为行业的关键优先事项。6月25日,在成都举行的天府人工智能产业生态与产品发布会上,智元创新(成都)科技有限公司发布了最新的“具身智能数据采集2.0”框架,为机器人发展提供了重要动力。在1.0版本的基础上,该更新系统在数据操作、模型评估和场景部署三个关键领域取得了重大进展。其突出特点是全新的“真机+无体”双轨数据采集方法,在提高效率和适应性的同时,解决了传统方法中常见的训练成本高、样本多样性有限等挑战。此外,该平台建立了
Snapchat 为完全由 AI 生成的 Spotlight 内容提供奖励
Snapchat 正对低质量 AI 生成内容采取强硬立场。该社交媒体平台将停止推广完全由 AI 制作的视频,转而优先推广人类创作的内容。周五,Snapchat 宣布其推荐算法将进行更新,以确保只有由真人制作的视频才有资格入选 Spotlight。Snapchat 在博客文章中表示,其目标是让 Spotlight “成为一个让人们发现来自真人的真实创意的地方,因为我们相信,奖励原创视角、个人叙事以及人们选择创作和分享的瞬间具有持久的价值。”然而,Snapchat 澄清称,它并未全面禁止 AI





首页






