왜 에이전트는 긴 작업에서 기억을 잃고 방향을 잃을까: AWS, Claude Code, Manus가 네 가지 프레임워크를 해부하다

대규모 언어 모델은 긴 작업 수행 중 자주 집중력을 잃고 원래 목표에서 벗어나곤 하는데, 이는 지능형 에이전트 분야에서 지속적으로 존재하는 과제입니다. 이 문제는 종종 모델 자체보다 주변 실행 프레임워크에서 비롯됩니다. 최근 AWS가 제시한 클라우드 프로그래밍 에이전트 설계 가이드는 이를 명확히 지적합니다: 피상적인 에이전트는 컨텍스트 오버플로우로 인해 집중력을 잃고, 긴 사이클 동안 상태를 유지하지 못합니다. 이를 해결하려면 핵심 모델 외부의 모든 작업을 관리하는 하네스를 최적화해야 합니다.
주요 프레임워크에 대한 포괄적인 검토는 이러한 중요한 계층을 밝혀냈습니다. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex, Amazon Bedrock AgentCore는 각각 컨텍스트 예산 할당, 압축, 작업 상태 관리, 크로스 세션 메모리라는 네 가지 핵심 메커니즘을 활용하여 기본 루프를 복잡한 장기 작업 처리가 가능한 견고한 에이전트로 변환합니다.
가장 직관에 반되는 발견은 컨텍스트 창을 단순히 확장하는 것만으로는 문제가 해결되지 않는다는 점입니다. 18개 대규모 모델을 평가한 Chroma의 Context Rot 보고서는 단순 검색 작업에서도 입력 길이가 증가함에 따라 모델의 신뢰도가 감소함을 드러냈습니다. Anthropic은 어텐션 메커니즘이 n개의 토큰에 대해 이차적 쌍별 관계를 생성한다고 설명하며, 이는 추가되는 각 토큰이 어텐션 예산의 유한한 부분을 소비함을 의미합니다. 컨텍스트는 무한한 용기가 아니라 고갈되는 자원입니다. Manus는 일반적인 작업에 약 50개의 도구 호출이 포함되며, 입력 대비 출력 비율이 100:1에 가까울 수 있다고 추가로 지적했습니다. 결과적으로 초기 지침은 점차 창의 중앙으로 이동하며, 이는 기억력 저하가 가장 현저하게 나타나는 영역입니다.
첫 번째 엔진은 컨텍스트 예산 할당과 오프로딩에 중점을 둡니다. Deep Agents는 두 가지 엄격한 규칙을 적용합니다: 도구 반환값이 20,000 토큰을 초과할 경우 데이터는 파일 시스템에 기록되며 파일 경로와 10줄 분량의 미리보기만 유지됩니다. 세션 컨텍스트가 창의 용량 85%를 초과하면 이전 편집 명령은 포인터로 대체됩니다. Claude Code는 로딩 전에 유사한 논리를 적용하여 메모리 사용량을 200줄 또는 25KB로 제한하며, MCP 도구 모드는 기본적으로 이름 나열과 필요 시 세부 정보 가져오기를 수행합니다. AWS AgentCore의 구현은 더욱 엄격합니다: 조정자는 세 개의 브라우저 하위 에이전트를 병렬로 생성하며, 각 에이전트는 자체 MicroVM 내에서 작동합니다. 분석 하위 에이전트는 구조화된 결과만 받으며, 이는 예상 실행 시간을 4~6분으로 단축시킵니다. 반면 직렬 실행은 최대 3배 더 오래 걸릴 수 있습니다.
두 번째 엔진은 압축을 처리합니다. 오프로딩이 충분하지 않을 경우 프레임워크는 용량 한계에 근접한 대화 내용을 요약하고 프로세스를 재시작합니다. Claude Code의 압축 프롬프트는 아키텍처 결정과 미해결 버그는 보존하면서 중복된 출력은 삭제합니다. 압축 후 마지막 5개의 수정된 파일을 다시 읽고 관련 기술 텍스트를 재주입합니다. 또한 원본 기록 전체를 디스크에 아카이브하여 요약 과정에서 손실된 사실을 나중에 검색할 수 있도록 합니다. Deep Agents는 목표 보존을 구조적 기능으로 처리하며, 요약 문서를 의도, 생성된 출력, 다음 단계로 구성합니다. 압축은 API 수준에서도 통합되었습니다: OpenAI의 Responses API는 compact\_threshold을 통해 서버 측 압축을 제공하며, 이는 Codex가 긴 프로그래밍 작업에 활용합니다. Claude 플랫폼은 작성 가능한 지침과 함께 사용자 정의 가능한 압축 설정을 제공합니다.
세 번째 엔진은 작업 상태와 지속적 알림을 관리합니다. Manus는 간단한 접근 방식을 사용합니다: todo.md 파일을 생성하고 항목을 단계별로 체크함으로써 컨텍스트 끝에 목표를 임베딩하여 "중간에 잠기는" 현상을 상쇄합니다. 그러나 이 방법은 보편적으로 효과적이지 않습니다: Deep Agents는 0.7 버전(2026년 7월 출시)에서 평가 결과 비활성화가 보상 점수를 약간 향상시키고 비용을 절감한다는 것을 보여줌에 따라 이 투두 미들웨어를 선택 사항으로 변경했습니다. LangChain은 여전히 긴 작업, 약한 모델, 진행 상황 가시성이 필요한 인터페이스에 대해 이 기능을 다시 활성화할 것을 권장합니다.
네 번째 엔진은 크로스 세션 메모리를 가능하게 합니다. Claude Code는 각 압축 주기 후 CLAUDE.md와 자동 메모리를 다시 로드합니다. AgentCore Memory는 백그라운드에서 추출 전략을 실행하여 조정자가 이전 통찰력을 다시 분석하는 대신 직접 호출할 수 있도록 합니다. 그러나 ETH Zurich의 연구는 주의할 것을 시사합니다: AGENTS.md와 같은 컨텍스트 파일은 일반적으로 성공률을 높이지 않으며, 재로드할 때마다 어텐션 예산에 고정된 과부하를 부과하여 추론 비용을 20%에서 23% 증가시킵니다. 따라서 Claude Code는 CLAUDE.md를 200줄 미만으로 유지할 것을 권장합니다.
이 연구는 프레임워크가 실제로 "목표를 파악하는지" 확인하려면 강제 압축 테스트가 필요하다는 결론을 내립니다. 가장 위험한 실패 모드는 요약 후 즉시 명확화를 요청하거나 작업을 완료했다고 잘못 선언하는 에이전트에서 발생합니다. 궁극적으로 긴 여정 동안 에이전트를 올바른 궤도에 유지하는 것은 모델의 크기가 아니라 이러한 지원 엔진의 정밀도에 달려 있습니다.
관련 기사
중국의 AI 산업이 풀체인 돌파구를 마련하며 인공지능법 제정이 가속화되고 있다
국내 대형 언어 모델의 글로벌 다운로드 횟수가 100억 건을 돌파했으며, 수조 파라미터 규모의 오픈소스 모델이 꾸준히 출시되고 있다. 중국의 인공지능(AI) 산업은 전체 가치 사슬에서 포괄적인 돌파구를 마련하고 있다.국가발전개혁위원회 정책연구실 주임이자 대변인인 장이는 7월 31일 기자회견에서 올해 상반기 중국 AI 산업이 자체 혁신에서 상당한 진전을 이루었다고 밝혔다. 디프시크(DeepSeek)와 문샷 AI(Moonshot AI)를 포함한
지위안 혁신이 더 스마트한 로봇을 위한 데이터 수집 2.0을 공개합니다
인공지능 분야가 급속히 확장됨에 따라, 로봇이 복잡하고 실제적인 환경을 정확하게 이해하고 적응하도록 하는 것이 중요한 산업적 우선순위로 부상했습니다. 6월 25일 청두에서 열린 천부 인공지능 산업 생태계 및 제품 출시 컨퍼런스에서 지위이신신(청두) 기술 유한회사는 최신 '구체적 지능 데이터 수집 2.0' 프레임워크를 공개하며 로봇 발전에 필수적인 동력을 제공했습니다.버전 1.0을 기반으로 한 이 업데이트된 시스템은 데이터 운영, 모델 평가,
스냅챗, 완전 AI 생성 스포트라이트 콘텐츠에 대한 보상 제공
스냅챗은 저품질 AI 생성 콘텐츠에 대해 단호한 입장을 취하고 있다. 이 소셜 미디어 플랫폼은 완전히 AI가 생성한 영상의 홍보를 중단하고 대신 인간이 만든 콘텐츠에 우선순위를 둔다.금요일 스냅챗은 Spotlight에서 자격이 있는 영상이 실제 사람에 의해 제작된 것임을 보장하기 위해 추천 알고리즘을 업데이트할 것이라고 발표했다.스냅챗은 블로그 게시물을 통해 Spotlight를 “사람들이 실제 사람으로부터 진정한 창의성을 발견할 수 있는 장
관련 특별 주제 추천
의견 (0)
0/500

대규모 언어 모델은 긴 작업 수행 중 자주 집중력을 잃고 원래 목표에서 벗어나곤 하는데, 이는 지능형 에이전트 분야에서 지속적으로 존재하는 과제입니다. 이 문제는 종종 모델 자체보다 주변 실행 프레임워크에서 비롯됩니다. 최근 AWS가 제시한 클라우드 프로그래밍 에이전트 설계 가이드는 이를 명확히 지적합니다: 피상적인 에이전트는 컨텍스트 오버플로우로 인해 집중력을 잃고, 긴 사이클 동안 상태를 유지하지 못합니다. 이를 해결하려면 핵심 모델 외부의 모든 작업을 관리하는 하네스를 최적화해야 합니다.
주요 프레임워크에 대한 포괄적인 검토는 이러한 중요한 계층을 밝혀냈습니다. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex, Amazon Bedrock AgentCore는 각각 컨텍스트 예산 할당, 압축, 작업 상태 관리, 크로스 세션 메모리라는 네 가지 핵심 메커니즘을 활용하여 기본 루프를 복잡한 장기 작업 처리가 가능한 견고한 에이전트로 변환합니다.
가장 직관에 반되는 발견은 컨텍스트 창을 단순히 확장하는 것만으로는 문제가 해결되지 않는다는 점입니다. 18개 대규모 모델을 평가한 Chroma의 Context Rot 보고서는 단순 검색 작업에서도 입력 길이가 증가함에 따라 모델의 신뢰도가 감소함을 드러냈습니다. Anthropic은 어텐션 메커니즘이 n개의 토큰에 대해 이차적 쌍별 관계를 생성한다고 설명하며, 이는 추가되는 각 토큰이 어텐션 예산의 유한한 부분을 소비함을 의미합니다. 컨텍스트는 무한한 용기가 아니라 고갈되는 자원입니다. Manus는 일반적인 작업에 약 50개의 도구 호출이 포함되며, 입력 대비 출력 비율이 100:1에 가까울 수 있다고 추가로 지적했습니다. 결과적으로 초기 지침은 점차 창의 중앙으로 이동하며, 이는 기억력 저하가 가장 현저하게 나타나는 영역입니다.
첫 번째 엔진은 컨텍스트 예산 할당과 오프로딩에 중점을 둡니다. Deep Agents는 두 가지 엄격한 규칙을 적용합니다: 도구 반환값이 20,000 토큰을 초과할 경우 데이터는 파일 시스템에 기록되며 파일 경로와 10줄 분량의 미리보기만 유지됩니다. 세션 컨텍스트가 창의 용량 85%를 초과하면 이전 편집 명령은 포인터로 대체됩니다. Claude Code는 로딩 전에 유사한 논리를 적용하여 메모리 사용량을 200줄 또는 25KB로 제한하며, MCP 도구 모드는 기본적으로 이름 나열과 필요 시 세부 정보 가져오기를 수행합니다. AWS AgentCore의 구현은 더욱 엄격합니다: 조정자는 세 개의 브라우저 하위 에이전트를 병렬로 생성하며, 각 에이전트는 자체 MicroVM 내에서 작동합니다. 분석 하위 에이전트는 구조화된 결과만 받으며, 이는 예상 실행 시간을 4~6분으로 단축시킵니다. 반면 직렬 실행은 최대 3배 더 오래 걸릴 수 있습니다.
두 번째 엔진은 압축을 처리합니다. 오프로딩이 충분하지 않을 경우 프레임워크는 용량 한계에 근접한 대화 내용을 요약하고 프로세스를 재시작합니다. Claude Code의 압축 프롬프트는 아키텍처 결정과 미해결 버그는 보존하면서 중복된 출력은 삭제합니다. 압축 후 마지막 5개의 수정된 파일을 다시 읽고 관련 기술 텍스트를 재주입합니다. 또한 원본 기록 전체를 디스크에 아카이브하여 요약 과정에서 손실된 사실을 나중에 검색할 수 있도록 합니다. Deep Agents는 목표 보존을 구조적 기능으로 처리하며, 요약 문서를 의도, 생성된 출력, 다음 단계로 구성합니다. 압축은 API 수준에서도 통합되었습니다: OpenAI의 Responses API는 compact\_threshold을 통해 서버 측 압축을 제공하며, 이는 Codex가 긴 프로그래밍 작업에 활용합니다. Claude 플랫폼은 작성 가능한 지침과 함께 사용자 정의 가능한 압축 설정을 제공합니다.
세 번째 엔진은 작업 상태와 지속적 알림을 관리합니다. Manus는 간단한 접근 방식을 사용합니다: todo.md 파일을 생성하고 항목을 단계별로 체크함으로써 컨텍스트 끝에 목표를 임베딩하여 "중간에 잠기는" 현상을 상쇄합니다. 그러나 이 방법은 보편적으로 효과적이지 않습니다: Deep Agents는 0.7 버전(2026년 7월 출시)에서 평가 결과 비활성화가 보상 점수를 약간 향상시키고 비용을 절감한다는 것을 보여줌에 따라 이 투두 미들웨어를 선택 사항으로 변경했습니다. LangChain은 여전히 긴 작업, 약한 모델, 진행 상황 가시성이 필요한 인터페이스에 대해 이 기능을 다시 활성화할 것을 권장합니다.
네 번째 엔진은 크로스 세션 메모리를 가능하게 합니다. Claude Code는 각 압축 주기 후 CLAUDE.md와 자동 메모리를 다시 로드합니다. AgentCore Memory는 백그라운드에서 추출 전략을 실행하여 조정자가 이전 통찰력을 다시 분석하는 대신 직접 호출할 수 있도록 합니다. 그러나 ETH Zurich의 연구는 주의할 것을 시사합니다: AGENTS.md와 같은 컨텍스트 파일은 일반적으로 성공률을 높이지 않으며, 재로드할 때마다 어텐션 예산에 고정된 과부하를 부과하여 추론 비용을 20%에서 23% 증가시킵니다. 따라서 Claude Code는 CLAUDE.md를 200줄 미만으로 유지할 것을 권장합니다.
이 연구는 프레임워크가 실제로 "목표를 파악하는지" 확인하려면 강제 압축 테스트가 필요하다는 결론을 내립니다. 가장 위험한 실패 모드는 요약 후 즉시 명확화를 요청하거나 작업을 완료했다고 잘못 선언하는 에이전트에서 발생합니다. 궁극적으로 긴 여정 동안 에이전트를 올바른 궤도에 유지하는 것은 모델의 크기가 아니라 이러한 지원 엔진의 정밀도에 달려 있습니다.
중국의 AI 산업이 풀체인 돌파구를 마련하며 인공지능법 제정이 가속화되고 있다
국내 대형 언어 모델의 글로벌 다운로드 횟수가 100억 건을 돌파했으며, 수조 파라미터 규모의 오픈소스 모델이 꾸준히 출시되고 있다. 중국의 인공지능(AI) 산업은 전체 가치 사슬에서 포괄적인 돌파구를 마련하고 있다.국가발전개혁위원회 정책연구실 주임이자 대변인인 장이는 7월 31일 기자회견에서 올해 상반기 중국 AI 산업이 자체 혁신에서 상당한 진전을 이루었다고 밝혔다. 디프시크(DeepSeek)와 문샷 AI(Moonshot AI)를 포함한
지위안 혁신이 더 스마트한 로봇을 위한 데이터 수집 2.0을 공개합니다
인공지능 분야가 급속히 확장됨에 따라, 로봇이 복잡하고 실제적인 환경을 정확하게 이해하고 적응하도록 하는 것이 중요한 산업적 우선순위로 부상했습니다. 6월 25일 청두에서 열린 천부 인공지능 산업 생태계 및 제품 출시 컨퍼런스에서 지위이신신(청두) 기술 유한회사는 최신 '구체적 지능 데이터 수집 2.0' 프레임워크를 공개하며 로봇 발전에 필수적인 동력을 제공했습니다.버전 1.0을 기반으로 한 이 업데이트된 시스템은 데이터 운영, 모델 평가,
스냅챗, 완전 AI 생성 스포트라이트 콘텐츠에 대한 보상 제공
스냅챗은 저품질 AI 생성 콘텐츠에 대해 단호한 입장을 취하고 있다. 이 소셜 미디어 플랫폼은 완전히 AI가 생성한 영상의 홍보를 중단하고 대신 인간이 만든 콘텐츠에 우선순위를 둔다.금요일 스냅챗은 Spotlight에서 자격이 있는 영상이 실제 사람에 의해 제작된 것임을 보장하기 위해 추천 알고리즘을 업데이트할 것이라고 발표했다.스냅챗은 블로그 게시물을 통해 Spotlight를 “사람들이 실제 사람으로부터 진정한 창의성을 발견할 수 있는 장





집






