Heim
Warum Agenten in langen Aufgaben vergessen und vom Kurs abkommen: AWS, Claude Code und Manus entpacken vier Frameworks

Große Sprachmodelle verlieren häufig den Fokus während längerer Operationen und entfernen sich von ihren ursprünglichen Zielen – eine anhaltende Herausforderung im Bereich der intelligenten Agenten. Das Problem resultiert oft nicht aus dem Modell selbst, sondern aus dem umgebenden Ausführungsframework. Ein kürzlich veröffentlichter AWS-Designleitfaden für Cloud-Programmierungsagenten verdeutlicht dies klar: flache Agenten leiden unter Kontextüberlauf, verlieren den Fokus während langer Zyklen und scheitern daran, den Zustand aufrechtzuerhalten. Die Behebung dieses Problems erfordert die Optimierung des Harness, der alle Operationen außerhalb des Kernmodells verwaltet.
Eine umfassende Überprüfung führender Frameworks hat diese kritische Schicht beleuchtet. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex und Amazon Bedrock AgentCore nutzen jeweils vier Schlüsselmechanismen – Kontextbudgetierung, Komprimierung, Aufgabenstatusverwaltung und sessionsübergreifender Speicher –, um einfache Schleifen in robuste Agenten zu verwandeln, die komplexe, langlaufende Aufgaben bewältigen können.
Die kontraintuitivste Erkenntnis ist, dass eine einfache Erweiterung des Kontextfensters das Problem nicht löst. Der Context Rot-Bericht von Chroma, der 18 große Modelle evaluierte, ergab, dass die Zuverlässigkeit der Modelle selbst bei einfachen Retrieval-Aufgaben mit zunehmender Eingabelänge abnimmt. Anthropic erklärt, dass Aufmerksamkeitsmechanismen quadratische paarweise Beziehungen für n Token erzeugen, was bedeutet, dass jedes zusätzliche Token einen endlichen Teil des Aufmerksamkeitsbudgets verbraucht. Kontext ist eine erschöpfliche Ressource, kein unendlicher Behälter. Manus stellte weiter fest, dass typische Aufgaben etwa 50 Tool-Aufrufe beinhalten, wobei das Eingabe-zu-Ausgabe-Verhältnis nahe bei 100:1 liegt. Folglich verschieben sich ursprüngliche Anweisungen allmählich in die Mitte des Fensters – genau dort, wo der Gedächtnisabbau am ausgeprägtesten ist.
Der erste Motor konzentriert sich auf Kontextbudgetierung und Entlastung. Deep Agents erzwingt zwei strenge Regeln: Wenn ein Tool mehr als 20.000 Token zurückgibt, werden die Daten im Dateisystem gespeichert, wobei nur der Dateipfad und eine Vorschau von 10 Zeilen behalten werden; wenn der Sitzungskontext 85 % der Fensterkapazität überschreitet, werden ältere Bearbeitungsbefehle durch Zeiger ersetzt. Claude Code wendet ähnliche Logik vor dem Laden an und begrenzt die Speichernutzung auf 200 Zeilen oder 25 KB, wobei der MCP-Tool-Standardmodus auf das Auflisten von Namen und das Abrufen von Details auf Anfrage festgelegt ist. AWS AgentCore’s Implementierung ist noch strenger: Der Koordinator startet drei Browser-Subagenten parallel, wobei jeder in seiner eigenen MicroVM operiert. Der Analyse-Subagent erhält nur strukturierte Ergebnisse, wodurch die erwartete Dauer auf 4–6 Minuten reduziert wird, während die sequentielle Ausführung bis zu dreimal länger dauern kann.
Der zweite Motor behandelt Komprimierung. Wenn die Entlastung unzureichend ist, fasst das Framework das Gespräch nahe den Kapazitätsgrenzen zusammen und startet den Prozess neu. Der Komprimierungsauftrag von Claude Code bewahrt architektonische Entscheidungen und ungelöste Fehler, während er redundante Ausgaben verwirft. Nach der Komprimierung liest er die letzten fünf geänderten Dateien erneut und injiziert relevante Skill-Texte neu. Er archiviert zudem den vollständigen ursprünglichen Datensatz auf der Festplatte, sodass später auf Fakten zugegriffen werden kann, die während der Zusammenfassung verloren gingen. Deep Agents betrachtet die Aufrechterhaltung des Ziels als strukturelles Merkmal und organisiert Zusammenfassungsdocumente in Absichten, generierte Ausgaben und nächste Schritte. Die Komprimierung wurde auch auf API-Ebene integriert: OpenAI’s Responses API bietet serverseitige Komprimierung über compact\_threshold, die Codex für lange Programmieraufgaben nutzt. Die Claude-Plattform bietet anpassbare Komprimierungseinstellungen mit beschreibbaren Anweisungen.
Der dritte Motor verwaltet den Aufgabenstatus und persistente Erinnerungen. Manus verwendet einen straightforward Ansatz: das Erstellen einer todo.md-Datei und das Abhaken von Elementen Schritt für Schritt, was das Ziel effektiv am Ende des Kontexts verankert, um dem „Untergehen in der Mitte“ entgegenzuwirken. Diese Methode ist jedoch nicht universell wirksam: Deep Agents machte seine To-Do-Middleware in Version 0.7 (veröffentlicht im Juli 2026) optional, da Bewertungen zeigten, dass das Deaktivieren sie die Belohnungswerte leicht verbesserte und die Kosten reduzierte. LangChain empfiehlt dennoch, diese Funktion für lange Aufgaben, schwächere Modelle und Schnittstellen, die Transparenz über den Fortschritt erfordern, wieder zu aktivieren.
Der vierte Motor ermöglicht sessionsübergreifenden Speicher. Claude Code lädt CLAUDE.md und den automatischen Speicher nach jedem Komprimierungszyklus neu. AgentCore Memory führt Extraktionsstrategien im Hintergrund aus, wodurch der Koordinator vorherige Erkenntnisse direkt abrufen kann, anstatt sie erneut zu analysieren. Forschungsergebnisse der ETH Zürich deuten jedoch auf Vorsicht hin: Kontextdateien wie AGENTS.md verbessern typischerweise nicht die Erfolgsquoten, sondern erhöhen die Rechenkosten um 20 % bis 23 %, was bei jedem Neuladen eine feste Steuer auf das Aufmerksamkeitsbudget auferlegt. Daher rät Claude Code, CLAUDE.md unter 200 Zeilen zu halten.
Die Studie kommt zu dem Schluss, dass die Überprüfung, ob ein Framework das Ziel wirklich „begreift“, erzwungene Komprimierungstests erfordert. Der gefährlichste Ausfallmodus tritt auf, wenn ein Agent unmittelbar nach einer Zusammenfassung Klarheit anfordert oder eine Aufgabe fälschlicherweise als abgeschlossen erklärt. Letztlich hängt es davon ab, einen Agenten auf dem richtigen Weg während langer Reisen zu halten, nicht von der Größe des Modells, sondern von der Präzision dieser unterstützenden Motoren.
Verwandter Artikel
Chinas KI-Branche verzeichnet Durchbrüche in der gesamten Wertschöpfungskette, was die Verabschiedung des Künstlichen-Intelligenz-Gesetzes beschleunigt.
Die globalen Downloads inländischer großer Sprachmodelle haben 10 Milliarden überschritten, wobei regelmäßig Open-Source-Modelle mit Trilliarden von Parametern auf den Markt kommen. Chinas künstliche Intelligenzbranche erzielt umfassende Durchbrüche
Zhiyuan Innovation stellt Data Acquisition 2.0 vor, um intelligentere Roboter anzutreiben
Da sich der Bereich der künstlichen Intelligenz rasch ausweitet, ist es zu einer entscheidenden Priorität der Branche geworden, Robotern zu ermöglichen, komplexe reale Umgebungen präzise zu erfassen und sich daran anzupassen. Auf der Tianfu-Konferenz
Snapchat gewährt Belohnungen für vollständig KI-generierte Spotlight-Inhalte
Snapchat nimmt eine klare Position gegen minderwertige, KI-generierte Inhalte ein. Die Social-Media-Plattform wird die Förderung vollständig KI-generierter Videos einstellen und stattdessen menschlich erstellte Inhalte priorisieren.Am Freitag kündig
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Große Sprachmodelle verlieren häufig den Fokus während längerer Operationen und entfernen sich von ihren ursprünglichen Zielen – eine anhaltende Herausforderung im Bereich der intelligenten Agenten. Das Problem resultiert oft nicht aus dem Modell selbst, sondern aus dem umgebenden Ausführungsframework. Ein kürzlich veröffentlichter AWS-Designleitfaden für Cloud-Programmierungsagenten verdeutlicht dies klar: flache Agenten leiden unter Kontextüberlauf, verlieren den Fokus während langer Zyklen und scheitern daran, den Zustand aufrechtzuerhalten. Die Behebung dieses Problems erfordert die Optimierung des Harness, der alle Operationen außerhalb des Kernmodells verwaltet.
Eine umfassende Überprüfung führender Frameworks hat diese kritische Schicht beleuchtet. LangChain Deep Agents, Claude Code, Manus, OpenAI Codex und Amazon Bedrock AgentCore nutzen jeweils vier Schlüsselmechanismen – Kontextbudgetierung, Komprimierung, Aufgabenstatusverwaltung und sessionsübergreifender Speicher –, um einfache Schleifen in robuste Agenten zu verwandeln, die komplexe, langlaufende Aufgaben bewältigen können.
Die kontraintuitivste Erkenntnis ist, dass eine einfache Erweiterung des Kontextfensters das Problem nicht löst. Der Context Rot-Bericht von Chroma, der 18 große Modelle evaluierte, ergab, dass die Zuverlässigkeit der Modelle selbst bei einfachen Retrieval-Aufgaben mit zunehmender Eingabelänge abnimmt. Anthropic erklärt, dass Aufmerksamkeitsmechanismen quadratische paarweise Beziehungen für n Token erzeugen, was bedeutet, dass jedes zusätzliche Token einen endlichen Teil des Aufmerksamkeitsbudgets verbraucht. Kontext ist eine erschöpfliche Ressource, kein unendlicher Behälter. Manus stellte weiter fest, dass typische Aufgaben etwa 50 Tool-Aufrufe beinhalten, wobei das Eingabe-zu-Ausgabe-Verhältnis nahe bei 100:1 liegt. Folglich verschieben sich ursprüngliche Anweisungen allmählich in die Mitte des Fensters – genau dort, wo der Gedächtnisabbau am ausgeprägtesten ist.
Der erste Motor konzentriert sich auf Kontextbudgetierung und Entlastung. Deep Agents erzwingt zwei strenge Regeln: Wenn ein Tool mehr als 20.000 Token zurückgibt, werden die Daten im Dateisystem gespeichert, wobei nur der Dateipfad und eine Vorschau von 10 Zeilen behalten werden; wenn der Sitzungskontext 85 % der Fensterkapazität überschreitet, werden ältere Bearbeitungsbefehle durch Zeiger ersetzt. Claude Code wendet ähnliche Logik vor dem Laden an und begrenzt die Speichernutzung auf 200 Zeilen oder 25 KB, wobei der MCP-Tool-Standardmodus auf das Auflisten von Namen und das Abrufen von Details auf Anfrage festgelegt ist. AWS AgentCore’s Implementierung ist noch strenger: Der Koordinator startet drei Browser-Subagenten parallel, wobei jeder in seiner eigenen MicroVM operiert. Der Analyse-Subagent erhält nur strukturierte Ergebnisse, wodurch die erwartete Dauer auf 4–6 Minuten reduziert wird, während die sequentielle Ausführung bis zu dreimal länger dauern kann.
Der zweite Motor behandelt Komprimierung. Wenn die Entlastung unzureichend ist, fasst das Framework das Gespräch nahe den Kapazitätsgrenzen zusammen und startet den Prozess neu. Der Komprimierungsauftrag von Claude Code bewahrt architektonische Entscheidungen und ungelöste Fehler, während er redundante Ausgaben verwirft. Nach der Komprimierung liest er die letzten fünf geänderten Dateien erneut und injiziert relevante Skill-Texte neu. Er archiviert zudem den vollständigen ursprünglichen Datensatz auf der Festplatte, sodass später auf Fakten zugegriffen werden kann, die während der Zusammenfassung verloren gingen. Deep Agents betrachtet die Aufrechterhaltung des Ziels als strukturelles Merkmal und organisiert Zusammenfassungsdocumente in Absichten, generierte Ausgaben und nächste Schritte. Die Komprimierung wurde auch auf API-Ebene integriert: OpenAI’s Responses API bietet serverseitige Komprimierung über compact\_threshold, die Codex für lange Programmieraufgaben nutzt. Die Claude-Plattform bietet anpassbare Komprimierungseinstellungen mit beschreibbaren Anweisungen.
Der dritte Motor verwaltet den Aufgabenstatus und persistente Erinnerungen. Manus verwendet einen straightforward Ansatz: das Erstellen einer todo.md-Datei und das Abhaken von Elementen Schritt für Schritt, was das Ziel effektiv am Ende des Kontexts verankert, um dem „Untergehen in der Mitte“ entgegenzuwirken. Diese Methode ist jedoch nicht universell wirksam: Deep Agents machte seine To-Do-Middleware in Version 0.7 (veröffentlicht im Juli 2026) optional, da Bewertungen zeigten, dass das Deaktivieren sie die Belohnungswerte leicht verbesserte und die Kosten reduzierte. LangChain empfiehlt dennoch, diese Funktion für lange Aufgaben, schwächere Modelle und Schnittstellen, die Transparenz über den Fortschritt erfordern, wieder zu aktivieren.
Der vierte Motor ermöglicht sessionsübergreifenden Speicher. Claude Code lädt CLAUDE.md und den automatischen Speicher nach jedem Komprimierungszyklus neu. AgentCore Memory führt Extraktionsstrategien im Hintergrund aus, wodurch der Koordinator vorherige Erkenntnisse direkt abrufen kann, anstatt sie erneut zu analysieren. Forschungsergebnisse der ETH Zürich deuten jedoch auf Vorsicht hin: Kontextdateien wie AGENTS.md verbessern typischerweise nicht die Erfolgsquoten, sondern erhöhen die Rechenkosten um 20 % bis 23 %, was bei jedem Neuladen eine feste Steuer auf das Aufmerksamkeitsbudget auferlegt. Daher rät Claude Code, CLAUDE.md unter 200 Zeilen zu halten.
Die Studie kommt zu dem Schluss, dass die Überprüfung, ob ein Framework das Ziel wirklich „begreift“, erzwungene Komprimierungstests erfordert. Der gefährlichste Ausfallmodus tritt auf, wenn ein Agent unmittelbar nach einer Zusammenfassung Klarheit anfordert oder eine Aufgabe fälschlicherweise als abgeschlossen erklärt. Letztlich hängt es davon ab, einen Agenten auf dem richtigen Weg während langer Reisen zu halten, nicht von der Größe des Modells, sondern von der Präzision dieser unterstützenden Motoren.
Chinas KI-Branche verzeichnet Durchbrüche in der gesamten Wertschöpfungskette, was die Verabschiedung des Künstlichen-Intelligenz-Gesetzes beschleunigt.
Die globalen Downloads inländischer großer Sprachmodelle haben 10 Milliarden überschritten, wobei regelmäßig Open-Source-Modelle mit Trilliarden von Parametern auf den Markt kommen. Chinas künstliche Intelligenzbranche erzielt umfassende Durchbrüche
Zhiyuan Innovation stellt Data Acquisition 2.0 vor, um intelligentere Roboter anzutreiben
Da sich der Bereich der künstlichen Intelligenz rasch ausweitet, ist es zu einer entscheidenden Priorität der Branche geworden, Robotern zu ermöglichen, komplexe reale Umgebungen präzise zu erfassen und sich daran anzupassen. Auf der Tianfu-Konferenz
Snapchat gewährt Belohnungen für vollständig KI-generierte Spotlight-Inhalte
Snapchat nimmt eine klare Position gegen minderwertige, KI-generierte Inhalte ein. Die Social-Media-Plattform wird die Förderung vollständig KI-generierter Videos einstellen und stattdessen menschlich erstellte Inhalte priorisieren.Am Freitag kündig











