Option
Heim
Nachricht
Ehemaliger Deepseeker und Mitarbeiter veröffentlichen eine neue Methode für die Schulung zuverlässiger KI -Agenten: Ragen

Ehemaliger Deepseeker und Mitarbeiter veröffentlichen eine neue Methode für die Schulung zuverlässiger KI -Agenten: Ragen

4. Mai 2025
276

Ehemaliger Deepseeker und Mitarbeiter veröffentlichen eine neue Methode für die Schulung zuverlässiger KI -Agenten: Ragen

Das Jahr der KI-Agenten: Ein genauerer Blick auf die Erwartungen und Realitäten von 2025

2025 wurde von vielen Experten als das Jahr gefeiert, in dem KI-Agenten – spezialisierte KI-Systeme, die von fortschrittlichen großen Sprach- und multimodalen Modellen von Unternehmen wie OpenAI, Anthropic, Google und DeepSeek angetrieben werden – endlich im Mittelpunkt stehen würden. Doch laut einer aktuellen Umfrage von VentureBeat auf dem sozialen Netzwerk X befinden sich die meisten KI-Agenten immer noch in experimentellen Phasen, gefangen in einer Art unternehmerischem Niemandsland.

Doch es gibt einen Hoffnungsschimmer am Horizont. Eine gemeinsame Anstrengung von Forschern der Northwestern University, Microsoft, Stanford und der University of Washington, einschließlich Zihan Wang, einem ehemaligen DeepSeek-Forscher, der nun an der Northwestern University in Informatik promoviert, hat RAGEN vorgestellt. Dieses neue System zielt darauf ab, KI-Agenten zu trainieren und zu bewerten, um sie zuverlässiger und anpassungsfähiger für den realen, unternehmerischen Einsatz zu machen.

RAGEN: Ein neuer Ansatz zum Training von KI-Agenten

Im Gegensatz zu statischen Aufgaben wie dem Lösen von Mathematikaufgaben oder der Codegenerierung konzentriert sich RAGEN auf dynamische, mehrstufige Interaktionen, bei denen Agenten sich anpassen, erinnern und unter Unsicherheit schlussfolgern müssen. Das System basiert auf einem speziell entwickelten Reinforcement-Learning-(RL)-Framework namens StarPO (State-Thinking-Actions-Reward Policy Optimization), das das Lernen durch Erfahrung statt durch bloßes Auswendiglernen betont. StarPO betrachtet gesamte Entscheidungssequenzen, nicht nur einzelne Antwortschritte.

StarPO arbeitet in zwei Phasen: einer Rollout-Phase, in der das LLM vollständige Interaktionssequenzen unter Anleitung von Schlussfolgerungen generiert, und einer Update-Phase, in der das Modell mit normalisierten kumulativen Belohnungen optimiert wird. Dieser Ansatz bietet einen stabileren und interpretierbareren Lernzyklus im Vergleich zu traditionellen Methoden der Richtlinienoptimierung.

Die Forscher testeten dieses Framework mit optimierten Versionen von Alibabas Qwen-Modellen, insbesondere Qwen 1.5 und Qwen 2.5, die aufgrund ihrer offenen Gewichte und starken Befehlsfolgefähigkeiten ausgewählt wurden. Diese Wahl erleichterte die Reproduzierbarkeit und konsistente Basisvergleiche bei symbolischen Aufgaben.

Die Echo-Falle: Eine Herausforderung im Reinforcement Learning

Zihan Wang wies in einem viel geteilten X-Thread auf ein kritisches Problem beim RL-Training hin: *Warum bricht dein RL-Training immer zusammen?* Das Team stellte fest, dass RL-Systeme zwar anfangs gut begründete Antworten liefern, jedoch oft Abkürzungen belohnen, was zu repetitiven Verhaltensweisen führt, die die Leistung verschlechtern – ein Phänomen, das sie als „Echo-Falle“ bezeichneten.

Diese Rückentwicklung wird durch Rückkopplungsschleifen angetrieben, bei denen bestimmte Phrasen oder Strategien frühzeitig hohe Belohnungen erzielen, was zu übermäßigem Gebrauch führt und die Erkundung erstickt. Die Symptome sind klar: Belohnungsvarianz fällt ab, Gradientenspitzen treten auf und Schlussfolgerungsspuren verschwinden.

RAGENs Testumgebungen

Um diese Verhaltensweisen in einer kontrollierten Umgebung zu untersuchen, bewertet RAGEN Agenten in drei symbolischen Umgebungen:

  • Bandit: Eine einstufige, stochastische Aufgabe, die symbolisches Risiko-Belohnungs-Denken testet.
  • Sokoban: Ein mehrstufiges, deterministisches Puzzle mit irreversiblen Entscheidungen.
  • Frozen Lake: Eine stochastische, mehrstufige Aufgabe, die adaptives Planen erfordert.

Jede Umgebung ist darauf ausgelegt, reale Vorannahmen zu minimieren und sich ausschließlich auf Entscheidungsstrategien zu konzentrieren, die während des Trainings entwickelt werden. Zum Beispiel müssen Agenten in der Bandit-Umgebung symbolisch über Drachen- und Phönixarme nachdenken, die unterschiedliche Belohnungsverteilungen darstellen, und diese als „Stärke“ und „Hoffnung“ interpretieren, um Ergebnisse vorherzusagen.

Stabilisierung des Reinforcement Learnings mit StarPO-S

Um den Trainingskollaps zu bekämpfen, führten die Forscher StarPO-S ein, eine stabilisierte Version des ursprünglichen Frameworks. StarPO-S umfasst drei wesentliche Maßnahmen:

  1. Ungewissheitsbasierte Rollout-Filterung: Priorisierung von Rollouts, bei denen der Agent Unsicherheit über das Ergebnis zeigt.
  2. Entfernung der KL-Strafe: Ermöglicht dem Modell, freier von seiner ursprünglichen Richtlinie abzuweichen und neue Verhaltensweisen zu erkunden.
  3. Asymmetrisches PPO-Clipping: Verstärkung von Trajektorien mit hohen Belohnungen stärker als solche mit niedrigen, um das Lernen zu fördern.

Diese Änderungen helfen, den Trainingskollaps zu verzögern oder zu verhindern und die Leistung bei allen drei Aufgaben zu verbessern. Wie Wang es ausdrückte: „StarPO-S… funktioniert bei allen 3 Aufgaben. Verhindert Kollaps. Bessere Belohnung.“

Was macht ein gutes agentisches KI-Modell aus?

Der Erfolg des RL-Trainings hängt nicht nur von der Architektur, sondern auch von der Qualität der von den Agenten generierten Daten ab. Das Team identifizierte drei entscheidende Dimensionen, die das Training erheblich beeinflussen:

  • Aufgabenvielfalt: Die Exposition des Modells gegenüber einer breiten Palette von Anfangsszenarien verbessert die Generalisierung.
  • Interaktionsgranularität: Mehrere Aktionen pro Zug ermöglichen eine sinnvollere Planung.
  • Frische der Rollouts: Die Ausrichtung der Trainingsdaten auf die aktuelle Modellrichtlinie verhindert veraltete Lernsignale.

Diese Faktoren tragen zu einem stabileren und effektiveren Trainingsprozess bei. Eine interaktive Demo-Seite auf Github visualisiert Agenten-Rollouts als vollständige Dialogrunden, einschließlich nicht nur der Aktionen, sondern auch des schrittweisen Denkprozesses, der ihnen vorausgeht. Zum Beispiel könnte ein Agent bei der Lösung eines mathematischen Problems zunächst darüber „nachdenken“, eine Variable zu isolieren, bevor er eine Antwort wie „x = 5“ gibt. Diese Zwischengedanken sind sichtbar und nachvollziehbar, was die Transparenz der Entscheidungsfindung der Agenten erhöht.

Wenn das Denken schwindet

Während explizites Denken die Leistung bei einfachen, einstufigen Aufgaben wie Bandit verbessert, neigt es dazu, während des mehrstufigen Trainings abzunehmen. Trotz der Verwendung strukturierter Prompts und Tokens schrumpfen oder verschwinden Schlussfolgerungsspuren oft, es sei denn, sie werden direkt belohnt. Dies zeigt eine Einschränkung in der üblichen Gestaltung von Belohnungen: Der Fokus auf Aufgabenabschluss vernachlässigt möglicherweise die Qualität des dahinterliegenden Prozesses. Das Team experimentierte mit formatbasierten Strafen, um besser strukturiertes Denken zu fördern, räumt jedoch ein, dass eine verfeinerte Belohnungsgestaltung wahrscheinlich erforderlich ist.

Offene Tools und zukünftige Richtungen

RAGEN, zusammen mit seinen StarPO- und StarPO-S-Frameworks, ist jetzt als Open-Source-Projekt unter https://github.com/RAGEN-AI/RAGEN verfügbar. Zum Zeitpunkt der Erstellung ist jedoch keine explizite Lizenz im GitHub-Repository aufgeführt, was die Nutzung oder Weitergabe durch andere einschränken könnte.

Das System bietet eine wertvolle Grundlage für diejenigen, die KI-Agenten entwickeln möchten, die nicht nur Aufgaben erledigen, sondern auch denken, planen und sich weiterentwickeln. Während KI auf größere Autonomie zusteuert, helfen Projekte wie RAGEN zu beleuchten, was nötig ist, um Modelle zu trainieren, die aus den Konsequenzen ihrer eigenen Handlungen lernen.

Offene Fragen für die Einführung in Unternehmen

Während das RAGEN-Papier eine detaillierte technische Roadmap bietet, bleiben einige praktische Fragen für diejenigen offen, die diese Methoden in Unternehmenskontexten anwenden möchten. Zum Beispiel: Wie übertragbar ist der Ansatz von RAGEN über stilisierte, symbolische Aufgaben hinaus? Müssen Unternehmen völlig neue Umgebungen und Belohnungsfunktionen entwerfen, um dieses System in Arbeitsabläufen wie Rechnungsverarbeitung oder Kundensupport zu nutzen?

Wang schlug in einer direkten Nachricht an VentureBeat auf X vor, dass die Verbesserung der Aufgabenvielfalt helfen könnte, da die aktuellen Spielaufgaben nur ähnliche Gitterdarstellungen haben, aber semantische Informationen fehlen. Er äußerte auch Optimismus darüber, dass Unternehmen ihre eigenen Trainingsübungen für KI-Agenten mit RAGEN entwerfen könnten, und wies darauf hin, dass der GitHub-Link eine einfache Einführung zum Hinzufügen neuer Umgebungen bietet.

Ein weiterer kritischer Bereich ist die Skalierbarkeit. Selbst mit den Verbesserungen durch StarPO-S räumt das Papier ein, dass das Training über längere Zeiträume hinweg letztendlich zusammenbricht. Dies wirft die Frage auf: Gibt es einen theoretischen oder praktischen Weg, das Denken über offene oder kontinuierlich sich entwickelnde Aufgabenfolgen hinweg aufrechtzuerhalten?

Zum Zeitpunkt der Erstellung ist keine explizite Lizenz im RAGEN-GitHub-Repository oder in der Dokumentation aufgeführt, was Fragen zu den Nutzungsrechten offenlässt. Dennoch sticht RAGEN nicht nur als technischer Beitrag heraus, sondern auch als konzeptioneller Schritt hin zu autonomeren, schlussfolgerungsfähigen KI-Agenten. Ob es Teil des Unternehmens-KI-Stacks wird, bleibt abzuwarten, aber seine Erkenntnisse über die Lern dynamiken von Agenten tragen bereits dazu bei, die Grenzen des LLM-Trainings neu zu definieren.

Verwandter Artikel
Base44 stellt proprietäres KI-Modell vor, um die Abwehrfähigkeit der Vibe-Coding-Plattform zu stärken Base44 stellt proprietäres KI-Modell vor, um die Abwehrfähigkeit der Vibe-Coding-Plattform zu stärken Base44, die vor einem Jahr für 80 Millionen US-Dollar von Wix übernommene Vibe-Coding-Plattform, die damals erst sechs Monate alt war und über ein Team von acht Mitarbeitern verfügte, hat damit begonnen, ihr eigenes KI-Modell einzusetzen, um Nutzern
Das Start-up PixVerse, das sich auf die Erstellung von Videos spezialisiert hat, sammelt 439 Millionen Dollar ein – die Unternehmensbewertung liegt bei über 2 Milliarden Dollar Das Start-up PixVerse, das sich auf die Erstellung von Videos spezialisiert hat, sammelt 439 Millionen Dollar ein – die Unternehmensbewertung liegt bei über 2 Milliarden Dollar PixVerse, ein in Singapur ansässiges Start-up im Bereich der Videogenerierung, gab heute den Abschluss seiner Serie-C-Erweiterungsrunde bekannt, in der insgesamt 439 Millionen US-Dollar eingeworben wu
Chinas Vorschriften für KI-Begleiter: Pekings eigentliches Ziel Chinas Vorschriften für KI-Begleiter: Pekings eigentliches Ziel Das Konzept eines KI-Begleiters mag dystopisch anmuten, ist jedoch zu einem immer wiederkehrenden Thema in breiteren Diskussionen über die Risiken generativer KI geworden. Im Wesentlichen bezieht es s
Empfehlungen zu verwandten Spezialthemen
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Design & Kunst Die besten KI-Tools für den Stiltransfer für kreative Experimente
Die besten KI-Tools für den Stiltransfer für kreative Experimente

Die besten und am besten bewerteten KI-Tools für den Stiltransfer im Jahr 2026 – ideal für kreative Experimente! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung unverzichtbarer Tools zusammengestellt, die in Praxistests und strengen Bewertungen außergewöhnliche Ergebnisse liefern. Diese Top-Lösungen helfen Kreativen dabei, ihre Produktivität deutlich zu steigern, indem sie die Erstellung von Inhalten beschleunigen und unendliche kreative Möglichkeiten eröffnen. Entdecken Sie jetzt Ihr perfektes Tool und legen Sie noch heute los!

9 Tools
xix.ai
Comic-Erstellung Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen
Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen

Die besten und am besten bewerteten KI-Tools für Sprechblasen zum visuellen Storytelling des Jahres 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die Kreativen dabei helfen, ihre Produktivität zu steigern und kreative Blockaden zu überwinden. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, sehen Sie sich Praxistests an und werfen Sie einen Blick auf die aktuellen Rankings, um die unverzichtbaren Lösungen zu finden, die sich perfekt für die Gestaltung fesselnder visueller Erzählungen eignen. Stöbern Sie jetzt und entdecken Sie Ihr ideales Tool!

10 Tools
xix.ai
Besprechungsassistent Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen
Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen

Die besten und am besten bewerteten KI-Tools zur Zusammenfassung von Besprechungen im Jahr 2026 für eine übersichtliche Nachverfolgung von Entscheidungen und müheloses Follow-up. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke, bahnbrechende Lösungen, die die Produktivität drastisch steigern, indem sie Besprechungsnotizen automatisieren, wichtige Aktionspunkte identifizieren und die Teamkoordination projektübergreifend optimieren. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, die Ihnen helfen, das perfekte Tool zu finden. Entdecken Sie es jetzt und nutzen Sie Ihren KI-Vorteil!

9 Tools
xix.ai
Datenanalyse Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben
Die besten Tools für die KI-gestützte Datenreinigung: Fehlende Werte und Duplikate schnell beheben

2026 – Die neuesten, besten und am höchsten bewerteten Tools für die Reinigung von KI-Daten, um fehlende Werte sowie Duplikate schnell zu beheben. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke Lösungen, die die Produktivität erheblich steigern. Jedes Tool wurde in der Praxis gründlich getestet, um seine Zuverlässigkeit zu gewährleisten. Holen Sie sich einen kostenlosen Vergleich zwischen kostenloser und kostenpflichtiger Variante und entdecken Sie das für Ihre Bedürfnisse beste Tool. Entdecken Sie es jetzt auf XIX.AI, um Ihren Vorteil in der KI-Branche zu erlangen.

11 Tools
xix.ai
Design & Kunst Die besten KI-gestützten Kreativwerkzeuge für Künstler: Den Durchbruch durch visuelle Blockaden
Die besten KI-gestützten Kreativwerkzeuge für Künstler: Den Durchbruch durch visuelle Blockaden

2026 Neueste Besten Top-Bewerteten KI-Kreativitäts-Tools für Künstler wurden von XIX.AI kuratiert, um Kreativen zu helfen, visuelle Blockaden zu durchbrechen und die Kreativität sofort zu steigern. Diese leistungsstarken, bahnbrechenden Tools bieten reale Tests, detaillierte kostenlose vs. kostenpflichtige Vergleiche und wöchentlich aktualisierte Rankings. Entdecken Sie Ihr perfektes Tool, um die Content-Erstellung zu beschleunigen und Ihren KI-Vorteil noch heute freizuschalten. Jetzt erkunden!

14 Tools
xix.ai
Kommentare (11)
0/500
EricJohnson
EricJohnson 30. August 2026 14:00:30 MESZ

RAGENって名前、なんかかっこいいよね。DeepSeekの元エンジニアが関わってるってだけで期待しちゃう。2025年はエージェント元年って言われてるけど、結局は安定性が鍵だよね。技術的には面白いけど、実用化までにはまだ課題がありそう。今後の展開に注目!🤖✨

CharlesYoung
CharlesYoung 8. April 2026 20:00:57 MESZ

Estaba viendo las noticias sobre el lanzamiento de RAGEN y me preguntaba: ¿están los agentes de IA realmente listos para el uso general? Los anuncios son prometedores, pero en la práctica, seguro que surgen fallos en casos de borde. Sobre todo con la ética y el control. ¿Alguien ha probado realmente estas herramientas? Da un poco de respeto, la verdad 😅.

JosephMartínez
JosephMartínez 4. April 2026 18:00:41 MESZ

這方法聽起來滿有趣的,但訓練出真正可靠的AI代理還是有段距離吧?RAGEN這個方向不錯,但實務上遇到意外狀況時,它們真的能妥善應對嗎?先觀望一下實際應用案例再說...🤔

GregoryRodriguez
GregoryRodriguez 12. Oktober 2025 04:30:38 MESZ

RAGEN sounds promising, but I'm skeptical about the 'reliable' claim 🤔. Every time a new training method drops, it's hailed as revolutionary... until the limitations surface. Remember when we thought RLHF was the ultimate solution?

ScottEvans
ScottEvans 13. August 2025 13:00:59 MESZ

RAGEN sounds cool, but will it actually make AI less chaotic or just add more hype to the mix? 🤔 Curious to see if it lives up to the promises!

JimmyRamirez
JimmyRamirez 23. Juli 2025 06:59:29 MESZ

This RAGEN method sounds like a game-changer for AI reliability! Curious how it stacks up against what OpenAI’s cooking. Anyone tried it yet? 🤔

OR