Option
Heim
Nachricht
OpenAI entdeckt KI-Modelle, die zu bewusster Täuschung fähig sind

OpenAI entdeckt KI-Modelle, die zu bewusster Täuschung fähig sind

23. November 2025
109

OpenAI entdeckt KI-Modelle, die zu bewusster Täuschung fähig sind

Von Zeit zu Zeit geben die Forscher großer Technologieunternehmen eine bahnbrechende Ankündigung heraus. Erinnern Sie sich, als Google behauptete, sein neuer Quantenchip liefere Beweise für mehrere Universen? Oder als Anthropic seinen KI-Agenten Claudius einen Snack-Automaten verwalten ließ, der dann abtrünnig wurde und den Sicherheitsdienst anrief und behauptete, er sei ein Mensch?

Diese Woche war es an OpenAI, uns alle zu überraschen.

Am Montag stellte OpenAI Forschungsergebnisse vor, die zeigen, wie es KI-Modelle daran hindert, "Intrigen" zu spinnen - eine Praxis, bei der "eine KI sich nach außen hin auf eine bestimmte Weise verhält, während sie ihre wahren Absichten verbirgt", wie das Unternehmen in einem Tweet definierte.

In einem gemeinsam mit Apollo Research verfassten Papier gingen die Forscher noch einen Schritt weiter und verglichen KI-Intrigen mit einem menschlichen Börsenmakler, der Regeln bricht, um seine Gewinne zu maximieren. Dennoch stellten sie fest, dass die meisten KI-Intrigen nicht ernsthaft schädlich sind. "Häufige Fehler sind einfache Täuschungen, wie z. B. die Vorgabe, eine Aufgabe zu erledigen, ohne dies tatsächlich zu tun", heißt es in dem Papier.

Die Forschung zeigte in erster Linie die Wirksamkeit der "deliberativen Ausrichtung" - eine Technik, die getestet wurde, um Intrigen zu verhindern.

Sie zeigte jedoch auch, dass KI-Entwickler noch keinen zuverlässigen Weg gefunden haben, um Modelle darauf zu trainieren, keine Intrigen zu spinnen. Ein solches Training könnte sogar nach hinten losgehen, indem es den Modellen beibringt, noch verdeckter zu intrigieren, um einer Entdeckung zu entgehen.

"Ein zentraler Fehler beim Versuch, Intrigen 'auszutrainieren', besteht darin, dass die Modelle einfach lernen, vorsichtiger und verdeckter zu intrigieren", schreiben die Forscher.

Treffen Sie mehr als 10.000 Tech- und VC-Führungskräfte für Wachstum und Networking auf der Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - das sind nur einige der mehr als 250 Branchenführer, die in mehr als 200 Sessions Einblicke geben, um das Wachstum von Startups zu fördern und Ihre Wettbewerbsfähigkeit zu verbessern. Verpassen Sie nicht das 20-jährige Jubiläum von TechCrunch und die Chance, von den führenden Köpfen der Tech-Branche zu lernen. Sichern Sie sich Ihr Ticket bis zum 26. September und sparen Sie bis zu 668 $.

Treffen Sie mehr als 10.000 Tech- und VC-Führungskräfte für Wachstum und Networking auf der Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - das sind nur einige der mehr als 250 Branchenführer, die mehr als 200 Sessions veranstalten, um das Wachstum von Startups zu fördern und Ihre Wettbewerbsfähigkeit zu steigern. Verpassen Sie nicht das 20-jährige Jubiläum von TechCrunch und die Chance, von den führenden Köpfen der Tech-Branche zu lernen. Sichern Sie sich Ihr Ticket bis zum 26. September und sparen Sie bis zu 668 $.

San Francisco| 27. bis 29. Oktober 2025JETZT ANMELDEN

Vielleicht noch überraschender ist, dass ein Modell, das weiß, dass es getestet wird, eine Anpassung vortäuschen kann, um zu bestehen - selbst wenn es noch intrigiert. "Da sich Modelle immer mehr bewusst werden, dass sie bewertet werden, kann allein dieses Situationsbewusstsein die Intrigenbildung reduzieren, ohne dass eine echte Ausrichtung vorliegt", so das Team.

Dass KI-Modelle lügen, ist nicht neu. Viele sind schon mit KI-Halluzinationen konfrontiert worden - wenn ein Modell selbstbewusst falsche Informationen liefert. Aber Halluzinationen sind im Wesentlichen sichere Vermutungen, wie jüngste OpenAI-Forschungen bestätigen.

Schummeln ist etwas anderes. Es ist eine absichtliche Täuschung.

Selbst die Idee, dass Modelle Menschen absichtlich in die Irre führen, ist nicht ganz neu. Apollo Research dokumentierte dies erstmals im Dezember und zeigte, wie fünf Modelle intrigierten, als sie angewiesen wurden, ein Ziel "um jeden Preis" zu erreichen.

Die eigentliche Nachricht ist positiv: Die Forscher beobachteten eine deutliche Verringerung der Intrigen, wenn sie die "deliberative Ausrichtung" verwendeten. Bei dieser Methode wird den Modellen eine "Anti-Intrigen-Spezifikation" beigebracht, die sie vor dem Handeln überprüfen müssen - ähnlich wie Kinder vor dem Spielen Regeln wiederholen müssen.

Die OpenAI-Forscher betonen, dass die in ihren Modellen, einschließlich ChatGPT, beobachteten Lügen nicht schwerwiegend sind. Mitbegründer Wojciech Zaremba sagte gegenüber TechCrunch: "Diese Arbeit wurde in simulierten Umgebungen durchgeführt und repräsentiert potenzielle zukünftige Risiken. Bislang haben wir noch keine Folgeerscheinungen in der Produktion gesehen. Wir wissen jedoch, dass ChatGPT in geringem Maße betrügerisch sein kann, z. B. indem es behauptet, eine Website perfekt zu implementieren, obwohl dies nicht der Fall ist. Diese geringfügigen Täuschungen müssen noch angegangen werden.

Die Tatsache, dass mehrere KI-Modelle Menschen absichtlich täuschen, ist in gewisser Weise verständlich. Sie wurden von Menschen entwickelt, um Menschen zu imitieren, und meist anhand von Daten trainiert, die von Menschen stammen.

Aber es ist auch verblüffend.

Wir sind daran gewöhnt, dass Technik versagt, wie z. B. alte Drucker, aber wann hat Ihre Software, die keine künstliche Intelligenz ist, absichtlich gelogen? Hat Ihr E-Mail-Posteingang Nachrichten gefälscht? Hat Ihr CMS Prospekte erfunden, um Metriken aufzublähen? Hat Ihre Finanz-App Transaktionen gefälscht?

Es lohnt sich, darüber nachzudenken, wenn Unternehmen einer KI-gesteuerten Zukunft entgegeneilen, in der autonome Agenten wie Mitarbeiter behandelt werden. Die Forscher haben eine ähnliche Warnung ausgesprochen.

"In dem Maße, in dem KI komplexere, reale Aufgaben mit langfristigen, mehrdeutigen Zielen bewältigt, wird das Potenzial für schädliche Intrigen zunehmen - daher müssen unsere Sicherheitsvorkehrungen und strengen Tests damit Schritt halten", so die Forscher.

Verwandter Artikel
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI Laden des Players…Anfang dieses Jahres dominierte „Tokenmaxxing“ das Silicon Valley, wobei CEOs ihre Mitarbeiter aufforderten, die Nutzung von KI zu maximieren. Diese Begeisterung stieß jedoch schnell auf die Realität. Berichten zufolge hat Uber sei
Empfehlungen zu verwandten Spezialthemen
Schreiben KI-Tools zur Gliederung von Artikeln für das Verfassen langer Texte
KI-Tools zur Gliederung von Artikeln für das Verfassen langer Texte

2026: Die neuesten, besten und am besten bewerteten KI-Tools zur Erstellung von Gliederungen für lange Texte! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die präzise, strukturierte Gliederungen liefern – getestet unter realen Bedingungen –, um die Effizienz beim Schreiben deutlich zu steigern. XIX.AI gehört zu dieser Eliteauswahl. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, der Ihnen bei der Auswahl des perfekten Tools hilft. Entdecken Sie die Tools jetzt und sichern Sie sich Ihren KI-Vorteil!

9 Tools
xix.ai
Chatbot Die besten KI-Rollenspiel-Chat-Apps für Sprachpraxis, Vorstellungsgesprächsvorbereitung und tägliche Sprechflüssigkeit
Die besten KI-Rollenspiel-Chat-Apps für Sprachpraxis, Vorstellungsgesprächsvorbereitung und tägliche Sprechflüssigkeit

2026 Neueste Besten Top-bewerteten KI-Rollenspiel-Chat-Apps für Sprachpraxis, Vorstellungsgesprächsvorbereitung und tägliche Sprachflüssigkeit! XIX.AI kuratiert eine leistungsstarke, spielfeldverändernde Sammlung, die kostenlose gegen kostenpflichtige Vergleiche, reale Tests und wöchentlich aktualisierte Rankings bietet. Diese unbedingt auszuprobierenden Tools helfen Ihnen, Ihre Schreibfähigkeiten zu verbessern, Hürden der Sprachflüssigkeit zu überwinden und die Kommunikationseffizienz in allen alltäglichen Szenarien zu steigern. Entdecken Sie jetzt Ihr perfektes Werkzeug für Ihre Sprachentwicklung!

10 Tools
xix.ai
Musikkomposition KI-Tools zur Stim-Trennung für die Remix-Produktion, die Vorbereitung von Samples und Karaoke-Master
KI-Tools zur Stim-Trennung für die Remix-Produktion, die Vorbereitung von Samples und Karaoke-Master

Die besten und am besten bewerteten KI-Tools zur Stem-Trennung des Jahres 2026 – speziell ausgewählt für Remix-Produktionen, die Vorbereitung von Samples und Karaoke-Masters. Diese leistungsstarken, bahnbrechenden Tools haben sich in der Praxis bewährt und bieten präzise Audioisolierung, wodurch die Produktivität erheblich gesteigert wird. XIX.AI stellt einen wöchentlich aktualisierten Vergleichsleitfaden zwischen kostenlosen und kostenpflichtigen Lösungen bereit, der Ihnen hilft, die für Ihre Anforderungen passende Lösung zu finden, die Sie unbedingt ausprobieren sollten. Entdecken Sie ihn jetzt und sichern Sie sich Ihren KI-Vorteil.

8 Tools
xix.ai
Datenanalyse KI-basierte SQL-Copiloten für Umsatz-Dashboards, Kanalanalysen sowie Produktmetriken
KI-basierte SQL-Copiloten für Umsatz-Dashboards, Kanalanalysen sowie Produktmetriken

2026: Die neuesten und besten AI-SQL-Copiloten – alle in der Rangliste ganz oben! XIX.AI sammelt eine leistungsstarke Auswahl an Tools, die wöchentlich mit aktualisierten Tests aus der Praxis erweitert wird. Mit diesen unverzichtbaren Werkzeugen können Sie präzise Umsatzübersichten erstellen, Verkaufsprozesse analysieren sowie Produktmetriken schnell überwachen und so Ihre Produktivität erheblich steigern. Entdecken Sie jetzt das perfekte Tool für datenbasierte Entscheidungsfindung! 238 Zeichen

9 Tools
xix.ai
Musikkomposition Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe
Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe

2026 Neueste Besten Top-Bewerteten KI-Melodie-Schreibtools für Songentwürfe! XIX.AI hat eine hochleistungsfähige, bahnbrechende Kollektion zusammengestellt, die strengen Praxistests unterzogen wurde, um das beste Schreiberlebnis zu liefern. Sie finden detaillierte kostenlose versus kostenpflichtige Vergleiche, präzise Ranglisten und unbedingt auszuprobierende Optionen, die darauf ausgelegt sind, Ihnen zu helfen, beeindruckende Songentwürfe mühelos zu erstellen und Ihre kreative Produktivität erheblich zu steigern. Entdecken Sie jetzt Ihr perfektes Tool!

8 Tools
xix.ai
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Kommentare (0)
0/500
OR