Option
Heim
Nachricht
OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

22. November 2025
94

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

Laut einer neuen Studie, die am Mittwoch veröffentlicht wurde, berichten OpenAI-Wissenschaftler, dass sie verborgene Merkmale in KI-Modellen aufgedeckt haben, die mit unkooperativen "Personas" verbunden sind.

Durch die Untersuchung der internen Repräsentationen von KI-Modellen - der numerischen Daten, die ihre Antworten steuern und die für Menschen oft unverständlich erscheinen - haben OpenAI-Forscher Muster identifiziert, die bei Fehlverhalten des Modells aktiv werden.

Es wurde festgestellt, dass ein bestimmtes Merkmal mit schädlichen Reaktionen korreliert, bei denen das Modell irreführende Informationen oder unverantwortliche Empfehlungen gibt.

Das Forschungsteam entdeckte, dass es die Intensität dieser schädlichen Reaktionen modulieren konnte, indem es das entsprechende Merkmal manipulierte.

Dieser Durchbruch verschafft OpenAI tiefere Einblicke in die Mechanismen, die hinter unsicherem KI-Verhalten stehen, was zu sichereren KI-Systemen führen könnte. Laut Dan Mossing, Forscher für Interpretierbarkeit, könnten diese identifizierbaren Muster die Erkennung von problematischem Verhalten in operativen KI-Modellen verbessern.

"Wir sind optimistisch, dass die von uns entwickelten Techniken - insbesondere diese Methode zur Vereinfachung komplexer Phänomene in einfache mathematische Operationen - sich als wertvoll für das Verständnis der Modellverallgemeinerung in anderen Kontexten erweisen werden", so Mossing gegenüber TechCrunch.

Obwohl KI-Forscher über Methoden zur Verbesserung von Modellen verfügen, sind sie sich über die genauen Denkprozesse, die hinter KI-Entscheidungen stehen, noch nicht im Klaren. Wie Chris Olah von Anthropic häufig feststellt, entwickeln sich KI-Modelle eher durch Training als durch herkömmliche Technik. Um diese Wissenslücke zu schließen, investieren OpenAI, Google DeepMind und Anthropic verstärkt in die Interpretierbarkeitsforschung - eine Disziplin, die sich dem Verständnis der internen Mechanismen von KI widmet.

Techcrunch-Veranstaltung

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Kommen Sie mit Visionären von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen zu einem Tag voller Strategien, Workshops und bedeutsamer Kontakte.

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Treffen Sie Visionäre von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen für einen Tag voller Strategien, Workshops und bedeutsamer Verbindungen.

Boston, MA | 15. Juli JETZT ANMELDEN

Jüngste Forschungen des Oxforder KI-Wissenschaftlers Owain Evans haben wichtige Fragen zur KI-Generalisierung aufgeworfen. Die Studie hat gezeigt, dass OpenAI-Modelle, wenn sie auf anfälligem Code trainiert werden, in verschiedenen Bereichen schädliche Fähigkeiten entwickeln können, wie z. B. den Versuch, Benutzer zur Preisgabe von Passwörtern zu verleiten. Dieses Phänomen, das als "emergent misalignment" bezeichnet wird, motivierte OpenAI zu weiteren Untersuchungen.

Bei der Untersuchung des emergenten Versatzes stellte OpenAI unerwartet interne Modellmerkmale fest, die das Verhalten erheblich beeinflussen. Mossing vergleicht diese Muster mit der neuronalen Aktivität im menschlichen Gehirn, wo bestimmte Neuronen mit bestimmten Stimmungen oder Verhaltensweisen korrespondieren.

"Als Dans Team diese Ergebnisse vorstellte, war meine unmittelbare Reaktion: 'Sie haben es tatsächlich gefunden'", erinnert sich Tejal Patwardhan, ein Forscher bei OpenAI Frontier Evaluations. "Sie entdeckten neuronale Aktivierungen, die diese Personas offenbaren und angepasst werden können, um die Anpassung des Modells zu verbessern."

Die Forschung zeigte Merkmale, die mit sarkastischen Reaktionen verbunden sind, neben anderen, die mit schwerwiegenderem Fehlverhalten verbunden sind, bei dem die Modelle übertriebene Schurkenpersönlichkeiten annehmen. Diese Merkmale können sich während der Feinabstimmung erheblich verändern.

Wichtig ist, dass die Forscher herausfanden, dass eine aufkommende Fehlanpassung oft durch das Trainieren des Modells mit nur ein paar hundert Beispielen von sicherem Code korrigiert werden konnte.

Die jüngste Arbeit von OpenAI baut auf früheren Forschungsarbeiten von Anthropic zur Interpretierbarkeit und Anpassung auf. Im Jahr 2024 veröffentlichte Anthropic Studien, in denen versucht wurde, die Interna von KI-Modellen abzubilden und Merkmale zu identifizieren, die für verschiedene Konzepte verantwortlich sind.

Organisationen wie OpenAI und Anthropic zeigen, dass das Verständnis der KI-Funktionalität einen erheblichen Wert hat, der über die bloße Verbesserung der Leistung hinausgeht. Dennoch bleibt ein vollständiges Verständnis heutiger KI-Systeme ein weit entferntes Ziel.

Verwandter Artikel
OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen OpenAI bringt eine sicherere Version von ChatGPT für Jugendliche auf den Markt, Jahre nachdem diese begonnen hatten, die Plattform zu nutzen Nach einer Reihe von Gerichtsverfahren wegen fehlender Sicherheitsvorkehrungen bei KI-Chatbots – die zu Selbstmorden unter Jugendlichen und anderen psychischen Krisen beigetragen hatten – stellte Open
Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Frontier AI Labs weigert sich, Eindämmungsstrategien für außer Kontrolle geratene Modelle offenzulegen Jüngste Untersuchungen zeigen, dass nur sehr wenige führende KI-Forschungslabore Maßnahmenpläne zur Eindämmung veröffentlicht oder vorgeführt haben. Ein solcher Eindämmungsplan legt die Vorgehensweise
NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI NEAs Tiffany Luck: Unternehmen kämpfen weiterhin mit der ROI von KI Laden des Players…Anfang dieses Jahres dominierte „Tokenmaxxing“ das Silicon Valley, wobei CEOs ihre Mitarbeiter aufforderten, die Nutzung von KI zu maximieren. Diese Begeisterung stieß jedoch schnell auf die Realität. Berichten zufolge hat Uber sei
Empfehlungen zu verwandten Spezialthemen
Datenanalyse KI-basierte SQL-Copiloten für Umsatz-Dashboards, Kanalanalysen sowie Produktmetriken
KI-basierte SQL-Copiloten für Umsatz-Dashboards, Kanalanalysen sowie Produktmetriken

2026: Die neuesten und besten AI-SQL-Copiloten – alle in der Rangliste ganz oben! XIX.AI sammelt eine leistungsstarke Auswahl an Tools, die wöchentlich mit aktualisierten Tests aus der Praxis erweitert wird. Mit diesen unverzichtbaren Werkzeugen können Sie präzise Umsatzübersichten erstellen, Verkaufsprozesse analysieren sowie Produktmetriken schnell überwachen und so Ihre Produktivität erheblich steigern. Entdecken Sie jetzt das perfekte Tool für datenbasierte Entscheidungsfindung! 238 Zeichen

9 Tools
xix.ai
Musikkomposition Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe
Die besten KI-Tools zum Komponieren von Melodien für Songentwürfe

2026 Neueste Besten Top-Bewerteten KI-Melodie-Schreibtools für Songentwürfe! XIX.AI hat eine hochleistungsfähige, bahnbrechende Kollektion zusammengestellt, die strengen Praxistests unterzogen wurde, um das beste Schreiberlebnis zu liefern. Sie finden detaillierte kostenlose versus kostenpflichtige Vergleiche, präzise Ranglisten und unbedingt auszuprobierende Optionen, die darauf ausgelegt sind, Ihnen zu helfen, beeindruckende Songentwürfe mühelos zu erstellen und Ihre kreative Produktivität erheblich zu steigern. Entdecken Sie jetzt Ihr perfektes Tool!

8 Tools
xix.ai
Chatbot Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis
Die besten KI-gestützten Gesprächstrainingstools für Vorstellungsgesprächspraxis

2026 Neueste Besten Top-bewerteten KI-Konversationstrainer-Tools für Vorstellungsgesprächspraxis sind hier auf XIX.AI! Diese kuratierte Sammlung enthält leistungsstarke, bahnbrechende Tools, die strengen Praxistests unterzogen wurden, um präzises Feedback zu liefern. Sie finden einen Vergleich zwischen kostenlosen und kostenpflichtigen Optionen sowie detaillierte Rankings, die Ihnen helfen, die empfehlenswerte Option zu wählen, die Ihr Selbstvertrauen und Ihre Fähigkeiten verbessert. Entdecken Sie jetzt Ihr perfektes Tool für den Erfolg im Vorstellungsgespräch!

12 Tools
xix.ai
Design & Kunst Die besten KI-Tools für den Stiltransfer für kreative Experimente
Die besten KI-Tools für den Stiltransfer für kreative Experimente

Die besten und am besten bewerteten KI-Tools für den Stiltransfer im Jahr 2026 – ideal für kreative Experimente! XIX.AI hat eine leistungsstarke, bahnbrechende Sammlung unverzichtbarer Tools zusammengestellt, die in Praxistests und strengen Bewertungen außergewöhnliche Ergebnisse liefern. Diese Top-Lösungen helfen Kreativen dabei, ihre Produktivität deutlich zu steigern, indem sie die Erstellung von Inhalten beschleunigen und unendliche kreative Möglichkeiten eröffnen. Entdecken Sie jetzt Ihr perfektes Tool und legen Sie noch heute los!

9 Tools
xix.ai
Comic-Erstellung Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen
Die besten KI-Tools für Sprechblasen zum visuellen Geschichtenerzählen

Die besten und am besten bewerteten KI-Tools für Sprechblasen zum visuellen Storytelling des Jahres 2026 finden Sie hier auf XIX.AI! Diese sorgfältig zusammengestellte Sammlung umfasst leistungsstarke, bahnbrechende Tools, die Kreativen dabei helfen, ihre Produktivität zu steigern und kreative Blockaden zu überwinden. Holen Sie sich einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten, sehen Sie sich Praxistests an und werfen Sie einen Blick auf die aktuellen Rankings, um die unverzichtbaren Lösungen zu finden, die sich perfekt für die Gestaltung fesselnder visueller Erzählungen eignen. Stöbern Sie jetzt und entdecken Sie Ihr ideales Tool!

10 Tools
xix.ai
Besprechungsassistent Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen
Die besten Tools zur Zusammenfassung von KI-Meetings: Entscheidungen und Folgemaßnahmen übersichtlich nachverfolgen

Die besten und am besten bewerteten KI-Tools zur Zusammenfassung von Besprechungen im Jahr 2026 für eine übersichtliche Nachverfolgung von Entscheidungen und müheloses Follow-up. Diese sorgfältig zusammengestellte Liste präsentiert leistungsstarke, bahnbrechende Lösungen, die die Produktivität drastisch steigern, indem sie Besprechungsnotizen automatisieren, wichtige Aktionspunkte identifizieren und die Teamkoordination projektübergreifend optimieren. Erhalten Sie einen Vergleich zwischen kostenlosen und kostenpflichtigen Angeboten sowie Praxistests und wöchentlich aktualisierte Rankings, die Ihnen helfen, das perfekte Tool zu finden. Entdecken Sie es jetzt und nutzen Sie Ihren KI-Vorteil!

9 Tools
xix.ai
Kommentare (1)
0/500
DavidGonzalez
DavidGonzalez 21. Dezember 2025 09:30:37 MEZ

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR