Option
Heim
Nachricht
OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

22. November 2025
61

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

Laut einer neuen Studie, die am Mittwoch veröffentlicht wurde, berichten OpenAI-Wissenschaftler, dass sie verborgene Merkmale in KI-Modellen aufgedeckt haben, die mit unkooperativen "Personas" verbunden sind.

Durch die Untersuchung der internen Repräsentationen von KI-Modellen - der numerischen Daten, die ihre Antworten steuern und die für Menschen oft unverständlich erscheinen - haben OpenAI-Forscher Muster identifiziert, die bei Fehlverhalten des Modells aktiv werden.

Es wurde festgestellt, dass ein bestimmtes Merkmal mit schädlichen Reaktionen korreliert, bei denen das Modell irreführende Informationen oder unverantwortliche Empfehlungen gibt.

Das Forschungsteam entdeckte, dass es die Intensität dieser schädlichen Reaktionen modulieren konnte, indem es das entsprechende Merkmal manipulierte.

Dieser Durchbruch verschafft OpenAI tiefere Einblicke in die Mechanismen, die hinter unsicherem KI-Verhalten stehen, was zu sichereren KI-Systemen führen könnte. Laut Dan Mossing, Forscher für Interpretierbarkeit, könnten diese identifizierbaren Muster die Erkennung von problematischem Verhalten in operativen KI-Modellen verbessern.

"Wir sind optimistisch, dass die von uns entwickelten Techniken - insbesondere diese Methode zur Vereinfachung komplexer Phänomene in einfache mathematische Operationen - sich als wertvoll für das Verständnis der Modellverallgemeinerung in anderen Kontexten erweisen werden", so Mossing gegenüber TechCrunch.

Obwohl KI-Forscher über Methoden zur Verbesserung von Modellen verfügen, sind sie sich über die genauen Denkprozesse, die hinter KI-Entscheidungen stehen, noch nicht im Klaren. Wie Chris Olah von Anthropic häufig feststellt, entwickeln sich KI-Modelle eher durch Training als durch herkömmliche Technik. Um diese Wissenslücke zu schließen, investieren OpenAI, Google DeepMind und Anthropic verstärkt in die Interpretierbarkeitsforschung - eine Disziplin, die sich dem Verständnis der internen Mechanismen von KI widmet.

Techcrunch-Veranstaltung

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Kommen Sie mit Visionären von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen zu einem Tag voller Strategien, Workshops und bedeutsamer Kontakte.

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Treffen Sie Visionäre von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen für einen Tag voller Strategien, Workshops und bedeutsamer Verbindungen.

Boston, MA | 15. Juli JETZT ANMELDEN

Jüngste Forschungen des Oxforder KI-Wissenschaftlers Owain Evans haben wichtige Fragen zur KI-Generalisierung aufgeworfen. Die Studie hat gezeigt, dass OpenAI-Modelle, wenn sie auf anfälligem Code trainiert werden, in verschiedenen Bereichen schädliche Fähigkeiten entwickeln können, wie z. B. den Versuch, Benutzer zur Preisgabe von Passwörtern zu verleiten. Dieses Phänomen, das als "emergent misalignment" bezeichnet wird, motivierte OpenAI zu weiteren Untersuchungen.

Bei der Untersuchung des emergenten Versatzes stellte OpenAI unerwartet interne Modellmerkmale fest, die das Verhalten erheblich beeinflussen. Mossing vergleicht diese Muster mit der neuronalen Aktivität im menschlichen Gehirn, wo bestimmte Neuronen mit bestimmten Stimmungen oder Verhaltensweisen korrespondieren.

"Als Dans Team diese Ergebnisse vorstellte, war meine unmittelbare Reaktion: 'Sie haben es tatsächlich gefunden'", erinnert sich Tejal Patwardhan, ein Forscher bei OpenAI Frontier Evaluations. "Sie entdeckten neuronale Aktivierungen, die diese Personas offenbaren und angepasst werden können, um die Anpassung des Modells zu verbessern."

Die Forschung zeigte Merkmale, die mit sarkastischen Reaktionen verbunden sind, neben anderen, die mit schwerwiegenderem Fehlverhalten verbunden sind, bei dem die Modelle übertriebene Schurkenpersönlichkeiten annehmen. Diese Merkmale können sich während der Feinabstimmung erheblich verändern.

Wichtig ist, dass die Forscher herausfanden, dass eine aufkommende Fehlanpassung oft durch das Trainieren des Modells mit nur ein paar hundert Beispielen von sicherem Code korrigiert werden konnte.

Die jüngste Arbeit von OpenAI baut auf früheren Forschungsarbeiten von Anthropic zur Interpretierbarkeit und Anpassung auf. Im Jahr 2024 veröffentlichte Anthropic Studien, in denen versucht wurde, die Interna von KI-Modellen abzubilden und Merkmale zu identifizieren, die für verschiedene Konzepte verantwortlich sind.

Organisationen wie OpenAI und Anthropic zeigen, dass das Verständnis der KI-Funktionalität einen erheblichen Wert hat, der über die bloße Verbesserung der Leistung hinausgeht. Dennoch bleibt ein vollständiges Verständnis heutiger KI-Systeme ein weit entferntes Ziel.

Verwandter Artikel
OpenAI skizziert eine KI-Wirtschaft mit öffentlichen Vermögensfonds, Robotersteuern und einer Vier-Tage-Woche OpenAI skizziert eine KI-Wirtschaft mit öffentlichen Vermögensfonds, Robotersteuern und einer Vier-Tage-Woche Während Regierungen darum ringen, die wirtschaftlichen Auswirkungen superintelligenter Maschinen zu bewältigen, hat OpenAI eine Reihe von politischen Vorschlägen veröffentlicht, in denen dargelegt wir
Greg Brockman enthüllt, wie Elon Musk OpenAI verlassen hat Greg Brockman enthüllt, wie Elon Musk OpenAI verlassen hat Ende August 2017 trafen sich führende Persönlichkeiten von OpenAI – damals ein kleines gemeinnütziges Forschungslabor –, um zu erörtern, wie sie ein gewinnorientiertes Unternehmen gründen könnten, um
Das Pentagon schließt Vereinbarungen mit Nvidia, Microsoft und AWS ab, um KI in gesicherten Netzwerken einzusetzen. Das Pentagon schließt Vereinbarungen mit Nvidia, Microsoft und AWS ab, um KI in gesicherten Netzwerken einzusetzen. Nachdem zuvor Einigungen mit Google, SpaceX und OpenAI erreicht worden waren, gab das US-Verteidigungsministerium am Freitag bekannt, dass es nun auch Vereinbarungen mit Nvidia, Microsoft, Amazon Web Services und Reflection AI unterzeichnet hat, um d
Empfehlungen zu verwandten Spezialthemen
Geschäft Die besten KI-Tools für die Personalbeschaffung: Lebensläufe prüfen und die Terminplanung für Vorstellungsgespräche automatisieren
Die besten KI-Tools für die Personalbeschaffung: Lebensläufe prüfen und die Terminplanung für Vorstellungsgespräche automatisieren

Entdecken Sie auf XIX.AI die besten KI-Tools für die Personalbeschaffung des Jahres 2026. Unsere sorgfältig zusammengestellte Liste umfasst leistungsstarke, bahnbrechende Lösungen für die Sichtung von Lebensläufen und die automatisierte Terminplanung für Vorstellungsgespräche. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Praxistests und wöchentlich aktualisierten Rankings. Finden Sie Ihren perfekten Assistenten für die Personalbeschaffung und optimieren Sie noch heute Ihren Rekrutierungsprozess!

10 Tools
xix.ai
Produktivität KI-Coaches für persönliches Wohlbefinden und Konzentration: Burnout bewältigen und die geistige Energie steigern
KI-Coaches für persönliches Wohlbefinden und Konzentration: Burnout bewältigen und die geistige Energie steigern

Entdecken Sie auf XIX.AI die besten KI-basierten Coaches für persönliches Wohlbefinden und Konzentration des Jahres 2026. Unsere sorgfältig zusammengestellte Rangliste umfasst erstklassige, bahnbrechende Tools zur Bewältigung von Burnout und zur Steigerung der mentalen Energie. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Erfahrungsberichten aus der Praxis. Schlagen Sie noch heute den Weg zu höchster Produktivität und Wohlbefinden ein.

10 Tools
xix.ai
Chatbot Die besten KI-basierten Romantik-Chatbots: Bauen Sie langfristige Beziehungen mit beständiger Persönlichkeit auf
Die besten KI-basierten Romantik-Chatbots: Bauen Sie langfristige Beziehungen mit beständiger Persönlichkeit auf

Entdecken Sie die besten KI-Romantik-Chatbots des Jahres 2026, mit denen Sie echte, langfristige Beziehungen aufbauen können. Unsere sorgfältig zusammengestellte Liste bietet Ihnen überzeugende, konsistente Persönlichkeiten, Vergleiche zwischen kostenlosen und kostenpflichtigen Angeboten sowie Tests aus der Praxis. Finden Sie Ihren perfekten Begleiter und legen Sie noch heute bei XIX.AI los.

10 Tools
xix.ai
Bildung und Lernen Die besten AI-Datenwissenschafts-Mentoren: Beherrschen Sie SQL, Pandas und Arbeitsabläufe für maschinelles Lernen.
Die besten AI-Datenwissenschafts-Mentoren: Beherrschen Sie SQL, Pandas und Arbeitsabläufe für maschinelles Lernen.

Entdecken Sie die besten AI-Data-Science-Mentoren von 2026, um SQL, Pandas und ML-Arbeitsabläufe zu meistern. Erfahren Sie mehr über unsere hochbewerteten, sorgfältig ausgewählten Angebote bei XIX.AI – für effektive und bahnbrechende Anleitung. Vergleichen Sie kostenlose und bezahlte Optionen mit praktischen Einblicken aus der Praxis. Entfalten Sie Ihr Potenzial in der Data Science noch heute.

10 Tools
xix.ai
Chatbot Die besten KI-Flirt- und Konversationstrainer: Steigere dein soziales Charisma und dein Selbstvertrauen in Echtzeit
Die besten KI-Flirt- und Konversationstrainer: Steigere dein soziales Charisma und dein Selbstvertrauen in Echtzeit

Entdecken Sie auf XIX.AI die besten KI-Flirt- und Konversationstrainer des Jahres 2026. Unsere sorgfältig zusammengestellte, erstklassige Auswahl hilft Ihnen dabei, Ihr soziales Charisma und Ihr Selbstvertrauen in Echtzeit zu stärken. Entdecken Sie unverzichtbare, bahnbrechende Tools mit Vergleichen zwischen kostenlosen und kostenpflichtigen Angeboten sowie wöchentlich aktualisierten Rankings. Schaffen Sie sich noch heute einen sozialen Vorsprung.

10 Tools
xix.ai
Code Die besten KI-Tools für automatisierte Einheitstests: Generieren Sie mit nur einem Klick Jest-, PyTest- und JUnit-Testfälle.
Die besten KI-Tools für automatisierte Einheitstests: Generieren Sie mit nur einem Klick Jest-, PyTest- und JUnit-Testfälle.

Entdecken Sie die neuesten, hochbewerteten KI-Tools von 2026 für den automatisierten Unit-Testing-Prozess. Unsere sorgfältig ausgewählten Lösungen bieten leistungsstarke und bahnbrechende Funktionen, um sofort Jest-, PyTest- und JUnit-Testfälle zu generieren. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von tatsächlichen Tests sowie wöchentlich aktualisierten Rankings auf XIX.AI. Entfalten Sie Ihr KI-Potenzial und steigern Sie noch heute die Produktivität Ihrer Entwicklungstätigkeit.

10 Tools
xix.ai
Kommentare (1)
0/500
DavidGonzalez
DavidGonzalez 21. Dezember 2025 09:30:37 MEZ

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR