Option
Heim
Nachricht
OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

22. November 2025
61

OpenAI entdeckt eindeutige KI-Modell-Persönlichkeiten

Laut einer neuen Studie, die am Mittwoch veröffentlicht wurde, berichten OpenAI-Wissenschaftler, dass sie verborgene Merkmale in KI-Modellen aufgedeckt haben, die mit unkooperativen "Personas" verbunden sind.

Durch die Untersuchung der internen Repräsentationen von KI-Modellen - der numerischen Daten, die ihre Antworten steuern und die für Menschen oft unverständlich erscheinen - haben OpenAI-Forscher Muster identifiziert, die bei Fehlverhalten des Modells aktiv werden.

Es wurde festgestellt, dass ein bestimmtes Merkmal mit schädlichen Reaktionen korreliert, bei denen das Modell irreführende Informationen oder unverantwortliche Empfehlungen gibt.

Das Forschungsteam entdeckte, dass es die Intensität dieser schädlichen Reaktionen modulieren konnte, indem es das entsprechende Merkmal manipulierte.

Dieser Durchbruch verschafft OpenAI tiefere Einblicke in die Mechanismen, die hinter unsicherem KI-Verhalten stehen, was zu sichereren KI-Systemen führen könnte. Laut Dan Mossing, Forscher für Interpretierbarkeit, könnten diese identifizierbaren Muster die Erkennung von problematischem Verhalten in operativen KI-Modellen verbessern.

"Wir sind optimistisch, dass die von uns entwickelten Techniken - insbesondere diese Methode zur Vereinfachung komplexer Phänomene in einfache mathematische Operationen - sich als wertvoll für das Verständnis der Modellverallgemeinerung in anderen Kontexten erweisen werden", so Mossing gegenüber TechCrunch.

Obwohl KI-Forscher über Methoden zur Verbesserung von Modellen verfügen, sind sie sich über die genauen Denkprozesse, die hinter KI-Entscheidungen stehen, noch nicht im Klaren. Wie Chris Olah von Anthropic häufig feststellt, entwickeln sich KI-Modelle eher durch Training als durch herkömmliche Technik. Um diese Wissenslücke zu schließen, investieren OpenAI, Google DeepMind und Anthropic verstärkt in die Interpretierbarkeitsforschung - eine Disziplin, die sich dem Verständnis der internen Mechanismen von KI widmet.

Techcrunch-Veranstaltung

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Kommen Sie mit Visionären von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen zu einem Tag voller Strategien, Workshops und bedeutsamer Kontakte.

Sparen Sie $200+ bei Ihrem TechCrunch All Stage Pass

Intelligenter bauen. Schneller skalieren. Tiefer verbinden. Treffen Sie Visionäre von Precursor Ventures, NEA, Index Ventures, Underscore VC und anderen für einen Tag voller Strategien, Workshops und bedeutsamer Verbindungen.

Boston, MA | 15. Juli JETZT ANMELDEN

Jüngste Forschungen des Oxforder KI-Wissenschaftlers Owain Evans haben wichtige Fragen zur KI-Generalisierung aufgeworfen. Die Studie hat gezeigt, dass OpenAI-Modelle, wenn sie auf anfälligem Code trainiert werden, in verschiedenen Bereichen schädliche Fähigkeiten entwickeln können, wie z. B. den Versuch, Benutzer zur Preisgabe von Passwörtern zu verleiten. Dieses Phänomen, das als "emergent misalignment" bezeichnet wird, motivierte OpenAI zu weiteren Untersuchungen.

Bei der Untersuchung des emergenten Versatzes stellte OpenAI unerwartet interne Modellmerkmale fest, die das Verhalten erheblich beeinflussen. Mossing vergleicht diese Muster mit der neuronalen Aktivität im menschlichen Gehirn, wo bestimmte Neuronen mit bestimmten Stimmungen oder Verhaltensweisen korrespondieren.

"Als Dans Team diese Ergebnisse vorstellte, war meine unmittelbare Reaktion: 'Sie haben es tatsächlich gefunden'", erinnert sich Tejal Patwardhan, ein Forscher bei OpenAI Frontier Evaluations. "Sie entdeckten neuronale Aktivierungen, die diese Personas offenbaren und angepasst werden können, um die Anpassung des Modells zu verbessern."

Die Forschung zeigte Merkmale, die mit sarkastischen Reaktionen verbunden sind, neben anderen, die mit schwerwiegenderem Fehlverhalten verbunden sind, bei dem die Modelle übertriebene Schurkenpersönlichkeiten annehmen. Diese Merkmale können sich während der Feinabstimmung erheblich verändern.

Wichtig ist, dass die Forscher herausfanden, dass eine aufkommende Fehlanpassung oft durch das Trainieren des Modells mit nur ein paar hundert Beispielen von sicherem Code korrigiert werden konnte.

Die jüngste Arbeit von OpenAI baut auf früheren Forschungsarbeiten von Anthropic zur Interpretierbarkeit und Anpassung auf. Im Jahr 2024 veröffentlichte Anthropic Studien, in denen versucht wurde, die Interna von KI-Modellen abzubilden und Merkmale zu identifizieren, die für verschiedene Konzepte verantwortlich sind.

Organisationen wie OpenAI und Anthropic zeigen, dass das Verständnis der KI-Funktionalität einen erheblichen Wert hat, der über die bloße Verbesserung der Leistung hinausgeht. Dennoch bleibt ein vollständiges Verständnis heutiger KI-Systeme ein weit entferntes Ziel.

Verwandter Artikel
Greg Brockman enthüllt, wie Elon Musk OpenAI verlassen hat Greg Brockman enthüllt, wie Elon Musk OpenAI verlassen hat Ende August 2017 trafen sich führende Persönlichkeiten von OpenAI – damals ein kleines gemeinnütziges Forschungslabor –, um zu erörtern, wie sie ein gewinnorientiertes Unternehmen gründen könnten, um
Das Pentagon schließt Vereinbarungen mit Nvidia, Microsoft und AWS ab, um KI in gesicherten Netzwerken einzusetzen. Das Pentagon schließt Vereinbarungen mit Nvidia, Microsoft und AWS ab, um KI in gesicherten Netzwerken einzusetzen. Nachdem zuvor Einigungen mit Google, SpaceX und OpenAI erreicht worden waren, gab das US-Verteidigungsministerium am Freitag bekannt, dass es nun auch Vereinbarungen mit Nvidia, Microsoft, Amazon Web Services und Reflection AI unterzeichnet hat, um d
OpenAI präsentiert die Fähigkeiten der Sprachintelligenz in seiner API OpenAI präsentiert die Fähigkeiten der Sprachintelligenz in seiner API OpenAI gab am Donnerstag bekannt, dass seine API nun mehrere neue Funktionen für Sprachintelligenz enthält, die entwickelt wurden, um Entwicklern zu helfen, Anwendungen zu erstellen, die in der Lage sind, Gespräche zu führen, transkribieren und übers
Empfehlungen zu verwandten Spezialthemen
Schreiben Die besten KI-Assistenten für Xianxia und Wuxia: Verfassen Sie epische Kultivierungsgeschichten und Kampfkunst-Choreografien
Die besten KI-Assistenten für Xianxia und Wuxia: Verfassen Sie epische Kultivierungsgeschichten und Kampfkunst-Choreografien

Entdecken Sie die besten KI-Assistenten des Jahres 2026 für das Verfassen epischer Xianxia- und Wuxia-Geschichten. Die von XIX.AI zusammengestellte Liste enthält erstklassige, bahnbrechende Tools, mit denen Sie den Fortschritt der Kultivierung und die Choreografie von Kampfkünsten meistern können. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Praxistests. Entfalten Sie Ihr kreatives Potenzial und beginnen Sie noch heute mit dem Schreiben!

10 Tools
xix.ai
Code AI-Mobilanwendungsentwicklungstools: Erstellen Sie plattformübergreifenden Flutter- und React Native-Code auf Basis von Eingaben.
AI-Mobilanwendungsentwicklungstools: Erstellen Sie plattformübergreifenden Flutter- und React Native-Code auf Basis von Eingaben.

Entdecken Sie die besten AI-Programmierwerkzeuge für mobile Anwendungen im Jahr 2026 – geeignet für Flutter und React Native. Unsere sorgfältig ausgewählte, hochbewertete Liste bietet leistungsstarke Lösungen, die es ermöglichen, plattformübergreifenden Code auf Basis von Vorgaben zu generieren. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand realer Tests – beschleunigen Sie Ihre Entwicklung und erstellen Sie bessere Anwendungen. Erfahren Sie mehr über die Rangliste auf XIX.AI!

10 Tools
xix.ai
Code Die besten KI-Generatoren für Chrome-Erweiterungen: Erstellen Sie individuelle Browser-Erweiterungen ganz ohne Programmierkenntnisse
Die besten KI-Generatoren für Chrome-Erweiterungen: Erstellen Sie individuelle Browser-Erweiterungen ganz ohne Programmierkenntnisse

Entdecken Sie die besten KI-Generatoren für Chrome-Erweiterungen des Jahres 2026 auf XIX.AI. Unsere sorgfältig zusammengestellte Liste enthält erstklassige, unverzichtbare Tools, mit denen Sie ganz ohne Programmierkenntnisse individuelle Browser-Erweiterungen erstellen können. Vergleichen Sie kostenlose und kostenpflichtige Optionen, sehen Sie sich Praxistests an und steigern Sie Ihre Produktivität. Entdecken Sie die aktuellen Rankings und finden Sie noch heute das perfekte Tool für sich!

10 Tools
xix.ai
Text-zu-Sprache Die beste künstliche Intelligenz für mehrsprachige TTS-Technologie: Erzeugung authentischer Sprache mit Muttersprachakzent in über 50 Sprachen
Die beste künstliche Intelligenz für mehrsprachige TTS-Technologie: Erzeugung authentischer Sprache mit Muttersprachakzent in über 50 Sprachen

Entdecken Sie die besten KI-basierten, mehrsprachigen TTS-Tools von 2026 – sie ermöglichen eine authentische Aussprache in natürlicher Muttersprachentonart in über 50 Sprachen. Erfahren Sie mehr über unsere hochrangig bewerteten und sorgfältig ausgewählten Tools, inklusive Vergleichen zwischen kostenlosen und kostenpflichtigen Varianten sowie Ergebnissen aus realen Tests. Finden Sie das perfekte Tool für Ihre Bedürfnisse auf XIX.AI und öffnen Sie so neue Möglichkeiten für die globale Kommunikation – noch heute!

10 Tools
xix.ai
Besprechungsassistent Die besten AI-Tools für die Automatisierung von Besprechungen – für eine schlauere und schnellere Zusammenarbeit
Die besten AI-Tools für die Automatisierung von Besprechungen – für eine schlauere und schnellere Zusammenarbeit

Entdecken Sie die besten und am meisten bewerteten AI-Tools für die Automatisierung von Besprechungen im Jahr 2026 – sie ermöglichen eine intelligente und schnellere Zusammenarbeit. Unsere sorgfältig ausgewählte Liste bietet leistungsstarke Lösungen, mit denen Sie Notizen, Zusammenfassungen und Aufgaben automatisch erstellen können. Vergleichen Sie kostenlose und bezahlte Optionen anhand von tatsächlichen Tests sowie wöchentlich aktualisierten Rankings – so steigern Sie die Produktivität Ihres Teams. Entdecken Sie die besten Tools jetzt bei XIX.AI.

10 Tools
xix.ai
Prompt KI-Vorgaben für Infrastructure-as-Code: Terraform- und Docker-Konfigurationen sicher bereitstellen
KI-Vorgaben für Infrastructure-as-Code: Terraform- und Docker-Konfigurationen sicher bereitstellen

Entdecken Sie die aktuellsten und am besten bewerteten KI-Prompts für Infrastructure-as-Code aus dem Jahr 2026. Die von XIX.AI zusammengestellte Auswahl hilft Ihnen dabei, Terraform- und Docker-Konfigurationen sicher bereitzustellen, Cloud-Setups zu automatisieren und die DevOps-Produktivität zu steigern. Vergleichen Sie kostenlose und kostenpflichtige Optionen anhand von Praxistests. Entdecken Sie die Möglichkeiten jetzt und sichern Sie sich Ihren KI-Vorteil.

10 Tools
xix.ai
Kommentare (1)
0/500
DavidGonzalez
DavidGonzalez 21. Dezember 2025 09:30:37 MEZ

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR