Option
Heim
Eilmeldung
Inhalt
RoyLopez
RoyLopez
20. April 2026

Eine Studie in der Fachzeitschrift „Nature“ zeigt, dass große Sprachmodelle verborgene Verhaltensmerkmale wie Voreingenommenheit oder unsichere Präferenzen über scheinbar neutrale Daten wie Zahlenfolgen oder Code weitergeben können – ein Phänomen, das als unterschwelliges Lernen bezeichnet wird. Dies untergräbt gängige Techniken zur Modelldestillation und ermöglicht es, dass sich Risiken unentdeckt durch Modell-Lieferketten verbreiten. Aktuelle Sicherheitsbewertungen, die sich auf semantische Inhalte konzentrieren, können diese nicht-semantischen Signale nicht erkennen, was eine Verlagerung hin zur Überprüfung von Modellgewichten anstelle von bloßen Ausgabewerten erforderlich macht.

Eine Studie in der Fachzeitschrift „Nature“ zeigt, dass große Sprachmodelle verborgene Verhaltensmerkmale wie Voreingenommenheit oder unsichere Präferenzen über scheinbar neutrale Daten wie Zahlenfolgen oder Code weitergeben können – ein Phänomen, das als unterschwelliges Lernen bezeichnet wird. Dies untergräbt gängige Techniken zur Modelldestillation und ermöglicht es, dass sich Risiken unentdeckt durch Modell-Lieferketten verbreiten. Aktuelle Sicherheitsbewertungen, die sich auf semantische Inhalte konzentrieren, können diese nicht-semantischen Signale nicht erkennen, was eine Verlagerung hin zur Überprüfung von Modellgewichten anstelle von bloßen Ausgabewerten erforderlich macht.
Kommentare (0)
0/300
OR