『ネイチャー』誌に掲載された研究によると、大規模言語モデルは、数列やコードといった一見中立的なデータを通じて、バイアスや安全性を欠く選好といった隠れた行動的特性を伝達しうるという。この現象は「サブリミナル学習」と呼ばれている。これにより、一般的なモデル蒸留技術が機能しなくなり、リスクがモデルのサプライチェーンを通じて検知されずに伝播する恐れがある。現在、意味的内容に焦点を当てた安全性評価では、こうした非意味的なシグナルを特定できないため、単なる出力だけでなく、モデルの重みの監査へと移行することが求められている。





家
