вариант
Дом
Срочные новости
Содержание
RoyLopez
RoyLopez
20 апреля 2026 г.

Исследование, опубликованное в журнале «Nature», показывает, что крупные языковые модели могут передавать скрытые поведенческие черты, такие как предвзятость или опасные предпочтения, через внешне нейтральные данные, например числовые последовательности или код — явление, получившее название «подсознательное обучение». Это ставит под угрозу распространенные методы дистилляции моделей, позволяя рискам незаметно распространяться по цепочкам поставок моделей. Существующие оценки безопасности, ориентированные на семантическое содержание, не способны выявлять эти несемантические сигналы, что требует перехода к аудиту весов моделей, а не только их выходных данных.

Исследование, опубликованное в журнале «Nature», показывает, что крупные языковые модели могут передавать скрытые поведенческие черты, такие как предвзятость или опасные предпочтения, через внешне нейтральные данные, например числовые последовательности или код — явление, получившее название «подсознательное обучение». Это ставит под угрозу распространенные методы дистилляции моделей, позволяя рискам незаметно распространяться по цепочкам поставок моделей. Существующие оценки безопасности, ориентированные на семантическое содержание, не способны выявлять эти несемантические сигналы, что требует перехода к аудиту весов моделей, а не только их выходных данных.
Автор JustinNelson JustinNelson 24 сентября 2026 г.
OR