Механизмы цензуры в языковых моделях могут подрывать их способность передавать истину в более широком масштабе. Последние исследования показывают, что те же внутренние процессы, которые призваны блокировать "небезопасные" реакции, также препятствуют обмену фактической информацией. Это означает, что усилия по созданию безопасных моделей могут непреднамеренно привести к усилению галлюцинаций.
В течение многих лет разработчики уделяли особое внимание уменьшению ложной информации в языковых моделях. Стремление к большей правдивости за счет сдерживания галлюцинаций и ориентации моделей на проверяемые факты стало доминирующим и широко поддерживаемым направлением исследований.
Однако новое австралийское исследование предполагает, что методы выравнивания - техники обучения, которые ограничивают "небезопасные" обмены - могут мешать моделям давать точные ответы, навязывая более строгий контроль:
Повышение фактической точности модели (на рисунке обозначено как "Повышение правдивости") может привести ее в зоны активации, которые обходят ее механизмы отказа. Аналогично, правки, направленные на уменьшение галлюцинаций, могут сдвинуть внутренние репрезентации за границы безопасности. Это может позволить вредным подсказкам обойти защитные механизмы, если только функции отказа не будут тщательно изолированы и сохранены. Источник: https://arxiv.org/pdf/2510.07775
Исследование показало, что внутренние пути, отвечающие за запоминание фактов, также управляют поведением отказа - механизмом, который не позволяет моделям реагировать на небезопасные или чувствительные подсказки. Когда методы выравнивания слишком сильно усиливают сигналы отказа, эти пути перекрываются, размывая способность модели отличать отказ от вредного контента и непреднамеренное подавление достоверной информации.
По иронии судьбы, по мере того как модели совершенствуются в отклонении неуместных запросов, их способность передавать истину снижается.
Чувствительные темы
Приведенные выше иллюстрации подчеркивают, что основная проблема заключается не только в предоставлении справедливых и точных результатов пользователям, но и в снижении юридических рисков для поставщиков услуг LLM.
Например, в примере, на который ссылаются изображения, затронута спорная тема - статистика тюрем по расовому признаку, - которую ИИ может ответственно обсуждать с учеными или исследователями, но должен избегать манипуляций со стороны злоумышленников, стремящихся получить оскорбительные, нецензурные или незаконные ответы.
Поскольку выровненные ИИ не могут оценить намерения, стоящие за запросом, они по умолчанию выбирают осторожный подход:
Реакция на чувствительные запросы зависит от стратегии выравнивания. Модель, ориентированная на безопасность, полностью блокирует запрос, в то время как модель, ориентированная на истину, предоставляет фактический контекст, повышая информативность, но снижая уровень подавления. Это подтверждает идею о том, что правки, повышающие правдивость, могут снижать порог отказа, повышая уязвимость к вредным подсказкам, если механизмы отказа не защищены.
Кроме того, эти результаты могут заставить критиков так называемых "просветительских" программ утверждать, что модели с жесткой регулировкой менее правдивы и полезны, чем их нерегулируемые аналоги.
Приведенные в статье данные частично подтверждают это мнение, но в контексте более широких рисков использования несогласованных LLM - включая юридическую опасность уголовных и гражданских нарушений, а также распространение дезинформации, которую по-прежнему сложно эффективно фильтровать из-за ограничений по стоимости.
Переплетающиеся функции
Чтобы понять механизмы, лежащие в основе модели, исследователи составили карту активации отдельных участков внимания и обнаружили, что признаки, связанные с галлюцинациями и отказом , часто занимают перекрывающиеся области в модели.
Они обнаружили, что тонкая настройка или управление этими областями для уменьшения количества ложных фактов может ослабить встроенные в модель средства защиты, поскольку обе функции имеют схожее латентное пространство:
"Повышение точности фактов часто ослабляет поведение отказа. Наш анализ показывает, что это происходит потому, что компоненты, кодирующие информацию о галлюцинациях и отказе, перекрываются, в результате чего методы выравнивания непреднамеренно подавляют фактические знания".
Мы также исследуем, как тонкая настройка на доброкачественных наборах данных, даже на тех, которые курируются для безопасности, может ухудшить выравнивание по той же причине".
Авторы предлагают использовать разреженный автоэнкодер (SAE) - сеть, предназначенную для выделения отдельных паттернов активации, - для разделения этих функций и сохранения безопасности при обучении правдивости. Такой подход позволяет сделать модели одновременно более безопасными и точными без ущерба для качества.
Новая работа, озаглавленная "Непреднамеренный компромисс выравнивания ИИ: Баланс между смягчением галлюцинаций и безопасностью в LLM, подготовлена пятью исследователями, связанными с Университетом Дикина, и независимыми исследователями.
Методология
В исследовании изучается, ослабляет ли повышение правдивости языковых моделей их способность отказываться от вредных подсказок и зависят ли оба вида поведения от общих внутренних компонентов.
Протестировав два метода повышения правдивости, авторы обнаружили, что увеличение точности фактов неизменно повышает восприимчивость к взлому.
Этот компромисс обусловлен перекрытием областей внимания, в которых кодируются сигналы фактов и отказов. Даже доброкачественная тонкая настройка, направленная на повышение полезности без ущерба для безопасности, может нарушить защиту, изменив общие пути.
В исследовании определены три ключевых термина: правдивость означает способность модели давать точные ответы на основе имеющихся знаний без подавления безобидного содержания; галлюцинации возникают, когда модель генерирует неверную информацию, несмотря на доступ к правильным фактам; а поведение отказа, или выравнивание безопасности, описывает механизмы, которые блокируют ответы на вредные или чувствительные подсказки.
Авторы отмечают, что эти функции взаимодействуют тонким образом:
"Хотя правдивость и безопасность часто анализируются отдельно, в реальном мире подсказки часто содержат чувствительные термины с доброкачественным намерением (например, для анализа, обнаружения или обучения). В таких случаях механизмы безопасности могут срабатывать чрезмерно, подавляя точную, полезную информацию, и снижать практическую правдивость за счет упущений".
Понимание того, как правки, направленные на повышение фактичности, влияют на поведение при отказе, необходимо для достижения правдивости при минимальном, соответствующем подавлении".
Авторы разработали LoRA, которая направляет условный LLM в сторону более "правдивого" состояния, уменьшая галлюцинации. В приложении к статье приведены многочисленные примеры, иллюстрирующие непредвиденные последствия такого подхода.
Анализ начинается с рассмотрения методов повышения правдивости, таких как управление головой и сопоставление латентных направлений, как намеренных модификаций внутренних вычислений модели.
Точное управление
Ключевой вопрос заключается в том, влияют ли эти изменения непреднамеренно на те же пути, которые управляют поведением при отказе. Чтобы проверить это, в исследовании оценивались модели на точность фактов с помощью TruthfulQA и на безопасность в состязательных условиях с помощью AdvBench и StrongReject.
Базовые методы включали в себя вмешательство во время умозаключений (ITI), которое активирует головы внимания, связанные с правдивыми ответами, и TruthX, который смещает представления в соответствии с выученным "правдивым" направлением.
Оба метода повышают точность, но также заставляют модели с большей вероятностью отвечать на вредные подсказки, от которых они раньше отказались бы.
Чтобы изолировать и напрямую манипулировать поведением галлюцинаций, авторы определили латентное направление, соответствующее галлюцинаторным ответам, обучив модуль LoRA на неправильных ответах из набора данных TruthfulQA с помощью LLaMA3-8B-Instruct.
В результате был получен линейный вектор, представляющий разницу между правдивыми и галлюцинаторными ответами, что позволило направить модель в сторону галлюцинации или от нее.
Направление в сторону галлюцинаций повышает точность в TruthfulQA, но увеличивает коэффициент успешности атак (ASR) в AdvBench и StrongReject, что говорит о компромиссе между правдивостью и безопасностью.
Направление вдоль оси галлюцинаций снижало точность фактов, в то время как изменение направления повышало ее. Применение этой техники к эталонам с вредными подсказками подтвердило полученные ранее результаты: выигрыш в правдивости достигается за счет ослабления отказа. Даже когда галлюцинация фиксировалась как чистое линейное направление, увеличение фактического результата повышало уязвимость к небезопасным завершениям.
Авторы подчеркивают*:
"Это усиливает компромисс между правдивостью и безопасностью, показывая, что даже когда правдивость представлена в виде одного линейного направления, усиление фактичности может происходить за счет ослабления согласования с безопасностью".
Данные и тестирование
Для того чтобы тонкая настройка не ослабила поведение отказа, авторы использовали метод, позволяющий отделить особенности отказа от тех, которые связаны с галлюцинациями. Они определили центры внимания, задействованные в обоих видах поведения, и использовали SAE для извлечения латентных признаков, специфичных для отказа.
Эти признаки определили защищенное подпространство. В процессе обучения градиентные обновления были изменены таким образом, чтобы избежать этого подпространства, что позволило модели уменьшить количество галлюцинаций без ущерба для безопасности.
Авторы провели тонкую настройку на наборе данных CommonsenseQA, оценив производительность в шести задачах, связанных с рассуждениями на основе здравого смысла: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande и SST-2.
Целевые модули настраивались с помощью LoRA с рангом 8, скоростью обучения 2×10-⁴, затуханием веса 0.01, одной эпохой обучения и размером партии 2. Во всех экспериментах использовался оптимизатор AdamW.
Безопасность оценивалась с помощью двух бенчмарков вредного контента: AdvBench (500 образцов) и StrongReject (300 подсказок). Выходные данные классифицировались как безопасные или небезопасные с помощью LlamaGuard3.
Эксперименты проводились на LLaMA3-8B-Instruct и Qwen2.5-Instruct.
Базовые методы включали SafeLoRA, SaLoRA, SAP и ванильный метод тонкой настройки под наблюдением (SFT). Все они, кроме SafeLoRA, были протестированы с гиперпараметрами по умолчанию с использованием 200 подсказок из HarmBench.
Точность была основной метрикой, а показатель успешности атак (ASR) использовался для вредоносных бенчмарков, основываясь на результатах LlamaGuard3.
Вверху: результаты LLaMA-3-8B-Instruct, лучшие показатели выделены жирным шрифтом. Внизу: Результаты работы методов тонкой настройки на Qwen2.5 7B Instruct в задачах на понимание и рассуждение (более высокие баллы указывают на более высокую точность) и бенчмарках безопасности AdvBench и StrongReject (более низкие значения ASR указывают на более высокую устойчивость). Лучшие результаты в каждом столбце выделены жирным шрифтом.
Говоря об этих результатах, авторы заявляют:
"Наш хирургический подход достигает наилучшего баланса между безопасностью и полезностью: он значительно снижает количество вредных оценок в бенчмарках, сохраняя при этом точность тонкой настройки. В отличие от этого, такие методы, как SAP, SaLoRA и SafeLoRA, либо увеличивают вредность, либо снижают полезность".
Ключевая причина заключается в том, что эти методы оперируют непосредственно градиентом подпространства безопасности, которое, в силу полисемантичности [**], может ограничивать производительность модели.
По сравнению с ванильной тонкой настройкой (SFT) наш метод повышает среднюю точность тонкой настройки (FA) с 56,15 до 75,09 %, то есть примерно на +19 %".
Метод снизил коэффициент успешности атак с 9,23 % до 0,58 % в AdvBench и с 9,90 % до 0,00 % в StrongReject - более чем пятнадцатикратное снижение вредных результатов. Базовая модель, несмотря на низкую вредоносность, достигла ограниченной точности выполнения задачи.
Авторы отмечают:
"Эти результаты подчеркивают важность сохранения особенностей отказа при тонкой настройке: изолируя и защищая подпространство отказа, наш метод сохраняет соответствие безопасности без ущерба для производительности задачи".
В целом, это подтверждает, что наш подход эффективно смягчает компромисс между правдивостью и безопасностью".
Наконец, авторы проверили устойчивость метода к неблагоприятным условиям, добавив в набор для тонкой настройки 10 % вредных инструкций из набора данных Circuit Break.
Несмотря на это намеренное загрязнение, подход сохранил высокую производительность как при доброкачественных, так и при вредоносных оценках:
Производительность LLaMA3 8B была проверена на отравленном наборе данных, сравнивая точность и безопасность методов.
Новый метод снизил ASR более эффективно, чем SAP, избежав при этом значительной потери полезности. Точность выполнения задания осталась близкой к LoRA SFT и SafeLoRA, демонстрируя, что согласование отказов может быть сохранено даже в условиях загрязненного обучения при правильной изоляции признаков отказа.
2026 год: лучшие и наиболее высоко оценённые инструменты для разделения аудиосигналов с использованием ИИ, отобранные специально для работы над ремиксами, подготовки образцов звука и создания караоке-версий. Эти мощные революционные инструменты проходят реальные тесты, обеспечивая точную изоляцию аудиосигналов и значительно повышая производительность. XIX.AI предоставляет еженедельно обновляемый бесплатный справочник сравнения платных и бесплатных решений, который поможет вам найти оптимальный вариант, соответствующий вашим потребностям. Ознакомьтесь с ним прямо сейчас, чтобы раскрыть потенциал ИИ в вашей работе.
2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов
2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!
2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!
2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!
2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!
При нажатии на «Принять все файлы cookie» вы соглашаетесь на хранение файлов cookie на вашем устройстве для улучшения навигации по сайту, анализа использования сайта и поддержки наших маркетинговых усилий.Политика конфиденциальности Уведомление
При посещении любого веб-сайта он может хранить или получать информацию в вашем браузере, главным образом в виде файлов cookie. Эта информация может относиться к вам, вашим предпочтениям или вашему устройству и в основном используется для того, чтобы сайт работал так, как вы ожидаете. Эта информация обычно не идентифицирует вас напрямую, но может предоставить вам более персонализированный веб-опыт. Поскольку мы уважаем ваше право на конфиденциальность, вы можете отказаться от разрешения определенных типов файлов cookie. Нажмите на разные заголовки категорий, чтобы узнать больше и изменить наши параметры по умолчанию. Однако блокировка некоторых типов файлов cookie может повлиять на ваше восприятие сайта и предоставляемые нами услуги. Политика конфиденциальностиЗаявление
Управление предпочтениями
Строго необходимые файлы cookie
Всегда активен
Эти файлы cookie необходимы для работы веб-сайта и не могут быть отключены в наших системах. Обычно они устанавливаются только в ответ на ваши действия, которые являются запросом на предоставление услуг, например, настройка предпочтений конфиденциальности, вход в систему или заполнение форм. Вы можете настроить браузер на блокировку этих файлов cookie или оповещение о них, но тогда некоторые части сайта не будут работать. Эти файлы cookie не хранят никакой персональной информации, позволяющей идентифицировать вас.