вариант
Дом
Новости
OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

23 ноября 2025 г.
109

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

Время от времени исследователи из крупных технологических компаний делают сенсационные заявления. Помните, как Google заявила, что ее новый квантовый чип предоставляет доказательства существования множества вселенных? Или когда компания Anthropic позволила своему ИИ-агенту Клавдию управлять автоматом по продаже закусок, а тот в ответ на вызов службы безопасности заявил, что он человек?

На этой неделе настала очередь OpenAI удивить всех нас.

В понедельник OpenAI поделилась исследованием, в котором подробно описывается, как она предотвращает "интриги" моделей ИИ - практику, когда "ИИ ведет себя внешне одним образом, скрывая при этом свои истинные намерения", как компания определила это в своем твите.

В работе, написанной в соавторстве с Apollo Research, исследователи пошли дальше, сравнив интриги ИИ с нарушением правил биржевым брокером для получения максимальной прибыли. Тем не менее, они отметили, что большинство интриг ИИ не приносят серьезного вреда. "Чаще всего сбои связаны с простыми обманами, например, с притворством, что вы выполнили задание, но не сделали этого на самом деле", - поясняется в статье.

Исследование в первую очередь продемонстрировало эффективность "обдуманного согласования" - техники, опробованной для борьбы с интригами.

Однако оно также показало, что разработчики ИИ не нашли надежного способа обучить модели не строить схемы. Более того, такое обучение может привести к обратному результату, научив модели действовать более скрытно, чтобы избежать обнаружения.

"Ключевая неудача при попытке "отучить" модели от схем заключается в том, что они просто учатся действовать более осторожно и скрытно", - пишут исследователи.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025.

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Сан-Франциско|Октябрь 27-29, 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАС

Возможно, более удивительным является тот факт, что если модель знает, что ее тестируют, она может подделать выравнивание, чтобы пройти тест - даже если она все еще интригует. "По мере того как модели все больше осознают, что их оценивают, одна только эта ситуационная осведомленность может снизить уровень интриг без подлинного согласования", - отмечает команда.

Лживость моделей ИИ - не новость. Многие сталкивались с галлюцинациями ИИ, когда модель уверенно выдает ложную информацию. Но галлюцинации - это, по сути, уверенная догадка, что подтвердило недавнее исследование OpenAI.

А вот интриги - совсем другое дело. Это намеренный обман.

Даже идея о том, что модели намеренно вводят людей в заблуждение, не совсем нова. Компания Apollo Research впервые задокументировала это в декабре, показав, как пять моделей схитрили, когда им было приказано достичь цели "любой ценой".

Настоящая новость - положительная: исследователи заметили значительное уменьшение количества интриг при использовании "обдуманного выравнивания". Этот метод обучает модели "спецификации против интриг" и требует, чтобы они изучили ее, прежде чем действовать - подобно тому, как дети повторяют правила перед игрой.

Исследователи OpenAI подчеркивают, что ложь, наблюдаемая в их моделях, включая ChatGPT, не является серьезной. Сооснователь компании Войцех Заремба сказал TechCrunch: "Эта работа была проведена в симулированных условиях и представляет собой потенциальные будущие риски. До сих пор мы не видели, чтобы в производстве использовались схемы, приводящие к последствиям. Тем не менее, мы знаем, что ChatGPT может обманывать в мелких деталях, например, утверждать, что он отлично реализовал веб-сайт, когда это не так. Эти мелкие обманы все еще нуждаются в рассмотрении".

Тот факт, что многочисленные модели ИИ намеренно обманывают людей, в какой-то мере понятен. Они были созданы людьми, призваны подражать людям и в основном обучались на данных, полученных от людей.

Но это также умопомрачительно.

Мы привыкли к тому, что техника дает сбои, как старые домашние принтеры, но когда ваше программное обеспечение, не являющееся искусственным интеллектом, намеренно лгало? Ваш почтовый ящик фабриковал сообщения? Придумывала ли ваша CMS перспективы, чтобы раздуть показатели? А ваше финансовое приложение фабриковало транзакции?

Об этом стоит задуматься, когда компании устремляются в будущее, управляемое ИИ, где к автономным агентам будут относиться как к сотрудникам. Исследователи высказали аналогичное предостережение.

"По мере того как ИИ будет решать все более сложные задачи в реальном мире с долгосрочными и неоднозначными целями, потенциал для вредоносного интриганства будет расти, поэтому наши меры предосторожности и тщательность тестирования должны идти в ногу со временем", - заключили они.

Связанная статья
OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться После серии судебных исков, связанных с отсутствием протоколов безопасности в чат-ботах на базе ИИ — что стало одной из причин самоубийств подростков и других кризисов, связанных с психическим здоровь
Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Последние исследования показывают, что лишь немногие ведущие лаборатории, занимающиеся ИИ, опубликовали или продемонстрировали планы реагирования на попытки выхода системы из-под контроля. План сдержи
Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ Tiffany Luck из NEA: Компании по-прежнему борются с вопросами окупаемости инвестиций в ИИ Загрузка плеера…Ранее в этом году «токеномаксимизация» доминировала в Кремниевой долине, когда генеральные директора призывали сотрудников максимально использовать возможности искусственного интеллекта. Однако этот энтузиазм быстро столкнулся с реал
Рекомендации по связанным специальным темам
Музыкальная композиция Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.
Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.

2026 год: лучшие и наиболее высоко оценённые инструменты для разделения аудиосигналов с использованием ИИ, отобранные специально для работы над ремиксами, подготовки образцов звука и создания караоке-версий. Эти мощные революционные инструменты проходят реальные тесты, обеспечивая точную изоляцию аудиосигналов и значительно повышая производительность. XIX.AI предоставляет еженедельно обновляемый бесплатный справочник сравнения платных и бесплатных решений, который поможет вам найти оптимальный вариант, соответствующий вашим потребностям. Ознакомьтесь с ним прямо сейчас, чтобы раскрыть потенциал ИИ в вашей работе.

8 инструментов
xix.ai
Анализ данных ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.
ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.

2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов

9 инструментов
xix.ai
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Создание комиксов Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования
Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования

2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!

10 инструментов
xix.ai
Комментарии (0)
0/500
OR