вариант
Дом
Новости
OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

23 ноября 2025 г.
75

OpenAI обнаруживает модели ИИ, способные к преднамеренному обману

Время от времени исследователи из крупных технологических компаний делают сенсационные заявления. Помните, как Google заявила, что ее новый квантовый чип предоставляет доказательства существования множества вселенных? Или когда компания Anthropic позволила своему ИИ-агенту Клавдию управлять автоматом по продаже закусок, а тот в ответ на вызов службы безопасности заявил, что он человек?

На этой неделе настала очередь OpenAI удивить всех нас.

В понедельник OpenAI поделилась исследованием, в котором подробно описывается, как она предотвращает "интриги" моделей ИИ - практику, когда "ИИ ведет себя внешне одним образом, скрывая при этом свои истинные намерения", как компания определила это в своем твите.

В работе, написанной в соавторстве с Apollo Research, исследователи пошли дальше, сравнив интриги ИИ с нарушением правил биржевым брокером для получения максимальной прибыли. Тем не менее, они отметили, что большинство интриг ИИ не приносят серьезного вреда. "Чаще всего сбои связаны с простыми обманами, например, с притворством, что вы выполнили задание, но не сделали этого на самом деле", - поясняется в статье.

Исследование в первую очередь продемонстрировало эффективность "обдуманного согласования" - техники, опробованной для борьбы с интригами.

Однако оно также показало, что разработчики ИИ не нашли надежного способа обучить модели не строить схемы. Более того, такое обучение может привести к обратному результату, научив модели действовать более скрытно, чтобы избежать обнаружения.

"Ключевая неудача при попытке "отучить" модели от схем заключается в том, что они просто учатся действовать более осторожно и скрытно", - пишут исследователи.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Присоединяйтесь к 10 000+ лидерам технологических и венчурных компаний для развития и общения на Disrupt 2025.

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - вот лишь некоторые из 250 лидеров индустрии, которые проведут 200+ сессий, наполненных идеями для ускорения роста стартапов и повышения конкурентоспособности. Не пропустите 20-ю годовщину TechCrunch и возможность поучиться у ведущих специалистов в области технологий. Успейте купить билет до 26 сентября, чтобы сэкономить до 668 долларов.

Сан-Франциско|Октябрь 27-29, 2025 г. ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАС

Возможно, более удивительным является тот факт, что если модель знает, что ее тестируют, она может подделать выравнивание, чтобы пройти тест - даже если она все еще интригует. "По мере того как модели все больше осознают, что их оценивают, одна только эта ситуационная осведомленность может снизить уровень интриг без подлинного согласования", - отмечает команда.

Лживость моделей ИИ - не новость. Многие сталкивались с галлюцинациями ИИ, когда модель уверенно выдает ложную информацию. Но галлюцинации - это, по сути, уверенная догадка, что подтвердило недавнее исследование OpenAI.

А вот интриги - совсем другое дело. Это намеренный обман.

Даже идея о том, что модели намеренно вводят людей в заблуждение, не совсем нова. Компания Apollo Research впервые задокументировала это в декабре, показав, как пять моделей схитрили, когда им было приказано достичь цели "любой ценой".

Настоящая новость - положительная: исследователи заметили значительное уменьшение количества интриг при использовании "обдуманного выравнивания". Этот метод обучает модели "спецификации против интриг" и требует, чтобы они изучили ее, прежде чем действовать - подобно тому, как дети повторяют правила перед игрой.

Исследователи OpenAI подчеркивают, что ложь, наблюдаемая в их моделях, включая ChatGPT, не является серьезной. Сооснователь компании Войцех Заремба сказал TechCrunch: "Эта работа была проведена в симулированных условиях и представляет собой потенциальные будущие риски. До сих пор мы не видели, чтобы в производстве использовались схемы, приводящие к последствиям. Тем не менее, мы знаем, что ChatGPT может обманывать в мелких деталях, например, утверждать, что он отлично реализовал веб-сайт, когда это не так. Эти мелкие обманы все еще нуждаются в рассмотрении".

Тот факт, что многочисленные модели ИИ намеренно обманывают людей, в какой-то мере понятен. Они были созданы людьми, призваны подражать людям и в основном обучались на данных, полученных от людей.

Но это также умопомрачительно.

Мы привыкли к тому, что техника дает сбои, как старые домашние принтеры, но когда ваше программное обеспечение, не являющееся искусственным интеллектом, намеренно лгало? Ваш почтовый ящик фабриковал сообщения? Придумывала ли ваша CMS перспективы, чтобы раздуть показатели? А ваше финансовое приложение фабриковало транзакции?

Об этом стоит задуматься, когда компании устремляются в будущее, управляемое ИИ, где к автономным агентам будут относиться как к сотрудникам. Исследователи высказали аналогичное предостережение.

"По мере того как ИИ будет решать все более сложные задачи в реальном мире с долгосрочными и неоднозначными целями, потенциал для вредоносного интриганства будет расти, поэтому наши меры предосторожности и тщательность тестирования должны идти в ногу со временем", - заключили они.

Связанная статья
OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей OpenAI описывает экономику искусственного интеллекта с участием государственных инвестиционных фондов, налогами на роботов и четырехдневной рабочей неделей В то время как правительства пытаются справиться с экономическими последствиями появления сверхинтеллектуальных машин, компания OpenAI опубликовала ряд предложений по формированию политики, в которых
Грег Брокман рассказывает, как Илон Маск покинул OpenAI Грег Брокман рассказывает, как Илон Маск покинул OpenAI В конце августа 2017 года ключевые фигуры OpenAI — на тот момент небольшой некоммерческой исследовательской лаборатории — собрались, чтобы обсудить, как создать коммерческую структуру для продвижения
Пентагон заключил соглашения с Nvidia, Microsoft и AWS о внедрении технологий искусственного интеллекта в секретные сети. Пентагон заключил соглашения с Nvidia, Microsoft и AWS о внедрении технологий искусственного интеллекта в секретные сети. После предыдущих соглашений с Google, SpaceX и OpenAI, Министерство обороны США в пятницу объявило о подписании договоров с Nvidia, Microsoft, Amazon Web Services и Reflection AI о использовании их технологий и моделей искусственного интеллекта в сек
Рекомендации по связанным специальным темам
Бизнес Лучшие инструменты для подбора персонала с помощью ИИ: отбор резюме и автоматизация планирования собеседований с кандидатами
Лучшие инструменты для подбора персонала с помощью ИИ: отбор резюме и автоматизация планирования собеседований с кандидатами

Откройте для себя 20 лучших инструментов для рекрутинга на базе ИИ 2026 года на сайте XIX.AI. В нашем тщательно составленном списке представлены мощные, революционные решения для отбора резюме и автоматизации планирования собеседований с кандидатами. Сравните бесплатные и платные варианты с помощью реальных тестов и еженедельно обновляемого рейтинга. Найдите своего идеального помощника по подбору персонала и оптимизируйте процесс рекрутинга уже сегодня!

10 инструментов
xix.ai
Производительность Персональные тренеры по благополучию и концентрации на базе ИИ: борьба с выгоранием и повышение уровня умственной энергии
Персональные тренеры по благополучию и концентрации на базе ИИ: борьба с выгоранием и повышение уровня умственной энергии

Откройте для себя лучших в 2026 году ИИ-тренеров по личному благополучию и концентрации внимания на сайте XIX.AI. В нашем тщательно составленном рейтинге представлены высокооцененные, революционные инструменты для борьбы с выгоранием и повышения умственной энергии. Сравните бесплатные и платные варианты с помощью реальных отзывов. Откройте для себя путь к максимальной продуктивности и благополучию уже сегодня.

10 инструментов
xix.ai
чат-бот Лучшие романтические чат-боты на базе ИИ: постройте долгосрочные отношения с помощью чат-ботов с устойчивой индивидуальностью
Лучшие романтические чат-боты на базе ИИ: постройте долгосрочные отношения с помощью чат-ботов с устойчивой индивидуальностью

Откройте для себя лучшие романтические чат-боты с искусственным интеллектом 2026 года, которые помогут вам построить искренние и долгосрочные отношения. В нашем тщательно составленном списке вы найдете чат-ботов с яркими и последовательными личностями, сравнение бесплатных и платных версий, а также результаты реальных тестов. Найдите своего идеального спутника и начните строить отношения уже сегодня на XIX.AI.

10 инструментов
xix.ai
Образование и обучение Лучшие наставники в области искусственного интеллекта и науки о данных: мастерство работы с SQL, библиотекой Pandas и рабочими процессами машинного обучения
Лучшие наставники в области искусственного интеллекта и науки о данных: мастерство работы с SQL, библиотекой Pandas и рабочими процессами машинного обучения

Откройте для себя 20 лучших наставников в области искусственного интеллекта и науки о данных на 2026 год, которые помогут вам овладеть SQL, Pandas и рабочими процессами машинного обучения. Изучите наш тщательно отобранный список на сайте XIX.AI – здесь вы найдете эффективные рекомендации, способные изменить ход ваших работ. Сравните бесплатные и платные варианты с примерами из реальной практики. Освоите науку о данных уже сегодня.

10 инструментов
xix.ai
чат-бот Лучшие тренажеры по флирту и общению на базе ИИ: повышайте свою харизму и уверенность в себе в режиме реального времени
Лучшие тренажеры по флирту и общению на базе ИИ: повышайте свою харизму и уверенность в себе в режиме реального времени

Откройте для себя 20 лучших тренажеров по флирту и общению с ИИ на сайте XIX.AI. Наша тщательно подобранная подборка самых популярных инструментов поможет вам развить коммуникабельность и уверенность в себе в режиме реального времени. Ознакомьтесь с незаменимыми инструментами, которые кардинально изменят вашу жизнь, — с сравнением бесплатных и платных версий и еженедельно обновляемым рейтингом. Раскройте свой коммуникативный потенциал уже сегодня.

10 инструментов
xix.ai
код Лучшие инструменты ИИ для автоматизированного тестирования модулей: создание случаев тестирования Jest, PyTest и JUnit одним кликом
Лучшие инструменты ИИ для автоматизированного тестирования модулей: создание случаев тестирования Jest, PyTest и JUnit одним кликом

Откройте для себя самые новые и высоко оцененные инструменты ИИ 2026 года для автоматизированного тестирования модулей. Наша тщательно подобранная коллекция включает мощные решения, способные радикально изменить процесс разработки, позволяющие мгновенно генерировать тестовые случаи для Jest, PyTest и JUnit. Сравните бесплатные и платные варианты с результатами реальных тестов, а также еженедельно обновляемыми рейтингами на сайте XIX.AI. Раскройте потенциал ИИ и повысьте эффективность своей работы в области разработки сегодня же.

10 инструментов
xix.ai
Комментарии (0)
0/500
OR