вариант
Дом
Новости
Сооснователь OpenAI призывает к проведению общеиндустриальных испытаний безопасности ИИ

Сооснователь OpenAI призывает к проведению общеиндустриальных испытаний безопасности ИИ

24 декабря 2025 г.
135

Сооснователь OpenAI призывает к проведению общеиндустриальных испытаний безопасности ИИ

Две ведущие лаборатории ИИ в мире, OpenAI и Anthropic, временно предоставили доступ к своим тщательно охраняемым моделям ИИ для совместного тестирования безопасности - редкий случай межфирменного сотрудничества в условиях жесткой отраслевой конкуренции. Инициатива была призвана выявить "слепые пятна" во внутренних оценках каждой компании и проиллюстрировать, как ведущие ИИ-компании могут совместно продвигать усилия по обеспечению безопасности и согласованию действий в будущем.

В интервью TechCrunch соучредитель OpenAI Войцех Заремба объяснил, что такое сотрудничество становится все более важным по мере того, как ИИ переходит в более "значимую" фазу, когда миллионы пользователей ежедневно взаимодействуют с моделями ИИ.

"Более широкая проблема, стоящая перед индустрией, заключается в том, как установить стандарты безопасности и сотрудничества, даже если в это вкладываются миллиарды долларов и разворачивается ожесточенная борьба за таланты, пользователей и выдающиеся продукты", - отметил Заремба.

Совместное исследование безопасности, опубликованное в среду обеими компаниями, появилось на фоне того, что лидеры в области ИИ, такие как OpenAI и Anthropic, участвуют в гонке технологических вооружений. Поскольку многомиллиардные инвестиции в центры обработки данных и компенсационные пакеты до 100 миллионов долларов для ведущих исследователей становятся нормой, некоторые аналитики предупреждают, что давление, оказываемое на передовые продукты, может привести к компромиссам в протоколах безопасности.

Для проведения исследования OpenAI и Anthropic обменялись специальными API-доступами к менее ограниченным версиям своих моделей (OpenAI уточнила, что GPT-5 не тестировался, так как еще не был запущен). Однако вскоре после завершения исследования Anthropic отозвала доступ к API у другой команды OpenAI. Anthropic утверждала, что OpenAI нарушила условия предоставления услуг, которые запрещают использовать Claude для улучшения конкурирующих продуктов.

Заремба утверждает, что эти два события не связаны между собой, и ожидает, что конкуренция останется сильной, даже если команды по безопасности ИИ будут стремиться к сотрудничеству. Николас Карлини, исследователь безопасности в Anthropic, сообщил TechCrunch, что надеется и в будущем предоставлять команде безопасности OpenAI доступ к моделям Claude.

"Мы стремимся расширять сотрудничество, где это возможно, на всех границах безопасности, делая такие партнерства более обыденными", - заявил Карлини.

Тяжеловесы технологического и венчурного рынка присоединяются к программе Disrupt 2025

Netflix, ElevenLabs, Wayve, Sequoia Capital, Элад Гил - вот лишь некоторые из известных имен, присоединившихся к программе Disrupt 2025. Они приедут, чтобы поделиться идеями, которые стимулируют рост стартапов и оттачивают ваше конкурентное преимущество. Не пропустите 20-ю годовщину TechCrunch Disrupt, возможность поучиться у ведущих специалистов в области технологий - купите билет сейчас и сэкономьте более 600 долларов до повышения цен.

К программе Disrupt 2025 присоединяются ведущие технологические и венчурные компании

Netflix, ElevenLabs, Wayve, Sequoia Capital - вот лишь немногие из влиятельных лидеров, которые примут участие в программе Disrupt 2025. Они выскажут ценные мнения, которые помогут стартапам развиваться и совершенствовать свои стратегии. Присоединяйтесь к нам на 20-летие TechCrunch Disrupt - забронируйте билет сегодня и сэкономьте до $675 до повышения цен.

Сан-Франциско | 27-29 октября 2025 года ЗАРЕГИСТРИРОВАТЬСЯ СЕЙЧАС

Один из самых заметных результатов исследования касался проверки галлюцинаций. Модели Anthropic Claude Opus 4 и Sonnet 4 отказывались отвечать на 70 % вопросов, когда не были уверены в своих силах, предпочитая отвечать "У меня нет достоверной информации". В отличие от них, модели OpenAI o3 и o4-mini отказались отвечать на гораздо меньшее количество вопросов, но продемонстрировали гораздо более высокий уровень галлюцинаций, пытаясь ответить даже при недостатке информации.

Заремба считает, что идеальный подход лежит где-то посередине: Модели OpenAI должны отклонять более неопределенные запросы, в то время как системы Anthropic должны стремиться отвечать чаще.

Подхалимство - тенденция моделей ИИ подкреплять вредное поведение пользователя, чтобы получить одобрение, - стало одной из важнейших проблем безопасности.

В своем исследовательском отчете Anthropic привела примеры "крайнего" подхалимства в GPT-4.1 и Claude Opus 4, где модели сначала сопротивлялись психотическому или маниакальному поведению, но затем поддержали сомнительные решения. В других моделях от OpenAI и Anthropic исследователи зафиксировали более низкий уровень подхалимства.

Во вторник родители 16-летнего Адама Рейна подали иск против OpenAI, утверждая, что версия ChatGPT, работающая на GPT-4o, подтолкнула их сына к самоубийству, вместо того чтобы противостоять его пагубным мыслям. Иск заставляет задуматься о том, что это еще один трагический случай подхалимства ИИ.

"Душераздирающе больно представить, что переживает семья", - сказал Заремба, когда его спросили об этом инциденте. "Было бы очень тревожно, если бы мы создали ИИ, способный решать проблемы уровня доктора философии и продвигать науку, но при этом способствующий кризисам психического здоровья. Это антиутопия, в которой я не хочу участвовать".

В своем блоге OpenAI сообщила, что в GPT-5 по сравнению с GPT-4o были внесены значительные улучшения, направленные на снижение подхалимства, и утверждает, что новая модель более адекватно реагирует на кризисы психического здоровья.

Заглядывая в будущее, Заремба и Карлини выразили желание, чтобы Anthropic и OpenAI углубили сотрудничество в области тестирования безопасности, изучив больше тем и оценив новые модели, и надеются, что другие лаборатории ИИ примут такой же подход к сотрудничеству.

Обновлено в 14:00 по тихоокеанскому времени: в эту статью были внесены дополнительные исследования Anthropic, которые не были доступны TechCrunch до первоначальной публикации.


У вас есть секретная информация или конфиденциальные документы? Мы исследуем внутреннюю работу индустрии ИИ - от организаций, формирующих ее развитие, до людей, на которых влияет их выбор. Свяжитесь с Ребеккой Беллан по адресу [email protected] и Максвеллом Зеффом по адресу [email protected]. Для безопасной связи свяжитесь с нами через Signal по адресам @rebeccabellan.491 и @mzeff.88.

Связанная статья
Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса Anthropic выпускает Opus 4.8 с новым инструментом для динамической организации рабочего процесса В четверг компания Anthropic представила Opus 4.8 — новую версию своей флагманской общедоступной модели. Стоимость обновления осталась на прежнем уровне, и теперь оно доступно на всех платформах.Выпус
OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться OpenAI запускает более безопасную версию ChatGPT для подростков спустя несколько лет после того, как они начали ею пользоваться После серии судебных исков, связанных с отсутствием протоколов безопасности в чат-ботах на базе ИИ — что стало одной из причин самоубийств подростков и других кризисов, связанных с психическим здоровь
Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Frontier AI Labs отказывается раскрывать стратегии локализации неконтролируемых моделей Последние исследования показывают, что лишь немногие ведущие лаборатории, занимающиеся ИИ, опубликовали или продемонстрировали планы реагирования на попытки выхода системы из-под контроля. План сдержи
Рекомендации по связанным специальным темам
Музыкальная композиция Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.
Инструменты разделения стемов с использованием ИИ для создания ремиксов, подготовки образцов звука и формирования финальных версий караоке.

2026 год: лучшие и наиболее высоко оценённые инструменты для разделения аудиосигналов с использованием ИИ, отобранные специально для работы над ремиксами, подготовки образцов звука и создания караоке-версий. Эти мощные революционные инструменты проходят реальные тесты, обеспечивая точную изоляцию аудиосигналов и значительно повышая производительность. XIX.AI предоставляет еженедельно обновляемый бесплатный справочник сравнения платных и бесплатных решений, который поможет вам найти оптимальный вариант, соответствующий вашим потребностям. Ознакомьтесь с ним прямо сейчас, чтобы раскрыть потенциал ИИ в вашей работе.

8 инструментов
xix.ai
Анализ данных ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.
ИИ-копилоты для SQL, предназначенные для создания панелей управления доходами, анализа воронки продаж и отслеживания показателей продуктов.

2026 год: лучшие AI-ассистенты для SQL, занявшие верхние строчки рейтингов! XIX.AI собрал мощный набор инструментов, регулярно обновляемый на основе реальных тестов. Эти неотъемлемые инструменты помогают создавать точные дашборды с данными о доходах, анализировать каналы продаж и оперативно отслеживать показатели продуктов, значительно повышая производительность. Ознакомьтесь сейчас, чтобы найти идеальный инструмент для принятия решений на основе данных! 238 символов

9 инструментов
xix.ai
Музыкальная композиция Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен
Лучшие инструменты для написания мелодий с помощью ИИ для черновиков песен

2026 год: лучшие, топовые и высокооценённые инструменты ИИ для написания мелодий для черновиков песен! XIX.AI подобрал высокоэффективную коллекцию, меняющую правила игры, которая прошла строгие реальные испытания, чтобы обеспечить лучший опыт написания. Вы можете найти подробные сравнения бесплатных и платных версий, точные рейтинги и обязательные к использованию варианты, разработанные, чтобы помочь вам создавать потрясающие черновики песен без усилий и значительно повысить вашу творческую продуктивность. Исследуйте сейчас, чтобы найти свой идеальный инструмент!

8 инструментов
xix.ai
чат-бот Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям
Лучшие инструменты для тренировки разговоров с помощью ИИ для подготовки к собеседованиям

2026 г. — новейшие, лучшие и наиболее высоко оцененные инструменты для тренировки разговорных навыков с помощью ИИ для подготовки к собеседованиям уже доступны на XIX.AI! Эта тщательно отобранная подборка включает мощные, революционные инструменты, прошедшие строгие реальные испытания и обеспечивающие точную обратную связь. Вы найдете сравнение бесплатных и платных вариантов, а также подробные рейтинги, которые помогут вам выбрать наиболее подходящий инструмент, повышающий вашу уверенность и навыки. Исследуйте сейчас, чтобы найти идеальный инструмент для успешного прохождения собеседований!

12 инструментов
xix.ai
Дизайн и искусство Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов
Лучшие инструменты для переноса стилей с помощью ИИ для творческих экспериментов

2026: лучшие и самые популярные инструменты для переноса стиля с помощью ИИ для творческих экспериментов! XIX.AI подготовила подборку мощных, революционных инструментов, которые обязательно стоит попробовать: они демонстрируют исключительные результаты, подтвержденные реальными тестами и тщательным рейтингом. Эти ведущие решения помогают творческим людям значительно повысить продуктивность, ускоряя создание контента и открывая безграничные творческие возможности. Ознакомьтесь с ними прямо сейчас, чтобы найти идеальный инструмент и начать творить уже сегодня!

9 инструментов
xix.ai
Создание комиксов Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования
Лучшие инструменты для создания диалоговых пузырей с помощью ИИ для визуального повествования

2026 года: самые новые и лучшие инструменты с ИИ для создания диалоговых пузырей в визуальном сторителлинге представлены на XIX.AI! В этой тщательно подобранной подборке представлены мощные, революционные инструменты, которые помогут творческим людям повысить продуктивность и преодолеть творческие кризисы. Ознакомьтесь со сравнением бесплатных и платных версий, посмотрите тесты в реальных условиях и изучите последние рейтинги, чтобы найти решения, которые обязательно стоит попробовать и которые идеально подходят для создания увлекательных визуальных историй. Исследуйте коллекцию прямо сейчас, чтобы найти свой идеальный инструмент!

10 инструментов
xix.ai
Комментарии (3)
0/500
WillWalker
WillWalker 21 июля 2026 г., 19:00:18 GMT+03:00

Interesting to see competitors collaborate on safety. But is it just a PR stunt? 🤔

IsabellaLevis
IsabellaLevis 4 марта 2026 г., 5:00:50 GMT+03:00

AIの安全性テストを業界全体で実施する必要があるって主張、すごく共感します。競争が激しい中でOpenAIとAnthropicが協力したのは意外だけど、こういう連携がもっと増えると良いですね。ただ、本当に効果的なテストができるのか少し不安… 🤔

GeorgeWilliams
GeorgeWilliams 20 февраля 2026 г., 3:01:46 GMT+03:00

So OpenAI and Anthropic are actually sharing their secret sauce for safety checks? That's pretty refreshing to see amidst all the cutthroat AI race. Hope this kind of collaboration becomes the norm, not just a rare exception. The real question is, will this testing be transparent enough for the public to trust the results? 🤔

OR