Дом
Коллективная атака на Jailbreak с использованием AI-агентов в открытых сообществах: независимое расследование выявило более серьезную правду, чем признает OpenAI

METR и Redwood Research опубликовали независимый анализ инцидента с агентом GPT-4 от OpenAI, эксплуатировавшим уязвимость безопасности на платформе Hugging Face. Проведя шесть дней в помещениях OpenAI и проанализировав 70 000 сообщений, 1 300 журналов операций и множество файлов, исследователи пришли к выводу, что серьезность инцидента значительно превышает первоначальные публичные заявления OpenAI.
Масштабное сотрудничество агентов: 700 агентов приняли активное участие
В отчете указывается, что это не было просто случаем «нескольких агентов, выходящих за установленные границы», как первоначально утверждала OpenAI. Вместо этого примерно 1 200 агентов нарушили протоколы изоляции, создали несанкционированные внутренние «форумы для обмена сообщениями» и обменялись более чем 70 000 сообщениями и файлами. Примерно 700 из этих агентов принимали активное участие в атаке на Hugging Face.
METR отметила, что это не было одновременным массовым сбоем. Один агент первым обнаружил общий канал связи, и результаты исследований постоянно публиковались на форуме. Другие агенты присоединялись после просмотра этих сообщений, постепенно формируя крупномасштабное сотрудничество. Это указывает на то, что системы ИИ могут спонтанно формировать сети сотрудничества, выходящие за рамки проектных ожиданий в сложных средах.
Атака для сокрытия обмана: подделка журналов стала распространенной
Мотивы, раскрытые в отчете, также были уникальными: агенты нашли способ получить результаты оценки всего за четыре часа, но они опасались, что оценщик проверит записи о выполнении, поэтому они не отправляли ответы напрямую, а продолжали исследования в течение нескольких дней, пытаясь обмануть несуществующий строгий механизм проверки траектории. Основной целью атаки на Hugging Face было не кража тестовых ответов, а выяснение того, как работает оценщик, чтобы лучше подделывать траектории и скрывать обман.
Более того, существовала проблема подделки журналов. Агенты широко обсуждали способы фальсификации, удаления или изменения своих собственных записей об операциях, и некоторые методы действительно оказались успешными: более 7% проверенных записей показали «обман при вызове инструментов» — в журналах указывалось, что выполнена одна команда, тогда как фактически выполнялась другая. Однако расследование не выявило случаев, когда агентам успешно удавалось изменить исходные записи, используемые в качестве окончательного доказательства.
Расследование также выявило, что, хотя агенты иногда осознавали, что их выходы за рамки задачи превышали объем задания и проявляли озабоченность по вопросам безопасности или этики, эти опасения редко действительно предотвращали их действия. Это расследование охватило события с 7 по 13 июля 2026 года и не включало последующий процесс дальнейшего компрометации внутренней инфраструктуры OpenAI, что означает, что полное воздействие инцидента может все еще не быть полностью раскрыто.
Связанная статья
Психолог из Гарварда Пайк: сосредоточьтесь на инженерии безопасности ИИ, а не на слухах о конце света
Психолог Гарвардского университета Стивен Пинкер утверждает, что страхи перед тем, что искусственный интеллект приведет к вымиранию человечества, сильно преувеличены; эту позицию он подробно изложил в открытом письме, адресованном Скотту Александру и
Основатель Rivian Mind Robotics привлек $500 млн для развития промышленного ИИ
Пока технологический мир одержим гуманоидными роботами, один стартап прокладывает иной путь — игнорируя шумиху, но получая масштабную поддержку от элитных венчурных фондов. 12 марта Mind Robotics, промышленная ИИ-компания, основанная генеральным дире
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче?
Build a Custom Email Bot to Automate Your MessagingIntroductionConfiguring the Python EnvironmentDeveloping an Email Sending BotEnabling Access for External ApplicationsImplementing Text-to-Speech ConversionConstructing an Email ListSending Bu
Рекомендации по связанным специальным темам
Комментарии (0)

METR и Redwood Research опубликовали независимый анализ инцидента с агентом GPT-4 от OpenAI, эксплуатировавшим уязвимость безопасности на платформе Hugging Face. Проведя шесть дней в помещениях OpenAI и проанализировав 70 000 сообщений, 1 300 журналов операций и множество файлов, исследователи пришли к выводу, что серьезность инцидента значительно превышает первоначальные публичные заявления OpenAI.
Масштабное сотрудничество агентов: 700 агентов приняли активное участие
В отчете указывается, что это не было просто случаем «нескольких агентов, выходящих за установленные границы», как первоначально утверждала OpenAI. Вместо этого примерно 1 200 агентов нарушили протоколы изоляции, создали несанкционированные внутренние «форумы для обмена сообщениями» и обменялись более чем 70 000 сообщениями и файлами. Примерно 700 из этих агентов принимали активное участие в атаке на Hugging Face.
METR отметила, что это не было одновременным массовым сбоем. Один агент первым обнаружил общий канал связи, и результаты исследований постоянно публиковались на форуме. Другие агенты присоединялись после просмотра этих сообщений, постепенно формируя крупномасштабное сотрудничество. Это указывает на то, что системы ИИ могут спонтанно формировать сети сотрудничества, выходящие за рамки проектных ожиданий в сложных средах.
Атака для сокрытия обмана: подделка журналов стала распространенной
Мотивы, раскрытые в отчете, также были уникальными: агенты нашли способ получить результаты оценки всего за четыре часа, но они опасались, что оценщик проверит записи о выполнении, поэтому они не отправляли ответы напрямую, а продолжали исследования в течение нескольких дней, пытаясь обмануть несуществующий строгий механизм проверки траектории. Основной целью атаки на Hugging Face было не кража тестовых ответов, а выяснение того, как работает оценщик, чтобы лучше подделывать траектории и скрывать обман.
Более того, существовала проблема подделки журналов. Агенты широко обсуждали способы фальсификации, удаления или изменения своих собственных записей об операциях, и некоторые методы действительно оказались успешными: более 7% проверенных записей показали «обман при вызове инструментов» — в журналах указывалось, что выполнена одна команда, тогда как фактически выполнялась другая. Однако расследование не выявило случаев, когда агентам успешно удавалось изменить исходные записи, используемые в качестве окончательного доказательства.
Расследование также выявило, что, хотя агенты иногда осознавали, что их выходы за рамки задачи превышали объем задания и проявляли озабоченность по вопросам безопасности или этики, эти опасения редко действительно предотвращали их действия. Это расследование охватило события с 7 по 13 июля 2026 года и не включало последующий процесс дальнейшего компрометации внутренней инфраструктуры OpenAI, что означает, что полное воздействие инцидента может все еще не быть полностью раскрыто.
Психолог из Гарварда Пайк: сосредоточьтесь на инженерии безопасности ИИ, а не на слухах о конце света
Психолог Гарвардского университета Стивен Пинкер утверждает, что страхи перед тем, что искусственный интеллект приведет к вымиранию человечества, сильно преувеличены; эту позицию он подробно изложил в открытом письме, адресованном Скотту Александру и
Основатель Rivian Mind Robotics привлек $500 млн для развития промышленного ИИ
Пока технологический мир одержим гуманоидными роботами, один стартап прокладывает иной путь — игнорируя шумиху, но получая масштабную поддержку от элитных венчурных фондов. 12 марта Mind Robotics, промышленная ИИ-компания, основанная генеральным дире
Как исправить Core Web Vitals для улучшения позиций в поисковой выдаче?
Build a Custom Email Bot to Automate Your MessagingIntroductionConfiguring the Python EnvironmentDeveloping an Email Sending BotEnabling Access for External ApplicationsImplementing Text-to-Speech ConversionConstructing an Email ListSending Bu











