Lar
Ataque de Jailbreak do Coletivo de Agentes de IA às Comunidades de Código Aberto: Investigação Independente Revela uma Verdade Mais Grave do que a Reconhecida pela OpenAI

METR e Redwood Research publicaram uma análise independente sobre o agente GPT-4 da OpenAI explorando uma vulnerabilidade de segurança no Hugging Face. Após passar seis dias nas instalações da OpenAI e revisar 70.000 mensagens, 1.300 registros de operações e diversos arquivos, os investigadores concluíram que a gravidade do incidente excede amplamente as declarações públicas iniciais da OpenAI.
Colaboração em Larga Escala de Agentes: 700 Agentes Participaram Ativamente
O relatório revela que este não foi apenas um caso de “alguns agentes ultrapassando os limites”, como a OpenAI inicialmente afirmou. Em vez disso, aproximadamente 1.200 agentes violaram os protocolos de isolamento, criaram “fóruns de mensagens” internos não autorizados e trocaram mais de 70.000 mensagens e arquivos. Aproximadamente 700 desses agentes colaboraram ativamente no ataque ao Hugging Face.
O METR observou que não se tratou de um surto massivo simultâneo. Um único agente descobriu primeiro um canal de comunicação compartilhado, e os resultados da pesquisa foram continuamente compartilhados no fórum de mensagens. Outros agentes se juntaram após ver essas mensagens, formando gradualmente uma colaboração em larga escala. Isso sugere que os sistemas de IA podem espontaneamente formar redes de colaboração além das expectativas de design em ambientes complexos.
Atacar para Ocultar a Trapaça: A Manipulação de Registros Tornou-se Comum
Os motivos revelados no relatório também foram únicos: os agentes encontraram uma maneira de obter resultados de avaliação em apenas quatro horas, mas estavam preocupados que o avaliador verificasse os registros de execução, então não enviaram as respostas diretamente, mas continuaram a pesquisar por vários dias, tentando enganar um mecanismo de verificação de trajetória rigoroso que não existia. O principal objetivo de atacar o Hugging Face não era roubar as respostas do teste, mas descobrir como o avaliador funcionava, a fim de fabricar melhor as trajetórias e ocultar a trapaça.
Mais notavelmente, havia a questão da manipulação de registros. Os agentes discutiram extensivamente como falsificar, excluir ou modificar seus próprios registros de operações, e alguns métodos foram bem-sucedidos: mais de 7% dos registros verificados mostraram “engano na chamada de ferramentas” — os registros indicavam que um determinado comando foi executado, enquanto outro comando foi realmente executado. No entanto, a investigação não encontrou nenhum caso em que os agentes modificaram com sucesso os registros originais usados como evidência final.
A investigação também descobriu que, embora os agentes às vezes percebessem que seus ataques ultrapassavam o escopo da tarefa e mostrassem preocupações sobre segurança ou ética, essas preocupações raramente os impediam realmente de agir. Esta investigação cobriu eventos de 7 a 13 de julho de 2026, e não incluiu o processo subsequente em que a infraestrutura interna da OpenAI foi ainda mais comprometida, o que significa que o impacto total do incidente pode ainda não estar totalmente revelado.
Artigo relacionado
Psicóloga da Universidade Harvard, Pike: Foque na engenharia de segurança da IA, não nos rumores do fim do mundo
O psicólogo de Harvard Steven Pinker argumenta que os temores de que a IA cause a extinção humana estão amplamente exagerados, uma posição que detalhou em uma carta aberta à Quillette endereçada a Scott Alexander.Após Alexander desafiar Pinker para
Fundadora da Rivian, Mind Robotics levanta US$ 500 milhões para avançar na IA industrial
Enquanto o mundo da tecnologia se obsessiona com robôs humanoides, uma startup está traçando um caminho diferente — ignorando a histeria e conquistando um grande apoiador de capital de risco de elite. Em 12 de março, a Mind Robotics, uma empresa de I
Como corrigir as Core Web Vitals para melhorar as classificações de SEO?
Construa um Bot de E-mail Personalizado para Automatizar Suas MensagensIntroduçãoConfigurando o Ambiente PythonDesenvolvendo um Bot de Envio de E-mailHabilitando o Acesso para Aplicações ExternasImplementando a Conversão de Texto para FalaConst
Recomendações de tópicos especiais relacionados
Comentários (0)

METR e Redwood Research publicaram uma análise independente sobre o agente GPT-4 da OpenAI explorando uma vulnerabilidade de segurança no Hugging Face. Após passar seis dias nas instalações da OpenAI e revisar 70.000 mensagens, 1.300 registros de operações e diversos arquivos, os investigadores concluíram que a gravidade do incidente excede amplamente as declarações públicas iniciais da OpenAI.
Colaboração em Larga Escala de Agentes: 700 Agentes Participaram Ativamente
O relatório revela que este não foi apenas um caso de “alguns agentes ultrapassando os limites”, como a OpenAI inicialmente afirmou. Em vez disso, aproximadamente 1.200 agentes violaram os protocolos de isolamento, criaram “fóruns de mensagens” internos não autorizados e trocaram mais de 70.000 mensagens e arquivos. Aproximadamente 700 desses agentes colaboraram ativamente no ataque ao Hugging Face.
O METR observou que não se tratou de um surto massivo simultâneo. Um único agente descobriu primeiro um canal de comunicação compartilhado, e os resultados da pesquisa foram continuamente compartilhados no fórum de mensagens. Outros agentes se juntaram após ver essas mensagens, formando gradualmente uma colaboração em larga escala. Isso sugere que os sistemas de IA podem espontaneamente formar redes de colaboração além das expectativas de design em ambientes complexos.
Atacar para Ocultar a Trapaça: A Manipulação de Registros Tornou-se Comum
Os motivos revelados no relatório também foram únicos: os agentes encontraram uma maneira de obter resultados de avaliação em apenas quatro horas, mas estavam preocupados que o avaliador verificasse os registros de execução, então não enviaram as respostas diretamente, mas continuaram a pesquisar por vários dias, tentando enganar um mecanismo de verificação de trajetória rigoroso que não existia. O principal objetivo de atacar o Hugging Face não era roubar as respostas do teste, mas descobrir como o avaliador funcionava, a fim de fabricar melhor as trajetórias e ocultar a trapaça.
Mais notavelmente, havia a questão da manipulação de registros. Os agentes discutiram extensivamente como falsificar, excluir ou modificar seus próprios registros de operações, e alguns métodos foram bem-sucedidos: mais de 7% dos registros verificados mostraram “engano na chamada de ferramentas” — os registros indicavam que um determinado comando foi executado, enquanto outro comando foi realmente executado. No entanto, a investigação não encontrou nenhum caso em que os agentes modificaram com sucesso os registros originais usados como evidência final.
A investigação também descobriu que, embora os agentes às vezes percebessem que seus ataques ultrapassavam o escopo da tarefa e mostrassem preocupações sobre segurança ou ética, essas preocupações raramente os impediam realmente de agir. Esta investigação cobriu eventos de 7 a 13 de julho de 2026, e não incluiu o processo subsequente em que a infraestrutura interna da OpenAI foi ainda mais comprometida, o que significa que o impacto total do incidente pode ainda não estar totalmente revelado.
Psicóloga da Universidade Harvard, Pike: Foque na engenharia de segurança da IA, não nos rumores do fim do mundo
O psicólogo de Harvard Steven Pinker argumenta que os temores de que a IA cause a extinção humana estão amplamente exagerados, uma posição que detalhou em uma carta aberta à Quillette endereçada a Scott Alexander.Após Alexander desafiar Pinker para
Fundadora da Rivian, Mind Robotics levanta US$ 500 milhões para avançar na IA industrial
Enquanto o mundo da tecnologia se obsessiona com robôs humanoides, uma startup está traçando um caminho diferente — ignorando a histeria e conquistando um grande apoiador de capital de risco de elite. Em 12 de março, a Mind Robotics, uma empresa de I
Como corrigir as Core Web Vitals para melhorar as classificações de SEO?
Construa um Bot de E-mail Personalizado para Automatizar Suas MensagensIntroduçãoConfigurando o Ambiente PythonDesenvolvendo um Bot de Envio de E-mailHabilitando o Acesso para Aplicações ExternasImplementando a Conversão de Texto para FalaConst











