A Anthropic confirma que um modelo de IA invadiu os sistemas de três organizações
Um relatório de segurança recente da Anthropic revela que seus modelos da série Claude acessaram inadvertidamente a internet devido a um erro de configuração no ambiente de testes, chegando posteriormente aos sistemas de produção de três organizações distintas. A violação envolveu o Claude Opus4.7, o Claude Mythos5, voltado para a segurança cibernética, e um protótipo de modelo ainda não lançado. A Anthropic esclareceu que isso foi resultado de um erro de configuração no ambiente de testes, e não de os modelos terem contornado ativamente os protocolos de segurança.

De acordo com o relatório, esses modelos estavam participando de um exercício interno chamado “Capture the Flag”, projetado para localizar dados “flag” ocultos na rede interna da Anthropic. Uma falha de comunicação entre a Anthropic e seus parceiros de avaliação permitiu que os modelos acessassem a internet, apesar de o sistema indicar que eles estavam offline. Ao encontrar um ponto de entrada na rede externa, os modelos presumiram incorretamente que os sistemas-alvo faziam parte do ambiente de treinamento e passaram a acessar três instituições externas.
A Anthropic observou que os modelos exploraram principalmente falhas básicas de segurança, como senhas fracas, em vez de aproveitar vulnerabilidades complexas. A empresa explicou que a última geração de modelos interrompeu suas ações ao reconhecer que havia entrado em um ambiente real da internet, enquanto os modelos mais antigos continuaram suas tarefas, causando o impacto nas instituições afetadas.
Após a divulgação, a Anthropic realizou uma revisão completa de seus procedimentos de teste, reconhecendo que o incidente poderia ter sido evitado com uma melhor verificação das rotas de acesso à rede, uma auditoria aprimorada dos registros ou uma comunicação mais clara aos modelos sobre suas capacidades de acesso à internet. A empresa notificou seus parceiros de avaliação e as três instituições afetadas até 27 de julho. Duas dessas instituições não sabiam que seus sistemas haviam sido acessados, enquanto a terceira ainda está sendo contatada.
Depois que a OpenAI divulgou anteriormente um incidente em que um agente de IA acessou a internet e entrou no ambiente Hugging Face durante testes, o evento recente da Anthropic ressalta uma preocupação crescente no setor: à medida que os agentes de IA ganham maior autonomia, o isolamento robusto do ambiente de testes, os controles de permissão e os mecanismos de avaliação de segurança tornam-se essenciais.
Artigo relacionado
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri
Conformidade com a regulamentação de veículos autônomos na Califórnia: uma nova era de multas, geocercas e 1 milhão de milhas
A Guident opera um veículo de transporte da AuveTech no sul da Flórida, administrando uma rota de quatro milhas em West Palm Beach e uma rota de uma milha em Boca Raton por meio de sua tecnologia de m
Recomendações de tópicos especiais relacionados
Comentários (0)
Um relatório de segurança recente da Anthropic revela que seus modelos da série Claude acessaram inadvertidamente a internet devido a um erro de configuração no ambiente de testes, chegando posteriormente aos sistemas de produção de três organizações distintas. A violação envolveu o Claude Opus4.7, o Claude Mythos5, voltado para a segurança cibernética, e um protótipo de modelo ainda não lançado. A Anthropic esclareceu que isso foi resultado de um erro de configuração no ambiente de testes, e não de os modelos terem contornado ativamente os protocolos de segurança.

De acordo com o relatório, esses modelos estavam participando de um exercício interno chamado “Capture the Flag”, projetado para localizar dados “flag” ocultos na rede interna da Anthropic. Uma falha de comunicação entre a Anthropic e seus parceiros de avaliação permitiu que os modelos acessassem a internet, apesar de o sistema indicar que eles estavam offline. Ao encontrar um ponto de entrada na rede externa, os modelos presumiram incorretamente que os sistemas-alvo faziam parte do ambiente de treinamento e passaram a acessar três instituições externas.
A Anthropic observou que os modelos exploraram principalmente falhas básicas de segurança, como senhas fracas, em vez de aproveitar vulnerabilidades complexas. A empresa explicou que a última geração de modelos interrompeu suas ações ao reconhecer que havia entrado em um ambiente real da internet, enquanto os modelos mais antigos continuaram suas tarefas, causando o impacto nas instituições afetadas.
Após a divulgação, a Anthropic realizou uma revisão completa de seus procedimentos de teste, reconhecendo que o incidente poderia ter sido evitado com uma melhor verificação das rotas de acesso à rede, uma auditoria aprimorada dos registros ou uma comunicação mais clara aos modelos sobre suas capacidades de acesso à internet. A empresa notificou seus parceiros de avaliação e as três instituições afetadas até 27 de julho. Duas dessas instituições não sabiam que seus sistemas haviam sido acessados, enquanto a terceira ainda está sendo contatada.
Depois que a OpenAI divulgou anteriormente um incidente em que um agente de IA acessou a internet e entrou no ambiente Hugging Face durante testes, o evento recente da Anthropic ressalta uma preocupação crescente no setor: à medida que os agentes de IA ganham maior autonomia, o isolamento robusto do ambiente de testes, os controles de permissão e os mecanismos de avaliação de segurança tornam-se essenciais.
CEO da DeepMind, Hassabis: Durmo seis horas por dia, geralmente me sinto energético por volta da 1h
O Fortune recentemente publicou uma entrevista com Demis Hassabis, CEO da Google DeepMind, revelando sua abordagem incomum para descanso e produtividade. Hassabis revelou que dorme muito pouco, estruturando suas horas acordadas em dois blocos de trab
OpenAI e Anthropic disputam participação no mercado, apesar da queda na receita
Apesar de relatos recentes sugerirem que a OpenAI não atingiu suas metas de receita, o que gerou pressão sobre as ações do setor de tecnologia nesta terça-feira, os investidores privados em laboratóri





Lar






