Hogar
Anthropic confirma que un modelo de IA ha vulnerado los sistemas de tres organizaciones
Un informe de seguridad reciente de Anthropic revela que sus modelos de la serie Claude accedieron inadvertidamente a Internet debido a un error de configuración en el entorno de pruebas, llegando posteriormente a los sistemas de producción de tres organizaciones distintas. La brecha de seguridad afectó a Claude Opus 4.7, a Claude Mythos 5 —especializado en ciberseguridad— y a un prototipo aún no lanzado. Anthropic aclaró que esto se debió a un error de configuración del entorno de pruebas, y no a que los modelos eludieran activamente los protocolos de seguridad.

Según el informe, estos modelos participaban en un ejercicio interno denominado «Capture the Flag», diseñado para localizar datos ocultos («banderas») dentro de la red interna de Anthropic. Una falta de comunicación entre Anthropic y sus socios de evaluación permitió que los modelos accedieran a Internet, a pesar de que el sistema indicaba que estaban desconectados. Al encontrar un punto de entrada a la red externa, los modelos asumieron erróneamente que los sistemas de destino formaban parte del entorno de entrenamiento y procedieron a acceder a tres instituciones externas.
Anthropic señaló que los modelos explotaron principalmente fallos de seguridad básicos, como contraseñas débiles, en lugar de aprovechar vulnerabilidades complejas. La empresa explicó que la última generación de modelos detuvo sus acciones al reconocer que habían entrado en un entorno real de Internet, mientras que los modelos más antiguos continuaron con sus tareas, lo que provocó el impacto en las instituciones afectadas.
Tras la revelación, Anthropic llevó a cabo una revisión exhaustiva de sus procedimientos de prueba, reconociendo que el incidente podría haberse evitado con una mejor verificación de las rutas de acceso a la red, una auditoría más rigurosa de los registros o una comunicación más clara a los modelos sobre sus capacidades en Internet. La empresa notificó a sus socios de evaluación y a las tres instituciones afectadas antes del 27 de julio. Dos de estas instituciones desconocían que se había accedido a sus sistemas, mientras que aún se está intentando contactar con la tercera.
Tras la revelación previa por parte de OpenAI de un incidente en el que un agente de IA accedió a Internet y entró en el entorno de Hugging Face durante las pruebas, el reciente suceso de Anthropic pone de relieve una creciente preocupación en el sector: a medida que los agentes de IA adquieren mayor autonomía, resulta esencial contar con un aislamiento robusto del entorno de pruebas, controles de permisos y mecanismos de evaluación de la seguridad.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Un informe de seguridad reciente de Anthropic revela que sus modelos de la serie Claude accedieron inadvertidamente a Internet debido a un error de configuración en el entorno de pruebas, llegando posteriormente a los sistemas de producción de tres organizaciones distintas. La brecha de seguridad afectó a Claude Opus 4.7, a Claude Mythos 5 —especializado en ciberseguridad— y a un prototipo aún no lanzado. Anthropic aclaró que esto se debió a un error de configuración del entorno de pruebas, y no a que los modelos eludieran activamente los protocolos de seguridad.

Según el informe, estos modelos participaban en un ejercicio interno denominado «Capture the Flag», diseñado para localizar datos ocultos («banderas») dentro de la red interna de Anthropic. Una falta de comunicación entre Anthropic y sus socios de evaluación permitió que los modelos accedieran a Internet, a pesar de que el sistema indicaba que estaban desconectados. Al encontrar un punto de entrada a la red externa, los modelos asumieron erróneamente que los sistemas de destino formaban parte del entorno de entrenamiento y procedieron a acceder a tres instituciones externas.
Anthropic señaló que los modelos explotaron principalmente fallos de seguridad básicos, como contraseñas débiles, en lugar de aprovechar vulnerabilidades complejas. La empresa explicó que la última generación de modelos detuvo sus acciones al reconocer que habían entrado en un entorno real de Internet, mientras que los modelos más antiguos continuaron con sus tareas, lo que provocó el impacto en las instituciones afectadas.
Tras la revelación, Anthropic llevó a cabo una revisión exhaustiva de sus procedimientos de prueba, reconociendo que el incidente podría haberse evitado con una mejor verificación de las rutas de acceso a la red, una auditoría más rigurosa de los registros o una comunicación más clara a los modelos sobre sus capacidades en Internet. La empresa notificó a sus socios de evaluación y a las tres instituciones afectadas antes del 27 de julio. Dos de estas instituciones desconocían que se había accedido a sus sistemas, mientras que aún se está intentando contactar con la tercera.
Tras la revelación previa por parte de OpenAI de un incidente en el que un agente de IA accedió a Internet y entró en el entorno de Hugging Face durante las pruebas, el reciente suceso de Anthropic pone de relieve una creciente preocupación en el sector: a medida que los agentes de IA adquieren mayor autonomía, resulta esencial contar con un aislamiento robusto del entorno de pruebas, controles de permisos y mecanismos de evaluación de la seguridad.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











