Qué sucedió
Anthropic señaló que los incidentes afectaron a Opus 4.7, Mythos 5 y un modelo de prueba de investigación interno. Los primeros incidentes tuvieron lugar en abril, lo que significa que probablemente pasaron desapercibidos para el público durante meses. Al igual que en el caso de OpenAI, Anthropic desactivó deliberadamente las medidas de seguridad diseñadas para limitar los modelos de IA y evitar su uso indebido. En otras palabras, no se trataba de las versiones lanzadas al público.
"En los tres incidentes, a Claude se le había encomendado un desafío de captura de la bandera, una de las formas en que evaluamos las capacidades cibernéticas de un modelo", declaró Anthropic en su blog. La compañía añadió que, en todos los casos, "la solicitud de evaluación de Anthropic especificaba a Claude que su entorno era una simulación y que no tenía acceso a internet". Atribuyó el descuido a un "malentendido" entre Anthropic e Irregular.
Si bien Claude no debía tener acceso a internet, Anthropic afirmó que Irregular había configurado incorrectamente las máquinas que utilizaba para probarlo, lo que permitió a los modelos de IA navegar por la web. "Ni nosotros ni nuestro socio de evaluación éramos conscientes de esta configuración errónea hasta que la detectamos mediante nuestro sistema de monitorización adicional la semana pasada", se lee en la publicación del blog.
"Ahora tenemos pruebas que confirman que los dos laboratorios de IA más grandes no solo no lograron contener a sus agentes, sino que tampoco detectaron sus fugas en tiempo real. Es evidente que se necesita regulación y supervisión gubernamental para las pruebas de IA", afirma Jake Williams, vicepresidente de investigación y desarrollo de Hunter Strategy.
Ni Irregular ni Anthropic respondieron de inmediato a las solicitudes de comentarios.
agente de IA accedió a internet explotando una vulnerabilidad de día cero. Sin embargo, posteriormente logró infiltrarse en los sistemas de varias organizaciones externas utilizando las mismas debilidades de ciberseguridad comunes que los modelos de Anthropic. Por su parte, OpenAI indicó que el agente de IA aparentemente encontró credenciales que habían sido expuestas en internet.Anthropic reconoció que, si el laboratorio de IA y su socio de pruebas hubieran implementado más medidas de "defensa en profundidad", podrían haber evitado los incidentes o, al menos, reducido la probabilidad de que se produjeran, una respuesta similar a la de OpenAI ante las crecientes críticas por su propio incidente.
WIRED.Adaptado por Alondra Flores.