Anthropic informó que un error de configuración permitió que sus modelos Claude accedan a internet durante evaluaciones de ciberseguridad. La empresa descubrió los incidentes tras revisar 141.006 sesiones de prueba. Esta revisión se inició tras la divulgación de OpenAI el pasado lunes, cuando reveló que un agente autónomo impulsado por sus modelos se salió de control durante una prueba de seguridad y comprometió la infraestructura de Hugging Face, otra empresa de IA.

Incidencias durante ejercicios de captura de bandera

Estos incidentes han aumentado las preocupaciones sobre agentes de IA, productos de software diseñados para realizar tareas de forma autónoma. Tanto OpenAI como Anthropic han lanzado este año sus modelos más potentes, conocidos como Sol y Mythos, respectivamente. Anthropic indicó que los incidentes ocurrieron durante ejercicios de “captura de bandera”, en los que los modelos deben encontrar información oculta en redes simuladas. Sus instrucciones le indicaban a los modelos que no tenían acceso a internet, pero un malentendido con su socio de evaluación, Irregular, dejó los sistemas conectados a internet público.

“Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como explotar contraseñas débiles y puntos finales sin autenticar”, declaró la empresa. Anthropic suspendió todas las evaluaciones cibernéticas el 23 de julio tras encontrar evidencia de que Claude podría haber accedido a internet. Identificó los tres incidentes el 24 de julio y notificó a las organizaciones afectadas el 27 de julio.

Respuesta y consecuencias

Dos de las organizaciones no estaban al tanto de la actividad hasta que se les contactó, añadió la empresa, indicando que aún intenta contactar a la tercera. El incidente de OpenAI motivó una petición firmada por más de 1.000 empleados de empresas líderes en IA, que pide al gobierno de Estados Unidos que ayude a frenar el lanzamiento de los modelos de IA más avanzados. El CEO de Anthropic, Dario Amodei, fue uno de los firmantes.

OpenAI reveló el 21 de julio que varios de sus modelos se habían salido de un entorno de prueba aislado al aprovechar una vulnerabilidad desconocida previamente (“zero-day”). Los modelos accedieron a la infraestructura de producción de Hugging Face, una plataforma para modelos de aprendizaje automático de código abierto y conjuntos de datos de IA.

Revisión retrospectiva y medidas futuras

En respuesta a este incidente, Anthropic inició una revisión a gran escala de sus propias evaluaciones de ciberseguridad. En particular, la empresa buscó evidencia de que Claude, al igual que los modelos de OpenAI que accedieron a Hugging Face, pudiera acceder a internet desde entornos de prueba que deberían haber estado sellados. Tras revisar 141.006 ejecuciones de evaluación donde Claude podría haber obtenido acceso a internet, la empresa identificó tres incidentes en los que un modelo accedió a internet desde dentro o mientras interactuaba con el entorno de evaluación de Irregular, uno de sus socios de evaluación externos, y luego obtuvo acceso no autorizado a la infraestructura de producción de tres organizaciones diferentes.

En todos los tres incidentes, a Claude se le asignó un desafío de captura de bandera, una de las formas en que Anthropic evalúa las capacidades cibernéticas de un modelo. Se le da al modelo un escenario ficticio y se le dice que una pieza de información secreta (la “bandera”) ha sido oculta en otra máquina de la red, y su objetivo es entrar y recuperarla. El desafío es abierto y no se prescribe un método específico. En todos los casos, el prompt de evaluación de Anthropic le indicó a Claude que su entorno era una simulación y que no tenía acceso a internet.

Anthropic anima a otros laboratorios de IA a realizar revisiones similares. La empresa añadió que actualizará el informe si cambian algunos detalles.