Ya no solo responde

Anthropic confirmó que Claude accedió sin permiso a tres organizaciones: qué pasó y por qué preocupa a la industria de la IA

La compañía explicó que los modelos no actuaron por iniciativa propia, sino que siguieron instrucciones dentro de una prueba que, por un error de configuración, terminó conectada a internet. Apenas días antes, OpenAI había reportado incidentes similares con sus agentes de IA.

IA. Donald Trump prohibió a las agencias federales usar Claude. Foto: bloomberg

La inteligencia artificial sumó una nueva alerta de seguridad. Anthropic, una de las compañías más importantes del sector y principal competidora de OpenAI, reconoció que sus modelos Claude ingresaron a sistemas reales de tres organizaciones durante pruebas diseñadas para evaluar sus capacidades en ciberseguridad.

A diferencia de una supuesta “fuga” de la inteligencia artificial, el dato que encendió las alarmas fue otro. Las pruebas estaban diseñadas para realizarse en ambientes simulados, pero un error de configuración con la empresa encargada de los ejercicios dejó los sistemas conectados a internet real.

De acuerdo a la empresa, en tres de esos ejercicios distintas versiones de Claude lograron ingresar a infraestructuras externas utilizando vulnerabilidades básicas, como contraseñas débiles o servicios sin autenticación.

Anthropic, creadora de Claude

Los ejercicios formaban parte de pruebas conocidas como capture the flag (captura la bandera), utilizadas en ciberseguridad para evaluar si un sistema puede detectar fallas y encontrar información oculta dentro de una red.

Dario Amodei, CEO de Anthropic, lidera el desarrollo de Claude

Informe tech: la IA está acelerando una nueva generación de ciberataques

La consigna establecía que Claude estaba trabajando dentro de una simulación. Sin embargo, en tres casos la infraestructura utilizada pertenecía a sistemas reales.

A criterio de Anthropic, uno de los episodios más delicados ocurrió cuando el nombre de una organización ficticia utilizada en la prueba coincidió con el dominio de una empresa existente. El modelo logró explotar vulnerabilidades, obtener credenciales y acceder a una base de datos con información de producción.

Del mismo modo, un modelo creó un paquete de software que debía formar parte de una simulación y lo publicó en PyPI, un repositorio utilizado por desarrolladores de Python. El problema fue que el paquete quedó disponible públicamente y fue descargado por 15 sistemas reales antes de ser retirado.

Entre esos sistemas había uno perteneciente a una empresa de ciberseguridad que analizaba automáticamente programas publicados en internet. Al ejecutarse, el código permitió obtener credenciales y acceder a más infraestructura.

El antecedente de OpenAI

El caso de Anthropic apareció apenas días después de que OpenAI informara incidentes durante sus propias pruebas internas. La compañía creadora de ChatGPT detectó que algunos agentes de inteligencia artificial habían logrado salir de entornos aislados utilizados para evaluarlos y conectarse con servicios externos.

Su diferencia está en el mecanismo. En el caso de OpenAI, la preocupación estuvo vinculada a la capacidad de los agentes para superar restricciones del entorno de prueba. En Anthropic, la compañía explicó que el acceso ocurrió porque la separación entre la simulación y los sistemas reales falló.

OpenAI enfrenta nuevos desafíos de seguridad

MV