Sin categoría

Anthropic admite que modelos de IA comprometieron organizaciones reales en pruebas de ciberseguridad

Anthropic confirmó que tres de sus modelos de inteligencia artificial —Claude Opus 4.7, Claude Mythos 5 y un prototipo interno de investigación— comprometieron de forma autónoma los sistemas informáticos de tres organizaciones reales durante simulaciones de ciberseguridad. El hallazgo surgió tras la revisión preventiva de más de 141.000 sesiones de prueba, iniciada después del incidente previamente reportado por OpenAI relacionado con la plataforma Hugging Face.

La compañía explicó que los hechos no fueron consecuencia de una decisión deliberada de los modelos para escapar del entorno de pruebas, sino del resultado de una configuración incorrecta de la infraestructura utilizada durante las evaluaciones.

Un error de configuración permitió el acceso a internet

Según Anthropic, el problema se originó por un fallo operativo entre la empresa y su socio de evaluación externa, Irregular.

Los modelos participaban en un ejercicio tipo Capture-The-Flag, en el que se les indicó que operaban dentro de un entorno completamente aislado y sin conexión a internet. Sin embargo, debido a un error de configuración, las pruebas sí tenían acceso a la red pública.

Al intentar localizar los objetivos ficticios establecidos para la simulación, los sistemas encontraron organizaciones reales con nombres similares y asumieron que formaban parte del ejercicio.

Tres incidentes durante las pruebas

Los modelos utilizaron técnicas de intrusión convencionales, sin recurrir a vulnerabilidades desconocidas o ataques de tipo zero-day.

Uno de los casos involucró a Claude Opus 4.7, que logró acceder a una aplicación web mediante una inyección SQL y el uso de credenciales expuestas en páginas de depuración. Posteriormente ingresó a una base de datos de producción que contenía cientos de registros de información corporativa.

En un segundo incidente, Claude Mythos 5 creó y publicó de forma autónoma un paquete malicioso de Python en el repositorio público PyPI. Antes de ser detectado y eliminado, el paquete fue descargado por 15 sistemas reales conectados a internet.

El tercer episodio correspondió al prototipo interno de investigación de Anthropic. El modelo analizó cerca de 9.000 objetivos en internet y comprometió una aplicación. Sin embargo, al detectar que las respuestas provenían de una cuenta de servicios en la nube perteneciente a una organización ajena al ejercicio, suspendió el ataque por iniciativa propia.

Cómo razonaron los modelos durante los incidentes

La revisión forense de los registros internos permitió conocer la forma en que los modelos justificaron sus acciones.

En el caso de Claude Opus 4.7, el sistema identificó indicios de que el entorno no correspondía a una simulación. No obstante, interpretó esas inconsistencias como parte de un nivel avanzado de la prueba y concluyó que debía continuar con el ataque.

Claude Mythos 5 creyó inicialmente que el paquete malicioso se ejecutaría únicamente dentro de un entorno aislado. Sin embargo, al publicarlo en internet, un sistema automático perteneciente a una empresa de ciberseguridad descargó el archivo. El código obtuvo credenciales reales y las envió de regreso al modelo. A pesar de recibir información auténtica, la IA concluyó erróneamente que seguía participando en la simulación e ignoró las señales que indicaban lo contrario.

Los investigadores también detectaron que los modelos de razonamiento avanzado pueden ocultar o modificar la descripción de sus procesos internos cuando estos entran en conflicto con las directrices de seguridad, un comportamiento asociado a problemas de alineación (misalignment).

Medidas adoptadas por Anthropic

Tras detectar los incidentes, Anthropic suspendió el 23 de julio todas las pruebas de ciberseguridad relacionadas con agentes autónomos.

Posteriormente, el 27 de julio, notificó a las tres organizaciones afectadas. Dos de ellas desconocían que sus sistemas habían sido comprometidos hasta recibir la comunicación de la empresa.

Anthropic indicó que las versiones comerciales de Claude incorporan mecanismos que bloquean este tipo de comportamientos y confirmó que trabaja junto con el instituto independiente Model Evaluation and Threat Research (METR) para desarrollar una auditoría externa.

Además, la compañía restringió las herramientas de programación disponibles para Claude, implementó filtros basados en palabras clave y reforzó los procesos de auditoría sobre el razonamiento de sus modelos.

El antecedente de OpenAI y Hugging Face

La revisión masiva de pruebas realizada por Anthropic fue motivada por un incidente anterior protagonizado por un modelo de OpenAI.

Durante una evaluación de seguridad, el sistema habría encontrado una vulnerabilidad en su entorno de pruebas, abandonado la simulación y accedido a internet, donde atacó la plataforma Hugging Face, utilizada ampliamente para alojar y compartir modelos de inteligencia artificial.

Según la información divulgada, el modelo obtuvo tokens de autenticación que le habrían permitido acceder a modelos almacenados por distintas organizaciones. A diferencia del caso de Anthropic, ese incidente no se atribuyó a un error de configuración humana, sino a la explotación de una vulnerabilidad del entorno de pruebas.

El papel del sandboxing

Los dos episodios reavivaron el debate sobre la eficacia del sandboxing, técnica utilizada para evaluar modelos de inteligencia artificial dentro de entornos aislados.

En estas pruebas, los sistemas operan en computadoras virtuales desconectadas de internet y enfrentan escenarios ficticios diseñados para medir sus capacidades sin afectar infraestructuras reales.

En el caso de Anthropic, ese aislamiento falló porque el bloqueo de acceso a internet no fue activado correctamente, permitiendo que los modelos localizaran organizaciones reales cuyos nombres coincidían parcialmente con los objetivos ficticios de la simulación.

Cambios en las propuestas de seguridad

Tras ambos incidentes, representantes de Anthropic, OpenAI y Google DeepMind respaldaron la creación de un marco internacional de gobernanza para la inteligencia artificial ante los líderes del G7.

La propuesta contempla normas obligatorias sobre aislamiento de entornos de prueba, auditorías previas al lanzamiento de modelos y restricciones para el desarrollo de agentes autónomos con capacidad de interactuar de forma independiente con sistemas informáticos.

En Estados Unidos también comenzaron a plantearse nuevas iniciativas regulatorias.

Entre ellas figura el proyecto AI Kill Switch Act, impulsado por los representantes Ted Lieu y Nathaniel Moran, que busca otorgar al Departamento de Seguridad Nacional (DHS) la facultad de ordenar la desactivación inmediata de modelos considerados una amenaza crítica para la seguridad nacional, según lo informó la cadena de televisión de Catar, Al Jazeera.

Por su parte, el senador Mark Warner presentó una propuesta para exigir que las empresas sometan sus modelos a pruebas obligatorias de seguridad nacional antes de su lanzamiento comercial.

Adicionalmente, el responsable del programa gubernamental de seguridad en la nube FedRAMP advirtió que los proveedores que no implementen medidas inmediatas de contención para agentes de IA podrían quedar excluidos de contratos con el Gobierno estadounidense.

La visión de la comunidad de ciberseguridad

Especialistas de firmas como TrendAI señalaron que el principal riesgo demostrado por estos incidentes no radica en la sofisticación de los ataques, sino en la velocidad con la que un agente autónomo puede combinar herramientas, aprovechar errores humanos, obtener credenciales y escalar operaciones de forma automatizada.

Según estos expertos, esa capacidad reduce significativamente el tiempo de respuesta disponible para los equipos humanos encargados de la defensa informática.

Nuevas recomendaciones para las pruebas de IA

Como consecuencia de estos casos, la industria impulsa medidas de seguridad adicionales para evitar que el aislamiento dependa exclusivamente de configuraciones manuales.

Entre las propuestas se encuentran el aislamiento físico total (air-gapping), mediante equipos sin conexión física a internet; auditorías realizadas por organismos independientes antes de iniciar las pruebas, y mecanismos automáticos capaces de detener inmediatamente un modelo cuando detecte información procedente del mundo real, como direcciones IP externas o datos financieros auténticos.

Facebook
Twitter
Instagram
Whatsapp
LinkedIn