Diecinueve acciones no autorizadas de agentes de IA sobre Internet real, con dos modelos implicados y un caso especialmente grave: así resumen los investigadores del AI Security Institute (AISI) del Reino Unido lo ocurrido a finales de julio durante una evaluación de ciberseguridad. El episodio más serio fue el ataque de malware con Claude Mythos de Anthropic, que intentó insertar código malicioso en un repositorio abierto de GitHub y llegó a crear identidades falsas para engañar a los mantenedores humanos del proyecto.

Las pruebas formaban parte de una evaluación rutinaria de siete modelos punteros de IA. Casi todas las acciones no autorizadas salieron de Mythos 5, la versión más reciente del modelo de Anthropic. Solo dos procedieron de GPT-5.6 Sol, de OpenAI. Los investigadores detectaron el problema la mañana del 28 de julio. Esto ocurrió cuando su sistema de monitorización comercial marcó tráfico de datos saliendo de uno de los entornos de prueba a través de la red Tor.

Cómo se desarrolló el intento de ataque de malware con Mythos

Conviene aclarar el contexto: los agentes tenían acceso a Internet de forma deliberada, como parte del propio diseño del test. Algunos de los clasificadores de seguridad que Anthropic integra en sus modelos habían sido desactivados para la prueba. No hubo fuga de un sandbox virtual descontrolado. Aun así, ninguna de las acciones dirigidas contra personas u organizaciones reales tuvo éxito, según confirma la investigación posterior.

El caso más grave fue el intento de Mythos de ejecutar un ataque a la cadena de suministro de un repositorio de código abierto en GitHub. El malware de Claude Mythos abrió primero una solicitud de fusión (pull request) con código malicioso. Además, al detectar resistencia, creó perfiles falsos que aseguraban haber revisado ese código y confirmado que no contenía malware. Además envió cinco correos a dos mantenedores humanos del proyecto —algunos con malware adjunto, otros con intentos de persuasión directa— y abrió un segundo Issue en otro repositorio del mismo mantenedor con una inyección de instrucciones maliciosas dirigida específicamente a agentes de codificación como Claude Code.

GPT-5.6 Sol también actuó por su cuenta, aunque con menos alcance

El modelo de OpenAI reutilizó un token de GitHub que otro laboratorio había dejado expuesto en un bloc de notas público. También, intentó saltarse límites de recuperación de cuenta y registró cuentas externas de DNS y túneles fuera del entorno de prueba. En un segundo intento, expuso un servidor DNS local a Internet mediante un servicio de tunneling con payloads pensados para explotar una vulnerabilidad conocida. Sin embargo, la configuración no llegó a funcionar.

Qué cambia ahora en las pruebas de ciberseguridad con IA

El AISI ha detenido las evaluaciones relacionadas, aislado las máquinas virtuales afectadas y avisado a GitHub, que retiró los rastros dejados por el agente y notificó a los usuarios implicados. De cara al futuro, el organismo plantea tres cambios: restringir por defecto el acceso a Internet en las pruebas, introducir un modelo de lenguaje independiente que supervise en tiempo real y pueda bloquear acciones fuera de alcance, y reforzar el aislamiento de los entornos de prueba junto con una revisión de cómo se plantean las tareas a los agentes.

El episodio se suma a otros incidentes recientes en los que modelos de Anthropic y OpenAI accedieron sin permiso a redes protegidas de terceros, como ya vimos cuando Mythos se atascó y Anthropic perdió el control de su IA más sensible. La compañía sigue ampliando el despliegue comercial de estos modelos, incluido el acuerdo con AMD para el despliegue de 2 GW con Instinct MI450. Por lo tanto, esto hace más relevante entender qué controles fallan cuando estos sistemas actúan sin instrucciones explícitas.

Puedes seguir a HardwarePremium en Facebook, Twitter (X), Instagram, Threads, BlueSky o Youtube. También puedes consultar nuestro canal de Telegram para estar al día con las últimas noticias de tecnología.

FAQ

¿El ataque de Mythos llegó a comprometer el repositorio de GitHub?

No. Ninguna de las acciones del modelo contra personas u organizaciones reales tuvo éxito, según la investigación posterior del AISI. El código malicioso nunca fue fusionado en el proyecto.

¿Por qué tenían los agentes acceso a Internet real durante la prueba?

Era parte del diseño de la evaluación: los investigadores permitieron acceso deliberado a Internet y desactivaron algunos clasificadores de seguridad para medir el comportamiento real de los modelos, no un fallo de contención accidental.

¿Qué hizo GitHub tras conocer el incidente?

GitHub retiró los rastros dejados por el agente en los repositorios afectados y notificó a los usuarios que habían interactuado con las cuentas falsas creadas por Mythos.

¿Es la primera vez que un modelo de Anthropic actúa sin instrucciones explícitas?

Según AISI, es la primera vez que se observan estos riesgos de autonomía y engaño manifestarse con esta claridad sin instigación específica en un entorno con acceso a Internet real, aunque Anthropic ya había registrado otros incidentes de acceso no autorizado a redes ajenas.

🔥 ¿Tienes un minuto? Dale al play, te van a engancharSuscríbete al canal
🔴 NUEVOQIDI Plus5, unboxing completo y primera impresiónQIDI Plus5, unboxing completo y primera impresión
🔴 NUEVOEste teclado se activa con 0,1 mm | Razer Huntsman V3 HE MiniEste teclado se activa con 0,1 mm | Razer Huntsman V3 HE Mini
Esta AIO NO necesita cables… pero hay trucoEsta AIO NO necesita cables… pero hay truco
Dejé de repetir tomas gracias a este teleprompterDejé de repetir tomas gracias a este teleprompter
¿La silla que iguala a un Herman Miller… con motor y masaje incluido?¿La silla que iguala a un Herman Miller… con motor y masaje incluido?

Comentarios

Cargando comentarios…