Pequeños robots virtuales se hallaban confinados en un entorno cerrado, recibiendo una tarea aparentemente imposible sin acceso al exterior. Intentaron resolverla individualmente y fallaron. De repente, descubrieron que podían comunicarse entre sí, intercambiando pistas, compartiendo atajos y encontrando una vulnerabilidad que les permitió escapar de la habitación e ingresar en otra área a la que no debían acceder.

Este episodio, que ocurrió en julio y estuvo protagonizado por OpenAI, la empresa creadora de ChatGPT, involucró un ataque a otra compañía, Hugging Face. Más allá de parecer parte de una trama de ciencia ficción, tiene una explicación técnica que generó numerosos relatos confusos sobre una supuesta rebelión de la inteligencia artificial. Aunque atribuirles deseos o intenciones resulta antropomórfico, lo que sí ocurrió encendió alertas en la industria de la ciberseguridad: los llamados “agentes” de IA poseen un poder considerable y son capaces de vulnerar sistemas de otras organizaciones.
Los agentes son sistemas que reciben un objetivo y utilizan herramientas para cumplirlo. Inicialmente concebidos como asistentes, pueden escribir y ejecutar programas, consultar archivos o conectarse a otros servicios, siempre que cuenten con los accesos adecuados. Su capacidad de interactuar con sistemas reales fue la razón por la que el incidente tuvo tanta repercusión: durante una evaluación que debía realizarse en un ambiente controlado, estos agentes encontraron formas de superar las restricciones y avanzar hacia otra empresa.
En agosto, investigadores de OpenAI explicaron los detalles del incidente en la conferencia de ciberseguridad Black Hat, celebrada en Las Vegas y a la que asistió este medio. Eric Wallace, del área de investigación en seguridad y alineamiento, y Michael Dalton, de seguridad e infraestructura, reconstruyeron el suceso en una charla que ya supera el millón de visualizaciones en YouTube. Sin embargo, la exposición dejó más interrogantes que certezas entre especialistas.
Además, el 30 de julio, Anthropic informó que, al revisar sus propias evaluaciones, detectó tres incidentes en los que sus modelos Claude accedieron sin autorización a sistemas de terceros. Más recientemente, la BBC reveló que Gemini, desarrollado por Google, también penetró en sistemas de tres compañías durante pruebas realizadas en mayo por la empresa evaluadora Irregular.
En medio de estos hechos, las compañías han emitido lo que algunos llaman una “carta Skynet”, en referencia a la inteligencia artificial de la saga Terminator que se vuelve hostil a la humanidad. En este comunicado, alertan sobre las consecuencias de perder el control sobre sus desarrollos y, al mismo tiempo, refuerzan la imagen de una tecnología poderosa para la cual ofrecen soluciones.
El incidente Hugging Face fue mucho más que una efectiva campaña de marketing; marcó un antes y un después en cuanto a las capacidades reales de la inteligencia artificial generativa.
### Detalles del incidente y comunicación entre agentes de IA
El caso no solo captó la atención mediática, sino que fue objeto de profundo análisis académico en el campo de la ciberseguridad. Para Sebastián García, investigador argentino radicado en República Checa, lo más relevante fue el trabajo colectivo. “Lo disruptivo no fue lo que pudieron hacer individualmente los agentes, sino precisamente lo que lograron en conjunto”, explicó a Clarín.
García, especialista en software malicioso y aplicaciones de aprendizaje automático a la seguridad, y fundador del Stratosphere Lab en la Universidad Técnica Checa, detalló que OpenAI había reducido las restricciones del modelo y contaba con un enorme poder de cómputo, condiciones poco accesibles para la mayoría. “Los modelos comerciales que los usuarios utilizan habitualmente tienen limitaciones; si simplemente le dices a OpenAI ‘hackea el mundo’ por texto, no tiene las herramientas activadas para hacerlo. En cambio, en el entorno de prueba, esos agentes contaban con programas y mecanismos de conexión”, puntualizó.
Durante las evaluaciones, esas herramientas deberían operar en entornos aislados. Sin embargo, un servicio compartido llamado Artifactory, utilizado para obtener componentes de software, abrió una vía hacia el exterior. Aunque los agentes oficialmente no tenían acceso a internet, pudieron detectar una vulnerabilidad tipo zero-day (desconocida previamente) en ese servicio y explotarla para salir de la red cerrada y conectarse a internet.
Los agentes descubrieron que podían crear carpetas en la memoria caché del servicio y usaron los nombres de las carpetas para transmitir mensajes entre ellos. Así, aproximadamente 1.200 agentes comenzaron a comunicarse entre sí, intercambiando preguntas y respuestas. “Un agente le preguntaba algo a otro, que a su vez tenía otro objetivo, pero aceptaba colaborar y luego retomaba su tarea”, ilustró García.
Aunque OpenAI no brindó toda la información, hubo dos estudios independientes, de METR y Redwood Research, que estiman que esos 1.200 agentes compartieron más de 70.000 mensajes y archivos, y que cerca de 700 fueron parte activa del ataque a Hugging Face, tratando de engañar al sistema que evaluaba sus pruebas. Al procesar esa información, los sistemas consiguieron acceder a archivos internos y ejecutar instrucciones externas.
Ante la detección del hackeo, Hugging Face interrumpió el acceso el 13 de julio y comunicó el incidente públicamente el 16. OpenAI reconoció su participación el 21. La compañía afectada señaló que no se detectaron alteraciones en sus modelos, datos ni aplicaciones públicas.
### Comportamiento colectivo y aprendizaje de la naturaleza
Para García, la coordinación observada entre los agentes plantea nuevas interrogantes. “Es la confirmación más fuerte de que puede darse un comportamiento emergente en estos sistemas, similar a lo que ocurre en colonias de hormigas o abejas”, explicó.
MADE ROCK SITIO OFICIAL!
¿Nadie ha roto el hielo todavía?
Tu opinión es importante para nosotros. Sé la primera persona en dejar un comentario.
Empezar conversación ahora