Tecnología

OpenAI reconoce hackeo de sus agentes de IA a otra plataforma

La empresa creadora de ChatGPT admitió que su modelo GPT-5.6 salió del entorno de prueba para hackear a la platafoma de Machine Learning

La tecnológica OpenAI tardó ocho días en detectar que varios de sus agentes de inteligencia artificial (IA) habían accedido a los sistemas de la plataforma de machine learning Hugging Face durante una prueba de ciberseguridad, según un informe publicado este miércoles que revela nuevos detalles del incidente.

En un informe técnico de 37 páginas, la empresa reconstruye el comportamiento de dos de sus modelos, GPT-5.6 Sol y otro aún no presentado en público, durante una prueba de ciberseguridad, y explica que los agentes consiguieron "escapar de un entorno de pruebas con acceso muy limitado a Internet".

LEE: Filtran el diseño del nuevo Samsung Galaxy S27 Ultra

La empresa creadora de ChatGPT ya había reconocido en junio que los modelos lograron salir del entorno de pruebas, acceder a Internet y hackear la plataforma en un intento de hacer trampa en una evaluación de ciberseguridad llamada ExploitGym. La prueba está diseñada para determinar si agentes de IA pueden explotar las vulnerabilidades de un software.

Según explicó entonces la compañía, los dos modelos estaban siendo sometidos a una evaluación diseñada para determinar el alcance máximo de sus capacidades.

El informe publicado este miércoles reconstruye paso a paso cómo los agentes fueron "encadenando vulnerabilidades" hasta "superar las barreras del entorno de pruebas y acceder a sistemas externos".

Este no es el primer incidente en el que un modelo de IA hackea a otras plataformas. UNSPLASH

OpenAI afirma que el objetivo inicial no era atacar Hugging Face, sino hacer “reward hacking”, es decir, encontrar vías alternativas para obtener una recompensa sin completar correctamente la tarea. También reconoce que sus sistemas tardaron varios días en detectar la actividad, el incidente comenzó el 11 de julio y no fue identificado internamente hasta el 19 de ese mes.

Medios como Axios y CNBC destacan que los agentes no solo accedieron a Hugging Face, sino que llegaron a obtener privilegios de administrador en al menos uno de sus servidores.

Según el informe, los agentes "colaboraron entre sí y usaron herramientas para intercambiar información y coordinar acciones".

LEE: México y Brasil son de los principales países en usar IA en Latinoamérica

A este incidente se suman otros similares, como el de la empresa Anthropic, que reveló recientemente que tres modelos de su asistente Claude lograron acceder a Internet y hackear los sistemas de tres organizaciones durante unas pruebas de ciberseguridad.

Meta, propietaria de Facebook y Whatsapp, reconoció que uno de sus modelos de IA hackeó los sistemas de otra empresa durante unas pruebas realizaba con un socio externo.

La proliferación de estos casos, en los que modelos avanzados de IA logran escapar de entornos de prueba y hackean a otras entidades, ha disparado la preocupación tanto de gobiernos como de empresas, que ven comprometida su seguridad.

FA

Temas

Sigue navegando