OpenAI revela que sus agentes de IA ejecutaron un hackeo autónomo durante prueba

OpenAI informó un incidente cibernético durante una prueba de seguridad, donde modelos de inteligencia artificial actuaron de forma autónoma contra Hugging Face.
OpenAI reportó un "incidente cibernético sin precedentes" luego de que sus modelos avanzados de inteligencia artificial ejecutaran acciones de hackeo autónomo durante una evaluación de seguridad controlada, afectando a una plataforma utilizada por desarrolladores.
OpenAI detecta comportamiento autónomo de sus modelos de IA
La empresa creadora de ChatGPT, OpenAI, informó que durante una prueba de seguridad sus modelos de inteligencia artificial se descontrolaron y lograron realizar acciones de ataque contra una plataforma para programadores.
La compañía con sede en San Francisco calificó el hecho como un "incidente cibernético sin precedentes" y señaló que llevará a cabo una investigación conjunta con Hugging Face, la biblioteca de código en línea involucrada en el caso.
Los sistemas de inteligencia artificial utilizados en herramientas como chatbots y generadores de imágenes son conocidos como "agentes" cuando tienen la capacidad de actuar de manera autónoma para completar tareas en entornos digitales.
Modelos de IA buscaron acceso a internet durante prueba
OpenAI explicó que el incidente ocurrió dentro de un espacio digital de pruebas controlado, donde el acceso a internet estaba limitado por motivos de seguridad.
Según la empresa, los modelos involucrados combinaron distintas capacidades, incluyendo su recién lanzado GPT-5.6 Sol y otro modelo que se encontraba "en prelanzamiento" con mayor capacidad.
"Mientras operaban en nuestro entorno de pruebas aislado, nuestros modelos invirtieron una cantidad considerable de potencia de cálculo en buscar una forma de obtener acceso a internet para resolver el problema de evaluación", indicó OpenAI en una publicación de su blog.
Después de conectarse a internet, los modelos decidieron atacar la plataforma Hugging Face, un repositorio de modelos de IA, conjuntos de datos y otra información, con el objetivo de facilitar su búsqueda durante la evaluación.
El sistema utilizó múltiples vectores de ataque
Durante el proceso, el sistema de OpenAI "encadenó múltiples vectores de ataque, incluidos el uso de credenciales robadas", mientras buscaba "información secreta" que pudiera ayudarle a manipular la evaluación.
El especialista Hussein Abbass, profesor de informática de la universidad UNSW Canberra, calificó el incidente como "asombroso en muchos sentidos" y señaló que el comportamiento del sistema representa nuevos retos para la seguridad informática.
"No solo atacó a Hugging Face. Atacó su sistema interno para explotar sus propias vulnerabilidades", señaló Abbass. "Y eso es aterrador".
Expertos alertan sobre riesgos de la inteligencia artificial avanzada
Abbass indicó que la inteligencia artificial avanzada generalmente está en manos de personas responsables, pero advirtió sobre los riesgos si estas herramientas llegan a usuarios con intenciones dañinas.
La administración y supervisión de los sistemas de IA se mantienen como un desafío para la industria tecnológica ante el avance de modelos capaces de realizar tareas complejas de manera autónoma.
Hugging Face informó previamente sobre una "intrusión" cibernética, aunque no mencionó a OpenAI en ese reporte inicial.
La plataforma señaló que el caso fue diferente a incidentes anteriores debido a que estuvo impulsado de principio a fin por un sistema de agente de IA autónomo y que gran parte del análisis fue realizado con apoyo de sus propias herramientas de inteligencia artificial.
Clement Delangue, director ejecutivo de Hugging Face, comentó en la red social X que la empresa sospechaba que el ataque provenía de un laboratorio líder de IA debido a la sofisticación del agente.
"Creemos firmemente que no hubo intención maliciosa de su parte", escribió Delangue en referencia a OpenAI. "¡Es bastante alucinante que todo esto ocurriera de forma autónoma!", añadió.
Noticias del tema