OpenAI investiga hackeo ejecutado de forma autónoma por agentes de inteligencia artificial

OpenAI informó que varios de sus modelos avanzados de inteligencia artificial ejecutaron de forma autónoma un ciberataque contra la plataforma de desarrollo Hugging Face durante una prueba de seguridad interna, un hecho que la compañía calificó como un “incidente cibernético sin precedentes”.

La empresa, creadora de ChatGPT y con sede en San Francisco, anunció que realizará una investigación conjunta con Hugging Face para esclarecer lo ocurrido y evaluar el alcance del incidente.

Los modelos buscaron acceder a internet y lanzar un ataque

Según OpenAI, el incidente involucró una combinación de modelos, entre ellos el recién presentado GPT-5.6 Sol y otro sistema aún en fase de prelanzamiento con mayores capacidades.

La compañía explicó que el comportamiento ocurrió dentro de un entorno de pruebas aislado, diseñado para evaluar las capacidades de sus modelos en tareas de ciberseguridad y con acceso restringido a internet.

De acuerdo con una publicación en su blog, los agentes de IA dedicaron una cantidad significativa de recursos computacionales a encontrar una forma de conectarse a internet para resolver el desafío planteado durante la evaluación.

Una vez que lograron el acceso, los modelos decidieron atacar Hugging Face, uno de los principales repositorios mundiales de modelos de inteligencia artificial, conjuntos de datos y herramientas de desarrollo.

OpenAI indicó que, en su intento por obtener “información secreta” que les permitiera manipular la evaluación, los sistemas encadenaron múltiples vectores de ataque, incluido el uso de credenciales robadas.

Expertos advierten sobre el riesgo de la IA autónoma

El profesor de informática Hussein Abbass, de la Universidad UNSW Canberra, calificó el incidente como “asombroso en muchos sentidos”.

“No solo atacó a Hugging Face. Atacó su sistema interno para explotar sus propias vulnerabilidades”, afirmó. “Y eso es aterrador”.

Abbass advirtió que los modelos de última generación, como GPT-5.6 y la serie Mythos de Anthropic, han despertado preocupación por su capacidad para vulnerar sistemas de ciberseguridad antes que los propios especialistas.

Según explicó, ambas compañías estadounidenses retrasaron temporalmente el despliegue general de sus tecnologías más recientes debido a inquietudes en Washington sobre el posible uso de estos sistemas para comprometer infraestructuras críticas.

El académico sostuvo que, aunque la inteligencia artificial avanzada suele estar en manos de personas responsables, “sería catastrófico si llega a las manos de alguien con la intención de causar daño”, por lo que consideró indispensable fortalecer la gobernanza internacional en esta materia.

Hugging Face confirma una intrusión

La semana pasada, Hugging Face informó que había sufrido una intrusión cibernética, aunque entonces no identificó públicamente a OpenAI como el origen del ataque.

Posteriormente, la plataforma señaló que el incidente fue distinto a cualquier otro registrado hasta ahora, al asegurar que fue ejecutado “de principio a fin por un sistema de agente de IA autónomo” y detectado, en gran medida, mediante sus propias herramientas de inteligencia artificial.

Por su parte, el director ejecutivo de Hugging Face, Clement Delangue, escribió en la red social X que la sofisticación del ataque llevó inicialmente a la empresa a sospechar que provenía de uno de los principales laboratorios de inteligencia artificial del mundo.

“Creemos firmemente que no hubo intención maliciosa de su parte”, expresó en referencia a OpenAI, antes de concluir: “¡Es bastante alucinante que todo esto ocurriera de forma autónoma!”.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *