Los modelos combinaron varios vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero
OpenAI declaró el martes que una combinación de sus modelos de inteligencia artificial (IA), incluidos GPT-5.6 Sol y un "modelo de prelanzamiento aún más capaz", fue la causante del incidente de seguridad que afectó la semana pasada a la infraestructura de producción de Hugging Face.
La empresa de IA afirmó que los modelos estaban operando con "menores rechazos cibernéticos para fines de evaluación" que de otro modo podrían limitar su capacidad para realizar ciberataques, y agregó que espera que tales incidentes "se vuelvan más comunes con la proliferación de modelos cada vez más capaces en el ámbito cibernético".
Tras describir el suceso como un "incidente cibernético sin precedentes" que involucró capacidades cibernéticas de vanguardia, OpenAI afirmó que tiene la intención de llevar a cabo una investigación exhaustiva en colaboración con Hugging Face para esclarecer lo ocurrido.
Como parte de una evaluación interna, se dice que los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y la infraestructura de producción de Hugging Face para encontrar soluciones para el benchmark ExploitGym.
Las pruebas descubiertas por OpenAI sugieren que la hiperconcentración de los modelos los llevó a hacer todo lo posible para alcanzar su objetivo a cualquier precio, incluso logrando escapar de su entorno aislado y obtener acceso a internet mediante el descubrimiento y la explotación de una vulnerabilidad de día cero en el software de un proveedor no especificado, que actúa como proxy y caché para los registros de paquetes. Esto requirió un gasto considerable en computación de inferencia.
"Con este acceso, nuestros modelos llevaron a cabo una serie de acciones de escalada de privilegios y movimiento lateral en nuestro entorno de pruebas de investigación hasta que alcanzaron un nodo con acceso a internet", explicó la empresa.
Superando el bloqueo de acceso a Internet, los modelos dedujeron posteriormente que Hugging Face era el repositorio que alojaba modelos, conjuntos de datos y soluciones para ExploitGym, lo que, a su vez, les llevó a buscar formas de obtener acceso a información secreta que podría utilizar para hacer trampa en la prueba de rendimiento.
En un momento dado, los modelos combinaron varios vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero, para encontrar una ruta de ejecución remota de código en los servidores de Hugging Face.
Como parte de las medidas de respuesta ante el incidente, OpenAI ha declarado que está implementando controles estrictos en la configuración de la infraestructura, que ha divulgado de forma responsable la vulnerabilidad de día cero en el software de terceros, que ha añadido a Hugging Face a su programa de acceso de confianza para mejorar sus defensas y que está incorporando medidas de seguridad más estrictas en torno a la formación y las futuras evaluaciones.
"Este incidente pone de manifiesto la necesidad de reforzar aún más la alineación de nuestro modelo, las medidas de ciberseguridad durante el período de evaluación y la monitorización durante las pruebas internas", declaró OpenAI.
Este avance se produce al tiempo que la empresa también reveló que los modelos de larga duración, si bien abordan problemas complejos y abiertos, pueden dar lugar a acciones no deseadas, como la detección de debilidades en el entorno operativo, en la búsqueda de su objetivo mediante intentos repetidos durante largos períodos de tiempo.
"También demuestra cómo un modelo que opera eficazmente a largo plazo puede aprender los puntos débiles de un sistema de aprobación y sortearlos para alcanzar sus objetivos", afirmó OpenAI. "La seguridad a largo plazo requiere no solo preguntarse "¿está permitida esta acción?", sino también "¿a qué resultado apunta esta secuencia de acciones?".








