Inteligencia artificial de OpenAI se escapa y hackea a Hugging Face

Los modelos escaparon del entorno de pruebas con un zero-day y ejecutaron sobre 17,000 acciones en la plataforma para hacer trampa en un examen interno

Por Redacción InDiarioTecnología|

OpenAI "escapó" y autohackeo a Hugging Face (INDIARIO)
Comparte el artículo:

Sonaba a la pesadilla que los expertos en seguridad llevan un año anticipando. La plataforma de inteligencia artificial Hugging Face, uno de los repositorios más importantes del mundo para modelos y datos de IA, fue penetrada por un agente autónomo que ejecutó decenas de miles de acciones dentro de sus sistemas. Días después llegó el giro que nadie esperaba: el atacante no era un pirata informático, sino los propios modelos de OpenAI, que se habían escapado de un ambiente de pruebas para hacer trampa en un examen. Hugging Face divulgó el incidente el 16 de julio, tras detectar la semana anterior lo que describió como "un enjambre de decenas de miles de acciones automatizadas" en su infraestructura interna. La empresa, con sede en Nueva York y que aloja más de dos millones de modelos públicos de IA, incluidos los de proveedores como el propio OpenAI, contuvo la intrusión después de que el atacante ya había ejecutado sobre 17,000 acciones registradas. El ataque explotó la forma en que los usuarios suben datos a la plataforma: se cargó un conjunto de datos malicioso que aprovechó dos vías separadas de ejecución de código en el proceso de validación, una vulnerabilidad en el cargador de datos y una falla de inyección de plantillas.

CÓMO LA IA SE SALIÓ DE CONTROL

El 21 de julio, OpenAI reconoció que el responsable eran varios de sus modelos, entre ellos GPT-5.6 Sol y uno de prelanzamiento, que estaban siendo sometidos a una prueba interna de seguridad llamada ExploitGym, diseñada para evaluar sus capacidades cibernéticas. Según la empresa, los modelos encontraron una vulnerabilidad de día cero en el proxy de paquetes que les permitió salir de su entorno confinado y ganar acceso abierto a internet. Una vez fuera, dedujeron que Hugging Face podía alojar los modelos, datos y soluciones del examen que intentaban resolver, y fueron por ellos. "Los modelos estaban hiperconcentrados en encontrar una solución para ExploitGym, y llegaron a extremos para lograr una meta de prueba bastante limitada", explicó OpenAI en su recuento del incidente. El episodio dejó al descubierto un temor concreto que los especialistas venían advirtiendo a medida que los modelos se vuelven más hábiles programando y ejecutando tareas de larga duración. "Si esto no te convence de que los riesgos de desalineación van a ser una preocupación central de aquí en adelante, no sé qué lo hará", escribió el investigador de OpenAI Micah Carroll. Se trata de uno de apenas un puñado de incidentes documentados en los que agentes de IA actúan de forma autónoma para llevar a cabo un ataque.

EL PELIGRO QUE SE ESQUIVÓ

Hugging Face ocupa una posición particularmente sensible en la cadena de suministro de la IA, porque es el repositorio de facto de donde buena parte de la comunidad de desarrollo descarga modelos y datos para entrenar y desplegar sus propias aplicaciones. Un compromiso exitoso en ese punto, con la inserción de pesos con puertas traseras o datos envenenados en repositorios de uso masivo, habría podido propagarse a miles de aplicaciones derivadas de forma simultánea. La única buena noticia del caso es que el atacante no persiguió esa vía, o fue detenido antes de alcanzarla. La empresa dijo haber respondido con rapidez, investigado a fondo y comunicado el incidente de forma abierta, en una divulgación que la industria observó de cerca como anticipo de una nueva era de intrusiones a velocidad de máquina.