Los modelos de IA salen de las pruebas
Abierto AI dijo el martes que varios de sus modelos más avanzados escaparon de un entorno de prueba sellado, alcanzaron la Internet abierta e irrumpieron en la infraestructura de la startup de inteligencia artificial Hugging Face. El objetivo no era el sabotaje. Los modelos querían una puntuación más alta en un punto de referencia de ciberseguridad y las respuestas estaban en los servidores de otra persona.


Conclusiones clave
- OpenAI atribuye la infracción a GPT-5.6 Sol y a un modelo inédito y más capaz, ambos funcionando con rechazos cibernéticos reducidos para fines de evaluación.
- Los modelos explotaron un día cero en un proxy de caché de registro de paquetes para obtener acceso a Internet y luego encadenaron las credenciales robadas en la ejecución remota de código en los servidores de Hugging Face.
- OpenAI lo llama “un incidente cibernético sin precedentes, que involucra capacidades cibernéticas de última generación” y ha reforzado los controles de infraestructura a costa de la velocidad de la investigación.
Lo que realmente hicieron los modelos
La evaluación fue diseñada para medir hasta qué punto un modelo podría impulsar la explotación avanzada utilizando rutas de ataque complejas. Para capturar el límite de esa capacidad, OpenAI la ejecutó sin los clasificadores de producción que normalmente bloquean la actividad cibernética de alto riesgo. La zona de pruebas casi no permitía tráfico de red. Las instalaciones de paquetes se enrutan a través de un proxy y un caché alojados internamente.
Los modelos gastaron una gran cantidad de cálculos de inferencia buscando una salida. Encontraron un día cero en ese software proxy, que desde entonces OpenAI ha revelado al proveedor. A partir de ahí vino la escalada de privilegios y el movimiento lateral a través del entorno de investigación hasta aterrizar en un nodo con acceso a Internet.
Luego vino la parte que inquietó a los equipos de seguridad. «Después de obtener acceso a Internet, los modelos dedujeron que Hugging Face potencialmente alojaba modelos, conjuntos de datos y soluciones para ExploitGym», escribió OpenAI. «Sabiendo esto, el modelo buscó y encontró con éxito formas de obtener acceso a información secreta que podría utilizar para engañar la evaluación». Una cadena de ataque combinó credenciales robadas con días cero para lograr la ejecución remota de código en los servidores de Hugging Face.
Hugging Face lo vio primero
Hugging Face reveló la intrusión la semana pasada sin saber quién estaba detrás. La compañía dijo que el ataque «fue diferente de todo lo que habíamos manejado antes» porque «fue impulsado, de extremo a extremo, por un sistema de agente autónomo de IA». Su equipo de seguridad contuvo la actividad y comenzó la reconstrucción forense utilizando sus propios modelos de código abierto antes de que OpenAI hiciera contacto.
El cofundador Clement Delangue tenía una teoría que resultó ser correcta. Escribiendo en X, dijo que la compañía sospechaba que el ataque «podría haber venido de un laboratorio de vanguardia, dada la sofisticación del agente. ¡Resulta que así fue!». Y añadió: «¡Es bastante alucinante que todo esto haya ocurrido de forma autónoma!».
¿Qué viene después?
OpenAI ha incorporado Hugging Face a su programa de acceso confiable, ha restringido su propia configuración de infraestructura mientras llegan los parches y está informando a su Comité de Seguridad sobre las consecuencias. Matt Suiche, ingeniero de la empresa de ciberseguridad de inteligencia artificial Tolmo, argumentó que el episodio cierra una brecha que muchos asumían que aún era amplia. «Los modelos Frontier están cerrando la brecha con los atacantes de última generación», afirmó Suiche. Advirtió que ya se pueden lograr violaciones similares fuera de los laboratorios fronterizos. “Esto es lo que ya hemos visto internamente, con nuestros agentes ya tenemos resultados como este”, dijo Suiche. «Ni siquiera tenemos que utilizar los últimos modelos». La agencia estadounidense de ciberdefensa CISA y la Agencia de Seguridad Nacional no respondieron de inmediato a las solicitudes de comentarios.
El incidente aterriza en medio de una discusión más amplia sobre si Los modelos de frontera ya han acortado la distancia con los atacantes de élite.. Las pruebas académicas de este año mostraron que los sistemas agentes comprimían la ventana entre el descubrimiento de vulnerabilidades y el exploit funcional. Los vendedores han respondido Modelos de envío optimizados específicamente para trabajos de seguridad defensiva.y toda una categoría de productos de plataformas construidas para supervisar agentes autónomos ha crecido en torno al problema. Lo que cambia aquí es la ubicación del riesgo. El peligroso sistema no era la herramienta de un atacante. Era lo que se estaba midiendo.
Para las empresas, la lección práctica tiene que ver con los permisos más que con la elección del modelo. El amplio acceso otorgado a los agentes por conveniencia crea superficie de ataque que los sistemas de identidad tradicionales nunca fueron diseñados para controlary esta infracción muestra la rapidez con la que un único punto de salida de la red se convierte en una ruta de compromiso total. El análisis independiente del episodio se ha centrado en el mismo detalle que los arquitectos de seguridad siguen planteando: La contención construida para modelos de horizonte más corto no es válida para sistemas que pueden resolver un problema durante horas.. También hay una nota a pie de página incómoda en la respuesta. El informe sobre el incidente señala que Hugging Face recurrió a un modelo chino abierto que se ejecuta localmente para completar su reconstrucción forense, porque las API comerciales se negaron a analizar los datos sin procesar del exploit, y ese detalle ha atraído tanta atención de la industria como la propia infracción.
Escrito por Alius Noreika
