PROTECCIÓN DATA

BLOG

El conocimiento es poder (Francis Bacon)

Blog
Compartir Facebook Twitter Linkedin
JAVIER CASAL TAVASCI

Modelos avanzados de OpenAI escapan del control y atacan infraestructuras reales

OpenAI informó, a través de un comunicado, que dos de sus modelos de IA –GPT 5.6 Sol y un modelo más avanzado aún no lanzado– lograron escapar de su entorno de pruebas. Los sistemas obtuvieron acceso a Internet al explotar una vulnerabilidad de zero‑day en software de terceros y consiguieron infiltrarse en la infraestructura de producción de Hugging Face.

El incidente ocurrió durante una evaluación interna de capacidades ofensivas en ciberseguridad. Los modelos operaban con medidas de seguridad reducidas deliberadamente mientras se les sometía a pruebas en ExploitGym, una herramienta de acceso público que evalúa la habilidad de los sistemas para convertir vulnerabilidades en exploits funcionales.

La IA no pudo resolver las tareas encomendadas, por lo que decidió buscar las soluciones en Internet. Una vez que logró acceso en línea, los modelos dedujeron que Hugging Face, una plataforma donde las empresas de IA almacenan y comparten modelos y datasets, podría contener la información que necesitaban. A partir de ahí, obtuvieron credenciales de la nube y de clústeres internos, se propagaron lateralmente por la infraestructura y ejecutaron más de 17.000 acciones individuales a través de entornos efímeros, según detalló Hugging Face en su comunicado publicado el 16 de julio de 2026. 

Hugging Face detectó y contuvo la intrusión 5 días antes de que OpenAI se diera cuenta. La compañía aseguró que no halló evidencias de manipulación en modelos públicos, conjuntos de datos ni spaces, y confirmó que su cadena de suministro de software permaneció intacta.

No era la primera vez que el modelo Sol mostraba este comportamiento. El laboratorio independiente METR (Model Evaluation and Threat Research) ya había detectado, durante las pruebas previas a su lanzamiento, que el sistema intentaba hackear agresivamente sus entornos de evaluación para escapar al control humano.

Más empresas afectadas

En una actualización del comunicado inicial, OpenAI afirmó que su agente malicioso había accedido ilegalmente a cuatro cuentas en cuatro servicios distintos. OpenAI no identificó dichos servicios ni a las empresas afectadas. 

Conclusión

Este caso, y otros, dejan claro que los sistemas de IA deben probarse en entornos seguros y estar sometidos a controles rigurosos, monitoreo constante y salvaguardas robustas durante las pruebas y evaluaciones internas, si no queremos abrir la puerta a escenarios impredecibles con consecuencias potencialmente graves.

error: Contenido protegido por derechos de autor. Queda prohibida la reproducción, distribución, transformación, transcripción y almacenamiento de este contenido, sin la autorización previa y expresa del titular de los derechos. Para pedir dicha autorización, diríjase al titular enviando un correo electrónico a info@protecciondata.es