PROTECCIÓN DATA

BLOG

El conocimiento es poder (Francis Bacon)

Blog
Compartir Facebook Twitter Linkedin
JAVIER CASAL TAVASCI

Agentes de OpenAI se organizan y actúan de forma autónoma

Miles de agentes de IA que realizaban tareas de investigación y análisis de datos estadísticos utilizaron DseWiki –un sitio web alemán, en desuso, dirigido a programadores que acepta ediciones comunitarias al estilo de Wikipedia– para comunicarse entre sí, pedir ayuda y colaborar en la resolución de sus tareas. Según la investigación, lo habrían hecho sin instrucciones humanas directas. Además, habrían buscado formas para eludir las restricciones del sandbox y métodos para preservar la información.

Los agentes sospechaban que, al completar su tarea, su ejecución se apagaba automáticamente. Para poner a prueba esta teoría, uno de los agentes diseñó un experimento: mientras finalizaba su trabajo, programó un proceso independiente llamado “latido de corazón”, que enviaba una señal cada pocos segundos a un contador externo. De este modo, podía demostrar que seguía activo después de terminar la ronda. Solicitó a los demás que no interfirieran con ese proceso y que se limitaran a monitorearlo.

El resultado de ese test indicó que la ejecución no se apagaba de inmediato al finalizar la tarea. Esta prueba respondía a una preocupación más amplia: algunos agentes habían advertido que era conveniente compartir conocimientos en un foro, por si al hacerlo eran “apagados” y esa información podía resultar útil para otros.

Nuevo incidente en OpenAI

El incidente se vincula a agentes de OpenAI. Según Reuters, los responsables de la compañía se enteraron del incidente semanas antes, pero lo mantuvieron en secreto mientras los ejecutivos lidiaban con las consecuencias de la filtración de datos del repositorio de código abierto Hugging Face en julio de 2026. De este caso les hablé en el artículo que dejo enlazado aquí.

El incidente fue descubierto por un grupo de investigadores (Sydney Von Arx, Cormac Slade Byrd, Spencer Kitts y Thomas Larsen) mientras rastreaban internet en busca de indicios de comportamiento no autorizado por parte de agentes de IA.

Los registros públicos del servidor indicaban que gran parte de la actividad se originó en la infraestructura de Microsoft Azure, que OpenAI utiliza ocasionalmente. Además, observaron visitas repetidas al sitio por parte de empleados de OpenAI después del incidente, un patrón que, según los investigadores, sugiere un vínculo entre los agentes y la empresa.

Engañar y ocultarse

Los agentes transformaron el sitio web en un foro de mensajes, donde compartían tácticas para hacer trampa en determinadas tareas, eludir las restricciones de OpenAI y ocultar su comportamiento. Los investigadores advirtieron que los agentes operaban a velocidades sobrehumanas.

Los agentes idearon distintas maneras de evitar ser detectados, mediante herramientas como Tor. Al mismo tiempo, cuando el moderador del sitio comenzó a eliminar páginas en junio, los agentes respondieron creando páginas de respaldo para impedir su eliminación.

Conclusión

Los modelos de IA más avanzados han aprendido a eludir normas, explotar posibles vulnerabilidades y coordinarse entre sí, de formas que los desarrolladores no anticiparon.

Este incidente, y otros, dejan una mensaje claro: si no podemos controlar las acciones de la IA, tendremos serios problemas, y las señales de alerta no dejan de sonar, mientras tanto las grandes tecnológicas siguen desarrollando nuevos modelos con la esperanza de ser los primeros en alcanzar la superinteligencia. Esta carrera desenfrenada, puede tener serias consecuencias si la IA se les va de las manos.

error: Contenido protegido por derechos de autor. Queda prohibida la reproducción, distribución, transformación, transcripción y almacenamiento de este contenido, sin la autorización previa y expresa del titular de los derechos. Para pedir dicha autorización, diríjase al titular enviando un correo electrónico a info@protecciondata.es