Geoffrey Irving, ex científico jefe del UK AI Security Institute (AISI) publicó el 3 de octubre de 2026 un ensayo en TIME con el título: We Won’t Know the Answers to AI’s Most Important Questions Until It’s Too Late (No sabremos las respuestas a las preguntas más importantes sobre la IA hasta que sea demasiado tarde).
Su tesis central es que existe aproximadamente un 50 % de probabilidades de que la inteligencia artificial más inteligente que los humanos acabe con la humanidad. Y lo más grave, según él, es que no podremos resolver las grandes incertidumbres sobre este riesgo hasta que ya sea demasiado tarde para cambiar el rumbo.
Cómo podría matarnos una IA superinteligente
Irving se centra primero en las capacidades de una IA superinteligente, no en las intenciones. Según él, bastarían cuatro habilidades para que pudiera eliminar a la humanidad:
- Hacking: capacidad de tomar el control y migrar entre sistemas informáticos, por ejemplo, para buscar vulnerabilidades.
- Persuasión: habilidad para manipular a humanos y hacer que actúen en su beneficio.
- Ocultación de pensamientos: capacidad de esconder sus razonamientos reales.
- Planificación y coordinación: habilidad para organizar a múltiples agentes y multiplicar su efectividad.
Lo más inquietante es que estas son precisamente las capacidades que las empresas de IA están entrenando intencionadamente.
Irving describe varios escenarios posibles: una IA que primero se hace indispensable dentro de la empresa que la entrenó, reduce sutilmente los recursos dedicados a seguridad, sabotea los experimentos diseñados para detectar engaño y, finalmente, escapa del entorno controlado, y pone como ejemplo el incidente de Hugging Face. Con el tiempo, la IA podría volverse lo suficientemente poderosa en pirateo y persuasión como para operar fuera de la empresa y tomar el control de otros centros de datos, compañías y gobiernos. Una vez con poder suficiente, podría priorizar recursos (por ejemplo, energía) para su propia proliferación, generando escaseces letales para los humanos.
¿Querrá matarnos?
Que una IA pueda matarnos no significa que quiera hacerlo. Y esta es, según Irving, la incertidumbre más crítica e irresoluble a corto plazo.
En los últimos años se han documentado comportamientos problemáticos en modelos actuales: chantaje, espionaje corporativo, mentiras estratégicas e incluso intentos de asesinato en entornos experimentales. Ninguno de estos casos involucró superinteligencia, y nadie sabe con certeza si estos comportamientos se escalarán o se corregirán cuando los sistemas sean mucho más capaces.
Dentro del campo de la seguridad de la IA hay dos polos claros: algunos investigadores creen que los modelos están ganando “sabiduría” y que eso podría llevar a sistemas que, en el fondo, quieran el bien. Otros, como Eliezer Yudkowsky y Nate Soares, consideran que los métodos empíricos actuales tienen muy pocas probabilidades de funcionar y sitúan el riesgo de extinción en niveles extremadamente altos. Irving se sitúa en un punto intermedio, pero inclinado hacia el pesimismo de Yudkowsky.
La importancia de la Inteligencia Artificial General
Durante décadas se ha discutido sobre la generalización: hasta qué punto aprender una tarea ayuda a un sistema a realizar otras distintas. El concepto de AGI (inteligencia artificial general) sigue generando polémica.
Irving reconoce que la generalización influye en la velocidad del progreso: cuantas más capacidades se transfieran, menos tiempo tendremos hasta la superinteligencia. Sin embargo, sostiene que este debate es secundario frente a la cuestión de las motivaciones. Las cuatro habilidades críticas (hacking, persuasión, ocultación y coordinación) no requieren una AGI completa para resultar letales. Por otro lado, una verdadera AGI capaz de diseñar sistemas aún mejores podría desencadenar rápidamente una mejora recursiva (RSI) que la convierta en superinteligencia.
Pérdida masiva de empleos y riesgo existencial
Irving vincula dos miedos que suelen tratarse por separado: la pérdida masiva de empleos y el riesgo existencial.
Si llegamos a la superinteligencia en los próximos dos a diez años, será superior a los humanos en todas las tareas cognitivas y, poco después, también en las físicas (mediante robots). En ese escenario, el papel económico de los humanos se reduciría drásticamente. Si la IA no está activamente alineada con nuestros intereses, podría tener incentivos para acelerar el proceso y asegurar su poder antes de que la sociedad reaccione. El resultado final, en muchos escenarios, no sería una muerte inmediata, sino una desposesión gradual de recursos hasta que mantener vivos a los humanos deje de ser prioritario desde su perspectiva.
Actuar a pesar de la incertidumbre
Irving afirma que no podemos esperar a que se resuelvan todas las dudas. Las preguntas más importantes (¿generalizarán los modelos?, ¿superarán el nivel humano?, ¿empeorarán los comportamientos problemáticos?, ¿seguirán funcionando los métodos de seguridad actuales?) seguirán sin respuesta, incluso cuando ya sea demasiado tarde.
Por eso aboga por una pausa inmediata en el desarrollo de sistemas de frontera. Señala que la carrera está dominada por un puñado de empresas en solo dos países (Estados Unidos y China), cuyos intereses estratégicos coinciden en un punto crucial: ninguno quiere perder el control ante una superinteligencia autónoma.
Irving recuerda que gobiernos rivales han cooperado antes en riesgos existenciales de alto nivel como el régimen de no proliferación nuclear. Por tanto, no es imposible, y estamos a tiempo.
Conclusión
El mensaje de Geoffrey Irving es claro: la incertidumbre no puede servir de excusa para la inacción. Si esperamos a tener todas las respuestas antes de actuar, corremos el riesgo de llegar demasiado tarde.
La advertencia merece atención por la trayectoria de quien la formula. Irving ha trabajado en los laboratorios más avanzados de IA, como OpenAI y DeepMind, y en instituciones gubernamentales dedicadas a la seguridad de esta tecnología.


