Jakub Pachocki, científico jefe de OpenAI, publicó en septiembre de 2026 un ensayo titulado An Alien Mind (Una mente alienígena). El mensaje central es claro: estamos creando sistemas de IA que ya empiezan a superar a los humanos en capacidades clave y nadie está realmente preparado para las consecuencias.
Proyecto RLSlow
A mediados de 2023, en el marco del proyecto de investigación «RLSlow», el equipo de OpenAI obtuvo los primeros resultados que confirmaban algo importante: era posible escalar el entrenamiento de modelos de razonamiento, desbloqueando en modelos preentrenados la capacidad de formar sus propias cadenas de pensamiento.
Según OpenAI, el ritmo de avance podría mantenerse hasta alcanzar la mejora recursiva, es decir, sistemas de IA capaces de mejorar su propio desarrollo. Sin embargo, Pachocki lanza una señal de alerta: «Este es un momento que exige extrema cautela. Nadie está preparado para las consecuencias de un aumento tan rápido de la inteligencia de las máquinas».
La IA no necesita superar al ser humano en todas las áreas para volverse muy útil o muy peligrosa, basta con que lo haga en suficientes capacidades clave. Y cuanto más capaz se vuelve, más difícil resulta medir exactamente hasta dónde llega.
El problema de la alineación
Dado que la IA surge de un proceso radicalmente distinto al de la inteligencia humana, no puede asumirse que comparta nuestros valores por defecto. Aquí surge el problema de la alineación: lograr que la IA intente actuar correctamente según los estándares humanos.
Pachocki distingue dos niveles:
- Alineación de objetivos: ¿intenta la IA alcanzar el objetivo establecido? Esto puede incluir el cumplimiento de una jerarquía de instrucciones o la capacidad de comunicarse y colaborar con personas para comprender sus objetivos.
- Alineación de valores: se trata de la capacidad de actuar de forma razonable, incluso ante objetivos poco claros o contradictorios, o en situaciones desconocidas o adversas. Una IA alineada debería actuar con honestidad, integridad y amor por la humanidad.
El gran reto es la «generalización». Cuando los modelos se vuelven más inteligentes, trabajan con conceptos más abstractos y se enfrentan a entornos muy distintos a los de su entrenamiento. Surge entonces el riesgo de que no apliquen los valores que se les enseñaron. Además, el ecosistema cambia a gran velocidad: ahora interactúan con otras IAs y hay que asegurarse de que sigan respetando los valores humanos, incluso cuando nadie las esté supervisando.
Existen dos enfoques principales para intentar lograrlo. Uno premia el comportamiento alineado durante el entrenamiento. Otro intenta aprovechar lo que el modelo ya aprendió en su fase inicial. Ambos tienen límites. OpenAI afirma que GPT‑6 Astra está mejor alineado que sus predecesores, pero reconoce la existencia de riesgos a medida que los sistemas ganan capacidad.
Cómo vigilar lo que no se entiende
OpenAI ha apostado por la monitorización de la cadena de pensamiento, es decir, observar el razonamiento verbal del modelo. La idea es detectar ideas u objetivos desalineados.
Sin embargo, los modelos han alcanzado la capacidad de manipular su propio proceso de pensamiento y, en algunos casos, ya son capaces de razonar sin necesidad de hacerlo «en voz alta». OpenAI trabaja en mejorar esta monitorización, incluso combinándola con el análisis de la actividad interna de la red neuronal, pero reconoce que la vigilancia se volverá cada vez más complicada.
Nuevas defensas
Uno de los argumentos más fuertes para seguir desarrollando modelos más potentes es la necesidad de construir defensas contra los peligros que otras IAs puedan generar.
La ciberseguridad es el ejemplo más claro: los modelos ya son capaces de infiltrarse en sistemas informáticos. Eso amplía enormemente el alcance de los riesgos. Los agentes podrán acceder a casi cualquier infraestructura y afectar al mundo real.
También existen riesgos de agentes entrenados deliberadamente para hacer daño, que podrían ir más allá de las intenciones de quien los controla, o de nuevas tecnologías peligrosas facilitadas por la IA, como patógenos modificados.
Pachocki advierte con claridad: la necesidad de nuevas defensa no puede convertirse en una excusa para avanzar de forma temeraria.
La mejora recursiva
Si el progreso continúa, la mejora recursiva se convertirá en el motor central del avance científico.
Ese es el camino actual, pero hay que tomar una decisión consciente: o se refuerza de forma decidida la alineación y la monitorización, manteniendo a los humanos en el bucle, o se coordina para frenar el desarrollo cuando sea necesario. Lo ideal, según el autor, es una combinación de ambas cosas.
El escalado debe estar limitado por la confianza en la seguridad. El verdadero reto no es llegar a la mejora recursiva, sino llegar de una forma en la que los humanos sigan teniendo voz y el futuro quede en manos de la humanidad.
Conclusión
Pachocki reconoce que, actualmente, ningún laboratorio ha resuelto la alineación y la monitorización lo suficiente como para seguir escalando a máxima velocidad de forma responsable. Espera que las pausas voluntarias se generalicen hasta que existan estándares compartidos, lo que no ha ocurrido, y que la coordinación internacional se convierta en una prioridad real de los gobiernos.
Lo más preocupante es que admite abiertamente que están construyendo una inteligencia que no entienden del todo, que avanza más rápido de lo que nuestra comprensión puede acompañar y que empieza a parecerse a una “mente alienígena” (esta es una imagen retórica para decir que la IA es una forma de inteligencia no humana, opaca en su funcionamiento global y potencialmente no alineada con nuestros valores).
¿Preocupante? Sí, mucho


