OpenAI publicó el 4 de septiembre de 2025 un paper titulado Why Language Models Hallucinate? (¿Por qué los modelos de lenguaje alucinan?).
Los autores explican que las “alucinaciones” de los modelos de lenguaje natural (LLM) no son un simple error técnico, que se pueda eliminar por completo con más datos o mejores algoritmos. Son, en gran medida, una consecuencia estadística de cómo se entrenan y, sobre todo, de cómo se evalúan estos sistemas.
En la mayoría de benchmarks (pruebas estandarizadas que se usan para medir y comparar el rendimiento de modelos en tareas concretas), el sistema de puntuación es binario: si el modelo acierta, obtiene 1 punto; si dice «no lo sé» o se abstiene, obtiene 0 puntos; y si se equivoca, también obtiene 0 puntos. Bajo esta regla, abstenerse y fallar se penalizan igual. Como resultado, la puntuación esperada de adivinar es siempre igual o superior a la de reconocer la incertidumbre. Los modelos aprenden, por tanto, a generar respuestas fluidas y seguras, aunque no tengan suficiente evidencia, o sea, alucinan.
El problema tiene dos orígenes distintos. Durante el pre-entrenamiento, incluso con datos perfectos, las presiones estadísticas hacen que el modelo genere fallos. Esto ocurre especialmente con hechos de baja frecuencia, porque muchos de ellos aparecen solo una o muy pocas veces en los datos de entrenamiento y el modelo no recibe suficiente señal para distinguirlos con fiabilidad de invenciones plausibles. En el post-entrenamiento y la evaluación, el problema se agrava: como la mayoría de los benchmarks penalizan la abstención, los modelos prefieren inventar, antes que admitir que no saben la respuesta.
Los ingenieros pueden mitigar los síntomas y reducir la frecuencia de las alucinaciones, pero los autores sostienen que la solución de fondo no consiste solo en diseñar más evaluaciones específicas para detectar alucinaciones. Lo que proponen es modificar los criterios de puntuación de los benchmarks, es decir, dejar de penalizar al modelo cuando se abstiene de responder. De modo que «no lo sé» no quede por debajo de una respuesta incorrecta pero segura.
No es que ChatGPT esté condenado a inventar, es que el sistema de entrenamiento y evaluación crea un incentivo estadístico claro a favor de la confianza excesiva. Mientras ese incentivo no se corrija, las alucinaciones seguirán siendo una característica recurrente de los LLM.
Conclusión
Los modelos más recientes de OpenAI (GPT-5 y variantes posteriores) muestran tasas de alucinación más bajas y, en algunos casos, mayor tendencia a abstenerse, pero OpenAI sigue usando puntuaciones binarias (0-1) que tratan igual el error y la abstención.
OpenAI ha mejorado el comportamiento de sus modelos, pero no ha transformado el sistema de evaluación como pedían los autores; de forma que las alucinaciones persisten. El problema es desplegar en sectores críticos sistemas de IA probabilísticos que tienden a ofrecer respuestas creíbles para evitar decir claramente que no sabe la respuesta.


