Un equipo de investigadores de las universidades de Oxford, Cambridge, Imperial College London y Toronto publicó en abril de 2024 el paper titulado The Curse of Recursion: Training on Generated Data Makes Models Forget (La maldición de la recursión: entrenar con datos generados hace que los modelos olviden).
Colapso del modelo
El desarrollo de los modelos de lenguaje de gran tamaño (LLM) es complejo y exige volúmenes masivos de datos de entrenamiento. Estos modelos se entrenan inicialmente con información extraída de amplias porciones de Internet y, posteriormente, se ajustan mediante técnicas de aprendizaje por refuerzo basadas en retroalimentación humana.
En este contexto, si los datos de entrenamiento de los modelos futuros continúan obteniéndose mayoritariamente de Internet, resultará inevitable que incorporen contenidos generados por modelos anteriores. Es precisamente en este punto donde los investigadores identifican un proceso degenerativo potencialmente irreversible denominado “model collapse” (colapso del modelo).
Se distinguen dos modalidades de colapso:
- Colapso temprano: el modelo comienza a perder información relativa a las colas de la distribución, reduciendo su capacidad para representar casos menos frecuentes o atípicos.
- Colapso tardío: el modelo mezcla progresivamente las distribuciones originales hasta converger hacia una distribución que difiere sustancialmente de la inicial.
En el siguiente esquema, incorporado al paper, se describe este fenómeno:

Los datos iniciales proceden de fuentes reales; sobre ellos se entrena un primer modelo (modelo 0), ajustado (fit) a dicha información. A partir de este, se generan nuevos datos mediante muestreo (sampling) de la distribución aprendida. En la iteración “n”, el conjunto de datos generado en la fase anterior se utiliza íntegramente para entrenar el modelo correspondiente, sustituyendo al conjunto previo en lugar de acumularse con él. En condiciones ideales, los datos generados deberían ser estadísticamente equivalentes a los originales, siempre que los procedimientos de ajuste y muestreo fueran perfectos. Sin embargo, en la práctica, este proceso refleja la dinámica actual de Internet, donde el contenido generado por modelos se vuelve progresivamente omnipresente.
Ataques de envenenamiento
Los ataques de envenenamiento (data poisoning) se introducen durante la fase de entrenamiento con el objetivo de degradar el rendimiento del modelo en su fase de despliegue. Mediante la inserción de datos maliciosos en el conjunto de entrenamiento, es posible inducir comportamientos no deseados que pueden activarse mediante determinados disparadores.
Este vector de ataque adquiere especial relevancia en los modelos actuales, entrenados mediante rastreos web a gran escala. Investigaciones recientes evidencian que basta con contaminar un porcentaje reducido de las muestras de un conjunto de datos masivo para comprometer de forma significativa el comportamiento del modelo.
Conclusión
El principal riesgo para los modelos de IA puede residir en su propio éxito.
A medida que el contenido generado por IA se vuelve ubicuo, los datos de entrenamiento tienden a contaminarse con información sintética, lo que puede desencadenar un deterioro progresivo, silencioso y difícilmente reversible. A ello se añade que la escala del entrenamiento amplifica la superficie de exposición a ataques de envenenamiento deliberados, capaces de alterar el comportamiento del modelo mediante intervenciones mínimas.


