Un equipo de investigadores de la Universidad del Sur de California, liderado por Zhivar Sourati y Morteza Dehghani, entre otros, publicó un artículo titulado The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models (El panorama cada vez más reducido de la diversidad lingüística en la era de los grandes modelos lingüísticos)
Metodología
Los autores analizaron más de 880.000 textos de siete conjuntos de datos distintos y concluyeron que el uso masivo de grandes modelos de lenguaje (LLM) como asistentes de escritura está vinculado a una reducción significativa de la diversidad lingüística. Los estilos de escritura se homogenizan y los patrones asociados a características dominantes se amplifican mientras se suprimen otros.
Los LLMs, entrenados para predecir la continuación más probable de un texto, favorecen por diseño los patrones lingüísticos dominantes. Es más que un problema estético: destruye la diversidad del lenguaje.
El lenguaje que empleamos muestra nuestra identidad, el contexto social, los valores morales y hasta señales de salud. Durante décadas, los investigadores en salud mental han utilizado el lenguaje para detectar indicios de depresión, ideación suicida, trastornos de la personalidad y otras alteraciones cognitivas o emocionales. Si esa riqueza expresiva se pierde, también se debilita una fuente valiosa de información sobre cómo pensamos, sentimos y nos relacionamos con los demás.
Implicaciones reales y riesgos
Los autores señalan que los modelos reflejan y amplifican sesgos de los datos de entrenamiento, privilegiando voces dominantes.
El lenguaje, que durante siglos ha sido un mosaico de individualidades, está empezando a parecerse más a un monocultivo.
Además, la homogeneización supone una amenaza real para dialectos y otras formas de expresión regionales o de comunidades minoritarias.
Conclusión
Este caso me recuerda al concurso de Cartas de Amor del Ayuntamiento de Cangas de Morrazo (Pontevedra), que fue suspendido tras 22 ediciones porque la mayoría de las candidaturas eran muy parecidas entre sí. La explicación era sencilla: la mayoría de participantes habían recurrido a modelos de IA generativa para elaborar sus textos. El resultado fue una homogeneización de los textos, lo que permitió descubrir la trampa. Este caso lo desarrollé en otro artículo, que dejo enlazado aquí.


