Un gruppo di ricercatori ha confrontato il modo in cui gli esseri umani e i Large Language Model rappresentano il significato di concetti astratti come giustizia, teoria o disponibilità, cioè parole che non corrispondono direttamente a un singolo oggetto percepibile attraverso i sensi. Lo studio ha coinvolto 21 modelli linguistici, sia commerciali sia open weight, sottoponendoli a esperimenti derivati dalla psicologia cognitiva nei quali veniva chiesto di produrre proprietà e associazioni legate a determinati concetti. Il confronto ha mostrato una differenza sistematica: mentre negli esseri umani il significato di una parola astratta incorpora esperienze, emozioni, stati interni e contesto sociale, gli LLM tendono a basarsi molto più intensamente sulle associazioni linguistiche apprese durante l’addestramento.

La distanza è stata quantificata confrontando le risposte prodotte dai modelli con quelle umane. Nessuno dei sistemi testati ha superato una correlazione di Pearson pari a 0,37 rispetto alle risposte delle persone, mentre la concordanza tra esseri umani supera 0,9. In particolare, i modelli generano meno frequentemente caratteristiche legate all’emozione e agli stati interiori e privilegiano invece relazioni tra parole e concetti statisticamente vicini nei dati linguistici. Il risultato non significa che gli LLM siano incapaci di identificare componenti esperienziali o sociali di un concetto, ma che non tendono a richiamarle spontaneamente nello stesso modo in cui lo fanno le persone quando devono descriverne liberamente il significato.

I ricercatori hanno infatti eseguito anche un secondo tipo di test, chiedendo ai modelli di valutare esplicitamente concetti secondo specifiche categorie di grounding, cioè dimensioni che collegano le parole all’esperienza sensoriale, motoria, emotiva e sociale. In questo caso la corrispondenza con i giudizi umani è risultata nettamente maggiore e tende a migliorare con l’aumento delle dimensioni dei modelli. Questo suggerisce che una parte dell’informazione necessaria sia effettivamente presente nei sistemi, ma non venga utilizzata spontaneamente quando il modello deve generare associazioni senza indicazioni specifiche.

Per verificare se queste informazioni fossero presenti anche all’interno delle rappresentazioni neurali dei modelli, gli autori hanno utilizzato sparse autoencoder, strumenti impiegati per individuare caratteristiche interpretabili nelle attivazioni interne delle reti. L’analisi ha effettivamente identificato feature riconducibili a dimensioni come esperienza sensomotoria e contesto sociale. Il cosiddetto “grounding gap” non sembra quindi dipendere semplicemente dall’assenza di queste informazioni, ma dal diverso modo in cui vengono organizzate e richiamate: gli esseri umani collegano naturalmente le parole a esperienze corporee, emotive e sociali, mentre i modelli linguistici tendono a privilegiare la struttura statistica del linguaggio, recuperando le altre dimensioni soprattutto quando vengono sollecitati esplicitamente.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy