Modelli e piattaforme di IA
La ricerca rivela che i LLM ricorrono a un ragionamento semplice quando aumenta la complessità

Un team di ricercatori ha pubblicato uno studio approfondito il 20 novembre, analizzando oltre 192.000 tracce di ragionamento da modelli linguistici di grandi dimensioni (LLM), rivelando che i sistemi di intelligenza artificiale si affidano a strategie lineari e superficiali piuttosto che ai processi cognitivi gerarchici che gli esseri umani utilizzano naturalmente.
Il team di ricerca ha esaminato 18 modelli diversi in compiti di ragionamento testuale, visivo e audio, confrontando i loro approcci con 54 tracce di pensiero umano raccolte specificamente per lo studio. L’analisi ha stabilito una tassonomia di 28 elementi cognitivi che comprendono vincoli computazionali, controlli meta-cognitivi, rappresentazioni di conoscenza e operazioni di trasformazione – fornendo un quadro per valutare non solo se i modelli producono risposte corrette, ma anche come arrivano a quelle conclusioni.
Differenze fondamentali nell’architettura cognitiva
Il ragionamento umano dimostra costantemente un’organizzazione gerarchica e un monitoraggio meta-cognitivo – la capacità di riflettere e regolare i propri processi di pensiero. Gli esseri umani organizzano fluidamente le informazioni in strutture annidate mentre attivamente tracciano il loro progresso attraverso problemi complessi.
I LLM utilizzano prevalentemente una catena di ragionamento in avanti, muovendosi passo dopo passo attraverso i problemi senza l’organizzazione gerarchica o l’autoriflessione che caratterizza la cognizione umana. Questa divergenza diventa più pronunciata quando i compiti sono mal definiti o ambigui, dove l’adattabilità umana supera notevolmente gli approcci dell’IA.
Lo studio ha scoperto che i modelli linguistici possiedono i componenti comportamentali associati a un ragionamento di successo, ma spesso non li utilizzano spontaneamente. Le prestazioni variano drasticamente in base al tipo di problema: il ragionamento dilemma ha mostrato la varianza più alta, con modelli più piccoli che lottano notevolmente, mentre il ragionamento logico ha mostrato prestazioni moderate con modelli più grandi che in generale superano quelli più piccoli. I modelli dimostrano debolezze controintuitive, riuscendo in compiti complessi mentre falliscono in varianti più semplici.
Miglioramenti delle prestazioni attraverso il ragionamento guidato
Il team di ricerca ha sviluppato una guida al ragionamento nel tempo di test che scaffalda automaticamente strutture cognitive di successo, dimostrando miglioramenti delle prestazioni fino al 66,7% in problemi complessi quando i modelli sono promossi ad adottare approcci di ragionamento più simili a quelli umani. Questo risultato suggerisce che i LLM possiedono capacità latenti per un ragionamento più sofisticato, ma hanno bisogno di una guida esplicita per utilizzarle efficacemente.
Il divario tra il ragionamento umano e quello dell’IA si allarga man mano che aumenta la complessità del compito. Mentre i modelli possono gestire problemi lineari attraverso la catena di ragionamento in avanti da soli, lottano con le strategie ricorsive e di auto-monitoraggio che gli esseri umani utilizzano naturalmente quando affrontano sfide ambigue o multilivello.
Il dataset pubblicamente disponibile dello studio fornisce una base per future ricerche che confrontano l’intelligenza artificiale e umana. Mappando 28 elementi cognitivi distinti, il quadro consente ai ricercatori di identificare esattamente dove il ragionamento dell’IA si rompe, piuttosto che misurare semplicemente i punteggi di accuratezza.
Implicazioni per lo sviluppo dell’IA
I risultati evidenziano una limitazione fondamentale negli attuali sistemi di intelligenza artificiale: il divario tra capacità computazionale e sofisticazione cognitiva genuina. I modelli addestrati su enormi dataset possono pattern-match il loro modo per arrivare a risposte corrette in molti compiti, ma mancano del pensiero riflessivo e gerarchico che caratterizza la risoluzione dei problemi umani.
Questa ricerca si basa su crescenti preoccupazioni riguardo alle limitazioni del ragionamento dell’IA identificate in più domini. Il miglioramento delle prestazioni attraverso il ragionamento guidato suggerisce che strategie di prompt migliori e modifiche architettoniche potrebbero aiutare i modelli ad accedere alle loro capacità di ragionamento latente più efficacemente.
Il contributo più significativo dello studio potrebbe essere la sua dettagliata tassonomia di elementi cognitivi, fornendo ai ricercatori e agli sviluppatori bersagli specifici per il miglioramento. Piuttosto che trattare il ragionamento come una capacità monolitica, il quadro lo divide in componenti misurabili che possono essere affrontati individualmente attraverso modifiche all’addestramento o tecniche di ingegneria dei prompt.












