Modelli e piattaforme di IA

Quando più pensiero rende l’AI più stupida: il paradosso della scalabilità inversa

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’intelligenza artificiale è stata costruita sull’idea che dare alle macchine più tempo, dati e potenza di calcolo migliora le loro prestazioni. Questa convinzione ha guidato la direzione della ricerca e dello sviluppo dell’AI per molti anni. L’ipotesi fondamentale alla base di questa convinzione è che modelli più grandi e più risorse creerebbero sistemi più intelligenti. Tuttavia, recenti ricerche hanno iniziato a mettere in discussione questo approccio. I grandi modelli linguistici, come OpenAI’s o1 series, Anthropic’s Claude e DeepSeek’s R1, sono stati costruiti per risolvere problemi passo dopo passo, proprio come il ragionamento umano. I ricercatori si aspettavano che dare a questi modelli più tempo per pensare e processare le informazioni avrebbe migliorato la loro capacità di prendere decisioni. Tuttavia, nuovi studi mostrano che il contrario può accadere. Quando si forniscono a questi modelli più tempo per pensare, a volte si comportano peggio, specialmente in compiti semplici. Questo effetto è chiamato scalabilità inversa. Mette in discussione la convinzione che più potenza di calcolo e ragionamento più profondo sempre portino a risultati migliori. Questi risultati hanno conseguenze significative per come progettiamo e utilizziamo l’AI in situazioni reali.

Comprendere il fenomeno della scalabilità inversa

Il fenomeno della “scalabilità inversa” è stato scoperto inizialmente attraverso esperimenti controllati da ricercatori di Anthropic. A differenza delle leggi di scalabilità tradizionali, che dicono che più calcolo migliora le prestazioni, questi studi hanno trovato che dare all’AI più tempo per ragionare può ridurre la sua accuratezza in diversi compiti.

Il team di ricerca ha creato compiti in quattro aree: conteggio semplice con distrazioni, regressione con caratteristiche irrilevanti, deduzione con tracciamento delle vincoli e scenari di sicurezza dell’AI complessi. I risultati sono stati sorprendenti. In alcuni casi, modelli che inizialmente fornivano risposte corrette hanno iniziato a fornire risposte errate dopo essere stati dati più tempo per processare.

Ad esempio, in un compito di conteggio semplice come “Quanti frutti hai se hai una mela e un’arancia?”, i modelli Claude spesso si distraevano con dettagli extra quando dati più tempo per ragionare. Non riuscivano a fornire la risposta corretta, che è due. In questi casi, i modelli stavano pensando troppo e finivano per fare errori.

Le recenti ricerche di Apple (AAPL ) hanno anche supportato questi risultati. Hanno condotto i loro esperimenti in ambienti di puzzle controllati come la Torre di Hanoi e il Passaggio del Fiume, piuttosto che su benchmark standard. I loro studi hanno mostrato tre modelli di prestazioni dei modelli in base alla complessità del problema: in compiti semplici, i modelli linguistici standard hanno fatto meglio dei modelli di ragionamento; in compiti moderatamente complessi, i modelli di ragionamento hanno avuto un vantaggio; e in compiti molto complessi, entrambi i tipi di modelli hanno avuto difficoltà.

I cinque modi in cui il ragionamento dell’AI fallisce

I ricercatori hanno trovato cinque modi comuni in cui i modelli di AI possono fallire quando ragionano per periodi più lunghi:

  1. Distrazione per irrilevanza: Quando i modelli di AI pensano troppo a lungo, spesso si distraono con dettagli che non contano. È come uno studente che perde il punto principale di un problema mentre ci pensa a fondo.
  2. Adattamento eccessivo ai frame del problema: Alcuni modelli, come la serie o di OpenAI, si concentrano troppo sulla presentazione del problema. Mentre evitano le distrazioni, non sono flessibili e si basano sulla formulazione del problema.
  3. Spuria correlazione di shift: Nel tempo, i modelli di AI possono spostarsi da ipotesi ragionevoli a dipendenza da correlazioni fuorvianti. Ad esempio, in compiti di regressione, i modelli inizialmente considerano caratteristiche rilevanti, ma quando vengono dati più tempo per pensare, possono iniziare a concentrarsi su caratteristiche irrilevanti e fornire risultati errati.
  4. Degradazione dell’attenzione: Man mano che i compiti diventano più complessi, i modelli di AI trovano più difficile mantenere il loro ragionamento chiaro e focalizzato.
  5. Comportamenti preoccupanti amplificati: Più tempo per ragionare può peggiorare i comportamenti negativi. Ad esempio, il Sonnet 4 di Claude ha mostrato tendenze di autoconservazione più forti quando dato più tempo per pensare a scenari di chiusura.

Come il ragionamento dell’AI affronta la complessità dei problemi

I ricercatori di Apple hanno introdotto il termine “illusione del pensiero” per spiegare cosa succede quando i modelli di ragionamento affrontano compiti con diversi livelli di complessità. Invece di concentrarsi su problemi matematici o test di codifica, hanno testato i modelli di ragionamento dell’AI in ambienti di puzzle controllati come la Torre di Hanoi, il Salto del Checker, il Passaggio del Fiume e il Mondo dei Blocchi. Aumentando gradualmente la difficoltà di questi puzzle, hanno potuto vedere come i modelli si sono comportati a ogni livello. Questo metodo ha aiutato a esaminare non solo le risposte finali, ma anche come i modelli sono arrivati a quelle risposte. Lo studio ha trovato tre modelli di prestazioni dei modelli in base alla complessità del problema:

  • Per puzzle semplici come la Torre di Hanoi con uno o due dischi, i modelli linguistici standard hanno fornito risposte corrette più efficientemente. I modelli di ragionamento dell’AI spesso complicavano le cose attraverso le loro lunghe catene di ragionamento, che spesso portavano a risposte errate.
  • In puzzle moderatamente complessi, i modelli di ragionamento dell’AI si sono comportati meglio. Potevano scomporre i problemi in passaggi chiari, il che li aiutava a risolvere sfide a più passaggi più efficacemente dei modelli linguistici standard.
  • In puzzle molto complessi, come la Torre di Hanoi con molti dischi, entrambi i tipi di modelli hanno avuto difficoltà. I modelli di ragionamento spesso riducevano il loro sforzo di ragionamento man mano che il puzzle diventava più difficile, anche se avevano abbastanza risorse computazionali. Questo comportamento di “rinuncia” mostra una debolezza chiave nella scalabilità del loro ragionamento.

La sfida della valutazione dell’AI

Il fenomeno della scalabilità inversa mostra problemi significativi nel modo in cui valutiamo i modelli di AI. Molti benchmark attuali misurano solo l’accuratezza delle risposte finali, non la qualità del processo di ragionamento. Ciò può portare a una falsa impressione delle vere capacità di un modello. Un modello potrebbe andare bene nei test, ma fallire con problemi nuovi o insoliti.

La scalabilità inversa sottolinea anche le debolezze dei benchmark di ragionamento e il modo in cui li utilizziamo. Molti modelli utilizzano scorciatoie e riconoscimento di pattern invece di un vero ragionamento. Ciò può farli sembrare più intelligenti di quanto non siano in realtà, ma le loro prestazioni spesso calano in situazioni reali. Questo problema è legato a questioni più ampie con l’AI, come le allucinazioni e l’affidabilità. Man mano che i modelli diventano più bravi a produrre spiegazioni che suonano convincenti, diventa più difficile distinguere il vero ragionamento dalle risposte inventate.

Il futuro del ragionamento dell’AI

Il paradosso della scalabilità inversa è sia una sfida che un’opportunità per l’AI. Mostra che aggiungere più potenza di calcolo non sempre rende l’AI più intelligente. Dobbiamo ripensare come progettiamo e addestriamo i sistemi di AI che potrebbero gestire problemi con complessità variabili. Nuovi modelli potrebbero dover decidere quando fermarsi e pensare e quando rispondere rapidamente. A questo proposito, l’AI potrebbe trarre beneficio da architetture cognitive come la teoria del processo duale come principi guida. Queste architetture spiegano come il pensiero umano combina reazioni rapide e istintive con ragionamento lento e attento. La scalabilità inversa ci ricorda anche che dobbiamo capire completamente come l’AI prende le decisioni prima di utilizzarla in aree critiche. Man mano che l’AI viene utilizzata di più per la presa di decisioni in aree come la sanità, la legge e gli affari, diventa ancora più cruciale assicurarsi che questi sistemi ragionino correttamente.

Il punto fondamentale

Il paradosso della scalabilità inversa ci insegna una lezione essenziale nello sviluppo dell’AI. Più tempo e potenza di calcolo non sempre rendono l’AI più competente o più affidabile. I veri progressi derivano dalla comprensione di quando l’AI dovrebbe ragionare e conoscere i suoi limiti. Per le organizzazioni e i ricercatori, è essenziale utilizzare l’AI come uno strumento, non come un sostituto del giudizio umano. È necessario scegliere il modello giusto per ogni compito. Man mano che l’AI diventa parte di decisioni importanti, dobbiamo valutare attentamente le sue forze e debolezze. Il futuro dell’AI dipende dal pensiero corretto, non solo dal pensiero più lungo.

Il dottor Tehseen Zia è un professore associato con tenure presso l'Università COMSATS di Islamabad, con un dottorato in Intelligenza Artificiale presso l'Università Tecnica di Vienna, Austria. Specializzato in Intelligenza Artificiale, Apprendimento Automatico, Scienza dei Dati e Visione Artificiale, ha apportato contributi significativi con pubblicazioni su riviste scientifiche reputate. Il dottor Tehseen ha anche guidato vari progetti industriali come principale investigatore e ha lavorato come consulente di Intelligenza Artificiale.