Leader di pensiero
Quanto in realtà possono ragionare i modelli di linguaggio grandi attraverso problemi complicati?
Lâintroduzione e lâevoluzione dellâintelligenza artificiale generativa sono state cosÃŽ improvvise e intense che ÃĻ davvero difficile apprezzare appieno quanto questa tecnologia abbia cambiato le nostre vite.
Facciamo un passo indietro di soli tre anni. SÃŽ, lâAI stava diventando piÃđ pervasiva, almeno in teoria. PiÃđ persone conoscevano alcune delle cose che poteva fare, anche se câerano enormi fraintendimenti sulle capacità dellâAI. In qualche modo la tecnologia aveva ricevuto contemporaneamente troppo poco e troppo credito per ciÃē che poteva effettivamente realizzare. Tuttavia, la persona media poteva indicare almeno unâarea in cui lâAI era allâopera, eseguendo compiti altamente specializzati abbastanza bene, in ambienti altamente controllati. Oltre a ciÃē, era o ancora in un laboratorio di ricerca o semplicemente non esisteva.
Confrontiamo questo con oggi. Con zero abilità , tranne quella di scrivere una frase o fare una domanda, il mondo ÃĻ a portata di mano. Possiamo generare immagini, musica e addirittura film che sono veramente unici e incredibili e hanno la capacità di disturbare intere industrie. Possiamo aumentare il nostro processo di ricerca, facendo una semplice domanda che, se formulata correttamente, puÃē generare pagine di contenuti personalizzati abbastanza buoni da sembrare scritti da uno studioso universitario âĶ o da un bambino di terza elementare se specificiamo il punto di vista. Mentre sono diventate quasi comuni in soli un paio di anni, queste capacità erano considerate assolutamente impossibili solo pochi anni fa. Il campo dellâintelligenza artificiale generativa esisteva, ma non aveva ancora decollato.
Oggi, molte persone hanno sperimentato lâintelligenza artificiale generativa come ChatGPT, Midjourney o altri strumenti. Altri lâhanno già incorporata nella loro vita quotidiana. La velocità con cui queste tecnologie sono evolute ÃĻ impressionante, al punto da essere quasi allarmante. E considerando i progressi degli ultimi sei mesi, non abbiamo dubbi che saremo sbalorditi, piÃđ e piÃđ volte, nei prossimi anni.
Uno strumento specifico in gioco allâinterno dellâintelligenza artificiale generativa ÃĻ stata la performance dei sistemi di generazione aumentata da recupero (RAG) e la loro capacità di pensare attraverso query particolarmente complesse. Lâintroduzione del dataset FRAMES, spiegato nel dettaglio allâinterno di un articolo su come funziona il dataset di valutazione, mostra sia dove si trova attualmente lo stato dellâarte, sia dove si sta dirigendo. Anche solo pochi mesi dopo lâintroduzione di FRAMES alla fine del 2024, un certo numero di piattaforme ha già battuto nuovi record nella loro capacità di ragionare attraverso query difficili e complesse.
Scendiamo nel dettaglio di ciÃē che FRAMES ÃĻ progettato per valutare e di come si stanno comportando i diversi modelli di intelligenza artificiale generativa. Possiamo vedere come sia la decentralizzazione che le piattaforme open-source non solo stanno tenendo il passo (in particolare Sentient Chat), ma stanno anche permettendo agli utenti di avere una chiara visione dellâincredibile ragionamento che alcuni modelli di intelligenza artificiale sono in grado di raggiungere.
FRAMES come una finestra nel cervello della GenAI
Il dataset FRAMES e il suo processo di valutazione si concentrano su 824 domande âmulti-hopâ progettate per richiedere inferenza, connessioni logiche, lâuso di diverse fonti per recuperare informazioni chiave e la capacità di unirle logicamente per rispondere alla domanda. Le domande richiedono tra due e 15 documenti per rispondere correttamente e includono anche vincoli, calcoli matematici e deduzioni, nonchÃĐ la capacità di elaborare logica basata sul tempo. In altre parole, queste domande sono estremamente difficili e rappresentano in realtà compiti di ricerca nel mondo reale che un essere umano potrebbe intraprendere su Internet. Affrontiamo queste sfide ogni giorno e dobbiamo cercare i pezzi di informazione chiave sparsi in un mare di fonti Internet, unendo le informazioni in base a diversi siti, creando nuova informazione attraverso calcoli e deduzioni e capendo come consolidare questi fatti in una risposta corretta alla domanda.
CiÃē che i ricercatori hanno scoperto quando il dataset ÃĻ stato rilasciato e testato per la prima volta ÃĻ che i migliori modelli di GenAI erano in grado di essere abbastanza precisi (circa il 40%) quando dovevano rispondere utilizzando metodi a un solo passo, ma potevano raggiungere una precisione del 73% se autorizzati a raccogliere tutti i documenti necessari per rispondere alla domanda. SÃŽ, il 73% potrebbe non sembrare una rivoluzione. Ma se si capisce esattamente cosa deve essere risposto, il numero diventa molto piÃđ impressionante.
Ad esempio, una particolare domanda ÃĻ: âIn che anno ÃĻ nato il leader del gruppo che ha originariamente eseguito la canzone campionata nella canzone di Kanye West âPowerâ?â Come farebbe un essere umano a risolvere questo problema? La persona potrebbe capire che deve raccogliere vari elementi di informazione, come i testi della canzone di Kanye West intitolata âPowerâ, e poi essere in grado di ascoltare la canzone (anche se non familiare con essa) e capire quando una canzone diversa ÃĻ campionata.
Ma pensiamoci: cosa dovrebbe fare un modello di GenAI per rilevare una canzone diversa dallâoriginale mentre âascoltaâ la canzone? Questo ÃĻ il punto in cui una domanda semplice diventa un ottimo test di intelligenza artificiale veramente intelligente. E se riuscissimo a trovare la canzone, ascoltarla e identificare i testi campionati, quello ÃĻ solo il passo 1. Dobbiamo ancora scoprire il nome della canzone, il nome del gruppo, chi ÃĻ il leader di quel gruppo e quale anno ÃĻ nato quella persona.
FRAMES mostra che per rispondere a domande realistiche, ÃĻ necessaria una enorme quantità di elaborazione del pensiero. Due cose vengono in mente qui.
Innanzitutto, la capacità dei modelli di GenAI decentralizzati di non competere solo, ma potenzialmente dominare i risultati, ÃĻ incredibile. Un numero crescente di aziende sta utilizzando il metodo decentralizzato per aumentare le proprie capacità di elaborazione mentre assicura che una grande comunità possieda il software, non una scatola nera centralizzata che non condividerà i propri progressi. Aziende come Perplexity e Sentient stanno guidando questa tendenza, ognuna con modelli formidabili che si esibiscono al di sopra dei primi record di accuratezza quando FRAMES ÃĻ stato rilasciato.
Il secondo elemento ÃĻ che un numero piÃđ piccolo di questi modelli di intelligenza artificiale non solo ÃĻ decentralizzato, ma ÃĻ anche open-source. Ad esempio, Sentient Chat ÃĻ entrambi, e i primi test mostrano quanto complesso possa essere il suo ragionamento, grazie allâaccesso open-source inestimabile. La domanda FRAMES sopra ÃĻ risposta utilizzando lo stesso processo di pensiero che un essere umano utilizzerebbe, con i dettagli del ragionamento disponibili per la revisione. Forse ancora piÃđ interessante, la loro piattaforma ÃĻ strutturata come una serie di modelli che possono regolare una prospettiva e una prestazione data, anche se il processo di regolazione in alcuni modelli di GenAI comporta una diminuzione dellâaccuratezza. Nel caso di Sentient Chat, sono stati sviluppati molti modelli diversi. Ad esempio, un modello recente chiamato âDobby 8Bâ ÃĻ in grado non solo di superare il benchmark FRAMES, ma anche di sviluppare un atteggiamento distintamente pro-crypto e pro-libertà , che influenza la prospettiva del modello mentre elabora pezzi di informazione e sviluppa una risposta.
Allâorizzonte
La chiave di tutte queste innovazioni sorprendenti ÃĻ la rapidità con cui siamo arrivati fin qui. Dobbiamo riconoscere che, veloce come questa tecnologia ÃĻ evoluta, evolverà ancora piÃđ velocemente nel prossimo futuro. Saremo in grado di vedere, soprattutto con i modelli di GenAI decentralizzati e open-source, quella soglia cruciale in cui lâintelligenza del sistema inizia a superare sempre piÃđ la nostra, e cosa significhi per il futuro.












