Modelli e piattaforme di IA

GPT-3: Few Shot Learning per il Modello Linguistico?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Negli ultimi anni, l’industria AI e ML ha assistito a una crescita meteorica nello sviluppo e nell’applicazione dei sistemi NLP, poiché i ricercatori sono stati in grado di implementare pratiche NLP in modi altamente flessibili e agnostici per le attività di trasferimento downstream.

Inizialmente, si trattava di rappresentazioni a livello singolo che utilizzavano vettori di parole e venivano quindi alimentate all’architettura specifica dell’attività. Successivamente, è stata utilizzata l’architettura RNN che utilizzava rappresentazioni multilivello e stato contestuale per formare rappresentazioni migliori. E più recentemente, abbiamo i modelli di linguaggio di trasferimento o modelli ricorrenti pre-addestrati che hanno completamente rimosso la necessità di architetture specifiche dell’attività aggiustando questi network.

I modelli di linguaggio di trasferimento si sono rivelati un punto di svolta importante nell’industria NLP, poiché hanno portato a enormi progressi in attività impegnative come la risposta a domande, la comprensione di testi o blocchi di testo, l’implicazione testuale e molto altro.

Tuttavia, nonostante i loro vantaggi, i modelli di linguaggio di trasferimento hanno una limitazione importante, poiché richiedono un aggiustamento specifico dell’attività o un set di dati specifico dell’attività per raggiungere le prestazioni desiderate in un’attività. Inoltre, i modelli di linguaggio di trasferimento richiedono anche agli sviluppatori di aggiustare i set di dati con centinaia di migliaia di esempi specifici di un’attività particolare.

Va da sé che rimuovere la necessità di un set di dati specifico dell’attività e di un aggiustamento specifico dell’attività sarà altamente desiderabile e benefico per l’industria NLP per numerosi motivi.

Problemi con i Modelli di Linguaggio di Trasferimento Pre-addestrati Esistenti o Modelli Ricorrenti

  • Limitazione della Praticità e dell’Applicabilità

In primo luogo, la necessità di un grande set di dati con dati etichettati per ogni attività limita l’applicabilità e la praticità dei modelli di linguaggio. I modelli di linguaggio trovano le loro applicazioni in una vasta gamma di attività che vanno dalla generazione di una storia breve alla correzione degli errori grammaticali, alla generazione di esempi su un concetto. A volte, può essere un’attività impegnativa raccogliere un grande set di dati supervisionato con dati etichettati, specialmente quando il processo deve essere ripetuto per ogni attività individuale.

  • Sfruttamento di Correlazioni Spurie nei Dati di Addestramento

Le limitazioni e la strettezza della distribuzione di addestramento, associate all’espressività del modello, possono risultare in un aumento potenziale dell’abilità di sfruttare le correlazioni spurie nei dati di addestramento. La capacità di sfruttare i dati di addestramento può risultare in problemi durante l’aggiustamento e il pre-addestramento, poiché i modelli di linguaggio di trasferimento sono progettati per assorbire una grande quantità di informazioni durante il pre-addestramento.

Inoltre, lavori su modelli precedenti hanno indicato che grandi modelli non risultano sempre in migliori risultati fuori dalla distribuzione. Inoltre, è stato anche indicato che la generalizzazione ottenuta in tale paradigma può risultare in prestazioni scarse, principalmente perché il modello è altamente specifico per i dati di addestramento e non può eseguire bene in situazioni al di fuori dell’ambito dei dati di addestramento.

  • Confronto con l’Apprendimento Umano

Infine, quando si confrontano i modelli di linguaggio di trasferimento con l’apprendimento umano, gli esseri umani non richiedono un grande set di dati di addestramento quando si tratta di apprendere la maggior parte delle attività linguistiche. La maggior parte delle volte, una breve direttiva nella lingua naturale di una persona o una piccola dimostrazione dell’attività linguistica è sufficiente per un essere umano per comprendere e eseguire un’attività linguistica con un certo livello di competitività.

La capacità degli esseri umani di adattarsi ha numerosi vantaggi pratici, poiché consente loro di passare da un insieme di abilità all’altro o di combinarle per eseguire meglio durante un dialetto, qualcosa che va al di là delle capacità degli attuali sistemi NLP.

Affrontare i Problemi con l’Apprendimento Meta e GPT-3

Una possibile soluzione alle sfide sopra menzionate è l’uso dell’apprendimento meta, un concetto nella moderna ML che consente a un modello di sviluppare un insieme più ampio di abilità e di riconoscere modelli mentre si addestra, e quindi utilizza queste abilità apprese durante l’interferenza per adattarsi rapidamente o riconoscere l’attività richiesta.

L’apprendimento meta sta essere implementato nell’architettura del modello di linguaggio attraverso una tecnica chiamata “apprendimento in contesto” che utilizza l’input di testo di un modello di linguaggio pre-addestrato come specificazione dell’attività. Nel processo, il modello si condiziona su un’istruzione in lingua naturale e potrebbe anche utilizzare alcune dimostrazioni, e il modello è quindi atteso a completare il resto dell’attività prediligendo i passaggi successivi.

L’unico problema importante con l’apprendimento meta è che, sebbene abbia mostrato un potenziale positivo, è ancora inferiore all’approccio di aggiustamento nell’architettura del linguaggio naturale, e necessita di ulteriori miglioramenti per diventare un metodo pratico per superare le attività linguistiche.

In aggiunta all’apprendimento meta, un altro metodo che sta guadagnando popolarità è l’aumento della capacità dei modelli di linguaggio di trasformazione. Negli ultimi anni, i modelli di trasferimento hanno assistito a un aumento sostanziale nella loro capacità, con il modello RNSS18 con 100 milioni di parametri, il modello DCLT18 con 300 milioni di parametri, il modello RWC19 con 1,5 miliardi di parametri, il modello SSP19 con 8 miliardi di parametri, il modello RSR19 con 11 miliardi di parametri e il modello TUR20 con 17 miliardi di parametri.

L’aumento della capacità del modello o l’aumento dei parametri ha storicamente portato a miglioramenti nella sintesi del testo, e c’è stato un indizio che la perdita di log, che si correla con le attività downstream, segue anche una tendenza liscia di miglioramento con la scala.

Ciò ci porta al modello GPT-3, che ha oltre 175 miliardi di parametri, e quando è stato lanciato, era il modello di linguaggio di trasferimento con la capacità più alta. Parliamo ora del modello GPT-3.

Introduzione al Modello GPT-3

Il GPT-3 è un modello di linguaggio auto-aggressivo con oltre 175 miliardi di parametri, rilasciato da OpenAI nel 2020. Il GPT-3 è anche classificato come un modello di linguaggio grande che, come il suo predecessore il modello GPT-2, è un modello di trasformazione di apprendimento profondo decoder-only che utilizza un’architettura basata su convoluzione per generare dati testuali.

Il modello GPT-3 misura le proprie capacità di apprendimento del contesto e il modello GPT-3 è valutato su oltre due dozzine di set di dati NLP e molte attività nuove. Per ogni attività individuale, il modello GPT-3 è valutato in tre condizioni,

  • Apprendimento a Pochi Colpi o Apprendimento in Contesto: Nell’apprendimento a pochi colpi, il modello GPT-3 consente quante distribuzioni possono adattarsi bene alla finestra di contesto del modello.
  • Apprendimento in Un Colpo: Nell’apprendimento in un colpo, il modello consente solo una dimostrazione.
  • Apprendimento a Zero Colpi: Nell’apprendimento a zero colpi, non ci sono dimostrazioni e c’è solo un’istruzione in lingua naturale che viene alimentata al modello.

In generale, il modello GPT-3 raggiunge le prestazioni desiderate in impostazioni a zero colpi e in un colpo, e nell’impostazione a pochi colpi, supera i modelli di trasferimento dello stato dell’arte la maggior parte delle volte. Inoltre, il modello GPT-3 si esegue bene in impostazioni a un colpo e a zero colpi in attività di linguaggio naturale progettate per testare la ragione sul volo o richiede un’attenzione rapida come l’uso di parole nuove dopo una frase, o lo scompattamento di parole, o l’esecuzione di operazioni aritmetiche. D’altra parte, quando operato in un’impostazione a pochi colpi, il modello GPT-3 genera articoli di notizie sintetici che assomigliano alla scrittura umana quando vengono passati attraverso valutatori umani.

Modello GPT-3: Approccio

Il modello GPT-3 utilizza un approccio di pre-addestramento convenzionale che comprende modello, dati e addestramento, e assomiglia al processo di pre-addestramento seguito dal modello di trasferimento RWC-19. Il modello GPT-3 scala il modello di dimensioni, le dimensioni del set di dati, la diversità del set di dati e aumenta la lunghezza del periodo di addestramento.

Il modello utilizza anche un approccio di apprendimento in contesto che, ancora una volta, assomiglia all’approccio del modello RWC-19, ma sistema le cose esplorando sistematicamente diverse impostazioni per l’apprendimento dei modelli all’interno del contesto del set di dati.

Quindi, iniziamo esplorando queste impostazioni e valutiamo come il modello GPT-3 si esegue in diverse impostazioni.

Aggiustamento Fine

L’aggiustamento fine del modello è stato l’approccio convenzionale nei modelli di linguaggio di trasferimento, e questo approccio comporta l’aggiornamento dei pesi di un modello pre-addestrato addestrando il modello su un set di dati supervisionato specifico dell’attività desiderata, e vengono utilizzati centinaia di migliaia di esempi etichettati durante il processo.

L’approccio di aggiustamento fine è benefico perché restituisce prestazioni forti in tutta una serie di benchmark. D’altra parte, la principale limitazione dell’uso dell’approccio di aggiustamento fine è che richiede un nuovo e grande set di dati per ogni attività individuale, ha il potenziale per sfruttare le caratteristiche spurie del set di dati di addestramento, può potenzialmente portare a un confronto ingiusto con le prestazioni umane e una generalizzazione scarsa per la distribuzione fuori dall’ambito.

L’attuale portata del modello GPT-3 non implementa l’approccio di aggiustamento fine a causa della sua prestazione agnostica dell’attività, sebbene l’aggiustamento fine possa essere applicato al modello GPT-3 in futuro.

Pochi Colpi

Pochi colpi è un termine che si riferisce all’impostazione in cui il modello GPT-3 viene fornito con alcune dimostrazioni dell’attività durante l’interferenza come condizionamento, ma i pesi del modello non vengono aggiornati. Nell’impostazione a pochi colpi, il set di dati di solito ha un esempio con un contesto e un completamento desiderato (ad esempio, una frase in francese e la sua traduzione in inglese). L’impostazione a pochi colpi fornisce al modello K esempi di contesto e completamento, e quindi fornisce al modello un contesto finale e si aspetta che il modello fornisca il completamento.

Il principale vantaggio dell’uso dell’impostazione a pochi colpi è che riduce notevolmente la necessità di dati specifici dell’attività e riduce anche il potenziale per apprendere una distribuzione ristretta da un grande set di dati che è stato aggiustato in modo ristretto. D’altra parte, il principale svantaggio dell’uso dell’apprendimento a pochi colpi è che i risultati consegnati nell’impostazione a pochi colpi non sono all’altezza e sono significativamente scarsi rispetto ad altri modelli di stato dell’arte che sono stati aggiustati.

Un Colpo

Nell’impostazione a un colpo, il modello viene fornito con una sola dimostrazione e il resto è simile all’impostazione a pochi colpi. Il motivo per cui l’impostazione a un colpo è rilevante nei modelli di linguaggio di trasferimento è perché, tra le tre impostazioni, l’impostazione a un colpo è quella che assomiglia di più al modo in cui le attività vengono comunicate agli esseri umani. È perché, nella maggior parte delle attività, è comune fornire una sola dimostrazione dell’attività, altrimenti potrebbe essere difficile capire il contesto dell’attività.

Zero Colpi

Nell’impostazione a zero colpi, non ci sono dimostrazioni e il modello viene fornito con un’istruzione in lingua naturale che descrive l’attività. Il metodo a zero colpi è quello che offre la massima convenienza, è robusto e evita anche le correlazioni spurie, ma è anche l’impostazione più impegnativa di tutte e tre. È perché, in alcuni casi, è difficile anche per noi esseri umani capire il contesto di un’attività senza vedere una dimostrazione per prima.

Nonostante ciò, per alcune attività, l’impostazione a zero colpi è quella che assomiglia di più a come gli esseri umani eseguono attività di linguaggio naturale.

La figura sopra confronta l’impostazione a pochi colpi, l’impostazione a un colpo e l’impostazione a zero colpi quando si esegue un’attività di linguaggio naturale di traduzione di una frase inglese in francese.

GPT-3: Architettura del Modello

Il modello GPT-3 utilizza la stessa architettura utilizzata nel modello GPT-2 e include pre-normalizzazione, inizializzazione modificata e tecniche di tokenizzazione reversibili come quelle utilizzate nel modello GPT con l’eccezione dell’uso di una strategia alternativa per schemi di attenzione sparse locali e layer densi alternati nei layer di trasformazione, simili a Sparse Transformer.

Per studiare la dipendenza delle prestazioni del modello dalle dimensioni del modello, gli sviluppatori hanno addestrato 8 diverse dimensioni di modello che coprono tre diverse ordini di grandezza da 125 milioni a oltre 175 miliardi di parametri, l’ultimo dei quali è chiamato modello GPT-3. Lavori precedenti relativi ai modelli LLM hanno indicato che la scala della perdita di convalida con una quantità sufficiente di dati di addestramento dovrebbe essere una legge di potenza liscia approssimativa come funzione della dimensione. L’addestramento di modelli di diverse dimensioni consente agli sviluppatori di testare l’ipotesi sia per le attività di linguaggio downstream che per la perdita di convalida.

La figura sopra confronta le dimensioni e l’architettura degli 8 diversi modelli utilizzati per lo sviluppo del GPT-3. Qui, n(parametri) definisce il numero totale di pattern addestrabili, n(strati) definisce il numero totale di strati nel modello, d(modello) definisce il numero di unità in ogni strato del collo di bottiglia e d(testa) definisce le dimensioni di ogni testa di attenzione. La finestra di contesto per ogni modello è la stessa con 2048 token.

Inoltre, per minimizzare il trasferimento di dati tra i nodi, il modello viene partizionato tra le GPU lungo la profondità e la larghezza delle dimensioni. I parametri architettonici per ogni modello sono stati scelti sulla base dell’efficienza computazionale e dell’equilibrio del carico per massimizzare la precisione nella disposizione dei modelli tra le GPU.

Set di Dati di Addestramento

Di solito, i grandi modelli di linguaggio utilizzano set di dati che sono cresciuti notevolmente con gli sviluppi recenti e culminano nel set di dati Common Crawl che consiste in oltre un trilione di parole diverse. Le dimensioni del set di dati sono adeguate per addestrare il modello GPT-3 senza aggiornare più volte sulla stessa sequenza. Tuttavia, studi e analisi delle prestazioni indicano che versioni leggermente filtrate o non filtrate del set di dati Common Crawl hanno una qualità bassa rispetto a set di dati più curati.

Per affrontare il problema della qualità media del set di dati, gli sviluppatori hanno preso 3 passaggi per aumentare la qualità del set di dati.

  1. Gli sviluppatori hanno scaricato e filtrato una versione del set di dati Common Crawl in base a un intervallo simile a corpora di riferimento di alta qualità.
  2. Gli sviluppatori hanno eseguito la duplicazione fuzzy a livello di documento in tutto il set di dati nel tentativo di preservare l’integrità del set di convalida trattenuto come misura efficace di sovra-addestramento e per prevenire la ridondanza.
  3. Gli sviluppatori hanno anche aggiunto corpora di riferimento di alta qualità ai dati di addestramento per aumentare ulteriormente la diversità del set di dati.

La figura seguente mostra la proporzione finale o la miscela dei set di dati utilizzati per l’addestramento del modello GPT-3. I dati Common Crawl consistevano in oltre 45 TB di testo semplice prima della filtrazione, che è stato ridotto a 570 GB di dati dopo la filtrazione, un equivalente approssimativo di oltre 400 miliardi di token codificati a coppie di byte. È degno di nota che i set di dati nel set di addestramento considerati di alta qualità vengono campionati con maggiore frequenza invece di campionare il set di dati in proporzione alle loro dimensioni. Di conseguenza, set di dati come Books2 e Common Crawl vengono campionati meno di una volta durante l’addestramento, mentre gli altri set di dati vengono campionati più volte. Ciò consente al modello di accettare una piccola quantità di sovra-addestramento in cambio dell’addestramento su dati di addestramento di alta qualità.

Una preoccupazione significativa con i grandi modelli di linguaggio pre-addestrati su una grande quantità di dati di Internet con la capacità di memorizzare e apprendere una grande quantità di contenuti è il potenziale inquinamento delle attività downstream a causa della visualizzazione dei set di sviluppo e test durante il processo di pre-addestramento. Per ridurre tale potenziale inquinamento, gli sviluppatori hanno cercato eventuali sovrapposizioni con i set di test e sviluppo dei benchmark studiati per il GPT-3 e hanno tentato di rimuovere queste sovrapposizioni.

La figura sopra mostra il calcolo totale utilizzato durante l’addestramento del modello GPT-3. Il modello utilizza le leggi di scala per i modelli di linguaggio neurale per addestrare modelli molto più grandi su meno token rispetto al solito. Di conseguenza, sia il modello GPT-3 che il modello RoBERTa-Large, che è 10 volte più piccolo del modello GPT-3, hanno utilizzato quasi 50 petaflops/giorno di calcolo durante il processo di pre-addestramento.

Valutazione

Per l’apprendimento a pochi colpi, il modello valuta ogni esempio presente nel set di dati di valutazione disegnando K esempi casualmente dal set di dati di addestramento dell’attività come condizionamento e li delimita con 1 o 2 nuove righe a seconda dell’attività. Per Storycloze e LAMBADA, il modello disegna esempi di condizionamento dal set di sviluppo e li valuta sul set di test a causa della mancanza di un set di dati di addestramento supervisionato. Per Winograd, esiste solo un set di dati e quindi gli esempi di condizionamento vengono disegnati direttamente da esso.

K può essere qualsiasi valore che va da 0 al massimo consentito dalla finestra di contesto del modello, che è next = 2048 per tutti i modelli, e di solito si adatta a 10-100 esempi. Valori più grandi di K spesso portano a risultati migliori, ma non sempre, quindi quando il modello ha un set di test e un set di sviluppo separato disponibile, il modello esegue alcuni valori di K sul set di sviluppo e, in base ai risultati, esegue il miglior valore sul set di test.

Inoltre, sulle attività che richiedono la selezione di un completamento corretto tra più opzioni, gli sviluppatori forniscono K esempi di correzione più contesto e completamento, e quindi forniscono un esempio di contesto solo e le attività vengono confrontate in base alla probabilità di ogni completamento del modello del linguaggio. Per le attività che richiedono una classificazione binaria, i modelli spesso forniscono opzioni più semantiche e con nomi più significativi e quindi trattano l’attività come una scelta multipla e a volte anche inquadra l’attività in modo simile a quanto fatto dal modello RSR e dall’architettura.

Per le attività che richiedono un completamento a forma libera, il modello utilizza la ricerca a fascio con parametri identici a quelli utilizzati nel quadro RSR, con un fascio di lunghezza 4 e una penalità di 0,6. Il modello viene quindi valutato utilizzando il punteggio di similarità F1, la corrispondenza esatta o BLEU, a seconda dello standard per il set di dati.

Risultati

La figura sopra mostra le curve di addestramento per gli 8 modelli utilizzati nell’architettura del modello GPT-3, come descritto nelle sezioni precedenti. Simile ai risultati del modello linguistico KMH, le prestazioni del modello GPT-3 seguono una legge quando si utilizza il calcolo di addestramento in modo efficace. C’è una leggera differenza dalla legge solo quando la tendenza viene estesa di due ordini di grandezza maggiori. Potrebbe sembrare che i miglioramenti nella perdita di entropia siano il risultato della modellazione di dettagli spurii del corpus di addestramento. Tuttavia, i miglioramenti nella perdita di entropia portano a guadagni costanti nelle prestazioni generali in una vasta gamma di attività NLP.

Prima di valutare i diversi modelli su una vasta gamma di dati di addestramento, i set di dati vengono raggruppati in 8 diverse categorie che rappresentano attività simili. Queste categorie sono

  1. Valutazione su attività di modellazione del linguaggio tradizionale e attività che assomigliano alla modellazione del linguaggio, come attività di chiusura o completamento di frasi/paragrafi.
  2. Valutazione su attività di risposta a domande “a libro chiuso”.
  3. Valutazione della capacità del modello di tradurre tra lingue (specialmente in un colpo e pochi colpi)
  4. Valutazione delle prestazioni del modello in attività di schema Winograd.
  5. Valutazione su set di dati che coinvolgono ragionamento del senso comune o risposta a domande.
  6. Valutazione su attività di comprensione della lettura.
  7. Valutazione sul benchmark SuperGLUE.
  8. Esplorazione dell’NLI.

Modellazione del Linguaggio, Completamento e Attività di Chiusura

In questa sezione, le prestazioni del modello GPT-3 vengono valutate sulle attività di modellazione del linguaggio tradizionale e sulle attività che richiedono la previsione di una singola parola di interesse o il completamento di un paragrafo o di una frase, o il completamento di un pezzo di testo. Parliamo di loro in breve dettaglio.

Modellazione del Linguaggio

Il modello GPT-3 calcola la perplessità a zero colpi sul set di dati PTB o Penn Tree Bank. Il modello omette le attività relative a Wikipedia perché sono già incluse nei dati di addestramento del modello e il benchmark di un miliardo di parole è anche omesso perché causa una quantità significativa di attrito del set di dati all’interno dei dati di addestramento. Tuttavia, il set di dati PTB affronta questi problemi perché può predatare l’Internet moderno. Il modello più grande nell’architettura del modello GPT-3 stabilisce un nuovo SOTA sul set di dati PTB con un margine notevole di 15 punti e raggiunge una perplessità di 20,50.

LAMBADA

Il set di dati LAMBADA viene utilizzato per testare la modellazione del modello sulle dipendenze a lungo raggio nei paragrafi o testi. Ciò significa che il modello viene chiesto di prevedere l’ultima parola di una frase dopo aver letto il paragrafo per il contesto. Inoltre, la scala continua dei modelli di linguaggio porta a rendimenti decrescenti sul benchmark.

Il modello GPT-3 raggiunge il 76% di accuratezza su LAMBADA e ha un guadagno di oltre l’8% rispetto ai modelli migliori precedenti. Inoltre, il modello LAMBADA dimostra la flessibilità dell’apprendimento a pochi colpi poiché affronta il problema in un modo che si verifica classicamente con il set di dati. Il completamento di una frase in LAMBADA è di solito l’ultima parola della frase, ma poiché un modello di linguaggio non può sapere che, assegna una probabilità non solo alla fine corretta, ma anche ad altre continuazioni nel paragrafo.

Inoltre, quando gli esempi alimentati al modello GPT-3 vengono modificati in un certo modo, il modello restituisce un’accuratezza del 86%, un aumento del 18% rispetto ai modelli precedenti. Inoltre, i risultati hanno anche indicato che le prestazioni del modello nell’impostazione a pochi colpi aumentano proporzionalmente con l’aumento delle dimensioni del modello. Sebbene questa strategia riduca il modello più piccolo nell’architettura del GPT-3 del 20%, aumenta l’accuratezza del modello GPT-3 principale con 175 miliardi di parametri del 10%.

Risposta a Domande a Libro Chiuso

La risposta a domande a libro chiuso è un tentativo di misurare la capacità del modello GPT-3 di rispondere a domande in base alla conoscenza fattuale generale. Poiché tali domande spesso hanno un grande numero di possibili query, l’attività viene normalmente eseguita utilizzando un sistema di recupero delle informazioni che consente al modello di trovare testo rilevante in combinazione con il modello che apprende a generare una risposta a una domanda data il testo recuperato e la domanda.

La figura sopra confronta il risultato per il modello GPT-3 rispetto a diversi modelli e in esecuzione su diversi set di dati. Sul set di dati TriviaQA, il modello raggiunge un punteggio di accuratezza del 64,3% nell’impostazione a zero colpi, mentre raggiunge un punteggio di accuratezza del 68% e del 71,2% nell’impostazione a un colpo e a pochi colpi, rispettivamente.

È evidente che il modello GPT-3 nell’impostazione a zero colpi supera il modello T5-11B aggiustato di oltre il 14%.

La figura sopra mostra come le prestazioni del modello GPT-3 crescano uniformemente con l’aumento delle dimensioni del modello. Le prestazioni suggeriscono che i modelli di linguaggio continuano a imparare dal set di dati man mano che la loro capacità aumenta.

Pensieri Finali

Sarebbe sicuro dire che il GPT-3 è stato una fase rivoluzionaria nell’industria LLM, poiché il GPT-3 ha aiutato a spingere i limiti di ciò che un modello di linguaggio poteva fare. È stato lo sviluppo e gli ostacoli superati dal GPT-3 che hanno aperto la strada al modello di linguaggio più avanzato e preciso fino ad oggi, il GPT-4.

Un ingegnere per professione, uno scrittore per passione. Kunal è uno scrittore tecnico con un profondo amore e comprensione di AI e ML, dedicato a semplificare concetti complessi in questi campi attraverso la sua documentazione coinvolgente e informativa.