Fondamenti di IA

Cosa sono le reti neurali Transformer?

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Un transformer è un’architettura di rete neurale che elabora le relazioni tra i token mediante l’attenzione. A differenza di una rete ricorrente che deve trasmettere uno stato nascosto da una posizione all’altra, un transformer può calcolare molte interazioni token‑a‑token in parallelo durante l’addestramento.

I transformer alimentano numerosi sistemi di linguaggio, visione, audio e multimodali, ma l’architettura non è un database né una garanzia di ragionamento. Le loro uscite rimangono previsioni condizionate sui parametri appresi, sul contesto fornito e sulla procedura di decodifica.

Punti chiave

  • L’auto‑attenzione consente a ciascun token di costruire una rappresentazione dipendente dal contesto a partire da altri token consentiti.
  • Le informazioni di posizione vengono aggiunte perché l’attenzione da sola non codifica l’ordine dei token.
  • I transformer encoder‑only, decoder‑only e encoder‑decoder servono a obiettivi diversi.
  • La lunghezza del contesto, la computazione, i dati di addestramento e la valutazione — non solo l’attenzione — determinano capacità e affidabilità.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
L’attenzione costruisce rappresentazioni contestuali; le maschere e gli obiettivi determinano quali informazioni sono disponibili.

Token, embedding e posizione

Il testo viene innanzitutto suddiviso in token, che possono essere parole, sotto‑parole o caratteri. Ogni ID di token seleziona un vettore di embedding appreso. Un transformer per la visione può invece incorporare patch di immagine; un transformer audio può incorporare frame o unità acustiche apprese.

Poiché un’operazione di attenzione pura è equivaria alle permutazioni, il modello necessita di informazioni di posizione. Le implementazioni possono aggiungere codifiche posizionali apprese o fisse, oppure modificare i punteggi di attenzione con schemi di posizione relativi o rotativi. Il risultato combina ciò che è un token con dove appare.

Prodotto scalare e attenzione multi‑testa

Per ogni posizione, le proiezioni apprese creano una query, una chiave e un valore. La somiglianza tra una query e le chiavi consentite genera pesi di attenzione; i loro valori ponderati costituiscono l’output. La scalatura del prodotto scalare aiuta a mantenere il softmax numericamente stabile man mano che la dimensione del vettore cresce.

L’attenzione multi‑testa ripete questa operazione in diversi sottospazi appresi. Teste diverse possono specializzarsi in relazioni differenti, sebbene un pattern di attenzione esteticamente gradevole non debba essere automaticamente interpretato come una spiegazione fedele della decisione del modello.

Il blocco Transformer

Un sottolivello di attenzione è seguito da una rete feed‑forward per posizione. Le connessioni residuali trasportano le rappresentazioni precedenti attorno a ciascun sottolivello, mentre la normalizzazione e la regolarizzazione supportano l’ottimizzazione. L’impilamento di molti blocchi costruisce caratteristiche sempre più contestuali tramite deep learning.

Durante la generazione causale, una maschera impedisce a una posizione di leggere token futuri. In fase di inferenza, un decoder prevede un token, lo aggiunge e ripete. Una cache chiave‑valore evita di ricalcolare ogni proiezione di attenzione precedente, riducendo ma non eliminando il costo della generazione.

Famiglie encoder, decoder e encoder‑decoder

I modelli solo‑encoder apprendono rappresentazioni bidirezionali adatte a classificazione, recupero e etichettatura di token. I modelli solo‑decoder utilizzano l’attenzione causale per la generazione del token successivo. I modelli encoder‑decoder consentono a un decoder di attendere a un input codificato, utile per la traduzione e altri compiti sequenza‑a‑sequenza.

I sistemi moderni spesso iniziano con un pre‑addestramento ampio e poi impiegano transfer learning, il fine‑tuning di istruzioni o l’ottimizzazione delle preferenze. La stessa architettura può quindi supportare comportamenti molto diversi a seconda del suo obiettivo e dei dati.

Limiti, efficienza e valutazione

L’attenzione completa su una sequenza comporta interazioni quadratiche tra coppie in funzione della lunghezza della sequenza, creando pressione su memoria e calcolo. L’attenzione sparsa o lineare, il chunking, il recupero, la quantizzazione e la cache scambiano accuratezza, accesso al contesto, latenza e complessità di implementazione.

Una finestra di contesto più ampia non garantisce che ogni fatto fornito venga utilizzato correttamente. Valutare la factualità, la robustezza, la calibrazione, la latenza, il costo e i modi di fallimento specifici del compito. Per i sistemi interattivi, prompt engineering può modellare il comportamento, ma non può trasformare un modello probabilistico in una fonte infallibile.

Calcolo del transformer da token a contesto

Un transformer mappa i token in vettori, aggiunge informazioni posizionali e li fa passare attraverso blocchi di attenzione e feed‑forward ripetuti. Nell’auto‑attenzione, le proiezioni apprese creano query, chiavi e valori. I prodotti scalari confrontano ogni query con le chiavi, un softmax produce i pesi e i valori ponderati formano il contesto. Teste multiple apprendono spazi di proiezione differenti. Le connessioni residuali e la normalizzazione stabilizzano le pile profonde, mentre la rete feed‑forward trasforma ogni token in modo indipendente tra i layer di attenzione.

I modelli solo‑encoder usano contesto bidirezionale e sono adatti a compiti di classificazione o rappresentazione. I modelli solo‑decoder applicano una maschera causale così che ogni posizione predica dai token precedenti e dominano la modellazione linguistica generativa. I modelli encoder‑decoder consentono a un decoder di attendere a un input codificato per traduzione e generazione strutturata. Il costo dell’attenzione cresce quadraticamente con la lunghezza della sequenza nella forma standard, motivando alternative sparse, lineari, a chunk, ricorsive e basate su spazi di stato. Un contesto più lungo aumenta le prove disponibili, ma non garantisce richiamo o ragionamento.

Addestramento, adattamento e inferenza

Gli obiettivi del pre‑addestramento includono la previsione del token successivo, la ricostruzione di token mascherati e la corruzione sequenza‑a‑sequenza. La miscela di dati, la deduplicazione, il tokenizer, il raggruppamento del contesto, l’ottimizzatore, il programma e la potenza di calcolo modellano la capacità. Il fine‑tuning può aggiornare tutti i parametri o utilizzare adattatori e metodi a bassa rango; il tuning di istruzioni e preferenze altera il comportamento. Il recupero è spesso migliore per fatti in evoluzione, mentre il tuning è utile per il formato e il comportamento del compito. Conservare un set di valutazione intatto e testare la contaminazione da benchmark pubblici.

L’inferenza autoregressiva memorizza le proiezioni chiave‑valore per i token precedenti per evitare il ricalcolo. La latenza dipende dall’elaborazione del prompt e dalla decodifica sequenziale; il throughput dipende dal batching, dalla memoria, dalla gestione della cache, dalla precisione e dall’hardware. I metodi greedy, temperature, top‑k, top‑p e beam bilanciano determinismo e diversità. La quantizzazione riduce la memoria ma può influire su capacità rare. Convalidare il modello distribuito esatto, il tokenizer, il modello di prompt, il campionatore e il runtime a lunghezze di sequenza realistiche.

Valutazione e controlli

I transformer possono generare allucinazioni, seguire istruzioni malevole recuperate, esporre dati memorizzati o degradare tra lingue e contesti lunghi. Valutare il successo del compito, il supporto fattuale, la calibrazione, il rifiuto, la robustezza, la sicurezza, la latenza e il costo; ispezionare separatamente le prove e le azioni degli strumenti. Utilizzare il recupero consapevole dei permessi, strumenti tipizzati, autorizzazione esterna, limiti di velocità e approvazione umana per azioni consequenziali. Monitorare versioni del modello e del prompt, distribuzione degli input, errori degli strumenti e correzioni degli utenti. Un transformer è un’architettura per il calcolo sequenziale, non una prova di comprensione né una garanzia di output veritieri.

Esempio pratico: un assistente documentale basato su transformer

Un’azienda indicizza manuali approvati con ID documento, versione, sezione, permessi e data di efficacia. Un assistente basato su transformer recupera e ri‑ordina le evidenze, poi risponde solo da passaggi consentiti con citazioni. Il set di valutazione comprende domande rispondibili, non rispondibili, ambigue e conflittuali su ruoli e tipologie di documento. Richiamo del recupero, precisione delle citazioni, correttezza delle risposte fondate, rifiuto, comportamento a lungo contesto, latenza e costo sono valutati separatamente.

I documenti recuperati sono trattati come dati non attendibili, quindi le istruzioni incorporate non possono sovrascrivere la politica di sistema o autorizzare strumenti. Gli utenti si autenticano prima del recupero, e le azioni consequenziali rimangono al di fuori del modello. I log conservano gli ID delle evidenze e le versioni senza contenuti documentali superflui. Il monitoraggio rileva cambiamenti del corpus, risposte non supportate, errori di permesso e correzioni degli utenti. Un cambiamento di modello o tokenizer viene rieseguito sul set di test completo, e la configurazione precedente rimane disponibile finché il nuovo sistema non dimostra pari o migliore sicurezza e qualità.

Prove di implementazione e prontezza operativa

Una decisione di produzione richiede più di una dimostrazione di successo. Definire gli utenti target, l’ambiente operativo, gli input, gli output, le dipendenze, il responsabile e le conseguenze di ogni errore importante. Stabilire una baseline riproducibile e un set di valutazione versionato prima del fine‑tuning. Testare casi ordinari, condizioni di confine, input malformati o mancanti, spostamenti di distribuzione, interruzioni di dipendenze, usi impropri e i gruppi o ambienti più soggetti a carenze. Misurare la qualità del compito insieme a calibrazione o incertezza, latenza, throughput, costo delle risorse, accessibilità, privacy e sicurezza. Registrare ogni trasformazione e soglia affinché un revisore indipendente possa riprodurre il risultato e distinguere le evidenze da un prototipo attraente.

Prima del lancio, assegnare l’autorità per il rilascio, le eccezioni, le modifiche, il rollback e il ritiro. Utilizzare un rollout a tappe, conservare un fallback sicuro e verificare il monitoraggio con guasti iniettati deliberatamente. La telemetria operativa dovrebbe rivelare la qualità dell’input, il comportamento dell’output, la versione del modello o della regola, lo stato di salute delle dipendenze, le sovrascritture umane e i risultati confermati senza raccogliere dati sensibili non necessari. Definire soglie di allerta e un responsabile di risposta, quindi rivedere le evidenze del mondo reale dopo il dispiegamento anziché presumere che le prestazioni offline persistano. Rivalutare ogni volta che le fonti di dati, gli utenti, i modelli, i fornitori, le politiche, l’hardware o gli obiettivi cambiano. Un sistema mantenuto ha inoltre bisogno di documentare

Domande frequenti

Ogni grande modello linguistico è un transformer?

La maggior parte degli attuali grandi modelli linguistici utilizza varianti del transformer, ma i modelli linguistici possono essere costruiti con architetture ricorrenti, a spazi di stato o ibride.

L’auto‑attenzione significa che un modello comprende il testo come una persona?

No. L’attenzione è un meccanismo di ponderazione appreso. Un comportamento linguistico simile a quello umano non stabilisce di per sé una comprensione, veridicità o intenzione simili a quelle umane.

Riferimenti principali

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.