Modelli e piattaforme di IA

Perché i Modelli Linguistici di Grande Scala (LLM) Saltano le Istruzioni e Come Risolvere il Problema

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
LLM instruction skipping fix

I Modelli Linguistici di Grande Scala (LLM) sono diventati rapidamente strumenti indispensabili di Intelligenza Artificiale (AI), alimentando applicazioni che vanno dai chatbot alla creazione di contenuti, fino all’assistenza alla codifica. Nonostante le loro impressionanti capacità, una sfida comune che gli utenti affrontano è che questi modelli a volte saltano parti delle istruzioni che ricevono, specialmente quando queste istruzioni sono lunghe o coinvolgono più passaggi. Questo salto porta a output incompleti o inaccurati, che possono causare confusione e erodere la fiducia nei sistemi AI. Comprendere perché gli LLM saltano le istruzioni e come affrontare questo problema è essenziale per gli utenti che si affidano a questi modelli per risultati precisi e affidabili.

Perché gli LLM Saltano le Istruzioni? 

Gli LLM funzionano leggendo il testo di input come una sequenza di token. I token sono le piccole parti in cui il testo è diviso. Il modello elabora questi token uno dopo l’altro, dall’inizio alla fine. Ciò significa che le istruzioni all’inizio dell’input tendono a ricevere più attenzione. Le istruzioni successive possono ricevere meno attenzione e possono essere ignorate.

Questo accade perché gli LLM hanno una capacità di attenzione limitata. L’attenzione è il meccanismo che i modelli utilizzano per decidere quali parti dell’input sono essenziali quando generano risposte. Quando l’input è breve, l’attenzione funziona bene. Ma l’attenzione diventa meno efficace quando l’input diventa più lungo o le istruzioni diventano complesse. Ciò indebolisce la focalizzazione sulle parti successive, causando il salto.

Inoltre, molte istruzioni contemporaneamente aumentano la complessità. Quando le istruzioni si sovrappongono o sono in conflitto, i modelli possono diventare confusi. Potrebbero cercare di rispondere a tutto, ma produrrebbero risposte vaghe o contraddittorie. Ciò spesso porta a ignorare alcune istruzioni.

Gli LLM condividono anche alcuni limiti umani. Ad esempio, gli esseri umani possono perdere la concentrazione quando leggono testi lunghi o ripetitivi. Allo stesso modo, gli LLM possono dimenticare le istruzioni successive mentre elaborano più token. Questa perdita di concentrazione fa parte del design del modello e dei suoi limiti.

Un’altra ragione è come gli LLM sono addestrati. Vedono molti esempi di istruzioni semplici, ma pochi esempi di istruzioni complesse o a più passaggi. A causa di ciò, i modelli tendono a preferire seguire istruzioni più semplici che sono più comuni nei loro dati di addestramento. Questo pregiudizio li porta a saltare le istruzioni complesse. Inoltre, i limiti di token restruiscono la quantità di input che il modello può elaborare. Quando gli input superano questi limiti, le istruzioni al di là del limite sono ignorate.

Esempio: Supponi di dare a un LLM cinque istruzioni in un unico prompt. Il modello potrebbe concentrarsi principalmente sulle prime due istruzioni e ignorare parzialmente o completamente le ultime tre. Ciò influenza direttamente come il modello elabora i token in sequenza e i suoi limiti di attenzione.

Quanto Bene gli LLM Gestiscono le Istruzioni Sequenziali in Base ai Risultati di SIFo 2024

Recenti studi hanno esaminato attentamente come gli LLM seguono più istruzioni fornite una dopo l’altra. Uno studio importante è il Benchmark di Sequential Instructions Following (SIFo) 2024. Questo benchmark testa i modelli su compiti che richiedono il completamento sequenziale di istruzioni, come la modifica del testo, la risposta alle domande, la matematica e il rispetto delle regole di sicurezza. Ogni istruzione nella sequenza dipende dal completamento corretto di quella precedente. Questo approccio aiuta a verificare se il modello ha seguito l’intera sequenza correttamente.

I risultati di SIFo mostrano che anche i migliori LLM, come GPT-4 e Claude-3, spesso trovano difficile completare tutte le istruzioni correttamente. Ciò è particolarmente vero quando le istruzioni sono lunghe o complesse. La ricerca individua tre problemi principali che gli LLM affrontano nel seguire le istruzioni:

Comprensione: Comprendere appieno cosa significa ogni istruzione.

Ragionamento: Collegare logicamente più istruzioni per mantenere la risposta chiara.

Output Affidabile: Produrre risposte complete e accurate, coprendo tutte le istruzioni fornite.

Tecniche come l’ingegneria dei prompt e il fine-tuning aiutano a migliorare come i modelli seguono le istruzioni. Tuttavia, questi metodi non risolvono completamente il problema del salto delle istruzioni. Utilizzare l’Apprendimento per Rinforzo con Feedback Umano (RLHF) migliora ulteriormente la capacità del modello di rispondere appropriatamente. Tuttavia, i modelli hanno difficoltà quando le istruzioni richiedono molti passaggi o sono molto complesse.

Lo studio mostra anche che gli LLM funzionano meglio quando le istruzioni sono semplici, chiaramente separate e ben organizzate. Quando i compiti richiedono catene di ragionamento lunghe o molti passaggi, l’accuratezza del modello diminuisce. Questi risultati aiutano a suggerire modi migliori per utilizzare gli LLM e mostrano la necessità di costruire modelli più forti che possano veramente seguire le istruzioni una dopo l’altra.

Perché gli LLM Saltano le Istruzioni: Sfide Tecniche e Considerazioni Pratiche

Gli LLM possono saltare le istruzioni a causa di diversi fattori tecnici e pratici radicati nel modo in cui elaborano e codificano il testo di input.

Attenzione Limitata e Diluizione delle Informazioni

Gli LLM si affidano a meccanismi di attenzione per assegnare importanza a diverse parti dell’input. Quando i prompt sono concisi, l’attenzione del modello è focalizzata ed efficace. Tuttavia, quando il prompt diventa più lungo o ripetitivo, l’attenzione diventa meno efficace, e i token o le istruzioni successive ricevono meno attenzione, aumentando la probabilità che vengano ignorati. Questo fenomeno, noto come diluizione delle informazioni, è particolarmente problematico per le istruzioni che appaiono tardi in un prompt. Inoltre, i modelli hanno limiti di token fissi (ad esempio, 2048 token); qualsiasi testo al di là di questo limite è troncato e ignorato, causando l’ignoranza completa delle istruzioni alla fine.

Complessità dell’Output e Ambiguità

Gli LLM possono lottare per produrre risposte chiare e complete quando affrontano istruzioni multiple o in conflitto. Il modello può generare risposte parziali o vaghe per evitare contraddizioni o confusione, effettivamente omettendo alcune istruzioni. L’ambiguità nella formulazione delle istruzioni pone anche sfide: istruzioni poco chiare o imprecise rendono difficile per il modello determinare le azioni intese, aumentando il rischio di saltare o fraintendere parti dell’input.

Progettazione e Sensibilità del Prompt

La struttura e la formulazione dei prompt giocano anche un ruolo critico nel seguire le istruzioni. La ricerca mostra che anche piccoli cambiamenti nella scrittura o nella formattazione delle istruzioni possono influenzare significativamente se il modello aderisce a esse.

I prompt mal strutturati, che mancano di una chiara separazione, punti elenco o numerazione, rendono più difficile per il modello distinguere tra passaggi, aumentando la probabilità di fondere o omettere istruzioni. La rappresentazione interna del prompt da parte del modello è altamente sensibile a queste variazioni, il che spiega perché l’ingegneria dei prompt (riformulazione o ristrutturazione dei prompt) può migliorare sostanzialmente l’aderenza alle istruzioni, anche se il contenuto sottostante rimane lo stesso.

Come Risolvere il Salto delle Istruzioni negli LLM

Migliorare la capacità degli LLM di seguire le istruzioni in modo accurato è essenziale per produrre risultati affidabili e precisi. Le seguenti best practice dovrebbero essere considerate per minimizzare il salto delle istruzioni e migliorare la qualità delle risposte generate dall’AI:

Le Attività Dovrebbero Essere Divise in Parti Più Piccole

I prompt lunghi o a più passaggi dovrebbero essere divisi in segmenti più focalizzati. Fornire una o due istruzioni alla volta consente al modello di mantenere una migliore attenzione e riduce la probabilità di perdere passaggi.

Esempio

Invece di combinare tutte le istruzioni in un unico prompt, come “Riassumi il testo, elenca i punti principali, suggerisci miglioramenti e traduci in francese“, ogni istruzione dovrebbe essere presentata separatamente o in gruppi più piccoli.

Le Istruzioni Dovrebbero Essere Formattate Utilizzando Elenco Numerato o Punti Elenco

Organizzare le istruzioni con una formattazione esplicita, come elenchi numerati o punti elenco, aiuta a indicare che ogni elemento è un compito individuale. Ciò aumenta le probabilità che la risposta affronti tutte le istruzioni.

Esempio

  • Riassumi il testo seguente.
  • Elenca i punti principali.
  • Suggerisci miglioramenti.

Una tale formattazione fornisce indicazioni visive che aiutano il modello a riconoscere e separare compiti distinti all’interno di un prompt.

Le Istruzioni Dovrebbero Essere Esplicite e Univoche

È essenziale che le istruzioni specifichino chiaramente il requisito di completare ogni passaggio. Il linguaggio ambiguo o vago dovrebbe essere evitato. Il prompt dovrebbe indicare esplicitamente che non è possibile saltare passaggi.

Esempio

“Per favore, completa tutti e tre i compiti qui sotto. Saltare qualsiasi passaggio non è accettabile.”

Affermazioni dirette come questa riducono la confusione e incoraggiano il modello a fornire risposte complete.

Per Compiti Critici, Dovrebbero Essere Utilizzati Prompt Separati

Ogni istruzione dovrebbe essere inviata come prompt individuale per compiti in cui l’accuratezza e la completezza sono critiche. Sebbene questo approccio possa aumentare il tempo di interazione, migliora significativamente la probabilità di ottenere output completi e precisi. Questo metodo assicura che il modello si concentri interamente su un compito alla volta, riducendo il rischio di istruzioni mancate.

Strategie Avanzate per Bilanciare Completezza ed Efficienza

Aspettare una risposta dopo ogni singola istruzione può essere dispendioso in termini di tempo per gli utenti. Per migliorare l’efficienza mantenendo la chiarezza e riducendo le istruzioni saltate, le seguenti tecniche di prompt avanzate possono essere efficaci:

Batch di Istruzioni con Formattazione Chiara ed Etichette Esplicite

Molteplici istruzioni correlate possono essere combinate in un unico prompt, ma ogni istruzione dovrebbe essere separata utilizzando numerazione o intestazioni. Il prompt dovrebbe anche istruire il modello a rispondere a tutte le istruzioni interamente e in ordine.

Esempio di Prompt

Per favore, completa tutti i seguenti compiti con attenzione senza saltare alcuno:

  1. Riassumi il testo qui sotto.
  2. Elenca i punti principali dalla tua riassunto.
  3. Suggerisci miglioramenti in base ai punti principali.
  4. Traduci il testo migliorato in francese.

Prompt nello Stile della Catena di Pensieri

I prompt nello stile della catena di pensieri guidano il modello a ragionare attraverso ogni compito passo dopo passo prima di fornire una risposta. Incoraggiare il modello a elaborare le istruzioni sequenzialmente all’interno di una singola risposta aiuta a garantire che non vengano saltati passaggi, riducendo la probabilità di saltare istruzioni e migliorando la completezza.

Esempio di Prompt

Leggi il testo qui sotto e esegui i seguenti compiti in ordine. Mostra chiaramente il tuo lavoro:

  • Riassumi il testo.
  • Identifica i punti principali dalla tua riassunto.
  • Suggerisci miglioramenti al testo.
  • Traduci il testo migliorato in francese.

Per favore, rispondi a tutti i compiti completamente e separatamente in una sola risposta.

Aggiungere Istruzioni di Completamento e Promemoria

Ricordare esplicitamente al modello di:

  • Rispondere a ogni compito completamente.
  • Non saltare alcuna istruzione.
  • Separare le risposte chiaramente.

Tali promemoria aiutano il modello a concentrarsi sulla completezza quando sono combinate più istruzioni.

Diversi Modelli e Impostazioni dei Parametri Dovrebbero Essere Testati

Non tutti gli LLM si comportano allo stesso modo nel seguire più istruzioni. È consigliabile valutare vari modelli per identificare quelli che eccellono nei compiti a più passaggi. Inoltre, regolare parametri come temperatura, token massimi e prompt di sistema può ulteriormente migliorare la focalizzazione e la completezza delle risposte. Testare queste impostazioni aiuta a personalizzare il comportamento del modello in base ai requisiti specifici del compito.

Il Fine-Tuning dei Modelli e l’Utilizzo di Strumenti Esterni Dovrebbero Essere Considerati

I modelli dovrebbero essere ottimizzati su set di dati che includono istruzioni a più passaggi o sequenziali per migliorare la loro aderenza a prompt complessi. Tecniche come RLHF possono ulteriormente migliorare il seguire le istruzioni.

Per casi d’uso avanzati, l’integrazione di strumenti esterni come API, plugin specifici per compiti o sistemi di Generazione Aumentata dalla Ricerca (RAG) può fornire ulteriore contesto e controllo, migliorando l’affidabilità e l’accuratezza degli output.

Il Punto di Partenza

Gli LLM sono strumenti potenti ma possono saltare le istruzioni quando i prompt sono lunghi o complessi. Ciò accade a causa di come leggono l’input e focalizzano la loro attenzione. Le istruzioni dovrebbero essere chiare, semplici e ben organizzate per ottenere risultati migliori e più affidabili. Dividere i compiti in parti più piccole, utilizzare elenchi e fornire istruzioni dirette aiutano i modelli a seguire i passaggi completamente.

Utilizzare prompt separati può migliorare l’accuratezza per compiti critici, anche se richiede più tempo. Inoltre, metodi di prompt avanzati come la catena di pensieri e la formattazione chiara aiutano a bilanciare velocità e precisione. Inoltre, testare diversi modelli e ottimizzarli può anche migliorare i risultati. Queste idee aiuteranno gli utenti a ottenere risposte consistenti e complete, rendendo gli strumenti AI più utili nel lavoro reale.

Il dottor Assad Abbas, professore associato con tenure presso l'Università COMSATS di Islamabad, Pakistan, ha ottenuto il suo dottorato di ricerca presso la North Dakota State University, USA. La sua ricerca si concentra su tecnologie avanzate, tra cui cloud, fog e edge computing, big data analytics e AI. Il dottor Abbas ha fatto contributi sostanziali con pubblicazioni su riviste scientifiche e conferenze reputate. È anche il fondatore di MyFastingBuddy.