Modelli e piattaforme di IA
Dentro di Microsoft’s Phi-3 Mini: un modello di intelligenza artificiale leggero che supera le aspettative
Microsoft (MSFT ) ha recentemente presentato il suo nuovo modello di linguaggio leggero chiamato Phi-3 Mini, che fa parte di una serie di modelli di intelligenza artificiale compatti progettati per offrire prestazioni all’avanguardia pur essendo abbastanza piccoli da funzionare efficientemente su dispositivi con risorse di calcolo limitate. Con soli 3,8 miliardi di parametri, Phi-3 Mini è una frazione delle dimensioni dei giganti dell’IA come GPT-4, eppure promette di eguagliare le loro capacità in molte aree chiave.
Lo sviluppo di Phi-3 Mini rappresenta un importante traguardo nella ricerca di democratizzare le capacità avanzate di intelligenza artificiale, rendendole accessibili su una gamma più ampia di hardware. La sua piccola dimensione gli consente di essere distribuito localmente su smartphone, tablet e altri dispositivi edge, superando i problemi di latenza e privacy associati ai modelli basati su cloud. Ciò apre nuove possibilità per esperienze intelligenti on-device in vari ambiti, dalla assistenza virtuale e dall’IA conversazionale agli strumenti di codifica e ai compiti di comprensione del linguaggio.

- 4-bit quantized phi-3-mini in esecuzione nativa su un iPhone
Sotto il cofano: architettura e formazione
Al suo nucleo, Phi-3 Mini è un modello di decodificatore di trasformatori basato su un’architettura simile a quella del modello Llama-2 open-source. Presenta 32 livelli, 3072 dimensioni nascoste e 32 teste di attenzione, con una lunghezza di contesto predefinita di 4.000 token. Microsoft ha anche introdotto una versione a contesto lungo chiamata Phi-3 Mini-128K, che estende la lunghezza del contesto a 128.000 token utilizzando tecniche come LongRope.
Ciò che distingue Phi-3 Mini, tuttavia, è la sua metodologia di formazione. Invece di affidarsi esclusivamente alla forza bruta di enormi set di dati e potenza di calcolo, Microsoft si è concentrata sulla creazione di un set di dati di formazione di alta qualità e denso di ragionamento. Questi dati sono composti da dati web pesantemente filtrati, nonché da dati sintetici generati da modelli di linguaggio più grandi.
Il processo di formazione segue un approccio a due fasi. Nella prima fase, il modello è esposto a una gamma diversificata di fonti web finalizzate a insegnargli conoscenze generali e comprensione del linguaggio. La seconda fase combina dati web ancora più pesantemente filtrati con dati sintetici progettati per impartire abilità di ragionamento logico e competenze di dominio di nicchia.
Microsoft definisce questo approccio come il “regime di dati ottimale”, una deviazione dal tradizionale “regime di calcolo ottimale” o “regime di sovra-formazione” utilizzato da molti grandi modelli di linguaggio. L’obiettivo è calibrare i dati di formazione per adeguarli alle dimensioni del modello, fornendo il giusto livello di conoscenza e capacità di ragionamento, lasciando al contempo sufficiente capacità per altre funzionalità.

- Qualità dei nuovi modelli Phi-3, come misurata dalle prestazioni sul benchmark Massive Multitask Language Understanding (MMLU)
Questo approccio basato sui dati ha dato i suoi frutti, poiché Phi-3 Mini raggiunge prestazioni notevoli su una vasta gamma di benchmark accademici, spesso rivaleggiando o superando modelli molto più grandi. Ad esempio, ottiene il 69% sul benchmark MMLU per l’apprendimento e la comprensione multitask e 8,38 sul benchmark MT-bench per il ragionamento matematico – risultati che sono alla pari con modelli come Mixtral 8x7B e GPT-3.5.
Sicurezza e robustezza
Accanto alle sue prestazioni impressionanti, Microsoft ha posto un forte accento sulla sicurezza e sulla robustezza nello sviluppo di Phi-3 Mini. Il modello ha subito un rigoroso processo di formazione post-training che include la formazione fine (SFT) e l’ottimizzazione delle preferenze dirette (DPO).
La fase SFT sfrutta dati altamente curati provenienti da domini diversi, tra cui matematica, codifica, ragionamento, conversazione, identità del modello e sicurezza. Ciò aiuta a rafforzare le capacità del modello in queste aree, instillando al contempo una forte sensazione di identità e comportamento etico.
La fase DPO, d’altra parte, si concentra su come allontanare il modello da comportamenti indesiderati utilizzando risposte rifiutate come esempi negativi. Questo processo copre dati in formato chat, compiti di ragionamento e sforzi di intelligenza artificiale responsabile (RAI), garantendo che Phi-3 Mini aderisca ai principi di intelligenza artificiale etica e affidabile di Microsoft.
Per ulteriormente migliorare il suo profilo di sicurezza, Phi-3 Mini è stato sottoposto a test estensivi di red teaming e testing automatizzato su decine di categorie di danno RAI. Un team di red team indipendente di Microsoft ha esaminato iterativamente il modello, identificando aree di miglioramento, che sono state poi affrontate attraverso set di dati curati e ulteriore formazione.
Questo approccio multifase ha notevolmente ridotto l’incidenza di risposte dannose, inesattezze fattuali e pregiudizi, come dimostrato dai benchmark interni RAI di Microsoft. Ad esempio, il modello presenta tassi di difetto bassi per contenuti dannosi (0,75%) e riassunti (10%), nonché un basso tasso di infondamento (0,603), indicando che le sue risposte sono saldamente radicate nel contesto fornito.
Applicazioni e casi d’uso
Con le sue prestazioni impressionanti e le solide misure di sicurezza, Phi-3 Mini è particolarmente adatto a una vasta gamma di applicazioni, specialmente in ambienti con risorse di calcolo limitate e scenari vincolati dalla latenza.
Una delle prospettive più emozionanti è il dispiegamento di assistenti virtuali intelligenti e di intelligenza artificiale conversazionale direttamente su dispositivi mobili. Eseguendosi localmente, questi assistenti possono fornire risposte immediate senza la necessità di una connessione di rete, garantendo al contempo che i dati sensibili rimangano sul dispositivo, affrontando così le preoccupazioni relative alla privacy.
Le forti capacità di ragionamento di Phi-3 Mini lo rendono anche un asset prezioso per l’assistenza alla codifica e la risoluzione di problemi matematici. Sviluppatori e studenti possono trarre vantaggio dal completamento del codice on-device, dalla rilevazione degli errori e dalle spiegazioni, semplificando così i processi di sviluppo e apprendimento.
Oltre a queste applicazioni, la versatilità del modello apre opportunità in aree come la comprensione del linguaggio, la sintesi di testi e la risposta alle domande. La sua piccola dimensione e l’efficienza lo rendono una scelta attraente per l’integrazione di funzionalità di intelligenza artificiale in una vasta gamma di dispositivi e sistemi, dai dispositivi domestici intelligenti ai sistemi di automazione industriale.
Guardando avanti: Phi-3 Small e Phi-3 Medium
Mentre Phi-3 Mini è un risultato notevole di per sé, Microsoft ha piani ancora più ambiziosi per la famiglia Phi-3. La società ha già presentato in anteprima due modelli più grandi, Phi-3 Small (7 miliardi di parametri) e Phi-3 Medium (14 miliardi di parametri), entrambi dei quali sono destinati a spingere i confini delle prestazioni per i modelli di linguaggio compatti.
Phi-3 Small, ad esempio, sfrutta un tokenizzatore più avanzato (tiktoken) e un meccanismo di attenzione a query raggruppate, insieme a un livello di attenzione blocksparse innovativo, per ottimizzare la sua impronta di memoria mantenendo al contempo le prestazioni di recupero del contesto lungo. Incorpora inoltre il 10% di dati multilingui in più, migliorando le sue capacità di comprensione e generazione del linguaggio su più lingue.
Phi-3 Medium, d’altra parte, rappresenta un notevole passo avanti in termini di scala, con 40 livelli, 40 teste di attenzione e una dimensione di incorporamento di 5.120. Sebbene Microsoft noti che alcuni benchmark potrebbero richiedere un ulteriore affinamento del mix di dati di formazione per sfruttare appieno questa maggiore capacità, i risultati iniziali sono promettenti, con miglioramenti sostanziali rispetto a Phi-3 Small in compiti come MMLU, TriviaQA e HumanEval.
Limitazioni e direzioni future
Nonostante le sue capacità impressionanti, Phi-3 Mini, come tutti i modelli di linguaggio, non è esente da limitazioni. Una delle debolezze più note è la sua capacità relativamente limitata di archiviazione di conoscenze fattuali, come dimostrato dalle sue prestazioni più basse sui benchmark come TriviaQA.
Tuttavia, Microsoft ritiene che questa limitazione possa essere mitigata integrando il modello con funzionalità di ricerca, consentendogli di recuperare e ragionare su informazioni rilevanti su richiesta. Questo approccio è dimostrato nell’interfaccia di chat di Hugging Face, dove Phi-3 Mini può sfruttare la ricerca per migliorare le sue risposte.
Un’altra area di miglioramento è la capacità multilingue del modello. Sebbene Phi-3 Small abbia fatto i primi passi incorporando dati multilingui aggiuntivi, è necessario ulteriore lavoro per sbloccare appieno il potenziale di questi modelli compatti per applicazioni cross-linguistiche.
Guardando avanti, Microsoft è impegnata a continuare ad avanzare la famiglia di modelli Phi, affrontando le loro limitazioni e ampliando le loro capacità. Ciò potrebbe coinvolgere ulteriori affinamenti dei dati di formazione e della metodologia, nonché l’esplorazione di nuove architetture e tecniche specificamente progettate per modelli di linguaggio compatti e ad alte prestazioni.
Conclusione
Il Phi-3 Mini di Microsoft rappresenta un notevole balzo in avanti nella democratizzazione delle capacità avanzate di intelligenza artificiale. Fornendo prestazioni all’avanguardia in un pacchetto compatto ed efficiente in termini di risorse, apre nuove possibilità per esperienze intelligenti on-device in una vasta gamma di applicazioni.
L’approccio innovativo di formazione del modello, che enfatizza dati di alta qualità e densi di ragionamento rispetto alla pura potenza di calcolo, si è rivelato un gioco-chiave, consentendo a Phi-3 Mini di superare le aspettative per la sua classe di dimensioni. Combinato con le sue solide misure di sicurezza e gli sforzi di sviluppo in corso, la famiglia di modelli Phi è pronta a svolgere un ruolo cruciale nel plasmare il futuro dei sistemi intelligenti, rendendo l’intelligenza artificiale più accessibile, efficiente e affidabile che mai.
Man mano che l’industria tecnologica continua a spingere i confini di ciò che è possibile con l’intelligenza artificiale, l’impegno di Microsoft per modelli leggeri e ad alte prestazioni come Phi-3 Mini rappresenta una piacevole deviazione dalla saggezza convenzionale secondo cui “più grande è meglio”. Dimostrando che le dimensioni non sono tutto, Phi-3 Mini ha il potenziale per ispirare una nuova ondata di innovazione focalizzata sul massimizzare il valore e l’impatto dell’intelligenza artificiale attraverso la cura intelligente dei dati, la progettazione del modello pensata e pratiche di sviluppo responsabili.












