Modelli e piattaforme di IA

Osprey: Addestramento dell’istruzione visiva per la comprensione a livello di pixel

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Con il recente miglioramento dei metodi di addestramento dell’istruzione visiva, i Modelli Linguistici Multimodali (MLLM) hanno dimostrato notevoli capacità di comprensione visiva-linguistica generale. Queste capacità li rendono elementi chiave per la costruzione di assistenti visivi general-purpose moderni. I modelli recenti, tra cui MiniGPT-4, LLaVA, InstructBLIP e altri, mostrano impressionanti capacità di ragionamento visivo e di esecuzione di istruzioni. Sebbene la maggior parte di essi si basi su coppie di immagini e testo per l’allineamento visivo-linguistico a livello di immagine, si comportano bene in questo dominio. Tuttavia, la loro dipendenza dall’allineamento a livello di scatola e di immagine è la principale ragione per cui gli MLLM non riescono a replicare le loro prestazioni sui compiti di allineamento visivo-linguistico fine-granulare a livello di pixel. Inoltre, la limitata disponibilità di dati di istruzione basati su maschere per l’addestramento rappresenta una sfida per ulteriori miglioramenti degli MLLM.

Osprey è un metodo di addestramento dell’istruzione testo-maschera con l’obiettivo principale di estendere le capacità degli MLLM. Incorpora regioni mascherate fine-granulari nelle istruzioni linguistiche per raggiungere la comprensione visiva-linguistica a livello di pixel. Per raggiungere questo obiettivo, il framework Osprey cura un set di dati di regioni-testo basate su maschere con oltre 700.000 campioni. Inietta la rappresentazione a livello di pixel nei Modelli Linguistici (LLM) per progettare un modello visivo-linguistico. Notabilmente, il framework Osprey adotta un modello CLIP basato su convolutional neural network (CNN) come encodatore visivo e integra un estrattore visivo consapevole di maschere nella sua architettura. Ciò consente un’estrazione precisa di caratteristiche visive di maschere da input ad alta risoluzione.

In questo articolo, discuteremo del framework Osprey e approfondiremo la sua architettura. Esploreremo anche il set di dati di regioni-testo curato con oltre 700.000 campioni e confronteremo le sue prestazioni in vari compiti di comprensione di regioni. Quindi, iniziamo.

Osprey: Comprensione a livello di pixel con addestramento dell’istruzione visiva

I Modelli Linguistici Multimodali come MiniGPT-4, Otter, Qwen-LV, InstructBLIP e altri sono i leader nello sviluppo di assistenti visivi general-purpose e sono noti per le loro eccezionali capacità multimodali e generative visive. Tuttavia, i Modelli Linguistici Multimodali soffrono di una sfida importante poiché forniscono risultati insoddisfacenti sui compiti di comprensione di immagini fine-granulari come la didascalia, la classificazione di regioni e il ragionamento. Una delle principali ragioni delle prestazioni scarse sui compiti di comprensione di immagini fine-granulari è la mancanza di allineamento a livello di regione. I recenti MLLM come GPT4RoI, Shikra e altri mirano a consentire la comprensione a livello di regione nei modelli visivo-linguistici elaborando regioni specificate da scatole di delimitazione e sfruttando l’addestramento dell’istruzione visiva con caratteristiche spaziali a livello di oggetto.

Sebbene l’approccio per consentire la comprensione a livello di regione possa migliorare le prestazioni, l’utilizzo di scatole di delimitazione sparse come input di regione di riferimento diretto potrebbe introdurre caratteristiche di sfondo irrilevanti, portando a un allineamento inaccurato di coppie di testo-regione per l’addestramento dell’istruzione visiva sui modelli linguistici di grandi dimensioni. Durante il processo di inferenza, l’input di riferimento a livello di scatola potrebbe non essere in grado di rilevare e rappresentare l’oggetto con precisione; ciò potrebbe risultare in una deviazione semantica, come dimostrato nell’immagine seguente.

Al contrario, utilizzare maschere fine-granulari invece di scatole di delimitazione grossolane come input di riferimento potrebbe rappresentare gli oggetti con maggiore precisione. Il modello SAM (Segment Anything Model) recentemente sviluppato, addestrato su miliardi di maschere di alta qualità, dimostra una notevole qualità di segmentazione su oggetti zero-shot e supporta l’utilizzo di punti o scatole di delimitazione semplici come prompt. Tuttavia, il framework SAM non può generare etichette semantiche primarie, né può fornire didascalie e attributi semantici dettagliati. Di conseguenza, i modelli esistenti mancano di informazioni multimodali fine-granulari innate e hanno una comprensione limitata delle scene nel mondo reale.

Per affrontare le sfide poste dai modelli MLLM esistenti, Osprey, un nuovo metodo di addestramento dell’istruzione testo-maschera, mira a estendere le capacità dei modelli linguistici multimodali per la comprensione fine-granulare a livello di pixel. Il framework Osprey introduce un estrattore visivo consapevole di maschere che cattura caratteristiche visive di maschere con granularità variabile con precisione. Il framework quindi intreccia le caratteristiche visive con le istruzioni linguistiche per generare la sequenza di input per il modello linguistico di grandi dimensioni e sfrutta l’architettura CLIP basata su CNN per facilitare l’utilizzo di input ad alta risoluzione. Grazie al suo design e alla sua architettura, il framework Osprey è in grado di raggiungere una comprensione semantica fine-granulare per regioni a livello di oggetto e di parte, e fornisce attributi di oggetto dettagliati insieme alla categoria di oggetto primaria e a descrizioni migliorate di scene complesse.

Sfruttando le capacità dell’addestramento dell’istruzione visiva, il framework Osprey consente nuove capacità al di là della comprensione a livello di immagine e di scatola delle scene, poiché il framework Osprey può generare semantica fine-granulare utilizzando maschere class-agnostiche da SAM pronte all’uso. Inoltre, Osprey mostra capacità notevoli in vari compiti, tra cui classificazione di oggetti di riferimento, riconoscimento a vocabolario aperto, didascalia a livello di regione e descrizione di regioni dettagliata.

Osprey: Metodologia e Architettura

La figura seguente mostra la panoramica dell’architettura del framework Osprey, che consiste in un modello linguistico di grandi dimensioni, un estrattore visivo consapevole di maschere a livello di pixel e un encodatore visivo a livello di immagine.

Per un’immagine data, il framework esegue la conversione e la tokenizzazione per generare le incapsulazioni prima di inviare le sequenze di incapsulazioni linguistiche e le caratteristiche di maschera intrecciate al modello linguistico di grandi dimensioni per ottenere comprensioni semantiche fine-granulari.

Encodatore visivo CLIP basato su CNN

L’encodatore visivo utilizzato nella maggior parte dei modelli linguistici multimodali è rappresentato da un modello CLIP basato su ViT. Di conseguenza, il framework adotta una risoluzione di immagine di 224×224 pixel o 336 x 336 pixel. Tuttavia, l’utilizzo del modello CLIP basato su ViT rende difficile per il modello raggiungere una comprensione fine-granulare delle rappresentazioni a livello di pixel, un problema amplificato ulteriormente in piccole regioni. Inoltre, il sovraccarico computazionale associato all’architettura ViT ostacola la possibilità di aumentare la risoluzione dell’immagine di input.

Per affrontare la sfida, il framework Osprey implementa un modello CLIP basato su CNN come encodatore visivo nella sua architettura. Tradizionalmente, i modelli CLIP basati su CNN hanno dimostrato notevoli capacità di generalizzazione across diverse risoluzioni di input rispetto ai modelli CLIP basati su trasformatori visivi. L’implementazione di un modello CLIP basato su CNN consente un’inferenza rapida e un addestramento efficiente senza compromettere le prestazioni del modello. Inoltre, un modello CLIP basato su CNN è in grado di generare mappe di caratteristiche multi-scala che il framework utilizza quindi direttamente per l’estrazione di caratteristiche in ogni regione di oggetto successiva.

Estrattore visivo consapevole di maschere

A differenza dei modelli basati su regioni esistenti che utilizzano scatole di delimitazione sparse come input di riferimento, il framework Osprey utilizza regioni di maschera dettagliate per implementare rappresentazioni basate su oggetti. Il modello Osprey impiega un componente di estrattore visivo consapevole di maschere per catturare caratteristiche visive a livello di pixel all’interno di ogni regione di oggetto.

Per implementare ciò, Osprey utilizza le caratteristiche di immagine a livello multipla generate dall’encodatore visivo per adottare l’operazione di pooling di maschera e, per ogni caratteristica a livello singolo, il framework esegue il pooling di tutte le caratteristiche che si trovano all’interno della regione di maschera. Il modello quindi codifica le caratteristiche attraverso diversi livelli passando ogni caratteristica attraverso un layer di proiezione lineare che genera incapsulazioni a livello di regione e fonde caratteristiche multi-livello eseguendo una sommazione. Il modello utilizza quindi un layer MLP per produrre il token di maschera visiva. Inoltre, Osprey preserva la geometria spaziale della regione di oggetto codificando la relazione di posizione a livello di pixel implementando una maschera binaria per ogni regione di oggetto. Infine, Osprey include il token di maschera visiva e i suoi token spaziali rispettivi per ogni incapsulamento di regione di maschera.

Tokenizzazione LLM

Come menzionato in precedenza, il modello estrae le incapsulazioni di immagine a livello di immagine inviando l’immagine a un encodatore visivo pre-addestrato basato su CNN. Per le informazioni testuali, il modello utilizza prima i tokenizzatori LLM pre-addestrati per tokenizzare le sequenze di testo e quindi proietta queste sequenze di testo tokenizzate in incapsulazioni di testo. Per le regioni basate su maschere, il modello definisce un token speciale come segnaposto e quindi lo sostituisce con un token spaziale insieme a un token di maschera. Quando il modello si riferisce a una regione di oggetto nel testo di input, aggiunge il segnaposto dopo il nome della regione, consentendo alle regioni di maschera di mescolarsi con il testo in modo da formare frasi complete senza spazi di tokenizzazione. Inoltre, oltre alle istruzioni dell’utente, il modello include anche un prompt di prefisso, un token speciale che serve come segnaposto, che viene quindi sostituito dalle incapsulazioni di immagine a livello di immagine dell’encodatore visivo. Infine, il framework intreccia i token visivi a livello di regione e di immagine con i token di testo e li invia al modello linguistico di grandi dimensioni per comprendere le istruzioni dell’utente e l’immagine con diverse regioni nell’oggetto.

Osprey: Processo di addestramento a tre fasi

Il framework Osprey impiega un processo di addestramento a tre fasi, in cui ogni fase di addestramento è supervisionata minimizzando la perdita di previsione del token successivo.

Fase 1: Addestramento dell’allineamento immagine-testo

Nella prima fase, il framework Osprey impiega l’encodatore visivo CLIP basato su CNN per addestrare le caratteristiche di immagine a livello di immagine e il connettore di linguaggio per addestrare il modello per l’allineamento delle caratteristiche di immagine e testo. Nella prima fase, il framework utilizza tre componenti: un modello linguistico di grandi dimensioni pre-addestrato, un encodatore visivo pre-addestrato e un proiettore di immagine a livello di immagine. Il framework adotta anche un layer MLP per servire come connettore visivo-linguistico che aiuta a migliorare le capacità generative multimodali di Osprey.

Fase 2: Pre-addestramento dell’allineamento testo-maschera

Nella seconda fase, Osprey carica i pesi addestrati nella prima fase e impiega il componente di estrattore visivo consapevole di maschere per catturare caratteristiche di regioni a livello di pixel. Nella seconda fase, il framework addestra solo l’estrattore visivo consapevole di maschere per allineare le incapsulazioni linguistiche con le caratteristiche di regioni basate su maschere. Inoltre, il modello raccoglie coppie di maschere a livello di pixel e testi brevi da set di dati a livello di parte e di oggetto pubblicamente disponibili e li converte in dati di addestramento per seguire le istruzioni.

Fase 3: Ritocco fine a livello di fine

Nella terza e ultima fase, il modello fissa i pesi dell’encodatore visivo e ritocca il modello linguistico di grandi dimensioni, l’estrattore di caratteristiche di regioni basate su maschere e il proiettore di immagine a livello di immagine nella sua architettura. L’obiettivo principale dell’addestramento nella terza fase è estendere la capacità del modello di seguire le istruzioni dell’utente con precisione e di eseguire compiti di comprensione di regioni a livello di pixel in modo efficiente.

Dopo aver implementato le tre fasi di addestramento, il framework Osprey è in grado di comprendere scenari complessi definiti dalle istruzioni dell’utente e basati su regioni di maschera a livello di pixel.

Osprey: Risultati sperimentali

Per valutare le sue prestazioni, gli sviluppatori di Osprey conducono una vasta gamma di esperimenti per dimostrare le capacità del modello nella classificazione, nel riconoscimento di regioni a livello di pixel e nelle descrizioni complesse.

Segmentazione a vocabolario aperto

L’obiettivo principale della segmentazione a vocabolario aperto è generare il riconoscimento di regioni basate su maschere e la loro categoria rispettiva in modo esplicito. Per raggiungere la segmentazione a vocabolario aperto, Osprey utilizza prima un prompt di testo di input, seguito dal modello che adotta regioni di maschera di ground-truth per la interferenza del modello per valutare le prestazioni del modello nei compiti di riconoscimento a vocabolario aperto. Sulla base della risposta generata dal modello linguistico multimodale, Osprey calcola la similarità semantica tra l’elenco di vocabolario e l’output di ogni set di dati. La figura seguente confronta Osprey con i modelli linguistici multimodali attuali.

Come si può osservare, il framework Osprey supera i metodi esistenti di un margine considerevole sia nel set di dati Cityscapes che in quello ADE20K-150. I risultati indicano la capacità di Osprey di superare gli approcci esistenti e di raggiungere una comprensione robusta e un riconoscimento di regioni fine-granulari di oggetti.

Classificazione di oggetti di riferimento

Nel compito di classificazione di oggetti di riferimento, il modello deve classificare l’oggetto all’interno di una regione specifica di un’immagine. Per valutare le sue capacità di classificazione, il framework Osprey utilizza due metriche di rilevanza semantica, tra cui IoU semantico (S-IoU) e similarità semantica (SS). L’IoU semantico rappresenta l’overlap di parole tra le etichette di ground-truth e di previsione, mentre la similarità semantica misura la similarità tra le etichette previste e di ground-truth in uno spazio semantico. La figura seguente dimostra le prestazioni di Osprey nel compito di classificazione di oggetti di riferimento quando confrontato con modelli che utilizzano approcci a livello di scatola e di immagine.

Descrizione di regioni dettagliata

Nel compito di descrizione di regioni dettagliata, il modello valuta le sue capacità di descrizione dettagliata seguendo le istruzioni e confronta le sue prestazioni con altri approcci a livello di regione. Il modello seleziona casualmente un prompt di inferenza di input da un elenco di prompt predefiniti e sfrutta il framework LLM GPT-4 per misurare la qualità della risposta generata dal modello rispetto alle regioni di riferimento in modo completo. Utilizzando il pipeline di generazione di istruzioni, il modello genera domande e cerca risposte da GPT-4, dopo di che il modello LLM valuta la correttezza della semantica e la precisione della comprensione di riferimento. La tabella seguente dimostra le prestazioni di Osprey rispetto ai modelli attuali negli compiti di descrizione di regioni dettagliata.

Didascalia a livello di regione

Il framework Osprey supera anche gli approcci attuali nel compito di didascalia a livello di regione, con i risultati contenuti nella figura seguente.

Pensieri finali

In questo articolo, abbiamo discusso di Osprey, un metodo di addestramento dell’istruzione testo-maschera con l’obiettivo principale di estendere le capacità dei modelli linguistici multimodali per la comprensione fine-granulare a livello di pixel. Per raggiungere il suo obiettivo, il framework Osprey cura un set di dati di regioni-testo basate su maschere con oltre 700.000 campioni e inietta la rappresentazione a livello di pixel nei modelli linguistici di grandi dimensioni per progettare un modello visivo-linguistico. Il framework Osprey mira a migliorare notevolmente le capacità dei modelli linguistici multimodali per la comprensione visiva fine-granulare e, implementando un modello CLIP basato su CNN e un estrattore visivo consapevole di maschere, Osprey raggiunge la capacità di comprendere le immagini a livelli di parte e di oggetto.

Kunal Kejriwal è un ingegnere backend specializzato in Python, PostgreSQL, Redis e infrastrutture cloud su GCP e AWS. Con tre anni di esperienza nella costruzione e nella scalabilità di sistemi di produzione, scrive di infrastruttura AI, sistemi distribuiti e dell'architettura alla base del deployment di workload di machine learning.