Modelli e piattaforme di IA

Modello Segment Anything – La visione computerizzata riceve un enorme impulso

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La visione computerizzata (CV) ha raggiunto un’accuratezza del 99% rispetto al 50% in soli 10 anni. La tecnologia è destinata a migliorare ulteriormente a un livello senza precedenti con algoritmi moderni e tecniche di segmentazione delle immagini. Di recente, il laboratorio FAIR di Meta ha rilasciato il Modello Segment Anything (SAM) – un vero e proprio cambiamento nella segmentazione delle immagini. Questo modello avanzato può produrre maschere di oggetti dettagliate a partire da prompt di input, portando la visione computerizzata a nuove altezze. Potrebbe potenzialmente rivoluzionare il modo in cui interagiamo con la tecnologia digitale in questa era.

Esploriamo la segmentazione delle immagini e scopriamo brevemente come SAM influenzi la visione computerizzata.

Cosa è la segmentazione delle immagini e quali sono i suoi tipi?

La segmentazione delle immagini è un processo nella visione computerizzata che divide un’immagine in più regioni o segmenti, ognuno rappresentante un oggetto o un’area diversa dell’immagine. Questo approccio consente agli esperti di isolare specifiche parti di un’immagine per ottenere informazioni significative.

I modelli di segmentazione delle immagini sono addestrati per migliorare l’output riconoscendo dettagli importanti dell’immagine e riducendo la complessità. Questi algoritmi differenziano efficacemente tra diverse regioni di un’immagine in base a caratteristiche come colore, texture, contrasto, ombre e bordi.

Dividendo un’immagine, possiamo concentrare la nostra analisi sulle regioni di interesse per ottenere dettagli significativi. Di seguito sono elencate diverse tecniche di segmentazione delle immagini.

  • Segmentazione semantica comporta l’etichettatura dei pixel in classi semantiche.
  • Segmentazione di istanza va oltre rilevando e delineando ogni oggetto in un’immagine.
  • Segmentazione panottica assegna ID di istanza univoci ai pixel di oggetti individuali, risultando in un’etichettatura più completa e contestuale di tutti gli oggetti in un’immagine.

La segmentazione viene implementata utilizzando modelli di apprendimento profondo basati su immagini. Questi modelli recuperano tutti i punti di dati e le caratteristiche preziose dal set di addestramento. Quindi, trasformano questi dati in vettori e matrici per comprendere caratteristiche complesse. Alcuni dei modelli di apprendimento profondo più utilizzati per la segmentazione delle immagini sono:

  • Reti Neurali Convoluzionali (CNN)
  • Reti Neurali Fully Connected (FCN)
  • Reti Neurali Ricorrenti (RNN)

Come funziona la segmentazione delle immagini?

Nella visione computerizzata, la maggior parte dei modelli di segmentazione delle immagini consiste in una rete encoder-decoder. L’encoder codifica una rappresentazione dello spazio latente dei dati di input che il decoder decodifica per formare mappe di segmenti, o in altre parole, mappe che delineano la posizione di ogni oggetto nell’immagine.

Di solito, il processo di segmentazione consiste in 3 fasi:

  • Un encoder di immagine che trasforma l’immagine di input in un modello matematico (vettori e matrici) per l’elaborazione.
  • L’encoder aggrega i vettori a più livelli.
  • Un decoder di maschera veloce prende l’input delle immagini incorporate e produce una maschera che delinea gli oggetti diversi nell’immagine separatamente.

Lo stato della segmentazione delle immagini

A partire dal 2014, è emersa un’onda di algoritmi di segmentazione basati sull’apprendimento profondo, come CNN+CRF e FCN, che hanno fatto notevoli progressi nel campo. Nel 2015, si è assistito alla nascita di U-Net e Deconvolution Network, migliorando l’accuratezza dei risultati di segmentazione.

Quindi, nel 2016, Instance Aware Segmentation, V-Net e RefineNet hanno ulteriormente migliorato l’accuratezza e la velocità della segmentazione. Nel 2017, Mark-RCNN e FC-DenseNet hanno introdotto la rilevazione di oggetti e la previsione densa nei compiti di segmentazione.

Nel 2018, Panoptic Segmentation, Mask-Lab e Context Encoding Networks sono stati al centro dell’attenzione in quanto questi approcci hanno affrontato la necessità di segmentazione a livello di istanza. Nel 2019, Panoptic FPN, HRNet e Criss-Cross Attention hanno introdotto nuovi approcci per la segmentazione a livello di istanza.

Nel 2020, la tendenza è continuata con l’introduzione di Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS e Efficient Net + NAS-FPN. Infine, nel 2023, abbiamo SAM, che discuteremo nel prossimo paragrafo.

Modello Segment Anything (SAM) – Segmentazione delle immagini a scopo generale

Il Modello Segment Anything (SAM) è un nuovo approccio che può eseguire compiti di segmentazione interattivi e automatici in un unico modello. In precedenza, la segmentazione interattiva consentiva la segmentazione di qualsiasi classe di oggetti, ma richiedeva una persona per guidare il metodo raffinando iterativamente una maschera.

La segmentazione automatica in SAM consente la segmentazione di categorie di oggetti specifiche definite in anticipo. La sua interfaccia promozionale la rende altamente flessibile. Di conseguenza, SAM può affrontare una vasta gamma di compiti di segmentazione utilizzando un prompt adatto, come clic, caselle, testo e altro.

SAM è stato addestrato su un set di dati diversificato e ricco di oltre 1 miliardo di maschere, rendendolo possibile riconoscere nuovi oggetti e immagini non disponibili nel set di addestramento. Questo moderno framework rivoluzionerà ampiamente i modelli CV nelle applicazioni come auto a guida autonoma, sicurezza e realtà aumentata.

SAM può rilevare e segmentare gli oggetti intorno all’auto nelle auto a guida autonoma, come altri veicoli, pedoni e segnali stradali. Nella realtà aumentata, SAM può segmentare l’ambiente del mondo reale per posizionare oggetti virtuali in posizioni appropriate, creando un’esperienza utente più realistica e coinvolgente.

Sfide della segmentazione delle immagini nel 2023

La crescente ricerca e sviluppo nella segmentazione delle immagini portano anche sfide significative. Alcune delle principali sfide della segmentazione delle immagini nel 2023 includono:

  • La crescente complessità dei set di dati, in particolare per la segmentazione delle immagini 3D
  • Lo sviluppo di modelli profondi interpretabili
  • L’uso di modelli di apprendimento non supervisionato che minimizzano l’intervento umano
  • La necessità di modelli efficienti in termini di tempo di esecuzione e memoria
  • L’eliminazione degli ostacoli della segmentazione dei punti cloud 3D

Il futuro della visione computerizzata

Il mercato globale della visione computerizzata ha un impatto su più settori e si prevede che raggiungerà oltre $41 miliardi entro il 2030. Le moderne tecniche di segmentazione delle immagini come il Modello Segment Anything, abbinato ad altri algoritmi di apprendimento profondo, rafforzeranno ulteriormente la struttura della visione computerizzata nel paesaggio digitale. Pertanto, vedremo modelli di visione computerizzata più robusti e applicazioni intelligenti nel futuro.

Per saperne di più sull’AI e sull’apprendimento automatico, esplora Unite.ai – la tua soluzione unica per tutte le domande sulla tecnologia e sul suo stato moderno.

Haziqa è uno scienziato dei dati con una vasta esperienza nella scrittura di contenuti tecnici per aziende di intelligenza artificiale e SaaS.