Modele și platforme AI

Prezentarea SAM 2: Noul model de bază open-source Meta pentru segmentarea obiectelor în timp real în videouri și imagini

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În ultimii ani, lumea inteligenței artificiale a cunoscut progrese remarcabile în dezvoltarea modelelor de bază pentru prelucrarea textului, cu realizări care au transformat industrii de la servicii clienți la analiza juridică. Cu toate acestea, atunci când vine vorba de prelucrarea imaginilor, abia începem să atingem suprafața. Complexitatea datelor vizuale și provocările de a antrena modele pentru a interpreta și analiza cu acuratețe imaginile au prezentat obstacole semnificative. Pe măsură ce cercetătorii continuă să exploreze modelele de bază pentru imagini și videouri, viitorul prelucrării imaginilor în inteligența artificială are potențialul de a inova în domenii precum sănătate, vehicule autonome și dincolo de acestea.

Segmentarea obiectelor, care implică identificarea exactă a pixelilor dintr-o imagine care corespund unui obiect de interes, este o sarcină critică în viziunea computerizată. În mod tradițional, acest lucru a implicat crearea de modele AI specializate, ceea ce necesită infrastructură extinsă și cantități mari de date annotate. Anul trecut, Meta a introdus Modelul de segmentare orice (SAM), un model de bază care simplifică acest proces, permițând utilizatorilor să segmenteze imagini cu o simplă comandă. Această inovație a redus nevoia de expertiză specializată și resurse de calcul extinse, făcând segmentarea imaginilor mai accesibilă.

Acum, Meta merge mai departe cu SAM 2. Această nouă iterație nu numai că îmbunătățește capacitățile existente de segmentare a imaginilor SAM, dar extinde și funcționalitatea la procesarea videourilor. SAM 2 poate segmenta orice obiect în imagini și videouri, chiar și cele pe care nu le-a întâlnit anterior. Această realizare reprezintă un salt înainte în domeniul viziunii computerizate și al prelucrării imaginilor, oferind un instrument mai versatil și mai puternic pentru analizarea conținutului vizual. Mai jos, explorăm realizările excitante ale SAM 2 și potențialul său de a redefini domenii precum sănătate, vehicule autonome și dincolo de acestea.

Prezentarea Modelului de segmentare orice (SAM)

Metodele tradiționale de segmentare necesită fie refacerea manuală, cunoscută sub numele de segmentare interactivă, fie date extinse annotate pentru segmentarea automată în categorii predefinite. SAM este un model de bază care susține segmentarea interactivă utilizând comenzi versatile precum clicuri, cutii sau intrări de text. De asemenea, poate fi ajustat cu date și resurse de calcul minime pentru segmentarea automată. Antrenat pe peste 1 miliard de annotări de imagini diverse, SAM poate gestiona obiecte și imagini noi fără a necesita colectarea de date personalizate sau ajustare.

SAM funcționează cu două componente principale: un codificator de imagine care prelucrează imaginea și un codificator de comandă care gestionează intrări precum clicuri sau text. Aceste componente se reunesc cu un decodificator ușor pentru a prezice măști de segmentare. Odată ce imaginea este prelucrată, SAM poate crea un segment în doar 50 de milisecunde într-un browser web, făcându-l un instrument puternic pentru sarcini interactive în timp real. Pentru a construi SAM, cercetătorii au dezvoltat un proces de colectare a datelor în trei etape: annotare asistată de model, o combinație de annotare automată și asistată, și crearea automată a măștilor. Acest proces a rezultat în setul de date SA-1B, care include peste 1,1 miliarde de măști pe 11 milioane de imagini licențiate, protejate și cu respectarea vieții private—fiind de 400 de ori mai mare decât orice set de date existent. Performanța remarcabilă a SAM provine din acest set de date extins și divers, asigurând o reprezentare mai bună în diferite regiuni geografice în comparație cu seturile de date anterioare.

Prezentarea SAM 2: Un salt de la segmentarea imaginilor la segmentarea videourilor

Construit pe baza SAM, SAM 2 este proiectat pentru segmentarea obiectelor în timp real, promptabilă, în imagini și videouri. În contrast cu SAM, care se concentrează exclusiv pe imagini statice, SAM 2 prelucrează videouri prin tratarea fiecărui cadru ca parte a unei secvențe continue. Acest lucru îi permite lui SAM 2 să gestioneze scene dinamice și conținut în schimbare mai eficient. Pentru segmentarea imaginilor, SAM 2 nu numai că îmbunătățește capacitățile SAM, dar funcționează și de trei ori mai rapid în sarcini interactive.

SAM 2 păstrează aceeași arhitectură ca și SAM, dar introduce un mecanism de memorie pentru procesarea videourilor. Această funcție permite lui SAM 2 să țină evidența informațiilor din cadrele anterioare, asigurând o segmentare consistentă a obiectelor în ciuda schimbărilor de mișcare, iluminare sau acoperire. Prin referința la cadrele anterioare, SAM 2 poate rafina predicțiile sale de mască pe tot parcursul videoului.

Modelul este antrenat pe un set de date nou dezvoltat, setul de date SA-V, care include peste 600.000 de annotări de masklet pe 51.000 de videouri din 47 de țări. Acest set de date divers acoperă atât obiecte întregi, cât și părți ale lor, îmbunătățind acuratețea SAM 2 în segmentarea videourilor din lumea reală.

SAM 2 este disponibil ca model open-source sub licența Apache 2.0, făcându-l accesibil pentru diverse utilizări. Meta a partajat și setul de date utilizat pentru SAM 2 sub licența CC BY 4.0. În plus, există și o demonstrație web care permite utilizatorilor să exploreze modelul și să vadă cum funcționează.

Cazuri de utilizare posibile

Capacitățile SAM 2 în segmentarea obiectelor în timp real, promptabilă, pentru imagini și videouri, au deblocat numeroase aplicații inovatoare în diverse domenii. De exemplu, unele dintre aceste aplicații sunt:

  • Diagnostică medicală: SAM 2 poate îmbunătăți semnificativ asistența chirurgicală în timp real prin segmentarea structurilor anatomice și identificarea anomaliilor în fluxurile video live din sala de operație. De asemenea, poate îmbunătăți analiza imaginilor medicale prin furnizarea unei segmentări precise a organelor sau tumorilor în scanări medicale.
  • Vehicule autonome: SAM 2 poate îmbunătăți sistemele de vehicule autonome prin îmbunătățirea acurateței detectării obiectelor prin segmentarea și urmărirea continuă a pietonilor, vehiculelor și semnelor de circulație pe cadre de videouri. Capacitatea sa de a gestiona scene dinamice sprijină, de asemenea, sistemele de navigare adaptivă și evitare a coliziunilor prin recunoașterea și răspunsul la schimbările de mediu în timp real.
  • Media interactivă și divertisment: SAM 2 poate îmbunătăți aplicațiile de realitate augmentată (AR) prin segmentarea precisă a obiectelor în timp real, făcându-le mai ușor de integrat cu lumea reală. De asemenea, beneficiază editarea videourilor prin automatizarea segmentării obiectelor în filmări, simplificând procese precum eliminarea fundalului și înlocuirea obiectelor.
  • Monitorizarea mediului: SAM 2 poate asista la urmărirea vieții sălbatice prin segmentarea și monitorizarea animalelor în filmări video, sprijinind cercetarea speciilor și studiile de habitat. În răspunsul la dezastre, poate evalua daunele și ghida eforturile de răspuns prin segmentarea precisă a zonelor și obiectelor afectate în fluxurile video.
  • Comerț și comerț electronic: SAM 2 poate îmbunătăți vizualizarea produselor în comerțul electronic prin activarea segmentării interactive a produselor în imagini și videouri. Acest lucru poate oferi clienților capacitatea de a vizualiza articole din diverse unghiuri și contexte. Pentru gestionarea stocurilor, ajută retailerii să urmărească și să segmenteze produsele de pe rafturi în timp real, simplificând inventarierea și îmbunătățind controlul general al stocurilor.

Depășirea limitărilor SAM 2: Soluții practice și îmbunătățiri viitoare

Deși SAM 2 funcționează bine cu imagini și videouri scurte, are anumite limitări care trebuie luate în considerare pentru utilizarea practică. Poate avea dificultăți în urmărirea obiectelor prin schimbări semnificative de perspectivă, ocultări lungi sau în scene aglomerate, în special în videouri extinse. Corecțiile manuale cu clicuri interactivi pot ajuta la abordarea acestor probleme.

În medii aglomerate cu obiecte care arată similar, SAM 2 ar putea, ocazional, să identifice greșit țintele, dar comenzi suplimentare în cadre ulterioare pot rezolva această problemă. Deși SAM 2 poate segmenta multiple obiecte, eficiența scade deoarece procesează fiecare obiect separat. Actualizări viitoare ar putea beneficia de integrarea informațiilor contextuale partajate pentru a îmbunătăți performanța.

SAM 2 poate, de asemenea, să omită detalii fine cu obiecte care se mișcă rapid, iar predicțiile pot fi instabile pe cadre. Cu toate acestea, o antrenare suplimentară ar putea aborda această limitare. Deși generarea automată a annotărilor s-a îmbunătățit, annotatorii umani sunt încă necesari pentru verificarea calității și selectarea cadrului, iar o automatizare suplimentară ar putea îmbunătăți eficiența.

Concluzia

SAM 2 reprezintă un salt semnificativ înainte în segmentarea obiectelor în timp real, atât pentru imagini, cât și pentru videouri, construind pe baza pusă de predecesorul său. Prin îmbunătățirea capacităților și extinderea funcționalității la conținutul video dinamic, SAM 2 promite să transforme o varietate de domenii, de la sănătate și vehicule autonome la media interactivă și comerț. Deși există încă provocări, în special în gestionarea scenelor complexe și aglomerate, natura open-source a SAM 2 încurajează îmbunătățirea și adaptarea continuă. Cu performanța sa puternică și accesibilitate, SAM 2 este pregătit să conducă inovația și să extindă posibilitățile în viziunea computerizată și dincolo.

Dr. Tehseen Zia este un profesor asociat titular la Universitatea COMSATS Islamabad, deținând un doctorat în IA de la Universitatea Tehnică din Viena, Austria. Specializându-se în Inteligență Artificială, Învățare Automată, Știință a Datelor și Viziune Computațională, el a făcut contribuții semnificative cu publicații în reviste științifice reputate. Dr. Tehseen a condus, de asemenea, diverse proiecte industriale ca Investigator Principal și a servit ca Consultant IA.