Modely a platformy AI

Odhalení SAM 2: Meta nový open-source foundation model pro reálnou segmentaci objektů v obrazech a videích

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V posledních letech jsme ve světě umělé inteligence zaznamenali pozoruhodný pokrok v oblasti základních AI modelů pro zpracování textu, které transformovaly odvětví od zákaznické podpory až po právní analýzu. Avšak co se týče zpracování obrazů, jsme teprve na počátku. Komplexnost vizuálních dat a obtíže spojené s výcvikem modelů pro přesnou interpretaci a analýzu obrazů představují významné překážky. Zatímco výzkumníci pokračují v prozkoumávání základních AI modelů pro obrazy a videa, budoucnost zpracování obrazů v AI slibuje inovace v oblasti zdravotnictví, autonomních vozidel a dalších odvětvích.

Segmentace objektů, která zahrnuje určení přesných pixelů v obraze, které odpovídají objektu zájmu, je kritickou úlohou v počítačovém vidění. Tradicionálně to vyžadovalo vytvoření specializovaných AI modelů, které vyžadují rozsáhlou infrastrukturu a velké množství anotovaných dat. Loňský rok Meta představila Segment Anything Model (SAM), základní AI model, který zjednodušuje tento proces tím, že umožňuje uživatelům segmentovat obrazy pomocí jednoduchého podnětu. Tato inovace snížila potřebu specializované odbornosti a rozsáhlých výpočetních zdrojů, čímž se zpracování obrazů stalo přístupnějším.

Nyní Meta jde ještě dále se SAM 2. Tato nová iterace nejenom vylepšuje stávající schopnosti SAM při segmentaci obrazů, ale také rozšiřuje je na zpracování videa. SAM 2 může segmentovat libovolný objekt v obrazech i videích, dokonce i ty, které belum setkal dříve. Tento pokrok je skokem vpřed v oblasti počítačového vidění a zpracování obrazů, poskytující více univerzální a výkonný nástroj pro analýzu vizuálního obsahu. Níže prozkoumáme zajímavé pokroky SAM 2 a jeho potenciál transformovat různá odvětví.

Představení Segment Anything Model (SAM)

Tradiční metody segmentace vyžadují ruční úpravy, známé jako interaktivní segmentace, nebo rozsáhlá anotovaná data pro automatickou segmentaci do předem definovaných kategorií. SAM je základní AI model, který podporuje interaktivní segmentaci pomocí univerzálních podnětů, jako jsou kliknutí, rámečky nebo textové vstupy. Může být také jemně naladěn s minimálními daty a výpočetními zdroji pro automatickou segmentaci. Trénován na více než 1 miliardě různých obrazových anotací, SAM může zpracovat nové objekty a obrazy bez potřeby vlastních datových sbírek nebo jemného naladění.

SAM funguje se dvěma hlavními komponenty: obrazovým kodérem, který zpracovává obraz, a podnětem kodérem, který zpracovává vstupy, jako jsou kliknutí nebo text. Tyto komponenty se spojují s lehkým dekodérem, aby předpověděly segmentační masky. Jakmile je obraz zpracován, SAM může vytvořit segment za pouhých 50 milisekund v prohlížeči, čímž se stává výkonným nástrojem pro reálné, interaktivní úkoly. Pro vytvoření SAM, výzkumníci vyvinuli tříkrokový proces sběru dat: model-pomocná anotace, kombinace automatické a asistované anotace a plně automatické vytváření masek. Tento proces vedl k SA-1B datasetu, který zahrnuje více než 1,1 miliardy masek na 11 milionech licencovaných, soukromých obrazů – což je 400krát větší než jakýkoli existující dataset. SAMova působivá výkonnost pochází z tohoto rozsáhlého a rozmanitého datasetu, zajišťující lepší reprezentaci napříč různými geografickými regiony ve srovnání s předchozími datovými sadami.

Představení SAM 2: Skok z obrazové na videosegmentaci

Vycházející ze SAMova základu, SAM 2 je navržen pro reálnou, podnětem ovládanou segmentaci objektů v obrazech i videích. Na rozdíl od SAM, který se zaměřuje pouze na statické obrazy, SAM 2 zpracovává videa tak, že považuje každý snímek za součást kontinuální sekvence. To umožňuje SAM 2 lépe zpracovat dynamické scény a měnící se obsah. Pro segmentaci obrazů SAM 2 nejenom vylepšuje SAMovy schopnosti, ale také funguje třikrát rychleji při interaktivních úkolech.

SAM 2 zachovává stejnou architekturu jako SAM, ale zavádí paměťový mechanismus pro zpracování videa. Tato funkce umožňuje SAM 2 sledovat informace z předchozích snímků, zajišťující konzistentní segmentaci objektů navzdory změnám v pohybu, osvětlení nebo zakrytí. Referencí na předchozí snímky, SAM 2 může upřesnit své předpovědi masek po celou dobu videa.

Model je trénován na nově vyvinutém datasetu, SA-V datasetu, který zahrnuje více než 600 000 masek na 51 000 videích z 47 zemí. Tento rozmanitý dataset pokrývá jak celé objekty, tak i jejich části, čímž se zvyšuje SAM 2ova přesnost ve skutečné videosegmentaci.

SAM 2 je dostupný jako open-source model pod licencí Apache 2.0, což z něj činí dostupný pro různé použití. Meta také sdílí dataset použitý pro SAM 2 pod licencí CC BY 4.0. Kromě toho existuje webová demonstrace, která umožňuje uživatelům prozkoumat model a vidět, jak funguje.

Potenciální použití

Schopnosti SAM 2 v reálné, podnětem ovládané segmentaci objektů v obrazech a videích odemkly řadu inovativních aplikací v různých oblastech. Některé z těchto aplikací jsou například:

  • Zdravotnické diagnostiky: SAM 2 může významně zlepšit reálnou chirurgickou asistenci segmentací anatomických struktur a identifikací anomálií během živých video přenosů v operačním sále. Může také vylepšit analýzu medicínských obrazů poskytováním přesné segmentace orgánů nebo nádorů v medicínských snímcích.
  • Autonomní vozidla: SAM 2 může vylepšit systémy autonomních vozidel zlepšením přesnosti detekce objektů prostřednictvím kontinuální segmentace a sledování chodců, vozidel a dopravních značek napříč video snímky. Jeho schopnost zpracovat dynamické scény také podporuje adaptivní navigaci a systémy prevence kolizí tím, že rozpoznává a reaguje na změny v prostředí v reálném čase.
  • Interaktivní média a zábava: SAM 2 může vylepšit aplikace rozšířené reality (AR) přesně segmentujícím objekty v reálném čase, což usnadňuje virtuálním prvkům sladit se s reálným světem. Také prospěje video editaci automatizací segmentace objektů ve filmech, což zjednodušuje procesy, jako je odstranění pozadí a nahrazení objektů.
  • Environmentální monitoring: SAM 2 může pomoci při sledování divoké zvěře segmentací a monitorováním zvířat ve video snímcích, podporujících výzkum druhů a habitatových studií. V případě reakce na katastrofy může vyhodnotit škody a vést úsilí o reakci tím, že přesně segmentuje postižené oblasti a objekty ve video přenosu.
  • Maloopt a e-commerce: SAM 2 může vylepšit vizualizaci produktů v e-commerce umožňujícím interaktivní segmentaci produktů v obrazech a videích. To může zákazníkům poskytnout možnost prohlížet si produkty z různých úhlů a kontextů. Pro inventarizaci pomáhá maloobchodníkům sledovat a segmentovat produkty na regálech v reálném čase, což usnadňuje inventarizaci a zlepšuje celkovou kontrolu zásob.

Překonání omezení SAM 2: Praktické řešení a budoucí vylepšení

Ačkoli SAM 2 funguje dobře s obrazech a krátkými videi, má některé omezení, která je třeba vzít v úvahu pro praktické použití. Může mít potíže se sledováním objektů přes významné změny perspektivy, dlouhá zakrytí nebo v přeplněných scénách, zejména ve prodloužených videích. Ruční korekce s interaktivními kliknutími může pomoci řešit tyto problémy.

V přeplněných prostředích se podobnými objekty, SAM 2 může občas nesprávně identifikovat cíle, ale další podněty v pozdějších snímcích mohou tento problém vyřešit. Ačkoli SAM 2 může segmentovat více objektů, jeho efektivita se snižuje, protože zpracovává každý objekt zvlášť. Budoucí aktualizace by mohly těžit z integrace sdílených kontextových informací, aby vylepšily výkon.

SAM 2 může také chybět jemné detaily s rychle se pohybujícími objekty a předpovědi mohou být nestabilní napříč snímky. Avšak další trénink by mohl tuto omezení řešit. Ačkoli automatická generace anotací se zlepšila, lidské anotátory jsou stále nezbytní pro kontrolu kvality a výběr snímků a další automatizace by mohla zlepšit efektivitu.

Závěrečné shrnutí

SAM 2 představuje významný skok vpřed v reálné segmentaci objektů pro obrazy i videa, vycházející z základu, který položil jeho předchůdce. Zlepšením schopností a rozšířením funkcí na dynamický video obsah, SAM 2 slibuje transformovat různá odvětví, od zdravotnictví a autonomních vozidel až po interaktivní média a maloobchod. Ačkoli existují výzvy, zejména při zpracování složitých a přeplněných scén, open-source povaha SAM 2 podporuje kontinuální zlepšování a adaptaci. S jeho výkonným výkonem a dostupností, SAM 2 je připraven pohánět inovace a rozšiřovat možnosti v počítačovém vidění a za jeho hranicemi.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.