Modely a platformy AI

TinySAM : Efektivní Segment Anything Model

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Segmentace objektů je základním a kriticky důležitým oborem v moderní počítačové vidění. Hraje zásadní roli v aplikacích, které vyžadují rozsáhlé vizuální komponenty, jako je lokalizace a identifikace objektů, a vyžaduje reálnou, rychlou a přesnou segmentaci. Tato důležitost učinila segmentaci objektů stále žhavým výzkumným tématem, s významnou prací provedenou v oblastech, jako je instance segmentace, semantická segmentace a panoptická segmentace.

S vývojem segmentace objektů se objevil Segment Anything Model (SAM) jako pozoruhodný nástroj, který prokázal vynikající segmentační schopnosti a rychle se stal široce používán v různých aplikacích počítačového vidění. Rámcové použití předem trénovaného SAM architektury dosáhlo působivého výkonu v downstream vizuálních úkolech. Nicméně, navzdory jeho schopnostem a vysoké přesnosti v segmentačních úkolech, komplexní a těžká architektura SAM vyžaduje podstatnou výpočetní sílu, bránící jeho implementaci na zařízeních s omezenými zdroji.

Řešením výpočetních problémů SAM, výzkumníci vyvinuli Tiny Segment Anything Model (TinySAM), který zachovává nulovou-shot performanci původního rámcového systému, zatímco je lehčí. TinySAM používá plnoetapovou metodu znalostní destilace s online tvrdými podněty pro vytvoření efektivnějšího studentního modelu. Post-tréninková kvantizace přizpůsobená úkolům segmentace dále snižuje výpočetní potřeby. Kromě toho, design TinySAM cílí na hierarchickou segmentaci, která téměř zdvojnásobuje rychlost inference bez ohrožení výkonu.

Tento článek se zabývá rámcem TinySAM, zkoumajícím jeho základní principy, architekturu a výkon ve srovnání s jinými špičkovými segmentačními rámcovými systémy. Podívejme se na tyto aspekty podrobněji.

TinySAM : Efektivní Segment Anything Model

Segment Anything Model pomohl v rychlém pokroku několika aplikací počítačového vidění díky svým vynikajícím segmentačním schopnostem spojeným s masivním segmentačním datasetem, který obsahuje více než 11 milionů obrázků a více než miliardu obrázkových masek. Díky své výjimečné výkonnosti v úkolech segmentace objektů s libovolnými kategoriemi a tvary, slouží jako základ pro rámcové systémy, které provádějí downstream úkoly, jako je inpainting obrázků, sledování objektů, 3D vidění a další. Kromě toho, Segment Anything Model nabízí také pozoruhodné nulové segmentační výkony, které prospěly citlivým odvětvím, která pracují s omezeným množstvím dat, včetně lékařského výzkumu a lékařské zobrazovací techniky.

Ačkoli nelze zpochybnit vynikající segmentační schopnosti Segment Anything Modelu v široké škále downstream vizuálních úkolů, má své nevýhody v podobě komplexní architektonické zátěže, vysoké výpočetní náročnosti a významných provozních nákladů. Pro systém běžící na moderním GPU, může být doba inference SAM modelu až 2 sekundy pro 1024×1024 obrázek. V důsledku toho, je velmi obtížné implementovat SAM aplikace na zařízeních s omezenými zdroji. Aby se tento problém překonal, recentní práce, jako je MobileSAM a FastSAM, se pokusily vyvinout SAM model s vyšší výpočetní efektivitou. Rámcový systém MobileSAM se pokusil nahradit těžkou komponentu v obrazovém kódéru architekturou TinyViT, zatímco model FastSAM přenesl segmentační úkol na instanci segmentace s pouze jednou kategorií s modelem YoloV8. Ačkoli tyto metody dosáhly jistého úspěchu v snížení výpočetních požadavků, nemohly zachovat výkon, zejména na nulových downstream úkolech.

TinySAM nebo Tiny Segment Anything Model je pokus o snížení výpočetní náročnosti současného SAM modelu bez ohrožení výkonu v nulových downstream úkolech. Kromě toho, rámcový systém TinySAM navrhuje implementovat plnoetapovou metodu znalostní destilace ve své architektuře s cílem zlepšit schopnost kompaktního studentního sítě. Rámcový systém TinySAM destiluje studentskou síť způsobem od konce do konce pod dohledem učitelské sítě z různých etap. Pro další zlepšení výkonu, rámcový systém umožňuje destilační procesu věnovat více pozornosti tvrdým příkladům implementací dodatečné online tvrdé podněty vzorkovací strategie. Kromě toho, pro další snížení výpočetních nákladů, rámcový systém TinySAM vystavuje úkol segmentace post-tréninkové kvantizaci.

Hlavní část výpočetní náročnosti Segment Anything Modelu je způsobena tím, že model generuje masivní masky z bodových podnětů pro segmentaci všeho v obrázku. Aby se snížila výpočetní náročnost této segmentační strategie, rámcový systém TinySAM používá hierarchickou segmentační strategii, která téměř zdvojnásobuje rychlost inference bez ohrožení výkonu. S těmito metodami implementovanými ve své architektuře, rámcový systém TinySAM nabízí významné snížení výpočetních požadavků a stanovuje nové limity pro efektivní segmentační úkoly.

TinySAM : Architektura a Metodologie

Než budeme diskutovat o architektuře a metodologii rámcového systému TinySAM, je důležité se nejprve podívat na jeho předchůdce, rámcový systém SAM. Od svého zavedení, Segment Anything Model prokázal vynikající výkon, flexibilitu a generalizační schopnosti v široké škále downstream vizuálních a segmentačních úkolů.

V jádru, SAM model se skládá ze tří sub-sítí: podnětu kódéru, obrazového kódéru a masky dekodéru. Hlavním cílem podnětu kódéru je zakódovat libovolné tvarové masky, vstupní body a boxy a volné texty s pozicionální informací. Obrazový kódér je těžká síť založená na Vision Transformer, která extrahuje vstupní obrázek do embeddings. Model používá různé sítě pro zpracování geometrických a textových podnětů. Nakonec, maska dekodér obsahuje dvoucestný transformer, který přijímá výstup podnětu a obrazového kódéru pro generování konečné masky predikce. S datasetem, rámcový systém SAM prokázal vynikající segmentační schopnosti pro objekty bez ohledu na jejich tvar a kategorii. Kromě toho, Segment Anything Model prokázal vynikající výkon a efektivitu v nulových downstream vizuálních úkolech, včetně objektové propozice, hranové detekce, text-to-mask predikce a instance segmentace. Díky svým vynikajícím segmentačním schopnostem a flexibilním podnětem, rámcové systémy SAM tvoří základ pro vizuální aplikace. S tím řečeno, nelze ignorovat vysokou výpočetní náročnost tradiční SAM architektury s velkým množstvím parametrů, což činí téměř nemožné pro vývojáře nasadit SAM založené aplikace na zařízeních s omezenými zdroji.

Znalostní Destilace

Znalostní destilace je důležitým přístupem pro zlepšení výkonu kompaktních sítí během tréninkové fáze. Metoda znalostní destilace, která používá výstup učitelské sítě pro supervizi tréninku lehčí studentní sítě. Metoda znalostní destilace se může rozdělit na dvě subkategorie: destilace pro mezilehlé funkce a destilace pro síťové výstupy, s většinou výzkumných prací se zaměřením na úkoly klasifikace obrázků.

S tím řečeno, následující obrázek demonstruje obecnou architekturu rámcového systému TinySAM spolu s přehledem výkonu v nulových instance segmentačních úkolech.

V první etapě, rámcový systém TinySAM implementuje znalostní destilaci navrženou speciálně pro rámcový systém SAM, a pro aktivaci destilačního procesu dále, model používá online tvrdou podnětu vzorkovací strategii pro těžbu tvrdých znalostí ze studentní sítě z učitelské sítě. Ve druhé etapě, rámcový systém TinySAM přizpůsobuje post-tréninkovou kvantizaci úkolům segmentace a implementuje ji na lehčí studentní síti. Nakonec, model implementuje hierarchickou segmentační inferenční mód navržený pro segmentační úkoly, což téměř zdvojnásobuje rychlost inference s zanedbatelnou ztrátou přesnosti.

Plnoetapová Znalostní Destilace

Jak bylo zmíněno dříve, Segment Anything Model se skládá ze tří sub-sítí v jádru: podnětu kódéru, obrazového kódéru a masky dekodéru, s obrazovým kódérem složením založeným na Vision Transformer a vysokými výpočetními nároky. Aby se tento problém vyřešil, rámcový systém MobileSAM nahradil Vision Transformer TinyViT, nicméně substituce nebyla účinná vzhledem k významnému poklesu výkonu. Aby se zajistilo, že nebude žádný pokles výkonu, rámcový systém TinySAM implementuje plnoetapovou znalostní destilaci, která vede lehčí obrazový kódér od úrovně učení do mnohých znalostních úrovní. Kromě konvenční ztráty mezi ground-truth značkami a predikovanými výsledky, rámcový systém TinySAM zavádí několik destilačních ztrát během různých etap, jak je ukázáno v následujícím obrázku.

Kvantizace

Modelová kvantizace je populárním přístupem v rámcových systémech počítačového vidění a je používána pro kompresi modelu kvantizací váh nebo aktivací z vyšší na nižší šířku pásma v pokusu o snížení výpočetní složitosti a požadavků na úložiště bez významného ohrožení kvality výstupu.

Hlavním cílem kvantizace v TinySAM je projekce plovoucího bodu tensoru na bitový integer tensor pomocí měřítka s metrikou pro měření vzdálenosti mezi maticovou multiplikací a kvantizovanou maticí, která hraje vitální roli při optimalizaci měřítka.

Hierarchická Segmentace

Segment Anything Model navrhuje použití automatického generátoru masek, který vzorkuje body jako mřížku pro segmentaci všeho v obrázku. Nicméně, bylo naznačeno, že použití husté bodové mřížky vede k příliš jemné segmentační výstupu a proces vyžaduje masivní výpočetní nároky a incuruje vysoké provozní náklady. Kromě toho, na jedné straně, příliš mnoho vzorkovacích bodů pro kompletní objekt může vést k tomu, že různé části objektu budou segmentovány nesprávně jako samostatné masky, zatímco na druhé straně, časová náročnost everything módu inference je primárně způsobena tím, že obrazový kódér byl zmenšen významně. Aby se snížila provozní cena everything módu, rámcový systém TinySAM používá hierarchickou maskovací generační strategii, s rozdílem v strategii s původním rámcovým systémem SAM ukázáným v následujícím obrázku.

Odlišně od přístupu implementovaného v původním rámcovém systému SAM, model TinySAM používá pouze 25% bodů na každé straně, tím pádem využívá pouze 1/16 dostupných bodů v původním nastavení. Model pak inferuje masku dekodéru a podnětu kódéru s těmito podněty a získá výstup. Model pak filtrová některé masky s důvěrou přesahující určitou prahovou hodnotu a masky odpovídajících míst jako oblasti pro potenciální konečné predikce. Jelikož model považuje tyto oblasti za segmentační výsledek instancí s vysokou důvěrou, nemá potřebu generovat bodové podněty. Strategie nejen pomáhá v prevenci příliš jemné segmentace objektu, ale také pomáhá snižovat provozní náklady a výpočetní nároky významně. Rámcový systém pak slučuje a zpracovává výsledky těchto dvou kol, aby získal konečné masky.

TinySAM : Experimenty a Výsledky

Aby se urychlil destilační proces, rámcový systém TinySAM počítá a ukládá obrazové embeddings z učitelské sítě předem, v důsledku čehož již není nutné pro model počítat těžký obrazový kódér učitelské sítě opakovaně během tréninkové fáze. Pro post-tréninkovou kvantizaci, rámcový systém TinySAM kvantizuje všechny maticové násobné vrstvy, konvoluční vrstvy, dekonvoluční vrstvy a lineární vrstvy, s modelem používajícím kanálové měřítko pro konvoluční a dekonvoluční vrstvy. Pro maticové násobné vrstvy, model implementuje hlavové měřítko, zatímco pro lineární vrstvy, model implementuje lineární měřítko. Model také provádí hodnocení v nulových downstream úkolech.

Pro instance segmentační úkoly v nulovém nastavení, rámcový systém TinySAM následuje experimentální nastavení svého předchůdce, Segment Anything Model, a používá objektové detekční výsledky rámcového systému Vision Transformer Det-H nebo VitDet-H pro instance segmentaci. Jak je ukázáno v následujícím obrázku, rámcový systém TinySAM překonává existující metody v instance segmentační přesnosti a FLOPs skóre.

Kromě toho, kvalitativní výkon modelu TinySAM je ukázán v následujícím obrázku pro nulovou instance segmentaci se zelenou značkou reprezentující boxové podněty.

V termínech nulové bodové validace masek, model TinySAM překonává rámcový systém MobileSAM významně na různých datech a dodává podstatně lepší výsledky, když je menší počet bodů použit jako podněty rámcovým systémem.

Kromě toho, následující tabulka shrnuje výsledky urychlení a snížení výpočetních požadavků dosažených v důsledku hierarchického everything módu strategie. Model aplikuje stejnou stabilitu skóre a prahovou hodnotu s různými strategiemi pro spravedlivé srovnání, a výsledky jsou shrnuty níže.

Konečné Myšlenky

V tomto článku, jsme diskutovali o TinySAM, navrhovaném rámcovém systému, který tlačí hranice pro segmentaci libovolného úkolu a získává efektivní modelovou architekturu s menšími výpočetními nároky a přesností na úrovni původního rámcového systému SAM. TinySAM nebo Tiny Segment Anything Model, který zachovává a dodává nulovou-shot performanci původního rámcového systému. Rámcový systém TinySAM nejdříve implementuje plnoetapovou znalostní destilaci, která používá online tvrdé podněty pro destilaci lehčího studentního modelu. Rámcový systém TinySAM pak přizpůsobuje post-tréninkovou kvantizaci úkolům segmentace, což dále pomáhá snižovat výpočetní nároky. Kromě toho, rámcový systém také cílí na hierarchickou segmentaci, která téměř zdvojnásobuje rychlost inference bez ohrožení výkonu.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.