Základy AI

Co je počítačové vidění?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Počítačové vidění je oblast tvorby systémů, které získávají užitečné informace z obrázků a videa. Model vidění může klasifikovat celý obrázek, lokalizovat objekty, označovat každý pixel, číst text, odhadovat pózu, sledovat pohyb nebo spojovat vizuální obsah s jazykem.

Moderní systémy vidění neprovádějí jen jednoduchou reprodukci počátečního procesu detekce hran lidského vnímání. Učí se úlohově specifické reprezentace z dat, často pomocí konvolučních neuronových sítí, vision transformerů nebo multimodálních základních modelů.

Klíčové poznatky

  • Klasifikace, detekce, segmentace, OCR, sledování a generování jsou odlišné úlohy vidění.
  • CNN staví na lokálnosti a sdílení vah; vision transformery používají pozornost napříč obrazovými patchemi.
  • Štítky mohou pocházet od lidí, slabého dohledu, syntetických dat nebo samoudálených cílů.
  • Pouhá přesnost není dostačující: důležitá je robustnost, latence, soukromí, zaujatost a náklady na selhání.
One street scene illustrated as image classification, object detection, semantic segmentation, pose estimation, OCR, and tracking
Stejný obrázek podporuje různé výstupy počítačového vidění v závislosti na úloze.

Hlavní úlohy počítačového vidění

  • Klasifikace obrázku přiřazuje jeden nebo více štítků k obrázku. Viz jak funguje klasifikace obrázku.
  • Detekce objektů předpovídá kategorie a ohraničující rámečky pro více objektů.
  • Sémantická segmentace označuje každý pixel podle třídy, zatímco instance segmentace odděluje jednotlivé objekty.
  • Optické rozpoznávání znaků (OCR) detekuje a přepisuje text.
  • Odhad pózy předpovídá body těla nebo objektu.
  • Sledování spojuje detekce napříč snímky videa.
  • Generování a úprava obrázků vytváří nebo transformuje vizuální obsah, často pomocí difúzních modelů.

Jak se obrázky stávají vstupy modelu

Digitální obrázek je již numerickým datem: tenzorem obsahujícím hodnoty pixelů napříč prostorovými dimenzemi a kanály. Předzpracování může obrázek změnit velikost, normalizovat, oříznout nebo augmentovat. Video přidává časovou dimenzi, zatímco lékařské a vědecké zobrazování může přidat hloubku, vlnovou délku nebo jiné modality.

Klasické počítačové vidění používalo ručně navržené hrany, rohy a texturové rysy. Moderní hluboké modely obvykle učí rysy společně s úlohou, ačkoliv klasické metody zůstávají užitečné, když jsou data omezená, pravidla dobře pochopena nebo je potřeba minimální výpočet.

CNN a naučené lokální rysy

CNN aplikuje naučené jádra napříč lokálními sousedy. Počáteční vrstvy mohou reagovat na lokální vzory, zatímco pozdější bloky je kombinují do reprezentací relevantních pro úlohu. Pooling nebo operace se stride snižují prostorové rozlišení a reziduální spojení usnadňují optimalizaci hlubokých sítí.

Moderní klasifikátor CNN často používá globální pooling místo velkého zásobníku plně propojených vrstev. Detektory a segmentační sítě přidávají specializované hlavy nebo dekodérské cesty, které zachovávají prostorové informace.

Vision transformery a základní modely

Vision transformer rozděluje obrázek na patche, zakóduje je a pomocí pozornosti modeluje jejich vztahy. Transformery se mohou efektivně škálovat s velkými datovými sadami a předtrénováním, zatímco CNN často poskytují silnější vestavěné předpoklady a efektivitu při menších měřítcích.

Multimodální modely zarovnávají obrázky s textem, aby uživatelé mohli vyhledávat, popisovat, odpovídat na otázky nebo řídit segmentaci pomocí jazyka. Tyto modely rozšiřují možnosti, ale také zdědí slabiny z rozsáhlých webových dat, včetně stereotypů, chráněného materiálu a nerovnoměrného pokrytí populací a prostředí.

Štítky, samoudálení a syntetická data

Ohraničující rámečky, masky, body a popisky mohou být nákladné na vytvoření. Samoudálené učení odvozuje cíle přímo z obrázků, zatímco slabý dohled používá šum nebo nepřímé štítky. Syntetická data mohou přidat vzácné scénáře, ale mezery v simulaci mohou zabránit přenosu výkonu syntetických dat do reálného světa.

Kvalita anotací musí být měřena. Nejednoznačné štítky, nekonzistentní hranice a chybějící objekty nastavují strop výkonu a mohou skrývat selhání podskupin.

Jak se hodnotí systémy vidění

Klasifikace používá metriky jako přesnost, precision, recall, F1 a kalibraci. Detekce běžně používá intersection over union a mean average precision. Segmentace používá intersection over union nebo měření ve stylu Dice. Sledování přidává metriky identity a trajektorie.

Metrika musí odpovídat nasazení. Model může dosáhnout dobrých výsledků na kurátorském benchmarku a přesto selhat v dešti, při nízkém osvětlení, neobvyklých úhlech kamery, nových zařízeních nebo neznámých populacích. Hodnocení by mělo zahrnovat posun distribuce, adversariální podmínky a operační latenci.

Soukromí, zaujatost a nasazení

Tváře, poznávací značky, domy, lékařské snímky a videa z pracoviště mohou odhalovat citlivé informace. Sběr a uchovávání by měly vycházet z definovaného právního a etického základu, s kontrolou přístupu a minimalizací dat. Analýza tváří a biometrická identifikace vyžadují zvláštní pozornost, protože chyby a sledování mohou způsobovat nerovné škody.

Nasazení na okraji může snížit latenci a přenos dat. Edge AI, kvantizace, ořezávání a specializované akcelerátory mohou učinit systémy vidění praktickými na kamerách, vozidlech, robotech a mobilních zařízeních, ale komprese musí být přehodnocena z hlediska přesnosti a zaujatosti.

Od pixelů k vizuálním úlohám

Počítačové vidění převádí obrázky nebo video na výstupy úloh, jako jsou klasifikace, detekce, segmentace, sledování, póza, hloubka, optický tok nebo rozpoznávání textu. Definice úlohy určuje anotaci: štítek obrázku nemůže trénovat přesnou lokalizaci a ohraničující rámeček nemůže plně popsat segmentační masku. Geometrie kamery, objektivy, expozice, osvětlení, pohyb, komprese a úhel pohledu formují distribuci dat. Definujte provozní prostředí a důsledky chyb před výběrem modelu, protože sbírka benchmarkových obrázků nemusí reprezentovat nasazený senzor nebo scénu.

Pipeline dekóduje a orientuje média, mění jejich velikost nebo je rozděluje na dlaždice, normalizuje hodnoty, aplikuje augmentaci zachovávající štítky, spouští model a následně postprocessuje logity, rámečky, masky nebo stopy. Detektory objektů používají prahové hodnoty jistoty a potlačení; sledovače spojují detekce v čase; segmentace může vyžadovat morfologické čištění. Zachovejte transformační souřadnice, aby výstupy odpovídaly původnímu obrázku. Rozdělte data podle osoby, kamery, lokality nebo zachycovací relace, aby se téměř identické snímky neobjevily jak v trénovacím, tak v testovacím souboru.

Hodnocení, zaujatost, soukromí a provoz

Metriky musí odpovídat úloze a použití. Klasifikace potřebuje třídu‑specifickou přesnost a recall; detekce používá intersection‑over‑union a průměrnou přesnost napříč prahy; segmentace používá IoU nebo Dice; sledování přidává výměny identity; latence a doba trvání zmeškaných událostí jsou důležité pro video. Výsledky reportujte podle osvětlení, vzdálenosti, zařízení, zakrytí, odstínu pleti, věku a dalších relevantních podmínek. Kontrolujte kalibraci a chyby s vysokou jistotou. Syntetická nebo augmentovaná data mohou zaplnit mezery, ale vyžadují srovnání se skutečnými nasazovacími daty a nesmí uniknout testové scény.

Vidění může sbírat okolní osoby, lokality, biometrické údaje a citlivé chování. Minimalizujte zachycení a uchovávání, zabezpečte streamy, omezte sekundární použití a tam, kde je to vyžadováno, poskytněte upozornění nebo souhlas. Testujte adversariální patche, přehrávání, zakrytí, selhání kamery a posun domény. Sledujte stav senzorů, vstupní statistiky, výstupní rychlosti a potvrzené výsledky; zachovejte lidskou kontrolu pro rozhodnutí s následky. Rozmazání nebo oříznutí může snížit expozici, ale může také odstranit důkazy. Vysoké laboratorní skóre neospravedlňuje tvrzení o identitě, emocích nebo úmyslu nad rámec ověřené úlohy.

Praktický příklad: detekce chodců na přechodu ve skladu

Kamery monitorují omezený přechod vozidel a model detekuje osoby, aniž by je identifikoval. Data zahrnují den i noc, počasí, oblečení, zakrytí, uživatele vozíčků, pozice kamer a prázdné scény, rozdělené podle nahrávací relace. Detektor je hodnocen podle zpětné odezvy událostí, falešných poplachů, lokalizace, předstihu varování a výkonu ve vzdálenosti. Bezpečnostní inženýrství definuje maximální tolerovanou latenci a nezávislé fyzické kontroly.

Upozornění z vidění může zpomalit vozidlo, ale nouzové zastavení a bariéry nevyžadují model. Zablokování kamery, zamrzlé snímky, ztráta sítě a časový limit modelu způsobují explicitní chyby. Uchovávání surového videa je minimalizováno a přístup je zaznamenán. Monitorování sleduje stav senzorů, četnost upozornění, přezkoumané incidenty a téměř neúspěchy podle podmínek. Jakákoli změna umístění kamery nebo úprava rozvržení spouští revalidaci, protože zdánlivá podobnost obrázků nezaručuje stejnou geometrii nebo riziko.

Důkazy o implementaci a provozní připravenost

Rozhodnutí o nasazení vyžaduje více než úspěšnou demonstraci. Definujte zamýšlené uživatele, provozní prostředí, vstupy, výstupy, závislosti, vlastníka a důsledky každého důležitého selhání. Zaveďte reprodukovatelný výchozí stav a verziovanou evaluační sadu před laděním. Testujte běžné případy, okrajové podmínky, poškozené nebo chybějící vstupy, posun distribuce, výpadky závislostí, zneužití a skupiny či prostředí, která jsou pravděpodobně nedostatečně obsloužena. Měřte kvalitu úlohy spolu s kalibrací nebo nejistotou, latencí, propustností, náklady na zdroje, přístupností, soukromím a bezpečností. Zaznamenejte každou transformaci a prahovou hodnotu, aby nezávislý recenzent mohl výsledek reprodukovat a odlišit důkazy od atraktivního prototypu.

Před spuštěním přiřaďte pravomoc pro vydání, výjimky, změny, rollback a ukončení. Použijte postupné nasazení, zachovejte bezpečnou záložní možnost a ověřte monitorování s úmyslně zavedenými selháními. Provozní telemetrie by měla odhalit kvalitu vstupů, chování výstupů, verzi modelu nebo pravidla, stav závislostí, lidské zásahy a potvrzené výsledky, aniž by sbírala zbytečná citlivá data. Definujte prahové hodnoty upozornění a odpovědného, poté po nasazení přezkoumejte reálné důkazy místo předpokladu, že offline výkon přetrvá. Přehodnoťte vždy, když se změní zdroje dat, uživatelé, modely, dodavatelé, zásady, hardware nebo cíle. Udržovaný systém také potřebuje zdokumentované postupy obnovy, učení z incidentů, mazání a uchovávání a jasný bod, kdy by měl být deaktivován nebo nahrazen.

Často kladené otázky

Je počítačové vidění stejné jako rozpoznávání obrazu?

Ne. Rozpoznávání obrazu se obvykle vztahuje ke klasifikaci nebo identifikaci. Počítačové vidění zahrnuje také lokalizaci, segmentaci, měření, sledování, rekonstrukci, generování a uvažování nad vizuálními informacemi.

Vidí systém vidění jako člověk?

Ne. Model zpracovává číselné vstupy podle své architektury a tréninkového cíle. Může překonat lidi na úzkém benchmarku, ale selže při drobných změnách, které člověk snadno zvládne.

Primární reference

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.