Fundamentele AI

Ce este Viziunea Calculatoarelor?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Ce este Viziunea Calculatoarelor?

Algoritmii de viziune a calculatoarelor sunt unii dintre cele mai transformative și puternice sisteme AI din lume, în acest moment. Sistemele de viziune a calculatoarelor sunt utilizate în vehicule autonome, navigație robotică, sisteme de recunoaștere facială și multe altele. Cu toate acestea, ce sunt exact algoritmii de viziune a calculatoarelor? Cum funcționează? Pentru a răspunde la aceste întrebări, vom explora în profunzime teoria din spatele viziunii calculatoarelor, algoritmii de viziune a calculatoarelor și aplicațiile sistemelor de viziune a calculatoarelor.

Cum Funcționează Sistemele de Viziune a Calculatoarelor?

Pentru a aprecia pe deplin modul în care funcționează sistemele de viziune a calculatoarelor, să discutăm mai întâi despre modul în care oamenii recunosc obiectele. Cea mai bună explicație pe care neuropsihologia o are pentru modul în care recunoaștem obiectele este un model care descrie faza inițială a recunoașterii obiectelor ca o fază în care componentele de bază ale obiectelor, cum ar fi forma, culoarea și adâncimea, sunt interpretate de creier. Semnalele de la ochi care intră în creier sunt analizate pentru a extrage marginile unui obiect și aceste margini sunt unite într-o reprezentare mai complexă care completează forma obiectului.

Sistemele de viziune a calculatoarelor funcționează foarte asemănător cu sistemul vizual uman, prin discernerea marginilor unui obiect și unirea acestor margini în forma obiectului. Marele diferență constă în faptul că, deoarece calculatoarele interpretează imaginile ca numere, un sistem de viziune a calculatoarelor are nevoie de o modalitate de a interpreta pixelii individuali care compun imaginea. Sistemul de viziune a calculatoarelor va atribui valori pixelilor din imagine și, prin examinarea diferenței de valori între o regiune de pixeli și o altă regiune de pixeli, calculatorul poate discernerea marginilor. De exemplu, dacă imaginea în cauză este în tonuri de gri, atunci valorile vor varia de la negru (reprezentat de 0) la alb (reprezentat de 255). O schimbare bruscă a gamei de valori a pixelilor din apropierea unui alt pixel va indica o margine.

Acest principiu de bază de comparare a valorilor pixelilor poate fi aplicat și pentru imagini color, calculatorul comparând diferențele dintre diferitele canale de culoare RGB. Acum că știm cum examinează un sistem de viziune a calculatoarelor valorile pixelilor pentru a interpreta o imagine, să examinăm arhitectura unui sistem de viziune a calculatoarelor.

Rețele Neurale Convolutive (CNN)

Tipul principal de IA utilizat în sarcinile de viziune a calculatoarelor este unul bazat pe rețele neurale convolutive. Ce este o convoluție exact?

Convoluțiile sunt procese matematice pe care rețeaua le utilizează pentru a determina diferența de valori între pixeli. Dacă vă imaginați o grilă de valori de pixeli, imaginați-vă o grilă mai mică care se deplasează peste această grilă principală. Valorile de sub a doua grilă sunt analizate de rețea, astfel încât rețeaua examinează doar o mână de pixeli la un moment dat. Acesta este adesea numit tehnica “ferestrelor glisante”. Valorile analizate de fereastra glisantă sunt rezumate de rețea, ceea ce ajută la reducerea complexității imaginii și la facilitarea extragerii de modele de către rețea.

Rețelele neurale convolutive sunt împărțite în două secțiuni diferite, secțiunea convolutivă și secțiunea complet conectată. Straturile convolutive ale rețelei sunt extractoarele de caracteristici, a căror sarcină este de a analiza pixelii din imagine și de a forma reprezentări ale acestora pe care straturile dens conectate ale rețelei neuronale le pot învăța modele. Straturile convolutive încep prin a examina doar pixelii și a extrage caracteristicile de nivel scăzut ale imaginii, cum ar fi marginile. Straturile convolutive ulterioare unesc marginile în forme mai complexe. Până la sfârșit, rețeaua ar trebui să aibă o reprezentare a marginilor și detaliilor imaginii pe care o poate transmite straturilor complet conectate.

Anotarea Imaginilor

Deși o rețea neuronală convolutivă poate extrage modele din imagini de una singură, acuratețea sistemului de viziune a calculatoarelor poate fi îmbunătățită semnificativ prin anotarea imaginilor. Anotarea imaginilor este procesul de adăugare de metadate la imagine care ajută clasificatorul să detecteze obiecte importante din imagine. Utilizarea anotării imaginilor este importantă ori de câte ori sistemele de viziune a calculatoarelor trebuie să fie foarte precise, cum ar fi atunci când se controlează un vehicul autonom sau un robot.

Există diverse modalități în care imaginile pot fi anotate pentru a îmbunătăți performanța unui clasificator de viziune a calculatoarelor. Anotarea imaginilor se face adesea cu cutii de delimitare, o cutie care înconjoară marginile obiectului țintă și spune calculatorului să-și concentreze atenția în interiorul cutiei. Segmentarea semantică este un alt tip de anotare a imaginilor, care funcționează prin atribuirea unei clase de imagine pentru fiecare pixel din imagine. Cu alte cuvinte, fiecare pixel care ar putea fi considerat “iarbă” sau “copaci” va fi etichetat ca aparținând acestor clase. Tehnica oferă precizie la nivel de pixel, dar crearea de anotări de segmentare semantică este mai complexă și mai consumatoare de timp decât crearea de cutii de delimitare simple. Alte metode de anotare, cum ar fi linii și puncte, există și ele.

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.