Interviuri
Sohaib Khan, Co-Fondator & CEO al Hazen.ai – Seria de Interviuri

Sohaib Khan este Co-Fondator & CEO al Hazen.ai, o companie care utilizează viziunea computerizată și învățarea profundă pentru a proiecta software de analitică de trafic inteligentă care este proiectată pentru a „înțelege” mișcarea fiecărui vehicul.
Ce v-a atras inițial în domeniul inteligenței artificiale?
A fost în timpul studiilor universitare când am citit pentru prima dată despre cum funcționează viziunea stereo (sau viziunea binoculară – estimarea adâncimii din două camere). Acest lucru m-a făcut să fiu interesat de explorarea mai departe a viziunii computerizate. În mod interesant, am citit despre acest lucru într-o carte pe care am cumpărat-o de la un târg de vechituri de pe o stradă din orașul nostru natal. Am continuat să fac un doctorat în acest domeniu în Statele Unite.
Ați fost anterior profesor la una dintre cele mai mari universități din Pakistan, Universitatea de Științe de Management din Lahore (LUMS). Care au fost interesele dvs. de predare și cercetare?
Când am intrat la LUMS după doctorat, am construit primul laborator de cercetare de masterat din universitate, cu fonduri pe care le-am primit de la o organizație de apărare. Programul de masterat în informatică era foarte nou, și nu existau laboratoare de cercetare la acea vreme. Am predat viziunea computerizată timp de 12 ani la LUMS și am avut un laborator activ în acest domeniu. La început, viziunea computerizată era predată foarte puțin la universitățile din Pakistan, dar mai târziu a devenit o materie standard, și de fapt, mulți dintre studenții mei predau acum la universitățile din Pakistan.
Puteți discuta ce v-a inspirat să lansați o companie care se specializează în algoritmi de viziune computerizată și învățare profundă pentru analiza video?
Viziunea computerizată a fost, timp de multă vreme, în mare parte un domeniu de cercetare experimentală, cu aplicații limitate în produse. Acest lucru se datorează faptului că maturitatea algoritmilor necesari pentru construirea de produse nu a fost atinsă. Pentru un produs, algoritmul de înțelegere a imaginilor trebuie să funcționeze într-o varietate de condiții de imagine și iluminare, și nu doar în câteva experimente controlate. Aveam o glumă printre studenții noștri de masterat când făceam doctoratul, că dacă poți găsi trei imagini pe care algoritmul tău le poate procesa, poți scrie un articol. Dacă funcționează pe trei videoclipuri, obții un articol foarte bun! Punctul este că mulți algoritmi de viziune funcționau doar în scenarii de laborator controlate și nu erau foarte robusti.
Însă acum lucrurile s-au schimbat. Cu apariția învățării profunde în 2012, am văzut progrese rapide și fascinante în înțelegerea imaginilor. Când am văzut acest lucru, am simțit că acum este momentul potrivit pentru a construi produse solide care pot avea un impact semnificativ.
Ce tipuri de încălcări ale regulamentului de circulație poate monitoriza Hazen.ai?
Scopul nostru este de a identifica toate tipurile de comportament periculos la volan pe drumuri. Acest lucru este determinat de obiectivul nostru general de a reduce accidentele rutiere. Fiecare 24 de secunde, cineva moare într-un accident de circulație, ceea ce este echivalent cu aproximativ 15 avioane Boeing 787-8 care se prăbușesc în fiecare zi! Așadar, acesta este ceea ce ne motivează. De aceea, construim software care poate detecta diferite tipuri de comportament periculos și nesigur, cum ar fi schimbarea nepermisă a benzilor, virajele ilegale, trecerea pe roșu sau oprirea la semafor, blocarea trecerii pietonilor, nepurtarea centurii de siguranță sau textarea la volan. De asemenea, lucrăm la construirea de funcții în software-ul nostru special pentru siguranța pietonilor și bicicliștilor, deoarece peste jumătate din decesele în accidente rutiere se produc în segmentul de utilizatori vulnerabili ai drumurilor, pietoni, bicicliști și motocicliști.
Care sunt unele dintre provocările unice ale utilizării viziunii computerizate pentru monitorizarea obiectelor care se mișcă la viteze atât de mari?
Există două tipuri de provocări: prima este legată de performanța algoritmilor de viziune computerizată – doriți să aveți un produs care să funcționeze în condiții de trafic dificile, 24/7, în toate variantele de iluminare. Deși a existat o mare progres tehnic în acest scop, există încă țări în care densitatea utilizatorilor drumurilor este atât de mare, cum ar fi grupuri de motociclete sau pietoni în proximitate foarte apropiată, încât este încă o provocare pentru algoritmi să îi urmărească individual și să înțeleagă scena. Însă, a doua provocare este și mai mare: crearea unui produs solid din algoritmi de viziune computerizată, care poate fi implementat pe resurse hardware limitate la margine și poate fi monitorizat și gestionat ușor, în ciuda faptului că este distribuit în toată orașul. Deoarece produsele de viziune computerizată manipulează o cantitate mare de date video, implementarea lor la margine, ca dispozitiv IoT, și gestionarea lor eficientă, rămâne o sarcină dificilă.
Care este procesul pentru utilizatorul final de a configura software-ul pentru diferite configurații de drum?
Fiecare intersecție oferă un scenariu unic, în ceea ce privește volumul de trafic, configurația benzilor și tipul de vehicul, bicicliști sau interacțiuni pietonale. Mai mult, interesul gestionarilor de trafic poate fi specific, pentru a identifica un anumit tip de comportament la volan la fiecare sit. De exemplu, poliția rutieră poate interzice virajul la stânga la o intersecție pentru a fluidiza traficul și este interesată să capteze această statistică. De aceea, am păstrat software-ul nostru configurabil pentru diferite scenarii. Când o cameră este configurată cu software-ul nostru, o configurăm printr-un proces simplu pentru ceea ce necesită utilizatorul final la acel sit. În interior, am construit un limbaj de nivel înalt în care putem descrie compact scenarii de trafic de interes într-un mod simplu. Acest lucru ne permite să configurăm rapid un sit pentru clienții noștri.
Care este tipul de hardware necesar pentru a opera acest sistem?
Analiza video necesită o putere de calcul semnificativă. Am optimizat codul nostru pentru a rula pe GPU-urile Nvidia mai mici, care pot fi implementate la margine, cum ar fi seria Jetson, și de asemenea pe procesoarele Intel pentru anumite funcții pe care le oferim. În ultimii ani, hardware-ul de margine mai puternic devine disponibil la un preț rezonabil, ceea ce este cu adevărat o aplicație interesantă.
Puteți discuta dacă există vreo jurisdicție care utilizează în prezent tehnologia Hazen.ai?
Acum avem teste în desfășurare în mai multe țări, Regatul Unit, Statele Unite, Egipt, Arabia Saudită, Pakistan, Oman, Peru și suntem implicați cu potențiali clienți în alte țări.
Există altceva pe care ați dori să îl împărtășiți despre Hazen.ai?
În general, simțim că tehnologiile de siguranță a traficului nu au progresat suficient, comparativ cu amploarea problemelor. Cu toate acestea, acum este momentul potrivit, datorită progresului masiv în viziunea computerizată și învățarea profundă, precum și a disponibilității ieftine a camerelor și hardware-ului de calcul. Vom vedea multe alte aplicații ale viziunii computerizate bazate pe margine în anii următori. Acestea sunt fundamentele care stau la baza Hazen.ai.
Mulțumim pentru interviu, cititorii care doresc să afle mai multe despre Hazen.ai pot vizita Hazen.ai












