Interviews
Sohaib Khan, medstifter og administrerende direktør i Hazen.ai – Intervju-serie

Sohaib Khan er medstifter og administrerende direktør i Hazen.ai, et selskap som bruker datavisjon og dypt læring til å designe intelligente trafikkanalyseprogrammer som er designet for å ‘forstå’ bevegelsen av hver enkelt bil.
Hva var det som først tiltalte deg til feltet kunstig intelligens?
Det var under min bachelorgrad som jeg først leste om hvordan stereo-vision (eller binokulær visjon – estimere dybde fra to kameralinser) fungerer. Det fikk meg til å bli interessert i å utforske datavisjon mer. Interessant nok, jeg leste først om det i en bok som jeg plukket opp fra en tradisjonell fredagsmarked hvor de solgte gamle brukte bøker på en gatefortau i vår hjemby. Jeg gikk videre og tok en ph.d. i dette feltet fra USA.
Du var tidligere professor ved ett av de største universitetene i Pakistan, Lahore University of Management Sciences (LUMS). Hva var dine undervisnings- og forskningsinteresser?
Når jeg begynte ved LUMS etter min ph.d., bygde jeg det som var det første graduate-forskningslaboratoriet ved universitetet, fra midler jeg mottok fra en stor bevilgning fra en forsvarsorganisasjon. Graduate-programmet i datavitenskap var veldig nytt, og det var ingen forskningslaboratorier på den tiden. Jeg underviste i datavisjon i 12+ år ved LUMS, og hadde et aktivt laboratorium i dette feltet. I begynnelsen var datavisjon knapt undervist ved noen pakistanske universiteter, men senere ble det et standardfag, og faktisk underviser mange av mine studenter nå også ved pakistanske universiteter.
Kan du diskutere hva som inspirerte deg til å lansere et startup som spesialiserer seg på datavisjon og dypt læring-algoritmer for videoanalyse?
Datavisjon var lenge et eksperimentelt forskningsfelt, med begrensede anvendelser i produkter. Dette skyldtes at modenheten av algoritmer som trengs for å bygge produkter ikke var der. For et produkt må bildforståelsesalgoritmen fungere i en rekke av bilde- og lysforhold, og ikke bare i noen veldig kontrollerte eksperimenter. Vi hadde en vits blant de graduate-studentene i vårt laboratorium da jeg gjorde min ph.d. tilbake i 2000, at hvis du kan finne tre bilder som din algoritme fungerer på, kan du skrive en artikkel. Hvis den fungerer på tre videoer, får du en veldig god artikkel! Poenget er at mange visjonsalgoritmer bare fungerte i veldig kontrollerte laboratorie-scenarier, og var ikke veldig robuste.
Men nå har ting endret seg. Med fremveksten av dypt læring i 2012, har vi sett en rekke veldig rask og fascinerende fremgang i bildeforståelse. Når vi så det, følte vi at nå er tiden rett til å bygge solide produkter som kan ha en betydelig innvirkning.
Hvilke typer trafikkforseelser kan Hazen.ai overvåke?
Vårt mål er å kunne identifisere alle typer farlig kjøreforfaring på veiene. Dette drives av vår overordnede mål om å redusere trafikkdødsfall. Hvert 24. sekund dør noen i en trafikkulykke, som tilsvarer omtrent 15 787-8 Dreamlinere som krasjer hver eneste dag! Så dette er virkelig det som motiverer oss. Derfor bygger vi programvare som kan detektere forskjellige typer farlig og usikker atferd, som usikre filskifter, ulovlige sving, å hoppe over en rød lys eller stoppskilt, blokkere en fotgjengerovergang, ikke bruke setebelte eller tekst-og-kjør. Vi jobber også med å bygge funksjoner i vår programvare spesielt for sikkerheten til fotgjengere og syklister, fordi mer enn halvparten av dødsfallene i trafikkulykker skjer i den sårbare veibrukersegmentet av fotgjengere, syklister og motorsyklister.
Hva er noen av de unike utfordringene bak å bruke datavisjon til å overvåke objekter som beveger seg i så høye hastigheter?
Det finnes to typer utfordringer: Først er det ytelsen til datavisjonsalgoritmer selv – du ønsker å ha et produkt som kan fungere i utfordrende trafikkforhold 24/7 i alle lysvariasjoner. Mens det har vært en del fremgang teknisk mot dette målet, er det fortsatt land der tettheten av veibruker er så høy, som for eksempel klaser av motorsykler eller fotgjengere i veldig nært område, at det fortsatt er utfordrende for algoritmer å spore dem individuelt og forstå scenariet. Men andre er en større utfordring å lage et solid produkt av datavisjonsalgoritmer, som kan deployes på begrensede maskinressurser på kanten, og kan overvåkes og håndteres enkelt til tross for å være distribuert over hele byen. Ettersom datavisjonsprodukter håndterer mye video-data, å deploye dem på kanten, som en IoT-enhet, og håndtere dem effektivt, er en vanskelig oppgave.
Hva er prosessen for sluttbrukeren til å konfigurere programvaren til forskjellige veikonfigurasjoner?
Hvert kryss finner en unik scenario, i terms of trafikkvolum, filkonfigurasjon og typen kjøretøy, syklister eller fotgjengerinteraksjoner. I tillegg kan trafikkledernes interesser være spesifikke, å identifisere en bestemt type trafikkatferd på hvert sted. For eksempel kan trafikpolitiet ikke tillate en U-sving på et kryss for å glatte ut trafikken, og er interessert i å fange denne statistikken. Derfor har vi holdt vår programvare konfigurerbar til forskjellige scenarier. Når en kamera er satt opp med vår programvare, konfigurerer vi den gjennom en enkel prosess for hva sluttbrukeren trenger på det stedet. Internally har vi bygget en høynivåspråk hvor vi kan kompakt beskrive trafikkscenarier av interesse på en enkel måte. Dette tillater oss å konfigurere et sted raskt for våre kunder.
Hva type maskinvare er nødvendig for å operere dette systemet?
Videoanalyse krever betydelig beregningskraft. Vi har optimert vår kode til å kjøre på de mindre Nvidia-GPU-ene som kan deployes på kanten, som deres Jetson-serie, og også på Intel-CPU-er for visse funksjoner som vi tilbyr. I de siste årene har mer kraftfulle kantmaskinvarer blitt tilgjengelig til en rimelig pris, så dette er virkelig en driver for mange spennende applikasjoner.
Kan du diskutere om noen jurisdiksjoner for tiden er i ferd med å teste eller bruke Hazen.ai-teknologien?
Vi har nå pågående tester i flere land, Storbritannia, USA, Egypt, Saudi-Arabia, Pakistan, Oman, Peru og er i ferd med å engasjere potensielle kunder i andre land også.
Er det noe annet du ville like å dele om Hazen.ai?
I alt føler vi at trafikksikkerhetsteknologier ikke har fremmet nok, sammenlignet med skalaen av problemet. Men nå er tiden rett, på grunn av den massive fremgangen i datavisjon og dypt læring, samt billig tilgjengelighet av kamera- og beregningsmaskinvarer. Vi vil se mange flere applikasjoner av kant-basert datavisjon i de kommende årene. Dette er grunnleggende prinsipper som driver Hazen.ai.
Takk for intervjuet, lesere som ønsker å lære mer kan besøke Hazen.ai












