Intervjuer
Sohaib Khan, medgrunnlegger og administrerende direktør i Hazen.ai – Intervju-serie

Sohaib Khan er medgrunnlegger og administrerende direktør i Hazen.ai, et selskap som bruker datavisjon og dyp læring til å designe intelligente trafikkanalyseprogrammer som er designet for å «forstå» bevegelsen til alle kjøretøy.
Hva var det som først tiltalte deg til feltet kunstig intelligens?
Det var under min bachelorgrad som jeg først leste om hvordan stereo-vision (eller binokulær visjon – estimere dybde fra to kameralinser) fungerer. Det fikk meg til å bli interessert i å utforske datavisjon mer. Interessant nok, jeg leste først om det i en bok som jeg plukket opp fra en tradisjonell fredagsmarked hvor de solgte gamle brukte bøker på en gatebenk i vår hjemby. Jeg gikk videre og tok en doktorgrad i dette feltet fra USA.
Du var tidligere professor ved ett av de største universitetene i Pakistan, Lahore University of Management Sciences (LUMS). Hva var dine undervisnings- og forskningsinteresser?
Når jeg begynte ved LUMS etter min doktorgrad, bygde jeg det som var det første graduate-forskningslaboratoriet ved universitetet, med midler fra et stort stipend fra en forsvarsorganisasjon. Graduate-programmet i informatikk var svært nytt, og det var ingen forskningslaboratorier på den tiden. Jeg underviste i datavisjon i over 12 år ved LUMS, og hadde et aktivt laboratorium i dette feltet. I begynnelsen var datavisjon knapt undervist ved noen pakistanske universiteter, men senere ble det et standardfag, og faktisk underviser mange av mine studenter nå også ved pakistanske universiteter.
Kan du diskutere hva som inspirerte deg til å starte et startup som spesialiserer seg på datavisjon og dyp læring-algoritmer for videoanalyse?
Datavisjon var lenge et eksperimentelt forskningsfelt, med begrensede anvendelser i produkter. Dette skyldtes hovedsakelig at modenheten til algoritmene som trengs for å bygge produkter ikke var der. For et produkt må bildeforståelsesalgoritmen fungere i en rekke av bilde- og lysforhold, og ikke bare i noen svært kontrollerte eksperimenter. Vi hadde en vits blant de graduate-studentene i vårt laboratorium da jeg gjorde min doktorgrad tilbake i 2000, at hvis du kan finne tre bilder som din algoritme fungerer på, kan du skrive en artikkel. Hvis den fungerer på tre videoer, får du en svært god artikkel! Poenget er at mange visjonsalgoritmer bare fungerte i svært kontrollerte laboratorie-scenarier, og var ikke svært robuste.
Men nå har ting endret seg. Med fremkomsten av dyp læring i 2012, har vi sett en svært rask og fascinerende fremgang i bildeforståelse. Når vi så det, følte vi at nå er tiden rett til å bygge solide produkter som kan ha en betydelig innvirkning.
Hvilke typer trafikkforseelser kan Hazen.ai overvåke?
Vårt mål er å kunne identifisere alle typer farlig kjøreforfaring på veiene. Dette drives av vårt overordnede mål om å redusere veiulykker. Hver 24. sekund dør noen i en bilulykke, som tilsvarer omtrent 15 787-8 Dreamlinere som krasjer hver eneste dag! Så dette er virkelig hva motiverer oss. Derfor bygger vi programvare som kan detektere forskjellige typer farlig og usikker atferd, som usikre filskifter, ulovlige sving, å hoppe over en rød lys eller stoppskilt, blokkere en fotgjengerovergang, ikke bruke setebelte eller tekst mens du kjører. Vi arbeider også med å bygge funksjoner i vår programvare spesielt for sikkerheten til fotgjengere og syklister, fordi over halvparten av dødsfallene i bilulykker skjer i den sårbare veibrukersegmentet av fotgjengere, syklister og motorsyklister.
Hva er noen av de unike utfordringene med å bruke datavisjon til å overvåke objekter som beveger seg i så høye hastigheter?
Det finnes to typer utfordringer: Først er det ytelsen til datavisjonsalgoritmene selv – du ønsker å ha et produkt som kan fungere i utfordrende trafikkforhold 24/7 i alle lysvariasjoner. Mens det har vært en del fremgang teknisk mot dette målet, er det fortsatt land der tettheten av veibruker er så høy, som for eksempel grupper av motorsykler eller fotgjengere i svært nærheten, at det fortsatt er utfordrende for algoritmer å spore dem individuelt og forstå scenariet. Men andre er en større utfordring å lage et solid produkt av datavisjonsalgoritmer, som kan distribueres på begrensede maskinressursene på kanten, og kan overvåkes og håndteres enkelt til tross for å være distribuert over hele byen. Ettersom datavisjonsprodukter håndterer mye video-data, å distribuere dem på kanten, som en IoT-enhet, og håndtere dem effektivt, er en vanskelig oppgave.
Hva er prosessen for sluttbrukeren til å konfigurere programvaren til forskjellige veikonfigurasjoner?
Hver kryssning tilbyr en unik scenario, i termer av trafikkvolum, filkonfigurasjon og type kjøretøy, syklister eller fotgjengerinteraksjoner. I tillegg kan trafikkledernes interesser være spesifikke, å identifisere en bestemt type trafikkatferd på hvert sted. For eksempel kan trafikkenheten ikke tillate en U-sving på en kryssning for å jevne ut trafikken, og er interessert i å fange denne statistikken. Derfor har vi holdt vår programvare konfigurerbar til forskjellige scenarier. Når en kamera er satt opp med vår programvare, konfigurerer vi den gjennom en enkel prosess for hva sluttbrukeren trenger på det stedet. Internally har vi bygget en høynivåspråk som vi kan kompakt beskrive trafikkscenarier av interesse på en enkel måte. Dette tillater oss å konfigurere et sted raskt for våre kunder.
Hva type maskinvare er nødvendig for å operere dette systemet?
Videoanalyse krever betydelig beregningskraft. Vi har optimalisert vår kode til å kjøre på de mindre Nvidia-GPU-ene som kan distribueres på kanten, som deres Jetson-serie, og også på Intel-CPU-er for visse funksjoner som vi tilbyr. I de siste årene har mer kraftfulle kantmaskinvare blitt tilgjengelig til en rimelig pris, så dette driver mye spennende anvendelser.
Kan du diskutere om noen jurisdiksjoner for tiden prøver eller bruker Hazen.ai-teknologien?
Vi har nå pågående prøvinger i flere land, Storbritannia, USA, Egypt, Saudi-Arabia, Pakistan, Oman, Peru og er engasjert med potensielle kunder i andre land også.
Er det noe annet du ville like å dele om Hazen.ai?
I alt føler vi at trafikksikkerhetsteknologier ikke har fremmet nok, sammenlignet med skalaen av problemet. Men nå er tiden rett, på grunn av den massive fremgangen i datavisjon og dyp læring, samt billig tilgjengelighet av kamera- og beregningsmaskinvare. Vi vil se mange flere anvendelser av kantbasert datavisjon i de kommende årene. Dette er grunnleggende prinsipper som driver Hazen.ai.
Takk for intervjuet, lesere som ønsker å lære mer kan besøke Hazen.ai












