Wywiady
Sohaib Khan, współzałożyciel i CEO Hazen.ai – seria wywiadów

Sohaib Khan jest współzałożycielem i CEO Hazen.ai, firmy, która wykorzystuje technologie komputerowego widzenia i głębokiego uczenia, aby tworzyć inteligentne oprogramowanie do analizy ruchu drogowego, które jest w stanie „zrozumieć” ruch każdego pojazdu.
Czym było to, co początkowo przyciągnęło Cię do dziedziny sztucznej inteligencji?
Było to podczas studiów licencjackich, kiedy po raz pierwszy przeczytałem o tym, jak działa stereo-widzenie (lub binocularne widzenie – szacowanie głębi z dwóch kamer). To mnie zaangażowało w dalsze eksplorowanie komputerowego widzenia. Co ciekawe, po raz pierwszy przeczytałem o tym w książce, którą kupiłem na tradycyjnym piątkowym rynku, gdzie sprzedawano stare używane książki na chodniku w naszym rodzinnym mieście. Później uzyskałem stopień doktora w tej dziedzinie w Stanach Zjednoczonych.
Byłeś wcześniej profesorem na jednym z największych uniwersytetów w Pakistanie, Lahore University of Management Sciences (LUMS). Jakie były Twoje zainteresowania dydaktyczne i badawcze?
Kiedy dołączyłem do LUMS po uzyskaniu stopnia doktora, zbudowałem pierwsze laboratorium badawcze na uniwersytecie, dzięki dofinansowaniu, które otrzymałem z dużego grantu od organizacji obronnej. Program magisterski z informatyki był wtedy bardzo nowy, a nie było wówczas laboratoriów badawczych. Wykładałem komputerowe widzenie przez 12+ lat w LUMS i miałem aktywne laboratorium w tej dziedzinie. Na początku komputerowe widzenie było ledwie nauczane na którymkolwiek pakistańskim uniwersytecie, ale później stało się standardowym przedmiotem, a tak naprawdę wielu moich studentów teraz również uczy na pakistańskich uniwersytetach.
Czy możesz omówić, co skłoniło Cię do założenia startupu specjalizującego się w komputerowym widzeniu i algorytmach głębokiego uczenia dla analizy wideo?
Komputerowe widzenie przez długi czas było w dużej mierze eksperymentalną dziedziną badawczą, z ograniczonymi zastosowaniami w produktach. Było to głównie spowodowane tym, że dojrzałość algorytmów potrzebnych do tworzenia produktów nie była jeszcze osiągnięta. Dla produktu algorytm zrozumienia obrazu musi działać w różnych warunkach obrazowania i oświetlenia, a nie tylko w niektórych kontrolowanych eksperymentach. Mieliśmy żart wśród studentów doktoranckich w naszym laboratorium, kiedy robiłem doktorat w 2000 roku, że jeśli możesz znaleźć trzy obrazy, na których twoja metoda działa, możesz napisać artykuł. Jeśli działa na trzech filmach, dostajesz bardzo dobry artykuł! Chodzi o to, że wiele algorytmów widzenia działało tylko w starannie przygotowanych laboratoryjnych scenariuszach i nie było zbyt wytrzymałych.
Ale teraz sytuacja się zmieniła. Z pojawieniem się głębokiego uczenia w 2012 roku, zobaczyliśmy bardzo szybki i fascynujący postęp w zrozumieniu obrazu. Kiedy to zobaczyliśmy, uznałem, że teraz jest odpowiedni moment, aby może zbudować solidne produkty, które mogą mieć znaczący wpływ.
Jakie rodzaje wykroczeń drogowych może monitorować Hazen.ai?
Naszym celem jest identyfikacja wszystkich rodzajów niebezpiecznych zachowań podczas jazdy na drodze. To jest napędzane przez nasz główny cel, jakim jest redukcja liczby ofiar śmiertelnych w wypadkach drogowych. Co 24 sekundy ktoś ginie w wypadku drogowym, co jest równoznaczne z około 15 samolotami 787-8, które rozbijają się każdego dnia! Dlatego budujemy oprogramowanie, które może wykryć różne rodzaje niebezpiecznych i niebezpiecznych zachowań, takich jak niebezpieczne zmiany pasa, nielegalne skręty, przekraczanie czerwonego światła lub znaku stop, zablokowanie przejścia dla pieszych, brak zapinania pasów bezpieczeństwa lub prowadzenie podczas pisania SMS-ów. Pracujemy również nad budową funkcji w naszym oprogramowaniu specjalnie dla bezpieczeństwa pieszych i rowerzystów, ponieważ ponad połowa ofiar śmiertelnych w wypadkach drogowych występuje wśród pieszych, rowerzystów i motocyklistów.
Jakie są niektóre unikalne wyzwania związane z używaniem komputerowego widzenia do monitorowania obiektów poruszających się z takimi wysokimi prędkościami?
Istnieją dwa rodzaje wyzwań: Po pierwsze, wydajność samych algorytmów komputerowego widzenia – chcesz mieć produkt, który może działać w trudnych warunkach drogowych 24/7 we wszystkich warunkach oświetlenia. Chociaż został dokonany duży postęp techniczny w tym kierunku, wciąż istnieją kraje, w których gęstość użytkowników dróg jest tak wysoka, jak np. skupiska motocykli lub pieszych w bardzo bliskiej odległości, co nadal stanowi wyzwanie dla algorytmów, aby śledzić ich indywidualnie i zrozumieć scenę. Ale po drugie, większym wyzwaniem jest stworzenie solidnego produktu z algorytmów komputerowego widzenia, który może być wdrożony na ograniczonych zasobach sprzętowych na brzegu i może być monitorowany i zarządzany łatwo, pomimo tego, że jest rozproszony po całym mieście. Ponieważ produkty komputerowego widzenia obsługują wiele danych wideo, wdrożenie ich na brzegu, jako urządzenie IoT, i skuteczne zarządzanie nimi pozostaje trudnym zadaniem.
Jaki jest proces dla użytkownika końcowego, aby skonfigurować oprogramowanie do różnych konfiguracji drogowych?
Każde skrzyżowanie zapewnia unikalną sytuację, pod względem natężenia ruchu, konfiguracji pasa i rodzaju pojazdu, rowerzystów lub interakcji pieszych. Ponadto zainteresowanie zarządców ruchu może być szczególne, aby zidentyfikować określony typ zachowania ruchu na każdym miejscu. Na przykład, policja drogowa może zabronić skrętu w lewo na skrzyżowaniu, aby usprawnić przepływ ruchu, i są zainteresowani przechwytywaniem tej statystyki. Dlatego zachowaliśmy nasze oprogramowanie w sposób konfigurowalny do różnych scenariuszy. Kiedy kamera jest ustawiona z naszym oprogramowaniem, konfigurujemy ją przez prosty proces, aby spełnić wymagania użytkownika końcowego w tym miejscu. Wewnętrznie zbudowaliśmy język wysokiego poziomu, w którym możemy ściśle opisać scenariusze ruchu w prosty sposób. To pozwala nam szybko skonfigurować miejsce dla naszych klientów.
Jaki rodzaj sprzętu jest potrzebny do obsługi tego systemu?
Analiza wideo wymaga znacznej mocy obliczeniowej. Zoptymalizowaliśmy nasz kod, aby działał na mniejszych procesorach graficznych Nvidia , które mogą być wdrożone na brzegu, takich jak ich seria Jetson, oraz na procesorach Intel Core dla niektórych funkcji, które oferujemy. W ostatnich latach bardziej wydajny sprzęt brzegowy staje się dostępny w rozsądnym punkcie ceny, co napędza wiele interesujących aplikacji.
Czy możesz omówić, czy jakiekolwiek jurysdykcje obecnie testują lub używają technologii Hazen.ai?
Mamy obecnie trwające testy w kilku krajach, Wielkiej Brytanii, USA, Egipcie, Arabii Saudyjskiej, Pakistanie, Omanie, Peru i angażujemy potencjalnych klientów w innych krajach.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat Hazen.ai?
Generalnie uważamy, że technologie bezpieczeństwa ruchu drogowego nie postąpiły wystarczająco, w porównaniu ze skalą problemu. Jednak teraz jest odpowiedni moment, dzięki ogromnemu postępowi w komputerowym widzeniu i głębokim uczeniu, a także taniej dostępności sprzętu kamer i komputerowego. Zobaczymy więcej zastosowań komputerowego widzenia na brzegu w nadchodzących latach. To są podstawy, które napędzają Hazen.ai.
Dziękujemy za wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Hazen.ai












