Interviews
Sohaib Khan, Mitgründer und CEO von Hazen.ai – Interview-Serie

Sohaib Khan ist der Mitgründer und CEO von Hazen.ai, einem Unternehmen, das Computer-Vision und Deep-Learning verwendet, um intelligente Verkehrsanalyse-Software zu entwickeln, die das Verhalten jedes Fahrzeugs “versteht”.
Was hat Sie ursprünglich zum Bereich KI hingezogen?
Während meines Bachelor-Studiums las ich zum ersten Mal über Stereo-Vision (oder binokulare Vision – die Schätzung von Tiefen aus zwei Kameras). Das hat mich dazu gebracht, Computer-Vision genauer zu erforschen. Interessanterweise las ich darüber zum ersten Mal in einem Buch, das ich auf einem traditionellen Freitagmarkt gekauft hatte, wo sie alte gebrauchte Bücher auf einem Straßenrand verkauften. Ich ging dann zum PhD-Studium in diesem Bereich in den USA.
Sie waren früher Professor an einer der größten Universitäten in Pakistan, der Lahore University of Management Sciences (LUMS). Was waren Ihre Lehr- und Forschungsinteressen?
Als ich nach meinem PhD an die LUMS kam, baute ich das erste Graduate-Forschungslabor an der Universität auf, das durch eine große Förderung von einer Verteidigungsorganisation finanziert wurde. Das Graduate-Programm in Informatik war sehr neu, und es gab zu diesem Zeitpunkt keine Forschungslabore. Ich unterrichtete Computer-Vision über 12 Jahre an der LUMS und hatte ein aktives Labor in diesem Bereich. Zu Beginn wurde Computer-Vision kaum an pakistanischen Universitäten unterrichtet, aber später wurde es zu einem Standardfach, und tatsächlich unterrichten viele meiner Studenten jetzt auch an pakistanischen Universitäten.
Können Sie über die Inspiration sprechen, die Sie dazu gebracht hat, ein Startup zu gründen, das sich auf Computer-Vision und Deep-Learning-Algorithmen für Video-Analytics spezialisiert?
Computer-Vision war lange Zeit ein experimentelles Forschungsgebiet mit begrenzten Anwendungen in Produkten. Dies lag hauptsächlich daran, dass die Reife der Algorithmen, die für die Erstellung von Produkten erforderlich waren, nicht vorhanden war. Für ein Produkt muss der Algorithmus zur Bildverständigung in verschiedenen Bild- und Beleuchtungsbedingungen funktionieren und nicht nur in kontrollierten Experimenten. Wir hatten einen Witz unter den Graduate-Studenten in unserem Labor, als ich meinen PhD machte, dass wenn Sie drei Bilder finden, auf denen Ihr Algorithmus funktioniert, Sie einen Artikel schreiben können. Wenn es auf drei Videos funktioniert, erhalten Sie einen sehr guten Artikel! Der Punkt ist, dass viele Vision-Algorithmen nur in sorgfältig kuratierten Labor-Szenarien funktionierten und nicht sehr robust waren.
Jetzt haben sich die Dinge geändert. Mit dem Aufkommen von Deep-Learning im Jahr 2012 haben wir einige sehr schnelle und faszinierende Fortschritte im Bereich des Bildverständnisses gesehen. Als wir das sahen, fühlten wir, dass jetzt der richtige Zeitpunkt ist, um vielleicht solide Produkte zu bauen, die einen signifikanten Einfluss haben können.
Welche Arten von Verkehrsverstößen kann Hazen.ai überwachen?
Unser Ziel ist es, alle Arten von gefährlichem Fahrverhalten auf den Straßen zu identifizieren. Dies wird von unserem übergeordneten Ziel der Reduzierung von Verkehrstoten angetrieben. Jede 24 Sekunden stirbt jemand bei einem Verkehrsunfall, was etwa 15 787-8 Dreamlinern entspricht, die jeden Tag abstürzen! Das ist wirklich, was uns motiviert. Deshalb bauen wir Software, die verschiedene Arten von gefährlichem und unsicheren Verhaltensweisen erkennen kann, wie unsichere Spurwechsel, illegale Abbiegevorgänge, Rotlicht- oder Stop-Schild-Übertretungen, Blockieren von Fußgängerüberwegen, Nicht-Tragen von Sicherheitsgurten oder Texten-während-des-Fahrens. Wir arbeiten auch daran, Funktionen in unserer Software zu entwickeln, die speziell für die Sicherheit von Fußgängern und Radfahrern konzipiert sind, da mehr als die Hälfte der Todesfälle bei Verkehrsunfällen in der verletzlichen Straßenbenutzer-Gruppe von Fußgängern, Radfahrern und Motorradfahrern auftreten.
Was sind einige der einzigartigen Herausforderungen bei der Verwendung von Computer-Vision, um Objekte zu überwachen, die mit so hoher Geschwindigkeit bewegt werden?
Es gibt zwei Arten von Herausforderungen: Erstens die Leistung der Computer-Vision-Algorithmen selbst – Sie möchten ein Produkt haben, das in anspruchsvollen Verkehrsbedingungen 24/7 in allen Beleuchtungsvarianten funktioniert. Während es in dieser Hinsicht große technische Fortschritte gegeben hat, gibt es immer noch Länder, in denen die Dichte der Straßenbenutzer so hoch ist, wie z.B. Gruppen von Motorrädern oder Fußgängern in sehr enger Nähe, dass es für Algorithmen immer noch eine Herausforderung ist, sie individuell zu verfolgen und die Szene zu verstehen. Zweitens ist eine größere Herausforderung darin, ein solides Produkt aus Computer-Vision-Algorithmen zu machen, das auf begrenzten Hardware-Ressourcen am Rand deployt werden kann und leicht überwacht und verwaltet werden kann, obwohl es über die ganze Stadt verteilt ist. Da Computer-Vision-Produkte große Mengen an Video-Daten verarbeiten, bleibt die Deployment auf dem Rand als IoT-Gerät und die effektive Verwaltung eine schwierige Aufgabe.
Was ist der Prozess für den Endbenutzer, um die Software für verschiedene Straßenkonfigurationen zu konfigurieren?
Jede Kreuzung bietet ein einzigartiges Szenario in Bezug auf Verkehrsvolumen, Spurkonfiguration und Art des Fahrzeugs, Radfahrers oder Fußgängers. Darüber hinaus können die Interessen der Verkehrsmanager spezifisch sein, um ein bestimmtes Verkehrsverhalten an jedem Standort zu identifizieren. Zum Beispiel kann die Verkehrspolizei ein U-Turn an einer Kreuzung verbieten, um den Verkehrsfluss zu glätten, und ist an der Erfassung dieser Statistik interessiert. Deshalb haben wir unsere Software so konzipiert, dass sie für verschiedene Szenarien konfiguriert werden kann. Wenn eine Kamera mit unserer Software eingerichtet wird, konfigurieren wir sie durch einen einfachen Prozess für das, was der Endbenutzer an diesem Standort benötigt. Intern haben wir eine Hochsprache entwickelt, in der wir Verkehrs-Szenarien von Interesse auf einfache Weise kompakt beschreiben können. Dies ermöglicht es uns, einen Standort schnell für unsere Kunden zu konfigurieren.
Welche Art von Hardware ist erforderlich, um dieses System zu betreiben?
Video-Analytics erfordert erhebliche Rechenleistung. Wir haben unseren Code optimiert, um auf den kleineren Nvidia-GPUs zu laufen, die am Rand deployt werden können, wie z.B. ihre Jetson-Serie, und auch auf Intel-CPUs für bestimmte Funktionen, die wir anbieten. In den letzten Jahren wird leistungsfähigere Edge-Hardware zu einem vernünftigen Preis angeboten, was viele aufregende Anwendungen vorantreibt.
Können Sie über die Gerichtsbarkeiten sprechen, die derzeit Hazen.ai-Technologie testen oder verwenden?
Wir haben derzeit laufende Tests in mehreren Ländern, UK, USA, Ägypten, Saudi-Arabien, Pakistan, Oman, Peru und sind auch mit potenziellen Kunden in anderen Ländern im Gespräch.
Gibt es noch etwas, das Sie über Hazen.ai teilen möchten?
Insgesamt fühlen wir, dass Verkehrssicherheitstechnologien nicht genug fortgeschritten sind, im Vergleich zum Umfang des Problems. Jetzt ist jedoch der richtige Zeitpunkt, weil des enormen Fortschritts in Computer-Vision und Deep-Learning sowie der günstigen Verfügbarkeit von Kamera- und Computer-Hardware. Wir werden in den kommenden Jahren viele weitere Anwendungen von Edge-basiertem Computer-Vision sehen. Diese sind die Grundlagen, die Hazen.ai antreiben.
Vielen Dank für das Interview, Leser, die mehr erfahren möchten, sollten Hazen.ai besuchen












