Interviste
Sohaib Khan, Co-Fondatore e Amministratore Delegato di Hazen.ai – Serie di Interviste

Sohaib Khan, è il Co-Fondatore e Amministratore Delegato di Hazen.ai, un’azienda che utilizza la visione artificiale e l’apprendimento automatico per progettare software di analisi del traffico intelligente in grado di “comprendere” il movimento di ogni veicolo.
Cosa ti ha inizialmente attratto nel campo dell’IA?
È stato durante gli studi universitari che ho letto per la prima volta come funziona la visione stereoscopica (o visione binoculare – stima della profondità da due telecamere). Questo mi ha fatto innamorare dell’esplorazione della visione artificiale. Interessante, l’ho letto per la prima volta in un libro che ho acquistato in un mercato tradizionale del venerdì dove si vendevano libri usati su un marciapiede in città. Ho poi fatto un dottorato di ricerca in questo campo negli Stati Uniti.
Sei stato precedentemente un professore in una delle più grandi università del Pakistan, The Lahore University of Management Sciences (LUMS). Quali erano i tuoi interessi di insegnamento e ricerca?
Quando mi sono unito a LUMS dopo il mio dottorato, ho costruito il primo laboratorio di ricerca universitario nell’università, grazie a un finanziamento che ho ricevuto da un’organizzazione di difesa. Il programma di laurea in Informatica era molto nuovo e non c’erano laboratori di ricerca a quel tempo. Ho insegnato Visione Artificiale per 12 anni a LUMS e ho avuto un laboratorio attivo in questo campo. All’inizio, la visione artificiale era insegnata a malapena in qualsiasi università pakistana, ma in seguito è diventata una materia standard e, in realtà, molti dei miei studenti stanno ora anche insegnando in università pakistane.
Puoi discutere cosa ti ha ispirato a lanciare una startup specializzata in algoritmi di visione artificiale e apprendimento automatico per l’analisi video?
La visione artificiale, per molto tempo, è stata principalmente un campo di ricerca sperimentale, con applicazioni limitate nei prodotti. Ciò era dovuto principalmente al fatto che la maturità degli algoritmi necessari per costruire prodotti non era ancora presente. Per un prodotto, l’algoritmo di comprensione delle immagini deve funzionare in una varietà di condizioni di immagine e illuminazione, e non solo in alcuni esperimenti controllati. Avevamo uno scherzo tra gli studenti universitari nel nostro laboratorio quando facevo il dottorato nel 2000, che se potevi trovare tre immagini su cui funzionava il tuo algoritmo, potevi scrivere un articolo. Se funzionava su tre video, ottenevi un articolo molto buono! Il punto è che molti algoritmi di visione funzionavano solo in scenari di laboratorio curati e non erano molto robusti.
Ma adesso le cose sono cambiate. Con l’avvento dell’apprendimento automatico nel 2012, abbiamo visto alcuni rapidi e affascinanti progressi nella comprensione delle immagini. Quando abbiamo visto questo, abbiamo pensato che forse era il momento giusto per costruire prodotti solidi che potessero avere un impatto significativo.
Quali tipo di violazioni del traffico può monitorare Hazen.ai?
Il nostro obiettivo è quello di identificare tutti i tipi di comportamenti pericolosi alla guida sulle strade. Questo è guidato dal nostro obiettivo principale di ridurre le vittime della strada. Ogni 24 secondi, qualcuno muore in un incidente stradale, il che equivale a circa 15 aerei 787-8 che si schiantano ogni singolo giorno! Quindi questo è ciò che ci motiva. Per questo stiamo costruendo software che possa rilevare diversi tipi di comportamenti pericolosi e insicuri, come cambi di corsia non sicuri, curve illegali, attraversamento di un semaforo rosso o di un segnale di stop, ostruzione di un attraversamento pedonale, non indossare la cintura di sicurezza o guidare mentre si scrive un messaggio di testo. Stiamo anche lavorando per costruire funzionalità nel nostro software specificamente per la sicurezza dei pedoni e dei ciclisti, perché più della metà delle vittime degli incidenti stradali si verificano nel segmento di utenti della strada vulnerabili di pedoni, ciclisti e motociclisti.
Quali sono alcune delle sfide uniche dietro l’uso della visione artificiale per monitorare oggetti in movimento a velocità così elevate?
Ci sono due tipi di sfide: la prima è la prestazione degli algoritmi di visione artificiale stessi – si desidera avere un prodotto che possa funzionare in condizioni di traffico impegnative 24/7 in tutte le variazioni di luce. Mentre c’è stato un grande progresso tecnico verso questo obiettivo, ci sono ancora paesi in cui la densità degli utenti della strada è così alta, come gruppi di motociclette o pedoni in prossimità molto vicina, che è ancora una sfida per gli algoritmi seguire individualmente e comprendere la scena. Ma in secondo luogo, una sfida più grande è creare un prodotto solido a partire da algoritmi di visione artificiale, che possa essere distribuito su risorse hardware limitate sul bordo e possa essere monitorato e gestito facilmente nonostante sia distribuito in tutta la città. Poiché i prodotti di visione artificiale gestiscono grandi quantità di dati video, distribuirli sul bordo, come un dispositivo IoT, e gestirli efficacemente, rimane una sfida difficile.
Qual è il processo per l’utente finale per configurare il software per diverse configurazioni stradali?
Ogni incrocio fornisce uno scenario unico, in termini di volume di traffico, configurazione dei corsi e tipo di veicolo, ciclisti o interazioni pedonali. Inoltre, l’interesse dei gestori del traffico potrebbe essere specifico, per identificare un particolare tipo di comportamento del traffico in ogni sito. Ad esempio, la polizia stradale potrebbe vietare un’inversione di marcia in un incrocio per fluidificare il traffico e essere interessata a catturare quella statistica. Per questo motivo, abbiamo mantenuto il nostro software configurabile per diverse scenari. Quando una telecamera è impostata con il nostro software, lo configuriamo attraverso un processo semplice per ciò che l’utente finale richiede in quel sito. Internamente, abbiamo costruito un linguaggio di alto livello in cui possiamo descrivere in modo compatto scenari di traffico di interesse in un modo semplice. Ciò ci consente di configurare un sito rapidamente per i nostri clienti.
Qual è il tipo di hardware necessario per eseguire questo sistema?
L’analisi video richiede una notevole potenza di calcolo. Abbiamo ottimizzato il nostro codice per eseguirsi sui più piccoli GPU Nvidia che possono essere distribuiti sul bordo, come la loro serie Jetson, e anche su CPU Intel per alcune funzionalità che offriamo. Negli ultimi anni, hardware di bordo più potente sta diventando disponibile a un prezzo ragionevole, quindi questo sta realmente guidando molte applicazioni emozionanti.
Puoi discutere se alcune giurisdizioni stanno attualmente testando o utilizzando la tecnologia Hazen.ai?
Abbiamo ora prove in corso in diversi paesi, Regno Unito, Stati Uniti, Egitto, Arabia Saudita, Pakistan, Oman, Perù e stiamo coinvolgendo potenziali clienti in altri paesi.
C’è qualcos’altro che vorresti condividere su Hazen.ai?
Nel complesso, sentiamo che le tecnologie di sicurezza stradale non sono progredite abbastanza, rispetto alla scala del problema. Tuttavia, adesso il momento è giusto, grazie al grande progresso nella visione artificiale e nell’apprendimento automatico, nonché alla disponibilità a buon mercato di hardware per telecamere e calcolo. Vedremo molte più applicazioni di visione artificiale basata sul bordo negli anni a venire. Questi sono i fondamenti che guidano Hazen.ai.
Grazie per l’intervista, i lettori che desiderano saperne di più possono visitare Hazen.ai












