Інтерв’ю

Сохаїб Хан, співзасновник та генеральний директор Hazen.ai – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Сохаїб Хан – співзасновник та генеральний директор Hazen.ai, компанії, яка використовує комп’ютерне бачення та глибоке навчання для розробки інтелектуального програмного забезпечення для аналізу трафіку, яке здатне «розуміти» рух кожного транспортного засобу.

Що спочатку привернуло вашу увагу до галузі штучного інтелекту?

Це було під час навчання в університеті, коли я вперше прочитав про те, як працює стереозір (або бінарне зір – оцінка глибини з двох камер). Це захопило мене, і я вирішив глибше вивчити комп’ютерне бачення. Цікаво, що я вперше прочитав про це в книзі, яку купив на традиційному п’ятничному ринку, де продавалися старі книги на тротуарі в нашому місті. Потім я захистив дисертацію в цій галузі в США.

Ви раніше були професором одного з найбільших університетів Пакистану – Університету менеджменту Лахора (LUMS). Які були ваші викладацькі та дослідницькі інтереси?

Коли я вступив до LUMS після захисту дисертації, я створив першу лабораторію для аспірантів в університеті, за рахунок фінансування, яке отримав від великої організації оборони. Програма для аспірантів з комп’ютерних наук була досить новою, і на той час не було дослідницьких лабораторій. Я викладав комп’ютерне бачення протягом 12 років в LUMS і мав активну лабораторію в цій галузі. Спочатку комп’ютерне бачення майже не викладалося в пакистанських університетах, але пізніше воно стало стандартним предметом, і насправді багато моїх студентів зараз також викладають в пакистанських університетах.

Можете розповісти про те, що спонукало вас створити стартап, який спеціалізується на комп’ютерному баченні та алгоритмах глибокого навчання для відеоаналітики?

Комп’ютерне бачення протягом тривалого часу було в основному експериментальним дослідницьким полем з обмеженими застосуваннями в продуктах. Це було головним чином через те, що алгоритми, необхідні для створення продуктів, ще не досягли достатнього рівня зрілості. Для продукту алгоритм розуміння зображення повинен працювати в різних умовах зображення та освітлення, а не лише в деяких контрольованих експериментах. У нас була жартівлива фраза серед аспірантів у нашій лабораторії, коли я робив дисертацію в 2000 році, що якщо ви можете знайти три зображення, на яких ваш алгоритм працює, ви можете написати статтю. Якщо він працює на трьох відео, ви отримуєте дуже хорошу статтю! Суть в тому, що багато алгоритмів бачення працювали лише в контрольованих лабораторних сценаріях і не були дуже стійкими.

Але зараз все змінилося. З появою глибокого навчання в 2012 році ми побачили дуже швидкий і цікавий прогрес у розумінні зображень. Коли ми побачили це, ми відчули, що зараз час створити солідні продукти, які можуть мати значний вплив.

Які види порушень правил дорожнього руху може контролювати Hazen.ai?

Наша мета – ідентифікувати всі види небезпечної поведінки водіїв на дорогах. Це викликано нашою основною метою – зменшення кількості загиблих у дорожньо-транспортних пригодах. Кожні 24 секунди хтось гине в результаті ДТП, що еквівалентно приблизно 15 літакам Boeing 787, які розбиваються кожну добу! Тому ми будемо створювати програмне забезпечення, яке зможе виявляти різні види небезпечної та безпечної поведінки, такі як небезпечне зміна смуги, незаконні повороти, проїзд на червоний світлофор або знак «стоп», блокування пішохідного переходу, не використання ременя безпеки або текстування під час водіння. Ми також працюємо над створенням функцій в нашому програмному забезпеченні спеціально для безпеки пішохідів та велосипедистів, оскільки більш ніж половина загиблих у ДТП припадає на вразливі учасники дорожнього руху – пішохідів, велосипедистів та мотоциклістів.

Які унікальні виклики стоять за використанням комп’ютерного бачення для контролю об’єктів, що рухаються з такою високою швидкістю?

Є два види викликів: Перший – це продуктивність самих алгоритмів комп’ютерного бачення – ви хочете мати продукт, який зможе працювати в складних умовах руху 24/7 у всіх варіантах освітлення. Хоча було багато прогресу в цьому напрямку, все ще є країни, в яких густота учасників руху така висока, як кластери мотоциклів або пішохідів у дуже близькій відстані, що це все ще виклик для алгоритмів – відстежувати їх індивідуально та розуміти сцену. Але другий, більший виклик – створення солідного продукту з алгоритмів комп’ютерного бачення, який можна розгорнути на обмежених апаратних ресурсах на краю мережі та можна легко контролювати та керувати, незважаючи на те, що вони розподілені по всьому місту. Оскільки продукти комп’ютерного бачення обробляють велику кількість відеоданих, їх розгортання на краю мережі, як пристрою IoT, та ефективне керування ними залишається складною задачею.

Який процес налаштування програмного забезпечення для різних конфігурацій доріг для кінцевого користувача?

Кожний перехресток забезпечує унікальний сценарій, щодо інтенсивності руху, конфігурації смуг та типу транспортного засобу, велосипедистів чи пішохідів. Крім того, інтереси керівників руху можуть бути конкретними, щоб ідентифікувати певний тип поведінки на дорозі в кожному місці. Наприклад, поліція руху може заборонити поворот у перехресті, щоб поліпшити рух, і вони зацікавлені у тому, щоб захопити цю статистику. Тому ми зробили наше програмне забезпечення конфігуровним для різних сценаріїв. Коли камера встановлюється з нашим програмним забезпеченням, ми налаштуємо його через простий процес для того, що кінцевий користувач потребує в цьому місці. Внутрішньо ми створили високорівневу мову, за допомогою якої можна компактно описати сценарії руху, які нас цікавлять, простим способом. Це дозволяє нам швидко налаштувати місце для наших клієнтів.

Який апаратний засіб необхідний для роботи цієї системи?

Відеоаналітика вимагає значної обчислювальної потужності. Ми оптимізували наш код для виконання на менших графічних процесорах Nvidia , які можна розгорнути на краю мережі, таких як їх серія Jetson, та на процесорах Intel для деяких функцій, які ми пропонуємо. Останнім часом більш потужне апаратне забезпечення краю мережі стає доступним за прийнятною ціною, тому це справді сприяє багатьом цікавим застосуванням.

Чи можете ви розповісти про те, чи будь-які юрисдикції зараз проводять випробування або використовують технологію Hazen.ai?

У нас зараз тривають випробування в кількох країнах, у Великій Британії, США, Єгипті, Саудівській Аравії, Пакистані, Омані, Перу, та ми ведемо переговори з потенційними клієнтами в інших країнах.

Чи є щось ще, що ви хотіли б поділитися про Hazen.ai?

У цілому ми вважаємо, що технології безпеки дорожнього руху не просунулися досить далеко, порівняно з масштабом проблеми. Однак зараз час правий, завдяки величезному прогресу в комп’ютерному баченні та глибокому навчанні, а також дешевій доступності камер та апаратного забезпечення. Ми побачимо ще більше застосувань комп’ютерного бачення на краю мережі в найближчі роки. Це є основою, яка рухає Hazen.ai.

Дякуємо за інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Hazen.ai

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.