Інтерв’ю
Гіл Ельбаз, співзасновник та технічний директор Datagen – Серія інтерв’ю

Гіл Ельбаз – технічний директор та співзасновник Datagen, базується в Тель-Авіві. Він отримав ступінь бакалавра та магістра в Техніоні. Дослідження Гіла було зосереджено на 3D комп’ютерному баченні та було опубліковано на CVPR, найвищій конференції з комп’ютерного бачення у світі. Datagen – піонер у новій галузі Симульованих Даних, підмножині синтетичних даних, яка зосереджується на фотореалістичному відтворенні світу навколо нас. Компанія вийшла зі стартапу з понад 18 мільйонами доларів фінансування у березні 2021 року та зараз працює з багатьма компаніями Fortune 100 у сфері доповненої/віртуальної реальності, робототехніки та автомобільної промисловості, включаючи більшість найбільших технологічних гігантів США.
Що спочатку привернуло вас до робототехніки та машинного навчання?
Книги наукової фантастики, такі як серія “Фундація” Айзека Азімова та “Я, робот”, завжди заставляли мене думати про майбутнє, в якому робототехніка буде невід’ємною частиною нашого щоденного життя. Є так багато нудних, повторюваних завдань, які виконують люди; я знав, що не хочу робити їх, і не міг уявити, що хто-небудь інший хоче. Розглядаючи робототехніку як технологічну невідворотність, я подумав, що рух у цьому напрямку буде розумним, “безпечним” кар’єрним рішенням.
Отже, спочатку я підійшов до цієї галузі, зосередившись на фізичних аспектах предмета, і отримав ступінь у галузі машинобудування в Техніоні в Хайфі, Ізраїль. До кінця свого навчання я почав глибоко вивчати світ інструментів та можливостей CAD. Це інструменти, які дозволяють інженерам-механікам проектувати конструкції та механічні пристрої (від моста до машини). Я побачив величезну можливість зробити великий вплив без пов’язаних з повільними ітераціями фізичного світу. На практиці ці програми мали дуже мало, якщо не жодних, можливостей машинного навчання/комп’ютерного бачення, інтегрованих у них, які допомагали інженерам створювати простіші, дешевші та більш стабільні механічні системи (це було у 2015 році). Я пішов у напрямку комп’ютерного бачення на 3D-даних з глибоким навчанням (дуже новим на той час) з метою створення розумніших програм CAD. Робота у перших днях сучасного глибокого навчання відчувалася як участь у чомусь, що могло бути справді великим – подібно до інтернету.
На практиці моє дослідження було першим, яке принесло революцію глибокого навчання до нашого факультету в Техніоні. Це пізніше перетворилося на статтю, прийняту до найвищої конференції з комп’ютерного бачення у світі, CVPR, і я літав на Гавайські острови на CVPR 2017. Презентація моєї статті та зустріч з людьми відкрили мені очі на масштаб спільноти комп’ютерного бачення (яка сьогодні є принаймні у 10 разів більша), тисячі учасників, які з великим ентузіазмом працюють над дослідженнями у цій галузі. Ця подія майже закріпила мій напрямок, показавши мені силу комп’ютерного бачення та потенціал, який чекає на своє відкриття.
Чи можете ви поділитися історією створення Datagen?
Datagen була заснована у 2018 році з місією перетворити спосіб, у який команди отримують дані для навчання комп’ютерного бачення. Рік тому ми побачили демонстрацію Oculus Rift, яка складалася з шолома віртуальної реальності та ручного пристрою дистанційного керування. Після демонстрації ми почали думати: “із складними камерами, вбудованими в шолом, чому потрібен ручний пристрій для підключення віртуального простору до фізичного простору (тобто для відстеження руху руки)?” Нейронні мережі вже були досить складними, щоб обробляти це, тому що була проблема?” І саме тоді спалахнула лампочка – Дані! Ми негайно побачили величезну можливість вирішити проблеми 3D-просторової присутності за допомогою передових комп’ютерних бачень та 3D-метаданих. Натомість ніж зосередитися виключно на VR/AR, ми підійшли до цього більш цілісно, зосередившись на проблемі генерації достатньої (та точної) навчальної інформації для реалізації реальних застосунків 3D-штучного інтелекту.
З фокусом на людях та взаємодії людини з середовищем, Datagen – піонер у новій галузі Симульованих Даних, підмножині синтетичних даних, яка зосереджується на фотореалістичному відтворенні світу навколо нас. Сьогодні ми працюємо з найбільш інноваційними компаніями у світі, щоб підживлювати та прискорювати розвиток комп’ютерного бачення та підтримуються деякими з найбільш шанованих інвесторів у цій галузі.
Для читачів, які незнайомі, можете ви пояснити, що саме є синтетичними даними?
Синтетичні дані – це будь-які навчальні дані, які замість того, щоб бути зібраними шляхом прямого вимірювання або спостереження за реальним світом, генеруються або алгоритмічно, або за допомогою симуляції. У контексті комп’ютерного бачення синтетичні дані – це комп’ютерно-генеровані зображення з пов’язаними метаданими, необхідними для навчання штучних інтелектів. З урахуванням проблем конфіденційності та реальних фізичних та економічних обмежень реальних даних, важливо не перебільшувати значення синтетичних даних для машинного навчання та штучного інтелекту. У недавньому звіті Gartner передбачив, що до 2024 року більшість даних, використовуваних у галузі штучного інтелекту, будуть штучно генеровані з цих причин.
Які є деякі переваги синтетичних даних порівняно з ручним збиранням даних?
Коротка відповідь така: подумайте про кожен аспект ручного збирання даних, який є нежаданим, і видаліть їх з процесу – це переваги синтетичних даних.
Генерація різноманітних наборів даних у великих масштабах для навчання комп’ютерного бачення – це дорогий, часозатратний процес, і варіативність дуже обмежена лише тим фактом, що розміщення людей у певних місцях та фотографування їх – це складний процес – набагато складніший і дорожчий, ніж робити це у симульованому середовищі. Іншою великою перевагою є ефективне усунення необхідності ручної анотації, яка є нудною, часозатратною та схильною до помилок людини.
Datagen називають симульовані дані підмножиною синтетичних даних. Чи можете ви пояснити, що саме є симульованими даними?
Симульовані дані – це синтетичні дані, які генеруються за допомогою симуляції. Ми використовуємо GANs (а також деякі інші передові методи машинного навчання) для генерації 3D-об’єктів та розміщення їх у високореалістичних 3D-симуляціях реального світу. Це виглядає як процес “віртуальної фотозйомки” з першої особи, але працює у фотореалістичній, фізично-основаній системі. Ці симуляції генерують візуальні дані (якби вони були зібрані у реальному світі), разом з повним рядом анотацій (фізика, освітлення тощо). Отже, Симульовані Дані – це синтетичні дані, які є фотореалістичними, контекстно-генерованими, 3D-образами, зібраними у симульованому середовищі.
Як Datagen генерує налаштовані симульовані дані?
Технологія Datagen генерує симульовані дані, які є як масштабованими, так і налаштованими для задоволення унікальних потреб кожної клієнтської програми. Ми робимо це, враховуючи кожний аспект кожного проекту – від системи комп’ютерного бачення, яка використовується, до демографічного складу регіону, у якому вона буде працювати. Чи працюємо ми безпосередньо з нашими клієнтами, чи просто дозволяємо їм використовувати своїх інженерів, процес Datagen починається з встановлення ключових параметрів для кожної конкретної програми, таких як специфікації об’єктива, освітлення, середовище, демографічний розподіл тощо. Datagen використовує GANs та інші передові інструменти та техніки для генерації величезної кількості активів, включаючи все, від людських голів з динамічними виразами обличчя для навчання штучного інтелекту у аналізі емоцій, до інтер’єрів транспортних засобів для моніторингу пасажирів у кабіні, та домашніх середовищ для застосунків відеоконференцій, лише для початку. Для кожного типу активів Datagen вводить варіативність по безлічі дискретних осей (від кольору шкіри та висоти брів до розміру, кольору та форми меблів для домашніх середовищ), використовуючи параметри, які тонко налаштовані для відображення конкретної програми.
Завдяки цим можливостям, набори даних Datagen не тільки великі та різноманітні, але й оптимізовані для цілей навчання унікальної системи виконання унікальної задачі (або набору завдань) у унікальному середовищі або обстановці, в якій вона буде використовуватися – все це без компромісу щодо масштабованості. Ми також враховуюємо конкретні вимоги до анотації/метаданих кожної програми.
Які є деякі приклади рішень у робототехніці, де використовуються синтетичні та/або симульовані дані?
Однією з найбільших переваг використання симульованих даних у робототехніці є можливість генерації зображень апаратного забезпечення, яке ще знаходиться у стадії розробки. Це дозволяє розробляти “мозок” робота (штучний інтелект) та “тіло” робота (апаратне забезпечення) паралельно. Тепер навчання може розвиватися паралельно з еволюцією специфікацій, а не чекати, поки остаточний продукт буде повністю прототипований, перш ніж можна буде фотографувати його та починати розробляти штучний інтелект.
Також, оскільки симульовані дані генеруються у контексті, можна легше врахувати взаємодію між роботом та його середовищем. Тому, якщо ви уявите собі робота, який забирає та видаляє дефектні продукти з конвеєра, симульовані дані дозволили б вам не тільки згенерувати дані для кожного фізичного дефекту продукту, а й з точки зору робота, щоб захопити повний діапазон руху роботизованої руки, її взаємодію з об’єктом, який вона захоплює. Що більше, 3D-метадані означають, що немає потреби у ручній анотації зображень, щоб забезпечити можливість робота правильно ідентифікувати продукт, дефекти, свою руку або будь-що інше у полі зору.
Які є деякі випадки використання симульованих даних у розумних автомобілях?
Симульовані дані у розробці розумних автомобілів роблять нескінченно легшим розробку наборів даних для конкретних моделей автомобілів під час їхнього проектування, ітеруючи у концерті з автомобілем самим під час його проходження через різні стадії проектування та виробництва. З симульованими даними інженери також можуть використовувати бачення у кабіні більш ефективно для ідентифікації сонних чи відволіканих водіїв, якщо водій зняв руку з керма, або будь-яких інших крайніх випадків для забезпечення безпеки водія. Це також дозволяє інженерам врахувати більшу різноманітність водіїв та пасажирів та вводити варіативність у вигляді кута зображення та освітлення – все це без порушення конфіденційності реальних людей.
Нещодавно Datagen оголосила про велику кількість цікавих нових наймів, що це означає для майбутнього компанії?
Нещодавні доповнення до нашої ради директорів та виконавчого керівництва включають деяких з найбільш талановитих та досвідчених професіоналів у галузі штучного інтелекту та комп’ютерного бачення. Їхні знання, бачення та досвід допоможуть орієнтувати та прискорити зростання Datagen, коли ми навігуюємо у галузі, яка ще молода та повна можливостей. У галузі з так nhiều невідомими, нічого не є більш цінним, ніж знання.
Чи є щось інше, що ви хотіли б поділитися про Datagen?
Базуючись у Тель-Авіві, Datagen є частиною великої економічної та культурної зміни, яка відбулася в Ізраїлі, і ми пишаємося бути частиною цього. За короткий період часу Ізраїль (Тель-Авів зокрема) перетворився на великий глобальний технологічний хаб, з процвітаючою екосистемою стартапів та енергійною інвестиційною спільнотою. Хоча Ізраїль часто вважається центром кібербезпеки, технології, орієнтовані на штучний інтелект та дані, виросли експоненціально за останні роки. Сьогодні існує понад 680 компаній штучного інтелекту в Ізраїлі, які разом зібрали 4,5 мільярда доларів. Цей вибуховий рост за останні кілька років відбувається в основному завдяки високій концентрації інженерів та світовим університетам Ізраїлю. Ці академічні установи забезпечують доступ до талантів та передових технологій у галузі. За останні два місяці Datagen найняла понад 20 працівників та планує прийняти додаткових членів команди у сфері продажів, маркетингу, програмного забезпечення, DevOps та продукції.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Datagen.












