Інтерв’ю

Раду Русу, генеральний директор та співзасновник Fyusion – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Раду Русу – генеральний директор та співзасновник компанії Fyusion, яка має на меті створення нових, візуально привабливих 3D-технологій, які дозволять їм вирішувати складні візуальні проблеми за допомогою штучного інтелекту. Разом вони розробили і запатентували новий формат файлів, який називається .fyuse, який дозволяє людям захоплювати потрясаючі 3D-образи зі своїх смартфонів, що викликало соціальну медійну сенсацію і привернуло понад 100 мільйонів користувачів через мобільні програми для споживачів.

Ви працюєте над 3D-технологіями з 2012 року, зараз ви президент і генеральний директор компанії Open Perception, Inc. Чи можете Ви розповісти про місію цієї некомерційної організації?

Я розпочав свою кар’єру в галузі обробки 3D-даних у початку 2000-х років під час навчання в аспірантурі, з ідеєю зробити так, щоб робототехніка бачила і розуміла світ краще з візуальної точки зору. Це привело мене через близько десяти років досліджень у галузі робототехніки та 3D-комп’ютерного зору, і на початку 2010-х років я зрозумів, що те, над чим я працював, можна застосувати до набагато ширшого спектра проблем. Компанія Open Perception була створена як відокремлений підрозділ компанії Willow Garage, і взяла на себе одну з наших відкритих ініціатив – проєкт Point Cloud Library (PCL), і продовжила підтримувати його розвиток. Компанія Open Perception, Inc. була заснована в Каліфорнії у квітні 2012 року як незалежна організація, створена з метою підтримки розробки, розповсюдження та впровадження відкритого програмного забезпечення для обробки 2D/3D-даних, з застосуванням у сфері досліджень, освіти та розробки продукції.

У 2014 році Ви стали співзасновником і генеральним директором компанії Fyusion, Inc. Чи можете Ви розповісти про історію створення компанії Fyusion, Inc?

Під час роботи над робототехнічними дослідженнями співзасновники компанії Fyusion і я зрозуміли, що основними обмеженнями були не алгоритми, а формати даних. Штучний інтелект досягнув піку точності у багатьох галузях, але тип даних, який ми використовували, особливо у візуальних форматах, був двовимірним (наприклад, фотографії та відео), тоді як світ є тривимірним. Ми вважали, що існує потенціал для трансформації того, як люди розуміють світ, використовуючи 3D-дані у платформах машинного навчання.

У 2014 році ми вирішили створити новий тип 3D-даних, згенерованих за допомогою програмного забезпечення комп’ютерного зору та машинного навчання, об’єднавши кілька джерел даних і використовуючи дуже масштабоване апаратне забезпечення, доступне у наших кишенях – тобто, наші смартфони.

Ми заснували компанію Fyusion з метою створення нових, візуально привабливих 3D-технологій, які дозволять кожному вирішувати складні візуальні проблеми за допомогою штучного інтелекту.

Разом ми розробили і запатентували новий формат файлів, який називається .fyuse, який дозволяє людям захоплювати потрясаючі 3D-образи зі своїх смартфонів. Це одразу викликало соціальну медійну сенсацію і привернуло понад 100 мільйонів користувачів через мобільні програми для споживачів.

Що спочатку привернуло Вашу увагу до ідеї переосмислення значення 3D для споживчих застосунків?

Ми просто зрозуміли, що ніхто не займався цим у великому масштабі. Це була нерозв’язана проблема. Як і під час наших аспірантських програм, речі, які нас цікавлять інтелектуально, це дуже складні проблеми, які хтось сказав, що не можна вирішити.

У цьому випадку, до певної міри, вони були праві. Тип алгоритмів, необхідних для вирішення цієї проблеми, був тільки частково продуманий, а апаратне забезпечення, необхідне для їх виконання, не існувало, особливо на мобільних пристроях, таких як смартфони. Насправді нам довелося чекати, поки не вийшов iPhone 4S, щоб ми могли запускати код комп’ютерного зору в реальному часі на смартфоні, оскільки до цього часу в iPhone був тільки один процесорний ядро. Як тільки ми побачили, що може зробити апаратне забезпечення смартфона, ми стали дуже зацікавлені у тому, щоб взяти наші знання у галузі комп’ютерного зору та робототехніки і побачити, що ми можемо вписати у ці маленькі камери та процесори/графічні процесори. Це зайняло деякий час, щоб повернутися до малювання і переосмислити, як уявити і реалізувати захоплення світлового поля та обробку всього через програмне забезпечення. Як тільки ми побачили, що це працює, компанія Fyusion була на ходу.

У нас були 2D-фотографії у вигляді аналогових носіїв, а потім вони були оцифровані разом з усім іншим. Єдина реалізація, яку ми мали у світі 3D, була у вигляді “трикутної сітки з текстурою” (наприклад, формати файлів типу OBJ), які походили з комп’ютерних ігор та комп’ютерної графіки і були призначені для представлення штучно створених об’єктів у грі. Вони сильно залежать від ідеальної геометрії, яку неможливо отримати – як ви можете захопити і представити воду у вигляді трикутної сітки з текстурою за допомогою камери? Що стосується прозорих об’єктів? Листя? Речей, які знаходяться далеко? І так далі…

Було зрозуміло, що хтось повинен зайнятися створенням споживчих 3D-форматів. Це повинно бути засновано на зовсім іншому парадигмі і вирішено у спосіб “рендерингу 3D-образів” (тобто, світлових полів), і включати інформацію, яка доступна під час захоплення (наприклад, орієнтація камери через гіроскопічний датчик), яка зазвичай викидається, коли ви захоплюєте 2D-образ. І потім, звичайно, ми намагаємось відновити цю викинуту інформацію за допомогою машинного навчання.

Це була наша можливість, і це те, про що повинні мріяти стартапи: знайти дуже складну проблему, яку вони пристрасно люблять, дочекатися правильного часу і можливості, і зробити все можливе, щоб вирішити її.

Який процес створення .fyuse за допомогою мобільного застосунку?

Ми ще на початку цієї технології, але суть у тому, що: Ви берете смартфон, який має застосунок, написаний компанією Fyusion або партнерським застосунком, який використовує наш SDK Fyusion ALIS, і відкриваєте камеру. Ви отримуєте інструкції, що робити, і якщо ви слідуєте їм, ви отримуєте .fyuse на пристрої, який є об’єктом файлу, обробленим за допомогою комп’ютерного зору та машинного навчання, який можна відтворити на пристрої, у вебі або на будь-якому шоломі доповненої реальності.

Які комп’ютерні технології використовуються для створення цієї реальності?

Насправді немає срібної кулі тут, а лише величезна суміш 3D-комп’ютерного зору та машинного навчання, яку ми створили для вирішення цієї проблеми. Є ідеї з фотограмметрії (оскільки ми фактично створюємо віртуальну камеру, рухаючи одну камеру у просторі), робототехніки (велика проблема фузії датчиків, оскільки у нас немає однієї камери, а цілий ряд датчиків, з яких можна витягнути дані, щоб допомогти вирішити цю проблему), комп’ютерної графіки (ви можете глянути на нашу роботу на конференції Siggraph 2019, щоб зрозуміти, як ми представляємо деякі з підлеглих структур), і багато іншого. Все це мало бути зроблено на пристрої і запущено в реальному часі, що означає, що ми використовуємо комп’ютерні шейдери та пишемо код на асемблері. Як вже згадувалося, це лише початок, і чим більше датчиків та обчислювальної потужності стане доступним нам, тим більше ми будемо використовувати наш двигун ALIS, щоб покращити різні аспекти технології. Це довгострокова візія, і перед нами ще понад десятиріччя роботи, щоб бути повністю задоволеними тим, як виглядають оцифровані складні реальні сцени.

Як .fyuse можуть бути використані у поточних застосунках доповненої реальності?

Ми вважаємо, що будь-який застосунок доповненої реальності, у якому оцифровування реального об’єкта та його відображення є важливим, повинен виграти від використання нашого двигуна ALIS та .fyuse. Там немає нестачі у вертикальних застосунках та галузях, таких як електронна комерція, охорона здоров’я, автомобільна промисловість, освіта та багато іншого, і ми дуже раді цьому майбутньому.

Який Ви бачите майбутнє застосунків доповненої реальності для .fyuse?

Ми не бачимо жодних обмежень для поточної технології, хоча наш основний фокус зараз більше на малих та середніх сценах та об’єктах, а не на великих міських пейзажах.

Я легко уявляю собі використання .fyuse у майбутніх застосунках доповненої та змішаної реальності. Який Ваш погляд на майбутнє .fyuse у цих умовах?

Ми ставимося до всіх застосунків доповненої, віртуальної та змішаної реальності точно однаково: як тільки 3D-об’єкт було оцифрований за допомогою нашої технології, його можна витягнути зі сцени та розмістити будь-де.

Чи обговорювала Ваш команда можливість створення .fyuse з віртуальним помічником або штучним інтелектом?

Ми не досліджували можливість створення інтерактивних віртуальних аватарів для людей. Це цікава можливість, але ми намагаємось залишатися сфокусованими на вирішенні поточної серії проблем, над якими ми працюємо.

Чи є щось ще, про що Ви хотіли б розповісти про .fyuse або компанію Fyusion, Inc?

Це може звучати як реклама, але… ми команда божевільних робототехніків та вчених у галузі 3D-комп’ютерного зору, змішаних з фізиками з ЦЕРН, чудовими хакерами та інженерами, і це лише опис членів нашої основної технічної команди. Ми любимо різноманітність усіх видів, оскільки це робить нас розумнішими та сильнішими як команда. Якщо щось, над чим ми працюємо, цікавить когось, хто читає це, то, будь ласка, не будьте сором’язливими та зв’яжіться з нами. Ми робимо все можливе, щоб відповісти кожному, і ви можете знайти себе у ситуації, коли ви прийдете до нас на каву та залишитеся на десятиліття.

Дякуємо за великі інтерв’ю, читачам, які бажають дізнатися більше, рекомендуємо відвідати Fyusion.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.