Wywiady

Radu Rusu, CEO & Co-Founder of Fyusion – Wywiad

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Radu Rusu, jest CEO & Co-Founder of Fyusion, firmy, której celem jest budowanie nowych, wizualnie imponujących technologii 3D, które umożliwią rozwiązanie złożonych problemów wizualnych za pomocą sztucznej inteligencji. Wspólnie opracowali i opatentowali nowy format plików, zwany .fyuse, który pozwala ludziom na przechwytywanie imponujących obrazów 3D za pomocą swoich smartfonów, co spowodowało sensację w mediach społecznościowych i przyciągnęło ponad 100 milionów użytkowników za pośrednictwem aplikacji mobilnych.

Pracujesz nad technologiami 3D od 2012 roku, obecnie jesteś prezesem i CEO Open Perception, Inc. Czy mógłbyś podzielić się misją tej organizacji non-profit?

Zacząłem swoją karierę w przetwarzaniu danych 3D na początku lat 2000, podczas studiów podyplomowych, z pomysłem, że sprawię, iż roboty będą lepiej widzieć i rozumieć świat z perspektywy wizualnej. To doprowadziło mnie do dekady badań nad robotyką i przetwarzaniem wizualnym, a na początku lat 2010 zorientowałem się, że to, nad czym pracowałem, mogło być zastosowane do szerszego zakresu problemów. Open Perception zostało utworzone jako spin-off z Willow Garage i kontynuowało rozwój projektu Point Cloud Library (PCL), który był naszym projektem oprogramowania open source na licencji BSD. Open Perception, Inc. zostało zarejestrowane w Kalifornii w kwietniu 2012 roku jako niezależna organizacja utworzona w celu wspierania rozwoju, dystrybucji i wdrożenia oprogramowania open source do przetwarzania danych sensorycznych 2D/3D, stosowanego w badaniach, edukacji i rozwoju produktów.

W 2014 roku zostałeś współzałożycielem i CEO Fyusion, Inc. Czy mógłbyś podzielić się historią powstania Fyusion, Inc?

Podczas badań nad robotyką, współzałożyciele Fyusion i ja zorientowaliśmy się, że wąskie gardło nie leży już w algorytmach, lecz w formatach danych. Sztuczna inteligencja osiągnęła wówczas szczyt dokładności w wielu dziedzinach, ponieważ typ danych, których używaliśmy, szczególnie w formatach wizualnych, był dwuwymiarowy (takich jak fotografie i filmy), podczas gdy świat jest trójwymiarowy. Uznaliśmy, że istnieje potencjał, aby przekształcić sposób, w jaki ludzie postrzegają świat, wykorzystując dane 3D w platformach sztucznej inteligencji.

W 2014 roku postanowiliśmy stworzyć nowy typ danych 3D, generowanych za pomocą oprogramowania komputerowego i sztucznej inteligencji, łącząc wiele źródeł danych i wykorzystując bardzo skalowalne sprzęt komputerowy dostępny w naszych kieszeniach, czyli nasze smartfony.

Utworzyliśmy Fyusion z celem budowania nowych, wizualnie imponujących technologii 3D, które umożliwią wszystkim rozwiązywanie złożonych problemów wizualnych za pomocą sztucznej inteligencji.

Wspólnie opracowaliśmy i opatentowaliśmy nowy format plików, zwany .fyuse, który pozwala ludziom na przechwytywanie imponujących obrazów 3D za pomocą swoich smartfonów. To natychmiast spowodowało sensację w mediach społecznościowych i przyciągnęło ponad 100 milionów użytkowników za pośrednictwem aplikacji mobilnych.

Czy mógłbyś powiedzieć, co Cię początkowo przyciągnęło do pomysłu zrewolucjonizowania znaczenia 3D w aplikacjach konsumenckich?

Prosto mówiąc, nikt wcześniej nie rozwiązał tego problemu w takiej skali. Był to nierozwiązany problem. Podobnie jak w naszych programach doktoranckich, rzeczy, które nas intelektualnie ekscytują, to naprawdę skomplikowane problemy, które ktoś powiedział, że nie mogą być rozwiązane.

W tym przypadku, w pewnym sensie, mieli rację. Algorytmy wymagane do rozwiązania tego problemu były tylko częściowo przemyślane, a sprzęt niezbędny do ich uruchomienia nie istniał, szczególnie na urządzeniach krawędziowych, takich jak smartfony. Musieliśmy naprawdę czekać, aż iPhone 4S zostanie wydany, abyśmy mogli uruchomić kod komputerowej wizji 3D w czasie rzeczywistym na smartfonie, ponieważ wcześniej iPhone miał tylko jeden rdzeń CPU. Gdy zaczęliśmy widzieć, co może zrobić sprzęt smartfona, bardzo nas zainteresowało wykorzystanie naszej wiedzy z zakresu komputerowej wizji i robotyki, aby zobaczyć, co możemy wcisnąć w te małe kamery i procesory/GPU. Zajęło to trochę czasu, aby wrócić do planszy i przemyśleć, jak wyobrazić i zaimplementować przechwytywanie i przetwarzanie pola światła za pomocą oprogramowania. Gdy zobaczyliśmy, że to działa, Fyusion ruszyło pełną parą.

Mieliśmy wcześniej zdjęcia 2D w formie analogowej, a potem zostały one zdigitalizowane razem z wszystkim innym. Jedyną instancją, jaką mieliśmy w świecie 3D w skali, była „siatka trójkątów z teksturowaniem” (np. formaty plików OBJ), które pochodziły z gier komputerowych i grafiki komputerowej i były przeznaczone do reprezentowania obiektów stworzonych sztucznie w grze. Bardzo zależą one od idealnej geometrii, co jest niemożliwe do uzyskania – jak przechwycić i reprezentować wodę jako siatkę trójkątów z kamerą? Co z obiektami przezroczystymi? Liśćmi? Rzeczami, które są daleko? I tak dalej…

Było jasne, że ktoś musi rozwiązać problem formatów 3D przyjaznych dla konsumentów. Musiało to być oparte na zupełnie innym paradygmacie i rozwiązane w sposób „renderowania obrazu 3D” (tj. pola światła), oraz uwzględniać informacje dostępne w momencie przechwytywania (takie jak orientacja kamery za pomocą czujnika żyroskopowego), które zwykle są odrzucane podczas przechwytywania obrazu 2D. A potem, oczywiście, próbujemy odtworzyć tę odrzuconą informację za pomocą sztucznej inteligencji.

To była nasza okazja, i to jest to, czego powinny pragnąć startupy: znaleźć naprawdę trudny problem, o którym są pasjonaci, poczekać na odpowiedni moment i otwarcie, i szaleć, próbując go rozwiązać.

Proces tworzenia immersyjnych, interaktywnych obrazów 3D zwanych .fyuse polega na poruszaniu kamerą wokół osoby, obiektu lub sceny. Czy mógłbyś opowiedzieć o tym procesie dla kogoś, kto chce utworzyć .fyuse za pomocą aplikacji mobilnej?

Jeszcze nie jesteśmy w pełni rozwinięci w tej technologii, ale istota tego jest taka: bierzesz smartphone, który ma aplikację napisaną przez Fyusion lub aplikację partnerską, która wykorzystuje nasze Fyusion ALIS SDK, i otwierasz kamerę. Otrzymujesz instrukcje, co robić, i jeśli je wykonasz, otrzymujesz .fyuse na urządzeniu, który jest obiektem pliku przetworzonym za pomocą komputerowej wizji i sztucznej inteligencji, który możesz wyświetlić na urządzeniu, w sieci lub na dowolnym zestawie AR/VR/MR.

Jakie technologie komputerowej wizji i sztucznej inteligencji są wykorzystywane do realizacji tego?

Nie ma tu srebrnej kulki, ale ogromna mieszanka narzędzi komputerowej wizji i sztucznej inteligencji, które stworzyliśmy do rozwiązania tego problemu. Są to pomysły z fotogrametrii (ponieważ skutecznie tworzymy wirtualną macierz kamer, poruszając jedną kamerą w przestrzeni), robotyki (ogromny problem fuzji sensorycznej, ponieważ nie mamy już jednej kamery, ale cały zestaw czujników, z których możemy ściągać dane, aby pomóc w rozwiązaniu tego problemu), grafiki komputerowej (możesz zajrzeć do naszej pracy na Siggraph 2019, aby zrozumieć, jak reprezentujemy niektóre z podstawowych struktur), i wiele innych. Wszystko to musiało być zrobione na urządzeniu i działać w czasie rzeczywistym, co oznacza, że wykorzystujemy compute shadery i piszemy kod w asemblerze. Jak wspomniano, to jest tylko początek, a im więcej czujników i mocy obliczeniowej będzie dostępnych, tym więcej będziemy wykorzystywać nasz silnik ALIS, aby poprawić wiele aspektów tej technologii. To jest długoterminowa wizja, a przed nami jest jeszcze ponad dekadę pracy, aby być w pełni zadowolonymi z tego, jak wyglądają zdigitalizowane skomplikowane sceny świata.

Łatwo jest wyobrazić sobie, jak .fyuse będą rewolucjonizować aplikacje VR. Czy mógłbyś opowiedzieć o typach aplikacji VR, w których .fyuse mogą być wykorzystane?

Uważamy, że KAŻDA aplikacja VR, w której digitalizacja obiektu świata rzeczywistego i jego wyświetlanie jest ważne, powinna skorzystać na wykorzystaniu naszego silnika ALIS i .fyuse. Nie ma braku pionów i aplikacji w e-commerce, ochronie zdrowia, motoryzacji, edukacji i poza tym, i jesteśmy bardzo podekscytowani tą przyszłością.

Czy mógłbyś powiedzieć, jak wyobrażasz sobie przyszłość aplikacji VR dla Fyuse?

Nie widzimy żadnych ograniczeń dla obecnej technologii, chociaż nasza obecna koncentracja jest bardziej ukierunkowana na małe do średnich sceny i obiekty, a nie na duże pejzaże miejskie.

Łatwo jest wyobrazić sobie Fyuse wykorzystywane w przyszłych aplikacjach rozszerzonej rzeczywistości (AR) i mieszanej rzeczywistości (MR). Czy mógłbyś opowiedzieć o swojej wizji przyszłości Fyuse w środowisku AR i MR?

Traktujemy wszystkie aplikacje AR/VR/MR dokładnie tak samo: gdy obiekt 3D zostanie zdigitalizowany za pomocą naszej technologii, może być wyodrębniony ze sceny i umieszczony gdziekolwiek.

Czy Twoja drużyna omawiała pomysł stworzenia Fyuse z wirtualnym asystentem lub AI?

Nie zbadaliśmy możliwości stworzenia interaktywnych awatarów wirtualnych dla ludzi. To jest interesująca możliwość, ale starujemy się pozostać skupieni na rozwiązywaniu bieżącego zestawu problemów, nad którymi pracujemy.

Czy jest coś jeszcze, co chciałbyś podzielić się na temat Fyuse lub Fyusion, Inc?

To może brzmieć jak pitch, ale… jesteśmy grupą szalonych robotyków i naukowców komputerowej wizji, wymieszanych z fizykami z CERN, niesamowitymi hakерами i inżynierami, a to tylko opisuje członków naszego rdzenia technicznego. Lubicie różnorodność wszelakiej maści, ponieważ to czyni nas mądrzejszymi i silniejszymi jako zespół. Jeśli coś, nad czym pracujemy, jest interesujące dla kogoś, kto to czyta, nie wahaj się skontaktować z nami. Robimy wszystko, co w naszej mocy, aby odpowiedzieć na każde pytanie, i możesz znaleźć się w sytuacji, w której przyjdziesz na kawę i zostaniesz na dekadę.

Dziękujemy za wspaniałe wywiady, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Fyusion.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.