Interviews

Radu Rusu, CEO & Co-Founder of Fyusion – Interview Serie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Radu Rusu, er CEO & Co-Founder of Fyusion, et firma, der har målet at opbygge nye, visuelt slående 3D-teknologier, der kan løse komplekse visuelle problemer med kunstig intelligens. Sammen udviklede de og patenterede et nyt filformat kaldet .fyuse, der giver folk mulighed for at fange slående 3D-billeder fra deres smartphones, hvilket fik en social medie-sensation og tiltrak over 100 millioner brugere gennem forbruger-mobilapplikationer.

Du har arbejdet med 3D siden 2012, og du er i øjeblikket præsident og CEO for Open Perception, Inc. Kan du dele, hvad missionserklæringen for denne non-profit organisation er?

Jeg begyndte min karriere inden for 3D-dataudvikling i begyndelsen af 2000’erne, mens jeg gjorde min efteruddannelse, med denne idé i hovedet, at jeg ville gøre robotter se og forstå verden bedre fra et visuelt perspektiv. Det førte mig gennem omkring et årti af robot-relateret 3D-computervision-forskning, og i begyndelsen af 2010’erne indså jeg, at det, jeg arbejdede med, kunne anvendes på et langt bredere sæt af problemer. Open Perception blev oprettet som en udspaltning fra Willow Garage og overtog et af vores BSD-licenserede, open source-initiativer – Point Cloud Library (PCL)-projektet – og fortsatte med at fremme dets vækst. Open Perception, Inc. blev inkorporeret i Californien i april 2012 som en uafhængig organisation oprettet med formålet at støtte udviklingen, distributionen og antagelsen af open source-software til 2D/3D-behandling af sensor-data med anvendelser i forskning, uddannelse og produktudvikling.

I 2014 blev du Co-Founder og CEO af Fyusion, Inc. Kan du dele historien om Fyusions opståen?

Mens jeg var engageret i robot-forskning, indså Fyusions medstiftere og jeg, at flaskehalsen ikke længere var algoritmer, men dataformater. Maskinlæring havde nået et højdepunkt i nøjagtighed på det tidspunkt i mange domæner, fordi den type data, vi brugte, især i visuelle formater, var todimensionale (såsom fotografier og videoer), mens verden er tredimensionel. Vi følte, at der var potentiale for at transformere, hvordan folk forstår verden, ved at udnytte 3D-data i maskinlæringsplatforme.

I 2014 besluttede vi at oprette en ny type 3D-data, genereret gennem computer-vision og maskinlæringssoftware, ved at fusionere sammenflere datakilder og bruge ekstremt skalerbar commodity-hardware tilgængelig i vores lommer – dvs. vores smartphones.

Vi oprettede Fyusion med målet at opbygge nye, visuelt slående 3D-teknologier, der ville give alle mulighed for at løse komplekse visuelle problemer med kunstig intelligens.

Sammen udviklede vi og patenterede et nyt filformat kaldet .fyuse, der giver folk mulighed for at fange slående 3D-billeder fra deres smartphones. Det fik straks en social medie-sensation og tiltrak over 100 millioner brugere gennem forbruger-mobilapplikationer.

Hvad var det, der oprindeligt tiltrak dig til idéen om at genopfinde betydningen af 3D til forbrugerapplikationer?

Vi indså simpelthen, at ingen havde tacklet dette i stor målestok. Det var et uløst problem. Ligesom i vores ph.d.-programmer er det, der intellektuelt ophidser os, virkelig komplicerede problemer, som nogen sagde, ikke kan løses.

I dette tilfælde var de til en vis grad ret. De algoritmer, der kræves for at løse dette, var kun delvist tænkt igennem, og den hardware, der krævedes for at køre dem, fandtes ikke, især på edge-enheder såsom smartphones. Vi måtte faktisk vente, til iPhone 4S kom ud, så vi kunne køre rigtige 3D-computervision-kode på en smartphone, fordi iPhones tidligere kun havde én CPU-kernel. Når vi først begyndte at se, hvad smartphone-hardware kunne gøre, blev vi meget interesseret i at tage vores computer-vision og robot-forskningsekspertise og se, hvad vi kunne proppen ind i disse små kamere og CPU’er/GPU’er. Det tog lidt tid at gå tilbage til tegnebrættet og genoverveje, hvordan man forestiller sig og implementerer lysfeltfangst og -behandling gennem software. Når vi først så, at det fungerede, var Fyusion i gang.

Vi havde tidligere 2D-fotografier i analog form, og derefter blev de bare digitaliseret med alt andet. Den eneste inkarnation, vi havde i 3D-verdenen i stor målestok, var en “trekants-mesh med en tekstur” (f.eks. OBJ-lignende filformater), der kom fra computer-spil og computer-grafik og var beregnet til at repræsentere kunstigt skabte objekter i et spil. De afhænger stærkt af perfekt geometri, som er umulig at opnå – hvordan fanger og repræsenterer man vand som en trekants-mesh med en kamera? Hvad med gennemsigtige objekter? Løv? Ting, der er langt væk? Og så videre…

Det var klart, at nogen måtte imødekomme behovet for forbruger-venlige 3D-formater. Det måtte baseres på en helt anden paradigm, og løses på en “3D-billede-renderings”-måde (dvs. lysfelter), og inkorporere information, der er tilgængelig på tidspunktet for fangst (såsom kamera-orientering gennem en gyroskop-sensor), der normalt bliver ignoreret, når man fanger et 2D-billede. Og så selvfølgelig er vi forsøger at gensende denne ignorerede information gennem maskinlæring.

Dette var vores chance, og det er, hvad startups skal drømme om: Find et rigtigt hårdt problem, du er passioneret om, vent på det rette tidspunkt og åbning, og gå amok med at løse det.

Kernen i teknologien giver alle mulighed for at oprette immersive, interaktive 3D-billeder kaldet .fyuses ved at flytte en hvilken som helst kamera rundt om en person, et objekt eller en scene. Kan du diskutere processen for en person, der ønsker at oprette en .fyuse ved hjælp af en mobil-app?

Vi er stadig i barndommen af denne teknologi, men essensen er: Du tager en smartphone, der har en applikation skrevet af Fyusion eller en partner-applikation, der udnytter vores Fyusion ALIS SDK underligt, og du åbner kameraet. Du får instruktioner om, hvad du skal gøre, og hvis du følger dem, får du en .fyuse på enheden, der er en computer-vision og maskinlærings-behandlet “fil-objekt”, som du kan rendre på enheden, på webben eller på en hvilken som helst AR/VR/MR-headset.

Hvad er nogle af de computer-vision og maskinlærings-teknologier, der bruges til at gøre dette til virkelighed?

Der er virkelig ikke en enkelt løsning her, men en stor cocktail af 3D-computervision og maskinlæringsværktøjer, som vi skabte for at løse dette problem. Der er idéer fra fotogrammetri (fordi vi effektivt skaber en virtuel kamera-array ved at flytte en enkelt kamera i rummet), robot-teknik (en enorm sensor-fusions-problem, da vi ikke har en enkelt kamera mere, men snarere en mængde af sensorer, som du kan trække data fra for at hjælpe med at løse dette problem), computer-grafik (du kan se vores Siggraph 2019-arbejde for at forstå, hvordan vi repræsenterer nogle af de underliggende strukturer), og mange flere. Alt dette havde at gøres på enheden og kunne køres i realtid, hvilket betyder, at vi udnytter compute-shaders og skriver kode i assembly. Som nævnt er dette kun begyndelsen, og jo flere sensorer og beregningskraft, der bliver tilgængelig for os, jo mere vil vi bruge vores ALIS-throttle til at forbedre flere aspekter af teknologien. Dette er en langsigtede vision, og vi har endnu et årti-plus af arbejde foran os for at være fuldt tilfreds med, hvordan digitaliserede komplekse virkelige verdens-scener ser ud.

Det er let at forestille sig, hvordan .fyuses vil være disruptivt for VR-applikationer. Kan du diskutere den type nuværende VR-applikationer, .fyuses kan bruges i?

Vi mener, at ENHVER VR-applikation, hvor digitalisering af en virkelig verden-objekt og derefter visning er vigtigt, skal kunne udnytte vores ALIS-motor og .fyuses. Der er virkelig ikke mangel på vertikaler og applikationer i e-commerce, sundhedspleje, bilindustri, uddannelse og langt mere, og vi er meget ophidsede over denne fremtid.

Hvad ser du som fremtiden for VR-applikationer for Fyuses?

Vi ser ikke nogen begrænsninger for den nuværende teknologi, selvom vores nuværende fokus er mere på små til medium-scener og objekter, og ikke store bylandskaber.

Jeg kan let forestille mig Fyuses bliver brugt i fremtidige augmented reality (AR) og Mixed reality (MR) applikationer. Hvad er din vision for fremtiden for Fyuses i både en AR og MR-indstilling?

Vi behandler alle AR/VR/MR-applikationer eksakt på samme måde: Når det 3D-objekt er blevet digitaliseret ved hjælp af vores teknologi, kan det udtrækkes fra scenen og placeres hvor som helst.

Har dit team diskuteret idéen om at lave Fyuses med en virtuel assistent eller AI?

Vi har ikke udforsket muligheden for at skabe interaktive virtuelle avatarer for mennesker. Dette er en interessant mulighed, men vi prøver at holde os fokuseret på at løse det nuværende sæt af problemer, vi arbejder på.

Er der noget andet, du gerne vil dele om Fyuses eller Fyusion, Inc?

Dette lyder måske som en salgspitch, men… vi er en flok vanvittige roboticister og 3D-computervision-videnskabsmænd, blandet med CERN-fysikere, fantastiske hackere og ingeniører, og det er kun en beskrivelse af medlemmer af det centrale tekniske team. Vi kan lide diversitet af alle slags, fordi det gør os klogere og stærkere som hold. Hvis noget, vi arbejder på, er af interesse for nogen, der læser dette, så lad være med at være genert og kom i kontakt med os. Vi gør vores bedste for at svare på alle, og du kan finde dig selv i en situation, hvor du kommer forbi for kaffe og så bliver i et årti.

Tak for de fantastiske interviews. Læsere, der ønsker at lære mere, skal besøge Fyusion.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.