Intervjuer

Radu Rusu, CEO og medgrunnlegger av Fyusion – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Radu Rusu er CEO og medgrunnlegger av Fyusion, et selskap som har som mål å bygge nye, visuelt slående 3D-teknologier som kan løse komplekse visuelle problemer med kunstig intelligens. Sammen utviklet og patenterte de en ny filformat, kalt .fyuse, som lar folk ta slående 3D-bilder med sine smarttelefoner, noe som førte til en sosial medie-sensasjon og tiltalte over 100 millioner brukere gjennom forbruker-mobilapplikasjoner.

Du har arbeidet med 3D siden 2012, og du er nå president og CEO av Open Perception, Inc. Kan du dele hva misjonen til denne non-profit-organisasjonen er?

Jeg begynte min karriere i 3D-data-prosesseringsforskning tidlig i 2000-årene, mens jeg gjorde min post-gradstudier, med denne ideen i hodet at jeg skulle gjøre roboter se og forstå verden bedre fra et visuelt perspektiv. Dette ledet meg gjennom omtrent et tiår med robot-relatert 3D-computervisjon-forskning, og tidlig i 2010-årene innsett jeg at det jeg arbeidet med kunne brukes til en mye bredere sett av problemer. Open Perception ble opprettet som en spin-off fra Willow Garage, og tok ett av våre BSD-lisensiert, åpne kildekode-initiativer – Point Cloud Library (PCL)-prosjektet – og fortsatte å fremme dens vekst. Open Perception, Inc. ble etablert i California i april 2012 som en uavhengig organisasjon opprettet med formålet å støtte utviklingen, distribusjonen og adopsjonen av åpen kildekode-programvare for 2D/3D-prosesserings av sanntidsdata, med anvendelser i forskning, utdanning og produktutvikling.

I 2014 ble du medgrunnlegger og CEO av Fyusion, Inc. Kan du dele opphavet til Fyusion, Inc?

Mens jeg var engasjert i robot-forskning, innsett medgrunnleggerne av Fyusion og jeg at flaskene ikke lenger var algoritmer, men data-formater. Maskinlæring hadde nådd et topp-nivå i nøyaktighet på den tiden i mange domener, fordi typen data vi brukte, spesielt i visuelle formater, var todimensjonale (som fotografier og videoer), mens verden er tredimensjonal. Vi følte at det fantes en mulighet til å transformere måten mennesker forstår verden ved å utnytte 3D-data i maskinlærings-plattformer.

I 2014 bestemte vi oss for å skape en ny type 3D-data, generert gjennom datamaskin-syn og maskinlærings-programvare, ved å fusjonere sammen flere data-kilder og bruke ekstremt skalerbare kommodity-hardware tilgjengelig i våre lommer – dvs. våre smarttelefoner.

Vi etablerte Fyusion med målet om å bygge nye, visuelt slående 3D-teknologier som ville enable alle å løse komplekse visuelle problemer med kunstig intelligens.

Sammen utviklet og patenterte vi en ny filformat, kalt .fyuse, som lar folk ta slående 3D-bilder fra sine smarttelefoner. Det førte umiddelbart til en sosial medie-sensasjon og tiltalte over 100 millioner brukere gjennom forbruker-mobilapplikasjoner.

Hva var det som først tiltalte deg til ideen om å gjenskape betydningen av 3D for forbruker-applikasjoner?

Vi innsett bare at ingen hadde tatt tak i dette i stor skala. Det var et uløst problem. Akkurat som i våre PhD-programmer, er det som exciterer oss intellektuelt, virkelig kompliserte problemer som noen sier ikke kan løses.

I dette tilfelle var det til en viss grad riktig. Algoritmene som var nødvendige for å løse dette, var bare delvis tenkt gjennom, og maskinvaren som var nødvendig for å kjøre dem, eksisterte ikke, spesielt på kant-enheter som smarttelefoner. Vi måtte faktisk vente til iPhone4S kom ut, så vi kunne kjøre sanntids 3D-computervisjon-kode på en smarttelefon, fordi tidligere iPhones bare hadde en CPU-kjerne. Når vi først så hva smartphone-hardware kunne gjøre, ble vi veldig interessert i å ta vår computervisjon- og robot-forskningsekspertise og se hva vi kunne pakke inn i disse små kameraene og CPU/GPU-ene. Det tok en stund å gå tilbake til tegnebrettet og tenke om hvordan vi kunne forestille oss og implementere lys-felt-kapture og -prosesserings alle gjennom programvare. Når vi først så det fungerte, var Fyusion i gang.

Vi hadde tidligere 2D-fotografier i analog form, og så ble de bare digitalisert sammen med alt annet. Den eneste instansiasjonen vi hadde i 3D-verdenen i stor skala, var en “triangulær mesh med tekstur” (f.eks. OBJ-lignende filformater) som kom fra dataspill og datagrafikk og var ment å representere kunstig skapte objekter i et spill. De avhenger sterkt av perfekt geometri, som er umulig å oppnå – hvordan kan du fange og representere vann som en triangulær mesh med en kamera? Hva med gjennomsiktige objekter? Løvverk? Ting som er langt borte? Og så videre…

Det var klart at noen måtte ta tak i behovet for forbruker-vennlige 3D-formater. Det måtte baseres på en helt annen paradigme, og løst på en “3D-bilde-rendering”-måte (dvs. lys-felt), og inkorporere informasjon som er tilgjengelig på tidspunktet for opptak (som kamera-orientering gjennom en gyroskop-sensor) som vanligvis blir kastet når du tar en 2D-bilde. Og så, selvfølgelig, prøver vi å gjen-inferere den kastete informasjonen gjennom maskinlæring.

Dette var vår mulighet, og det er hva startups skal drømme om: finn et virkelig hardt problem du er lidenskapelig om, vent på riktig tid og åpning, og prøv å løse det.

Kjerne-teknologien lar noen skape immersive, interaktive 3D-bilder kalt .fyuses ved å flytte noen kamera rundt en person, objekt eller scene. Kan du diskutere prosessen for noen som ønsker å skape en .fyuse ved hjelp av en mobil-app?

Vi er fortsatt i barndommen av denne teknologien, men kernen av det er: Du tar en smarttelefon som har en applikasjon skrevet av Fyusion eller en partner-applikasjon som utnytter vår Fyusion ALIS SDK under, og du åpner kameraet. Du får instruksjoner på hva du skal gjøre, og hvis du følger dem, får du en .fyuse på enheten som er en datamaskin-syn og maskinlærings-prosesser “fil-objekt” som du kan rendre på enheten, på nettet eller på noen AR/VR/MR-hode-enhet.

Hva er noen av de datamaskin-syn og maskinlærings-teknologiene som brukes for å gjøre dette til virkelighet?

Det finnes ikke en enkelt “silver bullet” her, men en stor koktail av 3D-computervisjon og maskinlærings-verktøy som vi skapte for å løse dette problemet. Det finnes ideer fra fotogrammetri (fordi vi effektivt skaper en virtuell kamera-array ved å flytte en enkelt kamera i rommet), robot-teknologi (en enorm sensor-fusjons-problem siden vi ikke lenger har ett enkelt kamera, men en mengde sensorer som du kan trekke data fra for å hjelpe med å løse dette problemet), datagrafikk (du kan se på vår Siggraph 2019-arbeid for å forstå hvordan vi representerer noen av de underliggende strukturer), og mange flere. Alt dette måtte gjøres på enheten og kunne kjøres i sanntid, noe som betyr at vi utnytter compute-shaders og skriver kode i assembly. Som nevnt, er dette bare begynnelsen, og jo flere sensorer og beregningskraft som blir tilgjengelig for oss, jo mer vil vi bruke vår ALIS-gass til å forbedre flere aspekter av teknologien. Dette er en lang-siktig visjon, og vi har et tiår eller mer av arbeid foran oss for å være fullstendig tilfreds med hvordan digitaliserte komplekse sanntids-scener ser ut.

Det er lett å visualisere hvordan .fyuses vil være disruptivt for VR-applikasjoner. Kan du diskutere typen nåværende VR-applikasjoner .fyuses kan brukes i?

Vi tror at enhver VR-applikasjon hvor digitalisering av en virkelig verden-objekt og deretter visning er viktig, bør dra nytte av å utnytte vår ALIS-motor og .fyuses. Det finnes ingen mangel på vertikaler og applikasjoner i e-handel, helse, bilindustri, utdanning og utover, og vi er veldig spente på denne fremtiden.

Hva ser du for seg som fremtiden for VR-applikasjoner for Fyuses?

Vi ser ingen begrensninger for den nåværende teknologien, selv om vårt nåværende fokus er mer på små-til-middels store scener og objekter, og ikke store by-landskap.

Jeg kan lett visualisere Fyuses som brukes i fremtidige augmented reality (AR) og Mixed reality (MR) applikasjoner. Hva er din visjon for fremtiden av Fyuses i både en AR- og MR-innstilling?

Vi behandler alle AR/VR/MR-applikasjoner eksakt likt: Når 3D-objektet er digitalisert ved hjelp av vår teknologi, kan det trekkes ut fra scenen og plasseres hvor som helst.

Har ditt team diskutert ideen om å lage Fyuses med en virtuell assistent eller AI?

Vi har ikke utforsket muligheten til å skape interaktive virtuelle avatarer for mennesker. Dette er en interessant mulighet, men vi prøver å holde oss fokusert på å løse de nåværende problemene vi arbeider med.

Er det noe annet du ville like å dele om Fyuses eller Fyusion, Inc?

Dette kan høres ut som en salgs-pitch, men… vi er en gjeng gale robot-entusiaster og 3D-computervisjon-vitenskapsmenn, blandet med CERN-fysikere, fantastiske hackere og ingeniører, og det er bare å beskrive medlemmene av det tekniske kjerne-teamet. Vi liker mangfold av alle slag, fordi det gjør oss smartere og sterkere som et team. Hvis noe vi jobber med er av interesse for noen som leser dette, så vær ikke sky og ta kontakt med oss. Vi gjør vårt beste for å svare alle, og du kan finne deg selv i en situasjon hvor du kommer for å drikke kaffe og så blir værende i et tiår.

Takk for de flotte intervjuene, lesere som ønsker å lære mer, bør besøke Fyusion.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.