Intervjuer
Radu Rusu, VD och medgrundare av Fyusion – Intervjuserie

Radu Rusu är VD och medgrundare av Fyusion, ett företag som har som mål att bygga nya, visuellt imponerande 3D-teknologier som kan hjälpa till att lösa komplexa visuella problem med artificiell intelligens. Tillsammans har de utvecklat och patenterat en ny filformat, kallad .fyuse, som gör det möjligt för människor att ta fantastiska 3D-bilder med sina smartphones, vilket orsakade en social medie-sensation och lockade över 100 miljoner användare genom konsumentmobila applikationer.
Du har arbetat med 3D sedan 2012, och du är för närvarande VD för Open Perception, Inc. Kan du berätta om företagets mission?
Jag började min karriär inom 3D-datahantering i början av 2000-talet under mina doktorandstudier, med idén att jag skulle göra robotar se och förstå världen bättre ur ett visuellt perspektiv. Det ledde mig genom ett decennium av robotikrelaterad 3D-datorseende-forskning, och i början av 2010-talet insåg jag att det jag arbetade med kunde tillämpas på ett mycket bredare spektrum av problem. Open Perception skapades som en utspinning från Willow Garage, och tog ett av våra BSD-licensierade, öppen källkodsinitiativ – Point Cloud Library (PCL)-projektet – och fortsatte att främja dess tillväxt. Open Perception, Inc. bildades i Kalifornien i april 2012 som en oberoende organisation skapad för att stödja utveckling, distribution och antagande av öppen källkodsprogramvara för 2D/3D-bearbetning av sensoriska data, med tillämpningar inom forskning, utbildning och produktutveckling.
2014 blev du medgrundare och VD för Fyusion, Inc. Kan du berätta om Fyusions ursprung?
Medan jag var engagerad i robotikforskning insåg Fyusions medgrundare och jag att flaskhalsarna inte längre var algoritmer, utan dataformat. Maskinlärning hade nått en topp i noggrannhet vid den tiden inom många områden, eftersom den typ av data vi använde, särskilt i visuella format, var tvådimensionell (såsom foton och videor), medan världen är tredimensionell. Vi kände att potentialen fanns att förvandla sättet människor förstår världen genom att utnyttja 3D-data i maskinlärningsplattformar.
2014 beslutade vi att skapa en ny typ av 3D-data, genererad genom datorseende och maskinlärningsprogramvara, genom att kombinera flera datakällor och använda extremt skalbar kommersiell hårdvara som finns i våra fickor, d.v.s. våra smartphones.
Vi grundade Fyusion med målet att bygga nya, visuellt imponerande 3D-teknologier som skulle göra det möjligt för alla att lösa komplexa visuella problem med artificiell intelligens.
Tillsammans utvecklade vi och patenterade en ny filformat, kallad .fyuse, som gör det möjligt för människor att ta fantastiska 3D-bilder med sina smartphones. Det orsakade omedelbart en social medie-sensation och lockade över 100 miljoner användare genom konsumentmobila applikationer.
Vad var det som initialt drog dig till idén att återuppfinna 3D för konsumenttillämpningar?
Vi insåg att ingen hade tacklat detta i stor skala tidigare. Det var ett olöst problem. Precis som under våra doktorsprogram är det som intellektuellt exciterar oss de riktigt komplicerade problemen som någon sagt att de inte kan lösas.
I det här fallet var de till viss del rätt. De algoritmer som krävdes för att lösa detta var bara delvis tänkta igenom, och den hårdvara som krävdes för att köra dem fanns inte, särskilt på kantenheter som smartphones. Vi var tvungna att vänta tills iPhone 4S släpptes så att vi kunde köra riktiga 3D-datorseende-koder på en smartphone, eftersom tidigare iPhone-modeller endast hade en CPU-kärna. När vi började se vad smartphone-hårdvara kunde göra, blev vi mycket intresserade av att ta vår datorseende- och robotikforskningskompetens och se vad vi kunde klämma in i dessa små kameror och CPU/GPU:er. Det tog ett tag att gå tillbaka till ritbordet och tänka om hur man kan tänka och implementera ljusfältsinsamling och -bearbetning genom programvara. När vi såg att det fungerade, var Fyusion igång.
Vi hade tidigare 2D-foton i analog form, och sedan blev de bara digitaliserade med allt annat. Den enda instansiering vi hade i 3D-världen i stor skala var en “triangulär mesh med textur” (t.ex. OBJ-liknande filformat) som kom från datorspel och datorgrafik och var tänkt att representera artificiellt skapade föremål i ett spel. De är starkt beroende av perfekt geometri, som är omöjlig att uppnå – hur fångar man vatten som en triangulär mesh med en kamera? Vad gäller transparenta föremål? Löv? Saker som är långt borta? Och så vidare…
Det var tydligt att någon måste ta itu med behovet av konsumentvänliga 3D-format. Det måste baseras på en helt annan paradigm och lösas på ett “3D-bildåtergivningssätt” (d.v.s. ljusfält), och inkorporera information som är tillgänglig vid tidpunkten för insamling (såsom kamerorientering genom en gyroskop-sensor) som vanligtvis kastas bort när man tar en 2D-bild. Och sedan, naturligtvis, försöker vi återigen hinna med den bortkastade informationen genom maskinlärning.
Detta var vår möjlighet, och det är vad startups bör drömma om: hitta ett riktigt svårt problem som man är passionerad om, vänta på rätt tillfälle och öppning, och gå crazy för att lösa det.
Kärnteknologin gör det möjligt för vem som helst att skapa immersiva, interaktiva 3D-bilder som kallas .fyuses genom att flytta en kamera runt en person, föremål eller scen. Kan du diskutera processen för att skapa en .fyuse med en mobilapp?
Vi är fortfarande i barndomen för denna teknik, men det viktigaste är: Du tar en smartphone som har en applikation skriven av Fyusion eller en partnerapplikation som använder vår Fyusion ALIS SDK under, och du öppnar kameran. Du får instruktioner om vad du ska göra, och om du följer dem, får du en .fyuse på enheten som är en datorseende- och maskinlärningsbehandlad “filobjekt” som du kan återge på enheten, på webben eller på någon AR/VR/MR-huvud enhet.
Vilka är några av de datorseende- och maskinlärningsteknologier som används för att göra detta till verklighet?
Det finns ingen silverkula här, men en stor cocktail av 3D-datorseende- och maskinlärningsverktyg som vi skapade för att lösa detta problem. Det finns idéer från fotogrammetri (eftersom vi effektivt skapar en virtuell kameraarray genom att flytta en enskild kamera i rymden), robotik (en enorm sensorfusionsproblem eftersom vi inte har en enda kamera längre, utan snarare en mängd sensorer som du kan dra data ifrån för att hjälpa till att lösa detta problem), datorgrafik (du kan titta på vårt Siggraph 2019-arbete för att förstå hur vi representerar några av de underliggande strukturerna), och många fler. Allt detta måste göras på enheten och köras i realtid, vilket innebär att vi använder compute-shaders och skriver kod i assembly. Som nämnts är detta bara början, och ju fler sensorer och beräkningskraft som blir tillgänglig för oss, desto mer kommer vi att använda vår ALIS-motor för att förbättra flera aspekter av tekniken. Detta är en långsiktig vision, och vi har ett decennium eller mer av arbete framför oss för att vara helt nöjda med hur digitaliserade komplexa verkliga världsscener ser ut.
Det är lätt att visualisera hur .fyuses kommer att störa VR-applikationer. Kan du diskutera vilka typer av nuvarande VR-applikationer .fyuses kan användas i?
Vi tror att VARJE VR-applikation där digitalisering av en verklig värld och sedan visning är viktig, bör dra nytta av att använda vår ALIS-motor och .fyuses. Det finns verkligen ingen brist på vertikaler och applikationer inom e-handel, hälsovård, bilindustri, utbildning och bortom, och vi är mycket entusiastiska över denna framtid.
Vad ser du som framtiden för VR-applikationer för Fyuses?
Vi ser inga begränsningar för den nuvarande tekniken, även om vår nuvarande fokus är mer på små till medelstora scener och föremål, och inte stora stadslandskap.
Jag kan lätt visualisera Fyuses som används i framtida förstärkt verklighet (AR) och mixed reality (MR)-applikationer. Vad är din vision för framtiden för Fyuses i både en AR- och MR-miljö?
Vi behandlar alla AR/VR/MR-applikationer exakt likadant: När 3D-objektet har digitaliserats med vår teknik, kan det extraheras från scenen och placeras var som helst.
Har ditt team diskuterat idén att skapa Fyuses med en virtuell assistent eller AI?
Vi har inte utforskat möjligheten att skapa interaktiva virtuella avatarer för människor. Detta är en intressant möjlighet, men vi försöker stanna fokuserade på att lösa den nuvarande uppsättningen problem som vi arbetar med.
Finns det något annat du vill dela om Fyuses eller Fyusion, Inc?
Detta kan låta som en pitch, men… vi är en grupp galna robotiker och 3D-datorseende-vetenskapsmän, blandade med CERN-fysiker, fantastiska hackare och ingenjörer, och det är bara att beskriva medlemmarna i det tekniska kärnteamet. Vi gillar mångfald av alla slag, eftersom det gör oss smartare och starkare som ett team. Om något vi arbetar med är av intresse för någon som läser detta, var inte blyg och ta kontakt med oss. Vi gör vårt bästa för att svara alla, och du kan hitta dig själv i en situation där du kommer för kaffe och sedan stannar i ett decennium.
Tack för de underbara intervjuerna, läsare som vill lära sig mer kan besöka Fyusion.












