Robotikk og fysisk AI
mimic robotics Introducerer FLUX-mimic for å Bring Video-Action Modeller til Audis Fabrikksgulv

mimic robotics har introdusert FLUX-mimic, en ny Video-Action Model designet for å hjelpe industrielle roboter med å lære komplekse manipulasjonsoppgaver fra betydelig mindre mengder demonstrasjonsdata.
Utviklet i samarbeid med visuell AI-selskap Black Forest Labs, er systemet allerede under testing og utrulling med Audi over produksjonsoppgaver som historisk sett har vært vanskelige å automatisere, inkludert arbeid med fleksible materialer, endringer i delkonfigurasjoner og presise manipulasjoner.
Kunngjøringen peker mot en potensiell endring i fysisk AI. I stedet for å primært basere seg på store samlinger av robotdemonstrasjoner, prøver FLUX-mimic å overføre kunnskap allerede lært av en generativ video-model til et system i stand til å kontrollere fysiske maskiner.
En Ny Tilnærming til Robotlæring
Mange av dagens generelle robot-systemer er basert på Vision-Language-Action-modeller, vanligvis kjent som VLAs. Disse systemene kombinerer vanligvis en modell trent på bilder og språk med en ekstra komponent som forutsier bevegelsene en robot skal gjøre.
Dette gir robotene en viss grad av semantisk forståelse, som å gjenkjenne et objekt eller tolke en skrevet instruksjon. Men statiske bilder fanger ikke fullt ut hvordan objekter bøyer, beveger, kolliderer eller reagerer på fysisk kontakt.
Den manglende kunnskapen må derfor læres fra robotdemonstrasjoner, som kan være dyre og tidskrevende å samle inn. Hver demonstrasjon krever en fysisk robot, en operatør, et egnet arbeidsområde og nøye innspilt aksjonsdata.
FLUX-mimic tar en annen rute. Det bruker de visuelle representasjonene produsert av Black Forest Labs’ FLUX 3-modell som grunnlag for å forutsi hvordan en oppgave skal utvikle seg over tid. Black Forest Labs beskriver FLUX 3 som en multimodal modell i stand til å generere bilder, video, lyd og aksjon, i stedet for et system begrenset til statisk bildegenerering.
En aksjonsdekoder oversetter deretter modellens visuelle forutsigelse til kommandoer en robot kan utføre. I praksis estimerer systemet først hva det vil se ut som å fullføre en oppgave og bestemmer deretter hvilke fysiske bevegelser som er nødvendige for å produsere den resultatet.
Bygging på mimic-video Arkitekturen
FLUX-mimic bygger på mimic-video, selskapets tidligere forskning på å bruke forhånds trenede video-modeller som ryggraden for robotkontroll.
I stedet for å be en konvensjonell visjon-språk-modell om å slutte bevegelse fra enkeltbilder, skaper mimic-video en latent visuell plan som representerer hvordan oppgaven kan utvikle seg. En separat aksjonsdekoder bruker den interne representasjonen til å generere robotbevegelser.
I sin forskningsrapport rapporterte selskapet at mimic-video oppnådde omtrent ti ganger større prøveeffektivitet og dobbelt så rask treningskonvergenshastighet som en sammenlignbar VLA-arkitektur over sine evalueringer. Det virkelige systemet ble trent ved hjelp av omtrent 500 baner fra en dyktig to-hendig robotoppsett.
FLUX-mimic utvider dette konseptet ved å bruke arkitekturen bak FLUX 3 og en design skapt spesielt for fysisk AI.
Ifølge mimic robotics kan oppgaver som tidligere ville ha krevd 30 timer eller mer med robotdemonstrasjoner nå nå produksjonsklar ytelse med så lite som 30 minutters data. Denne verdien representerer selskapets rapporterte resultater og vil til slutt måtte vurderes over en bredere rekke fabrikker, maskinkonfigurasjoner og produksjonsforhold.
Selv om reduksjonen av datakravet kan endre økonomien for industriell robotikk. Utgiftene ved utrulling utvides ofte langt utenfor roboten selv, med betydelige ressurser viet til programmering, integrering, simulering, testing og ombygging når en produkt eller prosess endres.
Audi Tilbyr en Krevende Industriell Test
Audi samarbeider med mimic robotics for å evaluere FLUX-mimic i virkelige produksjonsmiljøer, der automatiseringssystemer må håndtere produktvariasjon, strenge produksjonskrav og oppgaver som ikke alltid kan reduseres til repetitive bevegelser.
Bilprodusenten sier at robotene har utført komplekse myke kropp-manipulasjonsarbeid som ville ha vært ekstremt vanskelige å håndtere med konvensjonell robotikk. Myke materialer er spesielt utfordrende fordi deres form endrer seg under håndtering, noe som gjør det vanskelig å definere hver bevegelse gjennom faste koordinater eller regler.
Audis bredere automatiseringsforskning illustrerer hvorfor tilpasning blir stadig viktigere. På sitt Böllinger Höfe-anlegg har selskapet testet kunstig intelligens, mobile roboter, datavisning og nye plukk-teknologier i et virkelige laboratorium. Audi har notert at den høye graden av tilpasning i kjøretøy som e-tron GT skaper komplekse logistiske prosesser som involverer mange forskjellige deler.
Tradisjonelle industrielle roboter forblir høyt effektive når et miljø er strukturert og hvert objekt ankommer i en forutsigbar posisjon. De blir mindre økonomiske når deler, materialer eller produktvarianter endrer seg ofte nok til å kreve gjentakende ingeniørarbeid.
Læringsbaserte systemer kan gjøre disse lavere-volum og høyere-variasjonsprosessene mer praktiske å automatisere. I stedet for å skrive et nytt program for hver oppgave, kan produsentene demonstrere det ønskede oppførslet og la systemet lære hvordan å gjenta det.
Kombinering av Modeller, Maskinvare og Menneskelig Demonstrasjon
Modellen er en del av en bredere full-stack robotikkplattform som utvikles av mimic robotics.
Selskapet bygger sin egen dyktige robot-hånd-maskinvare, bærbar datainnsamlingsutstyr, robotlæringsmodeller og utrullingsinfrastruktur. Deres bærbare system er designet for å registrere menneskelige håndbevegelser i et format som kan overføres mer direkte til selskapets robot-hender.
Dette fokuset på hender i stedet for komplette humanoid-roboter reflekterer en mer målrettet tilnærming til industriell automatisering. Dyktige hender kan festes til konvensjonelle robot-armer allerede brukt i fabrikker, og reduserer behovet for å introdusere en helt ny robotformfaktor. ETH Zurich beskriver tilnærmingen som en kombinasjon av menneske-lignende manipulasjon med etablerte industrielle maskiner for å håndtere oppgaver som krever tilpasning og selvkorreksjon.
Grundlagt som en ETH Zurich-spin-off i 2024, har mimic robotics vokst til over 50 ansatte over Zurich og San Francisco. Deres team spenner over modellforskning, robotikk, maskinutvikling, dataoperasjoner og industriell utrulling.
De Videre Implikasjonene for Fabrikkautomatisering
Betydningen av FLUX-mimic vil avhenge mindre av isolerte demonstrasjoner enn på om teknologien kan opprettholde høye suksessrater over tusenvis av produksjonssykluser.
Fabrikker krever konsistent ytelse, forutsigbare syklustider, sikker drift rundt ansatte, rask gjenopprettelse fra feil og integrasjon med eksisterende produksjonssystemer. En modell som lærer raskt men oppfører seg uprediktabelt vil tilby liten fordel over konvensjonell automatisering.
Men hvis video-aksjonsmodeller kan beholde sin rapporterte dataeffektivitet samtidig som de møter industriell pålitelighetskrav, kan de utvide robotikk til kategorier av arbeid som har forblett manuelle fordi de var for variable eller dyre å programmere.
Dette kan inkludere montering av fleksible komponenter, håndtering av blandet lager, sortering av uregelmessige objekter, emballasje av ofte endrede produkter og støtte til arbeidere med fysisk krevende prosesser.
På lengre sikt er muligheten ikke bare en mer kapabel robot-hånd. Det er en annen utrullingsmodell der produsenter lærer maskiner gjennom demonstrasjon i stedet for å spesifisere hver bevegelse på forhånd.
Audis involvering gir FLUX-mimic en mulighet til å bevise at denne tilnærmingen kan gå utenfor kontrollerte forskningsmiljøer. Suksess på en bilfabrikkgulv vil tilby en viktig indikasjon på at generative video-modeller kan bli mer enn verktøy for å lage digitale medier, og i stedet tjene som en del av intelligenslaget som kontrollerer maskiner i den fysiske verden.












