Robotik och fysisk AI
mimic robotics Introducerar FLUX-mimic för att Föra Video-åtgärdsmodeller till Audis Fabriksgolv

mimic robotics har introducerat FLUX-mimic, en ny Video-åtgärdsmodell som är utformad för att hjälpa industrirobotar att lära sig komplexa manipuleringsuppgifter från avsevärt mindre mängder demonstrationsdata.
Utvecklad i samarbete med visuellt AI-företag Black Forest Labs, är systemet redan testat och distribuerat med Audi över tillverkningsuppgifter som historiskt sett har varit svåra att automatisera, inklusive arbete med flexibla material, ändrade delkonfigurationer och exakt manipulation.
Tillkännagivandet pekar på en potentiell förändring i fysisk AI. Istället för att förlita sig främst på stora samlingar av robotdemonstrationer, försöker FLUX-mimic att överföra kunskap som redan har lärt sig av en generativ videomodell till ett system som kan styra fysiska maskiner.
En Ny Ansats till Robotinlärning
Många av dagens allmänna robotiksystem baseras på Vision-Language-Action-modeller, som vanligtvis kallas VLAs. Dessa system kombinerar vanligtvis en modell som tränats på bilder och språk med en ytterligare komponent som förutsäger de rörelser en robot bör göra.
Denna ansats ger robotar en viss semantisk förståelse, såsom att känna igen ett föremål eller tolka en skriven instruktion. Men statiska bilder fångar inte fullständigt hur föremål böjer sig, rör sig, kolliderar eller svarar på fysisk kontakt.
Den saknade kunskapen måste därför läras från robotdemonstrationer, som kan vara dyra och tidskrävande att samla in. Varje demonstration kräver en fysisk robot, en operatör, en lämplig arbetsyta och noggrant inspelad aktionsdata.
FLUX-mimic tar en annan väg. Den använder de visuella representationer som produceras av Black Forest Labs FLUX 3-modell som grund för att förutsäga hur en uppgift bör utvecklas över tiden. Black Forest Labs beskriver FLUX 3 som en multimodal modell som kan generera bilder, video, ljud och åtgärder, snarare än ett system som är begränsat till statisk bildgenerering.
En åtgärdsavkodare översätter sedan modellens visuella förutsägelse till kommandon som en robot kan utföra. I praktiska termer uppskattar systemet först vad som krävs för att framgångsrikt slutföra en uppgift och bestämmer sedan vilka fysiska rörelser som behövs för att producera det resultatet.
Byggande på mimic-video-arkitekturen
FLUX-mimic bygger på mimic-video, företagets tidigare forskning om att använda förtränade videomodeller som ryggraden för robotstyrning.
Istället för att be en konventionell vision-språk-modell att dra slutsatser om rörelse från enskilda ramar, skapar mimic-video en latent visuell plan som representerar hur uppgiften kan utvecklas. En separat åtgärdsavkodare använder den interna representationen för att generera robotrörelser.
I sin forskningsrapport rapporterade företaget att mimic-video uppnådde ungefär tio gånger större provexempel-effektivitet och dubbelt så snabb träningskonvergenshastighet som en jämförbar VLA-arkitektur över sina utvärderingar. Det riktiga systemet tränades med hjälp av cirka 500 banor från en dexterous tvåhändig robotkonfiguration.
FLUX-mimic utökar den konceptet med hjälp av arkitekturen bakom FLUX 3 och en design som är specifikt utformad för fysisk AI.
Enligt mimic robotics kan uppgifter som tidigare kan ha krävt 30 timmar eller mer av robotdemonstrationer nå produktionsklar prestanda med så lite som 30 minuters data. Den siffran representerar företagets rapporterade resultat och kommer slutligen att behöva utvärderas över ett bredare urval av fabriker, maskinkonfigurationer och produktionsförhållanden.
Även om det kan minska datakraven avsevärt, skulle det kunna materiellt förändra ekonomin för industriell robotik. Distribueringskostnaderna sträcker sig ofta långt bortom roboten själv, med betydande resurser ägnade åt programmering, integration, simulering, testning och omkonstruktion när en produkt eller process ändras.
Audi Tillhandahåller en Krävande Industriell Test
Audi arbetar med mimic robotics för att utvärdera FLUX-mimic i riktiga tillverkningsmiljöer, där automatiseringssystem måste hantera produktvariation, stränga produktionskrav och uppgifter som inte alltid kan reduceras till repetitiva rörelser.
Biltillverkaren säger att robotarna har utfört komplex mjukkroppsmanipulation som skulle ha varit extremt svårt att hantera med konventionell robotik. Mjuka material är särskilt utmanande eftersom deras form ändras under hantering, vilket gör det svårt att definiera varje rörelse genom fasta koordinater eller regler.
Audis bredare automatiseringsforskning illustrerar varför anpassningsförmåga blir allt viktigare. På sin Böllinger Höfe-anläggning har företaget testat artificiell intelligens, mobila robotar, datorseende och nya plocktekniker i ett riktigt laboratorium. Audi har noterat att den höga nivån av anpassning i fordon som e-tron GT skapar komplexa logistiska processer som involverar ett stort antal olika delar.
Traditionella industrirobotar förblir högt effektiva när en miljö är strukturerad och varje föremål anländer i en förutsägbar position. De blir mindre ekonomiska när delar, material eller produktvarianter ändras tillräckligt ofta för att kräva upprepad ingenjörsarbete.
Lärandebaserade system kan göra dessa lägre volym- och högre variationsprocesser mer praktiska att automatisera. Istället för att skriva ett nytt program för varje uppgift, kan tillverkare demonstrera det önskade beteendet och låta systemet lära sig hur man reproducerar det.
Kombinera Modeller, Maskinvara och Mänskliga Demonstrationer
Modellen är en del av en bredare fullständig robotplattform som utvecklas av mimic robotics.
Företaget bygger sin egen dexterous robotisk handmaskinvara, bärbara datainsamlingssystem, robotinlärningsmodeller och distributionsinfrastruktur. Deras bärbara system är utformat för att spela in mänskliga handrörelser i ett format som kan överföras mer direkt till företagets robotiska händer.
Denna fokus på händer snarare än kompletta humanoida robotar speglar en mer riktad ansats till industriell automation. Dexterous händer kan fästas på konventionella robotarmar som redan används i fabriker, vilket minskar behovet av att införa en helt ny robotform. ETH Zurich beskriver ansatsen som att kombinera mänsklig manipulation med etablerad industriell maskinvara för att hantera uppgifter som kräver anpassning och självkorrigering.
Som ett ETH Zurich-spinoff från 2024 har mimic robotics vuxit till mer än 50 anställda i Zurich och San Francisco. Teamet omfattar modellforskning, robotik, maskinutveckling, dataåtgärder och industriell distribution.
De Vidare Implikationerna för Fabriksautomation
Betydelsen av FLUX-mimic kommer att bero mindre på isolerade demonstrationer än på om tekniken kan upprätthålla höga framgångsgrader över tusentals produktionscykler.
Fabriker kräver konsekvent prestanda, förutsägbara cykliska tider, säker drift runt anställda, snabb återhämtning från fel och integration med befintliga tillverkningssystem. En modell som lär sig snabbt men beter sig oförutsägbart skulle erbjuda liten fördel jämfört med konventionell automation.
Men om video-åtgärdsmodeller kan behålla sin rapporterade dataeffektivitet samtidigt som de uppfyller industriell tillförlitlighetskrav, kunde de expandera robotik till kategorier av arbete som har förblivit manuella eftersom de var för variabla eller dyra att programmera.
Det kunde inkludera montering av flexibla komponenter, hantering av blandad lager, sortering av oregelbundna föremål, förpackning av ofta ändrade produkter och stöd för arbetare med fysiskt krävande processer.
Den långsiktiga möjligheten är inte bara en mer kapabel robotisk hand. Det är en annan distributionsmodell där tillverkare lär maskiner genom demonstration snarare än att specificera varje rörelse i förväg.
Audis engagemang ger FLUX-mimic en möjlighet att bevisa att denna ansats kan gå utöver kontrollerade forskningsmiljöer. Framgång på en bilfabriksgolv skulle erbjuda en viktig indikation på att generativa videomodeller kan bli mer än verktyg för att skapa digital media, och istället fungera som en del av den intelligensskikt som styr maskiner i den fysiska världen.












