Robotteknologi og fysisk AI

mimic robotics Introducerer FLUX-mimic til at Bring Video-Action Modeller til Audis Fabriksgulv

mm
Føj Unite.AI til dine foretrukne kilder på Google

mimic robotics har introduceret FLUX-mimic, en ny Video-Action Model designet til at hjælpe industrielle robotter med at lære komplekse manipulationstasks fra betydeligt mindre mængder af demonstrationsdata.

Udviklet i samarbejde med visuelt AI-selskab Black Forest Labs, er systemet allerede under test og implementering med Audi på tværs af produktionsopgaver, som historisk set har været svære at automatisere, herunder arbejde med fleksible materialer, ændrede delkonfigurationer og præcis manipulation.

Meddelelsen peger på en mulig skift i fysisk AI. I stedet for at primært afhænge af store samlinger af robot-demonstrationer, forsøger FLUX-mimic at overføre viden, som allerede er lært af en generativ video-model, til et system, der kan styre fysiske maskiner.

En Ny Tilgang til Robotlæring

Mange af i dag’s almindelige robot-systemer er baseret på Vision-Language-Action modeller, som er almindeligt kendt som VLAs. Disse systemer kombinerer normalt en model, der er trænet på billeder og sprog, med en ekstra komponent, der forudser de bevægelser, en robot bør udføre.

Denne tilgang giver robotterne en vis semantisk forståelse, såsom at genkende et objekt eller fortolke en skrevet instruks. Men statiske billeder fanger ikke fuldt ud, hvordan objekter bøjer, bevæger, kolliderer eller reagerer på fysisk kontakt.

Den manglende viden må derfor læres fra robot-demonstrationer, som kan være dyre og tidskrævende at indsamle. Hver demonstration kræver en fysisk robot, en operatør, et egnet arbejdsområde og omhyggeligt optagede aktionsdata.

FLUX-mimic tager en anden rute. Det bruger de visuelle repræsentationer, der produceres af Black Forest Labs’ FLUX 3-model, som grundlag for at forudse, hvordan en opgave bør udvikle sig over tid. Black Forest Labs beskriver FLUX 3 som en multimodal model, der kan generere billeder, video, lyd og handling, snarere end et system, der er begrænset til statisk billede-generering.

En aktions-dekoder oversætter derefter modellens visuelle forudsigelse til kommandoer, som en robot kan udføre. I praksis estimerer systemet først, hvordan en succesfuld udførelse af en opgave bør se ud, og derefter bestemmer det, hvilke fysiske bevægelser der er nødvendige for at producere det resultat.

Bygning på mimic-video Arkitekturen

FLUX-mimic bygger på mimic-video, selskabets tidligere forskning i at bruge forudtrænede video-modeller som ryggraden for robot-styring.

I stedet for at bede en konventionel vision-sprog-model om at slutte sig til bevægelse fra enkelt billeder, skaber mimic-video en latent visuel plan, der repræsenterer, hvordan opgaven måske udvikler sig. En separat aktions-dekoder bruger derefter den interne repræsentation til at generere robot-bevægelser.

I sin forskningsrapport rapporterede selskabet, at mimic-video opnåede ca. ti gange større prøveeffektivitet og dobbelt så hurtig træningskonvergenshastighed som en sammenlignelig VLA-arkitektur på tværs af dets evalueringer. Det virkelige system blev trænet ved hjælp af ca. 500 trajektorier fra en dygtig to-håndet robot-opstilling.

FLUX-mimic udvider dette koncept ved hjælp af arkitekturen bag FLUX 3 og en design, der er specifikt til fysisk AI.

Ifølge mimic robotics kan opgaver, der tidligere ville have krævet 30 timer eller mere af robot-demonstrationer, nå produktionssikker ydelse med så lidt som 30 minutters data. Denne værdi repræsenterer selskabets rapporterede resultater og vil til sidst skulle vurderes på tværs af en bredere række fabrikker, hardware-konfigurationer og produktionsbetingelser.

Selv om det kan reducere datakravet i denne udstrækning, kan det materielt ændre økonomien i industrielle robotter. Implementeringsomkostningerne udstrækker sig ofte langt ud over robotterne selv, med betydelige ressourcer til programmering, integration, simulation, test og gen-opbygning, når en produkt eller proces ændres.

Audi Tilbyder en Krævende Industriel Test

Audi samarbejder med mimic robotics om at evaluere FLUX-mimic i virkelige produktionsmiljøer, hvor automatiseringssystemer må klare sig med produktvariation, stramme produktionskrav og opgaver, der ikke altid kan reduceres til gentagne bevægelser.

Bilproducenten siger, at robotterne har udført kompleks blød-legeme-manipulation, som ville have været ekstremt svært at tackle med konventionelle robotter. Bløde materialer er særligt udfordrende, fordi deres form ændrer sig under håndtering, hvilket gør det svært at definere hver bevægelse gennem faste koordinater eller regler.

Audis bredere automatiseringsforskning illustrerer, hvorfor tilpasning bliver mere og mere vigtig. På deres Böllinger Höfe-anlæg har selskabet testet kunstig intelligens, mobile robotter, computer-vision og nye picking-teknologier i et virkeligt laboratorium. Audi har noteret, at den høje grad af tilpasning i køretøjer som e-tron GT skaber komplekse logistikprocesser, der involverer mange forskellige dele.

Traditionelle industrielle robotter forbliver højt effektive, når et miljø er struktureret, og hvert objekt ankommer i en forudsigelig position. De bliver mindre økonomiske, når dele, materialer eller produktvarianter ændrer sig ofte nok til at kræve gentagen ingeniørarbejde.

Læringsbaserede systemer kunne gøre disse lavere-volumen- og højere-variation processer mere praktiske at automatisere. I stedet for at skrive et nyt program til hver opgave kunne fabrikanter demonstrere det ønskede adfærd og lade systemet lære, hvordan det skal reproducere det.

Kombinerer Modeller, Hardware og Menneskelig Demonstration

Modellen er en del af en bredt fuld-stack robot-platform, der udvikles af mimic robotics.

Selskabet bygger sin egen dygtige robot-hånd-hardware, bærbare data-indsamlingssystemer, robot-læringsmodeller og implementeringsinfrastruktur. Dets bærbare system er designet til at optage menneskelige håndbevægelser i et format, der kan overføres mere direkte til selskabets robot-hænder.

Dette fokus på hænder snarere end komplette humanoid-robotter afspejler en mere målrettet tilgang til industriell automatisering. Dygtige hænder kan monteres på konventionelle robot-arme, der allerede bruges i fabrikker, og reducere behovet for at introducere en helt ny robot-formfaktor. ETH Zurich beskriver tilgangen som en kombination af menneske-lignende manipulation med etableret industri-hardware til at tackle opgaver, der kræver tilpasning og selv-korrektion.

Etableret som en ETH Zurich-spin-off i 2024, er mimic robotics vokset til mere end 50 ansatte på tværs af Zurich og San Francisco. Dets team spænder over model-forskning, robot-teknologi, hardware-udvikling, data-operationer og industrielle implementeringer.

De Brede Konsekvenser for Fabriksautomatisering

Betydningen af FLUX-mimic vil afhænge mindre af isolerede demonstrationer end af, om teknologien kan opretholde høje succesrater over tusinder af produktionscykler.

Fabrikker kræver konsekvent præstation, forudsigelige cyklustider, sikker drift omkring medarbejdere, hurtig fejlrettelse og integration med eksisterende produktions-systemer. En model, der lærer hurtigt, men opfører sig upredicabelt, ville tilbyde lidt fordel over konventionel automatisering.

Men hvis video-handlingsmodeller kan fastholde deres rapporterede data-effektivitet, mens de opfylder industri-reliabilitetskrav, kunne de udvide robot-teknologien til kategorier af arbejde, der er blevet manuelt, fordi de var for variable eller dyre at programmere.

Dette kunne inkludere samling af fleksible komponenter, håndtering af blandet lager, sortering af uregelmæssige objekter, emballage af hyppigt ændrede produkter og støtte til medarbejdere med fysisk krævende processer.

Den langsigtige mulighed er ikke blot en mere kapabel robot-hånd. Det er en anden implementeringsmodel, hvor fabrikanter lærer maskiner gennem demonstration snarere end at specificere hver bevægelse i forvejen.

Audis involvering giver FLUX-mimic en mulighed for at bevise, at denne tilgang kan gå ud over kontrollerede forskningsmiljøer. Succes på en bilfabriks-gulv ville tilbyde en vigtig indikation af, at generative video-modeller kan blive mere end værktøjer til at skabe digitale medier, og i stedet fungere som en del af den intelligens-lag, der styrer maskiner i den fysiske verden.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.