AI-modeller og platforme

Gemini Robotics: AI-resonnering møder den fysiske verden

mm
Føj Unite.AI til dine foretrukne kilder på Google

I de seneste år er kunstig intelligens (AI) fremkommet betydeligt på tværs af forskellige områder, såsom naturlig sprogbehandling (NLP) og computerseende. Men en stor udfordring for AI har været dens integration i den fysiske verden. Mens AI har udmærket sig ved at resonere og løse komplekse problemer, har disse præstationer overvejende været begrænset til digitale miljøer. For at aktivere AI til at udføre fysiske opgaver gennem robotteknik, skal det have en dyb forståelse af rumlig resonnering, objekthåndtering og beslutningstagning. For at imødekomme denne udfordring har Google (GOOGL ) introduceret Gemini Robotics, en samling af modeller, der er udviklet specifikt til robotteknik og inkarneret AI. Bygget på Gemini 2.0, disse AI-modeller kombinerer avanceret AI-resonnering med den fysiske verden for at aktivere robotter til at udføre en bred vifte af komplekse opgaver.

Forståelse af Gemini Robotics

Gemini Robotics er et par AI-modeller bygget på grundlag af Gemini 2.0, en state-of-the-art Vision-Language Model (VLM) i stand til at behandle tekst, billeder, lyd og video. Gemini Robotics er i virkeligheden en udvidelse af VLM til Vision-Language-Action (VLA)-model, der tillader Gemini-modellen ikke kun at forstå og fortolke visuelle input og behandle naturlig sprog, men også at udføre fysiske handlinger i den virkelige verden. Denne kombination er kritisk for robotteknik, da den aktiverer maskiner ikke kun til at “se” deres omgivelser, men også at forstå dem i kontekst af menneskesprog og udføre komplekse opgaver i den virkelige verden, fra simpel objekthåndtering til mere indviklede, fingerfærdige aktiviteter.

En af de vigtigste styrker ved Gemini Robotics ligger i dets evne til at generalisere på tværs af en række opgaver uden at kræve omfattende genoptræning. Modellen kan følge åbne vokabularie-instruktioner, tilpasse sig variationer i omgivelserne og sogar håndtere uforudsete opgaver, der ikke var en del af dens oprindelige træningsdata. Dette er særligt vigtigt for at skabe robotter, der kan fungere i dynamiske, uforudsigelige omgivelser som hjem eller industrielle miljøer.

Inkarneret resonnering

En væsentlig udfordring i robotteknik har altid været gapet mellem digital resonnering og fysisk interaktion. Mens mennesker let kan forstå komplekse rumlige relationer og ubesværet interagere med deres omgivelser, har robotter kæmpet for at genskabe disse evner. For eksempel er robotter begrænset i deres forståelse af rumlige dynamikker, tilpasning til nye situationer og håndtering af uforudsigelige, virkelige interaktioner. For at imødekomme disse udfordringer inkorporerer Gemini Robotics “inkarneret resonnering”, en proces, der tillader systemet at forstå og interagere med den fysiske verden på en måde, der ligner menneskers.

I modsætning til AI-resonnering i digitale miljøer indebærer inkarneret resonnering flere afgørende komponenter, såsom:

  • Objekt-detektion og -manipulation: Inkarneret resonnering giver Gemini Robotics mulighed for at detektere og identificere objekter i dets omgivelser, selv når de ikke tidligere er set. Den kan forudsige, hvor objekter skal grebes, bestemme deres tilstand og udføre bevægelser som at åbne skuffer, hælde væske eller foldere papir.
  • Bane- og greb-forudsigelse: Inkarneret resonnering giver Gemini Robotics mulighed for at forudsige de mest effektive baner for bevægelse og identificere optimale punkter for at holde objekter. Denne evne er afgørende for opgaver, der kræver præcision.
  • 3D-forståelse: Inkarneret resonnering giver robotter mulighed for at percipere og forstå tredimensionale rum. Denne evne er særligt vigtig for opgaver, der kræver kompleks rumlig manipulation, såsom at foldere tøj eller samle objekter. Forståelse af 3D giver også robotter mulighed for at udføre opgaver, der indebærer multi-view 3D-korrespondance og 3D-boundsætning. Disse evner kan være afgørende for, at robotter kan håndtere objekter præcist.

Fingerfærdighed og tilpasning: Nøglen til opgaver i den virkelige verden

Mens objektdetektion og -forståelse er kritiske, ligger den sande udfordring i robotteknik i at udføre fingerfærdige opgaver, der kræver fine motoriske færdigheder. Uanset om det er at foldere en origami-fox eller spille et spil kort, opgaver, der kræver høj præcision og koordination, ligger typisk ud over det, som de fleste AI-systemer kan klare. Men Gemini Robotics er specifikt designed til at udføre sådanne opgaver.

  • Fine motoriske færdigheder: Modellens evne til at håndtere komplekse opgaver som at foldere tøj, stable objekter eller spille spil demonstrerer dets avancerede fingerfærdighed. Med yderligere finjustering kan Gemini Robotics håndtere opgaver, der kræver koordination på tværs af multiple frihedsgrader, såsom brug af begge arme til komplekse manipulationer.
  • Få-skud-læring: Gemini Robotics introducerer også begrebet få-skud-læring, der giver det mulighed for at lære nye opgaver med minimal demonstration. For eksempel kan Gemini Robotics med så få som 100 demonstrationer lære at udføre en opgave, der ellers ville kræve omfattende træningsdata.
  • Tilpasning til nye inkarnationer: En anden vigtig funktion i Gemini Robotics er dets evne til at tilpasse sig nye robot-inkarnationer. Uanset om det er en bi-armet robot eller en humanoid med et højere antal led, kan modellen ubesværet styre forskellige typer af robotkroppe, hvilket gør den alsidig og tilpasningsdygtig til forskellige hardware-konfigurationer.

Nul-skud-kontrol og hurtig tilpasning

En af de mest fremtrædende funktioner i Gemini Robotics er dets evne til at kontrollere robotter på en nul-skud- eller få-skud-læring-måde. Nul-skud-kontrol refererer til evnen til at udføre opgaver uden at kræve specifik træning for hver enkelt opgave, mens få-skud-læring indebærer at lære fra et lille sæt af eksempler.

  • Nul-skud-kontrol via kode-generering: Gemini Robotics kan generere kode til at kontrollere robotter, selv når de specifikke handlinger, der kræves, aldrig er set før. For eksempel kan Gemini, når det får en højniveaudeskription af en opgave, generere den nødvendige kode til at udføre opgaven ved at bruge sin resonneringsevne til at forstå de fysiske dynamikker og omgivelser.
  • Få-skud-læring: I tilfælde, hvor opgaven kræver mere kompleks fingerfærdighed, kan modellen også lære fra demonstrationer og straks anvende denne viden til at udføre opgaven effektivt. Denne evne til at tilpasse sig hurtigt til nye situationer er en betydelig fremgang i robotkontrol, især i miljøer, der kræver konstant ændring eller uforudsigelighed.

Fremtidige implikationer

Gemini Robotics er en vital fremgang for almindelige robotteknik. Ved at kombinere AI’s resonneringsevner med robotternes fingerfærdighed og tilpasning bringer det os tættere på målet om at skabe robotter, der kan integreres let i dagliglivet og udføre en række opgaver, der kræver menneske-lignende interaktion.

De potentielle anvendelser af disse modeller er enorme. I industrielle miljøer kunne Gemini Robotics anvendes til kompleks samling, inspektion og vedligeholdelsesopgaver. I hjemmet kunne det assistere med huslige pligter, omsorg og personlig underholdning. Da disse modeller fortsætter med at udvikle sig, er det sandsynligt, at robotter bliver almindelige teknologier, der kan åbne nye muligheder på tværs af flere sektorer.

Det endelige punkt

Gemini Robotics er en samling af modeller bygget på Gemini 2.0, designet til at aktivere robotter til at udføre inkarneret resonnering. Disse modeller kan assistere ingeniører og udviklere i at skabe AI-drevne robotter, der kan forstå og interagere med den fysiske verden på en menneske-lignende måde. Med evnen til at udføre komplekse opgaver med høj præcision og fleksibilitet inkorporerer Gemini Robotics funktioner som inkarneret resonnering, nul-skud-kontrol og få-skud-læring. Disse evner giver robotter mulighed for at tilpasse sig deres omgivelser uden behov for omfattende genoptræning. Gemini Robotics har potentialet til at transformere industrier, fra fremstilling til hjemmeassistance, og gøre robotter mere kapable og sikre i virkelige anvendelser. Da disse modeller fortsætter med at udvikle sig, har de potentialet til at redefinere fremtiden for robotteknik.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.