AI-modeller och plattformar

DeepMinds Mind Evolution: Att ge stora språkmodeller förmåga att lösa verkliga problem

mm
Lägg till Unite.AI bland dina föredragna källor på Google

På senare år har artificiell intelligens (AI) utvecklats till ett praktiskt verktyg för att driva innovation inom olika branscher. I framkant av denna utveckling finns stora språkmodeller (LLM) som är kända för sin förmåga att förstå och generera mänskligt språk. Medan LLM fungerar bra vid uppgifter som konversations-AI och innehållsskapande, har de ofta svårt med komplexa verkliga utmaningar som kräver strukturerat resonemang och planering.

Till exempel, om du ber LLM att planera en affärsresa till flera städer som involverar koordinering av flygscheman, mötestider, budgetbegränsningar och tillräcklig vila, kan de ge förslag för enskilda aspekter. Men de har ofta svårt att integrera dessa aspekter för att effektivt balansera konkurrerande prioriteringar. Denna begränsning blir ännu mer tydlig när LLM används för att bygga AI-agenter som kan lösa verkliga problem på egen hand.

Google DeepMind har nyligen utvecklat en lösning för att åtgärda detta problem. Inspirerad av naturlig selektion, kallas denna metod Mind Evolution, som förfinar problemlösningsstrategier genom iterativ anpassning. Genom att vägleda LLM i realtid, möjliggör det för dem att hantera komplexa verkliga uppgifter effektivt och anpassa sig till dynamiska scenarier. I denna artikel kommer vi att undersöka hur denna innovativa metod fungerar, dess potentiella tillämpningar och vad det betyder för framtiden för AI-driven problemlösning.

Varför LLM har svårt med komplex resonemang och planering

LLM tränas för att förutsäga nästa ord i en mening genom att analysera mönster i stora textdatabaser, såsom böcker, artiklar och onlineinnehåll. Detta möjliggör för dem att generera svar som verkar logiska och kontextuellt lämpliga. Men denna träning baseras på att känna igen mönster snarare än att förstå mening. Som ett resultat kan LLM producera text som verkar logisk men har svårt med uppgifter som kräver djupare resonemang eller strukturerad planering.

Kärnbegränsningen ligger i hur LLM bearbetar information. De fokuserar på sannolikheter eller mönster snarare än logik, vilket innebär att de kan hantera isolerade uppgifter – som att föreslå flygalternativ eller hotellrekommendationer – men misslyckas när dessa uppgifter behöver integreras i en sammanhängande plan. Detta gör det också svårt för dem att behålla kontext över tid. Komplexa uppgifter kräver ofta att man håller reda på tidigare beslut och anpassar sig när ny information uppstår. LLM tenderar att förlora fokus i utdragna interaktioner, vilket leder till fragmenterade eller inkonsekventa utdata.

Hur Mind Evolution fungerar

DeepMinds Mind Evolution åtgärdar dessa brister genom att anta principer från naturlig evolution. Istället för att producera ett enda svar på en komplex fråga, genererar denna metod flera potentiella lösningar, förfinar dem iterativt och väljer det bästa resultatet genom en strukturerad utvärderingsprocess. Till exempel, överväg ett team som brainstormar idéer för ett projekt. Vissa idéer är bra, andra mindre bra. Teamet utvärderar alla idéer, behåller de bästa och kasserar resten. De förbättrar sedan de bästa idéerna, introducerar nya variationer och upprepar processen tills de kommer fram till den bästa lösningen. Mind Evolution tillämpar denna princip på LLM.

Här är en nedbrytning av hur det fungerar:

  1. Generering: Processen börjar med att LLM skapar flera svar på en given uppgift. Till exempel, i en reseplaneringsuppgift, kan modellen skapa olika resplaner baserat på budget, tid och användarpreferenser.
  2. Utvärdering: Varje lösning utvärderas mot en fitnessfunktion, ett mått på hur väl den tillfredsställer uppgiftens krav. Lågkvalitativa svar kasseras, medan de mest lovande kandidaterna går vidare till nästa steg.
  3. Förfining: En unik innovation inom Mind Evolution är dialogen mellan två personligheter inom LLM: Författaren och Kritikern. Författaren föreslår lösningar, medan Kritikern identifierar brister och ger feedback. Denna strukturerade dialog speglar hur människor förfinar idéer genom kritik och revision. Till exempel, om Författaren föreslår en reseplan som inkluderar ett restaurangbesök som överstiger budgeten, pekar Kritikern på detta. Författaren reviderar sedan planen för att tillgodose Kritikerns bekymmer. Denna process möjliggör för LLM att utföra djup analys som de tidigare inte kunde utföra med andra prompttekniker.
  4. Iterativ optimering: De förfinade lösningarna utvärderas och kombinerar för att producera förbättrade lösningar.

Genom att upprepa denna cykel, förbättrar Mind Evolution iterativt kvaliteten på lösningarna, vilket möjliggör för LLM att hantera komplexa uppgifter mer effektivt.

Mind Evolution i praktiken

DeepMind testade denna metod på benchmark som TravelPlanner och Natural Plan. Med denna metod uppnådde Googles Gemini en framgångsgrad på 95,2% på TravelPlanner, vilket är en utmärkt förbättring från en baslinje på 5,6%. Med den mer avancerade Gemini Pro ökade framgångsgraden till nästan 99,9%. Denna transformerande prestanda visar effektiviteten i Mind Evolution för att hantera praktiska utmaningar.

Intressant nog ökar modellens effektivitet med uppgiftens komplexitet. Till exempel, medan enkel-pass metoder kämpade med flerdagarsresor som involverade flera städer, överträffade Mind Evolution konsekvent, med höga framgångsgrader även när antalet begränsningar ökade.

Utmaningar och framtida riktningar

Trots dess framgång är Mind Evolution inte utan begränsningar. Metoden kräver betydande beräkningsresurser på grund av de iterativa utvärderings- och förfiningsprocesserna. Till exempel, att lösa en TravelPlanner-uppgift med Mind Evolution förbrukade tre miljoner token och 167 API-samtal – avsevärt mer än konventionella metoder. Men metoden förblir mer effektiv än brutalkraftsstrategier som uttömmande sökning.

Dessutom kan det vara en utmaning att utforma effektiva fitnessfunktioner för vissa uppgifter. Framtida forskning kan fokusera på att optimera beräknings-effektivitet och utöka teknikens tillämpbarhet till en bredare range av problem, såsom kreativt skrivande eller komplex beslutsfattning.

En annan intressant område för utforskning är integrationen av domänspecifika utvärderare. Till exempel, inom medicinsk diagnos, kan inkorporering av expertkunskap i fitnessfunktionen ytterligare förbättra modellens noggrannhet och tillförlitlighet.

Tillämpningar bortom planering

Även om Mind Evolution huvudsakligen utvärderas på planeringsuppgifter, kan den tillämpas på olika områden, inklusive kreativt skrivande, vetenskaplig upptäckt och till och med kodgenerering. Till exempel, forskare har introducerat en benchmark som kallas StegPoet, som utmanar modellen att koda dolda meddelanden inom dikter. Även om denna uppgift fortfarande är svår, överträffar Mind Evolution traditionella metoder genom att uppnå framgångsgrader på upp till 79,2%.

Förmågan att anpassa och utveckla lösningar i naturligt språk öppnar nya möjligheter för att hantera problem som är svåra att formalisera, såsom att förbättra arbetsflöden eller generera innovativa produktutformningar. Genom att utnyttja kraften från evolutionära algoritmer, tillhandahåller Mind Evolution en flexibel och skalbar ram för att förbättra problemlösningsförmågan hos LLM.

Slutsatsen

DeepMinds Mind Evolution introducerar ett praktiskt och effektivt sätt att övervinna nyckelbegränsningar i LLM. Genom att använda iterativ förfining inspirerad av naturlig selektion, förbättrar det förmågan hos dessa modeller att hantera komplexa, flerstegs-uppgifter som kräver strukturerat resonemang och planering. Metoden har redan visat betydande framgång i utmanande scenarier som reseplanering och visar löfte över olika områden, inklusive kreativt skrivande, vetenskaplig forskning och kodgenerering. Medan utmaningar som höga beräkningskostnader och behovet av väl utformade fitnessfunktioner kvarstår, tillhandahåller metoden en skalbar ram för att förbättra AI-kapaciteter. Mind Evolution sätter scenen för mer kraftfulla AI-system som kan resonera och planera för att lösa verkliga utmaningar.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.