AGI och framtidens AI

Den utvecklande landskapet för generativ AI: En undersökning av Mixture of Experts, multimodalitet och jakten på AGI

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Området för artificiell intelligens (AI) har sett en enorm tillväxt under 2023. Generativ AI, som fokuserar på att skapa realistiskt innehåll som bilder, ljud, video och text, har varit i framkant av dessa framsteg. Modeller som DALL-E 3, Stable Diffusion och ChatGPT har demonstrerat nya kreativa förmågor, men har också väckt oro kring etik, fördomar och missbruk.

Medan generativ AI fortsätter att utvecklas i snabb takt, verkar blandningar av experter (MoE), multimodal inlärning och strävan efter artificiell allmän intelligens (AGI) vara de nästa frontlinjerna för forskning och tillämpningar. Den här artikeln kommer att ge en omfattande undersökning av den nuvarande tillståndet och den framtida banan för generativ AI, med analys av hur innovationer som Google’s Gemini och förväntade projekt som OpenAI’s Q* förändrar landskapet. Den kommer att undersöka de verkliga implikationerna inom hälsovård, finans, utbildning och andra områden, samtidigt som den lyfter fram nya utmaningar kring forskningskvalitet och AI-anpassning till mänskliga värderingar.

Släppandet av ChatGPT i slutet av 2022 väckte förnyad entusiasm och oro kring AI, från dess imponerande naturliga språkförmåga till dess potential att sprida desinformation. Samtidigt visar Google’s nya Gemini-modell en betydande förbättring av konversationsförmåga jämfört med föregångare som LaMDA genom framsteg som spike-and-slab-uppmärksamhet. Ryktade projekt som OpenAI’s Q* antyder en kombination av konversations-AI med förstärkt inlärning.

Dessa innovationer signalerar en förändrad prioritet mot multimodala, mångsidiga generativa modeller. Tävlingen fortsätter att hetta upp mellan företag som Google, Meta, Anthropic och Cohere som kämpar för att driva gränserna för ansvarsfull AI-utveckling.

Utvecklingen av AI-forskning

Allteftersom förmågorna har vuxit, har forskningstrender och prioriteringar också förändrats, ofta i takt med tekniska milstolpar. Uppkomsten av djupinlärning återupplivade intresset för neurala nätverk, medan naturlig språkbehandling ökade med ChatGPT-nivåmodeller. Samtidigt kvarstår uppmärksamheten på etik som en konstant prioritet mitt i snabb framsteg.

Förhandsversioner av vetenskapliga artiklar som arXiv har också sett en exponentiell tillväxt av AI-inlämnanden, vilket möjliggör snabbare spridning men minskar peer-granskning och ökar risken för okontrollerade fel eller fördomar. Samspelet mellan forskning och verkliga implikationer förblir komplext, vilket kräver mer samordnade insatser för att styra framstegen.

MoE och multimodala system – Nästa våg av generativ AI

För att möjliggöra mer mångsidig och avancerad AI över diverse tillämpningar, två tillvägagångssätt som vinner popularitet är blandningar av experter (MoE) och multimodal inlärning.

MoE-arkitekturer kombinerar flera specialiserade neurala nätverk “experter” som är optimerade för olika uppgifter eller datatyper. Google’s Gemini använder MoE för att bemästra både långa konversationsutbyten och koncisa frågesvar. MoE möjliggör hantering av en bredare variation av indata utan att modellstorleken ökar.

Multimodala system som Google’s Gemini sätter nya benchmark genom att bearbeta varierande modaliteter utöver bara text. Men för att förverkliga potentialen i multimodal AI krävs det att man övervinner viktiga tekniska hinder och etiska utmaningar.

Gemini: Omdefinierar benchmark i multimodalitet

Gemini är en multimodal konversations-AI, arkitekturerad för att förstå sambanden mellan text, bilder, ljud och video. Dess dubbla encoder-struktur, cross-modal uppmärksamhet och multimodal avkodning möjliggör avancerad kontextuell förståelse. Gemini anses överträffa enkelt encoder-system i att associera textkoncept med visuella regioner. Genom att integrera strukturerad kunskap och specialiserad utbildning överträffar Gemini föregångare som GPT-3 och GPT-4 i:

  • Bredd av modaliteter som hanteras, inklusive ljud och video
  • Prestanda på benchmark som massiv multitask-språkförståelse
  • Kodgenerering över programmeringsspråk
  • Skalbarhet via anpassade versioner som Gemini Ultra och Nano
  • Transparens genom motiveringar för utdata

Tekniska hinder i multimodala system

För att förverkliga robust multimodal AI krävs det att man löser problemen med datamångfald, skalbarhet, utvärdering och tolkbarhet. Obalanserade datamängder och inkonsekvenser i annoteringar leder till fördomar. Bearbetning av flera dataströmmar belastar beräkningsresurserna, vilket kräver optimerade modellarkitekturer. Framsteg inom uppmärksamhetsmekanismer och algoritmer behövs för att integrera motsägelsefulla multimodala indata. Skalbarhetsproblem kvarstår på grund av omfattande beräkningsbörda. Förbättring av utvärderingsmetoder genom omfattande benchmark är avgörande. Förbättring av användartillit genom förklarbar AI förblir också viktigt. Att hantera dessa tekniska hinder kommer att vara nyckeln till att låsa upp multimodal AI:s förmågor.

Avancerade inlärningstekniker som självständig inlärning, meta-inlärning och finjustering är i framkant av AI-forskning, förbättrar autonomi, effektivitet och mångsidighet hos AI-modeller.

Självständig inlärning: Autonomi i modellträning

Självständig inlärning betonar autonom modellträning med hjälp av omarkerad data, vilket minskar manuell märkningsansträngning och modellfördomar. Den inkorporerar generativa modeller som autoencoders och GANs för datadistributionsinlärning och indatamaskning, och använder kontrastiva metoder som SimCLR och MoCo för att skilja mellan positiva och negativa exempelpar. Själprediktionstrategier, inspirerade av NLP och förbättrade av nyliga Vision Transformers, spelar en betydande roll i självständig inlärning, visar dess potential i att främja AI:s autonoma träningsförmågor.

Meta-inlärning

Meta-inlärning, eller ‘inlärning att lära’, fokuserar på att utrusta AI-modeller med förmågan att snabbt anpassa sig till nya uppgifter med hjälp av begränsade datamängder. Denna teknik är avgörande i situationer med begränsad datatillgänglighet, säkerställer att modellerna kan anpassa sig och prestera över diverse uppgifter. Den betonar få-skottsgeneralisering, möjliggör AI att hantera en bred variation av uppgifter med minimal data, understryker dess betydelse i utvecklingen av mångsidiga och anpassningsbara AI-system.

Finjustering: Anpassning av AI för specifika behov

Finjustering innebär anpassning av förtränade modeller till specifika domäner eller användarpreferenser. Dess två primära tillvägagångssätt inkluderar slut-till-slut-finjustering, som justerar alla vikter i encoder och klassificerare, och feature-extraktionsfinjustering, där encoder-vikterna fryses för nedströmsklassificering. Denna teknik säkerställer att generativa modeller effektivt anpassas till specifika användarbehov eller domänkrav, förbättrar deras tillämpbarhet över diverse sammanhang.

Mänsklig värdeanpassning: Harmonisering av AI med etik

Mänsklig värdeanpassning koncentrerar sig på att anpassa AI-modeller till mänskliga etiska värderingar, säkerställer att deras beslut speglar samhälleliga normer och etiska standarder. Detta aspekt är avgörande i scenarier där AI interagerar nära med människor, som i hälsovård och personliga assistenter, för att säkerställa att AI-system fattar beslut som är etiskt och socialt ansvarsfulla.

AGI-utveckling

AGI fokuserar på att utveckla AI med förmågan till holistisk förståelse och komplex resonemang, i linje med mänskliga kognitiva förmågor. Denna långsiktiga aspiration driver kontinuerligt gränserna för AI-forskning och utveckling. AGI-säkerhet och inneslutning hanterar de potentiella riskerna förknippade med avancerad AI, betonar behovet av rigorösa säkerhetsprotokoll och etisk anpassning till mänskliga värderingar och samhälleliga normer.

Den innovativa MoE

Mixture of Experts (MoE)-modellarkitekturen representerar en betydande framsteg inom transformer-baserade språkmodeller, erbjuder en oöverträffad skalbarhet och effektivitet. MoE-modeller, som Switch Transformer och Mixtral, omdefinierar snabbt modellskala och prestanda över diverse språkuppgifter.

Kärnkcept

MoE-modeller använder en sparsamhetsdriven arkitektur med flera expertnätverk och en tränbar grindmekanism, optimerar beräkningsresurser och anpassar sig till uppgiftskomplexitet. De demonstrerar betydande fördelar i förträningshastighet men möter utmaningar i finjustering och kräver betydande minne för inferens.

MoE-modeller är kända för sin överlägsna förträningshastighet, med innovationer som DeepSpeed-MoE som optimerar inferens för att uppnå bättre latens och kostnadseffektivitet. Nyliga framsteg har effektivt hanterat all-till-all-kommunikationsbottlenecken, förbättrat tränings- och inferenseffektivitet.

Sammanfogning av byggstenarna för artificiell allmän intelligens

AGI representerar den hypotetiska möjligheten för AI att matcha eller överträffa mänsklig intelligens över alla domäner. Medan modern AI excellerar i snäva uppgifter, förblir AGI långt borta och kontroversiell givet dess potentiella risker.

Men, inkrementella framsteg inom områden som överföringsinlärning, multitask-träning, konversationsförmåga och abstraktion närmar sig långsamt AGI:s höga vision. OpenAI:s spekulativa Q*-projekt syftar till att integrera förstärkt inlärning i LLM som ett ytterligare steg framåt.

Etiska gränser och riskerna med att manipulera AI-modeller

Jailbreaks tillåter angripare att kringgå de etiska gränser som fastställs under AI:s finjusteringsprocess. Detta resulterar i generering av skadligt innehåll som desinformation, hatretorik, phishing-e-post och skadlig kod, vilket utgör risker för individer, organisationer och samhället i stort. Till exempel kunde en jailbroken modell producera innehåll som främjar splittrande berättelser eller stöder cyberkriminella aktiviteter. (Läs mer)

Medan det inte har funnits några rapporterade cyberattacker som använt jailbreaking ännu, finns flera bevis för jailbreaking tillgängliga online och till salu på den mörka webben. Dessa verktyg tillhandahåller prompter som är utformade för att manipulera AI-modeller som ChatGPT, potentiellt möjliggör för hackare att läcka känslig information genom företagschattbotar. Spridningen av dessa verktyg på plattformar som cyberkriminella forum betonar brådskan att hantera denna hot.

Minskning av jailbreak-risker

För att motverka dessa hot krävs en multifacetterad strategi:

  1. Robust finjustering: Inklusive diversifierad data i finjusteringsprocessen förbättrar modellens motståndskraft mot adversarial manipulation.
  2. Adversarial träning: Träning med adversarial exempel förbättrar modellens förmåga att känna igen och motstå manipulerade indata.
  3. Regelbunden utvärdering: Kontinuerlig övervakning av utdata hjälper till att upptäcka avvikelser från etiska riktlinjer.
  4. Mänsklig övervakning: Inblandning av mänskliga granskare tillför ett ytterligare lager av säkerhet.

AI-drivna hot: Hallucinationsutnyttjande

AI-hallucination, där modeller genererar utdata som inte grundar sig i deras träningsdata, kan vapnas. Till exempel manipulerade angripare ChatGPT för att rekommendera icke-existerande paket, vilket ledde till spridning av skadlig programvara. Detta betonar behovet av kontinuerlig vaksamhet och robusta motåtgärder mot sådant utnyttjande. (Utforska vidare)

Medan etiken kring att sträva efter AGI förblir kontroversiell, fortsätter dess aspirerade strävan att påverka generativ AI-forskningsriktningar – oavsett om nuvarande modeller liknar stegstenar eller avvikelser på vägen mot mänsklig AI-nivå.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.