Tankeledare
Att hantera nuvarande problem inom LLM och blicka framåt mot vad som kommer härnäst
Idag finns det dussintals offentligt tillgängliga stora språkmodeller (LLM), såsom GPT-3, GPT-4, LaMDA eller Bard, och antalet ökar ständigt när nya modeller släpps. LLM har revolutionerat artificiell intelligens och har helt förändrat hur vi interagerar med teknologi inom olika branscher. Dessa modeller låter oss lära av många mänskliga språkdatabaser och har öppnat nya vägar för innovation, kreativitet och effektivitet.
Men med stor makt följer stor komplexitet. Det finns inneboende utmaningar och etiska frågor kring LLM som måste hanteras innan vi kan utnyttja dem till fullo. Till exempel visade en nylig studie från Stanford att det fanns ras- och könsbias när man observerade ChatGPT-4 och hur den hanterade vissa frågor som innehöll för- och efternamn som antydde ras eller kön. I denna studie fick programmet frågan om hur mycket man borde betala för en begagnad cykel som såldes av någon som hette Jamal Washington, vilket resulterade i ett mycket lägre belopp jämfört med när säljaren hette Logan Becker. Ju mer sådana upptäckter kommer till ljuset, desto större blir behovet av att hantera LLM-utmaningarna.
Hur man mildrar vanliga LLM-bekymmer
Bias
En av de mest diskuterade frågorna kring LLM är bias och rättvisa. I en nylig studie testade experter fyra nyligen publicerade LLM och fann att de alla uttryckte partiska antaganden om män och kvinnor, särskilt de som stämde överens med människors uppfattningar snarare än de som grundades på faktiska omständigheter. I detta sammanhang avser bias den ojämna behandlingen eller resultaten bland olika sociala grupper, troligen på grund av historiska eller strukturella obalanser i makt.
I LLM orsakas bias av dataval, skapar-demografi och språk- eller kulturell snedvridning. Dataval-bias uppstår när de texter som valts för LLM-utbildning inte representerar den fulla mångfalden av språk som används på webben. LLM som tränats på omfattande men begränsade datamängder kan ärva de bias som redan finns i dessa texter. När det gäller skapar-demografi är vissa demografiska grupper mer framträdande än andra, vilket exemplifierar behovet av större mångfald och inkludering i innehållsskapande för att minska bias. Till exempel visar Wikipedia, en vanlig källa för utbildningsdata, en betydande demografisk obalans bland dess redaktörer med en majoritet av män (84%). Detta är liknande den snedvridning som finns för språk och kultur också. Många källor som LLM tränas på är snedvridna, med en tyngdpunkt på engelska, vilket bara ibland översätts korrekt till andra språk och kulturer.
Det är av största vikt att LLM tränas på filtrerade data och att det finns skyddsmekanismer på plats för att undertrycka ämnen som inte är konsekventa representationer av data. Ett sätt att göra detta är genom data-augmenteringsbaserade tekniker. Du kan lägga till exempel från underrepresenterade grupper i utbildningsdata, vilket breddar datamängdens mångfald. En annan mildrande taktik är datafiltrering och omviktning, som i huvudsak fokuserar på att exakt identifiera specifika, underrepresenterade exempel inom en befintlig datamängd.
Hallucinationer
Inom ramen för LLM är hallucinationer ett fenomen som kännetecknas av produktionen av text som, trots att den är grammatiskt korrekt och tycks vara sammanhängande, avviker från faktisk accuratess eller källmaterialets avsikt. Faktum är att nya rapporter har funnit att en stämningsansökan om en Minnesota-lag direkt påverkas av LLM-hallucinationer. En edsvuren förklaring som lämnades in för att stödja lagen visade sig innehålla icke-existerande källor som kan ha hallucinerats av ChatGPT eller en annan LLM. Dessa hallucinationer kan lätt minska en LLM:s tillförlitlighet.
Det finns tre primära former av hallucinationer:
- Input-konflikt-hallucination: Detta inträffar när en LLM:s utdata avviker från användarens angivna indata, som vanligtvis inkluderar uppgiftsinstruktioner och det faktiska innehållet som behöver bearbetas.
- Kontext-konflikt-hallucination: LLM kan generera interna inkonsekventa svar i scenarier som involverar utökad dialog eller flera utbyten. Detta antyder en potentiell brist i modellens förmåga att spåra kontext eller upprätthålla sammanhang över olika interaktioner.
- Faktum-konflikt-hallucination: Denna form av hallucination uppstår när en LLM producerar innehåll som strider mot etablerad faktuell kunskap. Ursprunget till sådana fel är varierande och kan uppstå vid olika stadier i en LLM:s livscykel.
Många faktorer har bidragit till detta fenomen, såsom kunskapsbrister, som förklarar hur LLM kan sakna kunskap eller förmåga att assimilera information korrekt under förträning. Dessutom kan bias i utbildningsdata eller en sekventiell genereringsstrategi för LLM, som kallas “hallucinations-snowballing”, skapa hallucinationer.
Det finns sätt att mildra hallucinationer, även om de alltid kommer att vara ett kännetecken för LLM. Hjälpsamma mildrande strategier för hallucinationer är mildring under förträning (manuell raffinering av data med filtreringstekniker) eller finjustering (kurering av utbildningsdata). Men mildring under inferens är den bästa lösningen på grund av dess kostnadseffektivitet och kontroll.
Integritet
Med internetns ökade tillgänglighet har den ökade tillgängligheten av personlig information och annan privat data blivit en allmänt erkänd oro. En studie fann att 80% av amerikanska konsumenter är oroliga för att deras data används för att träna AI-modeller. Eftersom de mest framträdande LLM är hämtade från webbplatser, måste vi överväga hur detta utgör integritetsrisker och förblir ett i stort sett olöst problem för LLM.
Det enklaste sättet att förhindra att LLM sprider personlig information är att rensa den från utbildningsdata. Men med tanke på den enorma mängd data som är inblandad i LLM, är det nästan omöjligt att garantera att all privat information är utplånad. En annan vanlig alternativ för organisationer som förlitar sig på externt utvecklade modeller är att välja en öppen källkods-LLM istället för en tjänst som ChatGPT.
Med detta tillvägagångssätt kan en kopia av modellen distribueras internt. Användarnas förfrågningar förblir säkra inom organisationens nätverk snarare än att utsättas för tredjepartstjänster. Medan detta dramatiskt minskar risken för att läcka känslig data, lägger det också till betydande komplexitet. Med tanke på svårigheterna att fullständigt garantera skyddet av privat data, är det fortfarande viktigt för applikationsutvecklare att överväga hur dessa modeller kan utsätta användarna för risk.
Nästa frontier för LLM
Medan vi fortsätter att växa och forma efterföljande utveckling av LLM genom att mildra nuvarande risker, bör vi förvänta oss genombrottet av LLM-agenter, som vi redan ser att företag som H med Runner H, börjar släppa. Övergången från rena språkmodeller till agenterbaserade arkitekturer representerar en förändring i AI-systemdesign; branschen kommer att gå förbi de inneboende begränsningarna för chattgränssnitt och enkel återvinning-baserad generering. Dessa nya agentramverk kommer att ha avancerade planeringsmoduler som bryter ner komplexa mål i atomära underuppgifter, upprätthåller episodisk minnesförklaring för kontextuell resonemang och utnyttjar specialiserade verktyg genom väldefinierade API:er. Detta skapar en mer robust tillvägagångssätt för uppgiftsautomatisering. Den arkitektoniska progressionen hjälper till att mildra de vanliga utmaningarna kring uppgifter och resonemang, verktygsintegration och utförandeövervakning inom traditionella LLM-implementationer.
Förutom LLM kommer det att finnas en större fokus på att träna mindre språkmodeller på grund av deras kostnadseffektivitet, tillgänglighet och lätthet att distribuera. Till exempel specialiserar sig domänspecifika språkmodeller på specifika branscher eller områden. Dessa modeller är finjusterade med domänspecifik data och terminologi, vilket gör dem idealiska för komplexa och reglerade miljöer, som den medicinska eller juridiska sektorn, där precision är avgörande. Detta riktade tillvägagångssätt minskar sannolikheten för fel och hallucinationer som allmänna modeller kan producera när de ställs inför specialiserat innehåll.
Medan vi fortsätter att utforska nya gränser inom LLM, är det av största vikt att driva innovationens gränser och hantera och mildra potentiella risker som är förknippade med deras utveckling och distribution. Bara genom att först identifiera och proaktivt hantera utmaningar relaterade till bias, hallucinationer och integritet kan vi skapa en mer robust grund för LLM att blomstra inom olika områden.












