Tankeledere
Å løse nåværende problemer innenfor LLM og se fremover mot hva som kommer neste
I dag finnes det dusinvis av offentlig tilgjengelige store språkmodeller (LLM), som GPT-3, GPT-4, LaMDA eller Bard, og antallet øker stadig når nye modeller utgis. LLM har revolusjonert kunstig intelligens og endret hvordan vi samhandler med teknologi over ulike bransjer. Disse modellene lar oss lære fra mange menneskeskapte språkdatasett og har åpnet nye veier for innovasjon, kreativitet og effektivitet.
Men med stor makt kommer stor kompleksitet. Det finnes innebygde utfordringer og etiske problemer omkring LLM som må løses før vi kan utnytte dem til deres fulle potensiale. For eksempel fant en nyere Stanford-studie rasistisk og kjønnsbasert bias når de observerte ChatGPT-4 og hvordan den behandlet bestemte spørsmål som inneholdt for- og etternavn som antydet rase eller kjønn. I denne studien ble programmet bedt om å gi råd om hvor mye en skulle betale for en brukt sykkel som ble solgt av noen som het Jamal Washington, noe som resulterte i en mye lavere sum enn når selgeren het Logan Becker. Ettersom slike oppdagelser kommer til lyset, øker behovet for å løse LLM-utfordringer.
Hvordan mildne vanlige LLM-behov
Bias
En av de mest diskuterte problemene blant LLM er bias og rettferdighet. I en nyere studie testet eksperter fire nylig publiserte LLM og fant at alle uttrykte bias antagelser om menn og kvinner, spesielt de som var i linje med folks oppfatninger snarere enn de som var basert på fakta. I denne sammenhengen refererer bias til ulik behandling eller resultater blant ulike sosiale grupper, mest sannsynlig på grunn av historiske eller strukturelle maktubalanser.
I LLM skyldes bias valg av data, skaperdemografi og språk- eller kulturell skjevhet. Datautvalgsbias oppstår når tekstene valgt for LLM-trening ikke representerer den fulle mangfoldet av språk som brukes på nettet. LLM som er trent på omfattende, men begrensede, datasett kan arve bias som allerede finnes i disse tekstene. Med skaperdemografi er visse demografiske grupper mer fremtredende enn andre, noe som understreker behovet for mer mangfold og inklusivitet i innholdsskapelse for å redusere bias. For eksempel viser Wikipedia, en vanlig kilde for treningdata, en merkbar demografisk ubalanse blant sine redaktører med en majoritet av menn (84%). Dette er lignende skjevheter som finnes for språk og kultur. Mange kilder som LLM er trent på er skjevheter, med en engelsk-sentrert vinkel, som bare noen ganger oversettes nøyaktig på andre språk og kulturer.
Det er avgjørende at LLM er trent på filtrert data, og at det finnes guardrails for å undertrykke emner som ikke er konsistente representasjoner av data. En måte å gjøre dette på er gjennom dataforbedringsbaserte tekniker. Du kan legge til eksempler fra underrepresenterte grupper til treningdata, og dermed utvide datasettets mangfold. En annen mildningsstrategi er datafiltrering og omveiing, som primært fokuserer på å målrette bestemte, underrepresenterte eksempler innen en eksisterende datasett.
Hallusinasjoner
Innenfor LLM er hallusinasjoner et fenomen som kjennetegnes av produksjon av tekst som, selv om den er grammatisk korrekt og ser ut til å være sammenhengende, avviker fra faktisk nøyaktighet eller intensjonen bak kildematerialet. Faktisk har nyere rapporter funnet at en søksmål om en Minnesota-lov er direkte berørt av LLM-hallusinasjoner. En edsavleggelse som ble levert for å støtte loven, har blitt funnet å inneholde ikke-eksisterende kilder som kan ha blitt hallusinert av ChatGPT eller en annen LLM. Disse hallusinasjonene kan lett redusere en LLMs pålitelighet.
Det finnes tre primære former for hallusinasjoner:
- Input-konflikt-hallusinasjon: Dette skjer når en LLMs utdata avviker fra brukerens angitte input, som vanligvis inkluderer oppgaveinstruksjoner og den faktiske innholdet som behandles.
- Kontekst-konflikt-hallusinasjon: LLM kan generere intern inkonsistente svar i scenarier som involverer utvidet dialog eller flere utvekslinger. Dette antyder en potensiell mangelfullhet i modellens evne til å spore kontekst eller opprettholde kohesjon over flere interaksjoner.
- Faktum-konflikt-hallusinasjon: Denne formen for hallusinasjon oppstår når en LLM produserer innhold som er i strid med etablert faktisk kunnskap. Opphavet til slike feil er mangfoldige og kan oppstå på ulike stadier i livssyklusen til en LLM.
Mange faktorer har bidratt til dette fenomenet, som kunnskapsmangler, som forklarer hvordan LLM kan mangle kunnskap eller evne til å assimilere informasjon korrekt under fortrening. I tillegg kan bias i treningdata eller en sekvensiell genereringsstrategi for LLM, kalt “hallusinasjons-snowballing”, skape hallusinasjoner.
Det finnes måter å mildne hallusinasjoner, selv om de alltid vil være et kjennetegn ved LLM. Hjelpsomme mildningsstrategier for hallusinasjoner er mildning under fortrening (manuell raffinering av data ved hjelp av filtreringsmetoder) eller finjustering (kurering av treningdata). Imidlertid er mildning under inferens den beste løsningen på grunn av dens kostnadseffektivitet og kontrollerbarhet.
Personvern
Med oppblomstringen av internett har den økte tilgjengeligheten av personlige opplysninger og andre private data blitt en vidt kjent bekymring. En studie fant at 80% av amerikanske forbrukere er bekymret for at deres data brukes til å trene AI-modeller. Ettersom de mest fremtredende LLM er hentet fra nettsteder, må vi vurdere hvordan dette utgjør personvernrisiko og forblir et stort uløst problem for LLM.
Den enkleste måten å forhindre LLM fra å distribuere personlige opplysninger er å rense dem fra treningdata. Imidlertid, gitt den enorme mengden data som er involvert i LLM, er det nesten umulig å garantere at all personlig informasjon er utryddet. En annen vanlig alternativ for organisasjoner som avhenger av eksternt utviklede modeller er å velge en åpen kilde LLM i stedet for en tjeneste som ChatGPT.
Med denne tilnærmingen kan en kopi av modellen deployes internt. Brukernes forespørsler forblir sikre innen organisasjonens nettverk, i stedet for å bli eksponert for tredjepartstjenester. Selv om dette dramatisk reduserer risikoen for å lekke sensitive data, legger det også til betydelig kompleksitet. Gitt vanskelighetene med å fullstendig garantere beskyttelsen av private data, er det likevel avgjørende for applikasjonsutviklere å vurdere hvordan disse modellene kan utgjøre en risiko for deres brukere.
Neste grense for LLM
Ettersom vi fortsetter å vokse og forme påfølgende evolusjoner av LLM gjennom å mildne nåværende risiko, bør vi forvente gjennombruddet av LLM-agenter, som vi allerede ser selskaper som H med Runner H, som begynner å lanseres. Skiftet fra rene språkmodeller til agente-arkitekturer representerer en endring i AI-systemdesign; industrien vil bevege seg forbi de innebygde begrensningene i chat-grensesnitt og enkel generering med støtte for henting. Disse nye agent-rammene vil ha sofistikerte planleggingsmoduler som bryter ned komplekse mål til atomiske underoppgaver, opprettholde episodisk minne for kontekstuell resonnering og utnytte spesialiserte verktøy gjennom godt definerte API-er. Dette skaper en mer robust tilnærming til oppgaveautomatisering. Arkitekturprogresjonen hjelper med å mildne de vanlige utfordringene rundt oppgaver og resonnering, verktøyintegrering og utføringsovervåking innen tradisjonelle LLM-implementeringer.
I tillegg til LLM, vil det være større fokus på å trene mindre språkmodeller på grunn av deres kostnadseffektivitet, tilgjengelighet og enkelhet ved deployering. For eksempel spesialiserer domenespesifikke språkmodeller seg på bestemte bransjer eller felt. Disse modellene er finjustert med domenespesifikke data og terminologi, og gjør dem ideelle for komplekse og regulerte miljøer, som det medisinske eller juridiske felt, hvor nøyaktighet er essensiell. Denne målrettede tilnærmingen reduserer sannsynligheten for feil og hallusinasjoner som generelle modeller kan produsere når de møter spesialisert innhold.
Ettersom vi fortsetter å utforske nye grenser i LLM, er det essensielt å presse grensene for innovasjon og løse og mildne potensielle risikoer forbundet med deres utvikling og deployering. Bare ved å først identifisere og proaktivt løse utfordringer relatert til bias, hallusinasjoner og personvern kan vi skape en mer robust grunnlag for LLM å trives over diverse felt.












