Tankeledere

Hvis din AI hallucinerer, skyld ikke AI-en

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

AI-“hallusinasjoner” – de overbevisende lydende, men feilaktige svarene – trekker mye medieoppmerksomhet, som i den nylige New York Times-artikkelen AI Is Getting More Powerful, But Its Hallucinations Are Getting Worse. Hallusinasjoner er en reel fare når du har å gjøre med en forbruker-chatbot. I sammenheng med bedriftsapplikasjoner av AI, er det en enda mer alvorlig bekymring. Heldigvis, som en bedriftsteknologileder, har jeg mer kontroll over det også. Jeg kan sikre at agenten har riktige data for å produsere et meningsfullt svar.

Fordi det er det virkelige problemet. I bedrift, er det ingen unnskyldning for AI-hallusinasjoner. Slutt å skyld AI-en. Skyld deg selv for ikke å bruke AI på riktig måte.

Når generative AI-verktøy hallucinerer, gjør de det de er designet til å gjøre – å gi det beste svaret de kan basert på dataene de har tilgjengelig. Når de finner på noe, produserer de et svar som ikke er basert på virkeligheten, det er fordi de mangler relevante data, kan ikke finne dem, eller forstår ikke spørsmålet. Ja, nye modeller som OpenAI sine o3 og o4-mini hallucinerer mer, og oppfører seg enda mer “kreativt” når de ikke har et godt svar på spørsmålet som er stilt til dem. Ja, mer kraftfulle verktøy kan hallucinere mer – men de kan også produsere mer kraftfulle og verdifulle resultater hvis vi setter dem opp for suksess.

Hvis du ikke ønsker at din AI skal hallucinere, må du ikke sulte den for data. Mat AI-en med de beste, mest relevante dataene for problemet du ønsker å løse, og den vil ikke bli fristet til å gå feil.

Even så, når du arbeider med et AI-verktøy, anbefaler jeg å holde dine kritiske tenkeevner intakt. Resultatene AI-agenter leverer, kan være produktive og deilige, men poenget er ikke å koble fra hjernen og la programvaren gjøre all tenkingen for deg. Fortsett å stille spørsmål. Når en AI-agent gir deg et svar, stil spørsmål om svaret for å sikre at det har mening og er bakket opp av data. Hvis det er tilfelle, bør det være et oppmuntrende tegn på at det er verdt å bruke tid på å stille følgespørsmål.

Jo mer du stiller spørsmål, desto bedre innsikt vil du få.

Hvorfor hallusinasjoner skjer

Det er ikke noen mysterium. AI-en prøver ikke å lyve til deg. Hvert stort språkmodell (LLM) AI er i realiteten å forutsi det neste ordet eller tallet basert på sannsynlighet.

På et høyt nivå, det som skjer her, er at LLM-er setter sammen setninger og avsnitt ett ord av gangen, og forutsier det neste ordet som bør skje i setningen basert på milliarder av andre eksempler i treningsdataene. Forgjengerne til LLM-er (bortsett fra Clippy) var autocomplete-prompter for tekstmedlinger og datamaskinkode, automatiserte menneskespråk-oversettelsesverktøy og andre probabilistiske språkligesystemer. Med økt brutto beregningskraft, samt trening på internett-skala data, ble disse systemene “smart” nok til at de kunne føre en fullstendig samtale over chat, som verden lærte med introduksjonen av ChatGPT.

AI-nektorer liker å peke på at dette ikke er det samme som “ekte” intelligens, bare programvare som kan destillere og regurgitere den menneskelige intelligensen som er blitt matet inn i den. Spør den om å sammenfatte data i en skrevet rapport, og den imiterer måten andre forfattere har sammenfattet lignende data.

Dette synes meg å være et akademisk argument så lenge dataene er korrekte og analysen er nyttig.

Hva skjer hvis AI-en ikke har dataene? Den fyller inn hullene. Noen ganger er det morsomt. Noen ganger er det en total rot.

Når man bygger AI-agenter, er dette 10 ganger større risiko. Agenter er ment å gi handlebare innsikter, men de tar flere beslutninger underveis. De utfører flertrinnsoppgaver, hvor resultatet av trinn 1 informerer trinn 2, 3, 4, 5, … 10 … 20. Hvis resultatene av trinn 1 er feil, vil feilen bli forsterket, og utgangen ved trinn 20 blir enda verre. Spesielt, ettersom agenter kan ta beslutninger og hoppe over trinn.

Utført riktig, agenter oppnår mer for bedriften som deployer dem. Likevel, som AI-produktledere, må vi erkjenne den større risikoen som følger med den større belønningen.

Hva er det vårt team gjorde. Vi så risikoen, og tok tak i den. Vi bygde ikke bare en fancy robot; vi sikret at den kjører på riktige data. Her er hva jeg mener vi gjorde riktig:

  • Bygget agenten til å stille riktige spørsmål og verifisere at den har riktige data. Sikre at den innledende datainndata-prosessen til agenten er mer deterministisk, mindre “kreativ”. Du ønsker at agenten skal si når den ikke har riktige data og ikke fortsette til neste trinn, men heller finne på dataene.
  • Strukturere en playbook for din agent – sikre at den ikke finner på en ny plan hver gang, men har en semi-strukturert tilnærming. Struktur og kontekst er ekstremt viktig på datagjennvinning- og analysenivå. Du kan la agenten løsne opp og oppføre seg mer “kreativt” når den har faktene og er klar til å skrive sammenfattingen, men først få faktene rett.
  • Bygge et høykvalitetsverktøy for å trekke ut dataene. Dette bør være mer enn bare en API-kall. Ta tid til å skrive koden (folk gjør fortsatt det) som gjør riktige mengder og variasjoner av data som vil bli samlet inn, og bygge kvalitetskontroller inn i prosessen.
  • Få agenten til å vise sitt arbeid. Agenten bør sitere sine kilder og lenke til hvor brukeren kan verifisere dataene, fra den opprinnelige kilden, og utforske dem videre. Ingen skjulte triks tillatt!
  • Guardrails: Tenk gjennom hva som kan gå galt, og bygge inn beskyttelse mot feilene du absolutt ikke kan tillate. I vårt tilfelle, betyr det at når agenten som er ansvarlig for å analysere en marked ikke har dataene – som våre Similarweb-data, ikke noen tilfeldig datakilde hentet fra nettet – sikrer at den ikke finner på noe, er en essensiell guardrail. Bedre for agenten å ikke kunne svare enn å levere et feilaktig eller misvisende svar.

Vi har inkorporert disse prinsippene i vår nylige utgivelse av våre tre nye agenter, med flere til å følge. For eksempel, vår AI-møteforberedelsesagent for salgsfolk ber ikke bare om navnet på målselskapet, men også detaljer om målet med møtet og hvem det er med, og klarer til å gi et bedre svar. Den trenger ikke å gjette fordi den bruker en mengde selskapsdata, digitale data og eksutive profiler for å informere sine anbefalinger.

Er våre agenter perfekte? Nei. Ingen lager ennå perfekt AI, ikke engang de største selskapene i verden. Men å møte problemet, er en hel del bedre enn å ignorere det.

Ønsker du færre hallusinasjoner? Gi din AI en fin del høykvalitetsdata.

Hvis den hallucinerer, kanskje er det ikke AI-en som trenger å fikses. Kanskje er det din tilnærming til å dra nytte av disse kraftfulle nye mulighetene uten å sette inn tid og innsats for å få dem rett.

Omri Shtayer er visepresident for Data Products og DaaS i Similarweb, der han leder innovasjon på tvers av organisasjonen og driver veksten av deres dataforretning. Han har nylig ledet lanseringen av AI-agenter - skalerbare, intelligente verktøy designet for å hjelpe bedrifter med å oversette data til virkelige resultater. Med en rekord for å bygge innvirkende datasøknader, er Omri i forkant av å transformere hvordan selskaper utnytter digital intelligens.