Tankeledere

Når din AI opfinder fakta: Den enterprise-risiko, som ingen leder kan ignorere

mm
Føj Unite.AI til dine foretrukne kilder på Google

Det lyder rigtigt. Det ser rigtigt ud. Det er forkert. Det er din AI på hallucination. Problemet er ikke bare, at i dagens generative AI-modeller hallucinerer. Det er, at vi føler, at hvis vi bygger nok sikkerhedsforanstaltninger, finjusterer det, RAG det og tamer det på en eller anden måde, så vil vi være i stand til at adoptere det på enterprise-skala.

Studie Domæne Hallucinationsrate Vigtige fund
Stanford HAI & RegLab (jan 2024) Juridisk 69%–88% LLM’er viste høje hallucinationsrater, når de besvarede juridiske spørgsmål, ofte uden selvbevidsthed om deres fejl og forstærkede forkerte juridiske antagelser.
JMIR-studie (2024) Akademiske referencer GPT-3.5: 90,6%, GPT-4: 86,6%, Bard: 100% LLM-genererede referencer var ofte irrelevante, forkerte eller ikke understøttet af tilgængelig litteratur.
UK-studie om AI-genereret indhold (feb 2025) Finans Ikke specificeret AI-genereret desinformation øgede risikoen for bankruns, med en betydelig del af bankkunder, der overvejede at flytte deres penge efter at have set AI-genereret falsk indhold.
World Economic Forum Global Risks Report (2025) Global risikovurdering Ikke specificeret Misinformation og desinformation, forstærket af AI, rangerede som den største globale risiko over en to-årig horizon.
Vectara Hallucination Leaderboard (2025) AI-modelvurdering GPT-4.5-Preview: 1,2%, Google Gemini-2.0-Pro-Exp: 0,8%, Vectara Mockingbird-2-Echo: 0,9% Vurderede hallucinationsrater på tværs af forskellige LLM’er, afslørende betydelige forskelle i præstation og nøjagtighed.
Arxiv-studie om faktuel hallucination (2024) AI-forskning Ikke specificeret Introducerede HaluEval 2.0 til at systematisk studere og registrere hallucinationer i LLM’er, fokuseret på faktuelle uøjagtigheder.

Hallucinationsrater spænder fra 0,8% til 88%

Ja, det afhænger af modellen, domænet, brugsfaldet og konteksten, men den spredning burde ryste enhver enterprise-beslutningstager. Disse er ikke ekstreme fejl. De er systemiske. Hvordan tager du den rigtige beslutning, når det kommer til AI-adopteringsbeslutninger i din virksomhed? Hvor, hvordan, hvor dybt, hvor bredt? 

Og eksempler på virkelige konsekvenser af dette kommer over din nyhedsfeed hver dag. G20’s Financial Stability Board har markeret generativ AI som en vektor for desinformation, der kunne forårsage markedskriser, politisk ustabilitet og værre–flash-crashes, falske nyheder og svindel. I en anden nyligt rapporteret historie udsendte advokatfirmaet Morgan & Morgan en nødsituationsskrivelse til alle advokater: Indsend ikke AI-genererede indlæg uden at kontrollere. Falsk retsafgørelse er en “fyringsgrund”.

Dette kan ikke være den bedste tid til at satse på, at hallucinationsraterne nærmer sig nul på kort tid. Især i reguleringer, såsom juridisk, livsvidenskab, kapitalmarkeder eller andre, hvor fejlkostnen kan være høj, herunder udgivelse af højere uddannelse.

Hallucination er ikke en afrundingsfejl

Dette handler ikke om en lejlighedsvis forkert svar. Det handler om risiko: Reputations-, juridisk-, operativ.

Generativ AI er ikke en resonansmaskine. Det er en statistisk afslutter, en stokastisk papegøje. Det afslutter dit prompt på den mest sandsynlige måde baseret på træningsdata. Selv de sandhedslignende dele er gæt. Vi kalder de mest latterlige dele “hallucinationer”, men hele outputtet er en hallucination. En velstillet en. Det virker dog – magisk godt – indtil det ikke gør.

AI som infrastruktur

Og alligevel er det vigtigt at sige, at AI vil være klar til enterprise-omfattende adoption, når vi begynder at behandle det som infrastruktur, og ikke som magi. Og hvor det er nødvendigt, skal det være gennemsigtigt, forklarligt og sporbart. Og hvis det ikke er, så er det simpelthen ikke klar til enterprise-omfattende adoption for disse brugsfald. Hvis AI træffer beslutninger, skal det være på jeres bestyrelses radar.

EU’s AI-akt er føregænger her. Højrisikodomæner som retfærdighed, sundhed og infrastruktur vil blive reguleret som mission-kritiske systemer. Dokumentation, test og forklarbarhed vil være obligatorisk.

Hvad enterprise-sikre AI-modeller gør

Virksomheder, der specialiserer sig i at bygge enterprise-sikre AI-modeller, tager en bevidst beslutning om at bygge AI anderledes. I deres alternative AI-arkitekturer er sprogmodellerne ikke trænet på data, så de er ikke “forurenet” med noget uønsket i data, såsom bias, IP-intrång eller tilbøjelighed til at gætte eller hallucinere.

Disse modeller “kompletterer ikke dine tanker” – de resonnerer fra brugerens indhold. Deres videnbas. Deres dokumenter. Deres data. Hvis svaret ikke er der, siger disse modeller det. Det er, hvad der gør disse AI-modeller forklarbare, sporbare, deterministiske og en god mulighed på steder, hvor hallucinationer er uacceptable.

En 5-trins playbook for AI-ansvarlighed

  1. Kortlæg AI-landskabet – Hvor bruges AI på tværs af jeres forretning? Hvordan påvirker de beslutninger? Hvad er præmien for at kunne spore disse beslutninger tilbage til gennemsigtige analyser på pålidelig kildegrundlag?
  2. Alignér jeres organisation – Afhængigt af omfanget af jeres AI-udrulning, opret rolle, komitéer, processer og revisionspraksis så rigorøse som dem for finansielle eller cybersikkerhedsrisici.
  3. Bring AI ind i bestyrelsesniveau-risiko – Hvis jeres AI taler til kunder eller regulatorer, hører det hjemme i jeres risikorapporter. Governance er ikke en sideshow.
  4. Behandl leverandører som co-ansvarlige – Hvis jeres leverandørs AI opfinder noget, ejer I stadig konsekvenserne. Udvid jeres AI-ansvarlighedsprincipper til dem. Kræv dokumentation, revisionsrettigheder og SLA’er for forklarbarhed og hallucinationsrater.
  5. Træn skepsis – Jeres team skal behandle AI som en junioranalytiker – nyttig, men ikke ufejlbarlig. Fejr, når nogen identificerer en hallucination. Tillid skal være fortjent.

Fremtiden for AI i virksomheden er ikke større modeller. Hvad der er nødvendigt, er mere præcision, mere gennemsigtighed, mere tillid og mere ansvarlighed.

Joy Dasgupta er administrerende direktør i Gyan og en erfaren leder inden for AI-drevne løsninger med mere end to årtiers globale ledelseserfaring på tværs af virksomheder som Hewlett-Packard, American Express og Genpact.

Gyan er en grundlæggende ny AI-arkitektur bygget til virksomheder med lav eller nul tolerance for hallucinationer, IP-risici eller energikrævende modeller. Hvor tillid, præcision og ansvarlighed er vigtige, sikrer Gyan, at hver enkelt indsigt er forklarlig, tilbage til reliable kilder, med fuld dataprivacy som kerne.