Thought leaders

Het stoppen van AI die verhalen vertelt: Een gids voor het voorkomen van hallucinaties

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

AI revolutioneert de manier waarop vrijwel elke industrie werkt. Het maakt ons efficiënter, productiever en – als het correct wordt geïmplementeerd – beter in ons werk. Maar naarmate onze afhankelijkheid van deze nieuwe technologie snel toeneemt, moeten we onszelf eraan herinneren dat AI niet onfeilbaar is. De uitvoer van AI moet niet voor waar worden aangenomen, omdat AI, net als mensen, fouten kan maken.

We noemen deze fouten “AI-hallucinaties”. Dergelijke fouten variëren van het verkeerd beantwoorden van een wiskundig probleem tot het verstrekken van onjuiste informatie over overheidsbeleid. In streng gereguleerde industrieën kunnen hallucinaties leiden tot dure boetes en juridische problemen, niet te vergeten ontevreden klanten.

De frequentie van AI-hallucinaties moet dan ook reden tot bezorgdheid zijn: het wordt geschat dat moderne grote taalmodellen (LLM’s) hallucineren tussen de 1% en 30% van de tijd. Dit resulteert in honderden valse antwoorden die dagelijks worden gegenereerd, wat betekent dat bedrijven die deze technologie willen gebruiken, bijzonder selectief moeten zijn bij het kiezen van de tools die ze implementeren.

Laten we onderzoeken waarom AI-hallucinaties gebeuren, wat er op het spel staat en hoe we ze kunnen identificeren en corrigeren.

Garbage in, garbage out

Herinner je je het spel “telefoon” dat je als kind speelde? Hoe de startzin werd veranderd toen hij van speler naar speler ging, waardoor een compleet andere verklaring ontstond tegen de tijd dat hij de cirkel rond was?

De manier waarop AI leert van zijn invoer is vergelijkbaar. De antwoorden die LLM’s genereren zijn alleen zo goed als de informatie die ze krijgen, wat betekent dat onjuiste context kan leiden tot de generatie en verspreiding van valse informatie. Als een AI-systeem is gebouwd op data die onjuist, verouderd of bevooroordeeld is, zullen de uitvoer ervan dat weerspiegelen.

Zo is een LLM alleen zo goed als zijn invoer, vooral als er een gebrek is aan menselijke interventie of toezicht. Naarmate meer autonome AI-oplossingen zich verspreiden, is het cruciaal dat we tools voorzien van de juiste gegevenscontext om hallucinaties te voorkomen. We hebben een grondige training van deze gegevens nodig, en/of de mogelijkheid om LLM’s zo te sturen dat ze alleen reageren vanuit de context die ze krijgen, in plaats van informatie te halen van overal op internet.

Waarom zijn hallucinaties belangrijk?

Voor klantgerichte bedrijven is nauwkeurigheid alles. Als medewerkers afhankelijk zijn van AI voor taken zoals het samenvatten van klantgegevens of het beantwoorden van klantvragen, moeten ze erop vertrouwen dat de antwoorden die dergelijke tools genereren accuraat zijn.

Anders lopen bedrijven het risico hun reputatie en klantloyaliteit te schaden. Als klanten onvoldoende of valse antwoorden krijgen van een chatbot, of als ze moeten wachten terwijl medewerkers de uitvoer van de chatbot controleren, kunnen ze hun zaken elders doen. Mensen zouden zich geen zorgen moeten maken over of de bedrijven waarmee ze te maken hebben hen valse informatie geven – ze willen snelle en betrouwbare ondersteuning, wat betekent dat het krijgen van deze interacties goed is van het grootste belang.

Bedrijfsleiders moeten hun huiswerk doen bij het selecteren van de juiste AI-tool voor hun medewerkers. AI moet tijd en energie voor medewerkers vrijmaken om zich te concentreren op hogere-waarde taken; investeren in een chatbot die constante menselijke controle vereist, maakt de hele adoptie zinloos. Maar zijn de hallucinaties echt zo prominent of wordt de term gewoon te veel gebruikt om elke reactie te identificeren die we verkeerd achten?

AI-hallucinaties bestrijden

Neem in overweging: Dynamic Meaning Theory (DMT), het concept dat een begrip tussen twee personen – in dit geval de gebruiker en de AI – wordt uitgewisseld. Maar de beperkingen van taal en kennis van de onderwerpen veroorzaken een misalignering in de interpretatie van het antwoord.

In het geval van AI-gegenereerde antwoorden is het mogelijk dat de onderliggende algoritmen nog niet volledig zijn uitgerust om tekst te interpreteren of te genereren op een manier die overeenkomt met de verwachtingen die we als mensen hebben. Deze discrepantie kan leiden tot antwoorden die op het eerste gezicht accuraat lijken, maar uiteindelijk de diepte of nuance missen die nodig is voor echt begrip.

Verder halen de meeste algemene LLM’s informatie alleen uit content die openbaar beschikbaar is op internet. Bedrijfsoplossingen van AI werken beter als ze worden geïnformeerd door gegevens en beleid die specifiek zijn voor individuele industrieën en bedrijven. Modellen kunnen ook worden verbeterd met directe menselijke feedback – vooral agente-oplossingen die zijn ontworpen om te reageren op toon en syntaxis.

Dergelijke tools moeten ook streng worden getest voordat ze consumentgericht worden. Dit is een cruciaal onderdeel van het voorkomen van AI-hallucinaties. De hele flow moet worden getest met behulp van gesprekken op basis van beurten met de LLM die de rol van een persona speelt. Dit stelt bedrijven in staat om beter te begrijpen of gesprekken met een AI-model succesvol zullen zijn voordat ze het in de wereld loslaten.

Het is essentieel voor zowel ontwikkelaars als gebruikers van AI-technologie om zich bewust te zijn van de dynamische betekenis theorie in de antwoorden die ze krijgen, evenals de dynamiek van de taal die wordt gebruikt in de invoer. Onthoud, context is key. En, als mensen, begrijpen we de meeste context op onuitgesproken wijze, of het nu gaat om lichaamstaal, sociale trends – zelfs onze toon. Als mensen hebben we het potentieel om te hallucineren als reactie op vragen. Maar, in onze huidige iteratie van AI, wordt onze mens-tot-mens begrip niet zo gemakkelijk gecontextualiseerd, dus we moeten kritischer zijn over de context die we in onze schriftelijke communicatie bieden.

Om het zo maar te zeggen – niet alle AI-modellen zijn gelijkwaardig. Naarmate de technologie zich ontwikkelt om steeds complexere taken uit te voeren, is het cruciaal voor bedrijven die implementatie overwegen om tools te identificeren die klantinteracties en -ervaringen zullen verbeteren in plaats van ze te schaden.

De verantwoordelijkheid ligt niet alleen bij oplossingsaanbieders om ervoor te zorgen dat ze alles in hun macht hebben gedaan om de kans op hallucinaties te minimaliseren. Potentiële kopers hebben ook hun rol te spelen. Door oplossingen te prioriteren die grondig getraind en getest zijn en die kunnen leren van propriëtaire gegevens (in plaats van alles en iedereen op internet), kunnen bedrijven het meeste uit hun AI-investeringen halen om medewerkers en klanten succesvol te maken.

Dan Balaceanu, Chief Product Officer bij DRUID AI, heeft ervaring met het beheren van ontwikkelafdelingen en -processen binnen enterprise-organisaties. Hij is een hooggekwalificeerde Solutions Architect en Technical Project Manager met meer dan 15 jaar ervaring in het leiden van middelgrote ontwikkelings- en implementatieprojecten, met verzameling van klantvereisten, systeemanalyse, applicatieontwikkeling en -testen, in klantgerichte teams.