AI-modellen en platforms

Hoe enkele tokens AI-redenering kunnen maken of breken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Stel je voor dat je een AI vraagt om een eenvoudig wiskundig probleem op te lossen over het terugbetalen van een lening. Wanneer de AI het woord “owed” tegenkomt, hapert het, waardoor het incorrecte berekeningen en foutieve logica produceert. Maar verander dat enkele woord in “paid” en plotseling verandert de redenering van de AI – het wordt duidelijk, nauwkeurig en precies. Dit is geen eigenaardigheid of toeval; het is een fundamentele inzicht die onze kennis over hoe AI-systemen denken, herschikt.

Wetenschappers aan de Tsinghua University en het Tencent AI Lab hebben een fenomeen in AI ontdekt: bepaalde woorden fungeren als neurale schakeltafels, die in staat zijn om de hele redenering van een AI om te leiden. Deze “kritieke tokens”, zoals onderzoekers ze noemen, kunnen het verschil maken tussen logische duidelijkheid en computationele verwarring.

Denk hierbij aan een GPS-systeem. Een enkele incorrecte straatnaam kan je mijlen verkeerd leiden, zelfs als elke andere richting perfect is. Op dezelfde manier kunnen deze kritieke woorden de hele logische reis van een AI omleiden, ongeacht hoe robuust de omringende context ook mag zijn.

De code van het woord kraken

De doorbraak kwam toen onderzoekers een methode ontwikkelden die cDPO (contrastive Direct Preference Optimization) heet. In tegenstelling tot eerdere benaderingen die alle woorden gelijk behandelden, erkent cDPO dat in het domein van AI-redenering, niet alle woorden even zwaar wegen.

Het onderzoeksteam demonstreerde dit door uitgebreid testen over meerdere AI-modellen, waaronder Llama-3 en DeepSeek-math. Hun bevindingen toonden aan dat wanneer bepaalde kritieke tokens aanwezig waren, de nauwkeurigheid van de AI aanzienlijk kon dalen – soms tot zo laag als 15,94%. Echter, wanneer deze tokens effectief werden geïdentificeerd en beheerd, steeg de nauwkeurigheid tot boven de 84%.

Wat deze ontdekking bijzonder krachtig maakt, is de precisie. In plaats van brede veranderingen aan te brengen in hoe AI-modellen taal verwerken, richt cDPO zich op specifieke woorden die als logische pivotpunten fungeren. Het is alsof je de drukpunten in een neurale netwerk vindt – die cruciale knooppunten waarop de juiste aanpassing kan leiden tot dramatisch verbeterde redenering.

De implicaties zijn belangrijk. Denk aan een AI-assistent die helpt bij financiële berekeningen, medische analyse of technische specificaties. Een enkele kritieke token kan het verschil maken tussen accurate richtlijnen en kostbare fouten. Door deze cruciale woorden te identificeren en te beheren, maken we AI meer betrouwbaar in real-world toepassingen.

Lin, Liang, Xu et al. Tsinghua University & Tencent AI Lab (2024)

Achter de neurale gordijn

De magie van cDPO ligt in de elegante aanpak van een complex probleem. In plaats van te proberen de manier waarop AI denkt te herschrijven, fungeert het meer als een hooggespecialiseerd trainingsprogramma dat AI-modellen leert om logische mijnen in hun redeneringsproces te herkennen.

Hier wordt het echt interessant: het systeem creëert eigenlijk twee verschillende perspectieven op hetzelfde probleem – een die leert van correcte redenering voorbeelden en een die onjuiste voorbeelden bestudeert. Het is vergelijkbaar met hoe een schaakspeler kan verbeteren door zowel winnende als verliespartijen te analyseren, maar met een cruciaal verschil: cDPO identificeert automatisch welke zetten (of in dit geval, welke woorden) het cruciale verschil maakten.

Het systeem bereikt dit door wat onderzoekers “contrastive estimation” noemen. Stel je voor dat je twee expert-adviseurs hebt – een die consistent correcte conclusies bereikt en een die vaak fouten maakt. Door te vergelijken hoe deze twee adviseurs verschillende woorden behandelen, kan cDPO exact bepalen welke termen de redenering doen ontsporen.

De resultaten spreken voor zich. In tests over meerdere AI-modellen, waaronder de geavanceerde Llama-3 en gespecialiseerde DeepSeek-math systemen, verbeterde cDPO consistent de redenering nauwkeurigheid. We hebben het niet over kleine verbeteringen – in sommige gevallen steeg de nauwkeurigheid van ongeveer 30% tot boven de 80% wanneer kritieke tokens effectief werden beheerd.

Van lab naar realiteit

Deze doorbraak opent deuren naar praktische toepassingen die de manier waarop we AI in alledaagse scenario’s gebruiken, kunnen verbeteren.

Denk aan deze real-world implicaties:

  • Financiële analyse: Wanneer AI-systemen beleggingsmogelijkheden analyseren of leningvoorwaarden berekenen, kan een enkel verkeerd geïnterpreteerd woord leiden tot aanzienlijk verschillende aanbevelingen. De mogelijkheid van cDPO om deze kritieke termen te identificeren en te beheren, kan het verschil maken tussen winstgevende beslissingen en kostbare fouten.
  • Medische documentatie: In gezondheidszorginstellingen, waar precisie van het grootste belang is, moeten AI-systemen die medische dossiers analyseren, elke term correct interpreteren. Het verschil tussen “verhoogd” en “verlaagd” in een patiëntgeschiedenis is niet alleen een kwestie van semantiek – het is cruciaal voor adequate behandelingsaanbevelingen.
  • Technische documentatie: Engineering- en software-ontwikkelteams zijn steeds meer afhankelijk van AI om te helpen bij het verwerken en analyseren van technische specificaties. Door meer betrouwbare redenering over technische vereisten te garanderen, kan cDPO helpen voorkomen dat dure misinterpretaties in complexe projecten optreden.

De technologie toont al belofte in gecontroleerde testomgevingen. Bijvoorbeeld, toen het werd opgedragen om wiskundige redeneringsproblemen van de GSM8K-benchmark op te lossen – een standaardtest voor AI-logische capaciteiten – toonden modellen die cDPO gebruikten, consistente verbetering over verschillende soorten problemen en complexiteitsniveaus.

Wat dit bijzonder spannend maakt, is de schaalbaarheid. In tegenstelling tot eerdere benaderingen die uitgebreide herscholing of complexe aanpassingen van bestaande AI-systemen vereisten, kan cDPO worden geïmplementeerd als een verbetering van bestaande modellen.

Het herschrijven van de taalcircuit van AI

De implicaties van cDPO gaan verder dan individuele toepassingen. Het daagt ook onze eerdere aannamen over machine learning-systemen uit en opent nieuwe mogelijkheden voor verbetering.

Denk aan traditionele AI-training als het leren van iemand om muziek te spelen door hele nummers te memoriseren. In contrast, is cDPO meer als het leren van iemand om specifieke noten te herkennen die een melodie doen werken. Deze granulaire kennis stelt ons in staat om meer precieze en betrouwbare verbeteringen in AI-redeneringscapaciteiten aan te brengen.

De bevindingen van het onderzoeksteam suggereren dat we alleen maar het oppervlak krabben. Vroege resultaten laten zien dat wanneer AI-modellen zich bewust worden van deze kritieke tokens, ze niet alleen fouten vermijden – ze ontwikkelen ook meer robuuste redeneringspatronen overall. Het is alsof het identificeren van deze cruciale beslissingspunten de AI helpt om sterker logische kaders vanaf de grond af aan te bouwen.

Terwijl cDPO een significante stap vooruit vertegenwoordigt, verlicht het ook de weg vooruit voor AI-ontwikkeling. De mogelijkheid om kritieke tokens te identificeren en te beheren, is alleen maar het begin. Het opent deuren naar nieuwe vragen en mogelijkheden over hoe we AI-redenering verder kunnen verbeteren.

Denk aan de potentiële ontwikkelingen in de toekomst:

Geavanceerde patroonherkenning:

  • Systemen die automatisch nieuwe categorieën van kritieke tokens kunnen identificeren
  • AI die zijn redeneringsstrategieën aanpast op basis van gedetecteerde tokenpatronen
  • Een meer geavanceerd begrip van context en semantische relaties

Verhoogde betrouwbaarheid:

  • Consistenter presteren over verschillende soorten redeneringstaken
  • Beter omgaan met randgevallen en ongebruikelijke scenario’s
  • Verhoogde transparantie in hoe AI-systemen hun conclusies bereiken

Toepassingen over meerdere domeinen:

  • Aanpassing van deze technieken aan andere gebieden van AI-ontwikkeling
  • Integratie met bestaande AI-verbeteringsmethoden
  • Nieuwe benaderingen om AI-betrouwbaarheid in gespecialiseerde gebieden te verbeteren

Naarmate deze systemen meer betrouwbaar worden in hun redenering, komen we dichter bij AI die vertrouwde partners kunnen zijn in complexe beslissingsprocessen. Naarmate het onderzoek voortgaat en de implementaties evolueren, zullen we waarschijnlijk nog meer innovatieve toepassingen van deze technologie zien over verschillende gebieden en industrieën.

Wat dit bijzonder veelbelovend maakt, is de praktische aard ervan. In tegenstelling tot sommige AI-vooruitgang die complete herschikkingen van bestaande systemen vereist, kan de aanpak van cDPO worden geïntegreerd in bestaande AI-modellen, waardoor het een waardevol instrument is voor onmiddellijke verbetering en een weg vrijmaakt voor toekomstige ontwikkelingen.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.