Ethiek

MIT-onderzoekers ontwikkelen nieuw AI-model met behulp van nieuwsgierigheidsgestuurde machine learning om de veiligheidstesten van chatbots te verbeteren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In recente jaren zijn grote taalmodellen (LLM’s) en AI-chatbots enorm populair geworden en veranderen de manier waarop we met technologie omgaan. Deze geavanceerde systemen kunnen mensachtige antwoorden genereren, helpen bij verschillende taken en waardevolle inzichten bieden.

Echter, naarmate deze modellen geavanceerder worden, zijn er bezorgdheden over hun veiligheid en het potentieel voor het genereren van schadelijke inhoud naar voren gekomen. Om de verantwoorde inzet van AI-chatbots te garanderen, zijn grondige tests en veiligheidsmaatregelen essentieel.

Beperkingen van huidige methoden voor veiligheidstesten van chatbots

Momenteel is de primaire methode voor het testen van de veiligheid van AI-chatbots een proces genaamd red-teaming. Dit houdt in dat menselijke testers prompts creëren die zijn ontworpen om onveilige of giftige antwoorden van de chatbot te ontlokken. Door de chatbot bloot te stellen aan een breed scala aan potentieel problematische invoer, proberen ontwikkelaars kwetsbaarheden of ongewenst gedrag te identificeren en aan te pakken. Echter, deze door de mens gestuurde benadering heeft zijn beperkingen.

Gezien de enorme mogelijkheden van gebruikersinvoer is het bijna onmogelijk voor menselijke testers om alle mogelijke scenario’s te dekken. Zelfs met uitgebreide tests kunnen er gaten zitten in de prompts die worden gebruikt, waardoor de chatbot kwetsbaar kan zijn voor het genereren van onveilige antwoorden wanneer hij wordt geconfronteerd met nieuwe of onverwachte invoer. Bovendien maakt de handmatige aard van red-teaming het een tijdrovend en resource-intensief proces, vooral omdat taalmodellen in omvang en complexiteit blijven groeien.

Om deze beperkingen aan te pakken, hebben onderzoekers zich gewend tot automatisering en machine learning-technieken om de efficiëntie en effectiviteit van veiligheidstesten van chatbots te verbeteren. Door de kracht van AI zelf te benutten, proberen ze meer omvattende en schaalbare methoden te ontwikkelen voor het identificeren en mitigeren van potentieel risico’s die zijn verbonden aan grote taalmodellen.

Nieuwsgierigheidsgestuurde machine learning-benadering voor red-teaming

Onderzoekers van de Improbable AI Lab van MIT en de MIT-IBM Watson AI Lab hebben een innovatieve benadering ontwikkeld om het red-teaming-proces te verbeteren met behulp van machine learning. Hun methode houdt in dat een apart red-team-groot taalmodel wordt getraind om automatisch diverse prompts te genereren die een bredere reeks ongewenste antwoorden van de chatbot kunnen ontlokken.

De sleutel tot deze benadering ligt in het inprenten van een gevoel van nieuwsgierigheid in het red-team-model. Door het model aan te moedigen om nieuwe prompts te verkennen en te focussen op het genereren van invoer die giftige antwoorden ontlokt, proberen de onderzoekers een bredere reeks potentieel kwetsbaarheden te ontdekken. Deze nieuwsgierigheidsgestuurde exploratie wordt bereikt door een combinatie van versterkingstechnieken en gemodificeerde beloningsignalen.

Het nieuwsgierigheidsgestuurde model omvat een entropiebonus, die het red-team-model aanmoedigt om meer willekeurige en diverse prompts te genereren. Bovendien worden noviteitsbeloningen geïntroduceerd om het model aan te moedigen prompts te creëren die semantisch en lexicaal verschillend zijn van eerder gegenereerde prompts. Door prioriteit te geven aan noviteit en diversiteit, wordt het model aangemoedigd om onverkende gebieden te verkennen en verborgen risico’s te ontdekken.

Om te garanderen dat de gegenereerde prompts coherent en natuurlijk blijven, hebben de onderzoekers ook een taalbonus opgenomen in de trainingsdoelstelling. Deze bonus helpt om te voorkomen dat het red-team-model nonsensical of irrelevante tekst genereert die de toxiciteitsclassificator ertoe kan brengen hoge scores toe te kennen.

De nieuwsgierigheidsgestuurde benadering heeft opmerkelijk succes geboekt in het overtreffen van zowel menselijke testers als andere geautomatiseerde methoden. Het genereert een grotere variëteit aan distincte prompts en ontlokt steeds giftigere antwoorden van de chatbots die worden getest. Opvallend is dat deze methode zelfs in staat is om kwetsbaarheden te ontdekken in chatbots die uitgebreide menselijke beveiligingsmaatregelen hebben ondergaan, waarmee het zijn effectiviteit aantoont in het ontdekken van potentieel risico’s.

Implicaties voor de toekomst van AI-veiligheid

De ontwikkeling van nieuwsgierigheidsgestuurde red-teaming markeert een belangrijke stap voorwaarts in het garanderen van de veiligheid en betrouwbaarheid van grote taalmodellen en AI-chatbots. Naarmate deze modellen in ons dagelijks leven geïntegreerd raken, is het cruciaal om robuuste testmethoden te hebben die hun snelle ontwikkeling kunnen bijhouden.

De nieuwsgierigheidsgestuurde benadering biedt een snellere en effectievere manier om kwaliteitscontrole uit te voeren op AI-modellen. Door de automatisering van de generatie van diverse en nieuwe prompts, kan deze methode de tijd en middelen die nodig zijn voor testen aanzienlijk verminderen, terwijl het tegelijkertijd de dekking van potentieel kwetsbaarheden verbetert. Deze schaalbaarheid is vooral waardevol in snel veranderende omgevingen, waar modellen mogelijk frequent moeten worden bijgewerkt en getest.

Bovendien opent de nieuwsgierigheidsgestuurde benadering nieuwe mogelijkheden voor het aanpassen van de veiligheidstesten. Bijvoorbeeld, door een groot taalmodel te gebruiken als de toxiciteitsclassificator, kunnen ontwikkelaars de classificator trainen met bedrijfsspecifieke beleidsdocumenten. Dit zou het red-team-model in staat stellen om chatbots te testen op naleving van specifieke organisatorische richtlijnen, waardoor een hoger niveau van aanpassing en relevantie wordt bereikt.

Naarmate AI blijft evolueren, kan de belangrijkheid van nieuwsgierigheidsgestuurde red-teaming in het garanderen van veiligere AI-systemen niet worden overschat. Door proactief potentieel risico’s te identificeren en aan te pakken, draagt deze benadering bij aan de ontwikkeling van meer betrouwbare en veilige AI-chatbots die met vertrouwen in verschillende domeinen kunnen worden ingezet.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.