Etikk

MIT-forskere utvikler nysgjerrighetsdrevet AI-modell for ÃĨ forbedre sikkerhetstesting av chatbott

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

I de senere ÃĨr har store sprÃĨkmodeller (LLM) og AI-chatbott blitt usedvanlig vanlige, og endret mÃĨten vi interagerer med teknologi pÃĨ. Disse sofistikerte systemene kan generere menneskelignende svar, assistere med ulike oppgaver og gi verdifull innsikt.

Men nÃĨr disse modellene blir mer avanserte, har bekymringene omkring deres sikkerhet og potensial for ÃĨ generere skadelig innhold kommet i forgrunnen. For ÃĨ sikre ansvarlig utrulling av AI-chatbott, er grundig testing og sikkerhetstiltak essensielle.

Begrensninger i nÃĨvÃĶrende chatbot-sikkerhetstestmetoder

For tiden er den primÃĶre metoden for ÃĨ teste sikkerheten til AI-chatbott en prosess kalt red-teaming. Dette innebÃĶrer at menneskelige testere lager innledninger som er designet for ÃĨ fremkalle usikre eller toksiske svar fra chatbotten. Ved ÃĨ eksponere modellen for en bred rekke potensielt problematiske innledninger, forsÃļker utviklerne ÃĨ identifisere og hÃĨndtere eventuelle svakheter eller uÃļnskede atferd. Men denne menneskedrevne tilnÃĶrmingen har sine begrensninger.

Gitt de enorme mulighetene for brukerinnledninger, er det nesten umulig for menneskelige testere ÃĨ dekke alle potensielle scenarier. Selv med omfattende testing, kan det vÃĶre hull i innledningene som brukes, og etterlate chatbotten sÃĨrbÃĶr for ÃĨ generere usikre svar nÃĨr den mÃļter nye eller uventede innledninger. I tillegg gjÃļr den manuelle naturen til red-teaming det til en tidskrevende og ressurskrevende prosess, spesielt nÃĨr sprÃĨkmodellene fortsetter ÃĨ vokse i stÃļrrelse og kompleksitet.

For ÃĨ hÃĨndtere disse begrensningene, har forskerne vendt seg til automatisering og maskinlÃĶringsteknikker for ÃĨ forbedre effektiviteten og effekten av chatbot-sikkerhetstesting. Ved ÃĨ utnytte kraften til AI selv, forsÃļker de ÃĨ utvikle mer omfattende og skalerbare metoder for ÃĨ identifisere og mildne potensielle risikoer forbundet med store sprÃĨkmodeller.

Nysgjerrighetsdrevet maskinlÃĶringstilnÃĶrming til red-teaming

Forskere fra Improbable AI Lab ved MIT og MIT-IBM Watson AI Lab har utviklet en innovativ tilnÃĶrming for ÃĨ forbedre red-teaming-prosessen ved hjelp av maskinlÃĶring. Deres metode innebÃĶrer ÃĨ trene en separat red-team stor sprÃĨkmodell for ÃĨ automatisk generere diverse innledninger som kan utlÃļse en bredere rekke uÃļnskede svar fra chatbotten som testes.

NÃļkkelen til denne tilnÃĶrmingen ligger i ÃĨ innfÃļre en fÃļlelse av nysgjerrighet i red-team-modellen. Ved ÃĨ oppmuntre modellen til ÃĨ utforske nye innledninger og fokusere pÃĨ ÃĨ generere innledninger som utlÃļser toksiske svar, forsÃļker forskerne ÃĨ avdekke en bredere rekke potensielle svakheter. Denne nysgjerrighetsdrevne utforskningen oppnÃĨs gjennom en kombinasjon av forsterkingslÃĶringsteknikker og modifiserte belÃļnningssignaler.

Den nysgjerrighetsdrevne modellen inkorporerer en entropibonus, som oppmuntret red-team-modellen til ÃĨ generere mer tilfeldige og diverse innledninger. I tillegg introduseres nyhetsbelÃļnninger for ÃĨ oppmuntre modellen til ÃĨ skape innledninger som er semantisk og leksikalsk distinkte fra tidligere genererte innledninger. Ved ÃĨ prioritere nyhet og diversitet, presses modellen til ÃĨ utforske uutforskede omrÃĨder og avdekke skjulte risikoer.

For ÃĨ sikre at de genererte innledningene forblir koherente og naturalistiske, inkluderer forskerne ogsÃĨ en sprÃĨkbonus i treningsobjektivet. Denne bonusen hjelper til ÃĨ forhindre at red-team-modellen genererer meningslÃļs eller irrelevant tekst som kunne lure toksisitetsklassifikatoren til ÃĨ tildele hÃļye poeng.

Den nysgjerrighetsdrevne tilnÃĶrmingen har demonstrert bemerkelsesverdig suksess i ÃĨ overgÃĨ bÃĨde menneskelige testere og andre automatiserte metoder. Den genererer en stÃļrre variasjon av distinkte innledninger og utlÃļser Ãļkende toksiske svar fra chatbottene som testes. Merkverdig er at denne metoden har ogsÃĨ kunnet avdekke svakheter i chatbott som hadde gjennomgÃĨtt omfattende menneskedesignet sikkerhetstiltak, og understreker dens effektivitet i ÃĨ avdekke potensielle risikoer.

Konsekvenser for fremtidens AI-sikkerhet

Utviklingen av nysgjerrighetsdrevet red-teaming markerer et betydelig skritt fremover i ÃĨ sikre sikkerheten og pÃĨliteligheten til store sprÃĨkmodeller og AI-chatbott. Mens disse modellene fortsetter ÃĨ utvikle seg og bli mer integrert i vÃĨre daglige liv, er det avgjÃļrende ÃĨ ha robuste testmetoder som kan holde tritt med deres raske utvikling.

Den nysgjerrighetsdrevne tilnÃĶrmingen tilbyr en raskere og mer effektiv mÃĨte ÃĨ utfÃļre kvalitetssikring pÃĨ AI-modeller. Ved ÃĨ automatisere genereringen av diverse og nye innledninger, kan denne metoden betydelig redusere tiden og ressursene som kreves for testing, samtidig som den forbedrer dekningen av potensielle svakheter. Denne skalerbarheten er spesielt verdifull i raskt endrende miljÃļer, hvor modellene kan kreve hyppige oppdateringer og nytesting.

I tillegg ÃĨpner den nysgjerrighetsdrevne tilnÃĶrmingen opp for nye muligheter for ÃĨ tilpasse sikkerhetstestprosessen. For eksempel kan utviklere bruke en stor sprÃĨkmodell som toksisitetsklassifikator, og trene klassifikatoren ved hjelp av selskapsspesifikke policydokumenter. Dette ville enable red-team-modellen til ÃĨ teste chatbott for overholdelse av bestemte organisatoriske retningslinjer, og sikre en hÃļyere grad av tilpasning og relevans.

Mens AI fortsetter ÃĨ utvikle seg, kan betydningen av nysgjerrighetsdrevet red-teaming for ÃĨ sikre sikrere AI-systemer ikke overdrives. Ved ÃĨ proaktivt identifisere og hÃĨndtere potensielle risikoer, bidrar denne tilnÃĶrmingen til utviklingen av mer pÃĨlitelige og sikre AI-chatbott som kan utrulleres med tillit i ulike domener.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.