Tankeledere
AI-først betyr sikkerhet-først

Kjøp et barn et nytt sykkel, og sykkelen vil få all oppmerksomheten – ikke den blanke hjelmen som følger med. Men foreldre setter pris på hjelmen.
Jeg er redd at mange av oss i dag er mer som barn når det gjelder AI. Vi er fokusert på hvor kjekt det er og hvor raskt vi kan gå med det. Ikke så mye på hva vi kan gjøre for å holde oss trygge mens vi bruker det. Det er en skam, fordi du ikke kan ha fordelene av en uten den andre.
Det enkleste er at å bruke AI uten å planlegge sikkerheten først, ikke bare er risikabelt. Det er en rett vei ned i en klippe.
Hva betyr AI-sikkerhet egentlig?
AI-sikkerhet innebærer en rekke skritt. Men kanskje det viktigste elementet er når man tar dem. For å være effektiv, må AI-sikkerhet være by design.
Det betyr at vi tenker på hvordan vi kan forhindre skade før vi tar det for en testkjøring. Vi finner ut hvordan vi kan sikre at AI opererer og genererer resultater i samsvar med våre verdier og sosiale forventninger først – ikke etter at vi får noen forferdelige resultater.
Å designe for AI-sikkerhet inkluderer også å tenke på hvordan vi kan gjøre det robust, eller i stand til å fungere forutsigbart selv i ugunstige situasjoner. Det betyr å gjøre AI gjennomsiktig, så beslutningene AI tar er forståelige, kontrollerbare og upartiske.
Men det inkluderer også å se på verden hvor AI vil fungere. Hvilke institusjonelle og juridiske sikkerhetstiltak trenger vi, spesielt for å være i samsvar med gjeldende regler og forskrifter? Og jeg kan ikke overbetone menneskekomponenten: Hva vil virkningen av å bruke AI være på menneskene som samhandler med det?
Sikkerhet ved design betyr å innbygge AI-sikkerhet i alle våre prosesser, arbeidsflyter og operasjoner før vi skriver vår første prompt.
Risikoen overstiger bekymringene
Ikke alle er enige. Når de hører “sikkerhet først”, hører noen “gå så forsiktig og sakte at du blir latt tilbake”. Selvfølgelig er det ikke hva sikkerhet først betyr. Det trenger ikke å kvalme innovasjon eller sakke ned tid til markedet. Og det betyr ikke en evig rekke av piloter som aldri skalerer. Tværtimot.
Det betyr å forstå risikoen med å ikke designe sikkerhet inn i AI. Vurdér bare noen få.
- Deloittes senter for finansielle tjenester forutser at GenAI kan være ansvarlig for svindelstap på 40 milliarder dollar i USA alene innen 2027, fra 12,3 milliarder dollar i 2023, en økning på 32%.
- Forvrengde beslutninger. Saker dokumenterer forvrengd medisinsk behandling på grunn av AI som var trent på forvrengde data.
- Dårlige beslutninger som inspirerer flere dårlige beslutninger. Verre enn en første dårlig beslutning utløst av feil AI, studier indikerer at disse feil beslutningene kan bli en del av hvordan vi tenker og tar fremtidige beslutninger.
- Reelle konsekvenser. AI som gir dårlige medisinske råd har vært ansvarlig for dødelige pasientutfall. Juridiske problemer har resultert fra å citere en AIs hallusinasjon som rettslig presedens. Og programfeil som følge av en AI-assistent som gir feilinformasjon, har forurenset selskapets produkter og omdømme, og ført til utbredt brukerutilfredshet.
Og tingene er på vei til å bli enda mer interessante.
Introduksjonen og rask adopsjon av agens AI, AI som kan fungere selvstendig for å ta beslutninger basert på beslutninger det har tatt, vil forsterke viktigheten av å designe for AI-sikkerhet.
En AI-agent som kan handle på dine vegne, kan være svært nyttig. I stedet for å fortelle deg om de beste flyreisene for en reise, kan den finne dem og bestille dem for deg. Hvis du ønsker å returnere et produkt, kan et selskaps AI-agent ikke bare fortelle deg om returpolitikken og hvordan du kan returnere det, men også håndtere hele transaksjonen for deg.
Flott – så lenge agenten ikke hallucinerer en flyreise eller mishandler din finansielle informasjon. Eller feilaktig fortolker selskapets returpolitikk og nektar gyldige returer.
Det er ikke vanskelig å se hvordan nåværende AI-sikkerhetsrisiko lett kan kaskade med en rekke AI-agenter som tar beslutninger og handler, spesielt siden de sannsynligvis ikke vil handle alene. Mye av den virkelige verdien i agens AI kommer fra team av agenter, hvor enkeltagenter håndterer deler av oppgaver og samarbeider – agent til agent – for å få jobben gjort.
Hvordan kan du omfavne AI-sikkerhet ved design uten å hemme innovasjon og drepe dens potensielle verdi?
Sikkerhet ved design i praksis
Ad hoc-sikkerhetstiltak er ikke svaret. Men å integrere sikkerhetspraksis i hver fase av en AI-implementering, er.
Start med data. Sørg for at data er merket, annotert der det er nødvendig, fri for bias og av høy kvalitet. Dette er spesielt viktig for treningdata.
Tren dine modeller med menneskelig tilbakemelding, da menneskelig dømmekraft er essensiell for å forme modellatferd. Forsterkning med menneskelig tilbakemelding (RLHF) og andre lignende tekniker tillater annotatorer å vurdere og veilede svar, og hjelper LLM-er å generere utdata som er trygge og i samsvar med menneskelige verdier.
Så, før du slipper ut en modell, utsätt den for stress. Rød team som prøver å utløse usikker atferd ved å bruke motstridende promter, randtilfeller og forsøk på å bryte ut, kan avsløre sårbarheter. Å fikse dem før de når offentligheten, holder ting trygge før det blir et problem.
Mens denne testen sikrer at dine AI-modeller er robuste, holder du øye på fremvoksende trusler og justeringer som må være nødvendige for modellene.
På en lignende måte, overvåk jevnt contentkilder og digitale interaksjoner for tegn på svindel. Kritisk, bruk en hybrid AI-menneskelig tilnærming, og la AI-automatisering håndtere den enorme mengden data som må overvåkes, og dyktige mennesker håndtere gjennomgang for håndheving og for å sikre nøyaktighet.
Å bruke agens AI krever enda mer omsorg. En grunnleggende krav: tren agenten til å kjenne sine begrensninger. Når den møter usikkerhet, etiske dilemmaer, nye situasjoner eller spesielt høyriskede beslutninger, sikre at den vet hvordan den skal be om hjelp.
Og design sporbarhet inn i dine agenter. Dette er spesielt viktig så at deres interaksjoner bare skjer med verifiserte brukere, for å unngå at svindlere påvirker en agents handlinger.
Hvis de ser ut til å fungere effektivt, kan det være fristende å slippe dem løs og la dem gjøre sin sak. Vår erfaring sier å holde øye på dem og oppgavene de utfører, for å se etter feil eller uventet atferd. Bruk både automatiserte sjekker og menneskelig gjennomgang.
I virkeligheten er et essensielt element av AI-sikkerhet jevn menneskelig involvering. Mennesker bør være bevisst engasjert der kritisk dømmekraft, empati eller nyanser og tvetydighet er involvert i en beslutning eller handling.
Igjen, for å være tydelig, disse er alle praksiser som du bygger inn i AI-implementeringen på forhånd, ved design. De er ikke resultatet av at noe går galt og så må rush til å finne ut hvordan man kan minimere skaden.
Fungerer det?
Vi har vært med på å bruke en AI-sikkerhetsfilosofi og “ved design”-rammeverk med våre kunder gjennom oppblomstringen av GenAI og nå på rask vei mot agens AI. Vi finner at, i motsetning til bekymringer om at det skulle sakke ned ting, det faktisk hjelper å akselerere dem.
Agens AI har potensialet til å redusere kostnadene til kundeservice med 25-50%, for eksempel, samtidig som det øker kundetilfredshet. Men det avhenger av tillit.
Mennesker som bruker AI må stole på det, og kundene som samhandler med AI-aktiverede menneskelige agenter eller med faktiske AI-agenter, kan ikke oppleve en enkelt interaksjon som ville undergrave deres tillit. En dårlig opplevelse kan utradere tillit til et merke.
Vi stoler ikke på det som ikke er trygt. Så når vi bygger sikkerhet inn i hver lag av AI, kan vi gjøre det med tillit. Og når vi er klare til å skalerer det, kan vi gjøre det raskt – med tillit.
Mens å sette AI-sikkerhet først i praksis kan synes overveldende, er du ikke alene. Det er mange eksperter som kan hjelpe og partnere som kan dele hva de har lært og lærer, så du kan dra nytte av verdiene i AI på en trygg måte uten å sakke ned.
AI har vært en spennende tur så langt, og mens turen akselerer, finner jeg det eksilerende. Men jeg er også glad for at jeg har på meg hjelmen.












