Tankeledere

De fire mest kostbare feilene med dårlig testet AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Når bedrifter setter i drift AI uten omfattende menneskelig tilsyn, ber de i realiteten en ikke-deterministisk automatisert system om å validere seg selv.

Problemet er ikke nødvendigvis at AI er dårlig til å teste. AI er utmerket til å gjøre ting som har blitt gjort før, spesielt å følge reglene du har eksplisitt satt. Men feilene som faktisk skader din merkevare? De lever i rommene hvor menneskelig dømmekraft betyr mest. En hallusinasjon om en returpolitikk. En avvikende respons på en følsom klage. En sikkerhetsgarder som ikke holder under press.

Med 70% av kundene villige til å bytte etter bare ett dårlig AI-møte, er innsatsen høy. Likevel er de fleste bedriftene i ferd med å levere AI valideret av foreldede eller automatiske verktøy bygget for deterministisk programvare. Denne staken var aldri designet for å fange feilene som faktisk driver folk bort.

Over engasjementene Teslio har kjørt for bedriftslag, står fire feilmoduser for det meste av kundesynte skadene. Ingen av dem blir fanget av automatisert testing alene.

1. Sikkerhets- og sikkerhetsgarder som ikke faktisk beskytter

En kunde spør din chatbot den riktige spørsmålet på riktig måte. Boten tilbyr dem en $1 000-vare for $10. Eller den avslører informasjon det absolutt ikke skal. Eller den bryter en grunnleggende forretningsregel fordi ingen testet grensebetingelser.

Risikoen er rett frem. Skaden er umiddelbar og skaden er offentlig.

Det virkelige problemet er ikke bare automatisering, selv om det er en del av det. Sikkerhetsgarder er ikke standardisert, de må tilpasses din spesifikke forretningskontekst. Og selv når beste praksis følges, forblir sikkerhetsgarder sårbare. Teknikker som “poetiske fengselsbrudd” viser oss at velmente sikkerhetsgarder kan manipuleres på måter deres skapere aldri hadde forutsett. Spørsmålet bedriftene må stille, er ikke “følger vår sikkerhetsgarder bransjens standarder?” men heller “hvordan kan denne modellen manipuleres på nye måter?”

Dette krever motstridende tenkning. Kreative, undersøkende mennesker som forstår både sikkerhetsgarddesign og angrepsflaten. Testing av kantene, stresstesting, stille komplekse spørsmål. Det er forskjellen på en sikkerhetsgard som passerer samsvar og en sikkerhetsgard som faktisk holder.

2. Nøyaktighet og forretningslogikkfeil skjult i hallusinasjoner

Realiteten er at AI hallusinerer. Det jeg har lært, er at når du har domeneekspertise i et område, merker du hallusinasjonen umiddelbart. Du ser rett gjennom den.

Men her er den kritiske feilen i å stole bare på ditt interne team: de har blinde flekker. Når du kjenner en produkt inn og ut, vet du eksakt hva spørsmål du må stille for å få riktig svar. Du kan ikke finne uakkurater hvis du ikke leter etter dem. Interne team vet hvordan produktet er ment å fungere, ikke hvordan det faktisk fungerer for ekte brukere med forskjellige mentale modeller, forskjellige kontekster og forskjellige måter å bryte dine antakelser på.

Det er der tilsyn fra mennesker som nærmer seg systemet på nytt kommer inn. De validerer ikke bare at AI gjør hva du fortalte det å gjøre, men de bringer også frem problemer som kan være av interesse for forskjellige avdelinger og høydepunkter områder av virkelig feil.

Når bedrifter begynner å bygge på toppen av de store språkmodellene, når de legger til sine egne prosesser og arbeidsflyter på toppen, blir testingkravene enda mer kritiske.

3. Brukervennlighet og brukeropplevelsesoversikt

Føles det riktig? Ser det riktig ut? Tar betalingsprosessen litt for lang tid? Bærer svaret riktig tone for en frustrert kunde eller riktig tempo for en ny bruker.

Dette er typen spørsmål som automatiserte verktøy ikke kan svare på. Og de er typen spørsmål som betyr enormt mye for kundene.

Det er en grunnleggende forskjell på å bestå en testserie og faktisk å være god. En AI-interaksjon kan sjekke hver enkelt boks i dine akseptkriterier og likevel bli oppfattet som feil av en bruker. Den kan være teknisk korrekt, men organisatorisk klønete. Den kan levere nøyaktig informasjon i feil rytme eller tone.

Dette er der en menneskelig løkke er essensiell. Du trenger mennesker trent til å gjenkjenne hvordan AI feiler, testing i regionene hvor dine kunder bor, med enhetene og betalingsmetodene de faktisk bruker. Noen som tester på en toppmodell iPhone i San Francisco har ikke samme erfaring som noen som tester på en mid-range Android med en svak dataforbindelse i Jakarta. Uten diversitet i hvem som tester og hvor, får du simuleringsresultater som vil feile øyeblikket ditt produkt møter virkeligheten.

Du må ha noen som faktisk bruker produktet, faktisk tenker på hva opplevelsen betyr, faktisk motsetter seg når noe ikke føles riktig.

4. Illusjonen av validerende ekspertise

Dette er den subtileste feilen, og kanskje den farligste. Når bedrifter setter i drift AI uten ordentlig testing, satser de ofte på at AI har absorbert nok kunnskap til å håndtere domenet ordentlig. De antar at fordi AI kan lyde selvbevisst om noe, så vet den sannsynligvis hva den snakker om.

Men det er en annen dimensjon til denne risikoen. De fleste menneskene som bruker AI-funksjoner gjør samme antakelse. De stiller ikke spørsmål ved utgangen. Hvis det lyder autoritativt og ikke åpenbart feil, stoler de på det. Dårlig medisinsk råd. Ukorrekt juridisk veiledning. Feilaktige finansielle anbefalinger. Konsekvensene akselerer når brukerne antar at AI er korrekt og har ingen grunn til å tvile det.

AI er svært god til å vite hva som har blitt gjort. Den er ikke god til å vite hva som bør gjøres i nye situasjoner. Hver bedrift har nye situasjoner. Hvert produkt har kanter. Hver kundeferd har et øyeblikk hvor riktig svar er det AI ikke er trent til å gi.

Omskaping av utgivelsesklarhet

En moden AI-utgivelsesstrategi krever å gå utenfor automatiserings-mentaltet. Den involverer bygging av en strukturert ramme av menneskelig ekspertise i løkken.

  • Engineering: Dette teamet bør eie systemintegritet, definere hva feil ser ut som på modell- og infrastrukturnivå, og hvor sikkerhetsgarder må sitte.
  • Produkt: Ledere bør eie avgjørelsens grenser, dømme hvilke avgjørelser AI er tillatt å gjøre selvstendig, hvilke krever menneskelig godkjenning, og hvilke det ikke skal berøre i det hele tatt.
  • Design og QA: Disse profesjonelle bør eie brukeropplevelsen, om brukerne forstår hva AI gjør, kan gjenkjenne når det er feil, og har meningsfullt opphevelse når det er.

Vi må akseptere at mens AI kan skape fantastiske opplevelser for våre kunder, kan det ikke være sin egen dommer og jury. Ansvarlig for AI-kvalitet er en organisatorisk en, fordelt over lag, forankret i menneskelig ekspertise og grunnlagt i virkelig testing. Vi må akseptere at mens AI kan skape fantastiske opplevelser for våre kunder, kan det ikke være sin egen dommer og jury. Ansvarlig for AI-kvalitet er en organisatorisk en, fordelt over lag, forankret i menneskelig ekspertise, og grunnlagt i virkelig testing. Vi må akseptere at det er galt, og ha meningsfullt opphevelse når det er. Vi må akseptere at mens AI kan skape fantastiske opplevelser for våre kunder, kan det ikke være sin egen dommer og jury. Ansvarlig for AI-kvalitet er en organisatorisk en, fordelt over lag, forankret i menneskelig ekspertise, og grunnlagt i virkelig testing.

Darin Brown er Chief Product and Technology Officer (CPTO) i Testlio, der leder global teknologistrategi og produktutvikling for å fremme digital kvalitet gjennom human-in-the-loop AI-testing. Med over 20 års erfaring med å skalerer bedriftens SaaS-plattformer, ledet han tidligere produktstrategi for Zooms Produktivitetsapper-gruppe etter dets oppkjøp av Docket, som han co-grunnla, og hadde ledelsesroller som CTO i Angie's List og VP i Salesforce.