Thought leaders

De Vier Duurste Falen van Slecht Geteste AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Wanneer bedrijven AI zonder strikte menselijke toezicht inzetten, vragen ze eigenlijk aan een niet-deterministisch geautomatiseerd systeem om zichzelf te valideren.

Het probleem is niet noodzakelijkerwijs dat AI slecht is in testen. AI is uitstekend in het doen van dingen die eerder zijn gedaan, specifiek door de regels te volgen die u expliciet heeft ingesteld. Maar de fouten die daadwerkelijk uw merk schaden? Die leven in de ruimtes waar menselijke oordeelsvorming het meest telt. Een hallucinatie over een retourbeleid. Een off-brand reactie op een gevoelige klacht. Een beveiligingsbarrière die niet standhoudt onder druk.

Met 70% van de klanten die bereid zijn om over te stappen na een enkele slechte AI-interactie, zijn de inzet hoog. Toch schepen de meeste bedrijven AI in die is gevalideerd door verouderde of geautomatiseerde tools die zijn ontwikkeld voor deterministische software. Die stack was nooit ontworpen om de fouten te detecteren die mensen daadwerkelijk wegjagen.

Over de engagements die Teslio heeft uitgevoerd voor enterprise-teams, vertegenwoordigen vier foutmodi de meeste klant-zichtbare schade. Geen van hen wordt alleen door geautomatiseerd testen gedetecteerd.

1. Beveiligings- en Veiligheidsbarrières die Echt geen Bescherming Bieden

Een klant stelt uw chatbot de juiste vraag op de juiste manier. De bot biedt hen een artikel van $1.000 aan voor $10. Of het onthult informatie die het absoluut niet zou mogen onthullen. Of het breekt een fundamentele bedrijfsregel omdat niemand de grensvoorwaarden heeft getest.

Het risico is rechttoe rechtaan. De schade is onmiddellijk en de schade is openbaar.

Het echte probleem is niet alleen automatisering, hoewel dat een deel ervan is. Beveiligingsbarrières zijn niet gestandaardiseerd, ze moeten worden aangepast aan uw specifieke bedrijfscontext. En zelfs wanneer de beste praktijken worden gevolgd, blijven beveiligingsbarrières kwetsbaar. Technieken zoals “poëtische inbraak” laten ons zien dat goedbedoelde beveiligingsbarrières op manieren kunnen worden gemanipuleerd die hun makers nooit hadden voorzien. De vraag die bedrijven moeten stellen, is niet “volgen onze beveiligingsbarrières de industrienormen?” maar eerder “op welke nieuwe manieren kan dit model worden gemanipuleerd?”

Dit vereist tegenstrijdige denkwijzen. Creatieve, prikkelende mensen die zowel de ontwerp van de beveiligingsbarrière als het aanvalsoppervlak begrijpen. Het testen van de randen, het belasten van tests, het stellen van complexe vragen. Het is het verschil tussen een beveiligingsbarrière die in overeenstemming is met de compliance en een beveiligingsbarrière die daadwerkelijk standhoudt.

2. Fouten in de Accuratesse en Bedrijfslogica die Verborgen Zijn in Hallucinaties

De realiteit is dat AI hallucineert. Wat ik heb geleerd, is dat wanneer je domeinexpertise hebt in een gebied, je de hallucinatie onmiddellijk opmerkt. Je ziet er recht doorheen.

Maar hier is de kritieke fout in het vertrouwen op alleen uw interne team: ze hebben blinde vlekken. Wanneer je een product vanbinnen en vanbuiten kent, weet je exact welke vragen je moet stellen om het juiste antwoord te krijgen. Je kunt geen onnauwkeurigheden vinden als je er niet naar zoekt. Interne teams weten hoe het product zou moeten werken, niet hoe het daadwerkelijk werkt voor echte gebruikers met verschillende mentale modellen, verschillende contexten en verschillende manieren om uw aannamen te breken.

Daar komt de toezicht van mensen die het systeem vers benaderen. Ze valideren niet alleen dat de AI doet wat je hem hebt verteld; ze brengen kwesties aan het licht die mogelijk interessant zijn voor verschillende afdelingen en benadrukken gebieden van echte falen.

Wanneer bedrijven beginnen te bouwen op basis van de belangrijkste grote taalmodellen, wanneer ze hun eigen processen en workflows toevoegen, worden de testvereisten nog kritieker.

3. Onderschatting van Gebruiksvriendelijkheid en Gebruikerservaring

Voelt het goed? Ziet het er goed uit? Neemt de betalingsverwerking een beetje te lang? Bevat de reactie de juiste toon voor een gefrustreerde klant of de juiste snelheid voor een eerste gebruiker.

Dit zijn de soorten vragen die geautomatiseerde tools niet kunnen beantwoorden. En ze zijn de soorten vragen die enorm veel voor klanten betekenen.

Er is een fundamenteel verschil tussen het doorstaan van een testsuite en daadwerkelijk goed zijn. Een AI-interactie kan elk vakje in uw acceptatiecriteria aanvinken en toch door een gebruiker als verkeerd worden waargenomen. Het kan technisch correct zijn, maar organisatorisch onhandig. Het kan de juiste informatie leveren in de verkeerde cadans of toon.

Dit is waar een mens-in-de-lus essentieel is. Je hebt mensen nodig die zijn opgeleid om te herkennen hoe AI faalt, die testen in de regio’s waar je klanten wonen, met de apparaten en betalingsmethoden die ze daadwerkelijk gebruiken. Iemand die test op een top-of-the-line iPhone in San Francisco heeft niet dezelfde ervaring als iemand die test op een mid-range Android met een onbetrouwbare internetverbinding in Jakarta. Zonder diversiteit in wie test en waar, krijg je gesimuleerde resultaten die zullen falen zodra uw product de realiteit ontmoet.

Je moet iemand hebben die het product daadwerkelijk gebruikt, die daadwerkelijk nadenkt over wat de ervaring betekent, die daadwerkelijk terugvecht wanneer iets niet goed voelt.

4. De Illusie van Geverifieerde Deskundigheid

Dit is de subtielste fout, en misschien wel de gevaarlijkste. Wanneer bedrijven AI zonder adequate testing inzetten, wedden ze vaak dat de AI voldoende kennis heeft opgenomen om het domein correct te behandelen. Ze gaan ervan uit dat omdat de AI zelfverzekerd klinkt over iets, het waarschijnlijk weet waar het over praat.

Maar er is nog een andere dimensie van dit risico. De meeste mensen die AI-functies gebruiken, maken dezelfde veronderstelling. Ze twijfelen niet aan de output. Als het autoritair klinkt en niet duidelijk verkeerd is, vertrouwen ze het. Slecht medisch advies. Onjuiste juridische richtlijnen. Gebrekkige financiële aanbevelingen. De gevolgen zijn versterkt wanneer gebruikers aannemen dat de AI correct is en geen reden hebben om eraan te twijfelen.

AI is heel goed in het weten wat er is gedaan. Het is niet goed in het weten wat er moet worden gedaan in nieuwe situaties. Elk bedrijf heeft nieuwe situaties. Elk product heeft randgevallen. Elke klantreis heeft een moment waarop het juiste antwoord het antwoord is dat de AI niet is getraind om te geven.

Opnieuw Definiëren van Release-klaarheid

Een volwassen AI-releasestrategie vereist dat je verder gaat dan de automatiserings-only-mentaliteit. Het omvat het opbouwen van een gestructureerd kader van menselijke expertise in de lus.

  • Engineering: Dit team moet de systeemintegriteit bezitten, definiëren wat falen betekent op het model- en infrastructuurniveau, en waar beveiligingsbarrières moeten zitten.
  • Product: Leiders moeten de beslissingsgrenzen bezitten, oordelen welke beslissingen de AI autonoom mag nemen, welke menselijke goedkeuring vereisen en welke het helemaal niet mag aanraken.
  • Ontwerp en QA: Deze professionals moeten de gebruikerservaring bezitten, of gebruikers begrijpen wat de AI doet, kunnen herkennen wanneer het verkeerd is en hebben betekenisvolle middelen wanneer het verkeerd is.

We moeten accepteren dat terwijl AI ongelofelijke ervaringen kan creëren voor onze klanten, het niet zijn eigen rechter en jury kan zijn. De verantwoordelijkheid voor AI-kwaliteit is een organisatorische, verdeeld over teams, verankerd in menselijke expertise en geworteld in real-world testing.

Darin Brown is de Chief Product en Technology Officer (CPTO) bij Testlio, waar hij de wereldwijde technologie-strategie en productontwikkeling leidt om digitale kwaliteit te verbeteren door middel van human-in-the-loop AI-testing. Met meer dan 20 jaar ervaring in het schalen van enterprise SaaS-platforms, leidde hij eerder de productstrategie voor Zoom's Productivity Apps-groep na de overname van Docket, dat hij mede-oprichtte, en bekleedde hij leidinggevende rollen als CTO van Angie's List en VP bij Salesforce.