Thought leaders
AI-Eerst Betekent Veiligheid-Eerst

Koop een kind een gloednieuwe fiets, en de fiets krijgt alle aandacht – niet de glimmende helm die erbij zit. Maar ouders waarderen de helm.
Ik ben bang dat veel van ons vandaag meer zoals kinderen zijn als het gaat om AI. We zijn gefocust op hoe cool het is en hoe snel we er mee kunnen gaan. Niet zozeer op wat we kunnen doen om veilig te blijven terwijl we het gebruiken. Het is jammer, want je kunt niet het voordeel van de een hebben zonder het andere.
Eenvoudig gezegd, AI toepassen zonder eerst zorgvuldig te plannen voor veiligheid is niet alleen riskant. Het is een rechtstreekse weg naar een afgrond.
Wat Betekent AI-Veiligheid Eigenlijk?
AI-veiligheid omvat een reeks stappen. Maar misschien het belangrijkste element is wanneer ze genomen moeten worden. Om effectief te zijn, moet AI-veiligheid by design zijn.
Dat betekent dat we nadenken over hoe we schade kunnen voorkomen voordat we het voor een testrit nemen. We bedenken hoe we ervoor kunnen zorgen dat de AI werkt en resultaten genereert in overeenstemming met onze waarden en sociale verwachtingen, en niet pas nadat we verschrikkelijke resultaten hebben gekregen.
Het ontwerpen van AI-veiligheid omvat ook het nadenken over hoe we ervoor kunnen zorgen dat het robuust is, ofwel in staat om voorspelbaar te presteren, zelfs in nadelige situaties. Het betekent dat we AI transparant maken, zodat de beslissingen die AI neemt, begrijpelijk, controleerbaar en onbevooroordeeld zijn.
Maar het omvat ook het onderzoeken van de wereld waarin de AI zal functioneren. Wat zijn de institutionele en juridische waarborgen die we nodig hebben, vooral om te voldoen aan de toepasselijke overheidsreguleringen? En ik kan niet genoeg benadrukken hoe belangrijk de mensencomponent is: wat zal het effect zijn van het gebruik van AI op de mensen die ermee interacteren?
Veiligheid door ontwerp betekent dat we AI-veiligheid integreren in al onze processen, workflows en operaties voordat we onze eerste prompt typen.
De Risico’s Wegen Zwaarder Dan Zorgen
Niet iedereen is het daarmee eens. Wanneer ze “veiligheid eerst” horen, denken sommigen “stap zo voorzichtig en langzaam dat je achterblijft”. Natuurlijk is dat niet wat veiligheid eerst betekent. Het hoeft innovatie niet te smoren of de tijd tot marktintroductie te verlengen. En het betekent geen eindeloze reeks pilots die nooit schaalbaar zijn. Integendeel.
Het betekent wel dat we de risico’s begrijpen van niet het ontwerpen van veiligheid in AI. Overweeg slechts een paar.
- Deloitte’s Center for Financial Services voorspelt dat GenAI mogelijk verantwoordelijk kan zijn voor fraudeverliezen van 40 miljard dollar in de VS alleen tegen 2027, van 12,3 miljard dollar in 2023, een stijging van 32% per jaar.
- Bevooroordeelde beslissingen. Gevaldocumenten bevooroordeelde medische zorg als gevolg van AI die was getraind op bevooroordeelde gegevens.
- Slechte beslissingen die meer slechte beslissingen inspireren. Erger dan een eerste slechte beslissing die is aangewakkerd door defecte AI, onderzoeken laten zien dat die defecte beslissingen deel kunnen worden van hoe we denken en toekomstige beslissingen nemen.
- Echte gevolgen. AI die slechte medische adviezen geeft, is verantwoordelijk geweest voor dodelijke patiëntresultaten. Juridische problemen zijn het gevolg van het citeren van een AI-hallucinatie als juridisch precedent. En softwarefouten als gevolg van een AI-assistent die onjuiste informatie geeft, hebben producten en de reputatie van bedrijven aangetast en hebben geleid tot algemene gebruikersongenoegen.
En dingen gaan nog interessanter worden.
De komst en snelle adoptie van agente AI, AI die autonoom kan functioneren om actie te ondernemen op basis van beslissingen die het heeft genomen, zal de belangrijkheid van het ontwerpen van AI-veiligheid vergroten.
Een AI-agent die namens u kan handelen, kan enorm nuttig zijn. In plaats van u te vertellen over de beste vluchten voor een reis, kan het ze voor u boeken. Als u een product wilt retourneren, kan de AI-agent van een bedrijf niet alleen het retourbeleid en de procedure voor retournering uitleggen, maar ook de hele transactie voor u afhandelen.
Geweldig – zolang de agent maar niet hallucineert over een vlucht of uw financiële gegevens verkeerd afhandelt. Of het retourbeleid van het bedrijf verkeerd begrijpt en geldige retours weigert.
Het is niet moeilijk om te zien hoe de huidige AI-veiligheidsrisico’s gemakkelijk kunnen escaleren met een heleboel AI-agents die rondlopen en beslissingen nemen en handelen, vooral omdat ze waarschijnlijk niet alleen zullen handelen. Veel van de echte waarde van agente AI zal komen van teams van agents, waar individuele agents delen van taken afhandelen en samenwerken – agent tot agent – om werk gedaan te krijgen.
Hoe kunt u AI-veiligheid door ontwerp omarmen zonder innovatie te smoren en de potentieel waarde te vernietigen?
Veiligheid Door Ontwerp in Actie
Ad-hoc veiligheidscontroles zijn niet het antwoord. Maar het integreren van veiligheidspraktijken in elke fase van een AI-implementatie is.
Begin met gegevens. Zorg ervoor dat gegevens gelabeld, geannoteerd waar nodig, vrij van vooroordeel en van hoge kwaliteit zijn. Dit is vooral waar voor trainingsgegevens.
Train uw modellen met menselijke feedback, aangezien menselijke oordeel essentieel is om modelgedrag te vormen. Versterking van leren met menselijke feedback (RLHF) en soortgelijke technieken stellen annotators in staat om antwoorden te beoordelen en te leiden, waardoor LLM’s outputs kunnen genereren die veilig en in overeenstemming met menselijke waarden zijn.
Vervolgens, voordat u een model vrijgeeft, test u het onder druk. Rode teams die proberen onveilige gedragingen te provoceren door gebruik te maken van vijandige prompts, randgevallen en pogingen tot jailbreaks, kunnen kwetsbaarheden blootleggen. Het oplossen ervan voordat ze bij het publiek komen, houdt dingen veilig voordat er een probleem is.
Terwijl deze tests ervoor zorgen dat uw AI-modellen robuust zijn, blijf ze controleren met een oog op opkomende bedreigingen en aanpassingen die mogelijk nodig zijn voor de modellen.
Op soortgelijke wijze moet u regelmatig contentbronnen en digitale interacties controleren op tekenen van fraude. Kritisch, gebruik een hybride AI-menselijke aanpak, waarbij AI-automatisering zorgt voor de enorme hoeveelheid gegevens die moeten worden gecontroleerd, en ervaren mensen zorgen voor controles voor handhaving en om nauwkeurigheid te garanderen.
Het toepassen van agente AI vereist nog meer zorg. Een basisvereiste: train de agent om zijn beperkingen te kennen. Wanneer het onzekerheid, ethische dilemma’s, nieuwe situaties of bijzonder risicovolle beslissingen tegenkomt, zorg er dan voor dat het weet hoe het om hulp kan vragen.
Ontwerp ook traceerbaarheid in uw agents. Dit is vooral belangrijk zodat interacties alleen plaatsvinden met geverifieerde gebruikers, om fraudeurs te voorkomen die de acties van een agent beïnvloeden.
Als ze lijken te werken, kan het verleidelijk zijn om de agents los te laten en ze hun ding te laten doen. Onze ervaring zegt dat we ze moeten blijven controleren en de taken die ze uitvoeren, om te kijken naar fouten of onverwacht gedrag. Gebruik zowel geautomatiseerde controles als menselijke controle.
Feitelijk is een essentieel element van AI-veiligheid regelmatige menselijke betrokkenheid. Mensen moeten opzettelijk worden betrokken waar kritische oordeel, empathie of nuances en ambiguïteit zijn betrokken bij een beslissing of actie.
Nogmaals, om duidelijk te zijn, zijn dit allemaal praktijken die u van tevoren in de AI-implementatie moet opnemen, by design. Ze zijn niet het resultaat van iets dat verkeerd gaat en dan haasten om te zien hoe u de schade kunt minimaliseren.
Werkt Het?
We hebben een filosofie van AI-veiligheid eerst en een “by design”-kader toegepast bij onze klanten gedurende de opkomst van GenAI en nu op de snelle weg naar agente AI. We vinden dat, in tegenstelling tot zorgen dat het dingen vertraagt, het eigenlijk helpt om dingen te versnellen.
Agente AI heeft het potentieel om de kosten van klantenservice met 25-50% te verlagen, terwijl het tevredenheid van klanten verhoogt. Maar dat hangt allemaal af van vertrouwen.
Mensen die AI gebruiken, moeten het vertrouwen, en klanten die interacteren met AI-geactiveerde menselijke agents of met echte AI-agents, kunnen geen enkele interactie ervaren die hun vertrouwen zou ondermijnen. Eén slechte ervaring kan het vertrouwen in een merk vernietigen.
We vertrouwen niet wat niet veilig is. Dus, wanneer we veiligheid in elke laag van de AI die we op het punt staan uit te rollen, integreren, kunnen we dat met vertrouwen doen. En wanneer we klaar zijn om het te schalen, kunnen we dat snel doen – met vertrouwen.
Terwijl het in praktijk brengen van AI-veiligheid eerst overweldigend kan lijken, bent u niet alleen. Er zijn veel experts die kunnen helpen en partners die kunnen delen wat ze hebben geleerd en leren, zodat u de waarde van AI veilig kunt benutten zonder uw tempo te vertragen.
AI is tot nu toe een spannende rit geweest, en terwijl de rit versnelt, vind ik het opwindend. Maar ik ben ook blij dat ik mijn helm draag.












