Thought leaders

Wanneer de ‘kennis’ van AI 50 jaar oud is: het compliance-risico dat u niet kunt negeren

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het probleem van valse AI-inzichten is een urgente uitdaging voor ondernemingen die generatieve tools gebruiken. Ondanks de brede enthousiasme over de adoptie van AI, is er ook een sterke onderstroom van kritiek. Critici wijzen vaak op de schijnbaar willekeurige, onvoorspelbare onnauwkeurigheden in de output van AI, die de waarde ervan ondermijnen – en zelfs echt gevaar kunnen opleveren voor mensen, vooral in sectoren zoals de gezondheidszorg en het transport, waar valse outputs theoretsch kunnen leiden tot alles, van de verkeerde medicatie tot treinen op een collision course.

Vaak worden deze onnauwkeurigheden toegeschreven aan AI-‘hallucinaties‘ – gevallen waarin de AI een ‘beste schatting’ antwoord genereert, dat met dezelfde zekerheid wordt gepresenteerd als een ‘echt’ antwoord, in plaats van de gebruiker te informeren over een lacune in zijn kennis of capaciteit. Hallucinaties kunnen moeilijk te herkennen zijn bij eerste oogopslag – maar er is een stiller, even serieus probleem dat nog moeilijker te detecteren is.

Schulden van gegevenskwaliteit: de achilleshiel van AI

Wanneer AI-systemen gegevens uit oude, onvolledige of onnauwkeurige bronnen halen, treden valse outputs op, maar zijn minder onmiddellijk herkenbaar. U kunt bijvoorbeeld een AI vragen om de symptomen van een medische aandoening te identificeren en een antwoord krijgen dat is gebaseerd op een 50 jaar oude publicatie in plaats van actueel onderzoek. Het resultaat is onwaarschijnlijk om meteen, lachwekkend verkeerd te lijken – maar die eerste schijn van plausibiliteit vormt een echt risico voor zowel de patiënt in kwestie als de zorgverlener.

Hetzelfde geldt voor alle industrieën – als de gegevens die aan het AI-model worden gevoerd oude, verouderde of gedeeltelijke informatie bevatten, is er een groot risico op valse outputs. En naarmate meer bedrijven AI integreren in bedrijfskritische processen, groeit het risico van het trekken van valse conclusies uit slecht beheerde gegevens.

Nauwkeurigheid voor de regulator

Dit is niet alleen een probleem voor de dagelijkse operaties – het is ook een aanzienlijke compliance-uitdaging. Reguleringsvereisten evolueren snel om problemen met onnauwkeurige AI aan te pakken. Zo hebben enkele vroege reguleringsacties op AI plaatsgevonden; bijvoorbeeld toen Italië tijdelijk ChatGPT verbood vanwege privacybezwaren, en de EU Data Protection Board een speciale taskforce lanceerde om potentiële handhavingsacties te coördineren tegen ChatGPT.

Een van de meest sprekende reguleringswijzigingen is de goedkeuring van de EU AI-wet, het eerste alomvattende juridische kader voor AI. De wet legt verplichtingen vast op basis van het risiconiveau van AI-systemen, van ‘onacceptabele risico’-systemen, die verboden zijn, tot ‘hoge-risico’-systemen, die strikte eisen stellen aan transparantie, gegevenskwaliteit, governance en menselijke toezicht.

Het belang van de EU AI-wet ligt niet in zijn ambitieuze omvang, maar belangrijk is het precedent dat het schept. Regulators maken duidelijk dat AI onderworpen zal zijn aan bindende, afdwingbare regels en dat organisaties compliance en transparantie rondom waar en hoe AI wordt gebruikt als integraal onderdeel van AI-adoptie moeten behandelen, in plaats van een nasleep.

De wet heeft een brede reikwijdte, met het potentieel om een groot deel van de AI-ontwikkelingen te beïnvloeden. In zijn hart is het de bedoeling om AI veilig te maken, terwijl fundamentele rechten en waarden worden gerespecteerd. Binnen dit nieuwe principiële ecosysteem komt de diagnose van potentiële bronnen voor AI-onnauwkeurigheden, waaronder de gegevens en datasets die de modellen voeden, modelopaciteit en toegang, en systeemontwerp en gebruik. AI-oplossingen zijn een construct van alle drie – problemen met een van deze kunnen een negatief resultaat hebben. Niet alleen dat, maar de gegevens die worden gebruikt voor het ontwerp, de ontwikkeling, de implementatie en de werking van AI zullen waarschijnlijk voornamelijk bestaan uit bedrijfsrecords die zelf onderworpen zijn aan verschillende compliance-eisen.

In andere woorden, de reguleringsomgeving rondom AI wordt steeds strenger – en dat is net zo waar voor gegevensinvoer als voor gegevensuitvoer, ook al krijgt de laatste meer aandacht.

Vijf stappen om AI compliant, actuele, relevante gegevens te voeden

Om deze dubbele uitdaging aan te pakken – zowel compliant gegevensbeheer als hoge kwaliteit invoer die hoge kwaliteit output mogelijk maakt – hebben bedrijven controle nodig over trainings- en inferentiegegevens. Helaas ontbreekt dit bij veel ondernemingen nog.

Op zijn minst zouden organisaties hun bredere compliance- en governanceprogramma’s moeten toepassen op AI-initiatieven. Ze moeten beginnen met het vastleggen en onderhouden van passende records over de gegevens die ze aan AI-modellen voeren, hoe modellen en systemen zijn ontworpen, evenals de beslissingen en inhoud die via AI worden gegenereerd.

Maar het is ook kritisch belangrijk voor organisaties om een stap verder te gaan en ervoor te zorgen dat ze volledige controle hebben over alle gegevens die mogelijk worden gebruikt in AI-implementaties, of het nu gaat om initiële training of ‘live’ werk. Dit vereist een strategie voor gegevensbeheer en -opslag van hoge kwaliteit, waarmee alle relevante gegevens slim worden verzameld, schoongemaakt, opgeslagen, geclassificeerd en geautoriseerd. Om dit te bereiken, moeten organisaties vier belangrijke stappen overwegen:

1. Gegevensafkomst en -herkomst

Dit omvat het onderhouden van een record van de bron van de gegevens, hun oorsprong, eigendom en eventuele wijzigingen in metadata (indien toegestaan) gedurende hun levenscyclus. Het betekent ook het onderhouden van rijke metadata en alle onderliggende documenten of artefacten waaruit het is afgeleid.

2. Gegevensauthenticiteit

Dit vereist het onderhouden van een duidelijke keten van bewaring voor alle gegevens, het opslaan van objecten in hun native vorm en het hashen van objecten die worden ontvangen om aan te tonen dat de gegevens ongewijzigd blijven. Bovendien moeten organisaties een volledige auditgeschiedenis onderhouden voor elk object en voor alle acties en gebeurtenissen met betrekking tot eventuele wijzigingen.

3. Gegevensclassificatie

Het vaststellen van de aard van een set of type gegevens is belangrijk. Organisaties moeten in staat zijn om gestructureerde gegevens, semi-gestructureerde gegevens en gestructureerde sets van gegevens te beheren. Het geven van elke klasse een unieke schema kan organisaties in staat stellen om diverse sets van gegevens te beheren zonder een vaste, inflexibele ontologie – waardoor de gegevens niet onnodig worden gemanipuleerd om ze in een inflexibele gegevensstructuur te dwingen.

4. Gegevensnormalisatie

Het vaststellen van gemeenschappelijke definities en formaten van metadata is belangrijk voor gebruik in analytics en AI-oplossingen. Duidelijk gedefinieerde schema’s zijn een belangrijk element, evenals tools die gegevens kunnen transformeren of in kaart brengen om consistente, genormaliseerde weergaven van verwante gegevens te behouden.

5. Gegevensautororisaties

Ondernemingen hebben granulaire autororisatiecontroles nodig, inclusief op object- of veldniveau, op basis van gebruikers- of systeemprofielen. Dit betekent dat de juiste gegevens beschikbaar zijn voor gebruikers en systemen die zijn geautoriseerd om toegang te krijgen, terwijl toegang wordt beperkt of geweigerd voor gebruikers die niet zijn geautoriseerd.

Met deze cruciale elementen op hun plaats, zullen bedrijven het best geplaatst zijn om ervoor te zorgen dat de gegevens die aan AI-modellen worden verstrekt, zowel van hoge kwaliteit als compliant zijn. AI zal verbeteringen en efficiëntie brengen in verschillende industrieën – maar om dat te laten gebeuren, is een solide gegevensbasis essentieel.

George Tziahanas is de VP van Compliance en Associate General Counsel bij Archive360. George is een executive leader met een diep begrip van complexe technologie, bankreglementen, gegevensbeheer en risicobeheer. En, werkt nauw samen met bestaande en potentiële klanten om ervoor te zorgen dat complexe gegevensbeheer- en compliance-eisen worden vervuld, in overeenstemming met de oplossingen van Archive360.