Thought leaders
De waarheid over synthetische data: waarom menselijke expertise essentieel is voor LLM-succes

Ontwikkelaars van LLM’s (Large Language Models) gebruiken steeds vaker synthetische data om de ontwikkeling te versnellen en de kosten te verlagen. Onderzoekers achter verschillende topmodellen, zoals LLama 3, Qwen 2 en DeepSeek R1, hebben vermeld dat ze synthetische data gebruiken om hun modellen te trainen in hun onderzoeksartikelen. Van buitenaf gezien lijkt dit de perfecte oplossing: een oneindige bron van informatie om de ontwikkeling te versnellen en de kosten te verlagen. Maar deze oplossing heeft een verborgen kostenpost die bedrijfsleiders niet kunnen negeren.
In eenvoudige bewoordingen is synthetische data gegenereerd door AI-modellen om kunstmatige datasets te creëren voor het trainen, fijnafstemmen en evalueren van LLM’s en AI-agents. In vergelijking met traditionele menselijke annotatie, maakt het de datapipeline snel schaalbaar, wat essentieel is in de snel veranderende en concurrerende landschap van AI-ontwikkeling.
Bedrijven kunnen andere redenen hebben om “nep”-data te gebruiken, zoals het beschermen van gevoelige of vertrouwelijke informatie in financiële of gezondheidsinstellingen door anonieme versies te genereren. Synthetische data is ook een goede vervanging wanneer propriëtaire data niet beschikbaar is, zoals voordat een product wordt gelanceerd of wanneer de data toebehoort aan externe klanten.
Maar revolutioneert synthetische data de AI-ontwikkeling? Het korte antwoord is een voorbehouden ja: het heeft een groot potentieel, maar het kan ook LLM’s en agents blootstellen aan kritieke kwetsbaarheden zonder grondige menselijke toezicht. LLM-producers en AI-agentontwikkelaars kunnen ontdekken dat AI-modellen die zijn getraind op onvoldoende gevalideerde synthetische data onnauwkeurige of bevooroordeelde uitvoer kunnen genereren, reputatiecrises kunnen creëren en kunnen leiden tot non-conformiteit met industrie- en ethische normen. Investeringen in menselijke toezicht om synthetische data te verfijnen, zijn een directe investering in het beschermen van de onderkant, het behouden van stakeholder-vertrouwen en het waarborgen van verantwoorde AI-adoptie.
Met menselijke input kan synthetische data worden getransformeerd in hoge kwaliteit trainingsdata. Er zijn drie kritieke redenen om gegenereerde data te verfijnen voordat ze worden gebruikt om AI te trainen: om lacunes in bronmodelkennis te vullen, om de gegevenskwaliteit te verbeteren en de steekproefgrootte te verkleinen, en om in overeenstemming te zijn met menselijke waarden.
We moeten unieke kennis vastleggen
Synthetische data wordt voornamelijk gegenereerd door LLM’s die zijn getraind op openbaar beschikbare internetbronnen, waardoor een inherente beperking ontstaat. Openbare inhoud vat zelden de praktische, hands-on kennis vast die in de werkelijke wereld wordt gebruikt. Activiteiten zoals het ontwerpen van een marketingcampagne, het opstellen van een financiële prognose of het uitvoeren van marktanalyse zijn meestal privé en niet online gedocumenteerd. Bovendien weerspiegelen de bronnen vaak de taal en cultuur van de Verenigde Staten, waardoor de wereldwijde vertegenwoordiging wordt beperkt.
Om deze beperkingen te overwinnen, kunnen we experts betrekken om datasamples te creëren in gebieden waarvan we vermoeden dat het synthetische datageneratiemodel deze niet kan dekken. Terugkerend naar het corporate-voorbeeld, als we willen dat ons eindmodel effectief financiële prognoses en marktanalyses kan uitvoeren, moet de trainingsdata realistische taken uit deze gebieden bevatten. Het is belangrijk om deze lacunes te identificeren en synthetische data aan te vullen met door experts gegenereerde samples.
Experts worden vaak vroeg in het project betrokken om de reikwijdte van het werk te definiëren. Dit omvat het creëren van een taxonomie, die de specifieke kennisgebieden aangeeft waarop het model moet presteren. Bijvoorbeeld in de gezondheidszorg kan algemene geneeskunde worden onderverdeeld in subonderwerpen zoals voeding, cardiovasculaire gezondheid, allergieën en meer. Een gezondheidsgericht model moet worden getraind in alle subgebieden waarop het moet presteren. Nadat de taxonomie is gedefinieerd door gezondheidsexperts, kunnen LLM’s worden gebruikt om datapunten met typische vragen en antwoorden snel en op grote schaal te genereren. Menselijke experts zijn nog steeds nodig om deze inhoud te controleren, te corrigeren en te verbeteren om ervoor te zorgen dat deze niet alleen nauwkeurig is, maar ook veilig en contextueel relevant. Deze kwaliteitsborgingsprocedure is noodzakelijk in hoge-risicotoepassingen, zoals de gezondheidszorg, om gegevensnauwkeurigheid te waarborgen en potentieel gevaar te mitigeren.
Kwaliteit boven kwantiteit: het stimuleren van model-efficiëntie met minder, betere samples
Wanneer domeinexperts data creëren voor het trainen van LLM’s en AI-agents, creëren ze taxonomieën voor datasets, schrijven ze prompts, creëren ze de ideale antwoorden of simuleren ze een specifieke taak. Alle stappen zijn zorgvuldig ontworpen om bij de doelstelling van het model te passen, en de kwaliteit wordt gewaarborgd door onderwerpspecialisten in de corresponderende gebieden.
De generatie van synthetische data kan deze procedure niet volledig repliceren. Het vertrouwt op de sterktes van het onderliggende model dat wordt gebruikt voor het creëren van de data, en de resulterende kwaliteit is vaak niet gelijk aan die van door mensen gegenereerde data. Dit betekent dat synthetische data vaak grotere volumes vereist om bevredigende resultaten te behalen, waardoor de berekeningskosten en de ontwikkelingstijd toenemen.
In complexe domeinen zijn er nuances die alleen door menselijke experts kunnen worden opgespoord, vooral bij outliers of randgevallen. Door mensen gegenereerde data levert consistent betere modelprestaties, zelfs met aanzienlijk kleinere datasets. Door menselijke expertise strategisch te integreren in het datageneratieproces, kunnen we het aantal samples dat nodig is voor het model om effectief te presteren, verkleinen.
Uit onze ervaring blijkt dat de beste manier om deze uitdaging aan te pakken is door onderwerpspecialisten te betrekken bij de bouw van synthetische datasets. Wanneer experts de regels voor datageneratie definiëren, taxonomieën definiëren en gegenereerde data controleren of corrigeren, is de eindkwaliteit van de data veel hoger. Deze aanpak heeft onze klanten in staat gesteld om sterke resultaten te behalen met minder datasamples, waardoor een snellere en efficiëntere weg naar productie mogelijk wordt.
Vertrouwen opbouwen: de onvervangbare rol van mensen in AI-veiligheid en -alignering
Geautomatiseerde systemen kunnen niet alle kwetsbaarheden anticiperen of waarborgen dat ze in overeenstemming zijn met menselijke waarden, vooral in randgevallen en tweedeurscenario’s. Expert-menselijke reviewers spelen een cruciale rol bij het identificeren van opkomende risico’s en het waarborgen van ethische resultaten voordat ze worden geïmplementeerd. Dit is een laag van bescherming die AI, althans voor nu, niet volledig op zichzelf kan bieden.
Daarom is het noodzakelijk om synthetische data alleen niet te gebruiken om een sterk red team-dataset te bouwen. Het is belangrijk om beveiligingsexperts vroeg in het proces te betrekken. Zij kunnen helpen om de soorten potentiële aanvallen in kaart te brengen en de structuur van de dataset te bepalen. LLM’s kunnen dan worden gebruikt om een grote hoeveelheid voorbeelden te genereren. Vervolgens zijn experts nodig om de data te verifiëren en te verfijnen om ervoor te zorgen dat deze realistisch, van hoge kwaliteit en nuttig is voor het testen van AI-systemen. Bijvoorbeeld kan een LLM duizenden standaard hacking-prompts genereren, maar een menselijke beveiligingsexpert kan nieuwe ‘sociale engineering’-aanvallen creëren die nuances in psychologische vooroordelen exploiteren – een creatieve bedreiging die geautomatiseerde systemen moeilijk zelf kunnen uitvinden.
Er is aanzienlijke vooruitgang geboekt in het aligneren van LLM’s met geautomatiseerde feedback. In het artikel “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” tonen onderzoekers aan dat AI-gebaseerde alignering in veel gevallen vergelijkbaar kan presteren met menselijke feedback. Echter, terwijl AI-feedback verbetert naarmate modellen verbeteren, toont onze ervaring aan dat RLAIF nog steeds worstelt in complexe domeinen en met randgevallen of outliers, gebieden waar prestaties kritiek kunnen zijn, afhankelijk van de toepassing. Menselijke experts zijn effectiever in het omgaan met taaknuances en context, waardoor ze meer betrouwbaar zijn voor alignering.
AI-agents profiteren ook van geautomatiseerde tests om een breed scala aan veiligheidsrisico’s aan te pakken. Virtuele testomgevingen gebruiken gegenereerde data om agentgedrag te simuleren, zoals het gebruik van online tools en het uitvoeren van acties op websites. Om de testdekking in realistische scenario’s te maximaliseren, is menselijke expertise essentieel om testcases te ontwerpen, de resultaten van geautomatiseerde evaluaties te verifiëren en kwetsbaarheden te melden.
De toekomst van synthetische data
Synthetische data is een waardevolle techniek voor de ontwikkeling van grote taalmodellen, vooral wanneer schaalbaarheid en snelle implementatie kritiek zijn in het huidige snel veranderende landschap. Hoewel er geen fundamentele fouten zijn in synthetische data zelf, vereist het verfijning om zijn volledige potentieel te bereiken en de meeste waarde te leveren. Een hybride aanpak die geautomatiseerde datageneratie combineert met menselijke expertise is een effectieve methode voor het ontwikkelen van capabele en betrouwbare modellen, aangezien de eindprestaties van het model meer afhankelijk zijn van de gegevenskwaliteit dan van het totale volume. Dit geïntegreerde proces, dat AI gebruikt voor schaalbaarheid en menselijke experts voor validatie, produceert meer capabele modellen met verbeterde veiligheidsalignering, wat essentieel is voor het opbouwen van gebruikersvertrouwen en het waarborgen van verantwoorde implementatie.












