Tankeledere
Sandheden om syntetisk data: Hvorfor menneskelig ekspertise er afgørende for LLM-succes

LLM-udviklere er i stigende grad begyndt at bruge syntetisk data for at accelerere udviklingen og reducere omkostningerne. Forskerne bag flere topmodeller, såsom LLama 3, Qwen 2 og DeepSeek R1, har nævnt, at de bruger syntetisk data til at træne deres modeller i deres forskningspapirer. Set udefra, ser det ud som den perfekte løsning: en uendelig kilde af information, der kan accelerere udviklingen og reducere omkostningerne. Men denne løsning har en skjult pris, som virksomhedsledere ikke kan ignorere.
På simple vilkår er syntetisk data genereret af AI-modeller for at skabe kunstige datasæt til træning, finjustering og evaluering af LLM’er og AI-agenter. I forhold til traditionel menneskelig annotation tillader datapiplen at skala hurtigt, hvilket er afgørende i den hurtigt udviklende og konkurrencedygtige landskab af AI-udvikling.
Virksomheder kan have andre grunde til at bruge “falsk” data, såsom beskyttelse af følsomme eller fortrolige oplysninger i finans- eller sundhedssektoren ved at generere anonymiserede versioner. Syntetisk data er også en god erstatning, når proprietær data ikke er tilgængelig, såsom før lancering af et produkt eller når data tilhører eksterne kunder.
Men er syntetisk data revolutionerende for AI-udviklingen? Det korte svar er et kvalificeret ja: den har stor potentiale, men den kan også afsløre LLM’er og agenter for kritiske sårbarheder uden rigorøs menneskelig overvågning. LLM-producenter og AI-agentudviklere kan opdage, at AI-modeller, der er trænet på utilstrækkeligt vurderet syntetisk data, kan generere ukorrekte eller fordomsfulde udgang, skabe reputationskriser og føre til non-overholdelse af brancheregler og etiske standarder. Investering i menneskelig overvågning til at forfine syntetisk data er en direkte investering i beskyttelse af bundlinjen, opretholdelse af stakeholder-tillid og sikring af ansvarlig AI-udvikling.
Med menneskelig indsats kan syntetisk data omdannes til højkvalitets træningsdata. Der er tre kritiske grunde til at forfine genereret data, før det bruges til at træne AI: for at udfylde huller i kilde-modell-viden, for at forbedre datakvaliteten og reducere samples størrelse, og for at tilpasse sig menneskelige værdier.
Vi må fange unik viden
Syntetisk data genereres primært af LLM’er, der er trænet på offentligt tilgængelige internetskilder, hvilket skaber en indbygget begrænsning. Offentligt indhold fanger sjældent den praktiske, hånd-til-hånd-viden, der bruges i virkelige arbejdssituationer. Aktiviteter som design af en markedsføringskampagne, forberedelse af en finansielle prognose eller gennemførelse af markedsanalyse er typisk private og ikke dokumenteret online. Derudover tenderer kilderne til at reflektere USA-centrisk sprog og kultur, hvilket begrænser global repræsentation.
For at overvinde disse begrænsninger kan vi inddrage eksperter til at skabe datasæt i områder, hvor vi formoder, at syntetisk data-genereringsmodellen ikke kan dække. Ved at vende tilbage til det corporate-eksempel, hvis vi ønsker, at vores endelige model kan håndtere finansielle prognoser og markedsanalyse effektivt, skal træningsdataen inkludere realistiske opgaver fra disse felter. Det er vigtigt at identificere disse huller og supplere syntetisk data med ekspert-skabte samples.
Eksperter er ofte involveret tidligt i projektet for at definere arbejdets omfang. Dette inkluderer oprettelse af en taksonomi, der fastlægger de specifikke områder af viden, hvor modellen skal udføre. For eksempel i sundhedssektoren kan almen medicin deles op i underemner som ernæring, hjertesundhed, allergier og mere. En sundhedsfokuseret model skal være trænet i alle underområder, det forventes at dække. Efter at taksonomien er defineret af sundhedseksperter, kan LLM’er bruges til at generere datapunkter med typiske spørgsmål og svar hurtigt og i stor målestok. Menneskelige eksperter er stadig nødvendige for at gennemgå, korrigere og forbedre dette indhold for at sikre, at det ikke kun er nøjagtigt, men også sikkert og kontekstligt passende. Denne kvalitetsikringsproces er nødvendig i højrisikoapplikationer, såsom sundhedssektoren, for at sikre dataakkuratthed og minimere potentiel skade.
Kvalitet over kvantitet: drivende model-effektivitet med færre, bedre samples
Når domæne-eksperter skaber data til træning af LLM’er og AI-agenter, skaber de taksonomier for datasæt, skriver prompts, udformer de ideelle svar eller simulerer en specifik opgave. Alle disse skridt er omhyggeligt designede til at tilpasse modellens formål, og kvaliteten sikres af fageksperter i de pågældende felter.
Syntetisk data-generering replicerer ikke fuldstændigt denne proces. Den afhænger af styrkerne i den underliggende model, der bruges til at generere data, og den resulterende kvalitet er ofte ikke på niveau med menneske-kurateret data. Dette betyder, at syntetisk data ofte kræver større volumener for at opnå tilfredsstillende resultater, hvilket driver op for beregningsomkostningerne og udviklingstiden.
I komplekse domæner er der nuancer, som kun menneskelige eksperter kan spotte, især med outliers eller edge-cases. Menneske-kurateret data leverer konsekvent bedre model-præstation, selv med betydeligt mindre datasæt. Ved at integrere menneskelig ekspertise i data-skabningsprocessen kan vi reducere antallet af samples, der er nødvendige for, at modellen kan udføre effektivt.
I vores erfaring er den bedste måde at tackle denne udfordring på at inddrage fageksperter i opbygningen af syntetiske datasæt. Når eksperterne designer reglerne for data-generering, definerer data-taksonomier og gennemgår eller korrigere den genererede data, er den endelige kvalitet af data meget højere. Denne tilgang har enablede vores kunder til at opnå stærke resultater ved at bruge færre data-samples, hvilket har ført til en hurtigere og mere effektiv vej til produktion.
Opbygning af tillid: den uerstattelige rolle af mennesker i AI-sikkerhed og -tilpasning
Automatiserede systemer kan ikke forudse alle sårbarheder eller sikre tilpasning til menneskelige værdier, især i edge-cases og tvetydige scenarier. Ekspert-menneskelige gennemgangere spiller en afgørende rol i at identificere opstående risici og sikre etiske resultater før deployment. Dette er et lag af beskyttelse, som AI, i hvert fald for nu, ikke fuldstændigt kan levere på egen hånd.
Derfor er det ikke nok at bruge syntetisk data alene til at opbygge en stærk red teaming-datasæt. Det er vigtigt at inddrage sikkerheds-eksperter tidligt i processen. De kan hjælpe med at kortlægge de potentielle angreb og guide strukturen af datasættet. LLM’er kan derefter bruges til at generere en stor mængde eksempler. Efterfølgende er eksperter nødvendige for at verificere og forfine data for at sikre, at det er realistisk, høj-kvalitets og nyttigt til test af AI-systemer. For eksempel kan en LLM generere tusinder af standard-hacking-prompts, men en menneskelig sikkerheds-ekspert kan skabe nye ‘social engineering’-angreb, der udnytter nuancerede psykologiske bias – en kreativ trussel, som automatiserede systemer kæmper med at opfinde på egen hånd.
Der har været betydelig fremgang i at tilpasse LLM’er ved hjælp af automatiseret feedback. I artiklen “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” viser forskerne, at AI-baseret tilpasning kan udføre sammenligneligt med menneskelig feedback i mange tilfælde. Men selvom AI-feedback forbedres, når modellerne forbedres, viser vores erfaring, at RLAIF stadig kæmper i komplekse domæner og med edge-cases eller outliers, områder hvor præstation kan være kritisk afhængigt af anvendelsen. Menneskelige eksperter er mere effektive til at håndtere opgave-nuancer og kontekst, hvilket gør dem mere pålidelige til tilpasning.
AI-agenter kan også drage fordel af automatiseret testning for at tackle en bred vifte af sikkerhedsrisici. Virtuelle test-miljøer bruger genereret data til at simulere agent-adfærd som interfacing med online-værktøjer og udførelse af handlinger på websites. For at maksimere test-dækningen i realistiske scenarier er menneskelig ekspertise integreret til at designe test-cases, verificere resultaterne af automatiserede evalueringer og rapportere om sårbarheder.
Fremskridtet for syntetisk data
Syntetisk data er en højværdi-teknik til udvikling af store sprogmodeller, især når skala og hurtig deployment er kritisk i dagens hurtigt udviklende landskab. Selvom der ikke er fundamentale fejl i syntetisk data i sig selv, kræver det forfining for at nå sin fulde potentiale og levere den mest værdi. En hybrid-tilgang, der kombinerer automatiseret data-generering med menneskelig ekspertise, er en meget effektiv metode til at udvikle dygtige og pålidelige modeller, da den endelige model-præstation afhænger mere af data-kvalitet end af total volumen. Denne integrerede proces, der bruger AI til skala og menneskelige eksperter til validering, producerer mere dygtige modeller med forbedret sikkerheds-tilpasning, hvilket er afgørende for at opbygge bruger-tillid og sikre ansvarlig deployment.












