Tankeledere
Synthetic Data’s Opkomst og Hvorfor det Vil Supplere Snarere End Erstatte Ægte Data

Elon Musk erklærede nylig, at vi har udnyttet den tilgængelige menneskegenererede data til træning af AI-modeller. Hans advarsel er den seneste kommentar til behovet for nye datakilder, hvis AI skal fortsætte sin hurtige udvikling. I brancher som sundheds- og finanssektoren gør strenge privatlivsregler mangel på data endnu mere akut.
Da synthetic data – en mulig løsning på denne mangel – ikke er ny, fortsætter dets betydning med at vokse, som bevises af de seneste fusioner og investeringer i dette område. Der er dog nogle dybe usikkerheder omkring brugen af synthetic data, især risikoen for modelkollaps, hvor kvaliteten af en multimodal stor sprogmodel (LLM) ‘s output forringes uden ægte verdensdata til træning. Hvis dette problem viser sig at være uløseligt eller kan løses, kan det have en betydelig indvirkning på fremtiden for generativ AI (Gen AI).
Hvad er synthetic data, og hvordan skabes det?
Synthetic data skabes kunstigt i stedet for at blive indsamlet fra ægte begivenheder. AI-genereret synthetic data er nu den mest udbredte form, som indebærer træning af modeller på ægte verdensdata for at opdage mønstre og korrelationer, derefter genererer nye data, der efterligner disse statistiske egenskaber.
LLM’er bruges til at generere en række synthetic data typer, herunder struktureret data, såsom tabeldata, og ustruktureret data, som f.eks. frit tekst, videoer og billeder. En række metoder anvendes afhængigt af den type data, der produceres.
For eksempel er to almindelige metoder, der anvendes til at generere synthetic billeddata, GAN’er og diffusionsmodeller. GAN’er anvender to neurale netværk: en generator skaber kunstige versioner af ægte data, mens en diskriminator identificerer, hvilke der er ægte kontra genererede. Ved at arbejde sammen kontinuerligt forsøger generatoren at “bedrage” diskriminatoren, og kontinuerligt forbedre realismen og diversiteten af kunstig data. Diffusionsmodeller tager en anden tilgang, hvor de lærer at forstyrre ægte data og derefter omvendte denne proces for at “rense” den. Når de er trænet effektivt, kan de producere højkvalitets synthetic lyd- og billeddata.
Synthetic data’s voksende betydning
Der har været langvarig interesse for synthetic data. Men i de sidste 5 år har den hurtige udvikling af LLM’er både øget efterspørgslen efter synthetic data og skabt en endnu mere effektiv måde at generere det i stor målestok. Som følge heraf er synthetic data-brugen eksploderet.
Gartner forudsagde, at synthetic data ville udgøre 60% af alle data, der bruges til træning af LLM’er i 2024, op fra kun 1% i 2021. Der er alle grund til at tro, at denne vurdering er bredt nøjagtig. For eksempel var Microsofts Phi-4-model, der overgår andre LLM’er, selvom den er meget mindre, succesfuldt trænet på primært synthetic data. Imens er ingeniørerne bag Amazon’s Alexa i gang med at udforske brugen af en “lærer/elev”-model, hvor “lærer”-modellen genererer synthetic data, der derefter bruges til at finjustere en mindre “elev”-model.
Dette omfattende antagelse bliver spejlet af store bevægelser på markedet. Synthetic data-sektoren så en investeringsboble i 2021-22. Gretel AI og Tonic.ai sikrede serie B-runder på 50 millioner dollar og 35 millioner dollar henholdsvis. Disse blev efterfulgt af MOSTLY AI lukkede en serie B-runde på 25 millioner dollar og Synthesis AI sikrede 17 millioner dollar i serie A-finansiering.
Senere har trenden været mod store opkøb. NVIDIA’s opkøb af Gretel i foråret vil støtte tech-gigantens eget arbejde på dette område. Ligesom AI-løsningsvirksomheden SAS opkøbte synthetic data-startup Hazy i november 2024.
Den analysefirma Cognilytica estimerede markedet for synthetic data-generering i 2021 til at have været værd omkring 110 millioner dollar. Firmaet forventer, at det vil nå 1,15 milliarder dollar i 2027. Andre forudsigelser forventer en årlig vækstrate på 31% for sektoren, da den vokser til $2,33 milliarder i værdi i 2030.
Modelkollaps
Men synthetic data’s spændende potentiale kommer med en betydelig downside: modelkollaps. Dette er et fænomen, hvor LLM’er, der udelukkende trænes på synthetic data, begynder at producere mindre præcise eller mindre diverse outputs.
mens ægte verdensdata tenderer til at være høj i kompleksitet, er synthetic data ofte forenket og kondenseret af modeller. For eksempel fandt forskere, at nøjagtigheden af en model, der var trænet til at opdage kræftige negle fra fotografier, var omvendt proportional til mængden af synthetic træningsdata. En ny studie af akademikere fra Oxford, Cambridge, Imperial College og University of Toronto fandt, at brugen af model-genereret data uden diskrimination førte til “uomgængelige fejl i den resulterende model.”
Endnu værre er de fleste LLM’er “sorte kasser”, hvilket gør det svært at forstå, hvordan de vil reagere på synthetic data. Forskere fra Rice University og Stanford konkluderede, at uden noget nyt ægte verdensdata vil “fremtidige generative modeller være dømt til at have deres kvalitet (præcision) eller diversitet (genkald) progressivt reduceret.”
Det fortsatte behov for ægte verdensdata
Det er tydeligt, at selv med den stigende efterspørgsel efter synthetic data, behovet for ægte verdensdata består. Faktisk kan efterspørgslen efter højkvalitets ægte verdensdata endda øge. Årsagen til dette er tofold: For det første vil ægte verdensdata altid være nødvendig for at træne de AI-modeller, der genererer synthetic data. For det andet er det nødvendigt at kontinuerligt synkronisere synthetic data med ægte verdensdata for at undgå modelkollaps.
Ægte data til træning af synthetic-data-producerende AI-modeller
Som nævnt tidligere skabes de fleste synthetic data i dag ved hjælp af Gen AI. Og disse Gen AI-modeller skal trænes på ægte verdensdata for at skabe brugbar synthetic data. Det skyldes, at de kun kan skabe synthetic data ved at replikere mønstre og statistiske egenskaber fra en ægte verdensdataset.
Overvej det nyeste eksempel på en forsikringsvirksomhed, der kunne bruge synthetic data til at teste forskellige leverandører uden at kompromittere deres følsomme kundedata. For at generere denne synthetic data, der nøjagtigt efterlignede virkeligheden, var de nødt til at bruge deres egen ægte verdensdata til at træne AI-modellen, der derefter genererede synthetic data.
Ægte data til at mildne modelkollaps
Der er flere strategier for at mildne risikoen for modelkollaps. Disse inkluderer validering og derefter regelmæssig gennemgang af synthetic data, samt kontrol af kvaliteten af synthetic data, før det bruges i generative modeller. Men den mest almindelige tilgang er at diversificere data ved at kombinere synthetic data med menneskegenereret data. Gartners undersøgelse fandt, at 63% af respondentende foretrækker at bruge en delvist synthetic dataset, mens kun 13% siger, de bruger fuldstændig synthetic data.
Selv tilføjelse af beskedne mængder af ægte verdensdata kan betydeligt forbedre en models præstation. Forskere fra University of South California fandt, at virksomheder kan erstatte op til 90% af deres ægte data med synthetic data uden at opleve en betydelig nedgang i præstation. Men erstatning af det sidste 10% af menneskegenereret data resulterer i en betydelig nedgang.
Kvalitet tæller også, som illustreret af Microsofts succes med Phi-4. Denne LLM blev trænet på primært synthetic data genereret af GPT-4o. Men en stor del af fortræningsdata – en generel dataset, der bruges til den første træningsfase, før en model finjusteres – var omhyggeligt udvalgt, højkvalitets ægte verdensdata, herunder bøger og forskningsartikler.
Potentialet for synthetic data
Når synthetic data bruges intelligent, og kombineres effektivt med ægte verdensdata, har det potentiale til at løse seks specifikke problemer, når det kommer til AI-træningsdata: knaphed, tilgængelighed, homogenitet, bias, privatlivsproblemer og omkostninger.
Knaphed
Da AI-virksomheder kapløber om at opnå markedsoverlegenhed og opnå nye rekorder, stiger efterspørgslen efter data til træning af deres LLM’er. Synthetic data har potentialet til at fylde denne lukke, ifølge Gartners forskning. Men det skal bemærkes, at brug af betydelige mængder ægte data i fortræningsdata og til synkronisering for at undgå modelkollaps stadig vil være nødvendig.
Tilgængelighed
Større teknologivirksomheder fungerer stadig som portvagter, når det kommer til data, og skaber en barrierer for mindre spillere. Synthetic data har potentialet til at demokratisere Gen AI ved at gøre store mængder træningsdata tilgængelige og billige. Alligevel vil dette ikke fjerne ansvaret for store teknologivirksomheder at forbedre adgangen til ægte verdensdata, da det stadig er nødvendigt for træning af synthetic-data-genererende modeller.
Homogenitet
I visse nicheanvendelser, som træning af AI til selvstændig kørsel, er ægte verdensdata for homogene. I tilfældet med kørsel kan udviklere generere synthetic data for at udfylde huller i data for usædvanlige situationer. Dette muliggør, at modeller kan trænes til sjældne begivenheder på vejen.
Bias
Nogle ægte verdensdata indeholder indbyggede bias, så synthetic data kan genereres for at sikre, at AI-modellerne får en mere balanceret billed. For eksempel har Storbritanniens Finansiel Tilsyn (FCA) argumenteret for, at synthetic data har potentialet til at modvirke potentielle bias, forårsaget af, at visse grupper er underrepræsenterede i menneskegenererede data.
Privatliv
I sektorer som sundheds- og finanssektoren gør privatlivskrav, at dataknapheden bliver endnu mere akut. Med synthetic data kan virksomheder bygge træningsdata til deres modeller, der indeholder niche-data uden at kompromittere kundernes privatliv. Men som en rapport udarbejdet af Storbritanniens Royal Society har påpeget med henvisning til synthetic data i medicinsk forskning, er der en antagelse, at synthetic data er “inherently privat.” Dette er en “misforståelse.” Som forskerne påpeger, kan synthetic data lække information om de data, det er afledt fra.
Specifikt er modeller, der er trænet på følsomme data, sårbare over for model-inversion-angreb, hvor hackere kan genskabe dele af den oprindelige dataset.
Omkostninger
Generelt set genereres synthetic data til en lavere omkostning end ægte verdensdata. Det kommer også med mærkning, hvilket sparer tid og omkostninger. I visse AI-træningsprojekter kan op til 80% af projektet være optaget af dataforberedelse, herunder mærkning. Dette forklarer, hvorfor særlige virksomheder er opstået specifikt for at tilbyde lavkost-arbejdskraft for at imødekomme dataforarbejdningsbehovene for Silicon Valley-giganter.
Supplerende ægte data i stedet for at erstatte det
Disse fordele ved synthetic data kan udnyttes, forudsat det ikke behandles som en erstatning for ægte data. I stedet skal dets rol være at supplere ægte data, og give mulighed for at øge antallet af datapunkter, der er tilgængelige.
For kontekst er Meta’s kommende LLM, LLAMA Behemoth, trænet på 30 billion datapunkter. Det er tydeligt, at det er en udfordring at finde ægte verdensdata i denne skala, hvis det overhovedet er muligt. Men som det er blevet bemærket, er brug af ægte verdensdata stadig en nødvendighed, enten for at træne modellerne, der producerer synthetic data, eller for at synkronisere med synthetic data for at sikre nøjagtighed og undgå modelkollaps. På den skala, som LLM’er arbejder på i øjeblikket, vil der stadig være en betydelig efterspørgsel efter ægte verdensdata, selv hvis synthetic data udgør en betydelig proportion af træningsdata. Dette betyder, at der vil være komplekse problemer at løse omkring portvagter, adgang, bias, omkostninger og tid.












