Tankeledere
Oppgangen av syntetisk data og hvorfor det vil supplere snarere enn erstatte ekte data

Elon Musk proklamerte nylig at vi har uttømt den menneskelige dataen som er tilgjengelig for å trene AI-modeller. Hans advarsel er den siste kommentaren om behovet for nye datakilder hvis AI skal fortsette sin raske fremgang. I industrier som helsevesen og finans, gjør strenge personvernsbestemmelser mangelen på data enda mer akutt.
Mens syntetisk data – en mulig løsning på denne mangelen – ikke er ny, fortsetter dens betydning å vokse, som bevist av de nylige fusjonene og investeringene i dette feltet. Det finnes likevel noen dyptgående usikkerheter rundt bruk av syntetisk data, særlig risikoen for modellkollaps, der kvaliteten på en multimodal stor språkmodells (LLM) utgang minsker uten ekte verdensdata å trene på. Om dette problemet viser seg å være uløselig eller løsbart, kan det ha en betydelig innvirkning på fremtiden for generativ AI (Gen AI).
Hva er syntetisk data og hvordan skapes det?
Syntetisk data skapes kunstig snarere enn samles inn fra ekte hendelser. AI-generert syntetisk data er nå den mest utbredte formen, som innebærer å trene modeller på ekte verdensdata for å oppdage mønster og korrelasjoner, og deretter generere ny data som etterligner disse statistiske egenskapene.
LLM-er brukes til å generere en rekke syntetiske datatyper, inkludert strukturert data, som tabelldata, og ustrukturert data, som fritekst, videoer og bilder. En rekke metoder brukes, avhengig av typen data som produseres.
For eksempel er to vanlige metoder som brukes for å generere syntetisk bilde-data GAN-er og diffusjonsmodeller. GAN-er bruker to neurale nettverk: en generator som skaper kunstige versjoner av ekte data, mens en diskriminatorenskaper hvilke som er ekte versus generert. Ved å arbeide sammen kontinuerlig, prøver generatoren å “bedra” diskriminatoren, og forbedrer kontinuerlig realismen og mangfoldet av kunstig data. Diffusjonsmodeller tar en annen tilnærming, og lærer å forstyrre ekte data og deretter reversere denne prosessen for å “rense” den. Når de er godt trent, kan de produsere høykvalitets syntetisk lyd- og bilde-data.
Syntetisk datas voksende betydning
Det har vært langvarig interesse for syntetisk data. Likevel, i løpet av de siste 5 årene, har den raske utviklingen av LLM-er både økt etterspørselen etter syntetisk data og skapt en enda mer effektiv måte å generere det på i stor skala. Som et resultat har bruken av syntetisk data skutt fart.
Gartner forutså at syntetisk data ville utgjøre 60% av all data brukt til å trene LLM-er innen 2024, opp fra bare 1% i 2021. Det finnes alle grunner til å tro at denne estimaten er bredt nøyaktig. For eksempel, Microsofts Phi-4-modell, som overgår andre LLM-er til tross for å være mye mindre, blev suksessfullt trent på hovedsakelig syntetisk data. I mellomtiden utforsker ingeniørene bak Amazons Alexa bruk av en “lærer/elev”-modell hvor “lærer”-modellen genererer syntetisk data som deretter brukes til å finjustere en mindre “elev”-modell.
Dette omfattende adopsjonen speiles i store bevegelser i markedet. Syntetisk data-sektoren så en investeringsboom i 2021-22. Gretel AI og Tonic.ai sikret henholdsvis 50 millioner dollar og 35 millioner dollar i serie B-runder. Disse ble fulgt av MOSTLY AI som lukket en serie B-runde på 25 millioner dollar og Synthesis AI som sikret 17 millioner dollar i serie A-finansiering.
Mer nylig har trenden vært mot store oppkjøp. NVIDIA’s oppkjøp av Gretel i våren vil støtte tech-gigantens eget arbeid i dette feltet. Liksom AI-løsningsselskapet SAS som kjøpte opp syntetisk data-startup Hazy i november 2024.
Analysefirmaet Cognilytica estimerte markedet for syntetisk data-generering i 2021 til å være verdt rundt 110 millioner dollar. Firmaet forventer at det vil nå 1,15 milliarder dollar innen 2027. Andre prognoser forventer en årlig vekst på 31% for sektoren, som vil vokse til 2,33 milliarder dollar i verdi innen 2030.
Modellkollaps
Likevel kommer syntetisk datas spennende potensial med en betydelig nedside: modellkollaps. Dette er et fenomen der LLM-er som er trent utelukkende på syntetisk data begynner å produsere mindre presise eller mindre diverse utganger.
Mens ekte verdensdata tenderer til å være høy i kompleksitet, er syntetisk data ofte forenklet og kondensert av modellene. For eksempel fant forskere at nøyaktigheten av en modell trent til å oppdage kreftsvulster fra fotografier var omvendt relatert til mengden syntetisk treningdata. En nylig studie av akademikere fra Oxford, Cambridge, Imperial College og University of Toronto fant at bruk av modell-generert data uten diskriminering ledet til “uomvendelige feil i den resulterende modellen.”
Enda verre, de fleste LLM-er er “svarte bokser”, noe som gjør det vanskelig å forstå hvordan de vil reagere på syntetisk data. Forskere fra Rice University og Stanford konkluderte at uten noen fersk ekte verdensdata, “vil fremtidige generative modeller være dømt til å ha sin kvalitet (presisjon) eller mangfold (tilbakekall) progressivt redusert.”
Den pågående behovet for ekte verdensdata
Det er tydelig at selv med økningen i etterspørsel etter syntetisk data, forblir behovet for ekte verdensdata. Faktisk kan etterspørselen etter høykvalitets ekte verdensdata øke. Grunnen til dette er todelt. Først og fremst vil ekte verdensdata alltid være nødvendig for å trene AI-modellene som genererer syntetisk data. Og for det andre, for å unngå modellkollaps, er det nødvendig å kontinuerlig synkronisere syntetisk data med ekte verdensdata.
Ekte data for å trene syntetisk data-produserende AI-modeller
Som nevnt tidligere, er de fleste syntetiske data i dag skapt ved hjelp av Gen AI. Og disse Gen AI-modellene må være trenet på ekte verdensdata for å skape brukbar syntetisk data. Det er fordi de kan bare skape syntetisk data ved å replikere mønster og statistiske egenskaper fra en ekte verdensdatamengde.
Vurdér det nylige eksemplet på et forsikringsselskap som kunne bruke syntetisk data til å teste ut forskjellige leverandører uten å kompromittere deres sensitive kundedata. For å generere denne syntetiske datamengden, som nøyaktig etterlignet virkeligheten, måtte de bruke deres egne ekte verdensdata til å trene AI-modellen som deretter genererte syntetisk data.
Ekte data for å mildne modellkollaps
Det finnes flere strategier for å mildne risikoen for modellkollaps. Disse inkluderer å validere og deretter regelmessig gjennomgå syntetiske datamengder, og å sjekke kvaliteten på syntetisk data før det brukes i generative modeller. Likevel, den vanligste tilnærmingen er å diversifisere dataene som brukes ved å kombinere syntetisk data med menneskelig data. Gartners undersøkelse fant at 63% av respondentene foretrakk å bruke en delvis syntetisk datamengde, med bare 13% som sa de brukte fullstendig syntetisk data.
Even små mengder ekte verdensdata kan forbedre en modells ytelse betydelig. Forskere fra University of South California fant at selskaper kan erstatte opptil 90% av deres ekte data med syntetisk data uten å se en betydelig nedgang i ytelse. Likevel, å erstatte den siste 10% av menneskelig data resulterer i en betydelig nedgang.
Kvalitet teller også, som illustrert av Microsofts suksess med Phi-4. Denne LLM ble trent på hovedsakelig syntetisk data generert av GPT-4o. Likevel, mye av fortreningdata – en generell datamengde brukt i den første fasen av trening før en modell er finjustert – var nøye kuratert, høykvalitets ekte verdensdata, inkludert bøker og forskningsartikler.
Potensielle fordeler syntetisk data kan bringe
Når syntetisk data brukes intelligently, og kombineres effektivt med ekte verdensdata, har det potensialet til å løse seks spesifikke problemer når det gjelder AI-treningdata: knapphet, tilgjengelighet, homogenitet, bias, personvernsproblemer og kostnad.
Knapphet
Mens AI-selskaper kapprer om å vinne markedet og oppnå nye førstegangspremiere, øker etterspørselen etter data til å trene deres LLM-er. Syntetisk data har potensialet til å fylle denne gapen, ifølge forskning fra Gartner. Likevel, bør det noteres at bruk av betydelige mengder ekte data i fortreningdatamengder og for å synkronisere for å unngå modellkollaps, vil fortsatt være nødvendig.
Tilgjengelighet
Større tech-selskaper handler som gatevakter når det gjelder data, og skaper en barrier for mindre spillere. Syntetisk data har potensialet til å demokratisere Gen AI ved å gjøre store mengder treningdata tilgjengelige og rimelige. Likevel, vil dette ikke fjerne ansvaret til større tech-selskaper til å forbedre tilgangen til ekte verdensdata, ettersom det fortsatt er nødvendig for å trene syntetisk data-produserende modeller.
Homogenitet
I noen nisjebrukstilfeller, som trening av AI for selvstyrte kjøretøy, er ekte verdensdatamengder for homogene. I tilfelle kjøring, kan utviklere generere syntetisk data for å fylle hull i datamengden for uvanlige situasjoner. Dette muliggjør at modeller kan trene for sjeldne hendelser på veien.
Bias
Noen ekte verdensdatamengder inneholder innebygde bias, så syntetisk data kan genereres for å sikre at AI-modellene mottar en mer balansert bilde. For eksempel, i finans, har UKs Financial Conduct Authority (FCA) argumentert at syntetisk data har potensialet til å motvirke potensielle bias forårsaket av at visse grupper er underrepresentert i menneskelige datamengder.
Personvern
I sektorer som helsevesen og finans, gjør personvernskrav at datamangelen blir enda mer akutt. Med syntetisk data, kan selskaper bygge treningdatamengder for sine modeller som inneholder nisje-data uten å kompromittere kundens personvern. Likevel, som en rapport bestilt av UKs Royal Society har påpekt med henvisning til syntetisk data i medisinsk forskning, er det en antagelse at syntetisk data er “inherently private”. Dette er en “misforståelse”. Som forskerne påpeker, kan syntetisk data lekke informasjon om datamengden det ble avledet fra.
Spesifikt, modeller trenet på sensitive data er sårbare for modell-inversjonsangrep, hvor hackere kan rekonstruere deler av en original datamengde.
Kostnad
Generelt sett, er syntetisk data generert til en lavere kostnad enn ekte verdensdata. Det kommer også merket, noe som sparer tid og kostnader. På noen AI-treningprosjekter, kan opptil 80% av prosjektet brukes på dataforberedelse, inkludert merking. Dette forklarer hvorfor selskaper har oppstått spesifikt for å søke lavkostnadsarbeid for å møte data-behandlingsbehovene til Silicone Valley-giganter.
Supplere snarere enn erstatte ekte data
Disse fordelene med syntetisk data kan utnyttes, forutsatt at det ikke behandles som en erstatning for ekte data. I stedet, bør dens rol være å supplere ekte datamengder, og gi måter å øke mengden datapunkter på.
I sammenheng, er Metas kommende LLM, LLAMA Behemoth, trenet på 30 billioner datapunkter. Det er tydelig at å finne ekte verdensdata i denne skalaen er utfordrende, hvis ikke umulig. Likevel, som det har blitt påpekt, er bruk av ekte verdensdata fortsatt et måtte, enten det er for å trene modellene som produserer syntetisk data, eller for å synkronisere med syntetisk data for å sikre nøyaktighet og unngå modellkollaps. På skalaen LLM-er nå arbeider på, selv om syntetisk data utgjør en betydelig andel av treningdataen, vil det fortsatt være en betydelig etterspørsel etter ekte verdensdata. Og dette betyr at det vil fortsatt være komplekse problemer å løse rundt gatekeeping, tilgang, bias, kostnad og tid.












