Tankeledare

Uppgången av syntetisk data och varför den kommer att komplettera snarare än ersätta riktig data

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Elon Musk proklamerade nyligen att vi har uttömt den mänskliga datan som finns tillgänglig för att träna AI-modeller. Hans varning är den senaste kommentaren om behovet av nya datakällor om AI ska fortsätta sin snabba utveckling. I branscher som hälsovård och finans är stränga sekretessregler och gör bristen på data ännu mer akut.

Medan syntetisk data – en möjlig lösning på denna brist – inte är ny, fortsätter dess betydelse att växa, som visas av de nyliga sammanslagningarna och investeringarna i detta område. Det finns dock vissa djupa osäkerheter kring användningen av syntetisk data, särskilt risken för modellkollaps, där kvaliteten på en multimodal stor språkmodells (LLM) utdata försämras utan riktiga världens data för att träna på. Om detta problem visar sig vara olösligt eller lösbart kan det ha en betydande inverkan på framtiden för generativ AI (Gen AI).

Vad är syntetisk data och hur skapas den?

Syntetisk data skapas artificiellt snarare än samlas in från riktiga händelser. AI-genererad syntetisk data är nu den mest utbredda formen, som innebär att modeller tränas på riktiga världens data för att upptäcka mönster och korrelationer, och sedan generera ny data som imiterar dessa statistiska egenskaper.

LLM-modeller används för att generera en mängd olika typer av syntetisk data, inklusive strukturerad data, såsom tabelldata, och ostrukturerad data, som fritext, videor och bilder. En mängd metoder används, beroende på den typ av data som produceras.

Till exempel är två vanliga metoder som används för att generera syntetisk bilddata GANs och diffusionsmodeller. GANs använder två neurala nätverk: en generator skapar artificiella versioner av riktiga data, medan en diskriminatör identifierar vilka som är riktiga och vilka som är genererade. Genom att arbeta tillsammans kontinuerligt försöker generatoren “lura” diskriminatören, och förbättrar kontinuerligt realismen och mångfalden av artificiell data. Diffusionsmodeller tar en annan approach, och lär sig att förvränga riktiga data och sedan omvända denna process för att “avlägsna brus” från den. När de tränas effektivt kan de producera högkvalitativ syntetisk ljud- och videodata.

Syntetisk datas växande betydelse

Det har funnits ett långvarigt intresse för syntetisk data. Men under de senaste 5 åren har den snabba utvecklingen av LLM-modeller både ökat efterfrågan på syntetisk data och skapat ett allt mer effektivt sätt att generera den i stor skala. Som ett resultat har användningen av syntetisk data skjutit i höjden.

Gartner förutspår att syntetisk data kommer att utgöra 60% av all data som används för att träna LLM-modeller till 2024, upp från bara 1% 2021. Det finns alla skäl att tro att denna uppskattning är i stort sett korrekt. Till exempel var Microsofts Phi-4-modell, som presterar bättre än andra LLM-modeller trots att den är mycket mindre, framgångsrikt tränad på mestadels syntetisk data. Samtidigt undersöker ingenjörerna bakom Amazons Alexa användningen av en “lärare/elev”-modell där “lärar”-modellen genererar syntetisk data som sedan används för att finjustera en mindre “elev”-modell.

Denna breda tillämpning återspeglas av stora drag i marknaden. Den syntetiska data-sektorn såg en investeringsboom 2021-22. Gretel AI och Tonic.ai säkrade serie B-rundor på 50 miljoner dollar respektive 35 miljoner dollar. Dessa följdes av MOSTLY AI som stängde en serie B-runda på 25 miljoner dollar och Synthesis AI som säkrade 17 miljoner dollar i serie A-finansiering.

Mer nyligen har trenden varit mot storskaliga förvärv. NVIDIAs förvärv av Gretel i våras kommer att stödja tech-jättens eget arbete inom detta område. Likaså förvärvade AI-lösningssystemet SAS den syntetiska data-startupen Hazy i november 2024.

Analytisk firman Cognilytica uppskattade marknaden för syntetisk data-generering 2021 till cirka 110 miljoner dollar. Företaget förväntar sig att den kommer att nå 1,15 miljarder dollar till 2027. Andra prognoser förutspår en årlig tillväxttakt på 31% för sektorn, när den växer till 2,33 miljarder dollar i värde till 2030.

Modellkollaps

Men den spännande potentialen för syntetisk data kommer med en betydande nackdel: modellkollaps. Detta är ett fenomen där LLM-modeller som tränas enbart på syntetisk data börjar producera mindre exakta eller mindre varierade utdata.

Medan riktiga världens data tenderar att vara hög i komplexitet, är syntetisk data ofta förenklad och kondenserad av modeller. Till exempel fann forskare att precisionen hos en modell som tränats för att upptäcka cancerogena födelsemärken från fotografier var invers relaterad till mängden syntetisk träningsdata. En nylig studie av akademiker från Oxford, Cambridge, Imperial College och University of Toronto fann att användningen av modellgenererad data utan diskriminering ledde till “oreparerbara defekter i den resulterande modellen.”

Ännu värre är de flesta LLM-modeller “svarta lådor”, vilket gör det svårt att förstå hur de kommer att svara på syntetisk data. Forskare från Rice University och Stanford drog slutsatsen att utan någon färsk riktiga världens data “är framtida generativa modeller dömda att ha sin kvalitet (precision) eller mångfald (återkallande) progressivt minska.”

Det pågående behovet av riktiga världens data

Tydligtvis, även med den ökande efterfrågan på syntetisk data, kvarstår behovet av riktiga världens data. I själva verket kan efterfrågan på högkvalitativ riktiga världens data till och med öka. Anledningen till detta är tvåfaldig. Först kommer riktiga världens data alltid att behövas för att träna AI-modellerna som genererar syntetisk data. Och för det andra är det nödvändigt att kontinuerligt synkronisera syntetisk data med riktiga världens data för att undvika modellkollaps.

Riktiga data för att träna syntetisk-data producerande AI-modeller

Som nämnts tidigare skapas den stora majoriteten av syntetisk data idag med hjälp av Gen AI. Och dessa Gen AI-modeller måste tränas på riktiga världens data för att skapa användbar syntetisk data. Det beror på att de bara kan skapa syntetisk data genom att replikera mönster och statistiska egenskaper hos en riktig världens datamängd.

Tänk på det nyliga exemplet med ett försäkringsbolag som kunde använda syntetisk data för att testa olika leverantörer utan att kompromissa med sin känsliga kunddata. För att generera denna syntetiska datamängd, som exakt imiterade verkligheten, var det nödvändigt att använda sin egen riktiga världens data för att träna AI-modellen som sedan genererade den syntetiska datan.

Riktiga data för att mildra modellkollaps

Det finns flera strategier för att mildra risken för modellkollaps. Dessa inkluderar att validera och sedan regelbundet granska syntetiska datamängder, och kontrollera kvaliteten på syntetisk data innan den används i generativa modeller. Men den vanligaste metoden är att diversifiera datan som används genom att kombinera syntetisk data med mänsklig data. Gartners undersökning fann att 63% av respondenterna föredrar att använda en delvis syntetisk datamängd, medan bara 13% säger att de använder fullständigt syntetisk data.

Även om man lägger till måttliga mängder riktiga världens data kan det förbättra en modells prestanda avsevärt. Forskare från University of South California fann att företag kan ersätta upp till 90% av sin riktiga data med syntetisk data utan att se en betydande nedgång i prestanda. Men att ersätta de sista 10% av mänsklig data resulterar i en betydande nedgång.

Kvalitet räknas också, som illustreras av fallet med Microsofts framgång med Phi-4. Denna LLM tränades på övervägande syntetisk data genererad av GPT-4o. Men en stor del av förträningsdatat – en allmän datamängd som används för den första fasen av träningsfasen innan en modell finjusteras – var noggrant utvald, högkvalitativ riktig världens data, inklusive böcker och forskningsartiklar.

Potentiella fördelar som syntetisk data kan medföra

När syntetisk data används på ett intelligent sätt och kombineras effektivt med riktiga världens data, har den potentialen att lösa sex specifika problem när det gäller AI-träningsdata: brist, tillgänglighet, homogenitet, bias, sekretessproblem och kostnad.

Data brist

När AI-företag tävlar om att vinna marknadsandelar och uppnå nya rekord, ökar den outsinliga efterfrågan på data för att träna deras LLM-modeller. Syntetisk data har potentialen att fylla denna lucka, enligt Gartners forskning. Men det bör noteras att användning av betydande mängder riktiga data i förträningsdatamängder och för att synkronisera för att undvika modellkollaps fortfarande kommer att behövas.

Data tillgänglighet

Alltmer agerar stora tech-företag som gatekeepers när det gäller data, vilket skapar en barriär för mindre aktörer. Syntetisk data har potentialen att demokratisera Gen AI genom att göra stora mängder träningsdata tillgängliga och överkomliga. Men detta kommer inte att ta bort ansvaret för stora tech-företag att förbättra tillgången till riktiga världens data, eftersom det fortfarande behövs för att träna syntetisk-data skapande modeller.

Data homogenitet

I vissa nischfall, som tränings-AI för självkörande fordon, är riktiga världens datamängder för homogena. I fallet med körning kan utvecklare generera syntetisk data för att fylla luckor i datamängden för ovanliga situationer. Detta möjliggör sedan för modeller att träna för sällsynta händelser på vägen.

Bias

Vissa riktiga världens datamängder innehåller inbyggda bias, så syntetisk data kan genereras för att säkerställa att AI-modeller får en mer balanserad bild. Till exempel har Storbritanniens finansiella tillsynsmyndighet (FCA) hävdat att syntetisk data har potentialen att motverka potentiella bias orsakade av att vissa grupper är underrepresenterade i mänskliga datamängder.

Sekretess

I sektorer som hälsovård och finans är sekretesskraven och gör databrister ännu mer akuta. Med syntetisk data kan företag bygga träningsdatamängder för sina modeller som innehåller nischdata utan att kompromissa med kundsekretessen. Men som en rapport som beställts av Storbritanniens Royal Society har påpekat med hänvisning till syntetisk data i medicinsk forskning, finns det ett antagande att syntetisk data är “inbyggt privat”. Detta är en “missuppfattning”. Som forskarna påpekar kan syntetisk data läcka information om den data den härrör från.

Specifikt är modeller som tränats på känslig data sårbara för modellinversionsattacker, där hackare kan rekonstruera delar av den ursprungliga datamängden.

Kostnad

Generellt sett genereras syntetisk data till en lägre kostnad än riktiga världens data. Den kommer också märkt, vilket sparar tid och kostnader. I vissa AI-träningsprojekt tar upp till 80% av projektet upp med datavorberedning, inklusive märkning. Detta förklarar varför särskilda företag har dykt upp specifikt för att tillhandahålla lågkostnadsarbete för att möta datahanteringsbehoven hos Silicone Valley-jättar.

Komplettera snarare än ersätta riktiga data

Dessa fördelar med syntetisk data kan utnyttjas, under förutsättning att den inte behandlas som en ersättning för riktiga data. Istället bör dess roll vara att komplettera riktiga datamängder, och ge möjligheter att öka antalet datapunkter som är tillgängliga.

För kontext är Metas kommande LLM, LLAMA Behemoth, tränad på 30 biljoner datapunkter. Tydligtvis är det en utmaning att hitta riktiga världens data i denna skala, om inte omöjligt. Men som har noterats, användning av riktiga världens data är fortfarande ett måste, antingen för att träna modellerna som producerar syntetisk data eller för att synkronisera med syntetisk data för att säkerställa noggrannhet och undvika modellkollaps. På den skala som LLM-modeller arbetar med idag, även om syntetisk data utgör en betydande andel av den träningsdata som används, kommer det fortfarande att finnas en betydande efterfrågan på riktiga världens data. Och detta innebär att det kommer att finnas kvar komplexa frågor att lösa kring gatekeeping, tillgång, bias, kostnad och tid.

Under de senaste 13 åren har Gediminas Rickevicius varit en drivande kraft för tillväxt inom marknadsledande IT-, annons- och logistikföretag runt om i världen. Han har förändrat den traditionella ansatsen för affärsutveckling och försäljning genom att integrera stora mängder data i strategiska beslutsprocesser. Som Senior Vice President för Globala Partnerskap på Oxylabs fortsätter Gediminas sin mission att ge företag möjlighet att använda sig av avancerade lösningar för insamling av webbdata.