Ajatusjohtajat
Synteettisen datan nousu ja miksi se täydentää olemassa olevaa dataa sen sijaan, että korvaa sen

Elon Musk ilmoitti hiljattain, että olemme käyttäneet loppuun ihmisten keräämän datan, jota voidaan käyttää tekoälymallien kouluttamiseen. Hänen varoituksensa on viimeisin kommentti uusien datalähteiden tarpeesta, jotta tekoäly voisi jatkaa nopeaa kehitystään. Terveydenhuolto- ja rahoitusaloilla tiukat tietosuojasäännökset tekevät datan niukkuuden entistä akuutimmaksi.
Vaikka synteettinen data – mahdollinen ratkaisu tähän niukkuuteen – ei ole uusi asia, sen merkitys jatkaa kasvamistaan, kuten todistavat viimeaikaiset fuusiot ja sijoitukset tässä alalla. On kuitenkin joitakin syvällisiä epävarmuuksia synteettisen datan käytön ympärillä, erityisesti riski mallin romahdukseen, jossa monimodaalisen suuren kielen mallin (LLM) tulosteen laatu heikkenee ilman aitoa maailman dataa koulutukseen. Tämän ongelman ratkeaminen tai ratkeamattomuus voi vaikuttaa merkittävästi generatiivisen tekoälyn (Gen AI) tulevaisuuteen.
Mikä on synteettinen data ja miten sitä luodaan?
Synteettinen data on keinotekoisesti luotua eikä kerättyä oikeista tapahtumista. Nykyään yleisin synteettisen datan muoto on tekoälyllä luotu, jossa malleja koulutetaan oikeaan maailman dataan havainnoimaan kuvioita ja korrelaatioita, ja sitten luomaan uutta dataa, joka jäljittelee näitä tilastollisia ominaisuuksia.
LLM-malleja käytetään luomaan erilaisia synteettisiä datatyyppejä, kuten rakenteista dataa, kuten taulukkoja, ja rakenteettomia tietoja, kuten vapaata tekstiä, videoita ja kuvia. Erilaisia menetelmiä käytetään riippuen datan tyypistä, jota tuotetaan.
Esimerkiksi kaksi yleisintä menetelmää synteettisten kuvadatan tuottamiseen ovat GANit ja diffuusiomallit. GANit käyttävät kahta neuroverkkoa: generoivaa verkkoa, joka luo keinotekoisia versioita aidoista tiedoista, ja diskriminoivaa verkkoa, joka tunnistaa, mitkä ovat aitoja ja mitkä luotuja. Toimien jatkuvasti yhdessä, generoiva verkko yrittää “pettää” diskriminoivaa verkkoa, jatkuvasti parantaen keinotekoisen datan realismin ja monipuolisuuden. Diffuusiomallit käyttävät toisenlaista lähestymistapaa, jossa ne oppivat vääristämään aitoa dataa ja sitten kääntämään tämän prosessin “denoiseen”. Kun ne on koulutettu tehokkaasti, ne voivat tuottaa laadukasta synteettistä ääni- ja kuvadataa.
Synteettisen datan kasvava merkitys
On ollut pitkään olemassa kiinnostusta synteettistä dataa kohtaan. Viimeisten 5 vuoden aikana nopea LLM-mallien kehitys on kuitenkin lisännyt synteettisen datan kysyntää ja luonut entistä tehokkaamman tavan sen tuottamiseen suuressa mittakaavassa. Tämän seurauksena synteettisen datan käyttö on räjähdysmäisesti kasvanut.
Gartner ennusti, että synteettinen data muodostaisi 60% kaikista LLM-malleja koulutettaessa käytettävistä tiedoista vuoteen 2024 mennessä, oltuaan vain 1% vuonna 2021. On jokainen syy uskoa, että tämä arvio on suurin piirtein oikein. Esimerkiksi Microsoftin Phi-4-malli, joka suorittaa muita LLM-malleja paremmin, vaikka on paljon pienempi, koulutettiin onnistuneesti pääasiassa synteettisellä datalla. Samaan aikaan Amazonin Alexan insinöörit tutkivat “opettaja/opetuslapsi”-mallin käyttöä, jossa “opettaja”-malli luo synteettistä dataa, jota sitten käytetään pienemmän “opetuslapsi”-mallin hienosäätöön.
Tämä laaja käyttöönotto heijastuu myös markkinoiden suurilla liikkeillä. Synteettisen datan alalla nähtiin sijoitusbuumi vuosina 2021-22. Gretel AI ja Tonic.ai saivat 50 miljoonan ja 35 miljoonan dollarin Series B -rahoitukset. Nämä seurasivat MOSTLY AI:n 25 miljoonan dollarin Series B -rahoitusta ja Synthesis AI:n 17 miljoonan dollarin Series A -rahoitusta.
Viimeaikaisemmin trendi on ollut suurten yritysostojen suuntaan. NVIDIAN Gretel-yritysosto keväällä tulee tukemaan teknologiayhtiön omaa työtä tässä alalla. Samoin tekoälyratkaisuihin erikoistunut yritys SAS osti synteettisen datan startup-yritys Hazy:n marraskuussa 2024.
Analytiikkayritys Cognilytica arvioi synteettisen datan tuottamisen markkinan olleen noin 110 miljoonan dollarin arvoinen vuonna 2021. Yritys odottaa sen saavuttavan 1,15 miljardia dollaria vuoteen 2027 mennessä. Muiden ennusteiden mukaan alan kasvuvauhti on 31%, ja se kasvaa 2,33 miljardiin dollariin vuoteen 2030 mennessä.
Mallin romahdus
Synteettisen datan mielenkiintoinen potentiaali tulee kuitenkin merkittävän haitan kera: mallin romahdus. Tämä ilmiö tarkoittaa, että LLM-mallit, jotka on koulutettu ainoastaan synteettisellä datalla, alkavat tuottaa vähemmän tarkkoja tai vähemmän monipuolisia tuloksia.
Vaikka aito maailman data on yleensä monimutkaisuudessaan korkeaa, synteettinen data on usein yksinkertaistettua ja tiivistettyä malleilla. Esimerkiksi tutkijat totesivat, että mallin, joka oli koulutettu havaitsemaan syöpäisiä nieluja valokuvista, tarkin havainto oli kääntäen suhteessa synteettisen koulutusdatan määrään. Oxfordin, Cambridgen, Imperial Collegen ja Toronton yliopiston akateemikoiden tekemä tutkimus osoitti, että mallin tuottaman datan käyttäminen ilman tarkastelua johti “pysyviin vikoihin tulokseksi saatuun malliin”.
Entistä pahempaa on, että useimmat LLM-mallit ovat “mustia laatikoita”, mikä tekee vaikeaksi ymmärtää, miten ne reagoivat synteettiseen dataan. Rice Universityn ja Stanfordin tutkijat totesivat, että ilman jonkin verran aitoa maailman dataa “tulevaisuuden generatiiviset mallit ovat tuomittuja olemaan heikompia (tarkin) tai vähemmän monipuolisia (muistin)”.
Jatkuva tarve aitoon maailman dataan
Ilmeisesti, vaikka synteettinen data on kasvamassa suosiotaan, aitoon maailman dataan liittyvä tarve jatkuu. Itse asiassa korkealaatuisen aitoon maailman datan kysyntä saattaa jopa kasvaa. Tämän syynä on kaksinkertainen. Ensinnäkin aito maailman data on aina tarpeen kouluttaa tekoälymallit, jotka luovat synteettistä dataa. Toiseksi, jotta voidaan välttää mallin romahdus, on tarpeen jatkuvasti synkronoida synteettistä dataa aitoon maailman dataan.
Aito data synteettisen datan tuottavien tekoälymallien koulutukseen
Kuten aiemmin mainittiin, suurin osa synteettisestä datasta luodaan tällä hetkellä Gen AI:lla. Nämä Gen AI -mallit on koulutettava aitoon maailman dataan, jotta voidaan luoda käyttökelpoista synteettistä dataa. Tämä johtuu siitä, että ne voivat luoda synteettistä dataa vain jäljittelemällä aitojen datojen kuvioita ja tilastollisia ominaisuuksia.
Tarkastellaan esimerkiksi vakuutusyhtiötä, joka pystyi käyttämään synteettistä dataa testaamaan eri toimittajia ilman, että se olisi vaarantanut omia arkaluontoisia asiakastietojaan. Jotta voidaan luoda tämä synteettinen datan joukko, joka toistaa todellisuutta, yhtiön on käytettävä omia aitoja tietojaan kouluttaakseen tekoälymallin, joka luo synteettisen datan.
Aito data mallin romahduksen estämiseksi
On useita strategioita mallin romahduksen estämiseksi. Niihin kuuluvat synteettisten datan joukkojen validointi ja säännöllinen tarkastelu, sekä synteettisen datan laadun tarkastelu ennen kuin sitä käytetään generatiivisissa malleissa. Kuitenkin yleisin lähestymistapa on diversifioida käytettävää dataa yhdistämällä synteettistä dataa ihmisten datan kanssa. Gartnerin tutkimus osoitti, että 63% vastaajista suosittaa osittain synteettisen datan käyttöä, kun taas vain 13% ilmoitti käyttävänsä täysin synteettistä dataa.
Jo pienet määrät aitoa maailman dataa voivat parantaa merkittävästi mallin suorituskykyä. Etelä-Carolinan yliopiston tutkijat totesivat, että yritykset voivat korvata jopa 90% aitoista datastaan synteettisellä datalla ilman, että heidän suorituskykynsä heikkenee merkittävästi. Korvaamalla viimeinen 10% ihmisten dataa johtaa kuitenkin suureen laskuun.
Laatu on myös tärkeää, kuten Microsoftin Phi-4:n menestys osoittaa. Tämä LLM koulutettiin pääasiassa synteettisellä datalla, jota generoi GPT-4o. Suurin osa pre-koulutusdataa – yleinen datan joukko, jota käytetään koulutuksen ensimmäisessä vaiheessa ennen mallin hienosäätöä – oli kuitenkin huolellisesti valittua, korkealaatuista aitoa maailman dataa, kuten kirjoja ja tutkimusartikkeleita.
Synteettisen datan potentiaaliset hyödyt
Kun synteettistä dataa käytetään älykkäästi ja yhdistetään tehokkaasti aitoon maailman dataan, se voi ratkaista kuusi tiettyä ongelmaa tekoälykoulutusdatan suhteen: niukkuus, saatavuus, homogeenisuus, harha, tietosuojan ongelmat ja kustannukset.
Dataniukkuus
Kun tekoälyyritykset kilpailevat markkinaosuuksista ja uusista saavutuksista, tekoälymallien koulutukseen tarvittavan datan vaatimukset kasvavat. Synteettinen data voi täyttää tämän aukon, kuten Gartnerin tutkimus osoittaa. On kuitenkin huomattava, että merkittävän määrän aitoa dataa on edelleen käytettävä pre-koulutusdatan joukoissa ja sen kanssa synkronoimiseksi mallin romahduksen estämiseksi.
Datansaatavuus
Yhä useammin suuret teknologiayritykset toimivat datan portinvartijoina, luoden esteen pienenemmille toimijoille. Synteettinen data voi demokratisoida Gen AI:ta tehden suuria määriä koulutusdataa edullisiksi ja saataviksi. Kuitenkaan tämä ei poista suurten teknologiayritysten vastuuta parantaa aitoon maailman datan saatavuutta, koska sitä edelleen tarvitaan synteettisen datan tuottamiseen.
Datanhomogeenisuus
Joidenkin erikoistapauksissa, kuten tekoälyjen kouluttamisessa itseohjautuvaa ajoa varten, aitojen datan joukot ovat liian homogeenisia. Ajotilanteissa kehittäjät voivat luoda synteettistä dataa täyttämään aukkoja datassa epätavallisissa tilanteissa. Tämä mahdollistaa mallien kouluttamisen harvinaisille tilanteille tiellä.
Harha
Jotkut aitojen datan joukot sisältävät sisäänrakennettuja harhoja, joten synteettistä dataa voidaan luoda varmistamaan, että tekoälymallit saavat tasapuolisen kuvan. Esimerkiksi rahoitusaloilla UK:n Finanssivalvonta (FCA) on väittänyt, että synteettinen data voi vastata potentiaalisiin harhoihin, joita aiheuttavat tietyt ryhmät, jotka ovat aliedustettuina aitojen datan joukoissa.
Tietosuojan ongelmat
Terveydenhuolto- ja rahoitusaloilla tietosuojan vaatimukset tekevät datan niukkuudesta entistä akuutimmaksi. Synteettisellä datalla yritykset voivat luoda koulutusdatan malleilleen, jotka sisältävät niukkoja tietoja ilman, että se vaarantaa asiakkaiden yksityisyyttä. Kuitenkaan, kuten UK:n Royal Societyn tilaama raportti on korostanut lääketieteellisen tutkimuksen osalta, on oletus, että synteettinen data on “luonnostaan yksityinen”. Tämä on “väärinkäsitys”. Tutkijat huomauttavat, että synteettinen data voi vuotaa tietoja siitä datasta, josta se on johdettu.
Nimenomaan malleja, jotka on koulutettu herkistä tiedoista, on altis mallin kääntämishyökkäyksille, joissa hakkerit voivat rekonstruoida alkuperäisen datan osia.
Kustannukset
Yleensä synteettinen data on edullisempaa kuin aito maailman data. Se tulee myös merkittyinä, mikä säästää aikaa ja kustannuksia. Joidenkin tekoälyprojektien kohdalla jopa 80% projektiin kuluu datan valmisteluun, mukaan lukien merkintä. Tämä selittää, miksi erikoistuneita yrityksiä on perustettu erityisesti hankkimaan edullista työvoimaa tyytyäväisyyden takaamiseksi Silicon Valley -jättiläisten datankäsittelytarpeisiin.
Synteettisen datan täydentäminen aitoa dataa
Synteettisen datan edut voidaan hyödyntää, jos sitä ei käytetä aitojen datan korvikkeena. Sen sijaan sen roolina on olla aitojen datan täydentäjä, tarjoamalla keinoja datapistekohtien määrän lisäämiseksi.
Esimerkiksi Metan tuleva LLM, LLAMA Behemoth, koulutetaan 30 biljoonalla datapistekohtaa. Selvästi, aitojen datan löytäminen tässä mittakaavassa on haasteellista, ellei mahdotonta. Kuitenkaan, kuten on huomautettu, aitojen datan käyttäminen on edelleen välttämätöntä, joko kouluttaakseen malleja, jotka tuottavat synteettistä dataa, tai synkronoimalla synteettistä dataa aitojen datan kanssa varmistaakseen tarkin ja välttääkseen mallin romahduksen. Tekoälymallien mittakaavassa, jossa ne toimivat nykyään, vaikka synteettinen data muodostaa merkittävän osan käytettävistä koulutusdatista, on edelleen suuri kysyntä aitoja maailman dataa. Tämä tarkoittaa, että on edelleen monimutkaisia ongelmia, jotka on ratkaistava datan porttienhallinnasta, pääsystä, harhasta, kustannuksista ja ajasta.












