Myslitelé
Vzestup syntetických dat a proč budou spíše doplňovat než nahrazovat skutečná data

Elon Musk nedávno prohlásil, že jsme vyčerpali lidská data dostupná pro výcvik modelů umělé inteligence. Jeho varování je posledním komentářem k potřebě nových zdrojů dat, pokud má umělá inteligence pokračovat v rychlém pokroku. V odvětvích, jako je zdravotnictví a finance, přísné předpisy na ochranu soukromí způsobují, že nedostatek dat je ještě více akutní.
Syntetická data – možná řešení tohoto nedostatku – nejsou nová, ale jejich význam pokračuje v růstu, jak je patrné z nedávných vln fúzí a investic v tomto odvětví. Existují však některé hluboké nejistoty kolem používání syntetických dat, zejména riziko kolapsu modelu, kdy se kvalita výstupu multimodálního modelu velkého jazykového modelu (LLM) zhoršuje bez skutečných dat ze světa, na kterých se může učit. Zda se tento problém ukáže jako neřešitelný nebo řešitelný, může mít významný dopad na budoucnost generativní umělé inteligence (Gen AI).
Co jsou syntetická data a jak jsou vytvářena?
Syntetická data jsou umělá, nikoli shromážděná z skutečných událostí. V současné době je nejrozšířenějším typem syntetických dat umělá inteligence, která zahrnuje výcvik modelů na skutečných datech za účelem detekce vzorců a korelací, a poté generování nových dat, která napodobují tyto statistické vlastnosti.
LLM jsou používány k generování různých typů syntetických dat, včetně strukturovaných dat, jako jsou tabulková data, a nestrukturovaných dat, jako jsou volné texty, videa a obrázky. Používá se řada metod, v závislosti na typu generovaných dat.
Například dvě běžné metody používané pro generování syntetických obrazových dat jsou GAN a difúzní modely. GAN používá dvě neuronové sítě: generátor vytváří umělé verze skutečných dat, zatímco diskriminátor rozpoznává, která data jsou skutečná a která jsou generovaná. Pracují-li společně nepřetržitě, generátor se snaží “oklamat” diskriminátor, neustále zlepšuje realističnost a rozmanitost umělých dat. Difúzní modely používají jiný přístup, učí se zkreslovat skutečná data a poté tento proces “odhluchovat”. Jakmile jsou efektivně vyškoleny, mohou produkovat vysokokvalitní syntetická audio a vizuální data.
Růst významu syntetických dat
O syntetických datech existuje dlouhodobý zájem. Nicméně v posledních 5 letech rychlý vývoj LLM nejen zvýšil poptávku po syntetických datech, ale také vytvořil stále účinnější prostředky pro jejich generování ve velkém měřítku. V důsledku toho se používání syntetických dat prudce zvýšilo.
Gartner předpovídal, že syntetická data budou tvořit 60 % všech dat používaných pro výcvik LLM do roku 2024, oproti pouze 1 % v roce 2021. Existuje každý důvod se domnívat, že tato odhad je zhruba přesný. Například model Microsoftu Phi-4, který překonává ostatní LLM, ačkoli je mnohem menší, byl úspěšně vyškolen na převážně syntetických datech. Zatímco inženýři Amazonu Alexa zkoumají použití “učitele/žáka” modelu, kde “učitel” model generuje syntetická data, která jsou poté použita k jemnému naladění menšího “žákovského” modelu.
Tento široký přijetí je zrcadlen velkými pohyby na trhu. Odvětví syntetických dat zažilo investiční boom v letech 2021-22. Gretel AI a Tonic.ai získaly série B ve výši 50 milionů a 35 milionů dolarů. Tyto investice byly následovány MOSTLY AI, která uzavřela série B ve výši 25 milionů dolarů, a Synthesis AI, která získala 17 milionů dolarů v rámci série A.
V nedávné době se trend ubíral k velkým akvizicím. NVIDIA získání Gretel na jaře bude podporovat práci tohoto technologického giganta v tomto odvětví. Podobně společnost SAS získala startup Hazy, který se specializuje na syntetická data, v listopadu 2024.
Analytická firma Cognilytica odhadla, že trh se syntetickými daty měl v roce 2021 hodnotu kolem 110 milionů dolarů. Předpovídá, že do roku 2027 dosáhne hodnoty 1,15 miliardy dolarů. Další předpovědi předpokládají roční tempo růstu 31 % pro toto odvětví, které by mělo dosáhnout hodnoty 2,33 miliardy dolarů do roku 2030.
Kolaps modelu
Syntetická data mají velký potenciál, ale s ním související riziko kolapsu modelu. Jedná se o jev, kdy se LLM, které jsou trénovány pouze na syntetických datech, začínají produkovat méně přesné nebo méně rozmanité výstupy.
Skutečná data ze světa jsou obvykle bohatá na složitost, zatímco syntetická data jsou často zjednodušena a zhuštěna modely. Například výzkumníci zjistili, že přesnost modelu, který byl trénován na detekci rakovinových melanomů na fotografiích, byla nepřímo úměrná množství syntetických trénovacích dat. Nedávná studie akademiků z Oxfordu, Cambridge, Imperial College a University of Toronto zjistila, že používání modelově generovaných dat bez rozdílu vedlo k “nepřípustným defektům v výsledném modelu.”
Ještě horší je, že většina LLM jsou “černé skříňky”, což ztěžuje pochopení, jak budou reagovat na syntetická data. Výzkumníci z Rice University a Stanfordu dospěli k závěru, že bez některých čerstvých skutečných dat ze světa “budou budoucí generativní modely odsouzeny k tomu, aby jejich kvalita (přesnost) nebo rozmanitost (připomenutí) postupem času klesala.”
Potřeba skutečných dat pokračuje
Zjevně, i přes rostoucí poptávku po syntetických datech, zůstává potřeba skutečných dat ze světa. Ve skutečnosti může poptávka po vysokokvalitních skutečných datech ze světa ještě vzrůst. Důvodem je to, že skutečná data ze světa budou vždy potřebná k výcviku modelů umělé inteligence, které generují syntetická data. A za druhé, aby se zabránilo kolapsu modelu, je nutné neustále synchronizovat syntetická data se skutečnými daty ze světa.
Skutečná data pro trénování modelů syntetických dat
Jak bylo zmíněno dříve, většina syntetických dat je dnes vytvářena pomocí Gen AI. A tyto modely Gen AI musí být trénovány na skutečných datech ze světa, aby mohla vytvářet využitelná syntetická data. To je proto, že mohou vytvářet syntetická data pouze napodobováním vzorců a statistických vlastností skutečného datasetu.
Vezměme si nedávný příklad pojišťovny, která použila syntetická data k testování různých dodavatelů bez ohrožení citlivých zákaznických dat. K vytvoření tohoto syntetického datasetu, který přesně napodoboval realitu, musela použít svá vlastní skutečná data ze světa k trénování modelu umělé inteligence, který poté generoval syntetická data.
Skutečná data pro zmírnění kolapsu modelu
Existuje několik strategií pro zmírnění rizika kolapsu modelu. Patří mezi ně ověření a pravidelné přezkoumání syntetických datasetů a kontrola kvality syntetických dat před jejich použitím v generativních modelech. Nicméně nejčastější přístup je diverzifikovat data kombinací syntetických dat s lidskými daty. Průzkum Gartneru zjistil, že 63 % respondentů preferuje použití částečně syntetického datasetu, zatímco pouze 13 % uvedlo, že používají plně syntetická data.
Even přidání malého množství skutečných dat ze světa může výrazně zlepšit výkon modelu. Výzkumníci z University of South California zjistili, že společnosti mohou nahradit až 90 % svých skutečných dat syntetickými daty bez významného poklesu výkonu. Nicméně nahrazení zbývajících 10 % lidských dat vede k významnému poklesu.
Kvalita také hraje roli, jak je ilustrováno případem úspěchu Microsoftu s Phi-4. Tento LLM byl trénován na převážně syntetických datech generovaných GPT-4o. Nicméně většina předtrénovacích dat – obecného datasetu používaného pro první fázi trénování před tím, než je model jemně nalazen – byla pečlivě kurátorovaná, vysokokvalitní skutečná data ze světa, včetně knih a výzkumných prací.
Potenciální výhody syntetických dat
Když jsou syntetická data používána inteligentně a kombinována efektivně se skutečnými daty ze světa, mají potenciál vyřešit šest specifických problémů při trénování modelů umělé inteligence: nedostatek dat, přístupnost, homogenitu, zkreslení, problémy s ochranou soukromí a náklady.
Nedostatek dat
Společnosti umělé inteligence se závodí, aby získaly podíl na trhu a dosáhly nových úspěchů, a poptávka po datech pro trénování jejich LLM roste. Syntetická data mají potenciál zaplnit tuto mezeru, alespoň podle výzkumu Gartneru. Nicméně je třeba poznamenat, že použití významného množství skutečných dat v předtrénovacích datasetech a pro synchronizaci, aby se zabránilo kolapsu modelu, bude stále potřeba.
Přístupnost
Velké technologické společnosti stále více jednají jako správci dat, vytvářejí bariéru pro menší hráče. Syntetická data mají potenciál demokratizovat Gen AI tím, že činí velké objemy trénovacích dat dostupnými a přístupnými. Nicméně to nezruší odpovědnost velkých technologických firem za zlepšení přístupu ke skutečným datům ze světa, protože jsou stále potřebná pro trénování modelů, které vytvářejí syntetická data.
Homogenita
V některých specifických případech, jako je trénování umělých inteligencí pro autonomní řízení, jsou skutečná data ze světa příliš homogenní. V případě řízení mohou vývojáři generovat syntetická data k vyplnění mezer v datech pro neobvyklé situace. To umožňuje modelům trénovat se na vzácné události na silnici.
Zkreslení
Některá skutečná data ze světa obsahují vrozená zkreslení, takže syntetická data mohou být generována tak, aby zajistila, že modely umělé inteligence obdrží vyváženější obraz. Například ve finančním sektoru britský regulační orgán pro finanční conduct (FCA) argumentoval, že syntetická data mají potenciál kompenzovat potenciální zkreslení způsobená tím, že certain skupiny jsou podreprzentovány v lidských datech.
Ochrana soukromí
V odvětvích, jako je zdravotnictví a finance, požadavky na ochranu soukromí způsobují, že nedostatek dat je ještě více akutní. Syntetická data umožňují společnostem vytvářet trénovací datasety pro své modely, které obsahují specifická data, aniž by ohrozily soukromí zákazníků. Nicméně, jak zpráva vypracovaná pro britskou Královskou společnost poukázala s odkazem na syntetická data ve výzkumu, existuje předpoklad, že syntetická data jsou “přirozeně soukromá”. To je “omyly”. Jak výzkumníci poukazují, syntetická data mohou prozrazovat informace o datech, ze kterých byla odvozena.
Konkrétně modely trénované na citlivých datech jsou zranitelné vůči útokům na model, kde hackeři jsou schopni rekonstruovat části původního datasetu.
Náklady
Obecně platí, že syntetická data jsou generována za nižších nákladů než skutečná data ze světa. Kromě toho jsou již označena, což šetří čas a náklady. V některých projektech umělé inteligence může až 80 % projektu zabírat příprava dat, včetně označování. To vysvětluje, proč specializované společnosti vznikly pro získávání low-cost pracovních sil pro splnění požadavků na zpracování dat pro giganty ze Silicon Valley.
Doplňování skutečných dat spíše než jejich nahrazování
Tyto výhody syntetických dat lze využít, pokud nejsou považována za náhradu skutečných dat. Místo toho by jejich role měla spočívat v doplňování skutečných datasetů, poskytování způsobů, jak zvýšit počet dostupných datových bodů.
Pro kontext, nadcházející LLM Meta, LLAMA Behemoth, bude trénován na 30 bilionech datových bodů. Zjevně, nalezení skutečných dat v tomto měřítku je obtížné, ne-li nemožné. Nicméně, jak bylo poznamenáno, použití skutečných dat ze světa je stále nezbytné, ať už pro trénování modelů, které vytvářejí syntetická data, nebo pro synchronizaci se syntetickými daty, aby se zajistila přesnost a zabránil kolaps modelu. Na úrovni, na které LLM nyní pracují, i když syntetická data tvoří významnou část trénovacích dat, bude stále existovat podstatná poptávka po skutečných datech ze světa. A to znamená, že budou přetrvávat komplexní problémy, které je třeba vyřešit kolem správy, přístupu, zkreslení, nákladů a času.












