Modely a platformy AI
Jak syntetická data ovlivňují halucinace AI?
Syntetická data jsou mocným nástrojem, ale mohou snížit halucinace umělé inteligence pouze za určitých okolností. V téměř všech ostatních případech je budou zesílit. Proč je to tak? Co to znamená pro ty, kteří do nich investovali?
Jak se syntetická data liší od skutečných dat?
Syntetická data jsou informace generované umělou inteligencí. Namísto sběru z reálných událostí nebo pozorování jsou vytvářeny uměle. Avšak připomínají originál dostatečně, aby produkovaly přesné a relevantní výstupy.
Pro vytvoření umělé datové sady se inženýři umělé inteligence učí generativnímu algoritmu na reálné relační databázi. Když jsou požádáni, produkují druhou sadu, která se blízce podobá první, ale neobsahuje žádné skutečné informace.
Uměle vytvořená datová sada jde za hranice deidentifikace, replikuje základní logiku vztahů mezi poli namísto toho, aby pouze nahradila pole ekvivalentními alternativami. Protože neobsahuje žádné identifikační údaje, společnosti je mohou použít k obejití předpisů o ochraně osobních údajů a autorských právech.
Syntetická data se však častěji používají k doplnění. Společnosti je mohou použít k obohacení nebo rozšíření vzorků, které jsou příliš malé, aby je mohli účinně využít k trénování systémů umělé inteligence.
Zmenšují syntetická data halucinace AI?
Algoritmy někdy odkazují na neexistující události nebo činí logicky nemožné návrhy. Tyto halucinace jsou často nesmyslné, zavádějící nebo nesprávné.
Pokud jsou umělá data vhodně kurátorována, mohou tyto incidenty zmírnit. Relevantní a autentická trénovací databáze je základem pro jakýkoli model, takže je logické, že čím více detailů někdo má, tím přesnější bude výstup modelu.
Debiasing je další způsob, jakým může syntetická datová sada zmírnit halucinace AI. Podle MIT Sloan School of Management to může pomoci řešit předpojatost, protože není omezeno původní velikostí vzorku.
Jak umělá data zhoršují halucinace
Protože inteligentní algoritmy nemohou rozumět nebo kontextualizovat informace, jsou náchylné k halucinacím. Generativní modely — zejména velké jazykové modely — jsou zvláště zranitelné.
Zesílení předpojatosti
Umělá inteligence může, stejně jako lidé, naučit se a reprodukovat předpojatosti. Pokud umělá datová sada převeličuje některé skupiny, zatímco jiné podreprzentuje — což je znepokojivě snadné udělat náhodou — logika jejího rozhodování bude zkreslena, což negativně ovlivní přesnost výstupu.
Podobný problém může nastat, když společnosti používají umělá data k odstranění skutečných předpojatostí, protože již nemusí odrážet realitu.
Intersekční halucinace
Intersekční teorie je sociologický rámec, který popisuje, jak demografické údaje, jako je věk, pohlaví, rasa, zaměstnání a třída, se protínají.
Když je generativní model požádán o vytvoření umělých detailů na základě toho, na čem se učil, může vygenerovat kombinace, které neexistovaly v originálu, nebo jsou logicky nemožné.
Ericka Johnson, profesorka genderu a společnosti na Linköping University, pracovala s vědcem z oboru strojového učení, aby demonstrovala tento jev.
Okamžitě si všimli závažného problému. Umělá verze měla kategorie s názvy „manželka a svobodná“ a „nikdy nevdaní manželé“, obě z nich byly intersekčními halucinacemi.
Bez řádné kurátorizace bude replika databáze vždy převeličovat dominantní subpopulace v datech, zatímco podreprzentuje — nebo dokonce vyloučí — podreprzentované skupiny.
Kolaps modelu
Nadměrná závislost na umělých vzorcích a trendech vede ke kolapsu modelu — kde výkon algoritmu dramaticky klesá, protože se stává méně adaptabilním na reálné pozorování a události.
Tento jev je zvláště patrný v next-generation generativních modelech umělé inteligence. Opakované používání umělé verze pro jejich trénink vede k sebekonzumujícímu cyklu.
Přepřáhnutí
Přepřáhnutí je nadměrná závislost na trénovacích datech. Algoritmus se zpočátku dobře vykoná, ale bude halucinovat, když mu budou předloženy nové datové body.
Důsledky pokračujícího používání syntetických dat
Trh s umělými daty roste. Společnosti v tomto oboru vybraly kolem 328 milionů dolarů v roce 2022, oproti 53 milionům dolarů v roce 2020 — což je nárůst o 518 % za pouhých 18 měsíců.
Pokud firmy budou pokračovat v používání umělých dat bez řádné kurátorizace a debiasingu, výkon jejich modelů bude postupně klesat, což zkazí jejich investice do umělé inteligence.
Riešení nebude spočívat v návratu k skutečným datům
Systémy umělé inteligence potřebují miliony, ne-li miliardy, obrázků, textů a videí pro trénink, z nichž většina je získávána ze veřejných webových stránek a kompilována do obrovských, otevřených datových sad.
Vedení firem se obává, že narazí na „datovou zeď“ — bod, ve kterém všechny veřejné informace na internetu budou vyčerpány.
I když se množství plain textu na průměrné webové stránce a počet uživatelů internetu zvyšuje o 2 % až 4 % ročně, algoritmy docházejí kvalitní data.
Je pravděpodobné, že sektor umělé inteligence narazí na datovou zeď ještě dříve.
V roce 2024 byla zveřejněna studie vedená MIT, která odhalila, že Colossal Cleaned Common Crawl (C4) — rozsáhlá webová korpus — omezení jsou na vzestupu.
Pokud firmy budou respektovat tato omezení, čerstvost, relevancy a přesnost skutečných veřejných faktů budou klesat, což je donutí spoléhat se na umělá data.
Budoucnost syntetických dat a halucinací AI
Jak se autorské zákony modernizují a více vlastníků webových stránek skrývá svůj obsah před webovými prohlížeči, generace umělých datových sad se stane stále populárnější.












