AI-modeller och plattformar
Hur påverkar syntetisk data AI-hallucinationer?
Syntetisk data är ett kraftfullt verktyg, men det kan bara minska AI-hallucinationer under specifika omständigheter. I nästan alla andra fall kommer det att förstärka dem. Varför är detta? Vad betyder detta fenomen för dem som har investerat i det?
Hur skiljer sig syntetisk data från riktiga data?
Syntetisk data är information som genereras av AI. Istället för att samlas in från verkliga händelser eller observationer, produceras den artificiellt. Men den liknar originalet tillräckligt för att producera precisa och relevanta utdata. Det är i alla fall idén.
För att skapa en artificiell datamängd tränar AI-tekniker en generativ algoritm på en riktig relationsdatabas. När den utlöses producerar den en andra uppsättning som nära speglar den första, men innehåller ingen äkta information. Medan de allmänna trenderna och matematiska egenskaperna förblir intakta, finns det tillräckligt med brus för att maskera de ursprungliga relationerna.
En AI-genererad datamängd går utöver avidentifiering och replikerar den underliggande logiken för relationer mellan fält, snarare än att bara ersätta fält med ekvivalenta alternativ. Eftersom den innehåller inga identifierande detaljer kan företag använda den för att kringgå sekretess- och upphovsrättslagar. Mer viktigt är att de kan dela eller distribuera den fritt utan rädsla för ett brott.
Men fejkad information används oftast för att komplettera. Företag kan använda den för att berika eller expandera exempelstorlekar som är för små, så att de blir tillräckligt stora för att träna AI-system effektivt.
Minimerar syntetisk data AI-hallucinationer?
Ibland hänvisar algoritmer till icke-existerande händelser eller gör logiskt omöjliga förslag. Dessa hallucinationer är ofta nonsens, vilseledande eller felaktiga. Till exempel kan en stor språkmodell skriva en instruktionsartikel om att domesticera lejon eller bli läkare vid 6 års ålder. Men de är inte alla så extrema, vilket kan göra det svårt att känna igen dem.
Om den är ordentligt kuraterad kan artificiell data mildra dessa incidenter. En relevant och äkta träningsdatabas är grunden för alla modeller, så det är logiskt att ju mer information någon har, desto mer exakt kommer modellens utdata att vara. En supplementär datamängd möjliggör skalbarhet, även för nischapplikationer med begränsad offentlig information.
Debiasning är ett annat sätt som en syntetisk databas kan minimera AI-hallucinationer. Enligt MIT Sloan School of Management kan den hjälpa till att adressera bias eftersom den inte är begränsad till den ursprungliga exempelstorleken. Proffs kan använda realistiska detaljer för att fylla luckorna där vissa subpopulationer är under- eller överrepresenterade.
Hur gör artificiell data hallucinationer värre
Eftersom intelligenta algoritmer inte kan resonera eller kontextualisera information, är de benägna att hallucinationer. Generativa modeller — särskilt stora språkmodeller — är särskilt sårbara. På något sätt förvärrar artificiella fakta problemet.
Bias-förstärkning
Liksom människor kan AI lära sig och reproducera bias. Om en artificiell databas övervärderar vissa grupper medan den underrepresenterar andra — vilket är ett oroande lätt misstag att göra — kommer dess beslutslogik att snedvridas, vilket negativt påverkar utdata-precisionen.
Ett liknande problem kan uppstå när företag använder fejkad data för att eliminera verkliga världsbias, eftersom den kanske inte längre speglar verkligheten. Till exempel, eftersom över 99% av bröstcancer förekommer hos kvinnor, kan användning av supplementär information för att balansera representationen skapa snedvridna diagnoser.
Intersektionella hallucinationer
Intersektionalitet är ett sociologiskt ramverk som beskriver hur demografiska faktorer som ålder, kön, ras, yrke och klass samverkar. Det analyserar hur gruppernas överlappande sociala identiteter resulterar i unika kombinationer av diskriminering och privilegier.
När en generativ modell begärs att producera artificiella detaljer baserat på vad den tränats på, kan den generera kombinationer som inte fanns i originalet eller som är logiskt omöjliga.
Ericka Johnson, professor i genus och samhälle vid Linköpings universitet, arbetade med en maskinläringsforskare för att demonstrera detta fenomen. De använde en generativ adversarial nätverk för att skapa syntetiska versioner av USA:s folkräkningssiffror från 1990.
De märkte genast ett uppenbart problem. Den artificiella versionen hade kategorier med titlar som “hustru och singel” och “aldrig gifta män”, båda av vilka var intersektionella hallucinationer.
Utan ordentlig kurering kommer den replikerade databasen alltid att överrepresentera dominanta subpopulationer i datamängder medan den underrepresenterar — eller till och med utesluter — underrepresenterade grupper. Edge-fall och avvikare kan ignoreras helt till förmån för dominanta trender.
Modellkollaps
En överdriven tillit till artificiella mönster och trender leder till modellkollaps — där en algoritmens prestanda drastiskt försämras när den blir mindre anpassad till verkliga observationer och händelser.
Detta fenomen är särskilt uppenbart i nästa generations generativa AI. Upprepad användning av en artificiell version för att träna dem resulterar i en självförsörjande loop. En studie fann att deras kvalitet och återkallande minskar progressivt utan tillräckligt med nya, faktiska siffror i varje generation.
Överanpassning
Överanpassning är en överdriven tillit till träningsdata. Algoritmen presterar bra initialt men kommer att hallucinera när den presenteras med nya datapunkter. Syntetisk information kan förvärra detta problem om den inte återger verkligheten korrekt.
Implikationerna av fortsatt användning av syntetisk data
Marknaden för syntetisk data blomstrar. Företag inom denna nischindustri samlade in cirka 328 miljoner dollar 2022, upp från 53 miljoner dollar 2020 — en ökning med 518% på bara 18 månader. Det är värt att notera att detta är enbart offentligt känd finansiering, vilket innebär att den faktiska siffran kan vara ännu högre. Det är säkert att säga att företag är oerhört investerade i denna lösning.
Om företag fortsätter att använda en artificiell databas utan ordentlig kurering och debiasning, kommer deras modellers prestanda att försämras progressivt, vilket kan försura deras AI-investeringar. Resultaten kan vara mer allvarliga, beroende på tillämpningen. Till exempel kan en ökning av hallucinationer inom hälso- och sjukvården leda till feldiagnoser eller olämpliga behandlingsplaner, vilket kan leda till sämre patientutfall.
Lösningen kommer inte att innebära en återgång till riktiga data
AI-system behöver miljontals, om inte miljarder, bilder, texter och videor för träning, mycket av vilket skrapas från offentliga webbplatser och samlas i stora, öppna datamängder. Tyvärr konsumerar algoritmer denna information snabbare än människor kan generera den. Vad händer när de lär sig allt?
Företagsledare är oroliga för att nå “datamuren” — den punkt då all offentlig information på internet har uttömts. Det kan vara närmare än de tror.
Även om både mängden vanlig text på den genomsnittliga webbplatsen och antalet internetanvändare växer med 2% till 4% årligen, är algoritmer på väg att tömma ut högkvalitetsdata. Bara 10% till 40% kan användas för träning utan att kompromissa med prestanda. Om trenderna fortsätter kan den mänskligt genererade offentliga informationsförrådet tömmas på 2026.
Det är troligt att AI-sektorn kommer att nå datamuren ännu tidigare. Den generativa AI-boomen under de senaste åren har ökat spänningarna kring informationsägande och upphovsrättsintrång. Fler webbplatsägare använder Robots Exclusion Protocol — en standard som använder en robots.txt-fil för att blockera webbcrawlers — eller gör det tydligt att deras webbplats är otillgänglig.
En studie från 2024, publicerad av en MIT-ledd forskargrupp, visade att Colossal Cleaned Common Crawl (C4) — en stor webbcrawl-korpus — begränsningar ökar. Över 28% av de mest aktiva, kritiska källorna i C4 var fullständigt begränsade. Dessutom var 45% av C4 nu utpekade som otillgängliga enligt villkoren.
Om företag respekterar dessa begränsningar kommer den faktiska, relevanta och precisa offentliga informationens färskhet att minska, vilket tvingar dem att lita på artificiella databaser. De kan inte ha mycket val om domstolarna beslutar att något alternativ är upphovsrättsintrång.
Framtiden för syntetisk data och AI-hallucinationer
När upphovsrättslagar moderniseras och fler webbplatsägare döljer sitt innehåll från webbcrawlers, kommer artificiell datagenerering att bli alltmer populär. Organisationer måste förbereda sig för att möta hotet från hallucinationer.












