Tankeledere
Sannheten om syntetisk data: Hvorfor menneskelig ekspertise er kritisk for LLM-suksess

LLM-utviklere søker stadig mer etter syntetisk data for å påskynde utviklingen og redusere kostnadene. Forskerne bak flere toppmodeller, som LLama 3, Qwen 2 og DeepSeek R1, har nevnt bruk av syntetisk data for å trene modellene i forskningsrapportene. Utenfra ser det ut som den perfekte løsningen: en ubegrenset kilde til informasjon for å påskynde utviklingen og kutte kostnadene. Men denne løsningen kommer med en skjult pris som næringslivets ledere ikke kan ignorere.
I enkle termer er syntetisk data generert av AI-modeller for å lage kunstige datasamlinger for trening, finjustering og evaluering av LLM-er og AI-agenter. I sammenligning med tradisjonell menneskelig annotering, tillater datapipen å skaleres raskt, noe som er essensielt i den raskt utviklende og konkurrerende landskapet for AI-utvikling.
Bedrifter kan ha andre grunner til å bruke “falsk” data, som å beskytte følsomme eller konfidensielle opplysninger i finansielle eller helseinstillinger ved å generere anonymiserte versjoner. Syntetisk data er også en god erstatning når proprietær data ikke er tilgjengelig, som før lansering av et produkt eller når dataene tilhører eksterne kunder.
Men er syntetisk data revolusjonererende for AI-utvikling? Det korte svaret er et kvalifisert ja: det har stor potensiale, men det kan også exponere LLM-er og agenter for kritiske sårbarheter uten rigorøs menneskelig tilsyn. LLM-produsenter og AI-agent-utviklere kan finne at AI-modeller trenet på utilstrekkelig verifisert syntetisk data kan generere uriktige eller forvrengte utdata, skape omdømmekriser og føre til brudd på bransje- og etiske standarder. Investeringer i menneskelig tilsyn for å forbedre syntetisk data er en direkte investering i å beskytte resultatet, opprettholde stakeholder-tillit og sikre ansvarlig AI-utvikling.
Med menneskelig innsats kan syntetisk data omformes til høykvalitets treningdata. Det finnes tre kritiske grunner til å forbedre generert data før de brukes til å trene AI: for å fylle hull i kilde-modell-kunnskap, for å forbedre datakvalitet og redusere prøvestørrelse, og for å sammenligne med menneskelige verdier.
Vi må fange unik kunnskap
Syntetisk data genereres hovedsakelig av LLM-er som er trenet på offentlig tilgjengelige internett-kilder, noe som skaper en innebygd begrensning. Offentlig innhold fanger sjelden den praktiske, hånd-til-hånd-kunnskapen som brukes i virkelige arbeidsoppgaver. Aktiviteter som å designe en markedsføringskampanje, å forberede en finansiell prognose eller å utføre markedsanalyse er vanligvis private og ikke dokumentert på internett. I tillegg tenderer kildene til å reflektere amerikansk-sentrert språk og kultur, noe som begrenser global representasjon.
For å overvinne disse begrensningene kan vi involvere eksperter for å lage datasamlinger i områder vi mistenker at syntetisk data-genereringsmodellen ikke kan dekke. Ved å returnere til det korporative eksemplet, hvis vi ønsker at vårt endelige modell skal håndtere finansielle prognoser og markedsanalyse effektivt, må treningdataene inkludere realistiske oppgaver fra disse feltene. Det er viktig å identifisere disse hullene og supplere syntetisk data med ekspert-lagde samlinger.
Eksperter er ofte involvert tidlig i prosjektet for å definere arbeidets omfang. Dette inkluderer å lage en taksonomi, som omfatter de spesifikke kunnskapsområdene hvor modellen må fungere. For eksempel i helsevesenet kan generell medisin deles inn i underkategorier som ernæring, hjerte-helse, allergier og mer. En helse-fokusert modell må være trenet i alle underkategoriene den forventes å dekke. Etter at taksonomien er definert av helse-eksperter, kan LLM-er brukes til å generere datapunkter med typiske spørsmål og svar raskt og i stor skala. Menneskelig eksperter er likevel nødvendige for å gjennomgå, korrigere og forbedre innholdet for å sikre at det ikke bare er nøyaktig, men også trygt og kontekstuelt passende. Denne kvalitetsikringsprosessen er nødvendig i høyrisiko-applikasjoner, som helsevesenet, for å sikre data-nøyaktighet og minimere potensiell skade.
Kvalitet over kvantitet: å drive modell-effektivitet med færre, bedre prøver
Når domene-eksperter lager data for trening av LLM-er og AI-agenter, lager de taksonomier for datasamlinger, skriver fremkalling, designer ideelle svar eller simulerer en spesifikk oppgave. Alle disse trinnene er nøye designet for å passe modellens formål, og kvaliteten sikres av fageksperter i tilhørende felt.
Syntetisk data-generering gjentar ikke fullstendig denne prosessen. Den avhenger av styrkene til den underliggende modellen som brukes for å lage data, og den resulterende kvaliteten er ofte ikke på samme nivå som menneskelig-kurert data. Dette betyr at syntetisk data ofte krever mye større volumer for å oppnå tilfredsstillende resultater, noe som driver opp beregningskostnadene og utviklingstiden.
I komplekse domener finnes det nuanser som bare menneskelig eksperter kan se, spesielt med outliers eller randtilfeller. Menneskelig-kurert data leverer konsekvent bedre modell-prestasjon, selv med betydelig mindre datasamlinger. Ved å strategisk integrere menneskelig ekspertise i dataprosessen, kan vi redusere antallet prøver som trengs for at modellen skal fungere effektivt.
I vår erfaring er den beste måten å møte denne utfordringen å involvere fageksperter i å bygge syntetiske datasamlinger. Når eksperter designer reglene for data-generering, definerer data-taksonomier og gjennomgår eller korrigerte generert data, er den endelige kvaliteten på dataene mye høyere. Denne tilnærmingen har enablet våre kunder å oppnå sterke resultater ved å bruke færre datasamlinger, noe som har ført til en raskere og mer effektiv vei til produksjon.
Bygge tillit: den uerstattelige rollen til mennesker i AI-sikkerhet og -alignering
Automatiserte systemer kan ikke forutse alle sårbarheter eller sikre at de er i samsvar med menneskelige verdier, spesielt i randtilfeller og tvetydige scenarioer. Menneskelig eksperter spiller en avgjørende rolle i å identifisere fremvoksende risiko og sikre etiske resultater før utrulling. Dette er et lag med beskyttelse som AI, i alle fall for nå, ikke fullt ut kan levere på egen hånd.
Derfor, for å bygge en sterk red team-datasamling, er syntetisk data alene ikke nok. Det er viktig å involvere sikkerhets-eksperter tidlig i prosessen. De kan hjelpe med å kartlegge potensielle angrep og guide strukturen til datasamlingen. LLM-er kan deretter brukes til å generere en stor mengde eksempler. Etter det, er eksperter nødvendige for å verifisere og forbedre dataene for å sikre at de er realistiske, høykvalitets og nyttige for å teste AI-systemer. For eksempel kan en LLM generere tusenvis av standard hacking-fremkalling, men en menneskelig sikkerhets-ekspert kan lage nye ‘sosiale ingeniør’-angrep som utnytter nuanserte psykologiske fordommer – en kreativ trussel som automatiserte systemer sliter med å oppfinne på egen hånd.
Det har vært betydelig fremgang i å sammenligne LLM-er ved hjelp av automatisert tilbakemelding. I artikkelen “RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback,” viser forskerne at AI-basert sammenligning kan fungere like godt som menneskelig tilbakemelding i mange tilfeller. Likevel, mens AI-tilbakemelding forbedres når modellene forbedres, viser vår erfaring at RLAIF likevel sliter i komplekse domener og med randtilfeller eller outliers, områder hvor ytelse kan være kritisk avhengig av applikasjonen. Menneskelig eksperter er mer effektive i å håndtere oppgave-nuanser og kontekst, noe som gjør dem mer pålitelige for sammenligning.
AI-agenter kan også dra nytte av automatisert testing for å håndtere en rekke sikkerhetsrisiko. Virtuelle test-miljøer bruker generert data for å simulere agent-atferd som å kommunisere med nettverktøy og utføre handlinger på nettsider. For å maksimere test-dekningen i realistiske scenarioer, er menneskelig ekspertise avgjørende for å designe test-tilfellene, verifisere resultater fra automatiserte evalueringer og rapportere om sårbarheter.
Fremtiden for syntetisk data
Syntetisk data er en svært verdifull teknikk for å utvikle store språkmodeller, spesielt når skalerbarhet og rask utrulling er kritisk i dagens raskt utviklende landskap. Mens det ikke finnes noen grunnleggende feil i syntetisk data selv, krever det forbedring for å nå sitt fulle potensiale og levere mest verdi. En hybrid-tilnærming som kombinerer automatisert data-generering med menneskelig ekspertise er en svært effektiv metode for å utvikle dyktige og pålitelige modeller, som final modell-prestasjon avhenger mer av data-kvalitet enn av total volum. Denne integrerte prosessen, som bruker AI for skala og menneskelig eksperter for verifisering, produserer mer dyktige modeller med forbedret sikkerhets-sammenligning, noe som er essensielt for å bygge bruker-tillit og sikre ansvarlig utrulling.












