Tankeledare

Sanningen om syntetiska data: Varför mänsklig expertis är avgörande för LLM:s framgång

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Utvecklare av LLM är alltmer benägna att använda syntetiska data för att påskynda utvecklingen och minska kostnaderna. Forskare bakom flera toppmodeller, såsom LLama 3, Qwen 2 och DeepSeek R1, har nämnt att de använt syntetiska data för att träna sina modeller i forskningsartiklarna. Utifrån sett verkar det som den perfekta lösningen: en outtömlig källa till information för att påskynda utvecklingen och minska kostnaderna. Men denna lösning har en dold kostnad som affärsledare inte kan bortse från.

I enkla termer är syntetiska data genererade av AI-modeller för att skapa artificiella datamängder för utbildning, finjustering och utvärdering av LLM och AI-agenter. Jämfört med traditionell mänsklig annotering möjliggör det att datapiplen kan skalas upp snabbt, vilket är avgörande i den snabbt föränderliga och konkurrensutsatta AI-utvecklingslandskapet.

Företag kan ha andra skäl att använda “falska” data, såsom att skydda känslig eller konfidentiell information inom finansiella eller hälso- och sjukvårdssektorn genom att generera anonyma versioner. Syntetiska data är också en bra ersättning när proprietär data inte är tillgänglig, såsom innan en produkt lanseras eller när data tillhör externa kunder.

Men revolutionerar syntetiska data AI-utvecklingen? Det korta svaret är ett kvalificerat ja: det har stor potential, men det kan också exponera LLM och agenter för kritiska sårbarheter utan rigorös mänsklig tillsyn. LLM-tillverkare och AI-agentutvecklare kan upptäcka att AI-modeller som tränats på otillräckligt granskade syntetiska data kan generera felaktiga eller partiska utdata, skapa rykteskriser och leda till bristande efterlevnad av bransch- och etiska standarder. Att investera i mänsklig tillsyn för att förbättra syntetiska data är en direkt investering i att skydda resultatet, upprätthålla intressenternas förtroende och säkerställa ansvarsfull AI-användning.

Med mänskligt bidrag kan syntetiska data omvandlas till högkvalitativa träningsdata. Det finns tre avgörande skäl att förbättra genererade data innan de används för att träna AI: för att fylla luckor i källmodellens kunskap, för att förbättra datakvaliteten och minska exempelstorleken, och för att anpassa sig till mänskliga värderingar.

Vi måste fånga unik kunskap

Syntetiska data genereras främst av LLM som tränats på offentligt tillgängliga internetkällor, vilket skapar en inneboende begränsning. Offentligt innehåll fångar sällan den praktiska, handgripliga kunskap som används i verkliga arbetslivet. Aktiviteter som att utforma en marknadsföringskampanj, förbereda en finansiell prognos eller genomföra marknadsanalys är vanligtvis privata och inte dokumenterade online. Dessutom tenderar källorna att spegla USA-centrerad språk och kultur, vilket begränsar den globala representationen.

För att övervinna dessa begränsningar kan vi involvera experter för att skapa dataspecimen i områden där vi misstänker att den syntetiska datagenereringsmodellen inte kan täcka. Om vi vill att vår slutliga modell ska hantera finansiella prognoser och marknadsanalys effektivt, behöver träningsdata innehålla realistiska uppgifter från dessa områden. Det är viktigt att identifiera dessa luckor och komplettera syntetiska data med expertskapade specimen.

Experter är ofta involverade tidigt i projektet för att definiera arbetsomfånget. Detta inkluderar att skapa en taxonomi, som anger de specifika kunskapsområden där modellen behöver prestera. Till exempel kan allmänmedicin inom hälso- och sjukvården delas in i underområden som nutrition, hjärt- och kärlsjukdomar, allergier och mer. En hälsoinriktad modell måste tränas i alla underområden den förväntas täcka. Efter att taxonomin har definierats av hälsoexperter kan LLM användas för att generera datapunkter med typiska frågor och svar snabbt och i stor skala. Mänskliga experter behövs fortfarande för att granska, korrigera och förbättra innehållet för att säkerställa att det inte bara är korrekt utan också säkert och kontextuellt lämpligt. Denna kvalitetssäkringsprocess är nödvändig i högriskapplikationer, såsom hälso- och sjukvård, för att säkerställa datakvalitet och minimera potentiell skada.

Kvalitet före kvantitet: att driva modellens effektivitet med färre, bättre specimen

När domänexperter skapar data för att träna LLM och AI-agenter, skapar de taxonomier för datamängder, skriver prompter, formulerar idealiska svar eller simulerar en specifik uppgift. Alla steg är noggrant utformade för att passa modellens syfte, och kvaliteten säkerställs av ämnesexperter inom de relevanta områdena.

Syntetisk datagenerering replikerar inte fullständigt denna process. Den förlitar sig på styrkorna hos den underliggande modell som används för att skapa data, och den resulterande kvaliteten är ofta inte i nivå med mänskligt kuraterad data. Detta innebär att syntetiska data ofta kräver mycket större volymer för att uppnå tillfredsställande resultat, vilket driver upp beräkningskostnaderna och utvecklingstiden.

I komplexa domäner finns det nyanser som endast mänskliga experter kan upptäcka, särskilt när det gäller avvikare eller randfall. Mänskligt kuraterad data levererar konsekvent bättre modellprestanda, även med avsevärt mindre datamängder. Genom att strategiskt integrera mänsklig expertis i dataskapandeprocessen kan vi minska antalet specimen som behövs för att modellen ska fungera effektivt.

I vår erfarenhet är det bästa sättet att hantera denna utmaning att involvera ämnesexperter i byggandet av syntetiska datamängder. När experter utformar reglerna för datagenerering, definierar datataxonomier och granskar eller korrigera den genererade datan, är den slutliga kvaliteten på datan mycket högre. Detta tillvägagångssätt har möjliggjort för våra kunder att uppnå starka resultat med färre dataspecimen, vilket leder till en snabbare och mer effektiv väg till produktion.

Att bygga förtroende: den oersättliga rollen för mänskliga insatser i AI-säkerhet och anpassning

Automatiserade system kan inte förutse alla sårbarheter eller säkerställa anpassning till mänskliga värderingar, särskilt i randfall och tvetydiga scenarier. Mänskliga granskare spelar en avgörande roll i att identifiera framväxande risker och säkerställa etiska resultat före distribution. Detta är ett skyddslager som AI, åtminstone för närvarande, inte kan tillhandahålla fullständigt på egen hand.

Därför kan en stark red team-dataset inte byggas enbart med syntetiska data. Det är viktigt att involvera säkerhetsexperter tidigt i processen. De kan hjälpa till att kartlägga potentiella attacker och vägleda datamängdens struktur. LLM kan sedan användas för att generera en stor mängd exempel. Därefter behövs experter för att verifiera och förbättra datan för att säkerställa att den är realistisk, högkvalitativ och användbar för att testa AI-system. Till exempel kan en LLM generera tusentals standardhackingprompt, men en mänsklig säkerhetsexpert kan skapa nya “sociala ingenjörer” som utnyttjar nyanserade psykologiska bias – en kreativ hot som automatiserade system kämpar för att uppfinna på egen hand.

Det har skett betydande framsteg i att anpassa LLM med automatiserad återkoppling. I artikeln RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback visar forskare att AI-baserad anpassning kan prestera jämförbart med mänsklig återkoppling i många fall. Men medan AI-återkoppling förbättras när modellerna förbättras, visar vår erfarenhet att RLAIF fortfarande kämpar i komplexa domäner och med randfall eller avvikare, områden där prestanda kan vara avgörande beroende på tillämpningen. Mänskliga experter är mer effektiva i att hantera uppgiftsnyanser och kontext, vilket gör dem mer tillförlitliga för anpassning.

AI-agenter kan också dra nytta av automatiserad testning för att hantera en bred range av säkerhetsrisker. Virtuella testmiljöer använder genererade data för att simulera agentbeteenden som att interagera med onlineverktyg och utföra åtgärder på webbplatser. För att maximera testtäckningen i realistiska scenarier är mänsklig expertis avgörande för att utforma testfall, verifiera resultaten från automatiserade utvärderingar och rapportera om sårbarheter.

Framtiden för syntetiska data

Syntetiska data är en mycket värdefull teknik för att utveckla stora språkmodeller, särskilt när skalbarhet och snabb distribution är avgörande i dagens snabbt föränderliga landskap. Medan det inte finns några grundläggande fel i syntetiska data i sig, kräver det förbättring för att nå sin fulla potential och leverera det mesta av värdet. En hybridmetod som kombinerar automatiserad datagenerering med mänsklig expertis är en mycket effektiv metod för att utveckla kapabla och pålitliga modeller, eftersom den slutliga modellprestandan beror mer på datakvalitet än på total volym. Denna integrerade process, som använder AI för skalbarhet och mänskliga experter för validering, producerar mer kapabla modeller med förbättrad säkerhetsanpassning, vilket är avgörande för att bygga användarförtroende och säkerställa ansvarsfull distribution.

Ilya Kochik är Vice President of Business Development på Toloka, en mänsklig datapartner för ledande GenAI-forskningslaboratorier, där han specialiserar sig på banbrytande uppgifter för frontmodeller och agenssystem. Med bas i London har han en bakgrund som inkluderar ledande och tekniska roller på Google, QuantumBlack (AI by McKinsey) och Bain & Company.