Ajatusjohtajat

Synteettisen datan totuus: Miksi ihmisen asiantuntemus on kriittinen LLM-menestykselle

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

LLM-kehittäjät kääntyvät yhä enemmän synteettisen datan puoleen nopeuttaakseen kehitystä ja vähentääkseen kustannuksia. Useiden huipputason mallien, kuten LLama 3, Qwen 2 ja DeepSeek R1, tutkijat ovat maininneet käyttävänsä synteettistä dataa mallien koulutukseen tutkimuspaperissaan. Ulkopuolelta näyttää siltä, että tämä on täydellinen ratkaisu: äärettömän tiedon lähde nopeuttaa kehitystä ja leikkaa kustannuksia. Mutta tämä ratkaisu tulee piilevän kustannuksen kera, jota liikkeenjohtajat eivät voi jättää huomiotta.

Yksinkertaisesti sanottuna synteettinen data luodaan tekoälymallien avulla luomaan keinotekoisia tietoja LLM- ja tekoälyagenttien koulutukseen, hienosäätöön ja arviointiin. Perinteiseen ihmisen annotointiin verrattuna se mahdollistaa tietoputken nopean skaalautumisen, mikä on välttämätöntä nopeasti muuttuvassa ja kilpailukykyisessä tekoälykehityksen maisemassa.

Yrityksillä voi olla muita syitä käyttää “väärää” dataa, kuten suojelemaan arkaluontoista tai luottamuksellista tietoa rahoitus- tai terveydenhuoltoalueilla luomalla anonymisoituja versioita. Synteettinen data on myös hyvä korvike, kun omistuksellista dataa ei ole saatavilla, kuten ennen tuotteen julkaisua tai kun data kuuluu ulkopuolisille asiakkaille.

Muuttaako synteettinen data tekoälykehitystä? Lyhyt vastaus on ehdollinen kyllä: sillä on suuri potentiaali, mutta se voi myös altistaa LLM- ja agentit kriittisille haavoittuvuuksille ilman tiukkaa ihmisen valvontaa. LLM-tuottajat ja tekoälyagenttien kehittäjät saattavat huomata, että tekoälymallit, jotka on koulutettu riittämättömästi tarkistetulla synteettisellä datalla, voivat tuottaa epätarkkoja tai harhaanjohtavia tuloksia, luoda maineeseen kohdistuvia kriisejä ja johtaa teollisuuden ja eettisten standardien mukaisuuden puutteeseen. Ihmisen valvonnan sijoittaminen synteettisen datan jalostamiseen on suora sijoitus yrityksen tuloksen suojelemiseen, sidosryhmien luottamuksen ylläpitämiseen ja vastuullisen tekoälykäytön varmistamiseen.

Ihmisen syötteen avulla synteettinen data voidaan muuttaa korkealaatuiseksi koulutusdataksi. On kolme kriittistä syytä jalostaa luotuja tietoja ennen niiden käyttämistä tekoälyjen koulutukseen: täyttääksesi tietojen aukot, parantaaksesi tietojen laatua ja vähentääksesi otoksen kokoa sekä sovittaaksesi ne ihmisen arvoihin.

Meidän on pyrittävä kaappaamaan yksilöllinen tietämys

Synteettinen data luodaan pääasiassa LLM:ien avulla, jotka on koulutettu julkisesti saatavilla oleville internet-lähteille, mikä luo sisäänrakennetun rajoituksen. Julkinen sisältö harvoin kaappaa käytännön, käytännön tietämystä, jota käytetään todellisessa työssä. Toimintaa, kuten markkinointikampanjan suunnittelua, taloudellisen ennusteen valmistelua tai markkinatutkimusta, ei yleensä dokumentoida verkossa. Lisäksi lähteet usein heijastelevat Yhdysvaltain keskeistä kieltä ja kulttuuria, mikä rajoittaa maailmanlaajuista edustusta.

Jotta voimme voittaa nämä rajoitukset, voimme kutsua asiantuntijoita luomaan tietoja alueilla, joilla epäilemme, että synteettinen datan luomismalli ei voi kattaa. Palatessamme esimerkkiin, jos haluamme lopullisen mallimme käsittävän taloudellisia ennusteita ja markkinatutkimusta tehokkaasti, koulutusdataa on sisällyttävä realistisia tehtäviä näistä aloista. On tärkeää tunnistaa nämä aukot ja täydentää synteettistä dataa asiantuntijoiden luomilla näytteillä.

Asiantuntijat ovat usein mukana projektin alussa määrittämässä työn laajuutta. Tähän sisältyy tietokannan luominen, joka määrittää tiettyjä tietämyksen alueita, joilla mallin on toimittava. Esimerkiksi terveydenhuollossa yleinen lääketiede voidaan jakaa alakohtiin, kuten ravitsemukseen, sydän- ja verisuonitautiin, allergioihin ja niin edelleen. Terveyteen keskittyvän mallin on koulutettava kaikilla alueilla, joilla se on tarkoitus toimia. Kun tietokanta on määritelty terveydenhuollon asiantuntijoiden toimesta, LLM:itä voidaan käyttää datapisteiden luomiseen tyypillisillä kysymyksillä ja vastauksilla nopeasti ja suurten määrien käsittelyyn. Ihmisen asiantuntijat ovat kuitenkin edelleen tarpeen tarkastamaan, korjaamaan ja parantamaan sisältöä, jotta se on sekä tarkkaa että turvallista ja asiayhteydestä riippuvaa. Tämä laadunvarmistusprosessi on välttämätön korkean riskin sovelluksissa, kuten terveydenhuollossa, varmistaaksesi tietojen tarkkuuden ja vähentääksesi mahdollista vahinkoa.

Laatu määrää määrän: mallien tehokkuuden ajama, vähemmän ja parempien näytteiden avulla

Kun alaan erikoistuneet asiantuntijat luovat tietoja LLM- ja tekoälyagenttien koulutukseen, he luovat tietokantoja, kirjoittavat ohjelmia, luovat ihanteellisia vastauksia tai simuloivat tiettyä tehtävää. Kaikki nämä vaiheet on huolellisesti suunniteltu sopimaan mallin tarkoitusta, ja laatu varmistetaan aihealueen asiantuntijoiden toimesta.

Synteettisen datan luominen ei täysin jäljitä tätä prosessia. Se perustuu sen perustana olevan mallin vahvuuksiin, ja tulokseksi saadaan usein laatu, joka ei ole vertailukelpoinen ihmisten kuratoimaan dataan. Tämä tarkoittaa, että synteettinen data usein vaatii suurempia määriä saadakseen tyydyttävän tuloksen, mikä johtaa laskennallisten kustannusten ja kehitysaikojen kasvuun.

Monimutkaisilla aloilla on nuansseja, joita vain ihmisen asiantuntijat voivat havaita, erityisesti poikkeuksissa tai reunatapauksissa. Ihmisten kuratoima data toimii johdonmukaisesti paremmin mallin suorituskyvyssä, jopa merkittävästi pienemmällä tietojoukolla. Strategisesti integroiden ihmisen asiantuntemuksen tietojen luomisprosessiin voimme vähentää näytteiden määrää, jota mallin on tarve toimia tehokkaasti.

Kokemuksemme mukaan paras tapa ratkaista tämä haaste on osallistua aihealueen asiantuntijat synteettisten tietojoukkojen rakentamiseen. Kun asiantuntijat suunnittelevat sääntöjä datan luomiseksi, määrittelevät tietojen tietokannat ja tarkastavat tai korjaavat luotuja tietoja, lopputuloksen laatu on paljon korkeampi. Tämä lähestymistapa on mahdollistanut asiakkaidemme saavuttaa vahvat tulokset käyttämällä vähemmän näytteitä, mikä johtaa nopeampaan ja tehokkaampaan tuotantoon.

Luottamuksen rakentaminen: ihmisten korvaamaton rooli tekoälyn turvallisuudessa ja suunnittelussa

Automaattiset järjestelmät eivät voi ennakoida kaikkia haavoittuvuuksia tai taata suunnittelua ihmisten arvojen mukaisesti, erityisesti reunatapauksissa ja epäselvissä tilanteissa. Asiantuntijoiden rooli on korvaamaton tunnistamassa nousseita riskejä ja varmistamassa eettisistä tuloksista ennen käyttöönottoa. Tämä on suojakerros, jonka tekoäly, ainakin toistaiseksi, ei voi tarjota yksin.

Siksi vahvan red team -tietojoukon luomiseksi synteettinen data yksinään ei riitä. On tärkeää osallistua turvallisuusasiantuntijoita prosessiin jo varhain. He voivat auttaa kartoittamaan mahdollisia hyökkäyksiä ja ohjata tietojoukon rakennetta. LLM:itä voidaan sitten käyttää luomaan suuri määrä esimerkkejä. Sen jälkeen asiantuntijat ovat tarpeen tarkastamaan ja jalostamaan dataa, jotta se on realistista, laadukasta ja hyödyllistä tekoälyjärjestelmien testaamiseen. Esimerkiksi LLM voi luoda tuhansia standardihyökkäyskysymyksiä, mutta turvallisuusasiantuntija voi luoda uusia “sosiaalisen insinöörityön” hyökkäyksiä, jotka hyödyntävät hienovaraisia psykologisia vinoumia – luovaa uhkaa, jota automaattiset järjestelmät kamppailevat keksimään omin avuin.

On tehty merkittävää edistystä tekoälyjen suunnittelussa automaattisella palautteella. Tutkimuspaperissa RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback tutkijat osoittavat, että tekoälypohjainen suunnittelu voidaan suorittaa vertailukelpoisesti ihmisten palautteen kanssa monissa tapauksissa. Kuitenkin, vaikka tekoälypohjainen palautteen anto parani mallien parantuessa, kokemuksemme osoittaa, että RLAIF kamppailee edelleen monimutkaisilla aloilla ja reunatapauksissa tai poikkeuksissa, joilla suorituskyky voi olla kriittistä sovelluksen mukaan. Ihmisen asiantuntijat ovat tehokkaampia käsittelemään tehtävän nuansseja ja asiayhteyttä, mikä tekee heistä luotettavampia suunnittelussa.

Tekoälyagentit hyötyvät myös automaattisesta testaamisesta laajan turvallisuusriskien käsittelyyn. Virtuaaliset testiympäristöt käyttävät luotuja tietoja simuloimaan agenttien käyttäytymistä, kuten vuorovaikutusta verkko-työkalujen kanssa ja toimintoja verkkosivuilla. Maksimoidakseen testikattavuuden realistisissa tilanteissa, ihmisen asiantuntemus on olennainen suunnitella testitapauksia, vahvistaa automaattisten arvioiden tuloksia ja raportoida haavoittuvuuksista.

Synteettisen datan tulevaisuus

Synteettinen data on erittäin arvokas tekniikka suurten kielen mallien kehittämisessä, erityisesti silloin, kun skaalautuvuus ja nopea käyttöönotto ovat kriittisiä nykyisessä nopeasti muuttuvassa maisemassa. Vaikka synteettisessä datassa itsessään ei ole perustavanlaatuisia virheitä, se vaatii jalostamista saavuttaakseen täyden potentiaalinsa ja tarjotakseen enemmän arvoa. Hybridi-lähestymistapa, joka yhdistää automaattisen datan luomisen ja ihmisen asiantuntemuksen, on erittäin tehokas keino kehittää kykyjä ja luotettavia malleja, koska lopullisen mallin suorituskyky riippuu enemmän datan laadusta kuin kokonaismäärästä. Tämä integroitu prosessi, jossa tekoälyä käytetään skaalautuvuuteen ja ihmisen asiantuntijat validointiin, tuottaa kykyjä ja parantaa turvallisuuden suunnittelua, mikä on välttämätöntä luotettavuuden rakentamiseen ja vastuullisen käyttöönoton varmistamiseen.

Ilya Kochik on Tolokan liiketoimintakehitysjohtaja, joka on johtava GenAI-tutkimuslaboratorioiden ihmisten tietojen kumppani, jossa hän erikoistuu ääriviivatöihin eturintamalla oleville malleille ja agenteille järjestelmille. Lontoossa sijaitseva Kochik on työskennellyt johtavissa ja teknisissä rooleissa Googlella, QuantumBlackilla (AI by McKinsey) ja Bain & Companylla.