Ajatusjohtajat

3 tapaa pitää vanhentuneet faktat tuoreina suurissa kielen mallissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suuret kielen mallit (LLM) kuten GPT3, ChatGPT ja BARD ovat kaikkien huomion keskipisteenä tänään. Jokaisella on oma mielipiteensä siitä, miten nämä työkalut ovat hyviä tai huonoja yhteiskunnalle ja mitä ne tarkoittavat tulevaisuuden älykkyydelle. Google sai paljon kritiikkiä uudesta mallistaan BARD, joka vastasi monimutkaiseen kysymykseen väärin (hieman). Kun kysymys “Mitkä uudet löydöt James Webb -avaruusteleskoopista voit kertoa 9-vuotiaalle?” – chatbotti antoi kolme vastausta, joista kaksi oli oikein ja yksi väärin. Väärä vastaus oli, että ensimmäinen “eksoplaneetan” kuva otettiin JWST: llä, mikä oli väärin. Periaatteessa malli oli tallentanut virheellisen faktan tietokantaansa. Suurten kielen mallien toimivuuden vuoksi tarvitsemme keinon päivittää nämä faktat tai täydentää niitä uudella tiedolla.

Katsotaan ensin, miten faktat tallennetaan suuren kielen malliin (LLM). Suuret kielen mallit eivät tallenna tietoja ja faktoja perinteisellä tavalla kuten tietokannat tai tiedostot. Sen sijaan ne on koulutettu laajoihin määriin tekstidataa ja ovat oppineet mallit ja suhteet siinä. Tämä mahdollistaa niiden luominen ihmismäisistä vastauksista kysymyksiin, mutta niillä ei ole tiettyä tallennussijaintia opittuun tietoon. Kun malli vastaa kysymykseen, se käyttää koulutusta luodakseen vastauksen saadun syötteen perusteella. Kielen mallin tiedot ja tietämys ovat seurausta siitä, mitä se on oppinut koulutusdatassa, eikä se ole tulosta siitä, että se on eksplisiittisesti tallennettu mallin muistiin. Transformer-arkkitehtuuri, jolle useimmat modernit LLM:t perustuvat, sisältää sisäisen faktan koodauksen, jota käytetään vastaamaan kysymyksiin, jotka esitetään syötteenä.

Jos faktat LLM:n sisäisessä muistissa ovat väärin tai vanhentuneita, uutta tietoa on tarjottava syötteen kautta. Syöte on teksti, joka lähetetään LLM: lle kysymyksen ja tukevan todisteen kanssa, joka voi olla uusia tai korjattuja faktoja. Tässä on 3 tapaa lähestyä tätä.

1. Yksi tapa korjata LLM:n koodatut faktat on tarjota uusia faktoja asiayhteyden mukaisesti ulkoisen tietokannan kautta. Tämä tietokanta voi olla API-kutsu, joka hakee asiaankuuluvaa tietoa tai hakukutsu SQL-, No-SQL- tai vektortietokantaan. Edistyneempää tietoa voidaan poimia tietoverkosta, joka tallentaa data-entiteettejä ja niiden välisiä suhteita. Kysymyksen mukaan, mitä tietoa käyttäjä kysyy, asiaankuuluvaa kontekstia voidaan hakea ja antaa LLM: lle lisäfaktana. Nämä faktat voidaan myös muotoilla näyttämään koulutus-esimerkeiltä, jotta parannetaan oppimisprosessia. Esimerkiksi voit antaa joukon kysymys-vastaus -paria mallille, jotta se opi antamaan vastauksia.

2. Innovaatio (ja kalliimpi) tapa täydentää LLM on todellinen hienosäätö koulutusdatan avulla. Sen sijaan, että haettaisiin tietokannasta tiettyjä faktoja, rakennetaan koulutusdataa näyttelemällä tietokannasta. Käyttämällä valvottua oppimista, kuten hienosäätöä, voidaan luoda uusi versio LLM: stä, joka on koulutettu tämän lisätiedon avulla. Tämä prosessi on yleensä kallis ja voi maksaa useita tuhansia dollareita rakentaa ja ylläpitää hienosäätöä mallia OpenAI: ssä. Tietysti kustannukset odotetaan laskevan ajan myötä.

3. Kolmas vaihtoehto on käyttää menetelmiä, kuten vahvistusoppiminen (RL), kouluttaa agentti ihmisen palautteen avulla ja oppia käyttäytymissääntöä, jolla vastataan kysymyksiin. Tämä menetelmä on osoittautunut erittäin tehokkaaksi rakentamaan pienempiä jalanjälkiä, jotka ovat hyviä tiettyihin tehtäviin. Esimerkiksi kuuluisa ChatGPT, joka julkaistiin OpenAI: n avulla, koulutettiin yhdistelmällä valvottua oppimista ja RL: ää ihmisen palautteen kanssa.

Yhteenvetona, tämä on erittäin kehittyvä ala, johon jokainen suuri yritys haluaa osallistua ja osoittaa eronomaistensa. Pian näemme suuria LLM-työkaluja useilla aloilla, kuten vähittäiskaupassa, terveydenhuollossa ja pankkitoiminnassa, jotka voivat vastata ihmismäisellä tavalla ymmärtäen kielen nuansseja. Nämä LLM-työkalut, jotka on integroitu yritysten tietoihin, voivat sujuvoittaa pääsyn ja tehdä oikean tiedon saataville oikeille ihmisille oikeaan aikaan.

Dattaraj Rao, Chief Data Scientist at Persistent Systems, on kirjan “Keras to Kubernetes: The Journey of a Machine Learning Model to Production” kirjoittaja. Persistent Systemsissä Dattaraj johtaa AI-tutkimuslaboratoriota, joka tutkii tietokoneen näön, luonnollisen kielen ymmärtämisen, todennäköisyysohjelmoinnin, vahvistusoppimisen, selitettävän AI:n jne. alan huipputason algoritmeja ja osoittaa niiden soveltamiskelpoisuuden terveydenhuollossa, pankkitoiminnassa ja teollisuusaloilla. Dattarajilla on 11 patenttia koneoppimisessa ja tietokoneen näössä.