AI-mallit ja alustat

OpenAI julkaisee kaupallisen version kuuluisasta tekstigeneraattorimallistaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoälytutkimuslaboratorio OpenAI aikoo tehdä kuuluisan tekstigeneraattorityökalunsa GPT-3 ostettavaksi, mikä on ensimmäinen kaupallinen tuote, jonka koneoppimisen hyväntekeväisyyssäätiö on tuottanut.

Viime vuoden helmikuussa OpenAI teki tekstigeneraattorimallinsa GPT-2 avoimeksi. GPT-2 pystyi luomaan vaikuttavasti koherentin tekstin, kun sille annettiin lyhyt aloitusviesti, ja malli katsottiin merkittävänä askeleena luonnollisen kielen prosessoinnin ja tekoälytutkimuksen aloilla. Itse asiassa OpenAI kieltäytyi aluksi julkaisemasta GPT-2-mallia, väittäen, että se oli liian vaarallinen avoimen lähdekoodin julkaisemiseen, peläten väärinkäyttöä. Kun kuitenkin versio mallista tuli jonkin aikaa saataville, ja voitto ei raportoinut havainneensa mitään todisteita pahantahtoisesta käytöstä, päätettiin tehdä malli avoimeksi. Viime aikoina OpenAI ilmoitti GPT-2:n seuraajasta, joka on nimeltään GPT-3.

GPT-3-malli on noin 100 kertaa suurempi kuin edeltäjänsä, ja juuri tätä mallia he tarjoavat kaupallisena tuotteena. GPT-2-malli koostui noin 1,5 miljardista parametrista, kun taas GPT-3 koostuu noin 175 miljardista parametrista. GPT-mallien sarjan monimutkaisuus ja luotettavuus ovat aiheuttaneet, että mallit ovat lähestymässä koneoppimishankkeiden tekstien standardia. Samoin kuin konvoluutio-neuroverkkomallit ovat tulleet oletusarvoiseksi malliksi kuvaa koskeville hankkeille, tekstien liittyvät hankkeet käyttävät yhä enenevissä määrin GPT-2:ta ja ehkä pian GPT-3:ta.

The Verge -lehden mukaan OpenAI näyttää toimivan sitoutuneesti GPT-standardin edistämiseksi tekemällä GPT-3-mallin kaupallisesti saataville. Tällä hetkellä pääsy GPT-3 API:en on kutsuilla. On kuitenkin todennäköistä, että GPT-3 tulee saataville laajemmin pian. OpenAI on ilmoittanut, että se tarkistaa asiakkaitaan estääkseen teknologian väärinkäyttöä epäeettisiin tarkoituksiin, kuten roskapostittamiseen, virheellisen tiedon levittämiseen tai häirintään.

On melko epäselvää, miten GPT-3 on tarkoitus käyttää asiakkaiden toimesta. Tämä johtunee siitä, että GPT-3 on niin joustava ja sillä on niin monia mahdollisia sovelluksia. GPT-pohjaiset mallit voidaan hienosäätää tarvittaessa luomaan tekstiä, joka on sovelias tiettyihin tehtäviin. Malli pystyy sopeutumaan laajaan valikoimaan eri aloitusviestejä ja syötteiden tyylejä, mikä tarkoittaa, että sitä voidaan käyttää tekstin tiivistämistyökaluina, yksinkertaisten kysymysten vastaamiseen tai edistyneen chatbottitoiminnan perustana. Kuten OpenAI:n chief technology officer Greg Brockman selitti Wired-lehdelle:

”Suuri mielenkiintoinen muutos on, että se on paljon enemmän kuin puhuminen ihmisen kanssa kuin muotoilu koneelle”, sanoo Greg Brockman, OpenAI:n chief technology officer. ”Sinun annetaan muutama kysymys ja vastaus, ja yhtäkkiä se on kysymys-vastaus-tilassa.”

On tuntematonta, miten luotettavia GPT-3:sta johdetut kaupalliset mallit ovat. Vaikka GPT-3 pystyy luomaan syntaktisesti oikein, luonnollisen kuulosta olevan kielen, siltä puuttuu intuitiivinen ymmärrys siitä, miten asioiden käsitteet liittyvät toisiinsa. Tämä voi osoittautua ongelmalliseksi sovelluksissa, joissa asiayhteyden säilyttäminen on erityisen tärkeää, kuten asiakastukea varten suunniteltujen chatbottien tapauksessa.

Joe Davison, tutkimusinsinööri Hugging Facessa, totesi Digital Trends -lehdelle, että GPT-3:n valtava koko voi rajoittaa sen mahdollisia sovelluksia. Davison väitti, että vaikka OpenAI on edennyt merkittävästi tekstigeneraation osalta, osoittamalla, että yleispätevien mallien luominen voi vähentää tehtävikohtaisen datan tarvetta, GPT-3:n käyttöön vaadittavat laskentaresurssit tekevät siitä melko epäkäytännöllisen monille yrityksille.

OpenAI oli aiemmin voitto, mutta vuodesta 2019 lähtien laboratorio on siirtynyt voittoa tavoittelevaan malliin. GPT-3 on laboratorion ensimmäinen suuri kaupallinen tuote, ja on nähtävä, siirtyykö OpenAI:n tutkimuksen painopisteet voittoa tavoittelevaan malliin.

Blogger ja ohjelmoija, jolla on erityisalat Machine Learning ja Deep Learning -aiheissa. Daniel toivoo pystyvänsä auttamaan muita käyttämään tekoälyn voimaa sosiaaliseen hyvään.