AI-mallit ja alustat

Generatiivinen tekoäly: Idea CHATGPT:n, DALL-E:n, Midjourneyn ja muiden taustalla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Maailma taide, viestintä ja todellisuuden havainnointi muuttuvat nopeasti. Jos tarkastelemme ihmisen innovaatiohistoriaa, voimme pitää esimerkiksi pyörän keksimistä tai sähkön löytymistä merkittävinä harppauksina. Nykyään uusi vallankumous on käynnissä – se siltaa ihmisen luovuuden ja koneen laskennan välimaastoa. Tämä on generatiivinen tekoäly.

Generatiiviset mallit ovat hämärtäneet ihmisten ja koneiden välisen rajan. GPT-4-mallin myötä, joka käyttää transformer-moduuleja, olemme edenneet luonnollisen ja kontekstirikkaan kielen generoimisen suhteen. Nämä edistysaskeleet ovat lisänneet sovelluksia asiakirjojen luomisessa, chatbot-viestintäjärjestelmissä ja jopa synteettisessä musiikin sävellyksessä.

Viimeaikaiset suurten teknologiayritysten päätökset korostavat sen merkitystä. Microsoft (MSFT ) lopettaa jo tänä kuukausina Cortana-sovelluksensa priorisoidakseen uudempia generatiivisen tekoälyn innovaatioita, kuten Bing Chat. Apple (AAPL ) on myös omannut merkittävän osan $22,6 miljardin tutkimus- ja kehitysbudjetistaan generatiiviseen tekoälyyn, kuten toimitusjohtaja Tim Cook on ilmoittanut.

Uusi aikakausi malleissa: Generatiivinen vs. Diskriminointi

Generatiivisen tekoälyn tarina ei ole vain sovelluksista, vaan myös sen sisäisistä toimintaperiaatteista. Tekoälyekosysteemissä on kaksi mallia: diskriminointi ja generointi.

Diskriminointimallit ovat sellaisia, joita useimmat ihmiset kohtaavat päivittäin. Nämä algoritmit ottavat syötteen, kuten tekstin tai kuvan, ja parittavat sen kohdeulostulokseen, kuten käännökseen tai lääketieteelliseen diagnoosiin. Ne ovat karttamisen ja ennustamisen asioita.

Generatiiviset mallit ovat luojia. Ne eivät ainoastaan tulkkaa tai ennusta; ne luovat uusia, monimutkaisia ulostuloja numerovektoreista, jotka usein eivät liity todellisiin arvoihin.

 

Generatiivisen tekoälyn tyypit: Teksti-teksti, teksti-kuva (GPT, DALL-E, Midjourney)

Generatiivisten mallien taustalla olevat teknologiat

Generatiiviset mallit ovat olemassa syvien neuroverkkorakenteiden ansiosta, jotka on suunniteltu jäljittelemään ihmisaivojen toimintaa. Vangitsemalla ja prosessoidessaan monimuotoisia muutoksia datasta, nämä verkot toimivat useiden generatiivisten mallien selkärankana.

Miten nämä generatiiviset mallit syntyvät? Yleensä ne rakennetaan syvien neuroverkkorakenteiden avulla, jotka on optimoitu vangitsemaan monimuotoisia muutoksia datasta. Esimerkki on Generative Adversarial Network (GAN), jossa kaksi neuroverkkoa, generoija ja diskriminoija, kilpailevat ja oppivat toisiltaan ainutlaatuisessa opettaja-oppija-suhteessa. Maalauksista tyylin siirtämiseen, musiikin sävellyksestä pelien pelaamiseen, nämä mallit kehittyvät ja laajenevat tavoin, joita ei aiemmin voitu kuvitella.

Tämä ei lopu GAN:ien kohdalla. Variational Autoencoders (VAEs) ovat toinen tärkeä osa generatiivisten mallien kentässä. VAE:t erottuvat kyvystään luoda fotorealistisia kuvia näennäisesti satunnaisista numeroista. Miten? Käsittelemällä näitä numeroita latentti-vektorin kautta, syntyy taidetta, joka heijastaa ihmisen esteettisten kokemusten monimuotoisuutta.

Generatiivisen tekoälyn tyypit: Teksti-teksti, teksti-kuva

Transformerit ja LLM

Google (GOOGL ) Brainin julkaisema ” Attention Is All You Need” -artikkeli merkitsi muutosta siinä, miten ajattelemme tekstien mallinnusta. Sen sijaan, että olisi käytetty monimutkaisia ja peräkkäisiä arkkitehtuureja kuten Recurrent Neural Networks (RNN) tai Convolutional Neural Networks (CNN), Transformer-malli esitteli huomion käsitteen, joka tarkoitti keskittymistä eri osiin syötetekstissä kontekstin mukaan. Yksi näiden etuja oli helppo rinnakkaisuus. Toisin kuin RNN:t, jotka prosessoi tekstiä peräkkäin, mikä tekee niistä vaikeampia skaalata, Transformerit voivat prosessoida tekstiosia samanaikaisesti, mikä tekee koulutuksesta nopeamman ja tehokkaamman suurilla tietojoukoilla.

Pitkässä tekstissä ei jokainen sana tai lause, jota luet, ole yhtä tärkeä. Jotkut osat vaativat enemmän huomiota kontekstin perusteella. Tämä kyky siirtää fokus perustuu huomio-mekanismiin, jonka Transformerit käyttävät.

Ymmärtääksemme tämän, ajatellaan lausetta: “Unite AI julkaisee tekoäly- ja robotiikka-uutisia.” Ennustettaessa seuraavaa sanaa vaaditaan ymmärrys siitä, mikä on tärkeintä edellisessä kontekstissa. Termi ‘Robotiikka’ saattaa viitata siihen, että seuraava sana liittyy johonkin tiettyyn edistykseen tai tapahtumaan robotiikan alalla, kun taas ‘julkaisee’ saattaa osoittaa, että seuraava konteksti liittyy johonkin viimeaikaiseen julkaisuun tai artikkeliin.

Itsehuomio-mekanismin selitys esimerkkilauseella
Itsehuomio-illustraatio

Huomio-mekanismit Transformerissa on suunniteltu saavuttamaan tämä valikoiva fokus. Ne arvioivat eri osien syötetekstissä olevan merkityksen ja päättävät, mihin “katsoa” vastauksen luomisen aikana. Tämä poikkeaa vanhemmista arkkitehtuureista kuten RNN:istä, jotka yrittivät pakata koko syötetekstin olemuksen yhteen ’tilaan’ tai ‘muistiin’.

Huomion toimintaa voidaan verrata avain-arvojärjestelmään. Yritettäessä ennustaa seuraavaa sanaa, jokainen edeltävä sana tarjoaa ‘avaimen’, joka viittaa sen potentiaaliseen merkitykseen, ja perustuen siihen, miten hyvin nämä avaimet vastaavat nykyistä kontekstia (tai kysymystä), ne vaikuttavat ‘arvoon’ tai painotukseen ennustuksessa.

Nämä edistyneet tekoälymallit ovat sulautuneet eri sovelluksiin, kuten Google-haun parannuksiin BERT:n avulla ja GitHubin Copilotiin, joka hyödyntää Large Language Models (LLM) -teknologiaa muuttaakseen yksinkertaiset koodinpätkät täysimittaisiksi lähdekoodiksi.

Large Language Models (LLM) kuten GPT-4, Bard ja LLaMA ovat valtavat rakenteet, jotka on suunniteltu tulkitsemaan ja generoimaan ihmisten kieltä, koodia ja muuta. Niiden valtava koko, joka vaihtelee miljardeista triljooniin parametreihin, on yksi niiden määrittävistä piirteistä. Nämä LLM:t on koulutettu valtavilla määrillä tekstidataa, mikä mahdollistaa niiden ymmärtämän ihmisen kielen monimuotoisuuden. Yksi näiden mallien huomattavista ominaisuuksista on niiden “vähäiskaltainen” oppimiskyky. Toisin kuin perinteiset mallit, jotka tarvitsevat laajan määrän koulutusdataa, LLM:t voivat yleistää hyvin vähäisestä määrästä esimerkkejä (tai “laukauksia”)

Large Language Models (LLM) tilanne vuoden 2023 puolivälin jälkeen

Mallin nimi Kehittäjä Parametrit Saatavuus ja pääsy Merkittävät ominaisuudet ja huomautukset
GPT-4 OpenAI 1,5 biljoonaa Ei avoimen lähdekoodin, ainoastaan API-pääsy Vaikuttava suorituskyky monilla tehtävillä, pystyy prosessoimaan kuvia ja tekstiä, maksimi syötteen pituus 32 768 merkkiä
GPT-3 OpenAI 175 miljardia Ei avoimen lähdekoodin, ainoastaan API-pääsy Osoittanut vähäiskaltainen ja nollakaltainen oppimiskyky. Suorittaa tekstin täydentämisen luonnollisella kielellä.
BLOOM BigScience 176 miljardia Ladattava malli, isäntä-PI-palvelu saatavilla Monikielinen LLM, kehitetty globaalina yhteistyönä. Tukee 13 ohjelmointikieltä.
LaMDA Google 173 miljardia Ei avoimen lähdekoodin, ei API- tai latauspääsyä Koulutettu dialogeihin, voi oppia puhumaan lähes mistä tahansa.
MT-NLG Nvidia /Microsoft 530 miljardia API-pääsy hakemuksen kautta Käyttää transformer-pohjaista Megatron-arkkitehtuuria eri NLP-tehtävissä.
LLaMA Meta AI 7B – 65B) Ladattava hakemuksen kautta Tarkoitettu tekoälyn demokratisoimiseen tarjoamalla pääsyn tutkimukseen, hallintoon ja akatemiaan.

Miten LLM:t käytetään?

LLM:t voidaan käyttää monin tavoin, mukaan lukien:

  1. Suora käyttö: Käyttäminen valmiina LLM:änä tekstien generoimiseen tai prosessointiin. Esimerkiksi käyttäminen GPT-4:ää blogipostauksen kirjoittamiseen ilman lisäkoulutusta.
  2. Hienosäätö: Sovittaminen pre-trainattuun LLM:ään tiettyyn tehtävään, jota kutsutaan siirtymällä oppimiseksi. Esimerkki on T5-mallin mukauttaminen tietylle teollisuudelle dokumenttien tiivistämiseen.
  3. Tiedon hakeminen: Käyttäminen LLM:ä osana laajempaa arkkitehtuuria kehittääkseen järjestelmiä, jotka voivat hakea ja luokitella tietoa.
Generatiivisen tekoälyn ChatGPT:n hienosäätöarkkitehtuuri
ChatGPT:n hienosäätöarkkitehtuuri

Monipäinen huomio: Miksi yksi, kun voit käyttää useita?

Riippumatta yhdestä huomio-mekanismista voi olla rajoittavaa. Erilaiset sanat tai jaksot tekstissä voivat olla erilaisia merkityksiä tai assosiaatioita. Tässä tulee monipäinen huomio. Sen sijaan, että olisi yksi joukko huomio-painoja, monipäinen huomio käyttää useita joukkoja, mikä mahdollistaa mallin vangita monipuolisemman joukon suhteita syötetekstissä. Jokainen huomio-“pää” voi keskittyä eri osiin tai tekstin osiin, ja niiden yhdistetty tieto käytetään lopulliseen ennustukseen.

ChatGPT: Suosituin generatiivinen tekoälytyökalu

GPT:n kehittämisestä lähtien vuonna 2018, malli rakennettiin 12 kerroksen, 12 huomio-pään ja 120 miljoonan parametrin perustalle, pääasiassa koulutettuna BookCorpus-tietojoukolla. Tämä oli vaikuttava aloitus, joka antoi vihjeitä kielen mallien tulevaisuudesta.

GPT-2, joka esiteltiin vuonna 2019, tarjosi nelinkertaisen kasvun kerroksissa ja huomio-päissä. Merkittävästi, sen parametri-lukumäärä nousi 1,5 miljardiin. Tämä parannettu versio sai koulutuksensa WebText-tietojoukosta, joka sisälsi 40 GB tekstiä eri Reddit-linkkeistä.

GPT-3, joka julkaistiin toukokuussa 2020, sisälsi 96 kerrosta, 96 huomio-päätä ja valtavan 175 miljardin parametrin. Se, mikä erotti GPT-3:n, oli sen monipuolinen koulutusdata, joka käsitti CommonCrawl-, WebText-, English Wikipedia-, kirjastojen ja muiden lähteiden yhteensä 570 GB.

ChatGPT:n toimintaperiaatteet ovat edelleen salaisia. On kuitenkin tiedostettu, että “vahvistusoppiminen ihmisten palautteen perusteella” (RLHF) on avainasemassa. Alkuperäisen ChatGPT-projektin lähtökohtana, tämä tekniikka oli ratkaiseva GPT-3.5-mallin kehittämisessä, jotta se olisi enemmän sopusoinnussa kirjoitettujen ohjeiden kanssa.

ChatGPT:n koulutus koostuu kolmivaiheisesta lähestymistavasta:

  1. Valvottu hienosäätö: Käyttäminen ihmisten kirjoittamia keskustelusyötteen ja ulostulon koulutusaineistona GPT-3.5-mallin parantamiseen.
  2. Palkkio-mallin muodostus: Ihmiset arvioivat eri mallin ulostulon laatua, ja tämä auttaa kouluttamaan palkkio-mallin, joka arvioi kunkin ulostulon laadun keskustelun kontekstin perusteella.
  3. Vahvistusoppiminen: Keskustelukonteksti toimii taustana, jossa malli ehdottaa vastausta. Tämä vastaus arvioidaan palkkio-mallin avulla, ja prosessi optimoidaan käyttäen Proximal Policy Optimization (PPO) -algoritmiä.

Niille, jotka aloittavat ChatGPT:n käytön, on olemassa kattava aloitusopas, joka löytyy täältä. Jos haluat syventää prompt-engineeringiin ChatGPT:ssä, meillä on myös edistynyt opas, joka valaisee viimeisimpiä ja valtavirtaista prompt-tekniikoita, saatavilla osoitteessa ‘ChatGPT & Advanced Prompt Engineering: Driving the AI Evolution‘.

Diffuusio- ja monimodaaliset mallit

Kun mallit kuten VAE:t ja GAN:t generoivat ulostulonsa yhden kierroksen kautta, jolloin ne ovat lukittuja siihen, mitä ne tuottavat, diffuusio-mallit ovat esittäneet “iteratiivisen tarkennuksen” käsitteen. Tällä menetelmällä ne palaavat, korjaavat virheitä edellisistä vaiheista ja tuottavat asteittain tarkemman tuloksen.

Diffuusio-mallien keskiössä on “turmelus” ja “tarkennus” -taiteen harjoittaminen. Koulutusvaiheessaan typillinen kuva turmellaan lisäämällä siihen eri tasoja melua. Tämä meluisa versio syötetään malliin, joka yrittää “puhdistaa” tai “korjata” sen. Useiden kierrosten jälkeen mallioppiminen parantaa ymmärrystä sekä hienoista että merkittävistä poikkeamista.

Kuva generoitu Midjourneysta
Kuva generoitu Midjourneysta

Uusien kuvien generoimisprosessi koulutuksen jälkeen on mielenkiintoinen. Aloittaen täysin satunnaistetusta syötteestä, se tarkennetaan jatkuvasti mallin ennusteiden avulla. Tavoitteena on saavuttaa täydellinen kuva mahdollisimman vähäisellä määrällä askelia. Melun tason hallinta tapahtuu “melu-aikataulun” kautta, joka määrää, kuinka paljon melua sovelletaan eri vaiheissa. Aikataulun määritys voidaan tehdä kirjastojen avulla, kuten “diffusers”, joka määrää meluisan version luonteen etukäteen määritettyjen algoritmien perusteella.

Tärkeä arkkitehtuuri useille diffuusio-malleille on UNet – konvoluutio-neuroverkko, joka on suunniteltu tehtäviin, jotka vaativat ulostulon, joka peilaa syötteen tilastollista ulottuvuutta. Se on yhdistelmä alennus- ja ylennyskerroksia, jotka on yhdistetty säilyttämään korkearesoluutioinen data, mikä on olennainen kuvien tuottamiselle.

Syventyessämme generatiivisten mallien maailmaan, OpenAI:n DALL-E 2 nousee esille yhdistämällä tekstuaalisen ja visuaalisen tekoälyn kyvyt. Se käyttää kolmivaiheista rakennetta:

DALL-E 2 esittää kolmivaiheisen arkkitehtuurin:

  1. Teksti-encoderi: Se muuttaa tekstipromptin konseptuaaliseksi upotukseksi latentti-avaruudessa. Tämä malli ei aloita tyhjästä. Se nojautuu OpenAI:n Contrastive Language–Image Pre-training (CLIP) -tietokantaan perustanaan. CLIP toimii visuaalisten ja tekstuaalisten tietojen siltaa oppimalla visuaalisia käsitteitä luonnollisen kielen avulla. Kontrastiivisen oppimisen kautta se tunnistaa ja vastaa kuvia niiden vastaaviin tekstuaalisiin kuvausten kanssa.
  2. Ensisijainen: Teksti-encoderista johdettu teksti-upotus muunnetaan kuva-upotukseksi. DALL-E 2 testasi sekä autoregressiivisiä että diffuusiivisia menetelmiä tähän tehtävään, jolloin jälkimmäinen osoitti parempia tuloksia. Autoregressiiviset mallit, kuten Transformerit ja PixelCNN, generoivat ulostulon sarjallisesti. Toisaalta diffuusiiviset mallit, kuten DALL-E 2:ssa käytetty, muuttavat satunnaisen melun ennustettuihin kuva-upotuksiin teksti-upotusten avulla.
  3. Decoderi: Prosessin huippu, jossa lopullinen visuaalinen ulostulo generoidaan tekstipromptin ja edellisestä vaiheesta saatujen kuva-upotusten perusteella. DALL-E 2:n decoderin arkkitehtuuri perustuu toiseen malliin, GLIDE:een, joka myös pystyy tuottamaan realistisia kuvia tekstiprompttien avulla.
DALL-E-mallin yksinkertaistettu arkkitehtuuri (diffuusiivinen monimalli)
Yksinkertaistettu arkkitehtuuri DALL-E-mallille

Python-käyttäjille, jotka ovat kiinnostuneita Langchainista, on olemassa yksityiskohtainen opas, joka kattaa kaiken perusteista edistyneisiin tekniikoihin.

Generatiivisen tekoälyn sovellukset

Tekstuaaliset alueet

Aloittaen tekstistä, generatiivinen tekoäly on muuttunut perustavasti chatbotien kuten ChatGPT:n myötä. Luottamuksella Natural Language Processingiin (NLP) ja suuriin kielen malleihin (LLM), nämä entiteetit kykenevät suorittamaan tehtäviä koodin generoimisesta ja kielentulkinnasta tiivistämiseen ja mielipideanalyysiin. ChatGPT on saavuttanut laajan hyväksynnän, tultuaan miljoonien käyttäjien arkeen.

Näiden mallien kaupallinen arvo on kasvamassa. Yritykset käyttävät niitä moniin toimintoihin, kuten riskienhallintaan, varastojen optimointiin ja tarpeiden ennustamiseen. Joitakin merkittäviä esimerkkejä ovat Bing AI, Google BARD ja ChatGPT API.

Taide

Kuvien maailma on kokenut dramaattisia muutoksia generatiivisen tekoälyn myötä, erityisesti DALL-E 2:n julkaisun jälkeen vuonna 2022. Tämä teknologia, joka pystyy generoimaan kuvia tekstiprompttien perusteella, on sekä taiteellista että ammattimaista merkitystä. Esimerkiksi midjourney on hyödyntänyt tätä teknologiaa tuottaakseen vaikuttavia realistisia kuvia. Tämä viimeaikainen julkaisu selventää midjourneyn yksityiskohtaisessa oppaassa, joka valaisee sekä alustan että sen prompt-engineeringin yksityiskohtia. Lisäksi alustat kuten Alpaca AI ja Photoroom AI käyttävät generatiivista tekoälyä edistyneisiin kuva-editointitoimintoihin, kuten taustan poistoon, objektiensaatoon ja jopa kasvojen palautukseen.

Video-tuotanto

Video-tuotanto, vaikka vielä alkuvaiheessa generatiivisen tekoälyn maailmassa, osoittaa lupaavia edistysaskelia. Alustat kuten Imagen Video, Meta Make A Video ja Runway Gen-2 työntävät mahdollisuuksien rajoja, vaikka täysin realistiset tulokset ovat vielä tulevaisuuden tuote. Nämä mallit tarjoavat merkittävää hyötyä digitaalisten videoiden luomiseen, ja sovellukset kuten Synthesia ja SuperCreator johtavat tätä laskua. Merkittävästi, Tavus AI tarjoaa ainutlaatuisen myyntivaltin, joka personoi videoita yksittäisille katsojille, mikä on yritysten kannalta suotuisa ominaisuus.

Koodin luominen

Koodaus, joka on välttämätön osa digitaalista maailmaamme, ei ole jäänyt generatiivisen tekoälyn ulottumattomiin. Vaikka ChatGPT on suosittu työkalu, useita muita tekoälysovelluksia on kehitetty koodaukseen. Nämä alustat, kuten GitHub Copilot, Alphacode ja CodeComplete, toimivat koodausavustajina ja voivat jopa generoida koodia tekstiprompttien perusteella. Mitä mielenkiintoista on, on näiden työkalujen sopeutumiskyky. Codex, joka on GitHub Copilotin voimanlähde, voidaan mukauttaa yksilölliseen koodaustyylille, korostaa generatiivisen tekoälyn personointipotentiaalia.

Johtopäätös

Yhdistämällä ihmisen luovuuden ja koneen laskennan, generatiivinen tekoäly on kehittynyt arvokkaaksi työkaluksi, ja alustat kuten ChatGPT ja DALL-E 2 ovat laajentaneet sitä, mitä on mahdollista.

Kuten kaikkien teknologioiden kohdalla, eettiset vaikutukset ovat tärkeitä. Vaikka generatiivinen tekoäly lupaakin rajattoman luovuuden, on tärkeää käyttää sitä vastuullisesti, olla tietoinen mahdollisista harhautumisista ja tiedon manipuloinnista.

Kun työkalut kuten ChatGPT tulevat helpommin saataville, nyt on täydellinen aika kokeilla ja kokea. Olit sitten taiteilija, koodari tai teknologia-intoilija, generatiivisen tekoälyn maailma on täynnä odottamattomia mahdollisuuksia, jotka odottavat tutkimista. Vallankumous ei ole horisontissa; se on täällä ja nyt. Joten, hypätä sisään!

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.