AI-mallit ja alustat

Avoin lähdekoodi vs. suljettu lähdekoodi: Tekninen Analyysi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Suuret kielen mallit (LLM) ovat viime vuosina hurmannet AI-yhteisöä, johtaen läpimurtoja luonnollisen kielen prosessoinnissa. Huhun taustalla on monimutkainen keskustelu – tulisiko nämä voimakkaat mallit olla avoimia vai suljettuja?

Tässä artikkelissa analyysimme teknisen eron näiden lähestymistapojen välillä, jotta ymmärtäisimme mahdollisuuksia ja rajoituksia, joita kumpikin tarjoaa. Käsittelemme seuraavia avainasioita:

  • Määrittely avoimen ja suljetun lähdekoodin LLM:lle
  • Arkkitehtuuriavain ja mukautuvuus
  • Suorituskyvyn vertailu
  • Laskennalliset vaatimukset
  • Soveltamisen monipuolisuus
  • Saavutettavuus ja lisenssi
  • Tietosuojaa ja luottamuksellisuutta
  • Kaupallinen tuki ja tuki

Lopussa sinulla on perusteltu näkemys teknisistä kompromisseista avoimen ja suljetun lähdekoodin LLM:ien välillä, jotta voit ohjata omaa AI-strategiaasi. Laitetaan homma käyntiin!

Määrittely avoimen ja suljetun lähdekoodin LLM:lle

Avoimet lähdekoodin LLM:t ovat julkisesti saatavilla olevia mallirakenteita, lähdekoodia ja painoarvoja. Tämä mahdollistaa tutkijoiden tarkastella sisäisiä rakenteita, arvioida laatua, toistaa tuloksia ja luoda mukautettuja variantteja. Johtavat esimerkit ovat Anthropicin ConstitutionalAI, Metan LLaMA ja EleutherAI:n GPT-NeoX.

Toisaalta suljetut lähdekoodin LLM:t käsittelevät mallirakennetta ja painoarvoja omistusasioina. Kaupalliset yritykset kuten Anthropic, DeepMind ja OpenAI kehittävät niitä sisäisesti. Ilman saatavilla olevaa koodia tai suunnittelutietoja, toistettavuus ja mukautuvuus kohtaavat rajoituksia.

Arkkitehtuuriavain ja mukautuvuus

Pääsy avoimiin lähdekoodin LLM:ien sisäisiin rakenteisiin avaa mukautuvuusmahdollisuuksia, joita ei ole mahdollista suljettujen lähdekoodin vaihtoehtojen kanssa.

Mallirakenteen muuttaminen mahdollistaa tutkijoille tekniikoiden kuten harvan yhteyden muodostamisen kerrosten välillä tai omistettujen luokittelutunnisteiden lisäämisen, jotta parannetaan suorituskykyä kapeilla tehtävillä. Pääsy painoarvoihin mahdollistaa kehittäjille olemassa olevien edustusten siirtämisen tai varianttien alustamisen esikoulutetuilla rakennuslohkoilla kuten T5 ja BERT:in upotukset.

Tämä mukautuvuus mahdollistaa avoimien lähdekoodin LLM:ien palvelemaan paremmin erikoistuneita aloja kuten biolääketieteellistä tutkimusta, koodin generointia ja koulutusta. Kuitenkin asiantuntemuksen vaatimus voi nostaa esteitä tuotannonlaadukkaiden toteutusten toimittamiselle.

Suljetut lähdekoodin LLM:t tarjoavat rajoitetun mukautuvuuden, koska niiden tekniset tiedot ovat omistusasioita. Kuitenkin niiden tukijat sitoutuvat laajoihin sisäisiin tutkimus- ja kehitystoimiin. Tuloksena olevat järjestelmät vievät eteenpäin sitä, mitä on mahdollista yleistetyllä LLM-arkkitehtuurilla.

Vaikka vähemmän joustava, suljetut lähdekoodin LLM:t erottuvat laajasti sovellettavissa luonnollisen kielen tehtävissä. Ne myös yksinkertaistavat integraatiota noudattamalla vakiintuneita rajapintoja kuten OpenAPI-standardeja.

Suorituskyvyn vertailu

Vaikka arkkitehtuuriavain on avoin, avoimien lähdekoodin LLM:ien suorituskyvyn mittaaminen esittää haasteita. Niiden joustavuus mahdollistaa lukuisia mahdollisia konfiguraatioita ja säätöstrategioita. Se myös mahdollistaa malleja, jotka on etiketöity “avoimiksi”, sisältävät todellisuudessa omistusasioita, jotka vääristävät vertailuja.

Suljetut lähdekoodin LLM:t ilmoittavat selvästi määritellyt suorituskykyrajan, koska heidän tukijansa mittaa ja mainostaa tiettyjä mittauskynnyksiä. Esimerkiksi Anthropic julkaisee ConstitutionalAI:n tarkin luokittelun NLU-ongelmien joukossa. Microsoft (MSFT ) korostaa, miten GPT-4 ylittää ihmisten vertailukohdat SuperGLUE-kielen ymmärtämisen työkalupakissa.

Sanottakoon, että nämä kapeasti määritellyt mittarit ovat kohtaneet arvostelua, koska ne liioittelevat suorituskykyä todellisissa tehtävissä ja aliarvioivat epäonnistumisia. Todella puolueeton LLM-arviointi on edelleen avoin tutkimuskysymys – sekä avoimille että suljettujen lähestymistavoille.

Laskennalliset vaatimukset

Suurten kielen mallien koulutus vaatii laajat laskennalliset resurssit. OpenAI käytti miljoonia koulutettaessaan GPT-3:aa pilvi-infrastruktuurissa, kun taas Anthropic kulutti ylös 10 miljoonan dollarin edestä GPU:ita ConstitutionalAI:lle.

Tällaisille malleille lasku sulkee useimmat yksilöt ja pienet tiimit avoimen lähdekoodin yhteisöstä. Itse asiassa EleutherAI joutui poistamaan GPT-J-mallin julkisesta käytöstä räjähtävien isäntäkustannusten vuoksi.

Ilman syvää taskua avoimien lähdekoodin LLM:ien menesty tarjoaa laskennallisia resursseja. LAION kokosi teknologiaan keskittyneen LAION-5B-mallin käyttäen joukkorahoitusta. Voittoa tavoittelematon Anthropic ConstitutionalAI-projekti hyödynsi vapaaehtoista laskentaa.

Suurten teknologiayritysten kuten Google (GOOGL ), Meta ja Baidu tuki antaa suljettujen lähdekoodin pyrkimyksille taloudellisen polttoaineen kehittämiseen ja ylläpitoon. Tämä mahdollistaa skaalautumisen mittakaavoja, joita grassroots-aloitteet eivät voi koskaan saavuttaa – katsokaa esimerkiksi DeepMindin 280 miljardin parametrin Gopher-mallia.

Soveltamisen monipuolisuus

Avoimien lähdekoodin LLM:ien mukautuvuus mahdollistaa hyökkäämisen erittäin erikoistuneisiin käyttökohteisiin. Tutkijat voivat aggressiivisesti muuttaa mallin sisäisiä rakenteita parantaakseen suorituskykyä kapeilla tehtävillä kuten proteiinirakenteen ennustaminen, koodin dokumentaation generointi ja matemaattisen todistuksen verifiointi.

Sanottakoon, pääsy koodiin ja sen muokkaaminen ei takaa tehokasta alan spesifistä ratkaisua ilman oikeaa dataa. Kattavat koulutusaineistot kapeille sovelluksille vaativat merkittävää ponnistelua kerätäkseen ja pitääkseen ajan tasalla.

Tässä suljetut lähdekoodin LLM:t hyötyvät resursseista lähteäkseen koulutusdataa sisäisistä repositorioista ja kaupallisista kumppaneista. Esimerkiksi DeepMind lisensoi tietokantoja kuten ChEMBL:ää kemiasta ja UniProt:ia proteiineista laajentaakseen soveltamisen ulottuvuutta. Teollisen mittakaavan dataan pääsy mahdollistaa malleille kuten Gopher saavuttaa huomattavan monipuolisuuden arkkitehtuurin epäselvyydestä huolimatta.

Saavutettavuus ja lisenssi

Avoimien lähdekoodin LLM:ien lisenssit ovat vapaat ja edistävät ilmaista pääsyä ja yhteistyötä. Mallit kuten GPT-NeoX, LLaMA ja Jurassic-1 Jumbo käyttävät sopimuksia kuten Creative Commons ja Apache 2.0 sallimaan ei-kaupallista tutkimusta ja reilua kaupallistamista.

Toisaalta suljetut lähdekoodin LLM:t sisältävät rajoittavia lisenssejä, jotka rajoittavat mallin saatavuutta. Kaupalliset yritykset kontrolloivat tiukasti pääsyä suojelemaan potentiaalisia tulovirtoja ennustus-rajapinnoista ja yritysyhteistyöstä.

Ymmärrettävästi yritykset kuten Anthropic ja Cohere veloittavat pääsystä ConstitutionalAI- ja Cohere-512-rajapintoihin. Kuitenkin tämä riski hinnan korkeus tärkeistä tutkimusaloista, vinouttaen kehitystä hyvin rahoitetuille aloille.

Avoimet lisenssit asettavat myös haasteita, erityisesti attribuutioon ja vastuuseen liittyen. Tutkimuskäyttötapauksille kuitenkin vapaudet, jotka avoimen lähdekoodin saatavuus tarjoaa, tarjoavat selviä etuja.

Tietosuojaa ja luottamuksellisuutta

LLM:ien koulutusaineistot keräävät yleensä sisältöä eri verkkolähteistä kuten verkkosivuilta, tieteellisistä artikkeleista ja keskustelufoorumeista. Tämä riski tuo esiin henkilökohtaisia tai muuten arkaluontoisia tietoja mallin tulosteissa.

Avoimien lähdekoodin LLM:ien kohdalla tietojoukon koostumuksen tarkastelu tarjoaa parhaimman esteen luottamuksellisuusongelmia vastaan. Arvioimalla tietolähteitä, suodattamismenettelyjä ja asiakirjoittamalla huolestuttavia esimerkkejä, joita havaitaan testauksen aikana, voidaan tunnistaa haavoittuvuuksia.

Valitettavasti suljetut lähdekoodin LLM:t estävät tällaisen julkisen tarkastelun. Sen sijaan kuluttajien on luotuttava sisäisen tarkasteluprosessin tiukkuuteen, joka perustuu ilmoitettuihin käytäntöihin. Esimerkiksi Azure Cognitive Services lupaa suodattaa henkilökohtaisia tietoja, kun taas Google määrittelee viralliset tietosuojakatselut ja datatunnisteet.

Kaiken kaikkiaan avoimet lähdekoodin LLM:t mahdollistavat enemmän proaktiivista tunnistamista AI-järjestelmissä olevia luottamuksellisuusriskejä ennen kuin ne ilmenevät laajassa mittakaavassa. Suljetut vastineet tarjoavat suhteellisen vähän näkyvyyttä tietojen käsittelykäytäntöihin.

Kaupallinen tuki ja tuki

Suljetun lähdekoodin LLM:ien mahdollisuus tuottaa voittoa kannustaa merkittävään kaupalliseen panostukseen kehitykseen ja ylläpitoon. Esimerkiksi odottaen tuottoisia tuloksia Azure AI -portfoliostaan, Microsoft sopi useiden miljardien dollarin arvoiset kumppanuudet OpenAI:n kanssa GPT-malleista.

Toisaalta avoimet lähdekoodin LLM:t riippuvat vapaaehtoisista, jotka omistavat henkilökohtaista aikaa ylläpitoon tai avustuksista, jotka tarjoavat rajoitetun aikaisen rahoituksen. Tämä resurssien epätasapaino riski avoimien lähdekoodin projektiensa jatkuvuutta ja kestävyyttä.

Kuitenkin kaupallistamisen esteet vapauttavat avoimet lähdekoodin yhteisöt keskittymään tieteelliseen edistymiseen voiton sijaan. Ja hajautettu luonne avoimista ekosysteemeistä lievittää riippuvuutta yhden tukijan jatkuvaan kiinnostukseen.

Lopulta kumpikin lähestymistapa sisältää kompromisseja resursseista ja kannustimista. Suljetut lähdekoodin LLM:t nauttivat suuremmasta rahoitusturvallisuudesta, mutta keskittävät vaikutusvaltaa. Avoimet ekosysteemit edistävät monimuotoisuutta, mutta kärsivät korkeamman epävarmuuden.

Navigointi avoimen ja suljetun lähdekoodin LLM -maisemassa

Päättäminen avoimen ja suljetun lähdekoodin LLM:ien välillä edellyttää organisaatioiden prioriteettien kuten mukautuvuuden, saatavuuden ja skaalautuvuuden vastaavuutta mallin ominaisuuksien kanssa.

Tutkijoille ja startup-yrityksille avoimet lähdekoodin LLM:t tarjoavat enemmän valvontaa sovittaa malleja tiettyihin tehtäviin. Lisenssit myös helpottavat vapaata jaettavuutta yhteistyökumppaneiden kanssa. Kuitenkin koulutusaineiston ja infrastruktuurin lähteen etsinti voi heikentää todellista soveltamiskykyä.

Toisaalta suljetut lähdekoodin LLM:t lupaavat merkittäviä laatuparannuksia runsaan rahoituksen ja datan ansiosta. Kuitenkin rajoitukset pääsylle ja muokkauksille rajoittavat tieteellisen avoimuuden ja sitovat käyttöönotot toimittajan tielle.

Käytännössä avoimet standardit arkkitehtuuriin, mallin tarkistuskohtiin ja arviointidataan voivat auttaa kompensoimaan kummankin lähestymistavan heikkouksia. Jaettu perusta kuten Google Transformer tai Oxfordin REALTO-benchmark parantaa toistettavuutta. Yhteensopivuusstandardit kuten ONNX sallivat sekoittaa osia avoimista ja suljetuista lähteistä.

Lopulta se, mikä on tärkeintä, on valinta oikeasta työkalusta – avoimesta tai suljetusta lähdekoodista – tehtävään. Kaupalliset yritykset, jotka tukkivat suljettuja lähdekoodin LLM:itä, kantavat kiistatonta vaikutusta. Mutta avoimen tieteen yhteisöjen intohimot ja periaatteet jatkavat pelaamista avainroolia ajamalla eteenpäin AI-edistystä.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.