AI-modeller och plattformar

Slaget mellan öppen källkod och sluten källkod för språkmodeller: En teknisk analys

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Stora språkmodeller (LLM) har fascinerat AI-samhället under de senaste åren och lett till genombrott inom naturlig språkbehandling. Bakom all uppståndelse finns en komplex debatt – bör dessa kraftfulla modeller vara öppen källkod eller sluten källkod?

I den här artikeln kommer vi att analysera de tekniska skillnaderna mellan dessa tillvägagångssätt för att förstå möjligheterna och begränsningarna som var och en presenterar. Vi kommer att täcka följande viktiga aspekter:

  • Definition av öppen källkod och sluten källkod för LLM
  • Arkitekturtransparens och anpassningsbarhet
  • Prestandamätning
  • Beräkningskrav
  • Tillämpningsmöjligheter
  • Tillgänglighet och licensiering
  • Dataskydd och konfidentialitet
  • Kommersiellt stöd och support

När vi är klara kommer du att ha en informerad syn på de tekniska avvägningarna mellan öppen källkod och sluten källkod för LLM för att vägleda din egen AI-strategi. Låt oss dyka in!

Definition av öppen källkod och sluten källkod för LLM

Öppen källkod för LLM har offentligt tillgängliga modellarkitekturer, källkod och viktparametrar. Detta tillåter forskare att inspektera interna delar, utvärdera kvalitet, reproducera resultat och skapa anpassade varianter. Ledande exempel inkluderar Anthropics ConstitutionalAI, Metas LLaMA och EleutherAIs GPT-NeoX.

I kontrast behandlar sluten källkod för LLM modellarkitektur och vikter som proprietära tillgångar. Kommersiella enheter som Anthropic, DeepMind och OpenAI utvecklar dem internt. Utan tillgänglig källkod eller designinformation möter reproducerbarhet och anpassning begränsningar.

Arkitekturtransparens och anpassningsbarhet

Tillgång till öppen källkod för LLM internt låser upp anpassningsmöjligheter som enkelt inte är möjliga med sluten källkod.

Genom att justera modellarkitektur kan forskare utforska tekniker som att införa sparse anslutning mellan lager eller lägga till dedikerade klassificeringstoken för att förbättra prestanda på nischuppgifter. Med tillgång till viktparametrar kan utvecklare överföra befintliga representationer eller initiera varianter med förtränade byggblock som T5 och BERT-inbäddningar.

Denna anpassningsbarhet låter öppen källkod för LLM bättre tjäna specialiserade områden som biomedicinsk forskning, kodgenerering och utbildning. Men den expertis som krävs kan höja tröskeln för att leverera produktionsklara implementationer.

Sluten källkod för LLM erbjuder begränsad anpassning eftersom deras tekniska detaljer förblir proprietära. Men deras bakomliggande företag allokerar omfattande resurser till intern forskning och utveckling. De resulterande systemen förbättrar gränserna för vad som är möjligt med en generaliserad LLM-arkitektur.

Så medan de är mindre flexibla, utmärker sig sluten källkod för LLM i bredt tillämpliga naturliga språkuppgifter. De förenklar också integration genom att följa etablerade gränssnitt som OpenAPI-standarden.

Prestandamätning

Trots arkitekturtransparens introducerar mätning av prestanda för öppen källkod för LLM utmaningar. Deras flexibilitet möjliggör otaliga möjliga konfigurationer och justeringsstrategier. Det låter också modeller prefixade som “öppen källkod” att faktiskt innehålla proprietära tekniker som förvränger jämförelser.

Sluten källkod för LLM skryter med mer tydligt definierade prestandamål eftersom deras bakomliggande företag mäter och annonserar specifika tröskelvärden för mått. Till exempel publicerar Anthropic ConstitutionalAIs noggrannhet på kuraterade NLU-problemuppsättningar. Microsoft (MSFT ) betonar hur GPT-4 överträffar mänskliga baslinjer på SuperGLUE-språkförståelseverktyget.

Det sagt, dessa smalt definierade benchmark har mött kritik för att överdriva prestanda på verkliga uppgifter och underrepresentera misslyckanden. Verkligen opartisk LLM-utvärdering förblir ett öppet forskningsproblem – för både öppen källkod och sluten källkod.

Beräkningskrav

Träning av stora språkmodeller kräver omfattande beräkningsresurser. OpenAI spenderade miljoner på att träna GPT-3 på molninfrastruktur, medan Anthropic konsumerade upp till 10 miljoner dollar värde av GPU:er för ConstitutionalAI.

Kostnaden för sådana modeller utesluter de flesta individer och små team från öppen källkodsamhället. I själva verket var EleutherAI tvungen att ta bort GPT-J-modellen från offentlig åtkomst på grund av exploderande värdkostnader.

Utan djupa fickor kan öppen källkodsframgångsberättelser utnyttja donerade beräkningsresurser. LAION kuraterade sin tekniktunga LAION-5B-modell med hjälp av crowdsourcad data. Den icke-vinstdrivande Anthropic ConstitutionalAI-projektet använde frivilligberäkning.

Det stora teknikstödet från företag som Google (GOOGL ), Meta och Baidu tillhandahåller sluten källkodsinsatser den finansiella bränsle som behövs för att industrialisera LLM-utveckling. Detta möjliggör skalning till längder som är ofattbara för gräsrotsinitiativ – se DeepMinds 280 miljarder parametrar Gopher-modell.

Tillämpningsmöjligheter

Anpassningsbarheten hos öppen källkod för LLM ger kraft att tackla högt specialiserade användningsfall. Forskare kan aggressivt modifiera modellinternt för att förbättra prestanda på nischuppgifter som proteinstrukturprediktion, koddokumentgenerering och matematisk bevisverifiering.

Det sagt, möjligheten att komma åt och redigera kod garanterar inte en effektiv domänspecifik lösning utan rätt data. Omfattande träningsdatabaser för smala tillämpningar kräver betydande ansträngningar för att kuratera och hålla uppdaterade.

Här gynnas sluten källkod för LLM av resurserna för att källa träningsdata från interna databaser och kommersiella partners. Till exempel licensierar DeepMind databaser som ChEMBL för kemi och UniProt för proteiner för att utöka tillämpningsområdet. Industriell skala för dataåtkomst låter modeller som Gopher uppnå anmärkningsvärd anpassningsförmåga trots arkitektur opakhet.

Tillgänglighet och licensiering

Den tillåtande licensieringen av öppen källkod för LLM främjar fri åtkomst och samarbete. Modeller som GPT-NeoX, LLaMA och Jurassic-1 Jumbo använder avtal som Creative Commons och Apache 2.0 för att möjliggöra icke-kommersiell forskning och rättvis kommersialisering.

I kontrast bär sluten källkod för LLM restriktiva licenser som begränsar modelltillgänglighet. Kommersiella enheter kontrollerar åtkomst till modeller för att skydda potentiella intäktsflöden från förutsägelse-API:er och företagspartnerskap.

Förståeligt nog tar organisationer som Anthropic och Cohere betalt för åtkomst till ConstitutionalAI- och Cohere-512-gränssnitt. Men det riskerar att prissätta viktiga forskningsområden, snedvrida utveckling mot välfinansierade branscher.

Öppen licensiering medför också utmaningar, särskilt kring tillskrivning och ansvar. För forskningsanvändningsfall erbjuder dock de friheter som ges av öppen källkodsåtkomst tydliga fördelar.

Dataskydd och konfidentialitet

Träningsdatabaser för LLM innehåller vanligtvis innehåll från olika onlinekällor som webbsidor, vetenskapliga artiklar och diskussionsforum. Detta riskerar att exponera personligt identifierbar eller annan känslig information i modellutdata.

För öppen källkod för LLM erbjuder granskning av databassammansättning det bästa skyddet mot konfidentialitetsproblem. Utvärdering av datakällor, filterförfaranden och dokumentation av besvärande exempel som hittas under testning kan hjälpa till att identifiera sårbarheter.

Tyvärr utesluter sluten källkod för LLM en sådan offentlig granskning. Istället måste konsumenter förlita sig på rigor av interna granskningsprocesser baserade på tillkännagivna policys. För sammanhang lovar Azure Cognitive Services att filtrera personuppgifter medan Google specificerar formella sekretessgranskningar och datamärkning.

Sammanfattningsvis ger öppen källkod för LLM möjlighet till mer proaktiv identifiering av konfidentialitetsrisker i AI-system innan dessa brister manifesterar sig i stor skala. Sluten källkod erbjuder relativt begränsad insyn i datahanteringspraxis.

Kommersiellt stöd och support

Möjligheten att kommersialisera sluten källkod för LLM inciterar betydande kommersiella investeringar för utveckling och underhåll. Till exempel, i förväntan av lukrativa avkastningar från sin Azure AI-portfölj, gick Microsoft med på multibilliondollarpartnerskap med OpenAI kring GPT-modeller.

I kontrast förlitar sig öppen källkod för LLM på volontärer som allokerar personlig tid för underhåll eller bidrag som tillhandahåller begränsad tidsbegränsad finansiering. Denna resursasymmetri riskerar kontinuitet och långsiktighet hos öppen källkodsprojekt.

Men hinder för kommersialisering frigör också öppen källkodssamhällen att fokusera på vetenskaplig framsteg över vinst. Och den decentraliserade naturen hos öppna ekosystem mildrar beroende av det bestående intresset för en enskild bakomliggande part.

Slutligen bär varje tillvägagångssätt med sig avvägningar kring resurser och incitament. Sluten källkod för LLM njuter av större finansieringssäkerhet men koncentrerar inflytande. Öppna ekosystem främjar mångfald men lider av förhöjd osäkerhet.

Att navigera i landskapet för öppen källkod och sluten källkod för LLM

Att bestämma sig för öppen källkod eller sluten källkod för LLM kräver att organisatoriska prioriteringar som anpassningsbarhet, tillgänglighet och skalbarhet matchas med modellförmågor.

För forskare och startups erbjuder öppen källkod större kontroll för att justera modeller till specifika uppgifter. Licensieringen underlättar också fri delning av insikter mellan samarbetspartners. Men bördan av att källa träningsdata och infrastruktur kan undergräva verklig livskraft.

I kontrast lovar sluten källkod för LLM betydande kvalitetsförbättringar tack vare omfattande finansiering och data. Men begränsningar kring åtkomst och modifieringar begränsar vetenskaplig transparens samtidigt som de binder distributioner till leverantörsroadmaps.

I praktiken kan öppna standarder kring arkitekturspecifikationer, modellcheckpunkter och utvärderingsdata hjälpa till att kompensera för båda tillvägagångssättens svagheter. Delade grunder som Googles Transformer eller Oxfords REALTO-benchmark förbättrar reproducerbarhet. Interoperabilitetsstandarder som ONNX tillåter blandning av komponenter från öppna och slutna källor.

Slutligen är det viktigt att välja rätt verktyg – öppen källkod eller sluten källkod – för uppgiften i fråga. De kommersiella enheterna som stöder sluten källkod för LLM har otvivelaktigt inflytande. Men passionen och principerna för öppen vetenskapliga samhällen kommer att fortsätta spela en avgörande roll för att driva AI-framsteg.

Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.