AI-modeller og platforme

Kampen mellem Open Source og Closed Source Sprogmodeller: En Teknisk Analyse

mm
Føj Unite.AI til dine foretrukne kilder på Google

Store sprogmodeller (LLM’er) har fascineret AI-samfundet i de seneste år og har været med til at skabe gennembrud i naturlig sprogbehandling. Bag alle de store forventninger ligger der en kompleks debat – skal disse kraftfulde modeller være open source eller closed source?

I denne artikel vil vi analysere den tekniske differentiering mellem disse tilgange for at forstå mulighederne og begrænsningerne, som hver især præsenterer. Vi vil dække følgende nøgleaspekter:

  • Definering af open source og closed source LLM’er
  • Arkitektonisk gennemsigtighed og tilpasning
  • Ydelsestest
  • Computermæssige krav
  • Anvendelsesmuligheder
  • Tilgængelighed og licens
  • Databeskyttelse og fortrolighed
  • Kommerciel støtte og backing

Til sidst vil du have en informeret perspektiv på de tekniske kompromiser mellem open source og closed source LLM’er, der kan vejlede din egen AI-strategi. Lad os dykke ned i!

Definering af Open Source og Closed Source LLM’er

Open source LLM’er har offentligt tilgængelige modellarkitekturer, kildekode og vægtparametre. Dette giver forskere mulighed for at undersøge interne komponenter, evaluere kvalitet, reproducerer resultater og opbygge brugerdefinerede varianter. Førende eksempler omfatter Anthropics ConstitutionalAI, Metas LLaMA og EleutherAIs GPT-NeoX.

I modsætning hertil behandler closed source LLM’er modellarkitektur og vægt som proprietære aktiver. Kommercielle enheder som Anthropic, DeepMind og OpenAI udvikler dem internt. Uden adgang til kode eller designdetaljer er reproducerbarhed og tilpasning begrænset.

Arkitektonisk Gennemsigtighed og Tilpasning

Adgang til open source LLM’ers interne komponenter låser op for tilpasningsmuligheder, der ikke er mulige med closed source-alternativer.

Ved at justere modellarkitekturen kan forskere udforske teknikker som introduktion af sparsomme forbindelser mellem lag eller tilføje dedikerede klassifikationstoken for at forbedre ydelsen på nicheopgaver. Med adgang til vægtparametre kan udviklere overføre eksisterende repræsentationer eller initialisere varianter med forudtrænede byggeklodser som T5 og BERT-embedding.

Denne tilpasning giver open source LLM’er mulighed for bedre at betjene specialiserede domæner som biomedicinsk forskning, kodegenerering og uddannelse. Dog kan den ekspertise, der kræves, øge barrieren for at levere produktionssikre implementationer.

Closed source LLM’er tilbyder begrænset tilpasning, da deres tekniske detaljer forbliver proprietære. Dog har deres bagmænd tildelt omfattende ressourcer til intern forskning og udvikling. De resulterende systemer driver grænserne for, hvad der er muligt med en generaliseret LLM-arkitektur.

Så selvom de er mindre fleksible, udmærker closed source LLM’er sig ved at være bredt anvendelige på naturlige sprogopgaver. De forenkler også integrationen ved at overholde etablerede grænseflader som OpenAPI-standarden.

Ydelsestest

Trods arkitektonisk gennemsigtighed introducerer måling af open source LLM’ers ydelse udfordringer. Deres fleksibilitet giver mulighed for utallige konfigurationer og tilpasningsstrategier. Det giver også mulighed for modeller, der er markeret som “open source”, faktisk at inkludere proprietære teknikker, der forvrænger sammenligninger.

Closed source LLM’er har mere klart definerede ydelsestargets, da deres bagmænd benchmark og annoncerer bestemte målniveauer. For eksempel annoncerer Anthropic ConstitutionalAIs nøjagtighed på kurerede NLU-problemsæt. Microsoft (MSFT ) fremhæver, hvordan GPT-4 overgår menneskelige baseline på SuperGLUE-sprogforståelsesværktøjet.

Det sagde, disse snævert definerede benchmark har fået kritik for at overdrive ydelsen på virkelige opgaver og underrepræsentere fejl. Sande, upartiske LLM-evalueringer forbliver et åbent forskningsspørgsmål – for både open source og closed source-tilgange.

Computermæssige Krav

Træning af store sprogmodeller kræver omfattende computermæssige ressourcer. OpenAI brugte millioner på at træne GPT-3 på cloud-infrastruktur, mens Anthropic forbrugte op til 10 millioner dollars værd af GPU’er til ConstitutionalAI.

Regningen for sådanne modeller udelukker de fleste enkeltpersoner og små teams fra open source-fællesskabet. Faktisk var EleutherAI nødt til at fjerne GPT-J-modellen fra offentlig adgang på grund af eksploderende værtgebyr.

Uden dybe lommer kan open source LLM’er kun lykkes ved at udnytte donerede computermæssige ressourcer. LAION kuraterede deres teknisk fokuserede LAION-5B-model ved hjælp af crowdsourced data. Den nonprofit Anthropic ConstitutionalAI-projekt udnyttede frivillig computing.

Den store tekniske backing fra virksomheder som Google (GOOGL ), Meta og Baidu giver closed source-bestræbelser den finansielle drivkraft, der er nødvendig for at industrialisere LLM-udvikling. Dette giver mulighed for at skala op til længder, der er ufattelige for grassroots-initiativer – se blot DeepMinds 280 milliarder parameter Gopher-model.

Anvendelsesmuligheder

Den tilpasning, der er mulig med open source LLM’er, giver mulighed for at tackle meget specialiserede anvendelsesmuligheder. Forskere kan aggressivt ændre modellens interne komponenter for at forbedre ydelsen på nicheopgaver som proteinstrukturprediktion, kode-dokumentgenerering og matematisk bevisverifikation.

Det sagde, muligheden for at få adgang til og redigere kode garanterer ikke en effektiv løsning uden den rette data. Omfattende træningsdata til smalle anvendelser kræver betydelig indsats for at kuraterer og opdatere.

Her kan closed source LLM’er drage fordel af ressourcerne til at indhente træningsdata fra interne repositoryer og kommercielle partnere. For eksempel licenserer DeepMind databaser som ChEMBL til kemi og UniProt til proteiner for at udvide anvendelsesmuligheder. Industri-størrelse adgang til data giver modeller som Gopher mulighed for at opnå bemærkelsesværdig fleksibilitet trods arkitektonisk uigennemsigtighed.

Tilgængelighed og Licens

Den tilladende licens for open source LLM’er fremmer fri adgang og samarbejde. Modeller som GPT-NeoX, LLaMA og Jurassic-1 Jumbo bruger aftaler som Creative Commons og Apache 2.0 til at aktivere ikke-kommerciel forskning og retfærdig kommerciel udnyttelse.

I modsætning hertil har closed source LLM’er restriktive licenser, der begrænser modellens tilgængelighed. Kommercielle enheder kontrollerer strengt adgangen for at beskytte potentielle indtægtsstrømme fra forudsigelses-API’er og enterprise-partnerskaber.

Forståeligt nok kræver organisationer som Anthropic og Cohere betaling for adgang til ConstitutionalAI og Cohere-512-grænseflader. Dog risikerer dette at udelukke vigtige forskningsdomæner og skæve udviklingen mod godt finansielle industrier.

Open licens udgør også udfordringer, især omkring tilskrivning og ansvar. For forskningsformål dog giver den frihed, der er givet af open source-adgang, klare fordele.

Databeskyttelse og Fortrolighed

Træningsdata til LLM’er samler typisk indhold fra forskellige online-kilder som websteder, videnskabelige artikler og diskussionsfora. Dette risikerer at afsløre personligt identificerbare eller andre følsomme oplysninger i modellens output.

For open source LLM’er giver undersøgelse af datasaftkompositionen den bedste beskyttelse mod fortrolighedsproblemer. Evaluering af datakilder, filtreringsprocedurer og dokumentation af bekymringsvækkende eksempler, der er fundet under test, kan hjælpe med at identificere sårbarheder.

Uheldigvis udelukker closed source LLM’er sådan offentlig revision. I stedet må forbrugerne stole på rigor af interne gennemgangsprocesser baseret på annoncerede politikker. For kontekst lover Azure Cognitive Services at filtrere personlige data, mens Google specificerer formelle privatlivsgennemgange og datamærkning.

I alt giver open source LLM’er mulighed for mere proaktiv identificering af fortrolighedsrisici i AI-systemer, før disse svagheder manifesterer sig i stor skala. Closed source-modeller tilbyder relativt begrænset gennemsigtighed i datahåndtering.

Kommerciel Støtte og Backing

Muligheden for at kommercialisere closed source LLM’er incentiviserer betydelig kommerciel investering i udvikling og vedligehold. For eksempel forventer Microsoft at få lukrative afkast fra sit Azure AI-portfolio og har derfor indgået multibillion-dollar-partnerskaber med OpenAI omkring GPT-modeller.

I modsætning hertil afhænger open source LLM’er af frivillige, der tildeler personlig tid til vedligehold eller bevilger midlertidige bevilgninger. Denne ressource-asymmetri risikerer kontinuiteten og langsigtetheden af open source-projekter.

Dog giver barriererne for kommerciel udnyttelse også open source-fællesskaber mulighed for at fokusere på videnskabelig fremgang frem for profit. Og den decentrale natur af open økosystemer mildner afhængigheden af en enkelt backers vedvarende interesse.

Ultimo hver tilgang medfører kompromiser omkring ressourcer og incitamenter. Closed source LLM’er nyder større finansiel sikkerhed, men koncentrerer indflydelse. Open økosystemer fremmer diversitet, men lider under forhøjet usikkerhed.

Navigering i Open Source vs Closed Source LLM-Landskabet

At vælge mellem open source eller closed source LLM’er kræver, at man matcher organisatoriske prioriteringer som tilpasning, tilgængelighed og skalerbarhed med modellens kapaciteter.

For forskere og startups giver open source mere kontrol til at tilpasse modeller til bestemte opgaver. Licensen giver også mulighed for fri deling af indsigt mellem samarbejdspartnere. Dog kan byrden af at indhente træningsdata og infrastruktur underminere virkelige muligheder.

Omvrendt lover closed source LLM’er betydelige kvalitetsforbedringer takket være omfattende finansiering og data. Dog begrænser restriktioner omkring adgang og ændringer videnskabelig gennemsigtighed, mens installationer bindes til leverandørens vejledning.

I praksis kan open standarder omkring arkitekturspecifikationer, modellcheckpoints og evalueringdata hjælpe med at afhjælpe ulemperne ved både tilgange. Fælles grundlag som Googles Transformer eller Oxfords REALTO-benchmark forbedrer reproducerbarhed. Interoperabilitetsstandarder som ONNX giver mulighed for at kombinere komponenter fra open og closed kilder.

Ultimo hvad der betyder noget, er at vælge det rette værktøj – open source eller closed source – til opgaven. De kommercielle enheder, der støtter closed source LLM’er, har ubestridt indflydelse. Men passionen og principperne i open science-fællesskaber vil fortsat spille en afgørende rolle i at drive AI-fremgang.

Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.