AI-modeller og platforme
Broen mellem store sprogmodeller og forretning: LLMops
Baggrunden for LLMâer som OpenAIâs GPT-3 eller dens efterfÃļlger GPT-4 ligger i dyb lÃĶring, en undergruppe af AI, der udnytter neurale netvÃĶrk med tre eller flere lag. Disse modeller er trÃĶnet pÃĨ enorme datasÃĶt, der omfatter et bredt spektrum af internettekst. Gennem trÃĶning lÃĶrer LLMâer at forudsige det nÃĶste ord i en sekvens, givet de ord, der er kommet fÃļr. Denne evne, enkel i sin essens, danner grundlag for LLMâers evne til at generere sammenhÃĶngende, kontekstrellevant tekst over lange sekvenser.
Potentielle anvendelser er ubegrÃĶnsede â fra udarbejdelse af e-mails, skabelse af kode, besvarelse af spÃļrgsmÃĨl til endda kreativ skrivning. Dog er det med stor magt fÃļlger stor ansvar, og hÃĨndtering af disse kÃĶmpemodeller i en produktionsmiljÃļ er ikke trivialt. Her kommer LLMOps ind i billedet, som inkarnerer en samling af bedste praksis, vÃĶrktÃļjer og processer for at sikre en pÃĨlidelig, sikker og effektiv drift af LLMâer.
Vejen til LLM-integration har tre fremherskende ruter:
- Prompting af generelle LLMâer:
- Modeller som ChatGPT og Bard tilbyder en lav barrierer for adoption med minimalt forhÃĨndskost, selvom der kan vÃĶre en potentiel pris pÃĨ lang sigt.
- Dog hviler skyggerne af dataintegritet og -sikkerhed tungt, isÃĶr for sektorer som Fintech og sundhedssektoren med stramme reguleringsrammer.
- Finjustering af generelle LLMâer:
- Med open-source-modeller som Llama, Falcon og Mistral kan organisationer tilpasse disse LLMâer til at harmonere med deres specifikke brugsomrÃĨder med kun modeltilpasningsressourcer som omkostning.
- Denne vej, der bÃĨde lÃļser bekymringer om privatliv og sikkerhed, krÃĶver en mere omfattende modelvalg, dataforberedning, finjustering, implementering og overvÃĨgning.
- Den cykliske natur af denne rute krÃĶver en vedvarende engagement, men nyere innovationer som LoRA (Low-Rank Adaptation) og Q(Quantized)-LoRa har strÃļmlinet finjusteringsprocessen, hvilket gÃļr det til en stadig mere populÃĶr valg.
- Tilpasning af LLMâer:
- Udvikling af en LLM fra bunden lover en ubesvÃĶret prÃĶcision tilpasset opgaven. Dog stiller de hÃļje krav til AI-ekspertise, beregningsressourcer, omfattende data og tidsinvesteringen betydelige hindringer.
Af de tre er finjusteringen af generelle LLMâer den mest gunstige mulighed for virksomheder. At opbygge en ny grundmodel kan koste op til 100 millioner dollars, mens finjustering af eksisterende modeller varierer mellem 100.000 til 1 million dollars. Disse tal stammer fra beregningsomkostninger, dataanskaffelse og -mÃĶrkning samt udviklings- og forskningsudgifter.
LLMOps versus MLOps
Machine learning operations (MLOps) har vÃĶret en velafprÃļvet vej, der tilbyder en struktureret vej til at overfÃļre machine learning (ML)-modeller fra udvikling til produktion. Dog med opkomsten af store sprogmodeller (LLMâer) er der opstÃĨet et nyt operativt paradigme, betegnet LLMOps, for at tackle de unikke udfordringer forbundet med implementering og drift af LLMâer. Forskellen mellem LLMOps og MLOps ligger pÃĨ flere punkter:
- Beregningsressourcer:
- LLMâer krÃĶver en betydelig beregningskraft til trÃĶning og finjustering, ofte nÃļdvendiggÃļrende specialiseret hardware som GPUâer til at accelerere data-parallele operationer.
- Omkostningerne ved inferens understreger endnu mere vigtigheden af modelkomprimering og -destillationsteknikker for at reducere beregningsomkostninger.
- OverfÃļring af lÃĶring:
- I modsÃĶtning til konventionelle ML-modeller, der ofte trÃĶnes fra bunden, hviler LLMâer tungt pÃĨ overfÃļring af lÃĶring, hvor man starter med en fortrÃĶnet model og finjusterer den for bestemte domÃĶneopgaver.
- Dette tilgang reducerer omkostningerne ved data og beregningsressourcer, samtidig med at det opnÃĨr state-of-the-art-prÃĶstation.
- Menneskelig feedback-lÃļkke:
- Forbedringen af LLMâer drives i hÃļj grad af forstÃĶrket lÃĶring fra menneskelig feedback (RLHF).
- Integration af en feedback-lÃļkke i LLMOps-pipelines gÃļr ikke kun evalueringen lettere, men driver ogsÃĨ finjusteringsprocessen.
- Hyperparameter-justering:
- Mens klassisk ML fokuserer pÃĨ forbedring af nÃļjagtighed via hyperparameter-justering, omfatter fokusomrÃĨdet i LLM ogsÃĨ reduktion af beregningskrav.
- Justering af parametre som batch-stÃļrrelser og lÃĶringsrater kan markant ÃĶndre trÃĶningshastighed og -omkostninger.
- PrÃĶstationsmetrik:
- Traditionelle ML-modeller holder fast i veldefinerede prÃĶstationsmetrik som nÃļjagtighed, AUC eller F1-score, mens LLMâer har en anden metrik-sÃĶt som BLEU og ROUGE.
- BLEU og ROUGE er metrikker, der bruges til at evaluere kvaliteten af maskin-genererede oversÃĶttelser og sammenfattelser. BLEU bruges primÃĶrt til maskinoversÃĶttelse, mens ROUGE bruges til tekst-sammenfattningsopgaver.
- BLEU mÃĨler prÃĶcision, eller hvor meget ordene i maskin-genererede sammenfattelser optrÃĶder i menneskelige referencesammenfattelser. ROUGE mÃĨler genkald, eller hvor meget ordene i menneskelige referencesammenfattelser optrÃĶder i maskin-genererede sammenfattelser.
- Prompt-teknik:
- PrÃĶcis prompt-teknik er afgÃļrende for at fremkalde prÃĶcise og pÃĨlidelige svar fra LLMâer, og reducerer risici som model-hallucination og prompt-hacking.
- LLM-pipelines-konstruktion:
- VÃĶrktÃļjer som LangChain eller LlamaIndex muliggÃļr opbygning af LLM-pipelines, der forbinder multiple LLM-kald eller eksterne system-interaktioner for komplekse opgaver som videnbasen Q&A.
ForstÃĨelse af LLMOps-arbejdsgangen: En dybdegÃĨende analyse
Sprogmodeloperations, eller LLMOps, ligner den operative rygrad af store sprogmodeller, sikrer en problemfri drift og integration pÃĨ tvÃĶrs af forskellige anvendelser. Mens det ligner en variant af MLOps eller DevOps, har LLMOps unikke nuancer, der tilgodeser store sprogmodellers krav. Lad os dykke ned i LLMOps-arbejdsgangen, som vist i illustrationen, og udforske hver fase omfattende.
- TrÃĶningsdata:
- Essensen af en sprogmodel ligger i dens trÃĶningsdata. Dette trin indebÃĶrer indsamling af datasÃĶt, sikring af, at de er rensede, balancerede og passende annoterede. Datans kvalitet og diversitet har en betydelig indvirkning pÃĨ modellens nÃļjagtighed og fleksibilitet. I LLMOps ligger fokus ikke kun pÃĨ mÃĶngde, men ogsÃĨ pÃĨ tilpasning til modellens Ãļnskede brugsomrÃĨde.
- Open Source-grundmodel:
- Illustrationen henviser til en âOpen Source-grundmodelâ, en fortrÃĶnet model, der ofte udgives af fÃļrende AI-entiteter. Disse modeller, trÃĶnet pÃĨ store datasÃĶt, tjener som en fremragende udgangspunkt, som sparer tid og ressourcer, og muliggÃļr finjustering for bestemte opgaver i stedet for at trÃĶne en ny model.
- TrÃĶning / Tilpasning:
- Med en grundmodel og specifik trÃĶningsdata fÃļlger tilpasning. Dette trin forfiner modellen for specialiserede formÃĨl, som f.eks. finjustering af en generel tekstmodel med medicinsk litteratur for sundhedsanvendelser. I LLMOps er omhyggelig tilpasning med konstante checks afgÃļrende for at forhindre overtilpasning og sikre god generalisering til usete data.
- TrÃĶnet model:
- Efter tilpasning opstÃĨr en trÃĶnet model, der er klar til implementering. Denne model, en forbedret version af grundmodellen, er nu specialiseret til en bestemt anvendelse. Den kan vÃĶre open-source med offentligt tilgÃĶngelige vÃĶgte og arkitektur eller proprietÃĶr, holdt hemmelig af organisationen.
- Implementer:
- Implementering indebÃĶrer integration af modellen i et live-miljÃļ for rigtig verden-bearbejdning. Det indebÃĶrer beslutninger om vÃĶrt, enten pÃĨ lokal maskine eller pÃĨ cloud-platforme. I LLMOps er overvejelser omkring latency, beregningsomkostninger og tilgÃĶngelighed afgÃļrende, sammen med sikring af, at modellen skalerer godt for mange samtidige anmodninger.
- Prompt:
- I sprogmodeller er en prompt en input-spÃļrgsmÃĨl eller udsagn. Opbygning af effektive prompts, ofte krÃĶvende modeladfÃĶrdforstÃĨelse, er afgÃļrende for at fremkalde Ãļnskede output, nÃĨr modellen bearbejder disse prompts.
- Indlejringslager eller Vektordatabaser:
- Efter bearbejdning kan modeller returnere mere end almindelig tekstoutput. Avancerede anvendelser kan krÃĶve indlejring â hÃļjdimensionelle vektorer, der reprÃĶsenterer semantisk indhold. Disse indlejring kan gemmes eller tilbydes som en service, hvilket muliggÃļr hurtig tilgang eller sammenligning af semantisk information, og beriger mÃĨden, modellens evner udnyttes pÃĨ, ud over almindelig tekstgenerering.
- Implementeret model (selv-vÃĶrt eller API):
- NÃĨr bearbejdet er fÃĶrdigt, er modellens output klar. AfhÃĶngigt af strategien kan output nÃĨs via en selv-vÃĶrtet interface eller en API, hvor den fÃļrstnÃĶvnte tilbyder mere kontrol til vÃĶrtsorganisationen, og den sidstnÃĶvnte tilbyder skalerbarhed og let integration for tredjepartsudviklere.
- Output:
- Dette trin resulterer i den konkrete output af arbejdsgangen. Modellen tager en prompt, bearbejder den og returnerer en output, der afhÃĶngigt af anvendelsen kan vÃĶre tekstblokke, svar, genererede historier eller endda indlejring, som omtalt.
Top LLM-startups
Landskabet for store sprogmodeller (LLMOps) har oplevet opkomsten af specialiserede platforme og startups. Her er to startups/platforme og deres beskrivelser i forhold til LLMOps-omrÃĨdet:
Comet strÃļmliner maskinlÃĶringslivscyklussen, specielt rettet mod udvikling af store sprogmodeller. Det tilbyder faciliteter for at spore eksperimenter og administrere produktionsmodeller. Platformen er velegnet til store virksomheds teams og tilbyder forskellige implementeringsstrategier, herunder private cloud, hybrid og lokal installation.
Dify
Dify er en open-source LLMOps-platform, der hjÃĶlper med udviklingen af AI-applikationer, der anvender store sprogmodeller som GPT-4. Den tilbyder en brugervenlig interface og giver problemfri adgang til modeller, kontekst-indlejring, omkostningskontrol og data-annoteringsfunktioner. Brugere kan let administrere deres modeller visuelt og anvende dokumenter, webindhold eller Notion-noter som AI-kontekst, som Dify hÃĨndterer for forarbejdning og andre operationer.
Portkey.ai
Portkey.ai er en indisk startup, der specialiserer sig i sprogmodeloperations (LLMOps). Med en nylig seed-finansiering pÃĨ 3 millioner dollars, ledet af Lightspeed Venture Partners, tilbyder Portkey.ai integrationer med betydelige store sprogmodeller som dem fra OpenAI og Anthropic. Deres tjenester er rettet mod generative AI-virksomheder, der fokuserer pÃĨ at forbedre deres LLM-operationsstak, der inkluderer realtids-canary-test og model-finjusteringsfunktioner.













