Tankeledere

Tilpassede LLM’er for hver bedrift? DeepSeek viser veien

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En gang var teknologiens klaringskall «mobiltelefoner for alle» – og faktisk har mobilkommunikasjon revolusjonert bedriftslivet (og verden). I dag er det tilsvarende opprop å gi alle tilgang til AI-applikasjoner. Men den virkelige kraften i AI ligger i å utnytte den for de spesifikke behovene til bedrifter og organisasjoner. Veien som den kinesiske startupen DeepSeek har banet, viser hvordan AI kan utnyttes av alle, spesielt de med begrensede budsjetter, for å møte deres spesifikke behov. Faktisk lover ankomsten av lavere-kostnads AI å endre det dypt inarbeidede mønsteret av AI-løsninger som ofte forblir utenfor syn for mange små bedrifter og organisasjoner på grunn av kostnadskrav.

LLM’er er – eller var – et kostbar bedrift, som krever tilgang til massive mengder data, store mengder kraftige datamaskiner for å prosessere data, og tid og ressurser investert i å trene modellen. Men disse reglene endres. DeepSeek utviklet sin egen LLM og en ChatGPT-liknende applikasjon for spørsmål – med en mye mindre investering enn for tilsvarende systemer bygget av amerikanske og europeiske selskaper. Tilnærmingen til DeepSeek åpner et vindu inn i LLM-utvikling for mindre organisasjoner som ikke har milliarder å bruke. Faktisk kan dagen ikke være langt unna når de fleste små organisasjoner kan utvikle sine egne LLM’er for å møte sine spesifikke formål, vanligvis tilbyr en mer effektiv løsning enn generelle LLM’er som ChatGPT.

Mens debatten fortsatt raser over den virkelige kostnaden av DeepSeek, er det ikke bare kostnaden som skiller det og lignende modeller: Det er faktum at det baserte seg på mindre avanserte chip og en mer fokusert tilnærming til trening. Som et kinesisk selskap som er underlagt amerikanske eksportrestriksjoner, kunne DeepSeek ikke få tilgang til avanserte Nvidia-chip som vanligvis brukes for tungvægts datamaskin som kreves for LLM-utvikling, og var derfor tvunget til å bruke mindre kraftfulle Nvidia H-800-chip (NVDA ), som ikke kan prosessere data like raskt eller effektivt.

For å kompensere for mangelen på kraft, tok DeepSeek en annen, mer fokusert og direkte tilnærming til sin LLM-utvikling. I stedet for å kaste fjell av data på en modell og basere seg på datamaskins styrke for å merke og anvende data, snevret DeepSeek inn treningen, utnyttet en liten mengde høykvalitets “kald-start” data og anvendte IRL (iterativ forsterkning av læring, med algoritmen anvendt data til forskjellige scenarier og lærte av det). Denne fokuserte tilnærmingen tillater modellen å lære raskere, med færre feil og mindre bortkastet datamaskinkraft.

Lignende hvordan foreldre kan veilede et barns spesifikke bevegelser, hjelpe dem med å rulle over for første gang – i stedet for å la barnet finne ut av det alene, eller undervise barnet i en bredere variasjon av bevegelser som kunne teoretisk hjelpe med å rulle over – zoomer dataeksperter som trener disse mer fokuserte AI-modellene inn på hva som er mest nødvendig for bestemte oppgaver og resultater. Slike modeller har sannsynligvis ikke like bredt anvendelsesområde som større LLM’er som ChatGPT, men de kan pålitelig brukes for bestemte applikasjoner og utføre dem med presisjon og effektivitet. Selv DeepSeek’s kritikere innrømmer at deres strømlinjeformet tilnærming til utvikling betydelig økte effisiensen, og muliggjorde å gjøre mer med langt mindre.

Denne tilnærmingen handler om å gi AI de beste innputtene slik at den kan nå sine milepæler på den smarteste og mest effektive måten mulig, og kan være verdifull for enhver organisasjon som ønsker å utvikle en LLM for sine spesifikke behov og oppgaver. En slik tilnærming er stadig mer verdifull for små bedrifter og organisasjoner. Det første skrittet er å starte med riktig data. For eksempel, et selskap som ønsker å bruke AI for å hjelpe sine salgs- og markedsføringslag, burde trene sin modell på en nøye valgt datasett som fokuserer på salgs samtaler, strategier og målinger. Dette holder modellen fra å kaste bort tid og datamaskinkraft på irrelevant informasjon. I tillegg må trening være strukturert i stadier, og sikre at modellen behersker hver oppgave eller konsept før den går videre til neste.

Dette har også paralleller i å oppdra et barn, som jeg har lært meg selv siden jeg ble mor for noen måneder siden. I begge scenarier unngår en veiledet, steg-for-steg-tilnærming å kaste bort ressurser og reduserer friksjon. Til slutt resulterer en slik tilnærming med både barn og AI-modeller i iterativ forbedring. Etterhvert som barnet vokser, eller modellen lærer mer, forbedres evnene. Dette betyr at modellene kan forbedres og forfineres for å håndtere virkelige situasjoner bedre.

Denne tilnærmingen holder kostnadene nede, og forhindrer AI-prosjekter fra å bli en ressursdræning, og gjør dem mer tilgjengelige for mindre lag og organisasjoner. Den fører også til bedre ytelse av AI-modellene raskere; og fordi modellene ikke er overbelastet med irrelevant data, kan de også justeres for å tilpasse seg ny informasjon og endrede forretningsbehov – nøkkel i konkurransedyktige markeder.

Ankomsten av DeepSeek og verden av lavere-kostnads, mer effektiv AI – selv om det først spredte panikk gjennom AI-verden og aksjemarkeder – er totalt sett en positiv utvikling for AI-sektoren. Den større effisiensen og lavere kostnadene til AI, i det minste for bestemte fokuserte applikasjoner, vil til slutt resultere i mer bruk av AI generelt, som driver vekst for alle, fra utviklere til chipprodusenter til sluttbrukere. Faktisk illustrerer DeepSeek Jevons’ paradoks – hvor mer effisiens sannsynligvis vil resultere i mer bruk av en ressurs, ikke mindre. Ettersom denne trenden ser ut til å fortsette, vil små bedrifter som fokuserer på å bruke AI for å møte sine spesifikke behov, også være bedre posisjonert for vekst og suksess.

Stav Levi-Neumark er administrerende direktør og medgrunnlegger av Alta og ekspert på produktledelse og omsetningsvekst. Tidligere var hun en av de første ansatte i Monday.com, der hun hjalp til å utvikle "BigBrain", et intern BI-verktøy brukt til dag-til-dag selskapsoperasjoner. Stav har en BS.c i datavitenskap og statistikk fra Det hebraiske universitetet i Jerusalem.