Tankeledere
Tilpassede LLM’er til hver forretning? DeepSeek viser vej

Engang var teknologiens klaringskald “mobiltelefoner til alle” – og sandt enough, mobile kommunikation har revolutioneret forretninger (og verden). I dag er det tilsvarende opkald at give alle adgang til AI-applikationer. Men den virkelige kraft i AI ligger i at udnytte den til de specifikke behov i forretninger og organisationer. Den vej, som den kinesiske startup DeepSeek har banet, viser, hvordan AI kan udnyttes af alle, især de med begrænsede budgetter, for at møde deres specifikke behov. Sandt enough, tilgangen af lavere-omkostnings AI lover at ændre den dybt-rodede mønster af AI-løsninger, der ofte forbliver utilgængelige for mange små forretninger og organisationer på grund af omkostningskrav.
LLM’er er – eller var – et kostbar foretagelse, der kræver adgang til massive mængder data, store mængder kraftfulde computere til at behandle data, og tid og ressourcer investeret i at træne modellen. Men disse regler ændrer sig. DeepSeek udviklede sin egen LLM og en ChatGPT-type-applikation til forespørgsler – med en langt mindre investering end lignende systemer bygget af amerikanske og europæiske virksomheder. DeepSeeks tilgang åbner et vindue ind til LLM-udvikling for mindre organisationer, der ikke har milliarder at bruge. Faktisk kan dagen ikke være langt borte, hvor de fleste små organisationer kan udvikle deres egne LLM’er til at betjene deres egne specifikke formål, som ofte giver en mere effektiv løsning end generelle LLM’er som ChatGPT.
Selv om debatten stadig består om den sande omkostning af DeepSeek, er det ikke kun omkostningen, der adskiller det og lignende modeller: Det er det faktum, at det afhængig af mindre avancerede chip og en mere fokuseret tilgang til træning. Som en kinesisk virksomhed underlagt amerikanske eksportrestriktioner, kunne DeepSeek ikke få adgang til de avancerede Nvidia-chip, der normalt bruges til den tungtvejende beregning, der kræves for LLM-udvikling, og var derfor tvunget til at bruge mindre kraftfulde Nvidia H-800-chip (NVDA ), der ikke kan behandle data så hurtigt eller effektivt.
For at kompensere for denne mangel på kraft, tog DeepSeek en anden, mere fokuseret og direkte tilgang til sin LLM-udvikling. I stedet for at kaste bjerge af data på en model og afhænge af beregningsstyrke til at mærke og anvende data, begrænsede DeepSeek træningen, anvendte en lille mængde højkvalitets “cold-start”-data og anvendte IRL (iterativ forstærket læring, hvor algoritmen anvender data til forskellige scenarier og lærer af det). Denne fokuserede tilgang tillader modellen at lære hurtigere, med færre fejl og mindre spildt beregningskraft.
Ligesom forældre kan vejlede et barns specifikke bevægelser, hjælpe det med at rulle over for første gang – i stedet for at lade barnet selv finde ud af det, eller undervise barnet i en bred vifte af bevægelser, der kunne hjælpe med at rulle over – zoomer datavidenskabsfolkene, der træner disse mere fokuserede AI-modeller, ind på, hvad der er mest nødvendigt for bestemte opgaver og resultater. Sådanne modeller har sandsynligvis ikke så bred en pålidelig anvendelse som større LLM’er som ChatGPT, men de kan anvendes til bestemte formål og udføre dem med præcision og effektivitet. Selv DeepSeeks kritikere indrømmer, at dens strømlinede tilgang til udvikling betydeligt øgede effektiviteten og gjorde det muligt at gøre mere med langt mindre.
Denne tilgang handler om at give AI de bedste input, så den kan nå sine mål på den smarteste og mest effektive måde, og kan være værdifuld for enhver organisation, der ønsker at udvikle en LLM til sine specifikke behov og opgaver. En sådan tilgang er stadig mere værdifuld for små forretninger og organisationer. Det første skridt er at starte med de rigtige data. For eksempel bør en virksomhed, der ønsker at bruge AI til at hjælpe sine salgs- og marketinghold, træne sin model på en omhyggeligt udvalgt dataset, der fokuserer på salgsdiskussioner, -strategier og -metricer. Dette holder modellen fra at spilde tid og beregningskraft på irrelevant information. Desuden skal træningen struktureres i etaper, så modellen behersker hver opgave eller koncept, før den går videre til den næste.
Dette har også paralleller i at opfostre et barn, som jeg selv har lært, siden jeg blev mor for nogle måneder siden. I begge tilfælde undgår en vejledt, trin-for-trin-tilgang spild af ressourcer og reducerer friktion. Endelig resulterer en sådan tilgang med både menneskebørn og AI-modeller i iterativ forbedring. Da barnet vokser, eller modellen lærer mere, forbedres dens evner. Dette betyder, at modeller kan affinere og forbedre sig til at håndtere virkelige situationer bedre.
Denne tilgang holder omkostningerne nede, forhindrer AI-projekter i at blive en ressourcedræn, og gør dem mere tilgængelige for mindre hold og organisationer. Den fører også til bedre præstation af AI-modeller hurtigere; og fordi modellerne ikke er overbelastet med irrelevant data, kan de også tilpasses til at tilpasse sig ny information og ændrede forretningsbehov – nøgle i konkurrencedygtige markeder.
Ankomsten af DeepSeek og verden af lavere-omkostnings, mere effektiv AI – selv om det først spredte panik i AI-verdenen og aktiemarkederne – er overordnet set en positiv udvikling for AI-sektoren. Den større effektivitet og lavere omkostninger af AI, i hvert fald for visse fokuserede anvendelser, vil sandsynligvis resultere i mere brug af AI generelt, hvilket driver vækst for alle, fra udviklere til chipproducenter til slutbrugere. Faktisk illustrerer DeepSeek Jevons Paradox – hvor mere effektivitet sandsynligvis resulterer i mere brug af en ressource, ikke mindre. Da denne trend ser ud til at fortsætte, vil små forretninger, der fokuserer på at bruge AI til at møde deres specifikke behov, også være bedre placeret til vækst og succes.












