Tankeledare
Skräddarsydda LLM:er för varje företag? DeepSeek visar vägen

En gång i tiden var den tekniska signalen “mobiltelefoner för alla” – och faktiskt har mobilkommunikation revolutionerat företag (och världen). Idag är den motsvarande signalen att ge alla tillgång till AI-applikationer. Men den verkliga kraften i AI ligger i att utnyttja den för företags och organisationers specifika behov. Den väg som den kinesiska startupen DeepSeek har banat visar hur AI kan utnyttjas av alla, särskilt de med begränsade budgetar, för att tillgodose deras specifika behov. Faktum är att tillkomsten av billigare AI lovar att förändra den djupt rotade mönstret att AI-lösningar ofta förblir utom räckhåll för många småföretag och organisationer på grund av kostnadskrav.
LLM:er är – eller var – ett dyrt företag, som kräver tillgång till stora mängder data, många kraftfulla datorer för att bearbeta data, och tid och resurser investerade i modellutbildning. Men dessa regler förändras. Med en skral budget utvecklade DeepSeek sin egen LLM, och en ChatGPT-liknande applikation för frågor – med en mycket mindre investering än för liknande system byggda av amerikanska och europeiska företag. DeepSeeks tillvägagångssätt öppnar upp ett fönster för LLM-utveckling för mindre organisationer som inte har miljarder att spendera. Faktum är att dagen då de flesta små organisationer kan utveckla sina egna LLM:er för att tillgodose sina egna specifika syften inte är långt borta, vanligtvis med en mer effektiv lösning än allmänna LLM:er som ChatGPT.
Medan debatt fortfarande pågår om den verkliga kostnaden för DeepSeek, är det inte bara kostnaden som särskiljer det och liknande modeller: Det är faktum att det förlitade sig på mindre avancerade chip och en mer fokuserad tillvägagångssätt för utbildning. Som ett kinesiskt företag som är föremål för amerikanska exportrestriktioner kunde DeepSeek inte få tillgång till de avancerade Nvidia-chip som vanligtvis används för den tunga datorkraft som krävs för LLM-utveckling, och var därför tvunget att använda mindre kraftfulla Nvidia H-800-chip (NVDA ), som inte kan bearbeta data lika snabbt eller effektivt.
För att kompensera för denna brist på kraft, tog DeepSeek en annan, mer fokuserad och direkt tillvägagångssätt för sin LLM-utveckling. Istället för att kasta stora mängder data på en modell och förlita sig på datorkraft för att märka och tillämpa data, begränsade DeepSeek utbildningen, använde en liten mängd högkvalitativ “cold-start”-data och tillämpade IRL (iterativ förstärkt inlärning, med algoritmen som tillämpar data på olika scenarier och lär av det). Detta fokuserade tillvägagångssätt tillåter modellen att lära sig snabbare, med färre misstag och mindre slösad datorkraft.
Liksom föräldrar kan vägleda ett barns specifika rörelser, hjälpa dem att lyckas med att rulla över för första gången – snarare än att lämna barnet att lista ut det själv, eller undervisa barnet i en bredare variation av rörelser som i teorin kunde hjälpa med att rulla över – zoomar dataforskare som tränar dessa mer fokuserade AI-modeller in på vad som är mest nödvändigt för vissa uppgifter och resultat. Sådana modeller har troligen inte lika breda tillämpningsområden som större LLM:er som ChatGPT, men de kan lita på för specifika tillämpningar, och utföra dem med precision och effektivitet. Till och med DeepSeeks kritiker medger att dess strömlinjeformade tillvägagångssätt för utveckling avsevärt ökade effektiviteten, vilket möjliggjorde att göra mer med mycket mindre.
Detta tillvägagångssätt handlar om att ge AI de bästa ingångarna så att den kan nå sina milstolpar på det smartaste, mest effektiva sättet, och kan vara värdefullt för varje organisation som vill utveckla en LLM för sina specifika behov och uppgifter. Ett sådant tillvägagångssätt är alltmer värdefullt för småföretag och organisationer. Det första steget är att börja med rätt data. Till exempel bör ett företag som vill använda AI för att hjälpa sina försäljnings- och marknadsföringsteam utbilda sin modell på en noggrant utvald dataset som fokuserar på försäljningssamtal, strategier och mått. Detta håller modellen från att slösa tid och datorkraft på irrelevanta uppgifter. Dessutom måste utbildningen struktureras i etapper, säkerställa att modellen behärskar varje uppgift eller koncept innan den går vidare till nästa.
Detta har också paralleller i att fostra ett barn, som jag har lärt mig själv sedan jag blev mamma för några månader sedan. I båda scenarierna undviker ett väglett, steg-för-steg-tillvägagångssätt att slösa resurser och minskar friktion. Slutligen resulterar ett sådant tillvägagångssätt med både barn och AI-modeller i iterativ förbättring. När barnet växer, eller modellen lär sig mer, förbättras dess förmågor. Detta innebär att modeller kan förfinas och förbättras för att bättre hantera verkliga situationer.
Detta tillvägagångssätt håller nere kostnaderna, förhindrar att AI-projekt blir en resursdränering, och gör dem mer tillgängliga för mindre team och organisationer. Det leder också till bättre prestanda för AI-modeller snabbare; och eftersom modellerna inte är överbelastade med onödig data, kan de också anpassas för att anpassa sig till ny information och föränderliga affärsbehov – nyckel i konkurrenskraftiga marknader.
Ankomsten av DeepSeek och världen av billigare, mer effektiv AI – även om det initialt spred panik genom hela AI-världen och aktiemarknader – är överlag en positiv utveckling för AI-sektorn. Den ökade effektiviteten och lägre kostnaderna för AI, åtminstone för vissa fokuserade tillämpningar, kommer slutligen att resultera i mer användning av AI i allmänhet, vilket driver tillväxt för alla, från utvecklare till chip-tillverkare till slutanvändare. Faktum är att DeepSeek illustrerar Jevons paradox – där mer effektivitet sannolikt kommer att resultera i mer användning av en resurs, inte mindre. När denna trend ser ut att fortsätta, kommer småföretag som fokuserar på att använda AI för att tillgodose sina specifika behov också att vara bättre rustade för tillväxt och framgång.












