AI-modeller og plattformer

Enden på skaleringsæraen: Hvorfor algoritme-gennembrud betyder mere end modelstørrelse

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I det meste af det sidste årti har fremskridt i kunstig intelligens været drevet af skala. Større datasæt, flere parametre og større beregningskraft blev recepten på succes. Hold konkurrerede om at skabe større modeller, og fremgang blev målt i billioner af parametre og petabyte af træningsdata. Vi kalder dette skaleringsæraen. Den har fremmet meget af den AI-fremgang, vi ser i dag, men vi nærmer os nu en grænse, hvor det blot at gøre modellerne større ikke længere er den mest effektive, smarte eller bæredygtige tilgang. Som følge heraf skifter fokus fra ren skala til gennembrud i algoritmer. I denne artikel undersøger vi, hvorfor skaleringsæraen i sig selv ikke er nok, og hvordan den næste fase af AI-udvikling vil afhænge af algoritmisk innovation.

Lov om aftagende afkast i model-skaleringsæraen

Skaleringsæraen var bygget på solide empiriske grundlag. Forskere observerede, at øgning af model- og datasætsstørrelse kan føre til forudsigelige gevinst i præstation. Dette mønster blev kendt som skaleringslove. Disse love blev hurtigt spillebogen for førende AI-laboratorier, og det fik gang i kapløbet om at bygge endnu større systemer. Dette kapløb gav anledning til store sprogmodeller og grundlæggende modeller, som nu driver mange af i dag’s AI. Men ligesom enhver eksponentiel kurve er denne AI-skaleringskurve begyndt at flade ud nu. Udgifterne til at udvikle endnu større modeller stiger skarpt. Træning af et state-of-the-art-system forbruger nu så meget energi som en lille by, hvilket rejser alvorlige miljømæssige bekymringer. Den finansielle omkostning er så høj, at kun en håndfuld organisationer kan konkurrere. Imens observerer vi tydelige tegn på aftagende afkast. At fordoble parameterantallet giver ikke længere dobbelt så stor kapacitet. Forbedringerne er også inkrementelle, og de forbedrer kun den eksisterende viden i stedet for at låse op for nye evner. Værdiøgningen for hver yderligere dollar og watt, der bruges, reduceres. Skaleringstrategien nærmer sig sine økonomiske og tekniske grænser.

Den nye front: Algoritme-effektivitet

Skaleringslovenes begrænsninger har fået forskere til at fokusere på algoritme-effektivitet. I stedet for at stole på brute kraft er de begyndt at fokusere på at designe smartere algoritmer, der bruger ressourcerne mere effektivt. Seneste fremskridt illustrerer kraften i denne skift. For eksempel har Transformer-arkitekturen, drevet af dens opmærksomheds-mekanisme, domineret AI i år. Men opmærksomheden kommer med en svaghed: dens beregningskrav vokser hurtigt med sekvenslængde. State Space Models (SSMs), som Mamba, er ved at opstå som en lovende alternativ til Transformer. Ved at aktivere mere effektiv selektiv fornuft kan SSM’erne matche præstationen af langt større Transformers, mens de kører hurtigere og bruger betydeligt mindre hukommelse.

Et andet eksempel på algoritme-effektivitet er opkomsten af Mixture of Experts (MoE)-modeller. I stedet for at aktivere hele det massive netværk for hver indgang sender MoE-systemer opgaverne til kun det mest relevante undermængde af mindre netværk eller “eksperter”. Modellen kan have milliarder af parametre i alt, men hver beregning bruger kun en brøkdel af dem. Dette er som at have en enorm bibliotek, men kun åbne de få bøger, du har brug for for at besvare et spørgsmål, i stedet for at læse hver bog i bygningen hver gang. Resultatet er videnkapaciteten af en kæmpe-model med effektiviteten af en langt mindre model.

Endnu et eksempel, der kombinerer disse idéer, er DeepSeek-V3, en Mixture-of-Experts-model forbedret med Multi-head Latent Attention (MLA). MLA forbedrer traditionel opmærksomhed ved at komprimere nøgle-værdi-tilstande, hvilket giver mulighed for, at modellen kan håndtere lange sekvenser effektivt, ligesom SSM’erne, samtidig med at den bevarede styrkerne fra Transformers. Med 236 milliarder parametre i alt, men kun en brøkdel aktiveret per opgave, leverer DeepSeek-V3 top-præstation i områder som kodning og fornuft, samtidig med at den er mere tilgængelig og mindre ressource-krævende end sammenlignelige store, skalerede modeller.

Disse er ikke kun isolerede eksempler. De repræsenterer en bredere trend mod smartere, mere effektive design. Forskere fokuserer nu på, hvordan man kan gøre modellerne hurtigere, mindre og mindre sultne efter data uden at ofre præstation.

Hvorfor denne skift betyder noget

Skiftet fra at stole på skala til at fokusere på algoritme-gennembrud har betydelige effekter på AI-feltet. Først gør det AI mere tilgængeligt for alle. Succes afhænger ikke længere kun af at have de mest kraftfulde computere. En lille gruppe forskere kan skabe en ny design, der overgår modeller bygget med langt større budgetter. Dette ændrer innovation fra en kapløb over ressourcer til en, der drives af idéer og ekspertise. Som følge heraf kan universiteter, startups og uafhængige laboratorier nu spille en større rolle, ud over kun de store teknologivirksomheder.

Anden, det hjælper med at gøre AI mere nyttig i hverdags-sammenhænge. En model med 500 milliarder parametre kan se imponerende ud i studier, men dens enorme størrelse gør det svært og dyrt at bruge den i praksis. I modsætning hertil kan effektive muligheder som Mamba eller Mixture of Experts-modeller køre på standard-hardware, herunder enheder på kanten af netværk. Denne letbrugelighed er afgørende for at bringe AI ind i almindelige anvendelser, såsom diagnostiske værktøjer i sundhedssektoren eller instant-oversættelsesfunktioner på smartphones.

Tredje, det tager fat i problemet med bæredygtighed. Energikravene til at bygge og operere kæmpe AI-modeller bliver en større udfordring for miljøet. Ved at fokusere på effektivitet kan vi skære skarpt ned på CO2-udledningen fra AI-arbejde.

Hvad kommer næste: Æraen for intelligens-design

Vi er ved at gå ind i, hvad vi måske kan kalde æraen for intelligens-design. Spørgsmålet er ikke længere, hvor stor vi kan gøre modellen, men hvordan vi kan designe en model, der er mere intelligent og effektiv.

Dette skift vil bringe innovationer på tværs af flere kerneområder for forskning. Et af områderne, hvor vi kan forvente fremskridt, er i AI-model-arkitektur. De nye modeller som de allerede nævnte state space-modeller kan ændre, hvordan neurale netværk behandler data. For eksempel er arkitektur inspireret af dynamiske systemer bevist mere kraftfuld i eksperimenter. Et andet fokusområde vil være træningsmetoder, der hjælper modellerne med at lære effektivt med langt mindre data. For eksempel er fremskridt i few-shot og zero-shot-læring ved at gøre AI mere data-effektiv, mens teknikker som activation steering giver adfærdsmæssige forbedringer uden nogen gen-træning. Efter-trænings-forbedringer og brugen af syntetisk data reducerer træningsbehov dramatisk, nogle gange med en faktor på 10.000.

Vi vil også se en stigende interesse for hybrid-modeller, såsom neuro-symbolisk AI. Neuro-symbolisk AI er ved at opstå som en stor trend i 2025, kombinerer neuralt læringens mønster-genkendelse med symboliske systemers logiske styrker til bedre forklarbarhed og mindre afhængighed af data. Eksempler omfatter AlphaGeometry 2 og AlphaProof, der giver Google DeepMind mulighed for at sikre guldmedalje-præstation ved IMO 2025. Målet er at udvikle systemer, der ikke kun forudsiger det næste ord baseret på statistik, men også forstår og fornufter om verden på en måde, der ligner menneskers.

Bottom Line

Skaleringsæraen var afgørende og førte til bemærkelsesværdig vækst i AI. Den udvidede grænserne for, hvad der var muligt, og leverede de grundlæggende teknologier, vi afhænger af i dag. Men ligesom enhver teknologi, der modnes, udtømmer den oprindelige strategi til sidst sin potentiale. De store gennembrud forude kommer ikke fra at tilføje flere lag til stakken. I stedet vil de opstå fra at redesigne stakken selv.

Fremtiden tilhører dem, der innoverer i algoritmer, arkitektur og den grundlæggende videnskab om maskinlæring. Det er en fremtid, hvor intelligens måles ikke af antallet af parametre, men af designets elegance. Drivkraften for at skabe smartere algoritmer er lige begyndt. Denne overgang åbner døren for AI, der er mere tilgængelig, bæredygtig og virkelig intelligent.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.