AI-modeller og platforme

Destillerede Kæmper: Hvorfor Vi Måtte Omstrukturere Udviklingen af Small AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

I de seneste år har kapløbet om at udvikle stadig større AI-modeller har fascineret tech-industrien. Disse modeller, med deres milliarder af parametre, lover banebrydende fremskridt inden for forskellige områder, fra naturlig sprogbehandling til billedgenkendelse. Imidlertid medfører denne uafbrudte jagt på størrelse betydelige ulemper i form af høje omkostninger og betydelig miljøpåvirkning. Mens Small AI tilbyder en lovende alternativ, der giver effektivitet og lavere energiforbrug, kræver den nuværende tilgang til at bygge den stadig betydelige ressourcer. Da vi stræber efter små og mere bæredygtige AI, er det afgørende at udforske nye strategier, der effektivt kan tackle disse begrænsninger.

Small AI: En Bæredygtig Løsning til Høje Omkostninger og Energiforbrug

Udvikling og vedligeholdelse af store AI-modeller er en dyrekøbt affære. Estimater antyder, at træning af GPT-3 koster over 4 millioner dollars, med mere avancerede modeller, der potentielt kan nå høj-singledigit millioner. Disse omkostninger, herunder nødvendig hardware, lagring, beregningskraft og menneskelige ressourcer, er forbudte for mange organisationer, især mindre virksomheder og forskningsinstitutioner. Denne finansielle barriere skaber en uretfærdig spillebane, der begrænser adgangen til avanceret AI-teknologi og hindrer innovation.

Desuden er energiforbruget forbundet med træning af store AI-modeller overvældende. For eksempel er træning af et stort sprogmodell som GPT-3 estimeret til at forbruge næsten 1.300 megawatt timer (MWh) elektricitet – svarende til den årlige elforbrug i 130 amerikanske hjem. Trods denne betydelige træningsomkostning medfører hver ChatGPT-anmodning en inference-omkostning på 2,9 watt-timer. IEA estimerer, at den samlede energibehov for AI, datacentre og kryptokurrency udgjorde næsten 2 procent af den globale energibehov. Dette behov forventes at fordobles inden 2026, nærmer sig den samlede elforbrug i Japan. Det høje energiforbrug øger ikke kun driftsomkostningerne, men bidrager også til det carbonaftryk, der forværre miljøkrisen. For at sætte det i perspektiv estimerer forskere, at træning af en enkelt stor AI-model kan udspy over 626.000 pund CO2, svarende til emissionerne fra fem biler over deres levetid.

I disse udfordringer tilbyder Small AI en praktisk løsning. Den er designet til at være mere effektiv og skalerbar, krævende langt mindre data og beregningskraft. Dette reducerer de samlede omkostninger og gør avanceret AI-teknologi mere tilgængelig for mindre organisationer og forskningsteams. Desuden har små AI-modeller lavere energibehov, hvilket hjælper med at reducere driftsomkostningerne og deres miljøpåvirkning. Ved at anvende optimerede algoritmer og metoder som overførselslæring kan små AI opnå høj ydelse med færre ressourcer. Denne tilgang gør ikke kun AI mere tilgængelig, men støtter også bæredygtighed ved at minimere både energiforbrug og CO2-udledning.

Hvordan Små AI-Modeller Bygges I Dag

Underkendende fordelene ved små AI, har større tech-virksomheder som Google (GOOGL ), OpenAI og Meta i stigende grad fokuseret på at udvikle kompakte modeller. Denne skift har ført til udviklingen af modeller som Gemini Flash, GPT-4o Mini og Llama 7B. Disse mindre modeller udvikles primært ved hjælp af en teknik kaldet videndistillation.

I dens kerne indebærer destillation overførslen af en stor, kompleks models viden til en mindre, mere effektiv version. I denne proces trænes en “lærer”-model – en stor AI-model – på omfattende datasæt for at lære komplekse mønstre og nuancer. Denne model genererer derefter forudsigelser eller “bløde mærker”, der indeholder dens dybe forståelse.

“Eleven”-modellen, som er den lille AI-model, trænes til at genskabe disse bløde mærker. Ved at efterligne lærerens adfærd fanger eleven-modellen meget af dens viden og ydelse, mens den opererer med betydeligt færre parametre.

Hvorfor Vi Måtte Gå Videre End Destillation af Stor AI

Selv om destillation af stor AI til små, mere håndterbare versioner er blevet en populær tilgang til at bygge små AI, er der flere overbevisende grunde til, at denne tilgang måske ikke er en løsning for alle udfordringer i stor AI-udvikling.

  • Fortsat Afhængighed af Store Modeller: Mens destillation skaber mindre, mere effektive AI-modeller og forbedrer beregnings- og energieffektivitet på inference-tid, afhænger den stadig stærkt af træning af store AI-modeller initialt. Dette betyder, at bygning af små AI-modeller stadig kræver betydelige beregningsressourcer og energi, hvilket fører til høje omkostninger og miljøpåvirkning, selv før destillation finder sted. Behovet for at gentagne gange træne store modeller for destillation flytter ressourcebyrden snarere end eliminerer den. Selv om destillation sigter mod at reducere størrelsen og omkostningerne for AI-modeller, eliminerer den ikke de betydelige initialomkostninger forbundet med træning af de store “lærer”-modeller. Disse forhåndsomkostninger kan være særligt udfordrende for mindre organisationer og forskningsgrupper. Desuden kan den miljømæssige påvirkning af træning af disse store modeller negere nogle af fordelene ved at bruge mindre, mere effektive modeller, da det carbonaftryk fra den initiale træningsfase stadig er betydeligt.
  • Begrænset Innovationsområde: At afhænge af destillation kan begrænse innovation ved at fokusere på at genskabe eksisterende store modeller snarere end at udforske nye tilgange. Dette kan langsommere udviklingen af nye AI-arkitekturer eller metoder, der kunne give bedre løsninger for bestemte problemer. Afhængigheden af stor AI begrænser små AI-udvikling i hænderne på få ressource-rige virksomheder. Som følge heraf er fordelene ved små AI ikke jævnt fordelt, hvilket kan hæmme bredere teknologisk fremgang og begrænse muligheder for innovation.
  • Generaliserings- og Tilpasningsudfordringer: Små AI-modeller skabt gennem destillation kæmper ofte med nye, usete data. Dette sker, fordi destillationsprocessen måske ikke fuldt ud fanger den større models evne til at generalisere. Som følge heraf kan disse mindre modeller måske fungere godt på velkendte opgaver, men de møder ofte vanskeligheder, når de står over for nye situationer. Desuden indebærer tilpasning af destillerede modeller til nye modaliteter eller datasæt ofte en gentræning eller finjustering af den større model først. Denne iterative proces kan være kompleks og ressourcekrævende, hvilket gør det vanskeligt at hurtigt tilpasse små AI-modeller til hurtigt udviklende teknologiske behov eller nye anvendelser.

Det Endelige Udbytte

Selv om destillation af store AI-modeller til mindre kan synes som en praktisk løsning, afhænger den stadig af de høje omkostninger forbundet med træning af store modeller. For at virkelig fremme små AI, må vi udforske mere innovative og bæredygtige praksisser. Dette indebærer at skabe modeller designet til bestemte anvendelser, forbedre træningsmetoder til at være mere omkostnings- og energieffektive, og fokusere på miljømæssig bæredygtighed. Ved at forfølge disse strategier kan vi fremme AI-udvikling på en måde, der både er ansvarlig og fordelagtig for industrien og planeten.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.