AI-modeller og platforme
Google gør AI-træning 28% hurtigere ved at bruge SLM’er som lærere
Træning af store sprogmodeller (LLM’er) er blevet utilgængelig for de fleste organisationer. Med omkostninger, der løber op i millioner, og beregningskrav, der ville få en supercomputer til at svede, er AI-udvikling blevet låst bag dørene af teknologigiganter. Men Google (GOOGL ) har lige vendt denne historie på hovedet med en tilgang, der er så enkel, at man undrer sig over, hvorfor ingen tænkte på det før: at bruge mindre AI-modeller som lærere.
Hvordan SALT virker: En ny tilgang til træning af AI-modeller
I en ny forskningsartikel med titlen “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” introducerede Google Research og DeepMind SALT (Small model Aided Large model Training). Dette er den nye metode, der udfordrer vores traditionelle tilgang til træning af LLM’er.
Hvorfor er denne forskning betydningsfuld? I øjeblikket er træning af store AI-modeller ligesom at forsøge at lære en person alt, de behøver at vide om et emne på én gang – det er ineffektivt, dyrt og ofte begrænset til organisationer med massive beregningsressourcer. SALT tager en anden vej, idet den introducerer en to-trins træningsproces, der er både innovativ og praktisk.
Breaking down how SALT actually works:
Trin 1: Videnstransfer
- En mindre sprogmodel (SLM) fungerer som en lærer, der deler sin forståelse med den større model
- Den mindre model fokuserer på at overføre sin “erhvervede viden” gennem, hvad forskerne kalder “bløde mærker”
- Tænk på det som en lærerassistent, der håndterer grundlæggende begreber, før en student går videre til avancerede emner
- Dette trin er særligt effektivt i “lette” områder af læring – områder, hvor den mindre model har stærk prædikativtiden
Trin 2: Selvstændig læring
- Den store model går over til selvstændig læring
- Den fokuserer på at mestre komplekse mønstre og udfordrende opgaver
- Dette er, hvor modellen udvikler evner, der går ud over, hvad den mindre “lærer” kunne give
- Overgangen mellem trinnene bruger omhyggeligt designede strategier, herunder lineær aftagen og lineær forholdsaftagen af destillationsvægten
I ikke-tekniske vendinger kan man forestille sig, at den mindre AI-model er som en hjælpsom lærer, der vejleder den større model i de første træningsfaser. Denne lærer giver ekstra information sammen med deres svar, hvilket angiver, hvor sikker de er på hvert svar. Denne ekstra information, kendt som “bløde mærker”, hjælper den større model med at lære hurtigere og mere effektivt.
- Lineær aftagen: Det er som langsomt at dæmpe lærerens stemme. Lærerens vejledning bliver mindre fremtrædende med hvert trin, hvilket giver den større model mulighed for at fokusere mere på at lære fra de rene data selv.
- Lineær forholdsaftagen: Dette er som at justere balancen mellem lærerens råd og den oprindelige opgave. Da træningen skrider frem, skifter fokus mere mod den oprindelige opgave, mens lærerens input bliver mindre dominerende.
Resultaterne er overbevisende. Da Google-forskere testede SALT ved at bruge en 1,5 milliard parameter SLM til at træne en 2,8 milliard parameter LLM på Pile-datasættet, så de:
- En 28% reduktion i træningstid i forhold til traditionelle metoder
- Betydelige ydelseforbedringer efter finjustering:
- Matematisk nøjagtighed sprang til 34,87% (i forhold til 31,84% baseline)
- Læseforståelse nåede 67% nøjagtighed (op fra 63,7%)
Men hvad gør SALT virkelig innovativt er dets teoretiske ramme. Forskerne opdagede, at selv en “svagere” lærermodel kan forbedre elevens præstation ved at opnå, hvad de kalder en “gunstig bias-varians-trade-off”. I simple vendinger hjælper den mindre model den større med at lære grundlæggende mønstre mere effektivt, og skaber dermed en stærkere grundlag for avanceret læring.
Hvorfor SALT kunne ændre AI-udviklingsfeltet
Husk, da cloud-computing ændrede, hvem der kunne starte et teknologifirma? SALT kunne gøre det samme for AI-udvikling.
Jeg har fulgt AI-træningsinnovationer i årevis, og de fleste gennembrud har primært haft til gode for teknologigiganterne. Men SALT er anderledes.
Her er, hvad det kunne betyde for fremtiden:
For organisationer med begrænsede ressourcer:
- Du behøver måske ikke længere massive beregningsinfrastrukturer for at udvikle dygtige AI-modeller
- Mindre forskningslaboratorier og virksomheder kunne eksperimentere med brugerdefineret modeludvikling
- Den 28% reduktion i træningstid oversætter sig direkte til lavere beregningsomkostninger
- Vigtigst, du kunne starte med beskedne beregningsressourcer og alligevel opnå professionelle resultater
For AI-udviklingslandskabet:
- Flere spillere kunne træde ind på markedet, hvilket ville føre til mere diverse og specialiserede AI-løsninger
- Universiteter og forskningsinstitutioner kunne køre flere eksperimenter med deres eksisterende ressourcer
- Barrieren for indgang til AI-forskning falder betydeligt
- Vi kunne se nye anvendelser i områder, der tidligere ikke kunne betale for AI-udvikling
Hvad dette betyder for fremtiden
Ved at bruge mindre modeller som lærere ændrer vi ikke kun AI-træning til at blive mere effektiv – vi ændrer også grundlæggende, hvem der får lov at deltage i AI-udvikling. Konsekvenserne går langt ud over blot tekniske forbedringer.
Vigtige punkter at huske:
- Træningstidsreduktion på 28% er forskellen på, om man starter et AI-projekt eller betragter det som utilgængeligt
- Ydelseforbedringerne (34,87% på matematik, 67% på læsetests) viser, at tilgængelighed ikke altid betyder kompromis med kvalitet
- SALT’s tilgang viser, at de bedste løsninger ofte kommer fra at genoverveje grundlæggende principper i stedet for blot at tilføje mere beregningskraft
Hvad at holde øje med:
- Hold øje med mindre organisationer, der starter at udvikle brugerdefinerede AI-modeller
- Hold øje med nye anvendelser i områder, der tidligere ikke kunne betale for AI-udvikling
- Hold øje med innovationer i, hvordan mindre modeller bruges til specialiserede opgaver
Husk: Den virkelige værdi af SALT ligger i, hvordan det måske kan ændre, hvem der får lov at innovere i AI. Uanset om du driver et forskningslaboratorium, styrer et teknisk hold eller bare er interesseret i AI-udvikling, er dette den type gennembrud, der kan gøre dit næste store projekt muligt.
Måske skal du starte med at tænke over det AI-projekt, du troede var utilgængeligt. Det kan være mere muligt, end du forestillede dig.










