AI-modeller og plattformer
Google gjør AI-trening 28% raskere ved å bruke SLM-er som lærere
Trening av store språkmodeller (LLM-er) har blitt utilgjengelig for de fleste organisasjoner. Med kostnader som løper inn i millioner og beregningskrav som ville få en supercomputer til å sverte, har AI-utvikling vært låst bak dørene til teknologigigantene. Men Google (GOOGL ) har nettopp snudd denne historien på hodet med en tilnærming så enkel at det får en til å undre seg over hvorfor ingen tenkte på det tidligere: å bruke mindre AI-modeller som lærere.
Hvordan SALT fungerer: En ny tilnærming til trening av AI-modeller
I en nylig forskningsrapport med tittelen “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” introduserte Google Research og DeepMind SALT (Small model Aided Large model Training). Dette er den nye metoden som utfordrer vår tradisjonelle tilnærming til trening av LLM-er.
Hvorfor er denne forskningen betydningsfull? For tiden er trening av store AI-modeller som å forsøke å lære noen alle ting de trenger å vite om et emne på en gang – det er ineffektivt, dyrt og ofte begrenset til organisasjoner med massive beregningsressurser. SALT tar en annen vei, og introduserer en to-trinns treningsprosess som er både innovativ og praktisk.
Hvordan SALT faktisk fungerer:
Trinn 1: Kunnskapsdestillering
- En mindre språkmodell (SLM) fungerer som en lærer, og deler sin forståelse med den større modellen
- Den mindre modellen fokuserer på å overføre sin “lærte kunnskap” gjennom hva forskerne kaller “myke etiketter”
- Tenk på det som en lærer som håndterer grunnleggende konsepter før en student går videre til avanserte emner
- Dette trinnet er spesielt effektivt i “enkle” områder av læring – områder hvor den mindre modellen har sterk prediktiv konfidens
Trinn 2: Selvstendig læring
- Den større modellen går over til uavhengig læring
- Den fokuserer på å mestre komplekse mønster og utfordrende oppgaver
- Dette er hvor modellen utvikler evner utover hva den mindre “læreren” kunne tilby
- Overgangen mellom trinnene bruker nøye designet strategier, inkludert lineær nedgang og lineær forholdsnedgang av destillasjons tapet
I ikke-tekniske termer, forestill deg at den mindre AI-modellen er som en hjelpsom lærer som veileder den større modellen i begynnelsen av treningen. Denne læreren gir ekstra informasjon sammen med sine svar, og indikerer hvor sikker den er på hvert svar. Denne ekstra informasjonen, kjent som “myke etiketter”, hjelper den større modellen å lære raskere og mer effektivt.
- Lineær nedgang: Det er som å sakte ned volumet på lærerens stemme. Lærerens veiledning blir mindre fremtredende med hver enkelt trinn, og tillater den større modellen å fokusere mer på å lære fra de rene dataene selv.
- Lineær forholdsnedgang: Dette er som å justere balansen mellom lærerens råd og den opprinnelige oppgaven. Etter hvert som treningen skjer, skifter fokuset mer mot den opprinnelige oppgaven, mens lærerens innflytelse blir mindre dominant.
Resultatene er overbevisende. Når Google-forskere testet SALT ved å bruke en 1,5 milliard parameter SLM til å trene en 2,8 milliard parameter LLM på Pile-datasettet, så de:
- En 28% reduksjon i treningstid sammenlignet med tradisjonelle metoder
- Betydelige ytelsesforbedringer etter finjustering:
- Matematisk problemløsning nådde 34,87% (i forhold til 31,84% baseline)
- Leseforståelse nådde 67% nøyaktighet (opp fra 63,7%)
Men hva gjør SALT virkelig innovativt er dens teoretiske rammeverk. Forskerne oppdaget at selv en “svakere” lærermodell kan forbedre elevens ytelse ved å oppnå en “gunstig bias-varians trade-off”. I enklere termer hjelper den mindre modellen den større modellen med å lære grunnleggende mønster mer effektivt, og skaper en sterkere grunnlag for avansert læring.
Hvorfor SALT kan endre AI-utviklingsbanen
Husk når skytjenester transformerte hvem som kunne starte et teknologiselskap? SALT kan gjøre det samme for AI-utvikling.
Jeg har fulgt AI-treninginnovasjoner i årevis, og de fleste gjennombruddene har hovedsakelig fordelt teknologigigantene. Men SALT er annerledes.
Hva det kan bety for fremtiden:
For organisasjoner med begrensede ressurser:
- Du trenger kanskje ikke lenger massive beregningsinfrastrukturer for å utvikle dyktige AI-modeller
- Mindre forskningslaboratorier og selskaper kunne eksperimentere med tilpasset modellutvikling
- 28% reduksjon i treningstid oversettes direkte til lavere beregningskostnader
- Mer viktig, du kunne starte med beskjedne beregningsressurser og likevel oppnå profesjonelle resultater
For AI-utviklingslandskapet:
- Flere aktører kunne komme inn i feltet, og føre til mer diverse og spesialiserte AI-løsninger
- Universiteter og forskningsinstitusjoner kunne kjøre flere eksperimenter med sine eksisterende ressurser
- Inngangsbarrieren for AI-forskning synker betydelig
- Vi kan se nye anvendelser i felt som tidligere ikke kunne betale for AI-utvikling
Hva dette betyr for fremtiden
Ved å bruke mindre modeller som lærere, endrer vi ikke bare AI-trening til å bli mer effektiv – vi endrer også hvem som får delta i AI-utvikling. Konsekvensene går langt utover bare tekniske forbedringer.
Nøkkel punkter å huske:
- 28% reduksjon i treningstid er forskjellen mellom å starte et AI-prosjekt eller å vurdere det som utilgjengelig
- Ytelsesforbedringene (34,87% på matematikk, 67% på leseoppgaver) viser at tilgjengelighet ikke alltid betyr å ofre kvalitet
- SALTs tilnærming viser at noen ganger kommer de beste løsningene fra å tenke om grunnleggende prinsipper på nytt, i stedet for å bare legge til mer beregningskraft
Hva å se etter:
- Hold øye på mindre organisasjoner som starter å utvikle tilpassede AI-modeller
- Se etter nye anvendelser i felt som tidligere ikke kunne betale for AI-utvikling
- Se etter innovasjoner i hvordan mindre modeller brukes til spesialiserte oppgaver
Husk: Den virkelige verdien av SALT ligger i hvordan det kan endre hvem som får innovere i AI. Uansett om du driver et forskningslaboratorium, styrer et teknologiteam eller bare er interessert i AI-utvikling, er dette typen gjennombrudd som kan gjøre din neste store idé mulig.
Kanskje bör du tenke på det AI-prosjektet du trodde var utilgjengelig. Det kan være mer mulig enn du forestiller deg.










