AI-modeller och plattformar

Google gör AI-utbildning 28% snabbare med hjälp av SLM som lärare

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Att utbilda stora språkmodeller (LLM) har blivit utom räckhåll för de flesta organisationer. Med kostnader som löper upp i miljontals och beräkningskrav som skulle få en superdator att svettas, har AI-utveckling förblivit låst bakom techjättarnas dörrar. Men Google (GOOGL ) har just vänt på den här historien med ett tillvägagångssätt så enkelt att det gör en undra varför ingen tänkte på det tidigare: att använda mindre AI-modeller som lärare.

Hur SALT fungerar: Ett nytt tillvägagångssätt för att utbilda AI-modeller

I en nyligen publicerad forskningsrapport med titeln “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” introducerade Google Research och DeepMind SALT (Small model Aided Large model Training). Detta är den banbrytande metoden som utmanar vårt traditionella tillvägagångssätt för att utbilda LLM.

Varför är denna forskning betydelsefull? För närvarande är utbildning av stora AI-modeller som att försöka lära någon allt de behöver veta om ett ämne på en gång – det är ineffektivt, dyrt och ofta begränsat till organisationer med massiva beräkningsresurser. SALT tar en annan väg, genom att introducera en tvåstegs utbildningsprocess som är både innovativ och praktisk.

Att bryta ner hur SALT faktiskt fungerar:

Steg 1: Kunskapsdestillering

  • En mindre språkmodell (SLM) fungerar som en lärare, delar sin förståelse med den större modellen
  • Den mindre modellen fokuserar på att överföra sin “lärd kunskap” genom vad forskare kallar “mjuka etiketter”
  • Tänk på det som en lärarassistent som hanterar grundläggande begrepp innan en student flyttar till avancerade ämnen
  • Detta steg är särskilt effektivt i “lätta” områden av lärande – områden där den mindre modellen har stark prediktivt förtroende

Steg 2: Självständigt lärande

  • Den stora modellen övergår till oberoende lärande
  • Den fokuserar på att bemästra komplexa mönster och utmanande uppgifter
  • Detta är där modellen utvecklar förmågor utöver vad dess mindre “lärare” kunde tillhandahålla
  • Övergången mellan steg använder noggrant utformade strategier, inklusive linjär nedgång och linjär förhållande nedgång av destillationsförlustvikt

I icke-tekniska termer, tänk på den mindre AI-modellen som en hjälpsam handledare som guidar den större modellen i de inledande stadierna av utbildning. Denna handledare tillhandahåller extra information tillsammans med sina svar, vilket indikerar hur säker de är på varje svar. Denna extra information, känd som “mjuka etiketter”, hjälper den större modellen att lära sig snabbare och mer effektivt.

Nu, när den större AI-modellen blir mer kapabel, behöver den övergå från att förlita sig på handledaren till att lära sig oberoende. Detta är där “linjär nedgång” och “linjär förhållande nedgång” kommer in i bilden.
Tänk på dessa tekniker som en gradvis minskning av handledarens inflytande över tid:
  • Linjär nedgång: Det är som att långsamt vända ned volymen på handledarens röst. Handledarens vägledning blir mindre framträdande med varje steg, vilket tillåter den större modellen att fokusera mer på att lära sig från de råa data i sig.
  • Linjär förhållande nedgång: Detta är som att justera balansen mellan handledarens råd och den faktiska uppgiften. När utbildning fortskrider, skiftar fokus mer mot den ursprungliga uppgiften, medan handledarens inmatning blir mindre dominerande.
Målet med båda teknikerna är att säkerställa en smidig övergång för den större AI-modellen, förhindra några plötsliga förändringar i dess lärandebeteende.

Resultaten är övertygande. När Google-forskare testade SALT med en 1,5 miljarder parametrar SLM för att utbilda en 2,8 miljarder parametrar LLM på Pile-databasen, såg de:

  • En 28% minskning av utbildningstiden jämfört med traditionella metoder
  • Betydande prestandaförbättringar efter finjustering:
    • Matematikproblemlösningens noggrannhet ökade till 34,87% (jämfört med 31,84% baslinje)
    • Läsförståelse nådde 67% noggrannhet (upp från 63,7%)

Men vad som gör SALT riktigt innovativt är dess teoretiska ramverk. Forskarna upptäckte att även en “svagare” lärarmodell kan förbättra studentens prestanda genom att uppnå vad de kallar en “gynnsam bias-varians trade-off”. I enklare termer hjälper den mindre modellen den större att lära sig grundläggande mönster mer effektivt, vilket skapar en starkare grund för avancerat lärande.

Varför SALT kan omforma AI-utvecklingsarenan

Kom ihåg när molnberäkning förvandlade vem som kunde starta ett techföretag? SALT kan göra samma sak för AI-utveckling.

Jag har följt AI-utbildningsinnovationer i år, och de flesta genombrotten har främst gynnat techjättarna. Men SALT är annorlunda.

Här är vad det kan betyda för framtiden:

För organisationer med begränsade resurser:

  • Du kan kanske inte längre behöva massiv beräkningsinfrastruktur för att utveckla kapabla AI-modeller
  • Mindre forskningslaboratorier och företag kunde experimentera med anpassad modellutveckling
  • Den 28% minskningen av utbildningstiden översätts direkt till lägre beräkningskostnader
  • Viktigare, du kunde börja med blygsamma beräkningsresurser och fortfarande uppnå professionella resultat

För AI-utvecklingslandskapet:

  • Fler aktörer kunde gå in på området, vilket leder till fler olika och specialiserade AI-lösningar
  • Universitet och forskningsinstitutioner kunde köra fler experiment med sina befintliga resurser
  • Inträdesbarriären för AI-forskning sjunker betydligt
  • Vi kan se nya tillämpningar inom områden som tidigare inte kunde bekosta AI-utveckling

Vad detta betyder för framtiden

Genom att använda mindre modeller som lärare, förändrar vi inte bara AI-utbildningens effektivitet – vi förändrar också vem som får delta i AI-utveckling. Konsekvenserna går långt utöver bara tekniska förbättringar.

Viktiga punkter att komma ihåg:

  • Utbildningstidsreduktionen på 28% är skillnaden mellan att starta ett AI-projekt eller att överväga det som utom räckhåll
  • Prestandaförbättringarna (34,87% på matematik, 67% på läsuppgifter) visar att tillgänglighet inte alltid behöver innebära att man gör avkall på kvalitet
  • SALT:s tillvägagångssätt visar att ibland kommer de bästa lösningarna från att tänka om grunderna snarare än att bara lägga till mer beräkningskraft

Vad att se upp för:

  1. Håll ett öga på mindre organisationer som börjar utveckla anpassade AI-modeller
  2. Titta efter nya tillämpningar inom områden som tidigare inte kunde bekosta AI-utveckling
  3. Letar efter innovationer i hur mindre modeller används för specialiserade uppgifter

Kom ihåg: Det verkliga värdet av SALT ligger i hur det kan omforma vem som får innovera inom AI. Oavsett om du driver ett forskningslaboratorium, hanterar ett tech-team eller bara är intresserad av AI-utveckling, är detta den typen av genombrott som kan göra din nästa stora idé möjlig.

Kanske börja tänka på det AI-projekt du trodde var utom räckhåll. Det kan vara mer möjligt än du trodde.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.