Modely a platformy AI

Google dělá školení AI o 28% rychlejší pomocí SLM jako učitelů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Školení velkých jazykových modelů (LLM) se stalo pro většinu organizací nedosažitelným. S náklady, které se pohybují v milionech a výpočetními požadavky, které by zpocály i superpočítač, zůstal vývoj AI uzavřený za dveřmi technologických gigantů. Ale Google (GOOGL ) právě otočil tento příběh vzhůru nohama s přístupem tak jednoduchým, že vás to nutí divit, proč na to nikdo dříve nepřišel: použití menších AI modelů jako učitelů.

Jak SALT funguje: Nový přístup ke školení AI modelů

V nedávné výzkumné práci s názvem “A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs,” představili Google Research a DeepMind SALT (Small model Aided Large model Training). Jedná se o novou metodu, která zpochybňuje náš tradiční přístup ke školení LLM.

Proč je tento výzkum významný? V současné době je školení velkých AI modelů podobné jako učit někoho všechno, co potřebuje vědět o určitém předmětu najednou – je to neefektivní, drahé a často omezené na organizace s masivními výpočetními zdroji. SALT zvolil jinou cestu, představil dvoufázový školicí proces, který je både inovativní a praktický.

Rozbor toho, jak SALT skutečně funguje:

1. fáze: Získání znalostí

  • Menší jazykový model (SLM) funguje jako učitel, sdílí své porozumění s větším modelem
  • Menší model se zaměřuje na přenos svých “získaných znalostí” prostřednictvím toho, co výzkumníci nazývají “měkkými štítky”
  • Představte si to jako učitele, který zpracovává základní koncepty, než student přechází k pokročilejším tématům
  • Tato fáze je zvláště efektivní v “lehkých” oblastech učení – oblastech, kde menší model má silnou předpovědní jistotu

2. fáze: Samoučící se učení

  • Větší model přechází na nezávislé učení
  • Zaměřuje se na zvládnutí složitých vzorců a náročných úkolů
  • Toto je místo, kde model vyvíjí schopnosti, které jeho menší “učitel” nemohl poskytnout
  • Přechod mezi fázemi využívá pečlivě navržené strategie, včetně lineárního poklesu a lineárního poměrového poklesu váhy ztráty destilace

V nelékařských termínech si představte, že menší AI model je jako pomocný učitel, který vede větší model v počátečních fázích školení. Tento učitel poskytuje další informace spolu se svými odpověďmi, které ukazují, jak je si jistý každou odpovědí. Tyto další informace, nazývané “měkkými štítky”, pomáhají většímu modelu učit se rychleji a efektivněji.

Nyní, když se větší AI model stává schopnějším, potřebuje přejít od závislosti na učiteli k nezávislému učení. Toto je místo, kde “lineární pokles” a “lineární poměrový pokles” přicházejí do hry.
Představte si tyto techniky jako postupné snižování vlivu učitele v čase:
  • Lineární pokles: Je to jako pomalé snižování hlasitosti učitele. Učitelova vedení se stává méně prominentním s každým krokem, umožňující většímu modelu soustředit se více na učení z raw dat samotných.
  • Lineární poměrový pokles: Je to jako úprava rovnováhy mezi učitelem a původním úkolem. Jak školení postupuje, důraz se přesouvá více na původní úkol, zatímco učitelův vstup se stává méně dominantním.
Cílem obou technik je zajistit hladký přechod pro větší AI model, zabránit jakékoli náhlé změně v jeho učebním chování.

Výsledky jsou přesvědčivé. Když výzkumníci z Google otestovali SALT pomocí 1,5 miliardového parametru SLM pro školení 2,8 miliardového parametru LLM na Pile datasetu, viděli:

  • 28% snížení školicího času ve srovnání s tradičními metodami
  • Významné zlepšení výkonu po jemném ladění:
    • Přesnost matematických problémů skočila na 34,87% (ve srovnání s 31,84% bazickým)
    • Čtenářská komprese dosáhla 67% přesnosti (oproti 63,7%)

Ale co dělá SALT skutečně inovativním, je jeho teoretický rámec. Výzkumníci objevili, že i “slabší” učební model může zlepšit výkon studenta tím, že dosáhne “příznivého rozdílu mezi variací a průměrem”. V jednoduchých termínech menší model pomáhá většímu modelu učit se základní vzorce efektivněji, vytváří silnější základ pro pokročilé učení.

Proč SALT může změnit hru ve vývoji AI

Pamatujete, když cloud computing proměnil, kdo mohl založit technologickou společnost? SALT by mohl udělat totéž pro vývoj AI.

Sleduji inovace ve školení AI po mnoho let a většina průlomů hlavně prospěla technologickým gigantům. Ale SALT je jiný.

Toto je to, co by to mohlo znamenat pro budoucnost:

Pro organizace s omezenými zdroji:

  • Možná již nebudete potřebovat masivní výpočetní infrastrukturu pro vývoj schopných AI modelů
  • Menší výzkumné laboratoře a společnosti by mohly experimentovat s vlastním vývojem modelů
  • 28% snížení školicího času se přímo překládá do nižších výpočetních nákladů
  • Více důležitějšího je, že můžete začít s skromnými výpočetními zdroji a přesto dosáhnout profesionálních výsledků

Pro vývoj AI:

  • Více hráčů by mohlo vstoupit do tohoto odvětví, vedoucí k více různorodým a specializovaným AI řešením
  • Univerzity a výzkumné instituce by mohly provádět více experimentů se svými stávajícími zdroji
  • Bariéra pro vstup do výzkumu AI se významně snižuje
  • Můžeme vidět nové aplikace v oblastech, které dříve nemohly dovolit vývoj AI

Co to znamená pro budoucnost

Používáním menších modelů jako učitelů neměníme pouze efektivitu školení AI – fundamentálně měníme, kdo se může účastnit vývoje AI. Důsledky sahají daleko za technické zlepšení.

Klíčové body, které je třeba mít na paměti:

  • 28% snížení školicího času je rozdíl mezi tím, zda můžete začít AI projekt nebo zda je považujete za nedosažitelný
  • Zlepšení výkonu (34,87% na matematických úkolech, 67% na čtenářské komprese) ukazuje, že dostupnost nemusí vždy znamenat kompromis v kvalitě
  • Přístup SALT dokazuje, že někdy nejlepší řešení pocházejí z přehodnocení základních principů, spíše než pouze přidání více výpočetního výkonu

Co sledovat:

  1. Sledujte menší organizace, které začínají vyvíjet vlastní AI modely
  2. Sledujte nové aplikace v oblastech, které dříve nemohly dovolit vývoj AI
  3. Hledejte inovace v tom, jak jsou menší modely používány pro specializované úkoly

Pamatujte: Skutečná hodnota SALT spočívá v tom, jak by mohl změnit, kdo se může účastnit inovací v AI. Bez ohledu na to, zda řídíte výzkumnou laboratoř, spravujete technologický tým nebo jste jen zajímáni o vývoj AI, jedná se o průlom, který by mohl učinit váš další velký nápad možným.

Možná začněte uvažovat o tom AI projektu, o kterém jste si mysleli, že je nedosažitelný. Může být více možný, než jste si představovali.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.