Modele i platformy AI

Google robi szkolenie AI o 28% szybsze, używając SLM jako nauczycieli

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Szkolenie dużych modeli językowych (LLM) stało się niedostępne dla większości organizacji. Z kosztami sięgającymi milionów i wymaganiami obliczeniowymi, które byłyby w stanie spowodować pocenie się superkomputera, rozwój AI pozostał zamknięty za drzwiami gigantów technologicznych. Ale Google (GOOGL ) właśnie odwróciło tę historię do góry nogami, używając podejścia tak prostego, że aż dziwne, że nikt wcześniej na to nie wpadł: używając mniejszych modeli AI jako nauczycieli.

Jak działa SALT: nowe podejście do szkolenia modeli AI

W niedawnym artykule badawczym pt. “Trochę pomocy idzie daleko: wydajne szkolenie LLM przy użyciu mniejszych modeli,” Google Research i DeepMind wprowadzili SALT (Small model Aided Large model Training). To nowe podejście wyzwala nasze tradycyjne podejście do szkolenia LLM.

Dlaczego to badanie jest znaczące? Obecnie szkolenie dużych modeli AI jest jak próba nauczenia kogoś wszystkiego, co potrzebne jest do danego tematu od razu – jest to niewydajne, drogie i często ograniczone do organizacji z ogromnymi zasobami obliczeniowymi. SALT podchodzi do tego inaczej, wprowadzając dwuetapowy proces szkolenia, który jest zarówno innowacyjny, jak i praktyczny.

Rozbicie, jak SALT naprawdę działa:

Etap 1: Destylacja wiedzy

  • Mniejszy model językowy (SLM) działa jako nauczyciel, dzieląc się swoim zrozumieniem z większym modelem
  • Mniejszy model koncentruje się na przenoszeniu swojej “nabytej wiedzy” za pomocą tego, co badacze nazywają “miękkimi etykietami”
  • Można to porównać do asystenta, który zajmuje się podstawowymi pojęciami, zanim uczeń przejdzie do zaawansowanych tematów
  • Ten etap jest szczególnie skuteczny w “łatwych” obszarach uczenia – obszarach, w których mniejszy model ma silną pewność predykcyjną

Etap 2: Samouczne uczenie

  • Duży model przechodzi do niezależnego uczenia
  • Koncentruje się na opanowaniu złożonych wzorców i trudnych zadań
  • To jest miejsce, w którym model rozwija możliwości poza tym, co mógłby zapewnić jego mniejszy “nauczyciel”
  • Przejście między etapami używa starannie opracowanych strategii, w tym liniowego zaniku i liniowego zaniku współczynnika destylacji

W nieotechnicznych słowach, wyobraź sobie, że mniejszy model AI jest jak pomocny tutor, który prowadzi większy model w początkowych etapach szkolenia. Ten tutor dostarcza dodatkowe informacje wraz z odpowiedziami, wskazując, jak pewny jest co do każdej odpowiedzi. Te dodatkowe informacje, znane jako “miękkie etykiety”, pomagają większemu modelowi uczyć się szybciej i skuteczniej.

Teraz, gdy większy model AI staje się bardziej zdolny, musi przejść od polegania na tutorze do samodzielnego uczenia. To jest miejsce, w którym “liniowy zanik” i “liniowy zanik współczynnika” grają swoją rolę.
Można to porównać do stopniowego zmniejszania wpływu tutora w czasie:
  • Liniowy zanik: Jest to jak stopniowe zmniejszanie głośności głosu tutora. Wskazówki tutora stają się mniej wyraźne z każdym krokiem, pozwalając większemu modelowi skoncentrować się bardziej na uczeniu się z samych danych.
  • Liniowy zanik współczynnika: Jest to jak dostosowanie balansu między radami tutora a samym zadaniem. W miarę postępu szkolenia, nacisk przesuwa się bardziej w kierunku oryginalnego zadania, podczas gdy wpływ tutora staje się mniej dominujący.
Celem obu technik jest zapewnienie gładkiego przejścia dla większego modelu AI, uniemożliwiając nagłe zmiany w jego zachowaniu podczas uczenia.

Wyniki są przekonywujące. Gdy badacze Google przetestowali SALT, używając modelu SLM o 1,5 miliardzie parametrów do szkolenia modelu LLM o 2,8 miliardzie parametrów na zbiorze danych Pile, zaobserwowali:

  • 28% redukcję czasu szkolenia w porównaniu z tradycyjnymi metodami
  • Znaczące poprawy wydajności po dalszym szkoleniu:
    • Dokładność rozwiązywania problemów matematycznych wzrosła do 34,87% (w porównaniu z 31,84% w przypadku podstawy)
    • Zrozumienie czytania osiągnęło 67% dokładności (wzrost z 63,7%)

Ale to, co naprawdę czyni SALT innowacyjnym, to jego teoretyczna struktura. Badacze odkryli, że nawet “słabszy” model nauczyciela może poprawić wyniki ucznia, osiągając tzw. “korzystny trade-off między biasem a wariancją”. W prostszych słowach, mniejszy model pomaga większemu w nauce podstawowych wzorców w sposób bardziej wydajny, tworząc silniejszą podstawę dla zaawansowanego uczenia.

Dlaczego SALT może zmienić pole gry w rozwoju AI

Pamiętaj, kiedy chmura obliczeniowa zmieniła, kto mógł założyć firmę technologiczną? SALT może zrobić to samo dla rozwoju AI.

Śledzę innowacje w szkoleniu AI od lat, a większość przełomów przyniosła głównie korzyści gigantom technologicznym. Ale SALT jest inne.

To, co to może oznaczać dla przyszłości:

Dla organizacji o ograniczonych zasobach:

  • Możesz nie potrzebować już ogromnej infrastruktury obliczeniowej, aby rozwijać zdolne modele AI
  • Mniejsze laboratoria badawcze i firmy mogą eksperymentować z rozwojem niestandardowych modeli
  • 28% redukcja czasu szkolenia przekłada się bezpośrednio na niższe koszty obliczeniowe
  • Co więcej, możesz zacząć od skromnych zasobów obliczeniowych i nadal osiągać profesjonalne wyniki

Dla krajobrazu rozwoju AI:

  • Więcej graczy może wejść na rynek, prowadząc do bardziej zróżnicowanych i wyspecjalizowanych rozwiązań AI
  • Uczelnie i instytucje badawcze mogą prowadzić więcej eksperymentów ze swoimi istniejącymi zasobami
  • Bariera wejścia do badań AI znacznie maleje
  • Możemy zobaczyć nowe zastosowania w dziedzinach, które wcześniej nie mogły sobie pozwolić na rozwój AI

To, co to oznacza dla przyszłości

Używając mniejszych modeli jako nauczycieli, nie tylko zwiększamy wydajność szkolenia AI, ale także zmieniamy fundamentalnie, kto może uczestniczyć w rozwoju AI. Wnioski idą znacznie dalej niż tylko poprawy techniczne.

Kluczowe punkty do zapamiętania:

  • Redukcja czasu szkolenia o 28% to różnica między rozpoczęciem projektu AI a uznaniem go za niedostępny
  • Poprawy wydajności (34,87% w zadaniach matematycznych, 67% w zadaniach czytania) pokazują, że dostępność nie zawsze oznacza kompromis w jakości
  • Podejście SALT dowodzi, że czasami najlepsze rozwiązania pochodzą z przebudowy podstaw, a nie tylko dodawania mocy obliczeniowej

Co obserwować:

  1. Zwróć uwagę na mniejsze organizacje, które zaczynają rozwijać niestandardowe modele AI
  2. Obserwuj nowe zastosowania w dziedzinach, które wcześniej nie mogły sobie pozwolić na rozwój AI
  3. Szukaj innowacji w tym, jak mniejsze modele są używane do specjalistycznych zadań

Pamiętaj: Prawdziwa wartość SALT tkwi w tym, jak może zmienić, kto może innowować w AI. Niezależnie od tego, czy prowadzisz laboratorium badawcze, zarządzasz zespołem technicznym, czy po prostu interesujesz się rozwojem AI, to przełom może umożliwić Twoją następną wielką ideę.

Może zacznij myśleć o tym projekcie AI, który wydawał się niedostępny. Może jest bardziej możliwy, niż sobie wyobrażałeś.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.