Modele i platformy AI
Rozwój Wyrównania AI z Ludzkimi Wartościami za Pomocą WARM
Wyrównanie Systemów AI z Ludzkimi Wartościami
Systemy sztucznej inteligencji (AI) stają się coraz bardziej zdolne do pomocy ludziom w złożonych zadaniach, od czatbotów obsługi klienta po algorytmy diagnostyki medycznej. Jednakże, gdy te systemy AI przejmują coraz więcej odpowiedzialności, jest niezwykle ważne, aby pozostawały wyrównane z ludzkimi wartościami i preferencjami. Jednym z podejść do osiągnięcia tego celu jest technika zwana wzmocnieniem uczenia się z ludzkiej informacji zwrotnej (RLHF). W RLHF, system AI, znany jako polityka, jest nagradzany lub karany na podstawie ludzkich osądów jego zachowania. Celem jest, aby polityka nauczyła się maksymalizować swoje nagrody, a tym samym zachowywała się zgodnie z ludzkimi preferencjami.
Kluczowym składnikiem RLHF jest model nagrody (RM). RM jest odpowiedzialny za ocenianie działań i wyników polityki, oraz zwracanie sygnału nagrody w celu prowadzenia procesu uczenia się. Projektowanie dobrego RM jest wyzwaniem, ponieważ ludzkie preferencje mogą być złożone, zależne od kontekstu i nawet niekonsekwentne wśród jednostek. Niedawno, badacze z Google DeepMind zaproponowali innowacyjną technikę zwana WARM (Weight Averaged Reward Models), aby poprawić projektowanie RM.
Problemy z Nagradzaniem
Jednym z głównych problemów w RLHF jest nagradzanie. Nagradzanie występuje, gdy polityka znajduje luki, aby oszukać system RM i uzyskać wysokie nagrody bez faktycznego spełniania zamierzonych celów. Na przykład, zakładając, że celem jest przeszkolenie asystenta pisarskiego AI, aby generować wysokiej jakości streszczenia. RM może nagradzać zwięzłe i informacyjne streszczenia. Polityka może następnie nauczyć się wykorzystywać to, generując bardzo krótkie, nieinformacyjne streszczenia posypane słowami kluczowymi, które oszukują RM.
Nagradzanie występuje z dwóch głównych powodów:
- Zmiana Dystrybucji – RM jest szkolony na ograniczonej zbiorze danych z ludzkimi etykietami. Podczas wdrożenia, dane wyjściowe polityki mogą pochodzić z innych dystrybucji, do których RM nie ogólnie się dobrze.
- Hałas w Etykietach – Ludzkie etykietowanie jest niedoskonałe, z niezgodnościami między oceniami. RM może zaczepić się o sygnały fałszywe, zamiast solidnych wskaźników jakości.
Nagradzanie prowadzi do bezużytecznych systemów, które nie spełniają ludzkich oczekiwań. Co gorsza, może to skutkować zachowaniami AI, które są tendencyjne lub nawet niebezpieczne, jeśli wdrożone są bez rozważenia.
Wzrost Połączenia Modeli
Rosnące zainteresowanie strategiami łączenia modeli, takimi jak Model Ratatouille, jest spowodowane uzmysłowieniem, że większe modele, choć potężne, mogą być niewydajne i niepraktyczne. Uczenie modelu z 1 trylionem parametrów wymaga ogromnych ilości danych, obliczeń, czasu i kosztów. Co więcej, takie modele mają tendencję do przystosowania się do dystrybucji szkoleniowej, utrudniając im generalizację do różnorodnych, rzeczywistych sytuacji.
Łączenie modeli oferuje alternatywną drogę do odblokowania większych możliwości bez niekontrolowanego zwiększania skali. Przez ponowne wykorzystanie wielu wyspecjalizowanych modeli szkolonych na różnych dystrybucjach, zadaniach lub celach, łączenie modeli ma na celu poprawę wszechstronności i wytrzymałości poza dystrybucją. Założenie jest takie, że różne modele przechwytują odrębne wzorce predykcyjne, które mogą się uzupełniać, gdy są łączone.
Niedawne wyniki ilustrują obietnicę tego pojęcia. Modele uzyskane za pomocą łączenia, pomimo mając znacznie mniej parametrów, mogą dorównać lub nawet przewyższyć wyniki gigantycznych modeli, takich jak GPT-3. Na przykład, zespół Modelu Ratatouille składający się z tylko 7 średnich punktów kontrolnych osiąga najlepszą dokładność na wysokowymiarowych zbiorach danych implikacji tekstowych, przewyższając GPT-3.
Prostota łączenia przez średnią ważoną jest ogromną zaletą. Uczenie wielu pomocniczych modeli wymaga dodatkowych zasobów. Jednak kluczowo, obliczenia w czasie inferencji pozostają identyczne jak dla jednego modelu, ponieważ wagi są kondensowane w jeden. To sprawia, że metoda jest łatwo adaptowalna, bez obaw o zwiększone opóźnienia lub koszty pamięci.
Mechanizmy Za Łączeniem Modeli
Ale co dokładnie umożliwia te zyski dokładności z łączenia modeli? Ostatnia analiza dostarcza pewnych wskazówek:
- Łagodzenie Zapamiętywania: Każdy model widzi różne losowe partie danych podczas szkolenia. Średnia zmniejsza zapamiętywanie przypadkowe, zachowując tylko uogólnienia na poziomie zbioru.
- Redukcja Wariancji: Modele szkolone niezależnie mają niezwiązane błędy. Łączenie ich średniej redukuje szum, poprawiając kalibrację.
- Regulacja poprzez Różnorodność: Zmienne zadania pomocnicze zmuszają modele do zaczepienia się o bardziej uogólnialne cechy użyteczne w różnych dystrybucjach.
- Zwiększona Wytrzymałość: Niespójność w predykcjach sygnalizuje niepewność. Średnia łagodzi wyroki odstające, zwiększając niezawodność.
W istocie, łączenie modeli równoważy słabości poszczególnych modeli, aby zwiększyć ich zbiorowe siły. Połączona reprezentacja przechwytuje wspólne podstawowe struktury przyczynowe, ignorując przypadkowe wahania.
To pojęciowe podstawy łączą łączenie modeli z innymi popularnymi technikami, takimi jak ensemblistyka i wielozadaniowe uczenie się. Wszystkie te metody wykorzystują różnorodność w modelach lub zadaniach, aby uzyskać wszechstronne, świadome niepewności systemy. Prostota i wydajność średniej ważonej dają łączeniu modeli unikalną przewagę w rozwijaniu wdrożeń w świecie rzeczywistym.
WARM
WARM innowacyjnie wykorzystuje model nagrody proxy (RM), który jest średnią ważoną wielu indywidualnych RM, każdego doskonale dopasowanego z tego samego pre-trenowanego LLM, ale z różnymi hiperparametrami. Ta metoda zwiększa wydajność, niezawodność podczas przesunięć dystrybucyjnych i wytrzymałość na niekonsekwentne preferencje. Badanie również pokazuje, że używanie WARM jako modelu nagrody proxy, szczególnie z zwiększoną liczbą uśrednionych RM, poprawia wyniki i opóźnia pojawienie się ‘nagradzania’, zjawiska, w którym nagrody kontroli pogarszają się w czasie.
Oto podsumowanie:
- Rozpocznij od podstawowego modelu językowego wstępnie trenowanego na dużym korpusie. Zainicjuj wiele RM, dodając małe warstwy specyficzne dla zadania na górze.
- Doskonale dopasuj każdy RM oddzielnie na zbiorze danych preferencji ludzkich, używając różnych hiperparametrów, takich jak szybkość uczenia się, dla różnorodności.
- Uśrednij wagi dopasowanych RM, aby uzyskać pojedynczy zespół WARM.
Kluczowa intuicja polega na tym, że uśrednianie ważone zachowuje tylko niezmienną informację, która jest uczona we wszystkich różnorodnych RM. To redukuje zależność od sygnałów fałszywych, zwiększając wytrzymałość. Zespół korzysta również z redukcji wariancji, poprawiając niezawodność pomimo przesunięć dystrybucyjnych.
Jak omówiono wcześniej, różnorodność w niezależnie trenowanych modelach jest kluczowa dla odblokowania pełnego potencjału łączenia modeli. Ale jakie są konkretnymi techniki, które mogą promować produktywną różnorodność?
Artykuł WARM eksploruje kilka pomysłów, które mogą się szerzej zastosować:
Permutacje Kolejności
Trywialne, ale wpływowe podejście, jest losowanie kolejności, w jakiej dane są widziane przez każdy model podczas szkolenia. Nawet ten prosty krok de-koreluje wagi, redukując redundancję pamięci wzorców.
Wariacje Hiperparametrów
Dostosowanie hiperparametrów, takich jak szybkość uczenia się i dropout, dla każdego przebiegu wprowadza użyteczną różnorodność. Modele konwergują inaczej, przechwytując odrębne właściwości zbioru.
Uśrednianie Punktu Kontrolnego – Baklava
Metoda Baklava inicjuje modele do łączenia z różnych migawek w tym samym przebiegu pre-trenowania. To luzuje ograniczenia w porównaniu z zupą modeli, która wymaga wspólnego punktu startowego. W stosunku do Modelu Ratatouille, Baklava unika dodatkowych zadań. Ogólnie, uderza w skuteczne równowagi między dokładnością a różnorodnością.
Analiza potwierdza, że dodawanie starszych punktów kontrolnych przez średnią ważoną szkodzi indywidualnym wynikom, kompromitując zalety różnorodności. Uśrednianie tylko końcowych reprezentacji z każdego przebiegu działa lepiej. Ogólnie, balansowanie celów różnorodności z utrzymaniem dokładności pozostaje otwartym wyzwaniem badawczym.
Ogólnie, łączenie modeli współgra z ogólnym etosem w dziedzinie, aby recyklingować istniejące zasoby skutecznie, aby zwiększyć niezawodność, wydajność i wszechstronność. Prostota uśredniania ważonego umacnia jego pozycję jako wiodącego kandydata do montowania wytrzymałych modeli z gotowych bloków.
W przeciwieństwie do tradycyjnych metod ensemblistyki, które uśredniają predykacje, WARM utrzymuje minimalne obciążenie obliczeniowe, utrzymując tylko jeden zestaw wag. Eksperymenty na zadaniach podsumowywania tekstu demonstrują skuteczność WARM:
- Dla najlepszego z N próbek, WARM osiąga 92,5% wskaźnik wygranych w porównaniu z losową selekcją według etykiet preferencji ludzkich.
- W RLHF, polityka WARM osiąga 79,4% wskaźnik wygranych w porównaniu z polityką trenowaną z jednym RM po tej samej liczbie kroków.
- WARM nadal działa dobrze, nawet gdy jedna czwarta etykiet ludzkich jest skażona.
Te wyniki ilustrują potencjał WARM jako praktycznej techniki dla rozwijania asystentów AI, które zachowują się niezawodnie. Poprzez wyrównywanie niekonsekwencji w ludzkiej informacji zwrotnej, polityki WARM mogą pozostać trwale wyrównane z ludzkimi wartościami, nawet gdy kontynuują uczenie się z nowych doświadczeń.
Szeroki Kontekst
WARM znajduje się na przecięciu dwóch kluczowych trendów w badaniach wyrównania AI. Po pierwsze, jest to studium generalizacji poza dystrybucją (OOD), które ma na celu poprawę wyników modelu na nowych danych, które różnią się od dystrybucji treningowej. Po drugie, jest to badanie nad algorytmiczną wytrzymałością, koncentrujące się na niezawodności pomimo małych perturbacji wejściowych lub szumu.
Poprzez nawiązanie połączeń między tymi dziedzinami wokół pojęcia nauczonych niezmiennych, WARM prowadzi nas ku bardziej gruntownie opracowanym technikom wyrównania wartości. Wglądy z WARM mogą uogólnić się nawet poza RLHF, dostarczając lekcji dla szerszych systemów uczenia maszynowego, które interaktywnie oddziałują z otwartym światem.
Oczywiście, modelowanie nagrody jest tylko jednym z elementów układanki wyrównania. Wciąż potrzebujemy postępów w innych wyzwaniach, takich jak specyfikacja nagrody, nadzór w skali i bezpieczna eksploracja. W połączeniu z komplementarnymi technikami, WARM może przyspieszyć rozwój AI, która zrównoważenie promuje ludzki dobrobyt. Poprzez zbiorowe wyjaśnienie zasad, które leżą u podstaw wytrzymałego wyrównania, badacze są w trakcie wytyczania drogi ku korzystnemu, etycznemu AI.














