Liderzy opinii

Czy GPT-4 przybliży nas do prawdziwej rewolucji AI?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Minęło już prawie trzy lata od wprowadzenia GPT-3 w maju 2020 roku. Od tego czasu model generacji tekstu AI wzbudził duże zainteresowanie ze względu na swoją zdolność tworzenia tekstu, który wygląda i brzmi jak napisany przez człowieka. Teraz wygląda na to, że następna wersja oprogramowania, GPT-4, jest już na horyzoncie, z przewidywaną datą wydania w pierwszej połowie 2023 roku.

Pomimo wysokiego poziomu zainteresowania tą wiadomością AI, dokładne informacje na temat GPT-4 są dość niejasne. OpenAI, firma odpowiedzialna za GPT-4, nie ujawniła publicznie wiele informacji na temat nowego modelu, takich jak jego funkcje czy możliwości. Niemniej jednak, ostatnie postępy w dziedzinie AI, szczególnie w odniesieniu do przetwarzania języka naturalnego (NLP), mogą dostarczyć pewnych wskazówek dotyczących tego, czego możemy oczekiwać od GPT-4.

Czym jest GPT?

Przed przejściem do szczegółów warto najpierw ustalić podstawy dotyczące tego, czym jest GPT. GPT oznacza Generative Pre-trained Transformer i odnosi się do modelu sieci neuronowej głębokiego uczenia, który jest szkolony na danych dostępnych z Internetu w celu tworzenia dużych ilości generowanego przez maszynę tekstu. GPT-3 jest trzecią generacją tej technologii i jest jednym z najbardziej zaawansowanych modeli generacji tekstu AI dostępnych obecnie.

Wyobraź sobie GPT-3 jako działający nieco jak asystenci głosowi, takie jak Siri lub Alexa, tylko w znacznie większej skali. Zamiast prosić Alexa o odtworzenie ulubionej piosenki lub wpisanie tekstu za pomocą Siri, możesz poprosić GPT-3 o napisanie całej książki w kilka minut lub wygenerowanie 100 pomysłów na posty w mediach społecznościowych w mniej niż minutę. Wszystko, co użytkownik musi zrobić, to podać wskazówkę, taką jak “Napisz mi artykuł o 500 słowach na temat znaczenia kreatywności”. O ile wskazówka jest jasna i konkretna, GPT-3 może napisać prawie wszystko, o co poprosisz.

Od czasu udostępnienia GPT-3 publiczności znalazło ono wiele zastosowań biznesowych. Firmy wykorzystują je do podsumowania tekstu, tłumaczenia języka, generowania kodu i dużej automatyzacji niemal każdego zadania związanego z pisaniem.

Powiedzmy, że chociaż GPT-3 jest bez wątpienia bardzo imponujący, jeśli chodzi o tworzenie bardzo czytelnych tekstów podobnych do tych napisanych przez człowieka, to jednak jest daleki od ideału. Problemy pojawiają się, gdy jest proszony o napisanie dłuższych utworów, szczególnie w przypadku skomplikowanych tematów, które wymagają wglądu. Na przykład, wskazówka dotycząca wygenerowania kodu komputerowego dla strony internetowej może spowodować powstanie poprawnego, ale nieoptymalnego kodu, więc człowiek-koder musi jeszcze wejść i wprowadzić poprawki. Jest to podobny problem z dużymi dokumentami tekstowymi: im większa objętość tekstu, tym bardziej prawdopodobne jest, że pojawią się błędy – czasem zabawne – które wymagają poprawienia przez pisarza.

Prosto mówiąc, GPT-3 nie jest pełnym zastępnikiem pisarzy ludzkich ani kodujących, i nie powinno się go tak traktować. Zamiast tego GPT-3 powinno być postrzegane jako asystent do pisania, który może zaoszczędzić ludziom dużo czasu, gdy potrzebują wygenerować pomysły na posty na blogu lub szkice do reklam lub komunikatów prasowych.

Czy więcej parametrów oznacza lepiej?

Jedną rzeczą, którą trzeba zrozumieć w odniesieniu do modeli AI, jest to, jak wykorzystują one parametry do dokonywania przewidywań. Parametry modelu AI definiują proces uczenia i zapewniają strukturę dla danych wyjściowych. Liczba parametrów w modelu AI była ogólnie używana jako miara wydajności. Im więcej parametrów, tym bardziej potężny, gładki i przewidywalny jest model, przynajmniej według hipotezy skalowania.

Na przykład, gdy GPT-1 został wydany w 2018 roku, miał 117 milionów parametrów. GPT-2, wydany rok później, miał 1,2 miliarda parametrów, podczas gdy GPT-3 zwiększył tę liczbę jeszcze bardziej do 175 miliardów parametrów. Według wywiadu z Wired z sierpnia 2021 roku, Andrew Feldman, założyciel i dyrektor generalny Cerebras, firmy partnerującej z OpenAI, powiedział, że GPT-4 będzie miał około 100 bilionów parametrów. To sprawiłoby, że GPT-4 byłby 100 razy potężniejszy niż GPT-3, skok parametryczny, który zrozumiale wywołał duże emocje.

Jednak pomimo ambitnych deklaracji Feldmana, istnieją powody, by sądzić, że GPT-4 nie będzie miał 100 bilionów parametrów. Im większa liczba parametrów, tym droższy staje się model w szkoleniu i dostosowaniu ze względu na ogromne ilości mocy obliczeniowej.

Ponadto istnieją czynniki poza samą liczbą parametrów, które określają skuteczność modelu. Weźmy na przykład Megatron-Turing NLG, model generacji tekstu zbudowany przez Nvidia i Microsoft, który ma ponad 500 miliardów parametrów. Pomimo swojego rozmiaru, MT-NLG nie zbliża się do GPT-3 pod względem wydajności. Innymi słowy, większy nie zawsze oznacza lepszy.

Prawdopodobnie GPT-4 będzie miał więcej parametrów niż GPT-3, ale pozostaje pytanie, czy ta liczba będzie rzędu wielkości wyższego. Zamiast tego istnieją inne interesujące możliwości, które OpenAI prawdopodobnie realizuje, takie jak lżejszy model, który koncentruje się na jakościowych ulepszeniach w projekcie algorytmicznym i wyrównaniu. Dokładny wpływ takich ulepszeń jest trudny do przewidzenia, ale wiadomo, że model rzadki może zmniejszyć koszty obliczeniowe za pomocą tzw. obliczeń warunkowych, tj. nie wszystkie parametry w modelu AI będą aktywne cały czas, co jest podobne do tego, jak neurony w ludzkim mózgu działają.

Co będzie mogło zrobić GPT-4?

Aż OpenAI wyda nowe oświadczenie lub nawet wyda GPT-4, możemy jedynie spekulować, jak będzie się różnił od GPT-3. Niezależnie od tego możemy jednak poczynić pewne przewidywania.

Chociaż przyszłość rozwoju głębokiego uczenia AI jest multimodalna, GPT-4 najprawdopodobniej pozostanie modelem tylko dla tekstu. Jako ludzie żyjemy w świecie wielozmysłowym, wypełnionym różnymi dźwiękami, wizualnymi i tekstowymi wprowadzeniami. Dlatego jest nieuniknione, że rozwój AI w końcu wyprodukuje model multimodalny, który może uwzględniać różne dane wejściowe.

Jednak dobry model multimodalny jest znacznie trudniejszy do zaprojektowania niż model tylko dla tekstu. Technologia po prostu jeszcze nie jest tam, a biorąc pod uwagę ograniczenia dotyczące rozmiaru parametrów, prawdopodobnie OpenAI koncentruje się na rozwijaniu i ulepszaniu modelu tylko dla tekstu.

Również prawdopodobne jest, że GPT-4 będzie mniej zależny od precyzyjnego wprowadzania danych. Jedną z wad GPT-3 jest to, że dane wejściowe muszą być starannie napisane, aby uzyskać pożądany wynik. Gdy dane wejściowe nie są starannie napisane, można otrzymać dane wyjściowe, które są nieprawdziwe, toksyczne lub nawet odzwierciedlające ekstremistyczne poglądy. To jest część tego, co nazywa się “problemem wyrównania” i odnosi się do wyzwań w tworzeniu modelu AI, który w pełni rozumie intencje użytkownika. Innymi słowy, model AI nie jest wyrównany z celami lub intencjami użytkownika. Ponieważ modele AI są szkolone przy użyciu zestawów danych z Internetu, bardzo łatwo jest, aby ludzkie uprzedzenia, fałsze i uprzedzenia znalazły się w danych wyjściowych.

Powiadają, że istnieją powody, by wierzyć, że deweloperzy robią postępy w rozwiązywaniu problemu wyrównania. Optymizm ten wynika z pewnych przełomów w rozwoju InstructGPT, bardziej zaawansowanej wersji GPT-3, która jest szkolona na podstawie opinii ludzi, aby bardziej ściśle przestrzegać instrukcje i intencje użytkownika. Ludzie stwierdzili, że InstructGPT był znacznie mniej zależny od dobrych danych wejściowych niż GPT-3.

Jednak powinno się zauważyć, że te testy były przeprowadzane tylko z pracownikami OpenAI, dość jednorodną grupą, która może się nie różnić znacznie pod względem płci, religii lub poglądów politycznych. Prawdopodobnie jest to bezpieczna zakład, że GPT-4 będzie przechodził bardziej zróżnicowane szkolenie, które poprawi wyrównanie dla różnych grup, choć w jakim stopniu pozostaje niepewne.

Czy GPT-4 zastąpi ludzi?

Pomimo obietnic GPT-4, jest mało prawdopodobne, że całkowicie zastąpi potrzebę pisarzy ludzkich i kodujących. Jest jeszcze wiele pracy do wykonania, od optymalizacji parametrów po multimodalność i wyrównanie. Może to potrwać wiele lat, zanim zobaczymy generator tekstu, który może osiągnąć prawdziwe ludzkie zrozumienie złożoności i niuansów prawdziwego doświadczenia.

Nawet tak, istnieją powody, by być podekscytowanym nadchodzącym GPT-4. Optymalizacja parametrów – a nie tylko ich wzrost – prawdopodobnie doprowadzi do modelu AI, który ma znacznie więcej mocy obliczeniowej niż jego poprzednik. A poprawione wyrównanie sprawi, że GPT-4 będzie znacznie bardziej przyjazny dla użytkownika.

Ponadto jesteśmy jeszcze tylko na początku rozwoju i wdrożenia narzędzi AI. Coraz więcej przypadków użycia tej technologii jest odkrywanych, a im ludzie zdobywają więcej zaufania i komfortu z używaniem AI w miejscu pracy, tym bardziej pewne jest, że zobaczymy powszechne wdrożenie narzędzi AI w niemal każdej branży biznesowej w nadchodzących latach.

Dr. Danny Rittman, jest CTO GBT Technologies, rozwiązanie stworzone w celu umożliwienia wdrożenia IoT (Internet of Things), globalnych sieci siatkowych, sztucznej inteligencji oraz aplikacji związanych z projektem układów scalonych.