Modele i platformy AI

Czy można zbudować duże modele językowe jak ChatGPT za połowę kosztu?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Duże modele językowe (LLM) jak GPT-3 i ChatGPT rewolucjonizują sztuczną inteligencję, oferując możliwości zrozumienia języka naturalnego i generowania treści. Jednak ich rozwój wiąże się z wysokimi kosztami, ograniczając dostępność i dalsze badania. Naukowcy szacują, że szkolenie GPT-3 kosztowało OpenAI około $5 milionów. Niemniej jednak, Microsoft (MSFT ) uznał potencjał i zainwestował $1 miliard w 2019 roku i $10 miliardów w 2023 roku w przedsięwzięciu OpenAI z GPT-3 i ChatGPT.

LLM to modele uczenia maszynowego szkolone na obszernych danych tekstowych do zastosowań związanych z przetwarzaniem języka naturalnego. Opierają się one na architekturze transformatora i wykorzystują mechanizmy uwagi do zadań związanych z przetwarzaniem języka, takich jak odpowiedzi na pytania, tłumaczenia maszynowe, analiza sentymentu itp.

Powstaje pytanie: czy można zwiększyć wydajność tych dużych modeli, jednocześnie redukując koszty obliczeniowe i czas szkolenia?

Wydano kilka podejść, takich jak Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance itp., aby zmniejszyć koszty obliczeniowe szkolenia sieci neuronowych. Nowatorskie podejście LiGO (Linear Growth Operator), które będziemy omawiać, ustanawia nowy standard. Polega ono na zainicjowaniu wag większych modeli z mniejszych wstępnie wytrenowanych modeli, umożliwiając efektywne skalowanie sieci neuronowych.

Przed omówieniem tej techniki, istotne jest zbadanie czynników, które przyczyniają się do wysokich kosztów tworzenia LLM.

Koszt budowy dużych modeli językowych

Trzy główne wydatki na rozwój LLM to:

1. Zasoby obliczeniowe

Budowa LLM wymaga ogromnych zasobów obliczeniowych do szkolenia na dużych zbiorach danych. Muszą one przetwarzać miliardy parametrów i uczyć się skomplikowanych wzorców z ogromnych danych tekstowych.

Inwestycja w specjalistyczne urządzenia, takie jak procesory graficzne (GPU) i jednostki przetwarzania tensorów (TPU), jest wymagana do budowy i szkolenia LLM, aby osiągnąć najlepsze wyniki.

Na przykład, GPT-3 został wytrenowany na superkomputerze z 10000 procesorami graficznymi (H100 i A100) i 285 000 rdzeniami procesora.

2. Zużycie energii

Wymagania obliczeniowe dla budowy LLM powodują znaczne zużycie energii. Na przykład, szkolenie 175 miliardów parametrów GPT-3 zajęło 14,8 dni przy użyciu 10 000 procesorów V100, co odpowiada 3,55 milionom godzin procesora. Taki wysoki poziom zużycia energii ma znaczny wpływ na środowisko.

3. Przechowywanie i zarządzanie danymi

LLM są szkolone na dużych zbiorach danych. Na przykład, GPT-3 został wytrenowany na ogromnym korpusie danych tekstowych, w tym Common Crawl, WebText2, Books1, Books2 i Wikipedia, wśród innych źródeł. Wymagana jest znaczna inwestycja w infrastrukturę do zbierania, kuracji i przechowywania tych danych.

Ponadto, wymagane jest przechowywanie w chmurze do przechowywania danych, a także ekspertyza ludzka do przetwarzania danych i kontroli wersji. Co więcej, zapewnienie, że strategia danych jest zgodna z przepisami, takimi jak RODO, również zwiększa koszty.

Technika LiGO: zmniejszanie kosztów budowy dużych modeli językowych o połowę

LiGO (Linear Growth Operator) to nowatorska technika opracowana przez naukowców z MIT, która zmniejsza koszty obliczeniowe szkolenia LLM o 50%. Metoda ta polega na zainicjowaniu wag większych modeli z mniejszych wstępnie wytrenowanych modeli, umożliwiając efektywne skalowanie sieci neuronowych.

Yoon Kim, główny autor artykułu, mówi:

„Szacuje się, że szkolenie modeli w skali, w jakiej działa ChatGPT, może kosztować miliony dolarów za jedną sesję szkoleniową. Czy możemy poprawić wydajność tych metod szkoleniowych, aby uzyskać dobre modele w krótszym czasie i za mniejsze pieniądze? Proponujemy to, wykorzystując mniejsze modele językowe, które zostały wcześniej wytrenowane.”

Metoda ta zachowuje korzyści wynikające z większych modeli przy zmniejszonym koszcie obliczeniowym i czasie szkolenia w porównaniu z szkoleniem modelu od podstaw. LiGO wykorzystuje operator liniowego wzrostu oparty na danych, który łączy operatory głębokości i szerokości dla optymalnej wydajności.

W artykule wykorzystano różne zestawy danych do przeprowadzenia eksperymentów opartych na tekście, w tym korpus angielskiej Wikipedii do szkolenia modeli BERT i RoBERTa oraz zestaw C4 do szkolenia modelu GPT2.

Eksperymenty z techniką LiGO obejmowały rozwinięcie modelu BERT-Small do BERT-Base, BERT-Base do BERT-Large, RoBERTa-Small do RoBERTa-Base, GPT2-Base do GPT2-Medium oraz CaiT-XS do CaiT-S.

Naukowcy porównali swoje podejście z kilkoma innymi punktami odniesienia, w tym szkoleniem od podstaw, szkoleniem progresywnym, bert2BERT i KI.

Technika LiGO oferowała 44,7% oszczędności w operacjach zmiennoprzecinkowych (FLOPs) i 40,7% oszczędności w czasie szkolenia w porównaniu z szkoleniem modelu BERT-Base od podstaw, wykorzystując model BERT-Small. Operator wzrostu LiGO przewyższa StackBERT, MSLT, bert2BERT i KI w efektywnym szkoleniu.

Korzyści z wykorzystania techniki optymalizacji szkolenia takiej jak LiGO

LiGO to efektywna metoda szkolenia sieci neuronowych, która ma wiele korzyści, wymienionych poniżej:

1. Szybsze szkolenie

Jak wcześniej wspomniano, szybsze szkolenie jest główną zaletą techniki LiGO. Szkoli LLM w połowie czasu, zwiększając produktywność i redukując koszty.

2. Wydajność zasobów

LiGO jest wydajne pod względem zasobów, ponieważ minimalizuje czas szkolenia i operacje zmiennoprzecinkowe, prowadząc do bardziej efektywnego i ekologicznego podejścia do szkolenia dużych modeli transformatorowych.

3. Uogólnienie

Technika LiGO poprawiła wyniki zarówno modeli językowych, jak i wizyjnych, sugerując, że jest to technika uogólniona, która może być stosowana w różnych zadaniach.

Budowanie komercyjnych produktów AI to tylko jeden aspekt ogólnych wydatków związanych z systemami AI. Innym znaczącym składnikiem kosztów jest codzienne użytkowanie. Na przykład, kosztuje to OpenAI około $700 000 dziennie, aby odpowiedzieć na zapytania przy użyciu ChatGPT. Naukowcy powinni kontynuować poszukiwania podejść, które sprawią, że LLM będą bardziej efektywne podczas szkolenia i bardziej dostępne podczas wykonywania.

Więcej treści związanych z AI można znaleźć na stronie unite.ai.

Haziqa jest naukowcem danych z bogatym doświadczeniem w tworzeniu treści technicznych dla firm AI i SaaS.