Liderzy opinii

Ewolucja szkolenia modeli AI: Poza rozmiarem w kierunku wydajności

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W szybko ewoluującym krajobrazie sztucznej inteligencji, tradycyjne podejście do doskonalenia modeli językowych poprzez zwiększanie rozmiaru modelu przechodzi przez przełomową transformację. Ta zmiana podkreśla bardziej strategiczne, oparte na danych podejście, jak pokazują ostatnie rozwoju modeli takich jak Llama3.

Dane to wszystko, czego potrzebujesz

Historycznie, dominującym przekonaniem w rozwoju możliwości AI było to, że większe jest lepsze.

W przeszłości byliśmy świadkami dramatycznego wzrostu możliwości głębokiego uczenia się, po prostu przez dodanie więcej warstw do sieci neuronowych. Algorytmy i aplikacje takie jak rozpoznawanie obrazów, które były wcześniej możliwe tylko teoretycznie przed pojawieniem się głębokiego uczenia się, szybko stały się powszechnie akceptowane. Rozwój kart graficznych dalej wzmocnił ten trend, umożliwiając większym modelom działanie z coraz większą wydajnością. Ten trend przeniósł się również do obecnej wielkiej mody na duże modele językowe.

Okresowo, spotykamy się z ogłoszeniami od dużych firm AI, które wydają modele z dziesiątkami lub nawet setkami miliardów parametrów. Łatwo zrozumieć racjonalność: im więcej parametrów posiada model, tym bardziej jest on wydajny. Jednak ten brutalny sposób skalowania osiągnął punkt malejących zwrotów, szczególnie biorąc pod uwagę opłacalność takich modeli w praktycznych aplikacjach. Ostatnie ogłoszenie Meta o podejściu Llama3, które wykorzystuje 8 miliardów parametrów, ale jest wzbogacone o 6-7 razy więcej wysokiej jakości danych szkoleniowych, odpowiada – i w niektórych przypadkach przewyższa – skuteczność wcześniejszych modeli, takich jak GPT3.5, które posiadają ponad 100 miliardów parametrów. To oznacza znaczącą zmianę w prawie skalowania modeli językowych, gdzie jakość i ilość danych zaczynają przeważać nad samym rozmiarem.

Koszt a wydajność: Delikatna równowaga

Podczas gdy modele sztucznej inteligencji (AI) przechodzą z rozwoju do praktycznego zastosowania, ich wpływ ekonomiczny, szczególnie wysokie koszty operacyjne dużych modeli, staje się coraz bardziej znaczący. Te koszty często przewyższają początkowe wydatki na szkolenie, podkreślając potrzebę zrównoważonego podejścia do rozwoju, które priorytetowo traktuje wydajne wykorzystanie danych ponad rozwój modelu. Strategie takie jak rozszerzanie danych i przenoszenie wiedzy mogą poprawić jakość zbiorów danych i zmniejszyć potrzebę intensywnego ponownego szkolenia. Usprawnienie modeli poprzez selekcję cech i redukcję wymiarowości zwiększa wydajność obliczeniową i obniża koszty. Techniki takie jak dropout i wczesne zatrzymanie poprawiają uogólnienie, pozwalając modelom działać skutecznie z mniej danymi. Alternatywne strategie wdrożeniowe, takie jak obliczenia brzegowe, zmniejszają zależność od drogiej infrastruktury chmurowej, podczas gdy bezserwerowe obliczenia oferują skalowalne i opłacalne wykorzystanie zasobów. Koncentrując się na rozwoju opartym na danych i badając ekonomiczne metody wdrożeniowe, organizacje mogą utworzyć bardziej zrównoważone środowisko AI, które równoważy wydajność z opłacalnością.

Malejące zwroty większych modeli

Krajobraz rozwoju AI przechodzi przez zmianę paradygmatu, z rosnącym naciskiem na efektywne wykorzystanie danych i optymalizację modelu. Centralne firmy AI tradycyjnie polegały na tworzeniu coraz większych modeli, aby osiągnąć najlepsze wyniki.

Z drugiej strony, zdecentralizowane AI przedstawiają inne wyzwania i możliwości. Zdecentralizowane sieci blockchain, które tworzą podstawę zdecentralizowanego AI, mają fundamentalnie inny projekt w porównaniu z centralnymi firmami AI. To sprawia, że jest trudno dla przedsięwzięć AI w zdecentralizowanej sieci, aby konkurować z centralnymi podmiotami pod względem skalowania większych modeli przy zachowaniu wydajności w zdecentralizowanych operacjach.

To jest miejsce, w którym zdecentralizowane społeczności mogą maksymalizować swój potencjał i wykroić niszę w krajobrazie AI. Wykorzystując zbiorową inteligencję i zasoby, zdecentralizowane społeczności mogą rozwijać i wdrażać zaawansowane modele AI, które są zarówno efektywne, jak i skalowalne. To pozwoli im skutecznie konkurować z centralnymi firmami AI i napędzać przyszłość rozwoju AI.

Spójrzmy w przyszłość: Ścieżka do zrównoważonego rozwoju AI

Trajektoria przyszłego rozwoju AI powinna koncentrować się na tworzeniu modeli, które są nie tylko innowacyjne, ale także integrujące i ekonomiczne. Nacisk powinien przesunąć się w kierunku systemów, które mogą osiągnąć wysoki poziom dokładności i użyteczności z zarządzalnymi kosztami i wykorzystaniem zasobów. Taka strategia nie tylko zapewni skalowalność technologii AI, ale także ich dostępność i zrównoważoność w dłuższej perspektywie.

Podczas gdy dziedzina sztucznej inteligencji dojrzewa, strategie rozwoju AI muszą ewoluować odpowiednio. Zmiana z wartościowania rozmiaru na priorytetowanie wydajności i opłacalności w szkoleniu modelu nie jest tylko wyborem technicznym, ale strategicznym imperatywem, który zdefiniuje następną generację aplikacji AI. To podejście prawdopodobnie zapoczątkuje nową erę innowacji, gdzie rozwój AI jest napędzany przez inteligentne, zrównoważone praktyki, które obiecują szersze przyjęcie i większy wpływ.​​​​​​​​​​​​​​​​

Jiahao Sun, założyciel i CEO FLock.io, jest absolwentem Oxfordu i ekspertem w dziedzinie sztucznej inteligencji i blockchain. Pełniąc wcześniej role Dyrektora ds. AI w Royal Bank of Canada oraz Fellowa Badawczego ds. AI w Imperial College London, założył FLock.io, aby skupić się na rozwiązaniach związanych z prywatnością w sztucznej inteligencji. Dzięki jego przywództwu FLock.io jest pionierem w dziedzinie bezpiecznego, współpracującego szkolenia i wdrożenia modeli sztucznej inteligencji, co pokazuje jego zaangażowanie w wykorzystywanie technologii dla postępu społecznego.