Liderzy opinii

Ewolucja szkolenia modeli AI: Poza rozmiarem w kierunku wydajności

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google

W szybko ewoluującym krajobrazie sztucznej inteligencji, tradycyjne podejście do doskonalenia modeli językowych poprzez zwiększanie rozmiaru modelu przechodzi przez przełomową transformację. Ta zmiana podkreśla bardziej strategiczne, oparte na danych podejście, jak pokazują ostatnie rozwoju modeli takich jak Llama3.

Dane to wszystko, czego potrzebujesz

Historycznie, dominującym przekonaniem w rozwoju moÅžliwości AI było to, Åže większe jest lepsze.

W przeszłości byliśmy świadkami dramatycznego wzrostu moÅžliwości głębokiego uczenia się, po prostu przez dodanie więcej warstw do sieci neuronowych. Algorytmy i aplikacje takie jak rozpoznawanie obrazÃģw, ktÃģre były wcześniej moÅžliwe tylko teoretycznie przed pojawieniem się głębokiego uczenia się, szybko stały się powszechnie akceptowane. RozwÃģj kart graficznych dalej wzmocnił ten trend, umoÅžliwiając większym modelom działanie z coraz większą wydajnością. Ten trend przeniÃģsł się rÃģwnieÅž do obecnej wielkiej mody na duÅže modele językowe.

Okresowo, spotykamy się z ogłoszeniami od duÅžych firm AI, ktÃģre wydają modele z dziesiątkami lub nawet setkami miliardÃģw parametrÃģw. Łatwo zrozumieć racjonalność: im więcej parametrÃģw posiada model, tym bardziej jest on wydajny. Jednak ten brutalny sposÃģb skalowania osiągnął punkt malejących zwrotÃģw, szczegÃģlnie biorąc pod uwagę opłacalność takich modeli w praktycznych aplikacjach. Ostatnie ogłoszenie Meta o podejściu Llama3, ktÃģre wykorzystuje 8 miliardÃģw parametrÃģw, ale jest wzbogacone o 6-7 razy więcej wysokiej jakości danych szkoleniowych, odpowiada – i w niektÃģrych przypadkach przewyÅžsza – skuteczność wcześniejszych modeli, takich jak GPT3.5, ktÃģre posiadają ponad 100 miliardÃģw parametrÃģw. To oznacza znaczącą zmianę w prawie skalowania modeli językowych, gdzie jakość i ilość danych zaczynają przewaÅžać nad samym rozmiarem.

Koszt a wydajność: Delikatna rÃģwnowaga

Podczas gdy modele sztucznej inteligencji (AI) przechodzą z rozwoju do praktycznego zastosowania, ich wpływ ekonomiczny, szczegÃģlnie wysokie koszty operacyjne duÅžych modeli, staje się coraz bardziej znaczący. Te koszty często przewyÅžszają początkowe wydatki na szkolenie, podkreślając potrzebę zrÃģwnowaÅžonego podejścia do rozwoju, ktÃģre priorytetowo traktuje wydajne wykorzystanie danych ponad rozwÃģj modelu. Strategie takie jak rozszerzanie danych i przenoszenie wiedzy mogą poprawić jakość zbiorÃģw danych i zmniejszyć potrzebę intensywnego ponownego szkolenia. Usprawnienie modeli poprzez selekcję cech i redukcję wymiarowości zwiększa wydajność obliczeniową i obniÅža koszty. Techniki takie jak dropout i wczesne zatrzymanie poprawiają uogÃģlnienie, pozwalając modelom działać skutecznie z mniej danymi. Alternatywne strategie wdroÅženiowe, takie jak obliczenia brzegowe, zmniejszają zaleÅžność od drogiej infrastruktury chmurowej, podczas gdy bezserwerowe obliczenia oferują skalowalne i opłacalne wykorzystanie zasobÃģw. Koncentrując się na rozwoju opartym na danych i badając ekonomiczne metody wdroÅženiowe, organizacje mogą utworzyć bardziej zrÃģwnowaÅžone środowisko AI, ktÃģre rÃģwnowaÅžy wydajność z opłacalnością.

Malejące zwroty większych modeli

Krajobraz rozwoju AI przechodzi przez zmianę paradygmatu, z rosnącym naciskiem na efektywne wykorzystanie danych i optymalizację modelu. Centralne firmy AI tradycyjnie polegały na tworzeniu coraz większych modeli, aby osiągnąć najlepsze wyniki.

Z drugiej strony, zdecentralizowane AI przedstawiają inne wyzwania i moÅžliwości. Zdecentralizowane sieci blockchain, ktÃģre tworzą podstawę zdecentralizowanego AI, mają fundamentalnie inny projekt w porÃģwnaniu z centralnymi firmami AI. To sprawia, Åže jest trudno dla przedsięwzięć AI w zdecentralizowanej sieci, aby konkurować z centralnymi podmiotami pod względem skalowania większych modeli przy zachowaniu wydajności w zdecentralizowanych operacjach.

To jest miejsce, w ktÃģrym zdecentralizowane społeczności mogą maksymalizować swÃģj potencjał i wykroić niszę w krajobrazie AI. Wykorzystując zbiorową inteligencję i zasoby, zdecentralizowane społeczności mogą rozwijać i wdraÅžać zaawansowane modele AI, ktÃģre są zarÃģwno efektywne, jak i skalowalne. To pozwoli im skutecznie konkurować z centralnymi firmami AI i napędzać przyszłość rozwoju AI.

SpÃģjrzmy w przyszłość: ŚcieÅžka do zrÃģwnowaÅžonego rozwoju AI

Trajektoria przyszłego rozwoju AI powinna koncentrować się na tworzeniu modeli, ktÃģre są nie tylko innowacyjne, ale takÅže integrujące i ekonomiczne. Nacisk powinien przesunąć się w kierunku systemÃģw, ktÃģre mogą osiągnąć wysoki poziom dokładności i uÅžyteczności z zarządzalnymi kosztami i wykorzystaniem zasobÃģw. Taka strategia nie tylko zapewni skalowalność technologii AI, ale takÅže ich dostępność i zrÃģwnowaÅžoność w dłuÅžszej perspektywie.

Podczas gdy dziedzina sztucznej inteligencji dojrzewa, strategie rozwoju AI muszą ewoluować odpowiednio. Zmiana z wartościowania rozmiaru na priorytetowanie wydajności i opłacalności w szkoleniu modelu nie jest tylko wyborem technicznym, ale strategicznym imperatywem, ktÃģry zdefiniuje następną generację aplikacji AI. To podejście prawdopodobnie zapoczątkuje nową erę innowacji, gdzie rozwÃģj AI jest napędzany przez inteligentne, zrÃģwnowaÅžone praktyki, ktÃģre obiecują szersze przyjęcie i większy wpływ.​​​​​​​​​​​​​​​​

Jiahao Sun, załoÅžyciel i CEO FLock.io, jest absolwentem Oxfordu i ekspertem w dziedzinie sztucznej inteligencji i blockchain. Pełniąc wcześniej role Dyrektora ds. AI w Royal Bank of Canada oraz Fellowa Badawczego ds. AI w Imperial College London, załoÅžył FLock.io, aby skupić się na rozwiązaniach związanych z prywatnością w sztucznej inteligencji. Dzięki jego przywÃģdztwu FLock.io jest pionierem w dziedzinie bezpiecznego, wspÃģłpracującego szkolenia i wdroÅženia modeli sztucznej inteligencji, co pokazuje jego zaangaÅžowanie w wykorzystywanie technologii dla postępu społecznego.