Modele i platformy AI

Jak DeepSeek przełamał barierę kosztową za 5,6 mln dolarów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Konwencjonalna mądrość sztucznej inteligencji sugeruje, że budowanie dużych modeli językowych (LLM) wymaga głębokich kieszeni – zwykle miliardów dolarów inwestycji. Ale DeepSeek, chiński startup AI, właśnie zniszczył ten paradygmat dzięki swojemu najnowszemu osiągnięciu: opracowaniu światowej klasy modelu AI za zaledwie 5,6 miliona dolarów.

Model V3 DeepSeek może konkurować z gigantami branży, takimi jak Gemini Google (GOOGL ) i najnowsze oferty OpenAI, przy użyciu ułamka typowych zasobów obliczeniowych. To osiągnięcie zwróciło uwagę wielu liderów branży, a to, co sprawia, że jest to szczególnie godne uwagi, to fakt, że firma osiągnęła to pomimo ograniczeń eksportowych w Stanach Zjednoczonych, które ograniczały ich dostęp do najnowszych chipów Nvidia (NVDA ).

Ekonomika wydajnej sztucznej inteligencji

Liczby opowiadają przekonywującą historię wydajności. Podczas gdy większość zaawansowanych modeli AI wymaga od 16 000 do 100 000 procesorów GPU do szkolenia, DeepSeek poradził sobie z zaledwie 2048 procesorami GPU przez 57 dni. Szkolenie modelu zużyło 2,78 miliona godzin procesora GPU na chipach Nvidia H800 – co jest niezwykle skromne dla modelu o 671 miliardach parametrów.

Aby to zobrazować, Meta potrzebowała około 30,8 miliona godzin procesora GPU – czyli około 11 razy więcej mocy obliczeniowej – aby przeszkolić swój model Llama 3, który ma mniej parametrów, bo 405 miliardów. Podejście DeepSeek przypomina mistrzostwo w optymalizacji pod ograniczeniami. Pracując z procesorami GPU H800 – chipami AI zaprojektowanymi przez Nvidia specjalnie dla chińskiego rynku z ograniczonymi możliwościami – firma przekształciła potencjalne ograniczenia w innowację. Zamiast używać gotowych rozwiązań dla komunikacji procesorów, opracowali niestandardowe rozwiązania, które maksymalizują wydajność.

Podczas gdy konkurenci nadal działają pod założeniem, że ogromne inwestycje są konieczne, DeepSeek pokazuje, że pomysłowość i efektywne wykorzystanie zasobów mogą wyrównać szanse.

Inżynieria niemożliwego

Osiągnięcie DeepSeek leży w jego innowacyjnym podejściu technicznym, pokazując, że czasami najbardziej wpływowe przełomy pochodzą z pracy w ramach ograniczeń, a nie z rzucaniem nieograniczonych zasobów na problem.

W sercu tej innowacji leży strategia zwana “auxiliary-loss-free load balancing”. Wyobraź sobie ogromny system przetwarzania równoległego, w którym tradycyjnie potrzebne są skomplikowane reguły i kary, aby wszystko działało gładko. DeepSeek odwrócił tę konwencjonalną mądrość, rozwijając system, który naturalnie utrzymuje równowagę bez nakładu tradycyjnych podejść.

Zespół również zapoczątkował to, co nazywają “Multi-Token Prediction” (MTP) – technikę, która pozwala modelowi myśleć o przyszłości, przewidując wiele tokenów jednocześnie. W praktyce przekłada się to na imponujący wskaźnik akceptacji 85-90% tych przewidywań w różnych tematach, dostarczając 1,8 razy szybsze prędkości przetwarzania niż poprzednie podejścia.

Samą architekturę techniczną można nazwać arcydziełem wydajności. Model V3 DeepSeek wykorzystuje podejście mixture-of-experts z 671 miliardami parametrów, ale jest tu mądre rozwiązanie – aktywuje tylko 37 miliardów parametrów dla każdego tokenu. Ta selektywna aktywacja oznacza, że uzyskują korzyści z ogromnego modelu, jednocześnie utrzymując praktyczną wydajność.

Ich wybór ramienia FP8 o mieszanej precyzji jest kolejnym skokiem do przodu. Zamiast akceptowania konwencjonalnych ograniczeń obniżonej precyzji, opracowali niestandardowe rozwiązania, które utrzymują dokładność, znacznie redukując wymagania pamięci i obliczeniowe.

Efekty falowe w ekosystemie sztucznej inteligencji

Wpływ osiągnięcia DeepSeek rozchodzi się daleko poza jeden udany model.

Dla rozwoju sztucznej inteligencji w Europie ten przełom jest szczególnie znaczący. Wiele zaawansowanych modeli nie dociera do UE, ponieważ firmy takie jak Meta i OpenAI albo nie mogą, albo nie chcą dostosować się do prawa AI UE. Podejście DeepSeek pokazuje, że budowanie najnowocześniejszej sztucznej inteligencji nie zawsze wymaga ogromnych klastrów GPU – jest to raczej kwestia efektywnego wykorzystania dostępnych zasobów.

Ten rozwój również pokazuje, jak ograniczenia eksportowe mogą napędzać innowacje. Ograniczony dostęp DeepSeek do wysokiej klasy sprzętu zmusił ich do myślenia inaczej, w efekcie czego powstały optymalizacje oprogramowania, które mogłyby nie pojawić się w środowisku bogatym w zasoby.

Wpływ na demokrację jest głęboki. Podczas gdy giganci branży wciąż przeżerają miliardy, DeepSeek stworzył plan wydajnego, efektywnego kosztowo rozwoju sztucznej inteligencji. To mogłoby otworzyć drzwi dla mniejszych firm i instytucji badawczych, które wcześniej nie mogły konkurować z powodu ograniczeń zasobowych.

Jednak nie oznacza to, że duże infrastruktury obliczeniowe stają się przestarzałe. Branża przechodzi w kierunku skalowania czasu inferencji – czasu, jaki model potrzebuje, aby wygenerować odpowiedzi. W miarę kontynuowania tego trendu znaczne zasoby obliczeniowe nadal będą niezbędne, prawdopodobnie nawet bardziej w przyszłości.

Ale DeepSeek zmienił gruntownie rozmowę. Długoterminowe implikacje są jasne: wkraczamy w erę, w której innowacyjne myślenie i efektywne wykorzystanie zasobów mogą być ważniejsze niż sama moc obliczeniowa. Dla społeczności sztucznej inteligencji oznacza to skupienie się nie tylko na tym, jakie zasoby posiadamy, ale na tym, jak kreatywnie i efektywnie je wykorzystujemy.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.