Modele și platforme AI

Cum a spărs DeepSeek bariera costurilor cu 5,6 milioane de dolari

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Înțelepciunea convențională a inteligenței artificiale sugerează că construirea modelelor de limbaj mari (LLM) necesită buzunare adânci – de obicei, miliarde de investiții. Dar DeepSeek, o companie chineză de inteligență artificială, a spărs această paradigmă cu realizarea lor recentă: dezvoltarea unui model de inteligență artificială de clasă mondială pentru doar 5,6 milioane de dolari.

Modelul V3 al DeepSeek poate concura cu giganții industriei, cum ar fi Gemini al Google (GOOGL ) și ofertele recente ale OpenAI, folosind doar o fracțiune din resursele de calcul obișnuite. Realizarea a atras atenția multor lideri din industrie, iar ceea ce face acest lucru remarcabil este faptul că compania a reușit să o facă în ciuda restricțiilor de export din Statele Unite, care le-au limitat accesul la cele mai recente cipuri Nvidia (NVDA ).

Economia inteligenței artificiale eficiente

Numerele spun o poveste convingătoare despre eficiență. În timp ce majoritatea modelelor de inteligență artificială avansate necesită între 16.000 și 100.000 de unități de procesare grafică (GPU) pentru antrenament, DeepSeek a reușit cu doar 2.048 de GPU care rulează timp de 57 de zile. Antrenamentul modelului a consumat 2,78 milioane de ore de GPU pe cipuri Nvidia H800 – o cantitate remarcabil de modestă pentru un model cu 671 de miliarde de parametri.

Pentru a pune aceasta în perspectivă, Meta a necesitat aproximativ 30,8 milioane de ore de GPU – aproximativ de 11 ori mai multă putere de calcul – pentru a antrena modelul Llama 3, care are de fapt mai puțini parametri, la 405 miliarde. Abordarea DeepSeek seamănă cu un masterclass în optimizare sub constrângeri. Lucrând cu cipuri H800 – cipuri de inteligență artificială proiectate de Nvidia în mod special pentru piața chineză, cu capacități reduse – compania a transformat limitările potențiale în inovație. În loc să utilizeze soluții standard pentru comunicarea procesorului, au dezvoltat soluții personalizate care maximizează eficiența.

În timp ce competitorii continuă să opereze sub presupunerea că investițiile masive sunt necesare, DeepSeek demonstrează că ingeniozitatea și utilizarea eficientă a resurselor pot egaliza terenul de joc.

Proiectarea imposibilului

Realizarea DeepSeek se datorează abordării tehnice inovatoare, demonstrând că, uneori, cele mai impactante descoperiri vin din lucru în cadrul constrângerilor, mai degrabă decât aruncarea unor resurse nelimitate la o problemă.

Inima acestei inovații este o strategie numită “auxiliary-loss-free load balancing”. Gândiți-vă la orchestrarea unui sistem masiv de procesare paralelă, unde, în mod tradițional, ați avea nevoie de reguli complexe și penalități pentru a menține totul funcționând neted. DeepSeek a răsturnat această înțelepciune convențională, dezvoltând un sistem care menține echilibrul fără supraîncărcarea abordărilor tradiționale.

Echipa a inovat, de asemenea, ceea ce numesc “Multi-Token Prediction” (MTP) – o tehnică care permite modelului să gândească înainte, prevăzând multiple tokenuri deodată. În practică, acest lucru se traduce într-un răspuns impresionant de 85-90% pentru aceste predicții în diverse subiecte, oferind viteze de procesare de 1,8 ori mai rapide decât abordările anterioare.

Arhitectura tehnică în sine este o capodoperă a eficienței. Modelul V3 al DeepSeek utilizează o abordare de amestec de experți cu 671 de miliarde de parametri totali, dar aici este partea ingenioasă – activează doar 37 de miliarde pentru fiecare token. Această activare selectivă înseamnă că obțin beneficiile unui model masiv, menținând, în același timp, o eficiență practică.

Alegerea lor de a utiliza un cadru de antrenament cu precizie mixtă FP8 este, de asemenea, un salt înainte. În loc să accepte limitările convenționale ale preciziei reduse, au dezvoltat soluții personalizate care mențin acuratețea, reducând, în același timp, semnificativ cerințele de memorie și calcul.

Efectele de undă în ecosistemul inteligenței artificiale

Impactul realizării DeepSeek se răsfrânge mult dincolo de un singur model de succes.

Pentru dezvoltarea inteligenței artificiale în Europa, această descoperire este deosebit de semnificativă. Multe modele avansate nu ajung în UE, deoarece companii precum Meta și OpenAI nu pot sau nu vor adapta Actul UE privind inteligența artificială. Abordarea DeepSeek arată că construirea inteligenței artificiale de ultimă generație nu necesită întotdeauna clusteruri masive de GPU – este mai mult despre utilizarea eficientă a resurselor disponibile.

Acestă dezvoltare arată, de asemenea, cum restricțiile de export pot, de fapt, stimula inovația. Accesul limitat al DeepSeek la hardware de înaltă performanță i-a forțat să gândească diferit, rezultând în optimizări software care ar fi putut să nu apară într-un mediu cu resurse nelimitate. Acest principiu ar putea redefini modul în care abordăm dezvoltarea inteligenței artificiale la nivel global.

Implicațiile democratizării sunt profunde. În timp ce giganții industriei continuă să ardă miliarde, DeepSeek a creat o hartă pentru dezvoltarea eficientă și ieftină a inteligenței artificiale. Acest lucru ar putea deschide porți pentru companii mai mici și instituții de cercetare care, anterior, nu puteau concura din cauza limitărilor de resurse.

Cu toate acestea, acest lucru nu înseamnă că infrastructura de calcul la scară largă devine învechită. Industria se îndreaptă spre scalarea timpului de inferență – cât timp îi ia unui model să genereze răspunsuri. Pe măsură ce această tendință continuă, resursele computaționale semnificative vor fi, probabil, încă necesare, chiar mai mult în timp.

Dar DeepSeek a schimbat fundamental conversația. Implicațiile pe termen lung sunt clare: intrăm într-o eră în care gândirea inovatoare și utilizarea eficientă a resurselor ar putea să conteze mai mult decât puterea de calcul brută. Pentru comunitatea inteligenței artificiale, acest lucru înseamnă concentrarea nu doar pe resursele pe care le avem, ci și pe modul în care le utilizăm creativ și eficient.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.