Lideri de opinie

Modele LLM personalizate pentru fiecare afacere? DeepSeek ne arată drumul

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Odinioară, chemarea clarion a tehnologiei era “telefoane mobile pentru toată lumea” – și, într-adevăr, comunicațiile mobile au revoluționat afacerile (și lumea). Astăzi, echivalentul acestei chemări este să ofere tuturor acces la aplicații de inteligență artificială. Dar adevărata putere a inteligenței artificiale constă în exploatarea ei pentru nevoile specifice ale afacerilor și organizațiilor. Calea deschisă de startup-ul chinez DeepSeek demonstrează cum inteligența artificială poate fi, într-adevăr, exploatată de toată lumea, în special de cei cu bugete limitate, pentru a-și satisface nevoile specifice. Într-adevăr, apariția inteligenței artificiale la costuri mai mici promite să schimbe modelul profund înrădăcinat al soluțiilor de inteligență artificială, care adesea rămân în afara vizorului multor afaceri mici și organizații din cauza cerințelor de cost.

Modelele LLM sunt – sau au fost – o întreprindere costisitoare, care necesită acces la cantități masive de date, un număr mare de calculatoare puternice pentru a procesa datele și timp și resurse investite în antrenarea modelului. Dar aceste reguli se schimbă. Funcționând pe un buget modest, DeepSeek și-a dezvoltat propriul model LLM și o aplicație de tip ChatGPT pentru întrebări – cu o investiție mult mai mică decât cea a sistemelor similare construite de companiile americane și europene. Abordarea DeepSeek deschide o fereastră către dezvoltarea modelului LLM pentru organizații mai mici care nu au miliarde de dolari pentru a cheltui. Într-adevăr, ziua în care majoritatea organizațiilor mici pot dezvolta propriile modele LLM pentru a-și satisface nevoile specifice nu este departe, oferind, de obicei, o soluție mai eficientă decât modelele LLM generale, cum ar fi ChatGPT.

În timp ce dezbaterile rămân cu privire la adevăratul cost al DeepSeek, nu este doar costul care îl diferențiază pe acesta și pe modelele similare: este faptul că s-a bazat pe cipuri mai puțin avansate și pe o abordare mai focalizată pentru antrenare. Ca o companie chineză supusă restricțiilor de export ale SUA, DeepSeek nu a putut accesa cipurile avansate Nvidia care sunt, de obicei, utilizate pentru calculul intensiv necesar dezvoltării modelului LLM și, prin urmare, a fost nevoit să utilizeze cipurile Nvidia H-800 mai puțin puternice (NVDA ), care nu pot procesa date la fel de rapid sau de eficient.

Pentru a compensa lipsa de putere, DeepSeek a adoptat o abordare diferită, mai focalizată și directă pentru dezvoltarea modelului LLM. În loc să arunce munți de date către un model și să se bazeze pe puterea de calcul pentru a eticheta și a aplica datele, DeepSeek a îngustat antrenamentul, utilizând o cantitate mică de date de înaltă calitate “de start rece” și aplicând IRL (învățarea prin întărire iterativă, cu algoritmul aplicând date în diferite scenarii și învățând din ele). Această abordare focalizată permite modelului să învețe mai rapid, cu mai puține greșeli și cu mai puțină putere de calcul irosită.

Similar cu modul în care părinții pot ghida mișcările specifice ale unui bebeluș, ajutându-l să se rostogolească cu succes pentru prima dată – în loc să-l lase să descopere singur sau să-i învețe o varietate mai largă de mișcări care ar putea, în teorie, să-i ajute să se rostogolească – oamenii de știință care antrenează aceste modele de inteligență artificială mai focalizate se concentrează pe ceea ce este cel mai necesar pentru anumite sarcini și rezultate. Astfel de modele nu au, probabil, o aplicare la fel de largă și de fiabilă ca modelele LLM mai mari, cum ar fi ChatGPT, dar pot fi de încredere pentru aplicații specifice și pot executa aceste sarcini cu precizie și eficiență. Chiar și criticii DeepSeek admit că abordarea sa structurată pentru dezvoltare a crescut semnificativ eficiența, permițându-i să facă mai mult cu mult mai puțin.

Această abordare se referă la oferirea inteligenței artificiale a celor mai bune intrări, astfel încât să poată atinge obiectivele în modul cel mai inteligent și eficient posibil, și poate fi valoroasă pentru orice organizație care dorește să dezvolte un model LLM pentru nevoile și sarcinile sale specifice. O astfel de abordare este din ce în ce mai valoroasă pentru afacerile mici și organizații. Primul pas constă în a începe cu datele potrivite. De exemplu, o companie care dorește să utilizeze inteligența artificială pentru a ajuta echipele sale de vânzări și marketing ar trebui să antreneze modelul său pe un set de date selectat cu atenție, care se concentrează pe conversații de vânzări, strategii și metrici. Acest lucru împiedică modelul să irosească timp și putere de calcul pe informații irelevante. În plus, antrenamentul trebuie structurat în etape, asigurându-se că modelul stăpânește fiecare sarcină sau concept înainte de a trece la următorul.

Acest lucru are, de asemenea, paralele în creșterea unui bebeluș, așa cum am învățat eu însumi de când am devenit mamă, cu câteva luni în urmă. În ambele scenarii, o abordare ghidată, pas cu pas, evită irosirea de resurse și reduce frecarea. În final, o astfel de abordare, atât pentru bebelușii umani, cât și pentru modelele de inteligență artificială, duce la îmbunătățirea iterativă. Pe măsură ce bebelușul crește sau modelul învață mai mult, capacitățile sale se îmbunătățesc. Acest lucru înseamnă că modelele pot fi rafinate și îmbunătățite pentru a face față mai bine situațiilor din lumea reală.

Această abordare menține costurile sub control, prevenind ca proiectele de inteligență artificială să devină o sursă de epuizare a resurselor, făcându-le mai accesibile pentru echipele și organizațiile mai mici. De asemenea, duce la o performanță mai bună a modelelor de inteligență artificială, mai rapid; și, deoarece modelele nu sunt supraîncărcate cu informații inutile, ele pot fi, de asemenea, ajustate pentru a se adapta la noi informații și la nevoile de afaceri în schimbare – cheie în piețele competitive.

Sosirea lui DeepSeek și a lumii inteligenței artificiale la costuri mai mici și mai eficiente – deși a răspândit inițial panică în lumea inteligenței artificiale și pe piețele bursiere – este, în general, un eveniment pozitiv pentru sectorul inteligenței artificiale. Eficiența și costurile mai mici ale inteligenței artificiale, cel puțin pentru anumite aplicații focalizate, vor duce, în cele din urmă, la o utilizare mai mare a inteligenței artificiale, în general, ceea ce stimulează creșterea pentru toată lumea, de la dezvoltatori la producători de cipuri și până la utilizatorii finali. Într-adevăr, DeepSeek ilustrează Paradoxul Jevons – unde o eficiență mai mare va duce, probabil, la o utilizare mai mare a unei resurse, nu mai mică. Pe măsură ce această tendință pare să continue, afacerile mici care se concentrează pe utilizarea inteligenței artificiale pentru a-și satisface nevoile specifice vor fi, de asemenea, mai bine pregătite pentru creștere și succes.

Stav Levi-Neumark este CEO și co-fondator al Alta și expert în managementul produselor și creșterea veniturilor. Anterior, a fost unul dintre primii angajați ai Monday.com, unde a contribuit la dezvoltarea "BigBrain", un instrument intern de business intelligence utilizat pentru operațiunile zilnice ale companiei. Stav deține o diplomă de licență în științe computaționale și statistică de la Universitatea Ebraică din Ierusalim.