Lideri de opinie

Mirajul AI al Chinei: Cum “sursa deschisă” ascunde ceea ce contează cel mai mult

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cu jucători din sectorul tehnologic precum Google, Microsoft și Meta care se luptă pentru a domina piața inteligenței artificiale, companiile chineze High Flyer, Baidu, Moonshot și Alibaba au făcut senzație prin lansarea modelelor lor de inteligență artificială, respectiv DeepSeek, ERNIE 4.5, Kimi K2 și Qwen3, ca surse deschise. Această schimbare de la lansarea de modele de inteligență artificială generativă (GenAI) protejate și proprietare a fost privită ca un semn că industria chineză de inteligență artificială adoptă puterea surselor deschise pentru a democratiza dezvoltarea inteligenței artificiale și a stimula inovarea.

La fel ca mulți jucători care își prezintă ofertele ca surse deschise și chiar le includ în numele companiilor, High Flyer, Baidu și Moonshot nu au împărtășit de fapt piese critice, cum ar fi seturile de date din inima modelelor lor. Pe măsură ce aceste modele mari încearcă să devină bunuri de care dezvoltatorii depind, transparența surselor deschise adevărate, care poate fi testată, investigată și iterată, este esențială pentru a crea tehnologie neîmpărtită, etică și benefică, pe care toată lumea o poate încredința. Toate aceste modele “surse deschise” sunt de fapt “surse deschise cu greutate”, ceea ce înseamnă că pot fi descărcate și utilizate, dar nu pot fi inspectate în niciun fel semnificativ fără datele aferente.

Pe măsură ce jucătorii din Statele Unite, cum ar fi Open AI și Meta, par să se retragă de la sursele deschise, invitația deschisă a lui Baidu de a utiliza gratuit suita de modele ERNIE 4.5 poate stimula într-adevăr inovarea și colaborarea cu dezvoltatorii care doresc să creeze aplicații mai mici și puternice. În același timp, compania, care este similară cu Google-ul Chinei, și-a creat un avantaj competitiv prin încurajarea adoptării și consolidării modelelor sale în ecosistemul în curs de dezvoltare al inteligenței artificiale.

La fel se poate spune și despre DeepSeek, Kimi K2 ieftin și Qwen3 actualizat, care are benchmark-uri care provoacă modele închise, cum ar fi Claude Opus 4 și GPT-4o-0327.

Acești jucători ai inteligenței artificiale s-au poziționat bine în cursa de a deveni modelul de bunuri de alegere și actualizarea inovatoare a lui Qwen3 a fost inspirată chiar de feedback-ul comunității cu surse deschise.

La fel ca mulți care își prezintă modelul de inteligență artificială mare ca sursă deschisă, comunitatea chineză de inteligență artificială nu împărtășește de fapt datele sau alte piese critice ale sistemelor sale de inteligență artificială. În schimb, cer dezvoltatorilor globali să aibă încredere oarbă în modele pe care nu le pot cu adevărat înțelege sau investiga.

Revendicarea viitorului cu modele de inteligență artificială deschise și de bunuri

Când iPhone-ul a apărut pe piață în 2007, unii au presupus că Mac va domini piața smartphone-urilor cu iOS, dar participarea la surse deschise este esențială pentru startup-uri, stimulând, de asemenea, creșterea antreprenorială și economică la nivel global – și Android, o companie dobândită de Google în 2005, a urmat acest drum spre victorie.

Prin lansarea de surse deschise care puteau fi vizualizate, modificate, adoptate și distribuite, Android a invitat academicieni, dezvoltatori și chiar concurenți să colaboreze la software. Acest lucru a accelerat procesul de inovare, a democratizat terenul de joc și, în cele din urmă, a redus prețurile. Android a apărut pe piață cu un an după primul iPhone și, la începutul acestui an, a avut 71,88% din piața globală, față de 27,65% pentru iOS.

Într-o revoluție tehnologică care a părut să aibă loc peste noapte, smartphone-urile au devenit ubiquitare și, chiar dacă îmbunătățirile software, hardware și interfețe cu utilizatorul continuă, industria a crescut mult dincolo de a încerca să revolutioneze modul în care funcționează smartphone-urile. Cu telefoanele mobile devenite bunuri, inovația de azi se află în aplicațiile care rulează pe ele, și pentru a fi concurenți, furnizorii de smartphone trebuie să mențină un ecosistem care invită dezvoltatorii.

La mai puțin de trei ani de la lansarea ChatGPT, industria inteligenței artificiale se află pe o astfel de margine. Fiecare jucător din industria globală de inteligență artificială se luptă pentru ca modelele sale să devină următorul Android sau chiar iOS, și prin lansarea surselor deschise pentru modelele DeepSeek, ERNIE 4.5 și Kimi K2, inovatorii chinezi încearcă să-și revendice poziția într-un ecosistem în curs de dezvoltare.

Deși acest lucru ar putea funcționa în favoarea lor, nu promovează totuși transparența adevărată a surselor deschise, care a fost esențială nu numai pentru a stimula inovarea, ci și pentru a crea inovare de încredere.

Datele lipsă în majoritatea surselor deschise de inteligență artificială

Având în vedere că modelele de inteligență artificială sunt mult mai complicate de creat și distribuit decât software-ul tradițional, apelul pentru surse deschise de inteligență artificială complete nu este deloc mic. În loc de a avea doar un cod sursă simplu, sistemele de inteligență artificială sunt compuse din șapte componente – inclusiv codul sursă, parametrii modelului, setul de date, hiperparametrii, codul sursă de antrenare, generarea de numere aleatoare și cadrele software.

Fiecare piesă trebuie să funcționeze în concert pentru ca un model să furnizeze rezultatele dorite, ceea ce înseamnă că dezvoltatorii au nevoie de vizibilitate completă pentru a partaja, modifica și adopta un sistem și pentru a înțelege ce se întâmplă. Cu reproducerea ca fundament al metodei științifice, industria inteligenței artificiale are obiceiul de a utiliza termenul de surse deschise pentru a se referi la lansări gratuite sau ieftine care sunt disponibile cu acces la câteva piese ale puzzle-ului.

Baidu, de exemplu, a făcut disponibile gratuit zece modele ERNIE 4.5. Împreună cu partajarea modelului și a parametrilor, compania a lansat și ERNIEKit și kit-urile de instrumente FastDeploy. Acestea permit dezvoltatorilor să creeze aplicații puternice de inteligență artificială, oferind capacități industriale, fluxuri de antrenare și inferență eficiente din punct de vedere al resurselor și compatibilitate multi-hardware.

În alte cuvinte, Baidu a oferit dezvoltatorilor unelte interesante care îi împuternicesc să deblocheze inovația mai repede, ceea ce, speră, îi va determina să aleagă ERNIE 4.5 în locul concurenților.

Dezvoltatorii care utilizează ERNIE 4.5 sunt, totuși, rugați să aibă încredere oarbă în model, deoarece Baidu a ținut ascunse multe, inclusiv seturile de date care informează și învață modelele sale.

Puterea modelelor de inteligență artificială deschise și transparente

Deși fiecare piesă a puzzle-ului inteligenței artificiale este critică pentru a face un model să funcționeze, 80% din proiectele de inteligență artificială eșuează, iar datele sunt în inima problemei. Seturile de date inexacte, incomplete și cu caracteristici împărtășite duc la modele care nu se comportă previzibil sau așa cum se dorește.

Videoul recent lansat al accidentului mortal Tesla Full-Self-Driving (FSD) din 2023, de exemplu, a expus scenariul cel mai rău posibil al ceea ce se poate întâmpla atunci când un set de date și un model nu reușesc. Pe măsură ce Tesla Model Y a accelerat spre un soare care apunea, sistemul parțial automatizat nu a putut înțelege sau reacționa corespunzător la ceea ce vedea – sau nu vedea – camerele sale. În timp ce mașinile conduse de oameni au încetinit și s-au oprit, confuzia FSD a dus la moartea unei femei.

Acest eșec devastator a reflectat date vizuale incomplete, precum și lipsa unui mecanism de siguranță care să țină cont de astfel de puncte oarbe. Când dezvoltatorii nu au nicio vedere asupra datelor lor, nu pot vedea cum interacționează cu modelul, ceea ce înseamnă că nu pot descoperi astfel de greșeli și itera pentru o performanță robustă.

Mai îngrijorător, fără datele care alimentează modelul, sunt obligați să aibă încredere oarbă în el.

Când seturile de date sunt surse deschise, comunitatea inteligenței artificiale a demonstrat că va eradica problemele îngrijorătoare, așa cum a făcut atunci când a descoperit peste 1.000 de URL-uri care conțineau materiale verificate de abuz sexual asupra copiilor în LAION 5B. Cu setul de date utilizat pentru modelele de generare de imagini de inteligență artificială, care este fundamental în crearea de aplicații precum Stable Diffusion și Midjourney, ar fi fost devastator pentru industria inteligenței artificiale dacă utilizatorii au început să producă imagini ilicite fotorealiste. În schimb, natura deschisă a acestui set de date a permis comunității să descopere conținutul periculos și să motiveze o soluție, Liaison B.

În plus, o mare parte a acelui prim set de date s-a bazat pe extragerea web realizată de enormul Common Crawl, care a fost utilizat și pentru modelele ChatGPT și LLAMA. Chiar dacă crawlerele de inteligență artificială continuă să ridice îngrijorări cu privire la drepturile de autor, confidențialitate și etichetarea rasistă și împărtășită, dezvoltatorii din comunitatea inteligenței artificiale lucrează la modalități de a curăța piese ale setului de date deschis Common Crawl pentru utilizare mai sigură.

Pe măsură ce dezvoltatorii încearcă nu numai să creeze inteligență artificială puternică, ci și inteligență artificială de încredere, atât utilizatorii, cât și industria sunt protejați de transparența și colaborarea surselor deschise adevărate.

Embrionarea drumului surselor deschise

Pe măsură ce mulți sunt încă precauți cu privire la această tehnologie în curs de dezvoltare, cursa de a deveni iOS-ul sau Android-ul modelelor de inteligență artificială mari și de bunuri este în desfășurare – și pe măsură ce comunitatea globală de inteligență artificială construiește literalmente ceea ce va deveni standardul pentru viitor, iar sistemele de inteligență artificială sunt deja la volan și oferă evaluări medicale, stabilirea încrederii prin crearea de inteligență artificială neîmpărtită, de încredere și sigură a devenit mai critică ca niciodată.

Pe măsură ce comunitatea chineză de inteligență artificială încearcă să se poziționeze ca campioni ai inovării deschise, drumul către inteligența artificială sigură se găsește doar în transparența surselor deschise adevărate, care a fost dovedită prin decenii de inovare software. Așezarea termenului de surse deschise pe sisteme care nu împărtășesc piese critice, cum ar fi datele, nu permite dezvoltatorilor să investigheze, să repete și să itereze. În timp ce atracția modelelor ușor disponibile, cum ar fi DeepSeek, ERNIE 4.5, Kimi K2 și Qwen3, este incontestabilă, dezvoltatorii care le utilizează schimbă transparența care favorizează colaborarea și inovarea pentru conveniență.

Comunitatea inteligenței artificiale trebuie să aleagă: să adopte transparența radicală prin surse deschise adevărate sau să riște construirea sistemelor critice de mâine pe cutiile negre de astăzi.

Dr. Jason Corso este Co-fondator și Șef al Departamentului de Știință la Voxel51, și profesor de robotică și inginerie electrică și informatică la Universitatea din Michigan. Un veteran în domeniul viziunii computaționale, Dr. Corso a dedicat peste 20 de ani cercetării academice în domeniile înțelegerii video, roboticii și științei datelor.