Modele și platforme AI

DINOv3 și viitorul viziunii calculate: învățarea auto-supervizată la scară largă

mm
Adaugă Unite.AI la sursele tale preferate pe Google
DINOv3 and the Future of Computer Vision: Self-Supervised Learning at Scale

Etichetarea imaginilor este un proces costisitor și lent în multe proiecte de viziune calculată. Acesta introduce adesea bias și reduce capacitatea de a scala seturi de date mari. Prin urmare, cercetătorii au căutat abordări care elimină nevoia de etichetare manuală grea. În răspuns la această provocare, Meta AI a introdus DINOv3 în 2025. Acesta este un model de bază de viziune auto-supervizată care poate învăța direct din 1,7 miliarde de imagini neetichetate.

Modelul este antrenat cu o rețea extinsă de 7 miliarde de parametri. Prin această configurație, produce caracteristici globale și dense de înaltă calitate dintr-un singur backbone înghețat. Ca rezultat, modelul poate capta atât detalii fine în imagini, cât și informații contextuale mai largi.

Mai mult, DINOv3 arată o performanță puternică în multe sarcini de viziune fără nevoia de ajustare costisitoare. Acest lucru înseamnă că nu este doar puternic din punct de vedere tehnic, dar și practic pentru cercetători, ingineri și lideri din industrie care se confruntă cu constrângeri de resurse și timp.

În acest fel, DINOv3 reprezintă o avansare semnificativă în viziunea calculată. Acesta combină învățarea la scară largă, eficiență și utilizabilitate largă, făcându-l un model de bază cu un potențial puternic atât pentru cercetarea academică, cât și pentru aplicațiile industriale.

Evoluția învățării auto-supervizate în viziune

Viziunea calculată tradițională a depins mult timp de învățarea supervizată. Această metodă necesită seturi de date mari și etichetate, pe care oamenii le anotează cu atenție. Procesul este costisitor, lent și adesea impracticabil în domenii în care etichetele sunt rare sau scumpe, cum ar fi imagistica medicală. Din acest motiv, învățarea auto-supervizată (SSL) a devenit o abordare critică. Acesta permite modelelor să învețe caracteristici vizuale utile direct din date brute, neetichetate, prin găsirea unor modele ascunse în imagini.

Metodele SSL timpurii, cum ar fi Momentum Contrast (MoCo) și Bootstrap Your Own Latent (BYOL), au demonstrat că modelele pot învăța caracteristici vizuale puternice fără date etichetate. Aceste metode au dovedit valoarea auto-supervizării și au deschis calea pentru abordări mai avansate.

În 2021, Meta a introdus DINO. Acesta a fost un pas semnificativ, deoarece a realizat o performanță competitivă utilizând doar antrenament auto-supervizat. Mai târziu, DINOv2 a avansat și mai mult acest progres, scalând antrenamentul și îmbunătățind transferabilitatea caracteristicilor învățate la diferite sarcini.

Aceste îmbunătățiri au creat baza pentru DINOv3, lansat în 2025. DINOv3 a utilizat un model mult mai mare și un set de date masiv, permițându-i să stabilească noi repere de performanță.

Până în 2025, SSL nu mai era opțional. A devenit o abordare necesară, deoarece a permis antrenarea pe miliarde de imagini fără etichetare umană. Acest lucru a făcut posibilă construirea unor modele de bază care se generalizează pe multiple sarcini. Spatele lor preantrenat oferă caracteristici flexibile, care pot fi adaptate prin adăugarea unor capete specifice sarcinii mici. Această metodă reduce costul și accelerează dezvoltarea sistemelor de viziune calculată.

În plus, SSL reduce ciclurile de cercetare. Echipele pot reutiliza modele preantrenate pentru testarea și evaluarea rapidă, ceea ce ajută la prototiparea rapidă. Această mișcare către învățarea la scară largă și eficientă în ceea ce privește etichetarea este în curs de a schimba modul în care sistemele de viziune calculată sunt construite și aplicate în multe industrii.

Cum redefinește DINOv3 viziunea calculată auto-supervizată

DINOv3 este cel mai avansat model de viziune auto-supervizată al Meta AI. Acesta reprezintă o nouă etapă în antrenamentul la scară largă pentru viziunea calculată. În contrast cu versiunile anterioare, combină o rețea extinsă de 7 miliarde de parametri cu antrenament pe 1,7 miliarde de imagini neetichetate. Această scară permite modelului să învețe caracteristici mai puternice și mai adaptabile.

O îmbunătățire semnificativă în DINOv3 este stabilitatea învățării caracteristicilor dense. Modelele anterioare, cum ar fi DINOv2, au pierdut adesea detalii în caracteristicile la nivel de patch în timpul antrenamentului de lungă durată. Acest lucru a făcut sarcinile precum segmentarea și estimarea adâncimii mai puțin fiabile. DINOv3 introduce o metodă numită Ancorare Gram pentru a aborda această problemă. Acesta păstrează structura de similaritate între patch-uri consistentă în timpul antrenamentului, prevenind colapsul caracteristicilor și păstrând detalii fine.

Un alt pas tehnic este utilizarea recoltelor de imagini de înaltă rezoluție. Prin lucrul cu secțiuni mai mari de imagini, modelul captează structura locală mai precis. Acest lucru duce la hărți de caracteristici dense mai detaliate și mai nuanțate. Astfel de hărți îmbunătățesc performanța în aplicații în care acuratețea la nivel de pixel este crucială, cum ar fi detectarea obiectelor sau segmentarea semantică.

Modelul beneficiază și de încorporările poziționale rotative (RoPE). Aceste încorporări, combinate cu strategiile de rezoluție și recoltare, permit modelului să gestioneze imagini de diferite dimensiuni și forme. Acest lucru face DINOv3 mai stabil în scenariile din lumea reală, unde imaginile de intrare adesea variază în calitate și format.

Pentru a susține diferitele nevoi de implementare, Meta AI a distilat DINOv3 într-o familie de modele mai mici. Acestea includ mai multe dimensiuni de Transformatori de Viziune (ViT) și versiuni ConvNeXt. Modelele mai mici sunt mai potrivite pentru dispozitive cu capacitate limitată, în timp ce cele mai mari sunt mai adecvate pentru laboratoare de cercetare și servere de producție. Această flexibilitate permite echipelor să înceapă testarea rapid și să extindă la configurații mai solicitante pe măsură ce este nevoie.

Rezultatele confirmă puterea acestei abordări. DINOv3 obține rezultate de top pe peste 60 de repere. Acesta performează bine în clasificare, segmentare, estimare a adâncimii și chiar în sarcini 3D. Multe dintre aceste rezultate sunt obținute cu spatele înghețat, ceea ce înseamnă că nu a fost necesară nicio ajustare suplimentară.

Performanță și superioritate în repere

DINOv3 s-a dovedit a fi un model de bază de viziune fiabil. Acesta a realizat rezultate puternice în multe sarcini de viziune calculată. O putere necesară este că spatele său înghețat a capturat deja caracteristici bogate. Ca rezultat, majoritatea aplicațiilor necesită doar o sondei liniară sau un decodificator ușor. Acest lucru face transferul mai rapid, mai puțin costisitor și mai ușor decât ajustarea completă.

La clasificarea ImageNet-1K, DINOv3 a obținut aproximativ 84,5% acuratețe de top-1 cu caracteristici înghețate. Acesta a fost mai mare decât multe modele auto-supervizate anterioare și, de asemenea, mai bun decât mai multe repere supervizate. Pentru segmentarea semantică pe ADE20K, a obținut un mIoU de aproximativ 63,0 utilizând un spate ViT-L. Aceste rezultate arată că modelul păstrează informații spațiale fine fără antrenament specific sarcinii.

În detectarea obiectelor pe COCO, DINOv3 a obținut un mAP de aproximativ 66,1 cu caracteristici înghețate. Acest lucru demonstrează puterea reprezentărilor sale dense în identificarea obiectelor în scene complexe. Modelul a performa, de asemenea, bine în estimarea adâncimii, de exemplu, pe NYU-Depth V2, unde a produs predicții mai precise decât multe metode supervizate și auto-supervizate mai vechi.

În afara acestor, DINOv3 a arătat rezultate puternice în clasificarea fină și în testele din afara distribuției. În multe cazuri, a depășit atât modelele SSL anterioare, cât și antrenamentul tradițional supervizat.

În timpul experimentării, un beneficiu clar a fost costul scăzut de transfer. Majoritatea sarcinilor au fost rezolvate cu doar un antrenament suplimentar minor. Acest lucru a redus calculul și a scurtat timpul de implementare.

Meta AI și alți cercetători au validat DINOv3 pe peste 60 de repere. Acestea au inclus clasificare, segmentare, detectare, estimare a adâncimii, recuperare și potrivire geometrică. Pe întreaga gamă de evaluări, modelul a livrat în mod constant rezultate de top sau aproape de top. Acest lucru confirmă rolul său de codificator vizual versatil și de încredere.

Cum a transformat DINOv3 fluxurile de lucru de viziune calculată

În fluxurile de lucru mai vechi, echipele trebuiau să antreneze multe modele specifice sarcinii. Fiecare sarcină necesita propriul set de date și reglare. Acest lucru a crescut atât costul, cât și efortul de întreținere.

Cu DINOv3, echipele pot acum standardiza pe un singur spate. Același model înghețat susține diferite capete specifice sarcinii. Acest lucru reduce numărul de modele de bază utilizate. De asemenea, simplifică pipeline-urile de integrare și scurtează ciclurile de lansare pentru caracteristici de viziune.

Pentru dezvoltatori, DINOv3 oferă resurse practice. Meta AI oferă puncte de control, scripturi de antrenament și cărți de model pe GitHub. Hugging Face găzduiește, de asemenea, variante distilate cu notebook-uri de exemplu. Aceste resurse fac mai ușoară experimentarea și adoptarea modelului în proiecte reale.

O modalitate comună în care dezvoltatorii utilizează aceste resurse este pentru extragerea caracteristicilor. Un model DINOv3 înghețat oferă încorporări care servesc ca intrări pentru sarcini downstream. Dezvoltatorii pot atașa apoi un cap liniar sau un adaptator mic pentru a aborda nevoi specifice. Când se necesită o adaptare suplimentară, metodele eficiente din punct de vedere al parametrilor, cum ar fi LoRA sau adaptori ușori, fac antrenamentul fezabil fără a implica o sarcină computațională semnificativă.

Variantele distilate joacă un rol esențial în acest flux de lucru. Versiunile mai mici pot rula pe dispozitive cu capacitate limitată, în timp ce cele mai mari rămân potrivite pentru laboratoare de cercetare și servere de producție. Această gamă oferă echipelor flexibilitatea de a începe testarea rapid și de a extinde la configurații mai solicitante pe măsură ce este nevoie.

Prin combinarea punctelor de control reutilizabile, a capetelor de antrenament simple și a dimensiunilor de model scalabile, DINOv3 reconfigurează fluxurile de lucru de viziune calculată. Acesta reduce costul, scurtează ciclurile de antrenament și face utilizarea modelelor de bază mai practică în întreaga industrie.

Apliicații specifice de domeniu ale DINOv3

Există mai multe domenii în care DINOv3 poate fi utilizat:

Imagistica medicală

Datele medicale adesea lipsesc etichete clare, iar anotarea de către experți este atât timp consumatorie, cât și costisitoare. DINOv3 poate ajuta prin producerea de caracteristici dense care se transferă bine la sarcini de patologie și radiologie. De exemplu, un studiu a ajustat DINOv3 cu adaptori de rang scăzut pentru clasificarea figurilor mitotice, obținând o acuratețe echilibrată de 0,8871 cu un număr minim de parametri antrenabili. Acest lucru a demonstrat că rezultate de înaltă calitate sunt posibile chiar și cu cantități limitate de date etichetate. Capetele mai simple pot fi, de asemenea, utilizate pentru detectarea anomaliilor, reducând nevoia de seturi de date clinice etichetate pe scară largă. Cu toate acestea, implementarea clinică necesită încă o validare strictă.

Imagistica satelitară și geospațială

Meta a antrenat variante DINOv3 pe un corpus larg de aproximativ 493 de milioane de recolte satelitare. Aceste modele au îmbunătățit estimarea înălțimii copacilor și sarcinile de segmentare. În unele cazuri, o variantă distilată ViT-L satelitar a egalat sau a depășit chiar modelul complet de 7 miliarde de parametri. Acest lucru a confirmat valoarea antrenamentului auto-supervizat specific domeniului. În mod similar, practicienii pot preantrena DINOv3 pe date din domeniu sau ajusta variante distilate pentru a reduce costurile de etichetare în teledetecție.

Vehicule autonome și robotică

Caracteristicile DINOv3 întăresc modulele de percepție pentru vehicule și roboți. Acestea îmbunătățesc detectarea și corespondența în diferite condiții de vreme și iluminare. Cercetările au arătat că spatele DINOv3 susține politici vizuomotorii și controlori de difuzie, rezultând o eficiență a eşantionării îmbunătățită și rate de succes mai mari în sarcinile de manipulare robotică. Echipele de robotică pot aplica DINOv3 pentru percepție, dar ar trebui să combine acesta cu date din domeniu și o ajustare atentă pentru sisteme cu caracter critic.

Comerț și logistică

În mediul de afaceri, DINOv3 poate susține controlul calității și sistemele de inventar vizual. Acesta se adaptează pe diferite linii de produse și configurații de cameră, reducând nevoia de reantrenare pentru fiecare produs. Acest lucru îl face practic pentru industrii cu dinamici rapide și medii vizuale variate.

Provocări, bias și drumul înainte

Antrenarea modelelor de bază de viziune la scară, cum ar fi DINOv3, la 7 miliarde de parametri necesită resurse computaționale extinse. Acest lucru limitează antrenamentul complet la câteva organizații bine finanțate. Distilarea reduce costul inferenței și permite modelelor studenți mai mici să fie implementate. Cu toate acestea, nu elimină costul original de antrenament. Din acest motiv, majoritatea cercetătorilor și inginerilor depind de puncte de control lansate public, mai degrabă decât de antrenarea unor astfel de modele de la zero.

O altă provocare critică este biasul de set de date. Colecțiile mari de imagini adunate de pe Internet adesea reflectă dezechilibre regionale, culturale și sociale. Modelele antrenate pe acestea pot moșteni sau chiar crește aceste biasuri. Chiar și atunci când spatele înghețat este utilizat, ajustarea poate reintroduce disparități între grupuri. Prin urmare, auditarea setului de date, verificarea echității și evaluarea atentă sunt necesare înainte de implementare. Problemele etice se aplică, de asemenea, practicilor de licențiere și lansare. Modelele deschise ar trebui să fie furnizate cu ghiduri clare de utilizare, note de siguranță și evaluări de risc juridic pentru a sprijini adoptarea responsabilă.

Următorul drum va fi modelat de mai multe tendințe care vor influența rolul DINOv3 și al sistemelor similare. În primul rând, sistemele multimodale care leagă viziunea și limbajul vor depinde de codificatori puternici, cum ar fi DINOv3, pentru o aliniere mai bună imagine-text. În al doilea rând, calculul de margine și robtica vor beneficia de variantele distilate mai mici, făcând percepția avansată posibilă pe hardware limitat. În al treilea rând, inteligența explicabilă va câștiga importanță, pe măsură ce echipele lucrează pentru a face caracteristicile dense mai interpretabile pentru audituri, depanare și încredere în domenii cu risc ridicat. În plus, cercetările continue vor îmbunătăți robustețea împotriva deplasărilor de distribuție și a intrărilor adverse, asigurând utilizarea fiabilă în medii reale.

Concluzia

Deoarece caracteristicile sale înghețate se transferă bine, DINOv3 susține sarcini precum clasificarea, segmentarea, detectarea și estimarea adâncimii cu un antrenament suplimentar minim. În același timp, variantele distilate fac modelul suficient de flexibil pentru a rula atât pe dispozitive ușoare, cât și pe servere puternice. Aceste puteri au aplicații practice în diverse domenii, inclusiv sănătate, monitorizare geospațială, robotică și comerț.

Cu toate acestea, calculul intensiv necesar pentru antrenament și riscul biasului de set de date rămân provocări continue. Prin urmare, progresul viitor depinde de combinarea capacităților DINOv3 cu validarea atentă, monitorizarea echității și implementarea responsabilă, asigurând utilizarea fiabilă în cercetare și industrie.

Dr. Assad Abbas, un profesor asociat titular la Universitatea COMSATS Islamabad, Pakistan, a obținut doctoratul de la Universitatea de Stat din Dakota de Nord, USA. Cercetările sale se axează pe tehnologii avansate, inclusiv calculul în cloud, fog și edge, analiza datelor mari și inteligența artificială. Dr. Abbas a făcut contribuții substanțiale prin publicații în reviste științifice și conferințe reputabile. El este, de asemenea, fondatorul MyFastingBuddy.