Modele și platforme AI
Transformatori de Viziune Depășesc Provocările cu Noua Metodă “Atenție de la Pachet la Cluster”
Tehnologiile de inteligență artificială (IA), în special Transformatorii de Viziune (ViTs), au arătat un potențial imens în capacitatea lor de a identifica și categorisi obiecte în imagini. Cu toate acestea, aplicarea lor practică a fost limitată de două provocări semnificative: cerințele ridicate de putere de calcul și lipsa de transparență în procesul de luare a deciziilor. Acum, un grup de cercetători a dezvoltat o soluție revoluționară: o metodologie nouă, cunoscută sub numele de “Atenție de la Pachet la Cluster” (PaCa). PaCa își propune să îmbunătățească capacitățile ViTs în identificarea, clasificarea și segmentarea obiectelor din imagini, rezolvând în același timp problemele legate de cerințele de calcul și claritatea deciziilor.
Abordarea Provocărilor ViTs: O Privire asupra Noii Soluții
Transformatorii, datorită capacităților lor superioare, sunt printre cele mai influente modele în lumea IA. Puterea acestor modele a fost extinsă la datele vizuale prin ViTs, o clasă de transformatori care sunt antrenați cu intrări vizuale. În ciuda potențialului enorm oferit de ViTs în interpretarea și înțelegerea imaginilor, acestea au fost împiedicate de câteva probleme majore.
În primul rând, datorită naturii imaginilor care conțin cantități uriașe de date, ViTs necesită o putere de calcul și o memorie substanțiale. Această complexitate poate fi copleșitoare pentru multe sisteme, mai ales atunci când se ocupă de imagini cu rezoluție ridicată. În al doilea rând, procesul de luare a deciziilor în cadrul ViTs este adesea încurcat și opac. Utilizatorii găsesc dificil să înțeleagă cum ViTs diferențiază între diverse obiecte sau caracteristici dintr-o imagine, ceea ce este esențial pentru numeroase aplicații.
Însă, metodologia inovatoare PaCa oferă o soluție pentru ambele provocări. “Abordăm provocarea legată de cerințele de calcul și memorie prin utilizarea tehnicilor de clusterizare, care permit arhitecturii de transformator să identifice și să se concentreze mai bine asupra obiectelor dintr-o imagine”, explică Tianfu Wu, autorul corespondent al unui articol despre această lucrare și profesor asociat de inginerie electrică și informatică la Universitatea de Stat din Carolina de Nord.
Utilizarea tehnicilor de clusterizare în PaCa reduce drastic cerințele de calcul, transformând problema dintr-un proces quadratic într-unul liniar gestionabil. Wu explică mai departe procesul, “Prin clusterizare, putem face ca acest proces să devină liniar, unde fiecare unitate mai mică trebuie comparată doar cu un număr prestabilit de clusteruri”.
Clusterizarea servește și la clarificarea procesului de luare a deciziilor în ViTs. Procesul de formare a clusterurilor arată cum ViT decide care caracteristici sunt importante pentru gruparea secțiunilor de date din imagine. Deoarece AI creează doar un număr limitat de clusteruri, utilizatorii pot înțelege și examina ușor procesul de luare a deciziilor, îmbunătățind semnificativ interpretabilitatea modelului.
Metodologia PaCa Depășește Alte ViTs de Ultimă Generație
Prin testări cuprinzătoare, cercetătorii au descoperit că metodologia PaCa depășește alte ViTs din mai multe puncte de vedere. Wu explică, “Am găsit că PaCa a depășit SWin și PVT în toate modurile”. Procesul de testare a arătat că PaCa a excelat în clasificarea și identificarea obiectelor din imagini și în segmentarea, conturând eficient limitele obiectelor din imagini. Mai mult, s-a constatat că este mai eficientă în timp, realizând sarcinile mai rapid decât alte ViTs.
Încurajați de succesul PaCa, echipa de cercetare își propune să continue dezvoltarea acesteia prin antrenarea pe seturi de date fundamentale mai mari. Prin aceasta, speră să extindă limitele a ceea ce este posibil în prezent cu IA bazată pe imagini.
Articolul de cercetare, “PaCa-ViT: Învățarea Atenției de la Pachet la Cluster în Transformatori de Viziune“, va fi prezentat la următoarea Conferință IEEE/CVF privind Viziunea Calculatorului și Recunoașterea Modelului. Este un moment important care ar putea deschide calea către sisteme de IA mai eficiente, transparente și accesibile.












