Lideri de opinie

Cum pot LLM-urile să rezolve cu adevărat probleme complexe?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Introducerea și evoluția inteligenței artificiale generative au fost atât de bruște și intense încât este destul de greu să apreciem pe deplin cât de mult această tehnologie a schimbat viețile noastre.

Să ne uităm la doar trei ani în urmă. Da, inteligența artificială devenea mai omniprezentă, cel puțin în teorie. Mai multe persoane știau unele dintre lucrurile pe care le putea face, deși chiar și atunci existau înțelegeri greșite masive despre capacitățile inteligenței artificiale. Într-un fel, tehnologia a primit simultan prea puțin și prea mult credit pentru ceea ce putea să realizeze cu adevărat. Încă, o persoană obișnuită putea indica cel puțin una sau două domenii în care inteligența artificială era la lucru, efectuând sarcini foarte specializate foarte bine, în medii controlate. Orice lucru dincolo de aceasta era fie încă într-un laborator de cercetare, fie pur și simplu nu exista.

Compară aceasta cu prezentul. Cu abilități zero, altele decât capacitatea de a scrie o propoziție sau de a pune o întrebare, lumea este la îndemâna noastră. Putem genera imagini, muzică și chiar filme care sunt cu adevărat unice și uimitoare și au capacitatea de a perturba întregi industrii. Putem suprasarcina procesului nostru de căutare, punând o întrebare simplă care, dacă este formulată corect, poate genera pagini de conținut personalizat suficient de bun pentru a trece drept un cercetător universitar instruit … sau un elev de clasa a III-a, dacă specificăm punctul de vedere. Deși au devenit, într-un an sau doi, foarte comune, aceste capacități erau considerate absolut imposibile cu doar câțiva ani în urmă. Domeniul inteligenței artificiale generative a existat, dar nu a decolat în niciun fel.

Astăzi, multe persoane au experimentat inteligența artificială generativă, cum ar fi ChatGPT, Midjourney sau alte unelte. Alții au încorporat deja acestea în viața lor de zi cu zi. Viteza cu care acestea au evoluat este uluitoare, ajungând aproape să fie alarmantă. Și, având în vedere progresele ultimelor șase luni, suntem, fără îndoială, pe cale să fim uimiți, din nou și din nou, în următorii câțiva ani.

Un instrument specific care joacă un rol în inteligența artificială generativă a fost performanța sistemelor de generare augmentate cu recuperare (RAG) și capacitatea lor de a gândi prin interogări complexe. Introducerea setului de date FRAMES, explicat în detaliu într-un articol despre modul în care funcționează setul de date de evaluare, arată atât unde se află stadiul actual, cât și unde se îndreaptă. Chiar și de la introducerea FRAMES la sfârșitul anului 2024, o serie de platforme au stabilit deja noi recorduri în ceea ce privește capacitatea de a gândi prin interogări dificile și complexe.

Hăi să intrăm în detalii despre ce este menit să evalueze FRAMES și cum performează diferitele modele de inteligență artificială generativă. Putem vedea cum atât descentralizarea, cât și platformele open-source nu numai că își mențin poziția (în special Sentient Chat), dar permit utilizatorilor să aibă o vedere clară a raționamentului uimitor pe care unele modele de inteligență artificială îl pot atinge.

FRAMES ca o fereastră în creierul GenAI

Setul de date FRAMES și procesul de evaluare se concentrează pe 824 de întrebări „multi-hop” menite să necesite inferență, conectarea logică a punctelor, utilizarea mai multor surse diferite pentru a obține informații cheie și capacitatea de a le asambla logic pentru a răspunde la întrebare. Întrebările necesită între două și 15 documente pentru a le răspunde corect și includ, de asemenea, constrângeri, calcule matematice și deducții, precum și capacitatea de a procesa logica bazată pe timp. Cu alte cuvinte, aceste întrebări sunt extrem de dificile și reprezintă, de fapt, sarcini de cercetare foarte reale pe care un om le-ar putea întreprinde pe internet. Ne confruntăm cu aceste provocări tot timpul și trebuie să căutăm bucățile cheie de informații într-un ocean de surse de internet, asamblând informații pe baza diferitelor site-uri, creând informații noi prin calcul și deducție și înțelegând cum să consolidate aceste fapte într-un răspuns corect la întrebare.

Ceea ce au descoperit cercetătorii atunci când setul de date a fost lansat și testat pentru prima dată este că principalele modele GenAI au putut fi destul de precise (aproximativ 40%) atunci când au trebuit să răspundă utilizând metode cu un singur pas, dar au putut atinge o precizie de 73% dacă li s-a permis să colecteze toate documentele necesare pentru a răspunde la întrebare. Da, 73% poate nu pare o revoluție. Dar dacă înțelegi exact ce trebuie răspuns, numărul devine mult mai impresionant.

De exemplu, o anumită întrebare este: „În ce an s-a născut liderul grupului care a interpretat inițial cântecul care a fost eșantionat în cântecul lui Kanye West Power?” Cum ar aborda un om această problemă? Persoana ar putea vedea că are nevoie de elemente de informații, cum ar fi versurile cântecului Kanye West numit „Power”, și apoi ar putea să caute prin versuri și să identifice punctul în care cântecul sampilează de fapt un alt cântec. Noi, oamenii, am putea probabil să ascultăm cântecul (chiar dacă nu suntem familiari cu el) și să putem spune când un alt cântec este sampilat.

Dar gândiți-vă: ce ar trebui să realizeze un model GenAI pentru a detecta un cântec diferit de originalul lui în timp ce „ascultă” cântecul? Acesta este punctul în care o întrebare simplă devine un test excelent pentru inteligența artificială cu adevărat inteligentă. Și dacă am putea găsi cântecul, asculta-l și identifica versurile sampilate, aceasta este doar etapa 1. Încă mai avem nevoie să aflăm ce este numele cântecului, ce este numele trupei, cine este liderul acelei trupe și apoi în ce an s-a născut acea persoană.

FRAMES arată că pentru a răspunde la întrebări realiste, este nevoie de o cantitate imensă de procesare a gândirii. Două lucruri vin în minte aici.

În primul rând, capacitatea modelelor GenAI descentralizate de a nu numai concura, ci și de a domina potențial rezultatele, este incredibilă. Un număr tot mai mare de companii utilizează metoda descentralizată pentru a-și scala capacitățile de procesare, asigurând în același timp că un mare grup de oameni deține software-ul, și nu o cutie neagră centralizată care nu își va împărtăși progresele. Companii precum Perplexity și Sentient conduc această tendință, fiecare cu modele formidabile care performează mai bine decât primele înregistrări de precizie atunci când FRAMES a fost lansat.

Al doilea element este că un număr mai mic dintre aceste modele de inteligență artificială nu numai că sunt descentralizate, dar sunt și open-source. De exemplu, Sentient Chat este atât descentralizat, cât și open-source, iar testele timpurii arată cât de complex poate fi raționamentul său, mulțumită accesului inestimabil la codul sursă. Întrebarea FRAMES de mai sus este răspunsă utilizând același proces de gândire pe care l-ar folosi un om, cu detalii despre raționament disponibile pentru revizuire. Poate și mai interesant, platforma lor este structurată ca o serie de modele care pot ajusta o perspectivă și o performanță dată, chiar dacă procesul de ajustare în unele modele GenAI duce la o precizie diminuată. În cazul Sentient Chat, au fost dezvoltate multe modele diferite. De exemplu, un model recent numit „Dobby 8B” este capabil atât să depășească benchmark-ul FRAMES, cât și să dezvolte o atitudine distinctă pro-crypto și pro-libertate, care afectează perspectiva modelului în timp ce procesează piese de informații și dezvoltă un răspuns.

Pe orizont

Cheia tuturor acestor inovații uimitoare este viteza rapidă care ne-a adus aici. Trebuie să recunoaștem că, la fel de rapid cum a evoluat această tehnologie, ea va evolua și mai rapid în viitorul apropiat. Vom putea vedea, în special cu modelele GenAI descentralizate și open-source, acel prag critic în care inteligența sistemului începe să depășească din ce în ce mai mult a noastră, și ce înseamnă acest lucru pentru viitor.

David Balaban este un cercetător în domeniul securității calculatoarelor, cu peste 17 ani de experiență în analiza malware-ului și evaluarea software-ului antivirus. David conduce proiectele MacSecurity.net și Privacy-PC.com care prezintă opinii ale experților pe probleme actuale de securitate a informației, incluzând ingineria socială, malware, testarea de penetrare, inteligența amenințărilor, confidențialitatea online și hacking-ul cu pălărie albă. David are o puternică experiență în soluționarea problemelor de malware, cu o focalizare recentă pe măsurile de contracarare a ransomware-ului.