Modele și platforme AI
Cele mai bune modele de IA sunt pierdute în documente lungi
Un studiu nou al cercetătorilor de la LMU Munich, Centrul de Învățare Automată din München și Adobe (ADBE ) Research a expus o slăbiciune a modelelor de limbaj IA: acestea au dificultăți în a înțelege documente lungi în moduri care ar putea să vă surprindă. Rezultatele echipei de cercetare arată că chiar și cele mai avansate modele de IA au probleme în a conecta informații atunci când nu se pot baza pe simpla potrivire a cuvintelor.
Problema ascunsă a abilităților de citire ale IA
Încercați să găsiți un detaliu specific într-un raport de cercetare lung. Ați putea să treceți prin el, făcând conexiuni mentale între diferite secțiuni pentru a reuni informațiile de care aveți nevoie. Multe modele de IA, se pare, nu funcționează în acest fel deloc. În schimb, ele se bazează adesea puternic pe găsirea de potriviri exacte de cuvinte, similare cu utilizarea tastei Ctrl+F pe computer.
Echipa de cercetare a dezvoltat o nouă benchmark numită NOLIMA (Fără potrivire literală) pentru a testa diverse modele de IA. Rezultatele au arătat că atunci când modelele de IA se confruntă cu texte mai lungi de 2.000 de cuvinte, performanța lor scade dramatic. Până când ajung la 32.000 de cuvinte – aproximativ lungimea unei cărți scurte – majoritatea modelelor funcționează la jumătate din capacitatea lor obișnuită. Acest lucru a inclus testarea unor modele majore, cum ar fi GPT-4o, Gemini 1.5 Pro și Llama 3.3 70B.
Luați în considerare un cercetător medical care utilizează IA pentru a analiza dosarele pacienților sau o echipă juridică care utilizează IA pentru a revizui documente de caz. Dacă IA ratează conexiuni cruciale din cauza că informațiile relevante folosesc cuvinte diferite decât cele din interogarea de căutare, consecințele ar putea fi semnificative.
De ce potrivirea cuvintelor nu este suficientă
Modelele de IA actuale procesează textul utilizând un mecanism de atenție. Acest sistem ajută IA să se concentreze pe diferite părți ale textului pentru a înțelege relațiile dintre cuvinte și idei. Atunci când lucrează cu texte scurte, acest lucru funcționează suficient de bine. Cu toate acestea, cercetarea arată că acest mecanism devine copleșit pe măsură ce textele devin mai lungi, mai ales atunci când nu se poate baza pe potriviri exacte de cuvinte.
Testul NOLIMA a dezvăluit această limitare prin a cere modelelor de IA să răspundă la întrebări al căror răspuns necesită înțelegerea contextului, mai degrabă decât găsirea de cuvinte potrivite. Rezultatele au fost elocvente. În timp ce modelele au funcționat bine cu texte scurte, capacitatea lor de a face aceste conexiuni a scăzut semnificativ pe măsură ce lungimea textului a crescut. Chiar și modelele specializate, proiectate pentru sarcini de raționament, au obținut sub 50% acuratețe atunci când s-au confruntat cu documente mai lungi.
Fără ajutorul potrivirii cuvintelor, modelele de IA au luptat pentru a:
- Conecta concepte legate care utilizează terminologie diferită
- Urma pașilor de raționament multipli
- Găsi informații relevante atunci când acestea apar după contextul cheie
- Ignora potrivirile de cuvinte înșelătoare din secțiunile nerelevante
Numerele spun povestea
Rezultatele cercetării arată o imagine dură a modului în care modelele de IA se descurcă cu texte mai lungi. GPT-4o a arătat cea mai puternică performanță, menținându-și eficacitatea până la aproximativ 8.000 de tokeni (aproximativ 6.000 de cuvinte). Cu toate acestea, chiar și acest performer de top a arătat o scădere semnificativă cu texte mai lungi. Majoritatea celorlalte modele, inclusiv Gemini 1.5 Pro și Llama 3.3 70B, au experimentat scăderi bruște ale performanței între 2.000 și 8.000 de tokeni.
Scăderea performanței a devenit și mai pronunțată atunci când sarcinile au necesitat multiple pași de raționament. De exemplu, dacă un model trebuia să facă două conexiuni logice – cum ar fi înțelegerea că un personaj trăiește lângă un reper și că acel reper se află într-un anumit oraș – rata de succes a scăzut considerabil. Cercetarea a arătat că acest tip de raționament multi-pas a devenit particular de dificil în texte care depășesc 16.000 de tokeni, chiar și atunci când se utilizează tehnici proiectate pentru a îmbunătăți raționamentul, cum ar fi promptarea de gândire în lanț.
Ce face aceste descoperiri deosebit de remarcabile este că ele contestă afirmațiile despre capacitatea modelelor de IA de a gestiona contexte lungi. În timp ce multe modele publicitatează suport pentru ferestre de context extinse, benchmark-ul NOLIMA arată că înțelegerea efectivă scade mult înainte de a atinge aceste limite teoretice.

Sursă: Modarressi et al.
Când IA ratează pădurea din cauza copacilor
Aceste limitări au implicații serioase pentru modul în care utilizăm IA în aplicații din lumea reală. Luați în considerare un sistem juridic de IA care caută prin legislație. Acesta ar putea să rateze precedente relevante pur și simplu pentru că acestea utilizează terminologie diferită decât interogarea de căutare. Sistemul ar putea să se concentreze în schimb asupra unor cazuri mai puțin relevante care să împărtășească mai multe cuvinte cu termenii de căutare.
Impactul asupra căutării și analizei documentelor este deosebit de îngrijorător. Sistemele actuale de căutare bazate pe IA se bazează adesea pe o tehnică numită Generare augmentată de recuperare (RAG). Chiar și atunci când aceste sisteme reușesc să recupereze un document care conține informația corectă, IA poate să nu recunoască relevanța sa dacă terminologia diferă de cea a interogării. În schimb, IA ar putea să se îndrepte spre documente mai puțin relevante care împărtășesc asemănări de suprafață cu termenii de căutare.
Pentru utilizatorii de IA, aceste descoperiri sugerează câteva considerații importante:
În primul rând, interogările și documentele mai scurte vor probabil să ofere rezultate mai fiabile. Atunci când lucrați cu texte mai lungi, împărțirea lor în segmente mai mici și concentrate poate ajuta la menținerea performanței IA.
În al doilea rând, utilizatorii ar trebui să fie deosebit de atenți atunci când cer IA să facă conexiuni între diferite părți ale unui document lung. Cercetarea arată că modelele de IA se luptă cel mai mult atunci când trebuie să reunească informații din secțiuni diferite, mai ales atunci când conexiunea nu este evidentă prin vocabularul împărtășit.
În final, aceste limitări subliniază importanța continuă a supravegherii umane. În timp ce IA poate fi un instrument puternic pentru procesarea și analiza textului, nu ar trebui să fie tratată ca singurul mijloc de identificare a conexiunilor importante în documente lungi sau complexe. Capacitatea umană de a menține contextul și de a face conexiuni conceptuale pe texte lungi rămâne superioară capacităților actuale de IA.
Descoperirile servesc ca o amintire că, în ciuda progreselor rapide în tehnologia IA, aceste sisteme procesează informația într-un mod foarte diferit de cel al oamenilor. Înțelegerea acestor limitări este esențială pentru utilizarea eficientă a instrumentelor de IA și pentru a ști când judecata umană rămâne esențială.
Ce urmează
Înțelegerea limitărilor actuale ale modelelor de IA în procesarea textelor lungi deschide întrebări importante despre viitorul dezvoltării de IA. Cercetarea din spatele benchmark-ului NOLIMA a arătat că abordările noastre actuale privind procesarea textului de IA pot necesita o refacere semnificativă, mai ales în ceea ce privește modul în care modelele gestionează informația de-a lungul pasajelor mai lungi.
Soluțiile actuale au arătat doar un succes parțial. Promptarea de gândire în lanț, care încurajează modelele de IA să-și descompună raționamentul în pași, ajută la îmbunătățirea performanței într-o oarecare măsură. De exemplu, atunci când se utilizează această tehnică, Llama 3.3 70B a arătat o capacitate mai bună de a gestiona contexte mai lungi. Cu toate acestea, această abordare încă nu este suficientă atunci când se confruntă cu texte care depășesc 16.000 de tokeni, sugerând că avem nevoie de soluții mai fundamentale.
Mecanismul de atenție, care formează baza modului în care modelele de IA actuale procesează textul, are nevoie de o reevaluare. Gândiți-vă la acesta ca la încercarea de a purta o conversație într-o cameră aglomerată – cu cât conversația este mai lungă, cu atât este mai greu să țineți evidența tuturor punctelor importante menționate anterior. Modelele noastre de IA actuale se confruntă cu o provocare similară, dar la o scară mult mai mare.
Privind spre viitor, cercetătorii explorează câteva direcții promițătoare. O abordare implică dezvoltarea de noi modalități pentru IA de a organiza și prioritiza informația în texte lungi, mergând dincolo de simpla potrivire a cuvintelor pentru a înțelege conexiuni conceptuale mai profunde. Acest lucru ar putea funcționa mai mult ca modul în care oamenii creează hărți mentale ale informației, conectând idei pe baza înțelesului, mai degrabă decât doar a vocabularului împărtășit.
O altă zonă de dezvoltare se concentrează pe îmbunătățirea modului în care modelele de IA gestionează ceea ce cercetătorii numesc “sărituri latente” – pașii logici necesari pentru a conecta diferite fragmente de informație. Modelele actuale se luptă cu aceste conexiuni, mai ales în texte mai lungi, dar arhitecturi noi ar putea ajuta la acoperirea acestei lacune.
Pentru cei care lucrează cu instrumente de IA astăzi, aceste descoperiri sugerează câteva abordări practice:
Luați în considerare împărțirea documentelor mai lungi în segmente semnificative atunci când lucrați cu IA. Acest lucru ajută la crearea unor secțiuni logice care păstrează contextul important. De exemplu, dacă analizați un raport de cercetare, ați putea să păstrați împreună secțiunile de metodologie și rezultate, deoarece acestea conțin adesea informații legate.
Atunci când cereți IA să analizeze texte mai lungi, fiți specifici cu privire la conexiunile pe care doriți să le facă. În loc de a pune întrebări largi, îndreptați IA spre relațiile specifice pe care sunteți interesat să le explorați. Acest lucru ajută la compensarea limitărilor actuale ale modelului în a face aceste conexiuni în mod independent.
Poate cel mai important, mențineți așteptări realiste cu privire la capacitățile de IA cu texte lungi. În timp ce aceste instrumente pot fi incredibil de utile pentru multe sarcini, nu ar trebui să fie tratate ca înlocuitori compleți pentru analiza umană a documentelor complexe. Capacitatea umană de a menține contextul și de a face conexiuni conceptuale pe texte lungi rămâne superioară capacităților actuale de IA.
Calea de urmat pentru dezvoltarea de IA în acest domeniu este atât provocatoare, cât și încurajatoare. Pe măsură ce înțelegem mai bine aceste limitări, putem lucra spre sisteme de IA care să înțeleagă într-adevăr texte lungi, mai degrabă decât doar să le proceseze. Până atunci, utilizarea eficientă a IA înseamnă a lucra cu limitările sale actuale, în timp ce apreciem punctele sale forte.












