Modele și platforme AI
Mai puțin este mai mult: De ce recuperarea mai puținelor documente poate îmbunătăți răspunsurile generate de IA
Generarea augmentată de recuperare (RAG) este o abordare pentru construirea sistemelor de inteligență artificială care combină un model de limbaj cu o sursă de cunoaștere externă. În termeni simpli, IA caută mai întâi documente relevante (precum articole sau pagini web) legate de o întrebare a utilizatorului și apoi utilizează aceste documente pentru a genera un răspuns mai precis. Această metodă a fost celebrată pentru ajutorul oferit modelelor de limbaj mari (LLM) pentru a rămâne factuale și a reduce halucinațiile, prin ancorarea răspunsurilor în date reale.
În mod intuitiv, s-ar putea crede că, cu cât IA recuperează mai multe documente, cu atât va fi mai bine informat răspunsul. Cu toate acestea, o cercetare recentă sugerează o întorsătură surprinzătoare: atunci când vine vorba de alimentarea IA cu informații, uneori mai puțin este mai mult.
Mai puține documente, răspunsuri mai bune
Un studiu nou realizat de cercetători de la Universitatea Ebraică din Ierusalim a explorat modul în care numărul de documente oferite unui sistem RAG afectează performanța acestuia. În mod crucial, ei au menținut constantă cantitatea totală de text – ceea ce înseamnă că, dacă au fost oferite mai puține documente, acestea au fost ușor extinse pentru a umple aceeași lungime ca și multe documente. Astfel, orice diferență de performanță putea fi atribuită numărului de documente, și nu doar faptului că avea un input mai scurt.
Cercetătorii au utilizat un set de date de întrebări și răspunsuri (MuSiQue) cu întrebări de trivia, fiecare inițial asociat cu 20 de paragrafe de pe Wikipedia (doar câteva conținând răspunsul, iar restul fiind distractori). Prin reducerea numărului de documente de la 20 la doar 2-4 documente cu adevărat relevante – și umplerea acestora cu un pic de context suplimentar pentru a menține o lungime constantă – ei au creat scenarii în care IA avea mai puține materiale de considerat, dar încă aproximativ același număr de cuvinte de citit.
Rezultatele au fost izbitoare. În majoritatea cazurilor, modelele de IA au răspuns mai precis atunci când li s-au oferit mai puține documente, în loc de setul complet. Performanța a fost îmbunătățită semnificativ – în unele cazuri, până la 10% în ceea ce privește acuratețea (scor F1) atunci când sistemul a utilizat doar documentele care susțineau, în loc de o colecție mare. Acest avans contraintuitiv a fost observat în mai multe modele de limbaj deschis, inclusiv variante ale modelului Llama de la Meta și altele, ceea ce indică faptul că fenomenul nu este legat de un singur model de IA.
Un model (Qwen-2) a fost o excepție notabilă care a gestionat multiple documente fără scădere a scorului, dar aproape toate modelele testate au performant mai bine cu mai puține documente în general. Cu alte cuvinte, adăugarea de material de referință dincolo de piesele cheie relevante a afectat negativ performanța mai des decât a ajutat-o.

Sursă: Levy et al.
De ce este aceasta o surpriză? De obicei, sistemele RAG sunt proiectate sub presupunerea că recuperarea unei porțiuni mai largi de informații nu poate decât să ajute IA – după toate, dacă răspunsul nu se află în primele câteva documente, s-ar putea să se afle în al zecelea sau al douăzecilea.
Acest studiu răstoarnă acest scenariu, demonstrând că adăugarea indiscriminată de documente suplimentare poate backfira. Chiar și atunci când lungimea totală a textului a fost menținută constantă, simpla prezență a multor documente diferite (fiecare cu propriul context și ciudățenii) a făcut ca sarcina de întrebare și răspuns să fie mai dificilă pentru IA. Se pare că, dincolo de un anumit punct, fiecare document suplimentar a introdus mai mult zgomot decât semnal, confundând modelul și împiedicându-l să extragă răspunsul corect.
De ce mai puțin poate fi mai mult în RAG
Acest rezultat “mai puțin este mai mult” are sens odată ce considerăm modul în care modelele de limbaj IA procesează informația. Atunci când o IA primește doar documentele cele mai relevante, contextul pe care îl vede este focalizat și lipsit de distracții, la fel ca un student care a primit doar paginile potrivite pentru a studia.
În studiu, modelele au performant semnificativ mai bine atunci când li s-au oferit doar documentele care susțineau, cu materialul irelevant eliminat. Contextul rămas nu a fost doar mai scurt, ci și mai curat – conținea fapte care indicau direct spre răspuns și nimic altceva. Cu mai puține documente de gestionat, modelul putea să-și dedice atenția deplină informației pertinente, făcându-l mai puțin probabil să se piardă sau să se confunde.
Pe de altă parte, atunci când au fost recuperate multe documente, IA a trebuit să sorteze printr-un amestec de conținut relevant și irelevant. Adesea, aceste documente suplimentare erau “similare, dar nerelevante” – ele ar fi putut împărtăși un subiect sau cuvinte cheie cu întrebarea, dar nu conțineau de fapt răspunsul. Un astfel de conținut poate înșela modelul. IA ar putea cheltui efort încercând să conecteze puncte între documente care nu duc de fapt la un răspuns corect sau, mai rău, ar putea combina informații din surse multiple în mod incorect. Acest lucru crește riscul de halucinații – cazuri în care IA generează un răspuns care sună plauzibil, dar nu este ancorat în nicio sursă singulară.
În esență, alimentarea modelului cu prea multe documente poate dilua informația utilă și introduce detalii conflictuale, făcându-l mai dificil pentru IA să decidă ce este adevărat.
În mod interesant, cercetătorii au descoperit că, dacă documentele suplimentare erau evident irelevante (de exemplu, text nelegat de subiect), modelele erau mai bune la ignorarea lor. Problema reală vine de la datele care distrug atenția, care par relevante: atunci când toate textele recuperate sunt pe subiecte similare, IA presupune că ar trebui să le utilizeze pe toate și poate lupta să determine care detalii sunt cu adevărat importante. Acest lucru se aliniază cu observația studiului că “distractorii aleatori au cauzat mai puțină confuzie decât distractorii realiști” în intrare. IA poate filtra nonsensul evident, dar informația subtil diferită este o capcană alunecătoare – se strecoară sub masca relevanței și deraiază răspunsul. Prin reducerea numărului de documente la doar cele necesare, evităm așezarea acestor capcane de la bun început.
Există și un beneficiu practic: recuperarea și procesarea mai puținelor documente reduc încărcătura computațională pentru un sistem RAG. Fiecare document care este extras trebuie analizat (încorporat, citit și atenționat de model), ceea ce utilizează timp și resurse de calcul. Eliminarea documentelor suplimentare face sistemul mai eficient – poate găsi răspunsuri mai repede și la un cost mai mic. În scenariile în care acuratețea s-a îmbunătățit prin focalizarea pe surse mai puține, obținem un câștig de ambele părți: răspunsuri mai bune și un proces mai eficient.

Sursă: Levy et al.
Reevaluarea RAG: Direcții viitoare
Această nouă dovadă că calitatea poate învinge cantitatea în recuperare are implicații importante pentru viitorul sistemelor de IA care se bazează pe cunoașterea externă. Sugerează că proiectanții de sisteme RAG ar trebui să prioritizeze filtrarea inteligentă și ierarhizarea documentelor în loc de volumul lor. În loc de a recupera 100 de pasaje posibile și a spera că răspunsul este îngropat undeva, ar putea fi mai înțelept să recupereze doar primele câteva documente extrem de relevante.
Autorii studiului subliniază nevoia ca metodele de recuperare să “găsească un echilibru între relevanță și diversitate” în informațiile pe care le furnizează modelului. Cu alte cuvinte, dorim să oferim suficientă acoperire a subiectului pentru a răspunde la întrebare, dar nu atât de mult încât faptele cheie să fie înecate într-un ocean de text suplimentar.
Înainte, cercetătorii sunt probabil să exploreze tehnici care ajută modelele de IA să gestioneze mai grațios multiple documente. O abordare este dezvoltarea unor sisteme de recuperare sau reordonare mai bune care pot identifica care documente adaugă cu adevărat valoare și care introduc doar conflicte. O altă direcție este îmbunătățirea modelelor de limbaj însele: dacă un model (precum Qwen-2) a reușit să gestioneze multe documente fără a-și pierde acuratețea, examinarea modului în care a fost antrenat sau structurat ar putea oferi indicii pentru a face și alte modele mai robuste. Poate că modelele de limbaj mari viitoare vor încorpora mecanisme pentru a recunoaște când două surse spun același lucru (sau se contrazic) și se vor concentra corespunzător. Scopul ar fi să permită modelelor să utilizeze o varietate bogată de surse fără a cădea pradă confuziei – obținând astfel cel mai bun din ambele lumi (lărgimea informației și claritatea focalizării).
De asemenea, este important de remarcat că, pe măsură ce sistemele de IA capătă ferestre de context mai mari (capacitatea de a citi mai mult text deodată), simpla adăugare de mai multe date în prompt nu este o soluție universală. O fereastră de context mai mare nu înseamnă neapărat o mai bună înțelegere. Acest studiu arată că, chiar și atunci când o IA poate citi 50 de pagini deodată, oferirea de 50 de pagini de informații mixte poate să nu conducă la un rezultat bun. Modelul beneficiază încă de a avea conținut relevant și curatoriat pentru a lucra cu el, mai degrabă decât o descărcare nediscriminatorie. De fapt, recuperarea inteligentă poate deveni și mai crucială în era ferestrelor de context uriașe – pentru a asigura că capacitatea suplimentară este utilizată pentru cunoașterea valoroasă, și nu pentru zgomot.
Concluziile din “Mai multe documente, aceeași lungime” (titlul potrivit al lucrării) încurajează o reevaluare a ipotezelor noastre în cercetarea IA. Uneori, alimentarea unei IA cu toate datele pe care le avem nu este la fel de eficientă cum credem. Prin focalizarea pe cele mai relevante piese de informație, nu numai că îmbunătățim acuratețea răspunsurilor generate de IA, dar facem și sistemele mai eficiente și mai ușor de încredere. Este o lecție contraintuitivă, dar una cu implicații excitante: sistemele RAG viitoare ar putea fi atât mai inteligente, cât și mai slabe, prin alegerea atentă a mai puținelor, dar mai bune documente pentru recuperare.












