Modele și platforme AI
Când mai multă gândire face ca IA să fie mai prostă: Paradoxul scalării inverse

Inteligența artificială a fost construită pe ideea că oferirea de timp, date și putere de calcul mașinilor îmbunătățește performanța lor. Această credință a ghidat direcția cercetării și dezvoltării IA de-a lungul anilor. Presupunerea cheie care stă la baza acestei credințe este că modelele mai mari și resursele mai mari vor crea sisteme mai inteligente. Cu toate acestea, cercetările recente cercetări au început să pună la îndoială această abordare. Modelele de limbaj mari, cum ar fi seria o1 a OpenAI, Claude de la Anthropic și R1 de la DeepSeek, au fost create pentru a rezolva probleme pas cu pas, la fel ca raționamentul uman. Cercetătorii se așteptau ca, oferindu-le acestor modele mai mult timp pentru a gândi și a procesa informații, va îmbunătăți luarea deciziilor. Cu toate acestea, noile studii arată că se poate întâmpla contrariul. Când oferiți acestor modele mai mult timp pentru a gândi, ele pot performa mai prost, în special la sarcini simple. Acest efect se numește scalare inversă. El pune la îndoială credința că mai multă putere de calcul și un raționament mai profund duc întotdeauna la rezultate mai bune. Aceste constatări au consecințe semnificative pentru modul în care proiectăm și utilizăm IA în situații reale.
Înțelegerea fenomenului de scalare inversă
Fenomenul de “scalare inversă” a fost descoperit inițial prin experimente controlate de către cercetătorii de la Anthropic. În contrast cu legile tradiționale de scalare, care spun că mai multă calculare îmbunătățește performanța, aceste studii au arătat că oferirea de mai mult timp IA pentru a raționa poate reduce acuratețea sa la diferite sarcini.
Echipa de cercetare a creat sarcini în patru domenii: numărătoare simplă cu distracții, regresie cu caracteristici irelevante, deducție cu urmărire a constrângerilor și scenarii complexe de siguranță a IA. Rezultatele au fost surprinzătoare. În unele cazuri, modelele care au dat inițial răspunsuri corecte au început să dea răspunsuri greșite după ce li s-a oferit mai mult timp pentru a procesa.
De exemplu, la o sarcină simplă de numărătoare, cum ar fi “Câte fructe aveți dacă aveți un măr și o portocală?”, modelele Claude au fost adesea distrase de detalii suplimentare atunci când li s-a oferit mai mult timp pentru a raționa. Ei nu au putut să ofere răspunsul corect, care este doi. În aceste cazuri, modelele au gândit prea mult și au făcut greșeli.
Cercetarea recentă a Apple (AAPL ) cercetare a susținut, de asemenea, aceste constatări. Ei și-au efectuat experimentele în medii de puzzle controlate, cum ar fi Turnul din Hanoi și traversarea râului, și nu pe standarde de referință. Studiile lor au arătat trei tipare: la sarcini simple, modelele standard de limbaj mare au dat răspunsuri corecte mai eficient; la sarcini moderate, modelele de raționament au avut un avantaj; și la sarcini foarte complexe, ambele tipuri de modele au avut dificultăți.
Cele cinci moduri în care raționamentul IA eșuează
Cercetătorii au descoperit cinci moduri comune în care modelele IA pot eșua atunci când raționează pentru perioade mai lungi:
- Distracție de la irelevanță: Când modelele IA gândesc prea mult, ele sunt adesea distrase de detalii care nu au importanță. Acest lucru este similar cu un student care pierde punctul principal al unei probleme în timp ce gândește profund despre problema respectivă.
- Supraadaptare la cadre de problemă: Unele modele, cum ar fi seria o a OpenAI, se concentrează prea mult pe prezentarea problemei. Deși evită distracțiile, ele nu sunt flexibile și se bazează pe formularea problemei.
- Schimbare de corelație spurie: În timp, modelele IA pot trece de la presupuneri rezonabile la bazarea pe corelații înșelătoare. De exemplu, la sarcini de regresie, modelele iau inițial în considerare caracteristici relevante, dar atunci când li se oferă mai mult timp pentru a gândi, ele pot începe să se concentreze pe caracteristici irelevante și să dea rezultate incorecte.
- Degradare a focalizării: Pe măsură ce sarcinile devin mai complexe, modelele IA găsesc mai greu să-și mențină raționamentul clar și focalizat.
- Comportamente îngrijorătoare amplificate: Mai mult timp pentru a raționa poate face ca comportamentele negative să fie mai grave. De exemplu, Sonnet 4 al lui Claude a arătat tendințe de autoconservare mai puternice atunci când i s-a oferit timp suplimentar pentru a gândi despre scenarii de închidere.
Cum abordează raționamentul IA complexitatea problemelor
Cercetătorii de la Apple au introdus termenul de “iluzia gândirii” pentru a explica ce se întâmplă atunci când modelele de raționament se confruntă cu sarcini cu niveluri diferite de complexitate. În loc să se concentreze pe probleme matematice sau teste de codare, ei au testat modelele de raționament IA în medii de puzzle controlate, cum ar fi Turnul din Hanoi, săritura de șah, traversarea râului și lumea blocurilor. Prin creșterea treptată a dificultății acestor puzzle-uri, ei au putut vedea cum modelele performează la fiecare nivel. Această metodă le-a ajutat să examineze nu numai răspunsurile finale, ci și modul în care modelele au ajuns la acele răspunsuri. Studiul a găsit trei tipare clare în performanța modelului în funcție de complexitatea problemei:
- La puzzle-uri simple, cum ar fi Turnul din Hanoi cu unul sau două discuri, modelele standard de limbaj mare au dat răspunsuri corecte mai eficient. Modelele de raționament IA au făcut adesea lucrurile prea complicate prin lanțurile lor lungi de raționament, ceea ce a dus la răspunsuri incorecte.
- La puzzle-uri moderate, modelele de raționament IA au performant mai bine. Ei au putut descompune problemele în pași clari, ceea ce i-a ajutat să rezolve provocări multietapă mai eficient decât modelele standard de limbaj mare.
- La puzzle-uri foarte complexe, cum ar fi Turnul din Hanoi cu multe discuri, ambele tipuri de modele au avut dificultăți. Modelele de raționament au redus adesea efortul de raționament pe măsură ce puzzle-ul devenea mai greu, chiar dacă aveau suficiente resurse de calcul. Acest comportament de “renunțare” arată o slăbiciune cheie în scalarea raționamentului lor.
Provocarea evaluării IA
Fenomenul de scalare inversă arată probleme semnificative în modul în care evaluăm modelele IA. Multe dintre benchmark-urile actuale măsoară doar acuratețea răspunsurilor finale, nu calitatea procesului de raționament. Acest lucru poate duce la o percepție falsă a capacităților reale ale modelului. Un model poate performa bine la teste, dar poate eșua cu probleme noi sau neobișnuite.
Scalarea inversă subliniază, de asemenea, slăbiciunile în benchmark-urile de raționament și modul în care le utilizăm. Multe modele utilizează scurtături și recunoașterea de modele în loc de un adevărat raționament. Acest lucru poate face ca ele să pară mai inteligente decât sunt în realitate, dar performanța lor scade în situații reale. Această problemă este legată de probleme mai mari cu IA, cum ar fi halucinațiile și fiabilitatea. Pe măsură ce modelele devin mai bune la producerea de explicații care sună convingător, devine mai dificil să diferențiem un adevărat raționament de răspunsuri inventate.
Viitorul raționamentului IA
Paradoxul scalării inverse este atât o provocare, cât și o oportunitate pentru IA. Acesta arată că adăugarea de mai multă putere de calcul nu face întotdeauna ca IA să fie mai inteligentă. Trebuie să reevaluăm modul în care proiectăm și antrenăm sistemele IA pentru a face față problemelor cu complexități variate. Noile modele pot necesita să decidă când să se oprească și să gândească și când să răspundă rapid. În acest sens, IA ar putea beneficia de arhitecturi cognitive, cum ar fi teoria procesului dual, ca principii directoare. Aceste arhitecturi explică modul în care gândirea umană combină reacții rapide și instinctive cu raționamente lente și atente. Scalarea inversă ne amintește, de asemenea, că trebuie să înțelegem pe deplin modul în care IA ia decizii înainte de a o utiliza în domenii critice. Pe măsură ce IA este utilizată mai mult pentru luarea deciziilor în domenii cum ar fi sănătatea, dreptul și afacerile, devine și mai important să ne asigurăm că aceste sisteme raționează corect.
Concluzia
Paradoxul scalării inverse ne învață o lecție esențială în dezvoltarea IA. Mai mult timp și putere de calcul nu fac întotdeauna ca IA să fie mai competentă sau mai fiabilă. Progresul real vine din înțelegerea momentului în care IA ar trebui să raționeze și a limitelor sale. Pentru organizații și cercetători, este esențial să utilizeze IA ca un instrument, nu ca un substitut pentru judecata umană. Este necesar să alegem modelul potrivit pentru fiecare sarcină. Pe măsură ce IA devine parte a deciziilor importante, trebuie să evaluăm cu atenție punctele sale forte și slabe. Viitorul IA depinde de gândirea corectă, nu doar de gândirea mai multă.












