Modele și platforme AI

Noua intuiție a inteligenței artificiale: De ce gândirea mai inteligentă contează mai mult decât gândirea mai lungă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Progresele în domeniul inteligenței artificiale (IA) au fost conduse de mult timp de convingerea că creșterea datelor și a puterii de calcul poate îmbunătăți performanța. Acest “aproximativ” a condus la sisteme impresionante de IA, cum ar fi GPT-3, care au performant remarcat de-a lungul anilor. Cu toate acestea, acest paradigme ajunge la limitele sale. Pe măsură ce problemele de IA devin mai complexe, devine clar că simpla adăugare de putere de calcul nu va fi o soluție durabilă sau eficientă pentru progresul pe termen lung. Această realizare a determinat cercetătorii să-și reevalueze abordarea dezvoltării IA. În acest context, modelul Cogito v2 al Deep Cogito introduce o nouă abordare care ar putea schimba viitorul dezvoltării IA. În loc să depindă de mai multă putere de calcul sau de raționament prelungit, Cogito v2 dezvoltă “intuiție” internă care îl îndrumă pe model să identifice drumul corect înainte de a începe căutarea. Acesta este un schimbare de paradigmă în modul în care IA este dezvoltată, concentrându-se pe gândirea mai bună, nu mai lungă.

O schimbare în dezvoltarea IA

Pentru mulți ani, forța motrice din spatele progreselor IA a fost ideea că “mai mult este mai bine”. Acestă abordare a condus la modele de IA care generează lanțuri extinse de raționament pentru a rezolva probleme complexe. Modelele OpenAI, cum ar fi GPT-3, sunt un exemplu al acestei abordări, unde lanțurile lungi de raționament au condus la rezultate impresionante pe sarcini dificile. Cu toate acestea, această metodă are dezavantaje semnificative. Lanțurile lungi de raționament necesită mai multe resurse computaționale, ceea ce duce la timp de inferență mai lent și costuri operaționale mai mari. Mai mult, cercetările au arătat că aceste procese prelungite conduc adesea la randamente descrescătoare, unde raționamentul mai lung conduce la o mai mare bias și mai puțină eficiență. Problema fundamentală este că depinderea de lanțuri lungi de raționament și creșterea puterii de calcul nu mai este o soluție eficientă pentru abordarea problemelor complexe de IA. Aceste abordări sunt limitate de timpul lor masiv de procesare și de cerințele de memorie.

De ce “intuiția” contează pentru IA

În contrast cu sistemele actuale de IA care depind de raționament prelungit, oamenii adesea se bazează pe ceea ce se numește “intuiție” (o formă de judecată rapidă și intuitivă) pentru a rezolva probleme. Deși intuiția poate părea un concept abstract, ea este adesea rezultatul anilor de experiență, învățare și procesare a contextului care permite oamenilor să ia decizii rapide fără a analiza în detaliu toate aspectele. Este acest tip de intuiție care separă calculul brut de raționamentul uman. Oamenii construiesc această “intuiție” prin recunoașterea modelelor și experiența acumulată, ceea ce le permite să ia decizii fără a explora exhaustiv toate opțiunile posibile. Noua “intuiție” a IA își propune să reproducă acest proces.

Această idee, cunoscută și sub numele de “inteligență prioritară”, ar putea fi cheia pentru a dota sistemele de IA cu raționament uman și a le face mai eficiente. Modelele de IA cu o puternică inteligență prioritară pot anticipa care soluții sunt probabil să reușească fără a fi nevoie de calcule extinse. În loc să se bazeze pe metode de căutare exhaustivă, intuiția permite sistemelor de IA să valorifice cunoștințele anterioare, concentrându-se pe cele mai eficiente căi către o soluție.

Cum a integrat Cogito v2 “intuiția”

Cogito a integrat conceptul de “intuiție” (mai tehnic, inteligență prioritară) în modelul său recent lansat, Cogito v2. Ei au integrat această idee folosind un mecanism numit Iterată Distilare și Amplificare (IDA). Acest mecanism permite modelului să învețe din propriul proces de raționament și să-și rafineze abilitățile de rezolvare a problemelor în timp. În loc să se bazeze pe prompturi statice sau profesori fixi, IDA permite IA să distileze căile de raționament reușite înapoi în parametrii de bază ai modelului. Acest proces de auto-îmbunătățire rafinează capacitatea de raționament a modelului în timp, optimizând nu numai pentru răspunsuri exacte, ci și pentru metodele de gândire cele mai eficiente.

  • Iterată Distilare și Amplificare (IDA)

Pentru a înțelege cum funcționează IDA, putem examina teoria procesului dual, care împarte gândirea umană în două sisteme: Sistemul 1 și Sistemul 2. Sistemul 1 se referă la decizii rapide și intuitive, în timp ce Sistemul 2 este mai lent, cu un raționament mai deliberat. Teoria sugerează că oamenii se bazează pe Sistemul 1 pentru majoritatea sarcinilor, dar trec la Sistemul 2 atunci când se confruntă cu decizii mai complexe.

IDA este un ciclu în două etape: amplificare și distilare. În faza de amplificare, modelul utilizează metode computaționale intensive pentru a genera soluții de înaltă calitate sau urme de raționament. Acesta este similar cu gândirea Sistemului 2, unde IA ia timp pentru a evalua cu atenție soluțiile potențiale. În faza de distilare, modelul internalizează insight-urile din faza de amplificare, transformând procesul de raționament de la Sistemul 2 la Sistemul 1. La fel cum un șofer devine mai intuitiv după ce câștigă experiență, un model de IA cu IDA poate lua decizii mai rapide și mai eficiente în timp.

Ideea cheie din spatele IDA este să se utilizeze raționamentul computațional intensiv în faza de amplificare, apoi să se distileze raționamentul îmbunătățit înapoi în parametrii modelului. Acest proces permite modelului să internalizeze strategii de raționament eficiente, care construiesc capacitatea sa de a gândi intuitiv atunci când rezolvă probleme. Prin repetarea acestui ciclu, sistemul de IA își îmbunătățește continuu capacitatea de a lua decizii cu mai puține resurse computaționale.

Avantajele integrării “intuiției” în IA

Unul dintre principalele avantaje ale “intuiției” IA este eficiența. Modele precum Cogito v2 demonstrează lanțuri de raționament care sunt cu până la 60% mai scurte decât cele ale modelelor concurente. Acest lucru înseamnă că ele pot ajunge la răspunsuri cu mai puține pași interni, reducând timpul și resursele necesare pentru inferență. De exemplu, o problemă care ar putea dura peste 200 de tokeni pentru a fi rezolvată de DeepSeek R1 poate fi finalizată de Cogito v2 în mai puțin de 100 de tokeni.

În plus, costul de antrenare a Cogito v2 este semnificativ mai mic decât cel al modelelor de IA tradiționale. Întregul proces de antrenare pentru Cogito v2, care acoperă o gamă largă de parametri, a costat sub 3,5 milioane de dolari, ceea ce este mult mai puțin decât cheltuielile asociate de obicei cu modelele de IA la scară largă, cum ar fi GPT-4.

Cogito v2 a demonstrat, de asemenea, capacități emergente în domenii pentru care nu a fost antrenat în mod explicit. De exemplu, în ciuda faptului că a fost antrenat în principal pe text, Cogito v2 poate raționa despre imagini, desprinzând insight-uri despre compoziția și habitatele imaginilor. Această capacitate de raționament trans-modal este un pas semnificativ către inteligența generală artificială, un punct de referință important pe drumul către Inteligență Generală Artificială (AGI).

Reevaluarea dezvoltării IA

Succesul inteligenței prioritare sugerează că strategiile de dezvoltare a IA necesită o schimbare fundamentală. În loc să se concentreze pe scalarea dimensiunii modelului sau pe creșterea puterii de calcul, dezvoltarea IA ar trebui să se concentreze pe construirea de sisteme care pot dezvolta și rafina propriile strategii cognitive. Această schimbare reflectă dezvoltarea cognitivă umană, unde inteligența nu este rezultatul unui creier mai mare sau a unui timp de gândire mai lung, ci mai degrabă a unor modele mentale și strategii de raționament mai bune. Această schimbare de abordare ar putea avea implicații pe termen lung. Prin accentuarea raționamentului mai inteligent decât a puterii brute de calcul, IA poate deveni mai versatilă, mai adaptabilă și mai capabilă de a face față noilor provocări. Această schimbare ar putea accelera aplicarea IA în industrii precum sănătatea, securitatea cibernetică și transportul autonom, făcând sistemele de IA mai eficiente, mai rentabile și mai impactante.

Concluzia

Succesul Cogito v2 demonstrează că viitorul IA nu constă în scalarea modelelor sau în creșterea puterii de calcul, ci în rafinarea arhitecturilor de raționament și în optimizarea pentru o rezolvare mai inteligentă a problemelor. Această schimbare promite un viitor mai durabil și mai accesibil pentru IA, unde sistemele pot îmbunătăți și se pot adapta continuu cu mai puțină dependență de resursele computaționale masive. Prin concentrarea asupra raționamentului inteligent și nu a calculului forțat, IA poate deveni mai capabilă de a aborda probleme complexe și reale.

Dr. Tehseen Zia este un profesor asociat titular la Universitatea COMSATS Islamabad, deținând un doctorat în IA de la Universitatea Tehnică din Viena, Austria. Specializându-se în Inteligență Artificială, Învățare Automată, Știință a Datelor și Viziune Computațională, el a făcut contribuții semnificative cu publicații în reviste științifice reputate. Dr. Tehseen a condus, de asemenea, diverse proiecte industriale ca Investigator Principal și a servit ca Consultant IA.