Modele și platforme AI

De la argint la aur: Cum a cucerit DeepMind Olimpiada de matematică

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Inteligența artificială a lui DeepMind a făcut progrese remarcabile în raționamentul matematic într-un interval de doar un an. După ce a câștigat o medalie de argint la Olimpiada Internațională de Matematică (IMO) în 2024, sistemul său de inteligență artificială a obținut o medalie de aur în 2025. Acest progres rapid subliniază capacitățile în creștere ale inteligenței artificiale în abordarea problemelor complexe și abstracte care necesită creativitate și perspicacitate umană. Acest articol va prezenta modul în care DeepMind a realizat această transformare, alegerile tehnice și strategice din spatele acesteia și implicațiile mai largi ale acestor progrese.

Importanța IMO

Olimpiada Internațională de Matematică, înființată în 1959, este recunoscută la nivel global ca principala competiție de matematică pentru elevi de liceu. Fiecare an, cei mai buni elevi din întreaga lume se confruntă cu șase probleme dificile din algebra, geometrie, teoria numerelor și combinatorică. Rezolvarea acestor probleme necesită mult mai mult decât calcul; participanții trebuie să arate creativitate matematică reală, gândire logică riguroasă și capacitatea de a construi demonstrații elegante.

Pentru inteligența artificială, IMO prezintă o provocare unică. În timp ce inteligența artificială a stăpânit recunoașterea modelelor, analiza datelor și chiar jocuri complexe precum Go și șah, matematica olimpică necesită raționament abstract și creativ și sinteza de noi idei, abilități considerate tradițional ca fiind caracteristice inteligenței umane. Ca urmare, IMO a devenit un test natural pentru evaluarea proximității inteligenței artificiale de a atinge un raționament cu adevărat similar celui uman.

Prima medalie de argint din 2024

În 2024, DeepMind a introdus două sisteme de inteligență artificială pentru a aborda probleme de nivel IMO: AlphaProof și AlphaGeometry 2. Ambele sisteme sunt exemple de inteligență artificială “neuro-simbolice”, combinând puterea modelelor lingvistice mari (LLM) cu rigurozitatea logicii simbolice.

AlphaProof a fost proiectat pentru a demonstra afirmații matematice utilizând Lean, un limbaj matematic formal. A combinat Gemini, modelul de limbaj mare al lui DeepMind, cu AlphaZero, care este un motor de învățare prin întărire cunoscut pentru succesul său în jocuri de table. În acest context, rolul lui Gemini a fost de a traduce probleme de limbaj natural în Lean și de a încerca demonstrații prin generarea de pași logici. AlphaProof a fost antrenat pe milioane de probleme de exemplu care acoperă diferite discipline și dificultăți matematice. Sistemul și-a îmbunătățit capacitățile prin încercarea de a demonstra afirmații din ce în ce mai complexe, similar cu modul în care AlphaZero a învățat prin jocuri împotriva sa.

AlphaGeometry 2 a fost proiectat pentru a rezolva probleme de geometrie. Aici, înțelegerea limbajului de către Gemini a permis inteligenței artificiale să prezică construcții auxiliare utile, în timp ce un motor de raționament simbolic a gestionat deducțiile logice. Acest abordare hibrid a permis AlphaGeometry să abordeze probleme geometrice mult dincolo de domeniul de aplicare a raționamentului mașinilor tradiționale.

Împreună, aceste sisteme au rezolvat patru din șase probleme IMO: două în algebra, una în teoria numerelor și una în geometrie, obținând un scor de 28 din 42. Această performanță a fost un moment semnificativ, deoarece a fost pentru prima dată când o inteligență artificială a atingerea nivelului de medalie de argint la IMO. Cu toate acestea, acest succes s-a bazat puternic pe experți umani pentru a traduce probleme în limbi matematice formale. De asemenea, au necesitat resurse computaționale masive, care au durat zile de timp de procesare pentru fiecare problemă.

Inovațiile tehnice din spatele medaliei de aur

Trecerea lui DeepMind de la o medalie de argint la o medalie de aur a fost condusă de câteva îmbunătățiri tehnice semnificative.

1. Limbajul natural ca mediu pentru demonstrații

Schimbarea cea mai semnificativă a fost trecerea de la sisteme care necesitau traduceri de experți în limbi formale la tratarea limbajului natural ca mediu pentru demonstrații. Acest schimb este realizat prin o versiune îmbunătățită a lui Gemini echipat cu capacități Deep Think. În loc de a converti probleme în Lean, modelul procesează textul direct, generează schițe informale, formalizează intern pașii critici și produce o demonstrație rafinată în engleză. Învățarea prin întărire din feedback uman (RLHF) a fost utilizată pentru a recompensa soluții care erau logic consistente, concise și prezentate.

Gemini Deep Think se diferențiază de versiunea publică a lui Gemini în două moduri principale. În primul rând, alocă ferestre de context mai lungi și mai multe tokenuri de calcul pe cerere, ceea ce permite modelului să mențină lanțuri de gândire pe mai multe pagini. În al doilea rând, utilizează raționament paralel, unde sute de fire speculative sunt generate pentru diferite soluții potențiale. Un supraveghetor ușor apoi clasifică și promovează cele mai promițătoare căi, împrumutând concepte din căutarea arborelui Monte Carlo dar aplicate textului. Acest abordare imită modul în care echipele umane brainstorm, elimină idei neproductive și converg către soluții elegante.

2. Antrenament și învățare prin întărire

Antrenamentul lui Gemini Deep Think a implicat ajustarea modelului pentru a prezice pașii următori, mai degrabă decât răspunsurile finale. În acest scop, a fost compilat un corpus de 100.000 de soluții de înaltă calitate pentru probleme olimpice și concursuri universitare. Corpusul a fost colectat în principal din forumuri publice de matematică, preprinturi arXiv și seturi de probleme universitare. Mentorii umani au examinat exemplele de antrenament pentru a filtra demonstrații ilogice sau incomplete. Învățarea prin întărire a ajutat la rafinarea modelului, îndreptându-l către producerea de demonstrații concise și precise. Versiunile timpurii au produs demonstrații prea verbose, dar penalizarea frazelor redundante a ajutat la tăierea outputului.

În contrast cu ajustarea convențională, care adesea se luptă cu recompense rare unde feedbackul este binar, fie demonstrația este corectă sau nu. DeepMind a implementat un sistem de recompensă treptată, unde fiecare sub-lemă verificată a contribuit la scorul general. Acest mecanism de recompensă îndrumă Gemini chiar și atunci când demonstrația completă este rară. Procesul de antrenament a durat trei luni și a utilizat aproximativ 25 de milioane de ore TPU.

3. Paralelizare masivă

Paralelizarea a jucat, de asemenea, un rol critic în progresul lui DeepMind de la argint la aur. Fiecare problemă a generat multiple ramuri de raționament în paralel, cu resurse care s-au mutat dinamic către căi mai promițătoare atunci când altele au stagnat. Acest programare dinamică a fost deosebit de benefică pentru problemele de combinatorică, care au spații de soluții mari. Abordarea este similară cu modul în care oamenii testează inegalități auxiliare înainte de a se angaja într-o inducție completă. Deși această tehnică a fost computațional scumpă, a fost gestionabilă utilizând clusterul TPU v5 al lui DeepMind.

DeepMind la IMO 2025

Pentru a menține integritatea competiției, DeepMind a înghețat greutățile modelului cu trei săptămâni înainte de IMO pentru a preveni scurgerea de probleme oficiale în setul de antrenament. De asemenea, au filtrat datele care conțineau soluții la întrebări olimpice nepublicate anterior.

În timpul competiției, Gemini Deep Think a primit cele șase probleme oficiale în format de text simplu, fără a avea acces la internet. Sistemul a funcționat pe un cluster configurat pentru a simula puterea de calcul a unui laptop standard pe proces. Întregul proces de rezolvare a problemelor a fost finalizat în mai puțin de trei ore, mult înainte de termenul limită. Demonstrațiile generate au fost trimise coordonatorilor IMO fără modificări.

Gemini Deep Think a obținut scoruri perfecte la primele cinci probleme. Ultima întrebare, care a fost o puzzle de combinatorică dificilă, a însă oprit atât inteligența artificială, cât și 94% din participanții umani. În ciuda acestui fapt, inteligența artificială a terminat cu un scor total de 35/42, asigurând o medalie de aur. Acest scor a fost cu șapte puncte mai mare decât performanța de argint din anul precedent. Observatorii au descris ulterior demonstrațiile inteligenței artificiale ca “diligente” și “complete”, notând că au urmat justificări riguroase așteptate de la concurenții umani.

Implicații pentru inteligența artificială și matematică

Realizarea lui DeepMind este un moment semnificativ atât pentru inteligența artificială, cât și pentru matematică. Pentru inteligența artificială, stăpânirea IMO este un pas către inteligența artificială generală (AGI), unde sistemele pot efectua orice sarcină intelectuală pe care o poate face un om. Rezolvarea problemelor matematice complexe necesită raționament și înțelegere, care sunt componente fundamentale ale inteligenței generale. Acest succes indică faptul că inteligența artificială face progrese către abilități cognitive mai umane.

Pentru matematică, sistemele de inteligență artificială precum Gemini Deep Think pot deveni unelte de neprețuit pentru matematicieni. Ei pot asista în explorarea de noi domenii, verificarea conjecturilor și chiar descoperirea de noi teoreme. Prin automatizarea aspectelor mai puțin interesante ale construcției demonstrațiilor, inteligența artificială eliberează matematicienii pentru a se concentra pe lucrări conceptuale de nivel superior. De asemenea, tehnicile dezvoltate pentru aceste sisteme de inteligență artificială ar putea inspira metode noi în cercetarea matematică care nu ar fi posibile prin efort uman singur.

Cu toate acestea, progresul inteligenței artificiale în matematică ridică, de asemenea, întrebări despre rolul inteligenței artificiale în setările educaționale și competițiile matematice. Pe măsură ce capacitățile inteligenței artificiale continuă să crească, vor exista dezbateri despre modul în care implicarea acesteia ar putea altera natura educației și competițiilor matematice.

Privind înainte

Câștigarea medaliei de aur la IMO este un moment semnificativ, dar multe provocări matematice rămân încă în afara sistemelor actuale de inteligență artificială. Cu toate acestea, progresul rapid de la argint la aur în doar un an subliniază ritmul accelerat al inovațiilor și dezvoltărilor în inteligența artificială. Dacă acest ritm continuă, sistemele de inteligență artificială ar putea aborda curând unele dintre cele mai faimoase probleme nerezolvate ale matematicii. În timp ce întrebarea dacă inteligența artificială va înlocui sau va îmbunătăți creativitatea umană rămâne nerezolvată, IMO 2025 este un indicator clar că inteligența artificială a făcut progrese semnificative în raționamentul logic.

Dr. Tehseen Zia este un profesor asociat titular la Universitatea COMSATS Islamabad, deținând un doctorat în IA de la Universitatea Tehnică din Viena, Austria. Specializându-se în Inteligență Artificială, Învățare Automată, Știință a Datelor și Viziune Computațională, el a făcut contribuții semnificative cu publicații în reviste științifice reputate. Dr. Tehseen a condus, de asemenea, diverse proiecte industriale ca Investigator Principal și a servit ca Consultant IA.