Modele i platformy AI

Od srebra do złota: Jak sztuczna inteligencja DeepMind zdobyła olimpiadę matematyczną

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sztuczna inteligencja DeepMind dokonała znaczących postępów w rozumowaniu matematycznym w ciągu zaledwie jednego roku. Po zdobyciu srebrnego medalu na Międzynarodowej Olimpiadzie Matematycznej (IMO) w 2024 roku, ich system sztucznej inteligencji zdobył złoty medal w 2025 roku. Ten szybki postęp podkreśla rosnące możliwości sztucznej inteligencji w rozwiązywaniu złożonych, abstrakcyjnych problemów, które wymagają ludzkiej kreatywności i wglądu. Artykuł ten przedstawi, jak DeepMind osiągnął tę transformację, techniczne i strategiczne wybory, które ją poprzedziły, oraz szersze implikacje tych postępów.

Znaczenie IMO

Międzynarodowa Olimpiada Matematyczna, założona w 1959 roku, jest uznawana na całym świecie jako najważniejsza konkurencja matematyczna dla uczniów szkół średnich. Co roku najlepsi uczniowie z całego świata muszą rozwiązać sześć wymagających problemów z zakresu algebry, geometrii, teorii liczb i kombinatoryki. Rozwiązanie tych problemów wymaga znacznie więcej niż tylko obliczeń; uczestnicy muszą wykazać się prawdziwą matematyczną kreatywnością, ścisłym myśleniem logicznym oraz umiejętnością konstruowania eleganckich dowodów.

Dla sztucznej inteligencji IMO stanowi wyjątkowe wyzwanie. Chociaż sztuczna inteligencja opanowała rozpoznawanie wzorców, analizę danych i nawet złożone gry takie jak Go i szachy, matematyka olimpijska wymaga kreatywnego, abstrakcyjnego rozumowania oraz syntezy nowych pomysłów, umiejętności tradycyjnie uważanych za cechy inteligencji ludzkiej. W rezultacie IMO stało się naturalnym polem testowym dla oceny, jak blisko sztuczna inteligencja jest do osiągnięcia prawdziwie ludzkiego rozumowania.

Przełom srebrnego medalu w 2024 roku

W 2024 roku DeepMind wprowadziło dwa systemy sztucznej inteligencji do rozwiązywania problemów na poziomie IMO: AlphaProof i AlphaGeometry 2. Obie te systemy są przykładami “neuro-symbolicznej” sztucznej inteligencji, łączącej zalety dużych modeli językowych (LLM) z rygorem logiki symbolicznej.

AlphaProof został zaprojektowany do dowodzenia twierdzeń matematycznych przy użyciu Lean, języka matematycznego formalnego. Połączył Gemini, duży model językowy DeepMind, z AlphaZero, silnikiem uczenia wzmocnionego, znanym ze swoich sukcesów w grach planszowych. W tym ustawieniu rola Gemini polegała na tłumaczeniu problemów języka naturalnego na Lean i próbowaniu dowodów poprzez generowanie kroków logicznych. AlphaProof został przeszkolony na milionach przykładów problemów z różnych dziedzin matematyki i poziomów trudności. System udoskonalił się, próbując udowodnić coraz bardziej złożone twierdzenia, podobnie jak AlphaZero uczył się, grając w gry przeciwko sobie.

AlphaGeometry 2 został zaprojektowany do rozwiązywania problemów geometrycznych. Tutaj zrozumienie języka przez Gemini umożliwiło sztucznej inteligencji przewidywanie pomocnych konstrukcji pomocniczych, podczas gdy silnik rozumowania symbolicznego zarządzał dedukcjami logicznymi. Ten hybrydowy podejście pozwolił AlphaGeometry rozwiązać problemy geometryczne znacznie poza zakres tradycyjnego rozumowania maszynowego.

Wspólnie te systemy rozwiązały cztery z sześciu problemów IMO: dwa z algebry, jeden z teorii liczb i jeden z geometrii, osiągając wynik 28 na 42. Ten wynik był znaczącym kamieniem milowym, ponieważ był to pierwszy raz, kiedy sztuczna inteligencja osiągnęła poziom medalu srebrnego na IMO. Jednak ten sukces opierał się w dużej mierze na ekspertach ludzkich, którzy tłumaczyli problemy na języki matematyczne formalne. Wymagały również ogromnych zasobów obliczeniowych, które zajmowały dni czasu przetwarzania dla każdego problemu.

Techniczne innowacje za złotym medalem

Przejście DeepMind od srebrnego do złotego medalu zostało napędzane przez kilka znaczących ulepszeń technicznych.

1. Język naturalny jako medium dla dowodów

Najważniejszą zmianą było przejście od systemów, które wymagały tłumaczeń ekspertów na języki matematyczne formalne, do traktowania języka naturalnego jako medium dla dowodów. Ta zmiana została osiągnięta dzięki ulepszonej wersji Gemini wyposażonej w możliwości Deep Think. Zamiast konwertowania problemów na Lean, model przetwarza tekst bezpośrednio, generuje nieformalne szkice, wewnętrznie formalizuje krytyczne kroki i produkuje ulepszony angielski dowód. Uczenie wzmocnione z ludzkim sprzężeniem zwrotnym (RLHF) zostało użyte do nagradzania rozwiązań, które były logicznie spójne, krótkie i przedstawione.

Gemini Deep Think różni się od publicznej wersji Gemini w dwóch głównych ways. Po pierwsze, przydziela dłuższe okna kontekstowe i więcej tokenów obliczeniowych na zapytanie, co umożliwia modelowi utrzymanie łańcuchów myśli wielostronicowych. Po drugie, wykorzystuje równoległe rozumowanie, gdzie setki spekulatywnych wątków są generowane dla różnych potencjalnych rozwiązań. Lekki nadzorca następnie klasyfikuje i promuje najbardziej obiecujące ścieżki, pożyczając koncepcje z Monte Carlo tree search, ale stosowane do tekstu. Ten podejście naśladuje, jak zespoły ludzkie generują pomysły, odrzucają nieproduktywne idee i koncentrują się na eleganckich rozwiązaniach.

2. Trening i uczenie wzmocnione

Trening Gemini Deep Think obejmował dostosowanie modelu do przewidywania następnych kroków, a nie tylko ostatecznych odpowiedzi. W tym celu skompilowano korpus 100 000 wysokiej jakości rozwiązań olimpiady i konkursów uniwersyteckich. Korpus został głównie zebrany z publicznych forów matematycznych, preprintów arXiv i zestawów problemów college’ów. Ludzcy mentorzy przeglądali przykłady treningowe, aby filtrować nie logiczne lub niekompletne dowody. Uczenie wzmocnione pomogło udoskonalić model, kierując go ku produkcji zwięzłych i precyzyjnych dowodów. Wczesne wersje produkowały zbyt rozwlekłe dowody, ale kary za redundancje pomogły obciąć wyjście.

W przeciwieństwie do konwencjonalnego dostosowania, które często ma trudności ze rzadkimi nagrodami, gdzie sprzężenie zwrotne jest binarne, czyli dowód jest poprawny lub nie. DeepMind wdrożył system nagradzania krokowego, gdzie każdy zweryfikowany podlemat przyczyniał się do ogólnego wyniku. Ten mechanizm nagradzania kieruje Gemini, nawet gdy kompletny dowód jest rzadki. Proces treningu trwał trzy miesiące i wykorzystał około 25 milionów godzin TPU.

3. Masowa paralelizacja

Paralelizacja odegrała również kluczową rolę w postępie DeepMind od srebra do złota. Każdy problem generował wiele gałęzi rozumowania w równolegli, z zasobami dynamicznie przenoszonymi do bardziej obiecujących dróg, gdy inne zatrzymywały się. To dynamiczne planowanie było szczególnie korzystne dla problemów kombinatorycznych, które mają duże przestrzenie rozwiązań. Podejście to jest podobne do tego, jak ludzie testują nierówności pomocnicze przed zaangażowaniem się w pełną indukcję. Chociaż ta technika była obliczeniowo kosztowna, była zarządzalna przy użyciu klastrów TPU v5 DeepMind.

DeepMind na IMO 2025

Aby utrzymać integralność konkursu, DeepMind zamroził wagi modelu trzy tygodnie przed IMO, aby uniemożliwić wyciek oficjalnych problemów do zestawu treningowego. Zastosowano również filtry, aby wykluczyć dane zawierające rozwiązania wcześniej niepublikowanych pytań olimpijskich.

Podczas konkursu Gemini Deep Think otrzymał sześć oficjalnych problemów w formacie zwykłego tekstu, bez dostępu do internetu. System działał na klastrze skonfigurowanym do symulowania mocy obliczeniowej standardowego laptopa na proces. Cały proces rozwiązywania problemów został ukończony w czasie krótszym niż trzy godziny, co było w ramach limitu czasowego. Wygenerowane dowody zostały przesłane koordinatorom IMO bez zmian.

Gemini Deep Think zdobył punkty maksymalne za pierwsze pięć problemów. Ostatnie pytanie, które było wymagającą zagadką kombinatoryczną, jednakże zaskoczyło zarówno sztuczną inteligencję, jak i 94% uczestników ludzkich. Mimo to sztuczna inteligencja ukończyła z wynikiem 35/42, co dało jej złoty medal. Ten wynik był siedem punktów wyższy niż poprzedni rok wynik srebrny. Obserwatorzy później opisali dowody sztucznej inteligencji jako “sumiennie” i “kompletne”, zauważając, że podążały one za rygorystycznymi uzasadnieniami oczekiwanymi od uczestników ludzkich.

Implikacje dla sztucznej inteligencji i matematyki

Osiągnięcie DeepMind jest znaczącym kamieniem milowym zarówno dla sztucznej inteligencji, jak i matematyki. Dla sztucznej inteligencji opanowanie IMO jest krokiem w kierunku ogólnej sztucznej inteligencji (AGI), gdzie systemy mogą wykonywać każde intelektualne zadanie, które może wykonać człowiek. Rozwiązywanie złożonych problemów matematycznych wymaga rozumowania i zrozumienia, które są podstawowymi składnikami ogólnej inteligencji. Ten sukces wskazuje, że sztuczna inteligencja robi postępy w kierunku bardziej ludzkich zdolności poznawczych.

Dla matematyki systemy sztucznej inteligencji, takie jak Gemini Deep Think, mogą stać się niezwykle cennymi narzędziami dla matematyków. Mogą one pomóc w badaniu nowych obszarów, weryfikowaniu koniunktur i nawet odkrywaniu nowych twierdzeń. Automatyzując bardziej nużące aspekty konstruowania dowodów, sztuczna inteligencja uwalnia matematyków ludzkich, aby skoncentrowali się na wyższych poziomach pracy konceptualnej. Ponadto techniki opracowane dla tych systemów sztucznej inteligencji mogą zainspirować nowe metody w badaniach matematycznych, które mogą nie być możliwe dzięki samemu wysiłkowi ludzkiemu.

Jednak postęp sztucznej inteligencji w matematyce podnosi również pytania o rolę sztucznej inteligencji w środowiskach edukacyjnych i konkursach. W miarę jak zdolności sztucznej inteligencji będą nadal rosły, będą debaty na temat tego, jak jej zaangażowanie może zmienić naturę edukacji matematycznej i konkursów.

Wygładzanie

Wygranie złotego medalu IMO jest znaczącym kamieniem milowym, ale wiele matematycznych wyzwań pozostaje jeszcze poza zasięgiem obecnych systemów sztucznej inteligencji. Jednak szybki postęp od srebra do złota w ciągu zaledwie jednego roku podkreśla przyspieszony tempo innowacji i rozwoju sztucznej inteligencji. Jeśli ten tempo się utrzyma, systemy sztucznej inteligencji mogą wkrótce rozwiązać niektóre z najbardziej znanych nierozwiązanych problemów matematyki. Chociaż pytanie, czy sztuczna inteligencja zastąpi czy ulepszy ludzką kreatywność, pozostaje nierozstrzygnięte, IMO 2025 jest wyraźnym wskaźnikiem, że sztuczna inteligencja zrobiła znaczące postępy w rozumowaniu logicznym.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniósł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia również kierował różnymi projektami przemysłowymi jako główny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.