Modely a platformy AI

Z stříbra na zlato: Jak DeepMindův AI ovládl matematickou olympiádu

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

DeepMindův AI udělal pozoruhodný pokrok v matematickém uvažování během pouhého jednoho roku. Po získání stříbrné medaile na Mezinárodní matematické olympiádě (IMO) v roce 2024 získal jeho systém AI zlatou medaili v roce 2025. Tento rychlý pokrok zdůrazňuje rostoucí schopnosti umělé inteligence při řešení složitých, abstraktních problémů, které vyžadují lidskou kreativitu a vhled. Tento článek prochází tím, jak DeepMind dosáhl této transformace, technickými a strategickými rozhodnutími, která za tím stojí, a širšími důsledky těchto pokroků.

Význam IMO

Mezinárodní matematická olympiáda, založená v roce 1959, je celosvětově uznávaná jako přední matematická soutěž pro studenty středních škol. Každý rok se nejlepší studenti z celého světa potýkají se šesti náročnými problémy z oblasti algebry, geometrie, teorie čísel a kombinatoriky. Řešení těchto problémů vyžaduje mnohem více než pouhé výpočty; účastníci musí prokázat skutečnou matematickou kreativitu, přísné logické myšlení a schopnost konstruovat elegantní důkazy.

Pro umělou inteligenci představuje IMO jedinečnou výzvu. Zatímco AI ovládla rozpoznávání vzorců, analýzu dat a dokonce i složitých her jako Go a šachy, olympiádní matematika vyžaduje kreativní, abstraktní uvažování a syntézu nových nápadů, dovedností, které jsou tradičně považovány za znaky lidské inteligence. Jako výsledek se IMO stalo přirozeným testovacím prostorem pro hodnocení, jak blízko je AI k dosažení skutečně lidského uvažování.

Průlom stříbrné medaile v roce 2024

V roce 2024 DeepMind představil dva systémy AI pro řešení problémů na úrovni IMO: AlphaProof a AlphaGeometry 2. Oba systémy jsou příklady “neuro-symbolického” AI, kombinující sílu velkých jazykových modelů (LLM) s přísností symbolické logiky.

AlphaProof byl navržen pro důkazy matematických tvrzení pomocí Lean, formálního matematického jazyka. Kombinoval Gemini, velký jazykový model DeepMindu, s AlphaZero, který je motorem učení s posilováním známým svým úspěchem v deskových hrách. V tomto nastavení byla role Gemini přeložit přirozené jazykové problémy do Lean a pokusit se o důkazy generováním logických kroků. AlphaProof byl trénován na milionech vzorových problémů pokrývajících různé matematické disciplíny a obtížnosti. Systém se zlepšoval tím, že se pokusil dokázat stále složitější tvrzení, podobně jako AlphaZero se učil hraním her proti sobě.

AlphaGeometry 2 byl navržen pro řešení geometrických problémů. Zde umožnila jazyková znalost Gemini AI předpovědět užitečné pomocné konstrukce, zatímco symbolický rozumový motor spravoval logické dedukce. Tento hybridní přístup umožnil AlphaGeometry řešit geometrické problémy daleko za rámec tradičního strojového uvažování.

Společně tyto systémy vyřešily čtyři ze šesti problémů IMO: dva v algebře, jeden v teorii čísel a jeden v geometrii, dosáhli skóre 28 z 42. Tento výkon byl významným milníkem, protože to byla první instance, kdy AI dosáhla úrovně stříbrné medaile na IMO. Nicméně, tento úspěch silně závisel na lidských odbornících, kteří překládali problémy do formálních matematických jazyků. Také vyžadovali enormní výpočetní zdroje, které trvaly dny zpracování pro každý problém.

Technické inovace za zlatou medailí

Přechod DeepMindu ze stříbrné na zlatou medaili byl poháněn několika významnými technickými vylepšeními.

1. Přirozený jazyk jako médium pro důkazy

Nejvýznamnější změnou bylo posunutí od systémů, které vyžadovaly odborné překlady do formálních jazyků, k zacházení s přirozeným jazykem jako s médiem pro důkazy. Tento posun je dosažen pomocí vylepšené verze Gemini vybavené funkcemi Deep Think. Místo převodu problémů do Lean zpracovává model text přímo, generuje neformální náčrtky, vnitřně formalizuje kritické kroky a produkuje rafinovaný anglický důkaz. Učení s posilováním z lidské zpětné vazby (RLHF) bylo použito k odměňování řešení, která byla logicky konzistentní, stručná a prezentovaná.

Gemini Deep Think se liší od veřejné verze Gemini ve dvou hlavních směrech. První, přiděluje delší kontextové okna a více výpočetních tokenů na dotaz, což umožňuje modelu udržet vícepodstránkové řetězce myšlenek. Druhý, používá paralelní uvažování, kde se generují stovky spekulativních vláken pro různé potenciální řešení. Lehký dohlížející systém pak řadí a propaguje nejperspektivnější cesty, vypůjčuje koncepty z Monte Carlo tree search, ale aplikovaných na text. Tento přístup napodobuje, jak lidské týmy brainstormují, odmítají neproduktivní nápady a konvergují k elegantním řešením.

2. Školení a učení s posilováním

Školení Gemini Deep Think zahrnovalo jemné doladění modelu pro předpověď dalších kroků místo konečných odpovědí. K tomuto účelu byl sestaven korpus 100 000 vysoce kvalitních olympiádních a studentských soutěžních řešení. Korpus byl hlavně shromážděn z veřejných matematických fór, arXiv preprintů a studentských problémových sad. Lidské mentory přezkoumali trénovací příklady, aby filtrovali nelogické nebo neúplné důkazy. Učení s posilováním pomohlo modelu, aby se přiblížil k produkci stručných a přesných důkazů. Rané verze produkovaly příliš verbose důkazy, ale penalizace redundantních frází pomohly zkrátit výstup.

Na rozdíl od konvenčního jemného doladění, které často bojuje se vzácnými odměnami, kde je zpětná vazba binární, buď je důkaz správný nebo ne. DeepMind implementoval krok za krokem odměnový systém, kde každá ověřená sub-lemma přispívala k celkovému skóre. Tento mechanismus odměn vede Gemini, i když je kompletní důkaz vzácný. Proces školení trval tři měsíce a využil přibližně 25 milionů TPU-hodin.

3. Masivní paralelizace

Paralelizace také sehrála kritickou roli v pokroku DeepMindu ze stříbra na zlato. Každý problém generoval několik rozumových větví paralelně, se zdroji dynamicky měnícími se na perspektivnější cesty, když jiné zastavily. Tento dynamický plánování byl zvláště prospěšný pro kombinatorické problémy, které mají velké prostory řešení. Tento přístup je podobný tomu, jak lidé testují pomocné nerovnosti, než se zavážou k plné indukci. Zatímco tato technika byla výpočetně nákladná, byla zvládnutelná pomocí clusterů TPU v5 od DeepMindu.

DeepMind na IMO 2025

Aby se zachovala integrita soutěže, DeepMind zmrazil váhy modelu tři týdny před IMO, aby se zabránilo úniku oficiálních problémů do trénovací sady. Také filtrovali data obsahující řešení dříve nezveřejněných olympiádních otázek.

Během soutěže byl Gemini Deep Think poskytnut se šesti oficiálními problémy v plaintext formátu, bez přístupu k internetu. Systém fungoval na clusteru nakonfigurovaném pro simulaci výpočetní síly standardního notebooku na proces. Celý proces řešení problémů byl dokončen za méně než tři hodiny, dobře v rámci časových limitů. Vygenerované důkazy byly předloženy koordinátorům IMO bez úprav.

Gemini Deep Think získal perfektní skóre na prvních pěti problémech. Poslední otázka, která byla náročnou kombinatorickou hádankou, však zablokovala jak AI, tak 94 % lidských účastníků. Přesto AI dokončil s celkovým skóre 35/42, aby zajistil zlatou medaili. Toto skóre bylo o sedm bodů vyšší než předchozí rok výkon stříbrné medaile. Pozorovatelé později popsali důkazy AI jako “příbuzné” a “úplné”, poznamenávají, že následovaly přísné ospravedlnění, očekávané od lidských účastníků.

Důsledky pro AI a matematiku

Úspěch DeepMindu je významným milníkem pro obě AI a matematiku. Pro AI je zvládnutí IMO krokem směrem k umělé obecné inteligenci (AGI), kde systémy mohou provádět jakoukoli intelektuální úlohu, kterou může člověk. Řešení složitých matematických problémů vyžaduje uvažování a porozumění, které jsou základními složkami obecné inteligence. Tento úspěch naznačuje, že AI dělá pokroky směrem k více lidským kognitivním schopnostem.

Pro matematiku mohou systémy AI, jako je Gemini Deep Think, stát se nepostradatelnými nástroji pro matematiky. Mohou pomoci při prozkoumávání nových oblastí, ověřování konjunktur a dokonce i objevování nových teorem. Automatizací více nudných aspektů konstrukce důkazů osvobozuje AI lidské matematiky, aby se soustředili na vyšší konceptuální práci. Kromě toho mohou techniky vyvinuté pro tyto systémy AI inspirovat nové metody v matematickém výzkumu, které by nemusely být možné pouze lidským úsilím.

Nicméně, pokrok AI v matematice také vyvolává otázky o roli AI ve vzdělávacích prostředích a soutěžích. Jak se schopnosti AI budou dále rozvíjet, budou debaty o tom, jak by zapojení AI mohlo změnit povahu matematického vzdělávání a soutěže.

Pohled do budoucna

Získání zlaté medaile na IMO je významným milníkem, ale mnoho matematických výzev zůstává mimo dosah současných systémů AI. Nicméně, rychlý pokrok ze stříbra na zlato za pouhý jeden rok zdůrazňuje urychlovací tempo inovací a vývoje AI. Pokud tento tempo bude pokračovat, systémy AI mohou brzy řešit některé z nejznámějších nevyřešených matematických problémů. Zatímco otázka, zda AI nahradí nebo zvýší lidskou kreativitu, zůstává nevyřešena, IMO 2025 je jasným ukazatelem toho, že umělá inteligence učinila významné kroky v logickém uvažování.

Dr. Tehseen Zia je docent s trvalým úvazkem na COMSATS University Islamabad, držitel titulu PhD v oblasti AI z Vienna University of Technology, Rakousko. Specializuje se na umělou inteligenci, strojové učení, datové vědy a počítačové vidění, a významně přispěl publikacemi v renomovaných vědeckých časopisech. Dr. Tehseen také vedl různé průmyslové projekty jako hlavní výzkumník a působil jako konzultant pro umělou inteligenci.