AI-modeller og platforme

Fra Sølv til Guld: Hvordan DeepMinds AI Erobrede Matematikolympiaden

mm
Føj Unite.AI til dine foretrukne kilder på Google

DeepMinds AI har gjort bemærkelsesværdige fremskridt i matematisk resonnering inden for blot et år. Efter at have vundet en sølvmedalje ved Den Internationale Matematikolympiade (IMO) i 2024, vandt deres AI-system en guldmedalje i 2025. Denne hurtige fremgang understreger de voksende evner i kunstig intelligens til at tackle komplekse, abstrakte problemer, der kræver menneske-lignende kreativitet og indsigt. Denne artikel vil gå igennem, hvordan DeepMind opnåede denne transformation, de tekniske og strategiske valg bagved, og de bredere implikationer af disse fremskridt.

Betydningen af IMO

Den Internationale Matematikolympiade, der blev etableret i 1959, anerkendes globalt som den førende matematikkonkurrence for gymnasieelever. Hvert år står top-elever fra hele verden over for seks udfordrende problemer inden for algebra, geometri, talteori og kombinatorik. At løse disse problemer kræver meget mere end beregning; deltagerne må vise rigtig matematisk kreativitet, streng logisk tænkning og evnen til at konstruere elegante beviser.

For kunstig intelligens præsenterer IMO en unik udfordring. Mens AI har mestret mønstergenkendelse, dataanalyse og endda komplekse spil som Go og skak, kræver olympiadematematik kreative, abstrakte resonnering og syntese af nye ideer, færdigheder, der traditionelt anses for at være kendetegn for menneskelig intelligens. Derfor er IMO blevet en naturlig test af, hvor tæt AI er på at opnå rigtig menneske-lignende resonnering.

Sølvmedalje-gennembruddet i 2024

I 2024 introducerede DeepMind to AI-systemer til at tackle IMO-niveau-problemer: AlphaProof og AlphaGeometry 2. Begge systemer er eksempler på “neuro-symbolisk” AI, der kombinerer styrkerne fra store sprogmodeller (LLM’er) med rigor af symbolisk logik.

AlphaProof var designed til at bevise matematiske udsagn ved hjælp af Lean, et formelt matematisk sprog. Det kombinerede Gemini, DeepMinds store sprogmodel, med AlphaZero, der er en forstærkning-læringsmotor kendt for sin succes i brætspil. I denne sammenhæng var Gemini’s rol at oversætte naturlige sprog-problemer til Lean og forsøge beviser ved at generere logiske trin. AlphaProof blev trænet på millioner af eksempler på problemer, der spændte over forskellige matematiske discipliner og sværhedsgrader. Systemet forbedrede sig selv ved at forsøge at bevise stadig mere komplekse udsagn, ligesom AlphaZero lærte ved at spille spil mod sig selv.

AlphaGeometry 2 var designed til at løse geometri-problemer. Her enablede Gemini’s sprogforståelse AI’en til at forudsige nyttige hjælpekonstruktioner, mens en symbolisk resonans-motor håndterede de logiske slutninger. Denne hybride tilgang tillod AlphaGeometry at tackle geometri-problemer langt ud over traditionel maskin-resonans.

Sammen løste disse systemer fire af seks IMO-problemer: to i algebra, en i talteori og en i geometri, og opnåede en score på 28 af 42. Denne præstation var en betydelig milepæl, da det var første gang, en AI havde opnået sølvmedalje-niveauet ved IMO. Men denne succes afhang stærkt af menneskelige eksperter til at oversætte problemer til formelle matematiske sprog. De krævede også massive beregningsressourcer, der tog dage af behandlingstid for hvert problem.

Tekniske Innovationer Bag Guldmedaljen

DeepMinds overgang fra en sølv til en guldmedalje-præstation blev drevet af flere betydelige tekniske forbedringer.

1. Naturligt Sprog som Medium for Beviser

Den mest betydelige ændring var skiftet fra systemer, der krævede ekspert-oversættelser til formelle sprog, til at behandle naturligt sprog som medium for beviser. Dette skift blev opnået gennem en forbedret version af Gemini udstyret med Deep Think-kapaciteter. I stedet for at konvertere problemer til Lean, behandler modellen teksten direkte, genererer uformelle skitser, internt formaliserer kritiske trin og producerer en raffineret engelsk bevis. Forstærkning-læring fra menneske-ligt feedback (RLHF) blev brugt til at belønne løsninger, der var logisk konsistente, korte og præsenterede.

Gemini Deep Think adskiller sig fra den offentlige version af Gemini på to måder. Først allokerer den længere kontekst-vinduer og flere beregnings-token per forespørgsel, hvilket tillader modellen at opretholde multi-side-kæder af tanker. Anden bruger den parallel resonans, hvor hundredvis af spekulative tråde genereres for forskellige potentielle løsninger. En let tilsynsfører rangerer og fremmer derefter de mest lovende stier, låner koncepter fra Monte Carlo-træsøgning men anvendt på tekst. Denne tilgang efterligner, hvordan menneskelige hold brainstormer, forkaster uproduktive ideer og konvergerer på elegante løsninger.

2. Træning og Forstærkning-læring

Træning af Gemini Deep Think involverede fin-justering af modellen til at forudsige næste trin i stedet for endelige svar. Til dette formål blev en samling af 100.000 høj-kvalitets-olympiade- og universitetskonkurrence-løsninger samlet. Samlingen blev hovedsagelig indsamlet fra offentlige matematik-fora, arXiv-preprints og college-problemsæt. Menneskelige mentorer gennemgik trænings-eksempler for at filtrere illogiske eller ufuldstændige beviser. Forstærkning-læring hjalp med at raffinere modellen, skubbede den mod at producere korte og præcise beviser. Tidlige versioner producerede overordentligt verbale beviser, men straffe på redundante fraser hjalp med at trimme outputtet.

I modsætning til konventionel fin-justering, der ofte kæmper med sparsomme belønninger, hvor feedback er binært, enten er beviset korrekt eller ej. DeepMind implementerede et trinvis belønnings-system, hvor hver verificeret under-lemma bidrog til den samlede score. Denne belønnings-mekanisme guider Gemini, selv når fuldt bevis er sjældent. Træningsprocessen strakte sig over tre måneder og anvendte ca. 25 millioner TPU-timer.

3. Massiv Parallelisering

Parallelisering spillede også en kritisk rolle i DeepMinds fremgang fra sølv til guld. Hvert problem genererede multiple resonans-grene i parallel, med ressourcer, der dynamisk skiftede til mere lovende veje, når andre stalled. Denne dynamiske planlægning var særligt fordelagtig for kombinatorik-problemer, der har store løsningsrum. Tilgangen ligner, hvordan mennesker tester hjælpe-uldigheder, før de engagerer sig i en fuld induktion. Selv om denne teknik var beregnings-mæssigt dyrt, var det håndterbart ved hjælp af DeepMinds TPU v5-kluster.

DeepMind ved IMO 2025

For at opretholde integriteten af konkurrencen, fryste DeepMind vægtene af modellen tre uger før IMO for at forhindre lækkage af officielle problemer ind i træningssættet. De filtrerede også data, der indeholdt løsninger til tidligere upublicerede olympiade-spørgsmål.

Under konkurrencen blev Gemini Deep Think præsenteret med de seks officielle problemer i ren tekst-format, uden adgang til internettet. Systemet opererede på en cluster konfigureret til at simulere beregningskraften af en standard-laptop per proces. Hele problem-løsningsprocessen blev afsluttet på under tre timer, langt inden for tidsbegrænsningerne. De genererede beviser blev indsendt til IMO-koordinatorerne uden ændringer.

Gemini Deep Think opnåede perfekte score på de første fem problemer. Det sidste spørgsmål, der var et udfordrende kombinatorik-puslespil, standsede dog både AI og 94% af menneskelige deltagere. Trods dette afsluttede AI’en med en samlet score på 35/42 og sikrede en guldmedalje. Denne score var syv point højere end sidste års sølv-præstation. Observatører beskrev senere AI’ens beviser som ‘omhyggelige’ og ‘komplette’, noterede, at de fulgte de strenge begrundelser, der forventedes af menneskelige deltagere.

Implikationer for AI og Matematik

DeepMinds præstation er en betydelig milepæl for både AI og matematik. For AI er at mestre IMO et skridt mod kunstig generel intelligens (AGI), hvor systemer kan udføre enhver intellektuel opgave, som et menneske kan. At løse komplekse matematiske problemer kræver resonans og forståelse, der er grundlæggende komponenter af generel intelligens. Denne succes indikerer, at AI er på vej mod mere menneske-lignende kognitive evner.

For matematik kan AI-systemer som Gemini Deep Think blive uvurderlige værktøjer for matematikere. De kan hjælpe med at udforske nye områder, verificere formodninger og endda opdage nye teorier. Ved at automatisere de mere kedelige aspekter af bevis-konstruktion frigør AI menneskelige matematikere til at fokusere på højere-niveau-konceptuel arbejde. Derudover kan de teknikker, der er udviklet til disse AI-systemer, inspirere nye metoder i matematisk forskning, der måske ikke er muligt gennem menneskeligt arbejde alene.

Men fremgangen i AI i matematik rejser også spørgsmål om AI’s rolle i uddannelses-miljøer og konkurrencer. Da AI’s evner fortsætter med at vokse, vil der være debatter om, hvordan AI’s involvering kan ændre naturen af matematisk uddannelse og konkurrence.

Fremadrettet

At vinde IMO-guld er en betydelig milepæl, men mange matematiske udfordringer ligger stadig uden for rækkevidde for nuværende AI-systemer. Men den hurtige fremgang fra sølv til guld på blot et år understreger den accelererende pace af AI-innovationer og udviklinger. Hvis denne pace fortsætter, kan AI-systemer snart tackle nogle af matematikens mest berømte uløste problemer. Mens spørgsmålet om, hvorvidt AI vil erstatte eller forbedre menneskelig kreativitet, forbliver uløst, er IMO 2025 en klar indikation af, at kunstig intelligens har gjort betydelige skridt i logisk resonans.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.