AI-modeller og plattformer
Fra sÃļlv til gull: Hvordan DeepMinds AI erobret matematikkoordinatet

DeepMinds AI har gjort bemerkelsesverdige fremskritt i matematisk resonnering innen ett ÃĨr. Etter ÃĨ ha vunnet en sÃļlvmedalje ved Den internasjonale matematikkolympiaden (IMO) i 2024, vant deres AI-system en gullmedalje i 2025. Denne raske fremgangen understreker de voksende evnene til kunstig intelligens i ÃĨ takle komplekse, abstrakte problemer som krever menneskelignende kreativitet og innsikt. Denne artikkelen vil gÃĨ gjennom hvordan DeepMind oppnÃĨdde denne transformasjonen, de tekniske og strategiske valgene bak det, og de videre implikasjonene av disse fremgangene.
Betydningen av IMO
Den internasjonale matematikkolympiaden, etablert i 1959, er anerkjent globalt som den fremste matematikkonkurransen for videregÃĨende skoleelever. Hvert ÃĨr mÃļter toppstudenter fra hele verden seks utfordrende problemer innen algebra, geometri, tallteori og kombinatorikk. Ã lÃļse disse problemene krever mye mer enn beregning; deltakerne mÃĨ vise ekte matematisk kreativitet, streng logisk tenkning og evnen til ÃĨ konstruere elegante bevis.
For kunstig intelligens presenterer IMO en unik utfordring. Mens AI har mestret mÃļnstergjenkjenning, dataanalyse og sogar komplekse spill som Go og sjakk, krever olympiadematematikk kreative, abstrakte resonnering og syntese av nye ideer, ferdigheter som tradisjonelt anses ÃĨ vÃĶre kjennetegn pÃĨ menneskelig intelligens. Derfor har IMO blitt en naturlig testbed for ÃĨ vurdere hvor nÃĶre AI er ÃĨ oppnÃĨ virkelig menneskelignende resonnering.
SÃļlvmedalje-gjennombruddet i 2024
I 2024 introduserte DeepMind to AI-systemer for ÃĨ takle IMO-nivÃĨproblemer: AlphaProof og AlphaGeometry 2. Begge systemer er eksempler pÃĨ âneuro-symboliskâ AI, som kombinerer styrkene til store sprÃĨkmodeller (LLM) med rigor til symbolisk logikk.
AlphaProof ble designet for ÃĨ bevise matematiske utsagn ved hjelp av Lean, et formelt matematisk sprÃĨk. Det kombinerte Gemini, DeepMinds store sprÃĨkmodell, med AlphaZero, som er en forsterkingslÃĶringssmotor kjent for sin suksess i brettspill. I denne sammenhengen var Geminiâs rolle ÃĨ oversette naturlige sprÃĨkproblemer til Lean og forsÃļke ÃĨ bevise logiske skritt. AlphaProof ble trent pÃĨ millioner av eksempler pÃĨ problemer som spenner over ulike matematiske disipliner og vanskelighetsgrader. Systemet forbedret seg selv ved ÃĨ prÃļve ÃĨ bevise stadig mer komplekse utsagn, likt hvordan AlphaZero lÃĶrte ved ÃĨ spille spill mot seg selv.
AlphaGeometry 2 ble designet for ÃĨ lÃļse geometriproblemer. Her enablede Geminiâs sprÃĨkforstÃĨelse AI-en ÃĨ forutsi nyttige hjelpekonstruksjoner, mens en symbolisk resoneringssmotor hÃĨndterte logiske deduksjoner. Denne hybride tilnÃĶrmingen tillot AlphaGeometry ÃĨ takle geometriske problemer langt utenfor rekkevidden av tradisjonell maskinresonnering.
Sammen lÃļste disse systemene fire av seks IMO-problemer: to i algebra, ett i tallteori og ett i geometri, og oppnÃĨdde en poengsum pÃĨ 28 av 42. Denne prestasjonen var et betydelig milepÃĶl, da det var fÃļrste gang en AI hadde nÃĨdd sÃļlvmedaljenivÃĨet ved IMO. Imidlertid var denne suksessen sterkt avhengig av menneskelige eksperter for ÃĨ oversette problemer til formelle matematiske sprÃĨk. De krevde ogsÃĨ massive beregningsressurser, som tok dager med prosesseringstid for hvert problem.
Tekniske innovasjoner bak gullmedaljen
DeepMinds overgang fra en sÃļlv til en gullmedalje var drevet av flere betydelige tekniske forbedringer.
1. Naturlig sprÃĨk som medium for bevis
Den mest betydelige endringen var ÃĨ gÃĨ fra systemer som krevde ekspertoversettelser til formelle sprÃĨk til ÃĨ behandle naturlig sprÃĨk som medium for bevis. Denne endringen ble oppnÃĨdd gjennom en forbedret versjon av Gemini utstyrt med Deep Think-kapasiteter. I stedet for ÃĨ konvertere problemer til Lean, prosesserer modellen teksten direkte, genererer uformelle skisser, internt formaliserer kritiske skritt og produserer en raffinert engelsk bevis. ForsterkingslÃĶring fra menneskelig tilbakemelding (RLHF) ble brukt til ÃĨ belÃļnne lÃļsninger som var logisk konsistente, korte og presenterte.
Gemini Deep Think skiller seg fra den offentlige versjonen av Gemini pÃĨ to mÃĨter. FÃļrst allokerer den lengre kontekstvinduer og flere beregningsToken per forespÃļrsel, noe som muliggjÃļr at modellen kan opprettholde multi-sidige tanker. For det andre bruker den parallell resonnering, der hundrevis av spekulative trÃĨder genereres for ulike potensielle lÃļsninger. En lett tilsynshaver rangerer og fremmer deretter de mest lovende stier, lÃĨner konsepter fra Monte Carlo-trÃĶrÃļkning, men anvendt pÃĨ tekst. Denne tilnÃĶrmingen ligner hvordan menneskelige team brainstormer, forkaster uproduktive ideer og konvergerer mot elegante lÃļsninger.
2. Trening og forsterkingslÃĶring
Trening av Gemini Deep Think innebar finjustering av modellen for ÃĨ forutsi neste skritt i stedet for endelige svar. For dette formÃĨlet ble en korpus pÃĨ 100 000 hÃļykvalitets IMO- og universitetskonkurranselÃļsninger samlet inn. Korpuset ble hovedsakelig samlet fra offentlige matematikkforum, arXiv-preprint og collegeproblemer. Menneskelige mentorer gjennomgikk trenings eksempler for ÃĨ filtrere illogiske eller ufullstendige bevis. ForsterkingslÃĶring hjalp til ÃĨ finjustere modellen, som ble presset mot ÃĨ produsere konsise og presise bevis. Tidlige versjoner produserte overordnet verbale bevis, men straffer pÃĨ redundante fraser hjalp til ÃĨ kutte uttaket.
I motsetning til konvensjonell finjustering, som ofte sliter med sparsomme belÃļnninger hvor tilbakemelding er binÃĶr, enten er beviset riktig eller ikke. DeepMind implementerte et trinnvis belÃļnningsystem, der hver verifisert underlemma bidro til den totale poengsummen. Denne belÃļnningsmekanismen guider Gemini, selv nÃĨr fullstendig bevis er sjeldent. Treningprosessen varte i tre mÃĨneder og brukte omtrent 25 millioner TPU-timer.
3. Massiv parallellisering
Parallellisering spilte ogsÃĨ en kritisk rolle i DeepMinds fremgang fra sÃļlv til gull. Hvert problem genererte flere resonanser i parallell, med ressurser som dynamisk skiftet til mer lÃļftende veier nÃĨr andre stanset. Denne dynamiske planleggingen var spesielt gunstig for kombinatoriske problemer, som har store lÃļsningsrom. TilnÃĶrmingen er lik hvordan mennesker tester hjelpeulikheter fÃļr de begynner en full induksjon. Selv om denne teknikken var beregningskrevende, var den hÃĨndterbar ved hjelp av DeepMinds TPU v5-kluster.
DeepMind ved IMO 2025
For ÃĨ opprettholde integriteten til konkurransen, frÃļs DeepMind vekterne til modellen tre uker fÃļr IMO for ÃĨ forhindre at offisielle problemer kom inn i treningssettet. De filtrerte ogsÃĨ ut data som inneholdt lÃļsninger pÃĨ tidligere upubliserte olympiadeproblemer.
Under konkurransen fikk Gemini Deep Think de seks offisielle problemene i ren tekstformat, uten ÃĨ gi tilgang til internettet. Systemet opererte pÃĨ et kluster konfigurert for ÃĨ simulere beregningskraften til en standard bÃĶrbar datamaskin per prosess. Hele problem-lÃļsingsprosessen ble fullfÃļrt pÃĨ mindre enn tre timer, godt innenfor tidsbegrensningene. De genererte bevisene ble sendt til IMO-koordinatorerne uten endringer.
Gemini Deep Think oppnÃĨdde full poeng pÃĨ de fem fÃļrste problemene. Det siste spÃļrsmÃĨlet, som var et utfordrende kombinatorisk puslespill, stumpet imidlertid bÃĨde AI og 94% av menneskelige deltakere. Til tross for dette fullfÃļrte AI-en med en total poengsum pÃĨ 35/42 og sikret en gullmedalje. Denne poengsummen var syv poeng hÃļyere enn ÃĨrets tidligere sÃļlvprestasjon. ObservatÃļrer beskrev senere AI-ens bevis som âflittigeâ og âfullstendigeâ, og noterte at de fulgte de strenge rettferdiggjÃļringene som forventes av menneskelige deltakere.
Implikasjoner for AI og matematikk
DeepMinds prestasjon er et betydelig milepÃĶl for bÃĨde AI og matematikk. For AI er ÃĨ mestre IMO et skritt mot kunstig generell intelligens (AGI), der systemer kan utfÃļre enhver intellektuell oppgave som et menneske kan. Ã lÃļse komplekse matematiske problemer krever resonnering og forstÃĨelse, som er grunnleggende komponenter i generell intelligens. Denne suksessen indikerer at AI gjÃļr fremskritt mot mer menneskelignende kognitive evner.
For matematikk kan AI-systemer som Gemini Deep Think bli uvurderlige verktÃļy for matematikere. De kan assistere i ÃĨ utforske nye omrÃĨder, verifisere antagelser og sogar oppdage nye teorier. Ved ÃĨ automatisere de mer kjedelige aspektene av beviskonstruksjon, frigjÃļr AI menneskelige matematikere til ÃĨ fokusere pÃĨ hÃļyere konseptuell arbeid. I tillegg kan teknikken som er utviklet for disse AI-systemene inspirere nye metoder i matematisk forskning som kanskje ikke er mulig gjennom menneskelig innsats alene.
Imidlertid setter AI-ens fremgang i matematikk ogsÃĨ spÃļrsmÃĨl om AI-ens rolle i utdanningsinstilling og konkurranser. Ettersom AI-ens evner fortsetter ÃĨ vokse, vil det vÃĶre debatter om hvordan AI-ens involvering kan endre naturen til matematisk utdanning og konkurranse.
Se fremover
à vinne IMO-gull er et betydelig milepÃĶl, men mange matematiske utfordringer ligger fortsatt utenfor rekkevidde for nÃĨvÃĶrende AI-systemer. Imidlertid understreker den raske fremgangen fra sÃļlv til gull pÃĨ bare ett ÃĨr den akselererende takten i AI-innovasjoner og -utviklinger. Hvis denne takten fortsetter, kan AI-systemer snart takle noen av matematikkens mest berÃļmte ulÃļste problemer. Mens spÃļrsmÃĨlet om hvorvidt AI vil erstatte eller forbedre menneskelig kreativitet fortsatt er ulÃļst, er IMO 2025 et tydelig tegn pÃĨ at kunstig intelligens har gjort betydelige fremskritt i logisk resonnering. ments. Hvis denne takten fortsetter, kan AI-systemer snart takle noen av matematikkens mest berÃļmte ulÃļste problemer. Mens spÃļrsmÃĨlet om hvorvidt AI vil erstatte eller forbedre menneskelig kreativitet fortsatt er ulÃļst, er IMO 2025 et tydelig tegn pÃĨ at kunstig intelligens har gjort betydelige fremskritt i logisk resonnering.












