AI-modeller och plattformar

DeepSeek-Prover-V2: Brygga gapet mellan informell och formell matematisk resonemang

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Medan DeepSeek-R1 har avsevärt förbättrat AI:s förmåga i informell resonemang, har formell matematisk resonemang förblivit en utmanande uppgift för AI. Detta beror främst på att produktion av bevisbara matematiska bevis kräver både djup konceptuell förståelse och förmåga att konstruera precisa, steg-för-steg logiska argument. Nyligen har dock en betydande utveckling skett i denna riktning, eftersom forskare på DeepSeek-AI har introducerat DeepSeek-Prover-V2, en open-source AI-modell som kan omvandla matematisk intuition till rigorösa, bevisbara bevis. Den här artikeln kommer att gå in på detaljerna om DeepSeek-Prover-V2 och undersöka dess potentiella påverkan på framtida vetenskaplig upptäckt.

Utmaningen med formell matematisk resonemang

Matematiker löser ofta problem med hjälp av intuition, heuristik och högnivåresonemang. Detta tillvägagångssätt låter dem hoppa över steg som verkar uppenbara eller förlita sig på approximationer som är tillräckliga för deras behov. Formell bevisföring kräver dock en annan tillvägagångssätt. Den kräver fullständig precision, med varje steg explicit uttryckt och logiskt motiverat utan någon tvetydighet.

De senaste framstegen inom stora språkmodeller (LLM) har visat att de kan hantera komplexa, tävlingssnivåmatematiska problem med hjälp av naturligt språkresonemang. Trots dessa framsteg kämpar LLM fortfarande med att omvandla intuitivt resonemang till formella bevis som maskiner kan verifiera. Detta beror främst på att informellt resonemang ofta innehåller genvägar och utelämnade steg som formella system inte kan verifiera.

DeepSeek-Prover-V2 löser detta problem genom att kombinera styrkorna hos informellt och formellt resonemang. Den bryter ner komplexa problem i mindre, hanterbara delar samtidigt som den upprätthåller den precision som krävs för formell verifikation. Detta tillvägagångssätt gör det lättare att överbrygga gapet mellan mänsklig intuition och maskinverifierade bevis.

En ny tillvägagångssätt för bevisföring

I princip använder DeepSeek-Prover-V2 en unik dataprocesseringspipeline som involverar både informellt och formellt resonemang. Pipelinen börjar med DeepSeek-V3, en allmän språkmodell, som analyserar matematiska problem på naturligt språk, bryter ner dem i mindre steg och översätter dessa steg till formellt språk som maskiner kan förstå.

I stället för att försöka lösa hela problemet på en gång, bryter systemet ner det i en serie “submål” – mellanlemmar som fungerar som stegstenar mot det slutliga beviset. Detta tillvägagångssätt återger hur mänskliga matematiker hanterar svåra problem, genom att arbeta med hanterbara bitar i stället för att försöka lösa allt på en gång.

Vad som gör detta tillvägagångssätt särskilt innovativt är hur det syntetiserar träningsdata. När alla submål för ett komplext problem är lösta, kombinerar systemet dessa lösningar till ett komplett formellt bevis. Detta bevis paras sedan med DeepSeek-V3:s ursprungliga kedja-av-tankar-resonemang för att skapa högkvalitativ “kall-start”-träningsdata för modellträning.

Reinforcement Learning för matematiskt resonemang

Efter den initiala träningen på syntetisk data använder DeepSeek-Prover-V2 reinforcement learning för att ytterligare förbättra sina förmågor. Modellen får feedback på om dess lösningar är korrekta eller inte, och den använder denna feedback för att lära sig vilka tillvägagångssätt som fungerar bäst.

En av utmaningarna här är att strukturen på de genererade bevisen inte alltid stämmer överens med lemmadecompositionen som föreslås av kedja-av-tankar. För att lösa detta inkluderade forskarna en konsekvensbelöning i träningsstadierna för att minska strukturell misalignment och säkerställa att alla nedbrutna lemmor ingår i de slutliga bevisen. Detta tillvägagångssätt har visat sig vara särskilt effektivt för komplexa satser som kräver flerstegsresonemang.

Prestanda och realvärldskapacitet

DeepSeek-Prover-V2:s prestanda på etablerade benchmarktest visar dess exceptionella förmågor. Modellen uppnår imponerande resultat på MiniF2F-test-benchmark och löser framgångsrikt 49 av 658 problem från PutnamBench – en samling problem från den prestigefyllda William Lowell Putnam Mathematical Competition.

Kanske ännu mer imponerande är att, när den utvärderas på 15 utvalda problem från nyliga American Invitational Mathematics Examination (AIME)-tävlingar, modellen löser framgångsrikt 6 problem. Det är också intressant att notera att, i jämförelse med DeepSeek-Prover-V2, DeepSeek-V3 löser 8 av dessa problem med hjälp av majoritetsröstning. Detta tyder på att gapet mellan formell och informell matematisk resonemang snabbt minskar i LLM. Men modellens prestanda på kombinatoriska problem kräver fortfarande förbättring, vilket lyfter fram ett område där framtida forskning kan fokusera.

ProverBench: En ny benchmark för AI i matematik

DeepSeek-forskare introducerade också en ny benchmarkdatamängd för att utvärdera den matematiska problemslösningsförmågan hos LLM. Denna benchmark, som heter ProverBench, består av 325 formaliserade matematiska problem, inklusive 15 problem från nyliga AIME-tävlingar, samt problem från läroböcker och utbildningstutorier. Dessa problem täcker områden som talteori, algebra, kalkyl, reell analys och mer. Införandet av AIME-problem är särskilt viktigt eftersom det utvärderar modellen på problem som kräver inte bara kunskapsåterkallande utan också kreativt problemslövande.

Öppen källkodstillgång och framtida implikationer

DeepSeek-Prover-V2 erbjuder en spännande möjlighet med sin öppna källkodstillgång. Värd på plattformar som Hugging Face, är modellen tillgänglig för en bred användargrupp, inklusive forskare, utbildare och utvecklare. Med både en mer lättviktig 7-miljardersparametrarversion och en kraftfull 671-miljardersparametrarversion, säkerställer DeepSeek-forskare att användare med varierande beräkningsresurser fortfarande kan dra nytta av den. Denna öppna tillgång uppmuntrar experiment och möjliggör för utvecklare att skapa avancerade AI-verktyg för matematiskt problemslövande. Som ett resultat har denna modell potentialen att driva innovation inom matematisk forskning, vilket möjliggör för forskare att hantera komplexa problem och upptäcka nya insikter inom området.

Implikationer för AI och matematisk forskning

Utvecklingen av DeepSeek-Prover-V2 har betydande implikationer inte bara för matematisk forskning utan också för AI. Modellens förmåga att generera formella bevis kan assistera matematiker i att lösa svåra satser, automatisera verifikationsprocesser och till och med föreslå nya antaganden. Dessutom kan de tekniker som används för att skapa DeepSeek-Prover-V2 påverka utvecklingen av framtida AI-modeller inom andra områden som förlitar sig på rigoröst logiskt resonemang, såsom programvaru- och maskinvaruutveckling.

Forskarna syftar till att skala upp modellen för att hantera ännu mer utmanande problem, såsom de som finns på Internationella matematikolympiaden (IMO)-nivå. Detta kan ytterligare förbättra AI:s förmåga att bevisa matematiska satser. När modeller som DeepSeek-Prover-V2 fortsätter att utvecklas, kan de omdefiniera framtiden för både matematik och AI, vilket driver framsteg inom områden som sträcker sig från teoretisk forskning till praktiska tillämpningar inom teknologi.

Sammanfattning

DeepSeek-Prover-V2 är en betydande utveckling inom AI-drivet matematiskt resonemang. Den kombinerar informell intuition med formell logik för att bryta ner komplexa problem och generera bevisbara bevis. Dess imponerande prestanda på benchmarktest visar dess potential att stödja matematiker, automatisera bevisverifikation och till och med driva nya upptäckter inom området. Som en open-source-modell är den tillgänglig för en bred användargrupp, vilket erbjuder spännande möjligheter för innovation och nya tillämpningar inom både AI och matematik.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.