AI-modeller og platforme

AI som forsker: Første peer-reviewed forskningsartikel skrevet uden menneskelig indgriben

mm
Føj Unite.AI til dine foretrukne kilder på Google

Kunstig intelligens har overskredet endnu en betydelig milepæl, der udfordrer vores forståelse af, hvad maskiner kan opnå uafhængigt. For første gang i videnskabelig historie har et AI-system skrevet en komplet forskningsartikel, der er blevet godkendt af en akademisk konference uden nogen menneskelig hjælp i skriveprocessen. Dette gennembrud kan være en grundlæggende ændring i, hvordan videnskabelig forskning kan blive udført i fremtiden.

Historisk præstation

En artikel produceret af The AI Scientist-v2 er blevet godkendt af en workshop på en top international AI-konference. Forskningen blev indsendt til en ICLR 2025-workshop, som er en af de mest prestigefyldte venueer i maskinlæring. Artiklen blev genereret af en forbedret version af den originale AI Scientist, kaldet The AI Scientist-v2.

Den accepterede artikel, med titlen “Compositional Regularization: Uventede hindringer i forbedring af neurale netværks generalisering“, fik imponerende score fra menneskelige anmeldere. Af de tre artikler, der blev indsendt til anmeldelse, fik en af dem en score, der lå over accepteringsgrænsen. Dette gennembrud er en betydelig fremgang, da AI nu kan deltage i den grundlæggende proces for videnskabelig opdagelse, som har været eksklusivt menneskelig i århundreder.

Forskningsholdet fra Sakana AI, der arbejdede sammen med samarbejdspartnere fra University of British Columbia og University of Oxford, udførte dette eksperiment. De fik institutionel godkendelse og arbejdede direkte med ICLR-konferencearrangørerne for at sikre, at eksperimentet fulgte de rigtige videnskabelige protokoller.

How The AI Scientist-v2 fungerer

The AI Scientist-v2 har opnået denne succes på grund af flere store fremskridt i forhold til sin forgænger. I modsætning til sin forgænger eliminerer AI Scientist-v2 behovet for menneskeskrevne kode-skabeloner, kan arbejde på tværs af diverse maskinlæringsdomæner og anvender en træ-søge-metode til at udforske multiple forskningsretninger samtidigt.

Systemet fungerer gennem en slut til slut-proces, der spejler, hvordan menneskelige forskere arbejder. Det begynder med at formulerer videnskabelige hypoteser baseret på det forskningsdomæne, det er tildelt til at udforske. AI’en designer derefter eksperimenter for at teste disse hypoteser, skriver den nødvendige kode for at udføre eksperimenterne og udfører dem automatisk.

Hvad der gør dette system særligt avanceret, er dets brug af agens-træ-søge-metode. Denne tilgang tillader AI’en at udforske multiple forskningsretninger samtidigt, ligesom menneskelige forskere måske ville overveje forskellige tilgange til at løse et problem. Dette indebærer at køre eksperimenter via agens-træ-søge, analysere resultater og generere en artikeludkast. En dedikeret eksperiment-manager-agent koordinerer hele processen for at sikre, at forskningen forbliver fokuseret og produktiv.

Systemet inkluderer også en forbedret AI-anmelder-komponent, der bruger vision-language-modeller til at give feedback på både indhold og visuel præsentation af forskningsresultater. Dette skaber en iterativ forbedringsproces, hvor AI’en kan forbedre sit eget arbejde baseret på feedback, ligesom menneskelige forskere forbedrer deres manuskripter baseret på kollega-indput.

Hvad gjorde denne forskningsartikel særlig

Den accepterede artikel fokuserede på et udfordrende problem i maskinlæring kaldet compositional generalization. Dette refererer til evnen af neurale netværk til at forstå og anvende lært koncepter i nye kombinationer, de aldrig har set før. The AI Scientist-v2 undersøgte nye regulariseringsmetoder, der måske kan forbedre denne evne.

Interessant nok rapporterede artiklen også negative resultater. AI’en opdagede, at visse tilgange, den havde hypoteser ville forbedre neuralt netværkspræstation, faktisk skabte uventede hindringer. I videnskab er negative resultater værdifulde, fordi de forhinder andre forskere i at følge uproduktive veje og bidrager til vores forståelse af, hvad der ikke virker.

Forskningen fulgte strenge videnskabelige standarder igennem hele processen. The AI Scientist-v2 udførte multiple eksperimentelle kørsler for at sikre statistisk gyldighed, skabte klare visualiseringer af sine resultater og citerede korrekt relevante tidligere arbejde. Det formaterede hele manuskriptet i overensstemmelse med akademiske standarder og skrev omfattende diskussioner af sin metode og resultater.

De menneskelige forskere, der overvågede projektet, udførte deres egen grundige gennemgang af alle tre genererede artikler. De fandt, at selv om den accepterede artikel var af workshop-kvalitet, indeholdt den nogle tekniske problemer, der ville forhindre accept ved hovedkonferencens spor. Denne ærlige vurdering demonstrerer de nuværende begrænsninger, mens den samtidig anerkender den betydelige fremgang, der er opnået.

Tekniske evner og forbedringer

The AI Scientist-v2 demonstrerer flere bemærkelsesværdige tekniske evner, der adskiller det fra tidligere automatiserede forskningssystemer. Systemet kan arbejde på tværs af diverse maskinlæringsdomæner uden at kræve forhåndsdefinerede kode-skabeloner. Denne fleksibilitet betyder, at det kan tilpasse sig til nye forskningsområder og generere originale eksperimentelle tilgange i stedet for at følge forudbestemte mønstre.

Træ-søge-metoden er en betydelig innovation i AI-forskningautomatisering. I stedet for at følge en enkelt forskningsretning kan systemet opretholde multiple hypoteser samtidigt og allokerer computermæssige ressourcer baseret på den løfte, hver retning viser. Denne tilgang spejler, hvordan erfarne menneskelige forskere ofte opretholder flere forskningstråde, mens de fokuserer mest på de mest lovende veje.

En anden afgørende forbedring er integrationen af vision-language-modeller til at gennemgå og forbedre de visuelle elementer af forskningsartikler. Videnskabelige figurer og visualiseringer er afgørende for at kommunikere forskningsresultater effektivt. AI’en kan nu evaluere og forbedre sine egne data-visualiseringer iterativt.

Systemet demonstrerer også en forståelse for videnskabelige skrivekonventioner. Det strukturerer artikler med passende afsnit, opretholder konsistent terminologi igennem manuskripter og skaber en logisk flow mellem forskellige dele af forskningsnarrativen. AI’en viser sig at være bekendt med, hvordan man præsenterer metode, diskuterer begrænsninger og kontekstualiserer resultater inden for eksisterende litteratur.

Nuværende begrænsninger og udfordringer

Trods dette historiske gennembrud er der flere vigtige begrænsninger, der begrænser de nuværende evner af AI-genereret forskning. Selskabet sagde, at ingen af deres AI-genererede studier opfyldte deres interne standard for ICLR-konferencens spor. Dette indikerer, at selv om AI’en kan producere workshop-kvalitetsforskning, er det stadig en udfordring at nå de højeste niveauer af videnskabelig publikation.

Accept-raterne giver vigtig kontekst for at evaluere dette gennembrud. Artiklen blev accepteret på en workshop-spor, som typisk har mindre strenge standarder end hovedkonferencen (60-70% accept-rate vs. de 20-30% accept-rater, der er typiske for hovedkonferencens spor). Selv om dette ikke formindsker betydningen af gennembruddet, antyder det, at producere virkelig banebrydende forskning stadig er uden for nuværende AI-evner.

The AI Scientist-v2 demonstrerede også nogle svagheder, som menneskelige forskere identificerede under deres gennemgangsproces. Systemet lavede lejlighedsvis citeringsfejl, hvor det tilskrev forskningsresultater til forkerte forfattere eller publikationer. Det havde også svært ved visse aspekter af eksperimentdesign, som menneskelige eksperter ville have tilgangen til på en anden måde.

Måske det vigtigste er, at AI-genereret forskning fokuserede på inkrementelle forbedringer i stedet for paradigmeskiftende opdagelser. Systemet synes mere i stand til at udføre grundige undersøgelser inden for etablerede forskningsrammer end til at foreslå helt nye måder at tænke om videnskabelige problemer på.

Vejene fremad

Den succesfulde peer-review af AI-genereret forskning er begyndelsen på en ny æra i videnskabelig forskning. Da grundmodellerne fortsætter med at forbedre sig, kan vi forvente, at The AI Scientist og lignende systemer vil producere stadig mere avanceret forskning, der nærmer sig og potentielt overgår menneskelige evner i mange domæner.

Forskningsholdet forventer, at fremtidige versioner vil være i stand til at producere artikler, der er værdige til accept på top-konferencer og tidsskrifter. Den logiske progression antyder, at AI-systemer måske en dag vil bidrage til gennembrudsopdagelser i fag som medicin, fysik og kemi.

Dette udvikling rejser også vigtige spørgsmål om forskningsetik og publikationsstandarder. Den videnskabelige fællesskab må udvikle nye normer for håndtering af AI-genereret forskning, herunder hvornår og hvordan man skal afsløre AI-deltagelse og hvordan man skal evaluere sådant arbejde sammen med menneske-genereret forskning.

Transparensen demonstreret af forskningsholdet i dette eksperiment giver en værdifuld model for fremtidig AI-forsknings-evaluering. Ved at arbejde åbent med konferencearrangørerne og underkaste deres AI-genererede arbejde til de samme standarder som menneske-genereret forskning har de etableret vigtige præcedenser for den ansvarlige udvikling af automatiserede forskningskapaciteter.

Bottom Line

Accepten af en AI-skrevet artikel på en førende maskinlærings-workshop er en betydelig fremgang i AI-evner. Selv om arbejdet endnu ikke er på niveau med top-konferencer, viser det en klar retning mod, at AI-systemer bliver alvorlige bidragydere til videnskabelig opdagelse. Udfordringen ligger nu ikke kun i at fremme teknologien, men også i at forme de etiske og akademiske rammer, der vil styre denne nye forskningsfront.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.