Andersons vinkel
Oppdage AI-ideer, ikke AI-tekst

Hva om det fantes en AI‑tekstdetektor som kunne gjenkjenne at du skrev noe basert på en idé som AI ga deg – selv om all selve skrivingen (dvs. teksten) var ditt eget originale arbeid?
Vi kjenner alle til AI‑tekstdetektorer som har gjort kjendiser og politikere flau – algoritmer som har studert egenskapene ved AI‑generert tekst og kan skjelne disse mønstrene når de dukker opp.
Disse tilfellene representerer en enkel avlasting av en kommunikasjonsoppgave, der språkmodeller som ChatGPT og Google Gemini forutsier det neste sannsynlige tokenet i et svar på en brukers prompt – ikke ved å ta et steg tilbake og se på det brede lerretet av problemet eller påstanden først, men bare ved å gjette det neste mest sannsynlige ordet.
Likevel vil dette lappeteppet av prediksjoner til slutt gi en underliggende struktur, ifølge nyere forskning: behovet for at tilstøtende tekstseksjoner skal være koherente og relevante for hverandre får en unik signatur til å utvikle seg i ‘oversikten’ eller høyere dimensjonalitet av arbeidet – en som kan skjelne AI‑handen selv når teksten er omfattende omskrevet for å ‘humanisere’ den:

Den distinkte høyere-dimensjonale ‘formen’ på skriving under ulike LLM‑er, og – venstre – ren menneskelig skriving. Kilde
Målrettet AI‑idéutforming
Et nytt akademisk samarbeid ledet av University of Maryland går et skritt videre, ved å tilby en metodikk som kan oppdage om ideene selv har sin opprinnelse i AI, uavhengig av hvem som til slutt skrev ordene.
Tilnærmingen, kalt IdeaLens og trent på én million oversikter hentet fra nett-dokumenter, fokuserer på å redusere hvert dokument til en oversikt som bevarer dets ideer samtidig som ordlyden fjernes – og leveres med en online‑demo:

Til venstre passer en av mine egne artikler som menneskelig i online‑demoen, mens en annen artikkel jeg leverte (skrevet av en annen forfatter) ser ut til å ha hatt betydelig AI‑innspill. Kilde
Som sett i de eksemplariske demoresultatene ovenfor, kan de brukte deteksjonsmetodene skille mellom menneskelige ideer og menneskelig prosa, samt AI‑ideer og AI‑prosa, og evaluere dem på en granular og distinkt måte – selv om de to detektorene ble trent på de samme dokumentene, etikettene og den underliggende modellarkitekturen, mens de er designet for å oppdage i hovedsak motsatte ting: opprinnelsen til ideer, og opprinnelsen til prosa.
Dette slags deteksjonsområde, mistenker man, kan gjøre flere kategorier av forfattere nervøse, fra politisk talespillere til romanforfattere og spalteforfattere, i tillegg til andre som hittil har verdsatt sin egen skrivestil, men har latt AI drive deres temaer.
En grunn til at LLM‑er sannsynligvis vil produsere gjenkjennelige (og dermed sporbare) ideer er ikke bare at visse konsepter og tekster statistisk har dominert modellens underkuraterte treningsdata, noe som gjør dem mer sannsynlig å dukke opp i et bredere spekter av forespørsler; men også fordi LLM‑er har mystiske og repeterende besettelser som ikke engang ser ut til å relatere til spesifikke treningsdata, og likevel ofte dukker opp uten å bli bedt om det.
Forfatterne uttaler*:
‘Mens moderne AI‑detektorer identifiserer hvem som skrev ordene, økende retningslinjer for AI‑bruk hviler i økende grad på et annet spørsmål: hvem som kom opp med ideene?Vi introduserer IdeaLens, en detektor som identifiserer om et dokuments ideer kom fra et menneske eller AI (idé‑opprinnelse), uavhengig av hvem som skrev ordene.
‘For å fokusere IdeaLens på ideer snarere enn prosa, representerer vi dokumenter som oversikter: lister over elementer som hver parer en diskursrolle med en kort, parafrasert beskrivelse av innholdet, og minimerer ordnivå‑overlapp med den rå teksten.’
Data og metoder
Artikkelen hevder at den nye metoden kan identifisere menneskelige ideer i AI‑genererte dokumenter (dvs. noen sa til en AI ‘Skriv en oppgave om dette temaet‘); og kan også identifisere AI‑ideer i menneskelig skriving (dvs. noen sa til en AI Foreslå noe jeg kan skrive om).

Testresultater på tvers av fire kombinasjoner av menneskelige og AI‑ideer og prosa. Alle fire detektorene presterer sterkt når ideer og prosa har samme opphav, men avviker kraftig når opprinnelsen er blandet: IdeaLens gjenkjenner korrekt 94,7 % av AI‑skrevne dokumenter basert på menneskelige ideer som menneskelig opprinnelse, og identifiserer AI‑ideer i 68 % av menneskeskrevne historier, sammenlignet med kun 8 % for Pangram 4 og 0 % for ProseLens og EditLens‑3B. Kilde
Deteksjon er enklest når opprinnelsen er tydelig – for eksempel når et menneskeskrevet stykke er basert på AI‑genererte ideer, eller når et AI‑generert resultat stammer fra en menneskelig idé. Når disse opprinnelsesstyrkene varierer, blir deteksjon vanskeligere.
Forskerne testet dette skillet ved gradvis å endre hvor mye av et dokuments underliggende plan som kommer fra en person. I ett eksperiment fikk AI‑modeller stadig mer detaljerte menneskelige planer, fra ikke mye mer enn et tema, til en fullstendig disposisjon.
Etter hvert som den menneskelige bidraget økte, falt IdeaLens sin AI‑flaggfrekvens fra 94,9 % til 6,8 %; og konvensjonelle prosa‑detektorer fortsatte å identifisere den resulterende teksten som AI i overveiende grad:

Testresultater som viser hva som skjer når stadig mer av en AI‑skrevet dokuments underliggende plan leveres av et menneske. IdeaLens gjenkjenner i økende grad den menneskelige opprinnelsen til ideene, med AI‑flaggfrekvensen som faller fra 94,9 % for kun et tema‑prompt til 6,8 % for en fullstendig menneskelig disposisjon; de konvensjonelle tekstdetektorene ProseLens og Pangram klassifiserer fortsatt mesteparten av den resulterende skrivingen som AI.
Siden ideene må skilles fra språket som brukes til å uttrykke dem, og det ikke finnes et stort datasett som registrerer hvem som faktisk oppsto ideene i et dokument, trente forskerne i stedet IdeaLens på eksisterende AI‑skriveetiketter – men fjernet mesteparten av selve skrivingen:

Hvordan IdeaLens skiller ideer fra prosa under trening og testing, sammenlignet med den konvensjonelle tekstdetektoren ProseLens. En prøve på en 1 321‑orders meningsartikkel reduseres til en rolle‑merkede disposisjon, med punkter kategorisert etter deres funksjon, som en hendelsesrapport eller evaluering. Under trening ble disse disposisjonene ytterligere parafrasert for å fjerne formuleringer arvet fra kildedokumentene før IdeaLens lærte av eksisterende Pangram AI‑etiketter. For nye dokumenter kan den ekstraherte disposisjonen deretter sendes direkte til IdeaLens for å estimere sannsynligheten for at ideene er AI‑avledet. Den nedre delen av figuren viser en sekundær detektor – ‘ProseLens’ – brukt av forskerne for sammenligning, som i stedet mottar hele teksten og estimerer om prosaen selv er AI‑generert.
Som vist ovenfor ble hvert dokument redusert til en disposisjon som beskriver hva som blir sagt, og hvilken rolle hvert punkt spiller i dokumentet. Under trening ble disse disposisjonene parafrasert for ytterligere å fjerne spor av forfatternes opprinnelige ordvalg. IdeaLens kan derfor gjøre sine prediksjoner i stor grad fra ideene som gjenstår, snarere enn fra avslørende kjennetegn ved prosaen.
Tre datasett ble opprettet for prosjektet: IdeaShift; IdeaShift-X; og TwiceTold. IdeaShift ble laget fra 500 menneskeskrevne og AI‑genererte seed‑dokumenter hentet fra forskernes eksisterende testkorpus. GPT-5.6 Sol ble brukt til å gjøre hver av dem til gradvis mer detaljerte prompt, fra ‘kun tema’ til en full disposisjon. GPT-5.6 ble deretter brukt til å generere nye dokumenter.
IdeaShift-X brukte i stedet 10 000 menneskeskrevne FineWeb2-dokumenter på 24 språk, og anvendte den nevnte IdeaShift‑protokollen for å generere AI‑versjoner på hvert språk.
Det tredje datasettet, TwiceTold, ble skrevet av akademiske studenter under forfatternes veiledning, for å unngå mulig bruk av AI innebygd i crowdsourcing av slike data. Femtifem historier ble skrevet fra bunnen av, men ved bruk av en 500‑orders disposisjon levert av ChatGPT-5.6 Sol.
Tester
Forskerens egne detektorer besto av IdeaLens i disposisjons- og dokumentform; den nevnte ProseLens; ModernBERT-L versjoner av begge systemene; Qwen3.5-9B-versjoner av IdeaLens; og en IdeaLens logistic-classifier-variant.
Disse ble sammenlignet med Pangram 4; EditLens-Llama-3B; Binoculars; EditLens-RoBERTa; MELD; Desklib-academic; Desklib; Entropy; Fast-DetectGPT; Likelihood; Log-rank; LRR; MAGE; OpenAI-RoBERTa-base; OpenAI-RoBERTa-large; RADAR; og Rank.
For testene ble nøyaktighet målt ved om den forutsagte AI‑ eller menneskelabelen samsvarte med kilden til idéene. IdeaLens, ProseLens og EditLens brukte en global 1 % FPR‑grense; AI‑, AI‑assistert‑ og menneskelabelene i Pangram 4 ble binarisert; og Fast-DetectGPT, Binoculars, MELD og Desklib brukte sine standardgrenser.
Den bredere evalueringen brukte 19 eksterne referanserammer, inkludert 14 som dekket helt menneskelig eller helt AI‑materiale, og 10 som inneholdt menneskelig tekst etterfølgende redigert av AI. Ytterligere 50 000 dokumenter innenfor domenet ble testet, mens 10 000 pre‑ChatGPT C4‑dokumenter ble brukt for å vurdere falske positiver:

Testresultater som sammenligner detektornøyaktighet når idéer og prosa har samme eller ulike opprinnelser. IdeaLens beholder høy nøyaktighet i begge tilfeller, med 95,3 % for felles proveniens og 81,3 % for blandet proveniens; konkurrerende detektorer presterer betydelig dårligere når idéenes kilde avviker fra prosaens kilde.
På tvers av 51 tester hentet fra 22 referanserammer var IdeaLens den eneste detektoren som presterte sterkt når idéene og prosaen kom fra enten samme eller ulike kilder, med resultater på 95,3 % og 81,3 % henholdsvis.
Til sammenligning oppnådde ProseLens og Pangram 4 over 98 % når idéer og prosa delte samme kilde, men falt til rundt 25 % når de ikke gjorde det.
Forfatterne uttaler om disse resultatene*:
‘Siden ProseLens har samme rammeverk, treningsdokumenter og treningsetiketter som IdeaLens, fremhever dette virkningen av vår disposisjonsrepresentasjon, som et ModernBERT-basert par gjenskaper med et annet rammeverk.
‘IdeaLens overfører også uventet godt til råtekst‑innganger under testing, og viser høy nøyaktighet for felles proveniens og betydelig høyere nøyaktighet for blandet proveniens enn ProseLens.’
Alle tre detektorene identifiserte nesten alle de opprinnelige AI‑skrevne historiene. På TwiceTold identifiserte IdeaLens AI‑opprinnelige idéer i 68 % av de menneskeskrevne historiene, sammenlignet med 0 % for ProseLens og 8 % for Pangram 4:

IdeaLens tilordner lignende AI‑sannsynligheter til de opprinnelige AI‑skrevne historiene og de menneskeskrevne TwiceTold‑versjonene basert på de samme AI‑genererte disposisjonene, mens ProseLens sine AI‑sannsynligheter faller kraftig når prosaen omskrives av mennesker.
Til tross for at den er trent på engelsk, generaliserte IdeaLens over IdeaShift‑X sine 24 språk, og flagget 95,3 % av dokumentene basert på AI‑idéer – men kun 0,7 % når en detaljert menneskelig plan leverte idéene. På 10 000 pre‑ChatGPT‑menneskedokumenter på de samme språkene var falsk‑positiv‑raten kun 0,1 %.
Forfatterne innrømmer at et større datasett ville vært ønskelig i fremtidig arbeid, og at støyen i datasett‑etikettene kan trenge oppmerksomhet. Likevel kan de som ønsker å bygge videre på denne interessante innledende presentasjonen benytte GitHub‑depotet som papirforfatterne har gjort tilgjengelig; og de som bare er nysgjerrige kan lime inn «mistanke»-tester i prosjektets demo‑nettsted, og selv vurdere om metoden samsvarer med deres egne estimater, eller med andre tilnærminger.
Konklusjon
Om en slik deteksjonsmetode er viktig avhenger av hvordan aksept, integrering eller avvisning av AI vil utvikle seg (utvilsomt ulikt på tvers av sektorer og omstendigheter) i løpet av de neste 6–12 månedene.
Det kan være at en politikers publikum er mer tilgivende overfor hans eller hennes bruk av AI for å finpusse og presentere egne originale idéer, enn de ville være overfor en lettvint presentasjon av idéer generert av en LLM (tross alt er publikum statistisk sannsynligvis sympatiske til bruk av AI som kun et presentasjonsverktøy).
Likevel, samtidig, hva håper vi på fra AI annet enn at den skal generere perspektiver, idéer og alternativer som vi selv ville ha oversett eller aldri vurdert; og fra dette ståstedet, er det så ille å la maskinintelligensen ta rattet?
Vel, når det gjelder optikk, og gitt AI sin berømte og økende tilbøyelighet til feil og –sist‑ned– avvikende atferd, er det kanskje fortsatt for tidlig å la LLM-er komme med politiske forslag, eller generelt bli en drivkraft i idéutvikling.
* Forfatternes vektlegging, ikke min, men min konvertering av forfatternes inline‑sitater til hyperlenker, der det er nødvendig.*
Først publisert tirsdag 6. oktober 2026












