AI-modeller og platforme

Hvordan et mentalt sundheds-AI-værktøj tilfældigt opdagede præcis deepfake-detektion

mm
Føj Unite.AI til dine foretrukne kilder på Google

Da teknologigiganten Open AI lancerede sin flagskib Sora 2 video- og audio-genereringsmodel i september 2025, har deepfake-videoer oversvømmet sociale medieplatforme og gjort publikummere og mere bekendt med potentielt farlige hyperrealistiske indhold.

Selv om Open AI anså det ansvarlige lanceringsaspekt af Sora 2 som en top-prioritet, påstod de, at det ville give brugerne “værktøjerne og valgmulighederne til at være i kontrol over, hvad de ser i deres feed” og kontrol over deres lighed fra ende til ende, fandt en oktober 2025 studie, at modellen producerede falske påstande-videoer 80% af tiden.

Fra videoer, der mimikerer nyhedsrapporter om en moldovisk valgmyndighedsdestruktion af stemmesedler til fabrikerede scener af en lille pige, der bliver anholdt af immigrationsmyndighederne, eller en Coca-Cola-talsperson, der annoncerer, at virksomheden ikke vil sponsorere Super Bowl, kunne gevinsten for at producere misinformationsindhold i en sammenhængende verden ikke være højere.

Beyond Sora: Vishing

Selv før Open AI’s værktøj blev lanceret, var skabelsen og den online udbredelse af deepfake-filer stigende. Ifølge en september 2025-rapport fra det cybersikkerhedsfirma DeepStrike, steg deepfake-indhold fra 500.000 i 2023 til en overvældende 8 million i 2025, hvoraf meget blev brugt til svindel.

Trenden viser ingen tegn på at stoppe; AI-svindel i USA alene forventes at nå 40 milliarder USD i 2027.

En sådan stigning er ikke begrænset til mængde. Med værktøjer som Sora 2 og Google’s Veo 3 er indhold af AI-genererede ansigter, stemmer og fuld-krop-forestilling nu mere realistiske end nogensinde. Som signaliseret af computerforsker og deepfake-forsker Siwei Luy, er samtidige modeller i stand til at producere stabile ansigter uden forvridning eller forvrængning, mens stemme-kloning har overskredet en “umulig at skelne”-grænse.

Sandheden er, at deepfakes er foran detektion. Hvad teknologivirksomheder sælger som sjove værktøjer til at generere alt fra olympiske gymnastik-rutiner til sofistikerede baggrund-lydlandskaber, har også været udnyttet af kriminelle til at målrette virksomheder og enkeltpersoner. Kun i første halvår af 2025 fremkaldte deepfake-episoder tab på 356 millioner USD for virksomheder og 541 millioner USD for enkeltpersoner.

Traditionel deepfake-detektion – herunder identificering af vandmærker, airbrushede ansigter og metadata-kontroller – fejler. Og, da stemme-deepfakes forbliver den andenhyppigste form for AI-aktiveret svindel og stemme-phishing (vishing) steg 442% i 2025, er konsekvenserne allerede blevet følt.

“Et par sekunder af audio er nok til at generere en overbevisende klon – kompleks med naturlig intonation, rytme, betoning, emotion, pauser og åndedrætsstøj,” skrev Lyu .

Videnskaben om at lytte til mennesker

Kintsugi, en healthtech-startup, der udvikler AI-stemme-biomarkørteknologi til at detektere tegn på klinisk depression og angst. Deres arbejde startede fra en tilsyneladende simpel præmis: vi må lytte til mennesker.

“Jeg startede Kintsugi på grund af et problem, jeg selv havde oplevet. Jeg tilbragte næsten fem måneder med at ringe til min provider for at få en initial terapi-afstemning, og ingen ringede nogensinde tilbage. Jeg fortsatte med at prøve – men jeg husker tydeligt, at jeg tænkte, at hvis det var min far eller min bror, ville de have stoppet langt før jeg gjorde,” sagde CEO Grace Chang i en samtale med Unite.AI.

Det Californien-baserede selskab blev grundlagt i 2019 som en løsning på, hvad Chang beskrev som en “triage-bottleneck”. Grundlæggeren mente, at detektion af alvorlighed tidligere og passivt kunne hjælpe med at få mennesker til det rette niveau af pleje hurtigere. Og gennem Kintsugi Voice identificerer stemme-biomarkører klinisk depression og angst.

Forskning viser, at AI-drevet tale- og stemmeanalyse kan bruges som en biomarkør for mentale sundhedsforhold. En maj 2025-rapport fandt for eksempel, at akustiske biomarkører kan detektere tidlige tegn på mentale sundheds- og neurodivergens-forhold og argumenterede for integration af sanganalyser i kliniske indstillinger for at vurderere patienternes potentielle kognitive tilbagegang.

Stemme-mål har faktisk en nøjagtighed på 78% til 96% i identificering af mennesker med depression i forhold til dem uden, ifølge den amerikanske psykiatriske forening. En anden studie brugte en en-minutters verbal flydighedstest, hvor en person navngav så mange ord som muligt inden for en given kategori – og fandt 70% til 83% nøjagtighed i detektion af, om en person havde både depression og angst.

For at vurderere brugernes mentale sundhed, anmoder Kintsugi om en kort taleklip, efterfulgt af dens stemme-biomarkørteknologi, der analyserer tonehøjde, intonation, tone og pauser – markører fundet at være forbundet med forhold som depression, angst, bipolar lidelse og demens.

Hvad Chang ikke oprindeligt var klar over, var, at teknologien havde låst en af sikkerhedsindustriens mest presserende nutidige udfordringer op: at identificere, hvad der gør menneskestemmer menneskelige.

Fra mental sundhedspleje til cybersikkerhed

Under et møde i New York i slutningen af 2025 nævnte Chang til en ven i cybersikkerhedsfeltet, at hendes teams eksperimenter med syntetiske stemmer havde været skuffende.

“Vi udforskede syntetisk data til at supplere træning for vores mentale-sundhedsmodeller, men de genererede stemmer var så forskellige fra ægte menneskestemmer, at vi kunne se næsten 100% af tiden,” sagde hun.

“Han standsede mig og sagde: ‘Grace – det er ikke et løst problem i sikkerhed.’ Det var øjeblikket, hvor alt faldt på plads. Siden da har samtaler med sikkerheds-, finans- og teleselskaber bekræftet, hvor hurtigt deepfake-stemmeangreb stiger – og hvor reel det behov er til at skelne mellem menneskelige og syntetiske stemmer i live-opkald,” tilføjede CEO’en.

I april sidste år advarede FBI om en ondsindet tekst- og stemme-meddelelseskampagne, der udgav sig for at være kommunikationer fra senior amerikanske embedsmænd og målrettede tidligere regeringsansatte og deres kontakter. Store nationale banker i USA var også målrettede med 5,5 gennemsnitlige daglige stemme-manipulations-svindel-forsøg, og hospital-personale på Vanderbilt University Medical Center rapporterede om vishing-angreb fra personer, der udgav sig for at være venner, chefer og kolleger.

Uanset hvad, var deepfakes ikke en del af Kintsugis arbejde fra starten. Mens selskabets team havde brugt standardmodeller som Cartesia, Sesame og ElevenLabs til at eksperimentere med syntetiske stemmer til administrative callcenter-agenter og udgående arbejdsgange, var deepfake-svindel ikke deres fokus i en travl og tilgængelig marked med modeller som Sora.

Menneske-niveau-signaler, der indikerer stemme-authenticitet, er de samme biomarkører, der gør en person menneskelig. Uanset sprog eller semantik fungerer Kintsugi Voice med signalbehandling og den fysiske latency af tale, og fanger subtile timing, prosodisk variabilitet, kognitivt belastning og fysiologiske markører, der reflekterer, hvordan tale produceres … ikke hvad der siges.

“Syntetiske stemmer kan lyde flydende, men de bærer ikke de samme biologiske og kognitive artefakter,” sagde Chang. Selskabets model er konsekvent en top-decile-performer i detektionsnøjagtighed og bruger kun 3 til 5 sekunder af audio.

Kintsugi kan være revolutionerende for dem, der kæmper med mental sundhed, især i områder, hvor det tager tid og ressourcer at få behandling med professionelle. På samme måde stiller teknologien et spørgsmål om deepfake-detektion og cybersikkerhed mere generelt: autenticitets-detektion i stedet for deepfake-genkendelse.

Fremtiden ligger i menneske-centreret teknologi

Cybersikkerhed har længe været fokuseret på ondsindet brug af teknologier eller selv forkyndere. Kintsugis tilfældige opdagelse, derimod, satser på menneskeheden selv.

“Vi opererer på et helt andet overfladeareal: menneske-autenticitet selv. LLM’er kan ikke pålideligt detektere LLM-genereret indhold, og artifact-baserede metoder er skrøbelige. At indfange store, klinisk mærkede datasæt, der kodificerer rigtig menneske-variation, er dyrt, langsomt og uden for kernekompetencen af de fleste sikkerhedsfirmaer – hvilket gør denne tilgang svær at genskabe,” bemærkede Chang.

Startuppens tilgang antyder også en bredere skift: cross-domæne-innovation. De frontløbere i sundhedssektoren kan måske føre an i AI-baseret vishing-detektion, ligesom de innovative i rumteknologi kan støtte nye nødsituations-mekanismer, eller spillere kan arkitektur og byplanlægning.

For Chang planlægger hun at blive en standard for at verificere rigtige mennesker og til sidst rigtig intention gennem stemme-interaktioner.

“Ligesom HTTPS blev en standard-trust-lag for webben, tror vi, at ‘bevis for menneske’ vil blive et grundlæggende lag for stemme-baserede systemer. Signal er begyndelsen på den infrastruktur,” sagde hun.

Da generativ AI fortsætter med at accelerere, kan de mest effektive sikkerhedsforanstaltninger måske komme fra at forstå, hvad der gør mennesker … godt, menneskelige.

Salomé er en i Medellín født journalist og senior reporter ved Espacio Media Incubator. Med en baggrund i historie og politik, lægger Salomés arbejde vægt på den sociale relevans af nye teknologier. Hun er blevet fremhævet i Al Jazeera, Latin America Reports og The Sociable, blandt andre.