AI-modeller og plattformer
Hvordan et mentalt helse AI-verktøy tilfeldigvis oppdaget nøyaktig deepfake-oppdaging

Da tech-giganten Open AI lanserte sitt flaggskip Sora 2 video- og audio-generasjonsmodell i september 2025, har deepfake-videor oversvømt sosiale medier, og gjort publikummer stadig mer kjent med potensielt farlige hyper-realistiske innhold.
Selv om Open AI anså en ansvarlig lansering av Sora 2 som en topprioritet, hevdet de at det ville gi brukerne “verktøyene og valgfriheten til å være i kontroll over hva de ser i feeden” og kontroll over deres likhet fra ende til ende, en oktober 2025 studie fant modellen produserte feilaktige påstander videoer 80% av tiden.
Fra videoer som mimikerte nyhetsrapporter om en moldovsk valgfunksjonær som ødela stemmesedler til fabrikkerte scener av en liten gutt som ble arrestert av innvandringsmyndighetene eller en Coca-Cola-talsperson som annonserte at selskapet ikke ville sponsorere Super Bowl, kunne konsekvensene av å produsere feilinformasjon i en sammenkoblet verden ikke være høyere.
Beyond Sora: Vishing
Selv før Open AI’s verktøy ble lansert, var skapelsen og nettbasert spredning av deepfake-filer på fremmarsj. Ifølge en september 2025-rapport fra selskapet for cybersikkerhet DeepStrike, økte deepfake-innholdet fra 500 000 i 2023 til en overveldende 8 millioner i 2025, mye av dette ble brukt til svindel.
Trenden viser ingen tegn til å stoppe; AI-svindel i USA alene forventes å nå 40 milliarder USD i 2027.
En slik økning er ikke begrenset til mengde. Med verktøy som Sora 2 og Google’s Veo 3, er innholdet av AI-genererte ansikter, stemmer og fullkroppsforestillinger nå mer realistiske enn noensinne. Som signalisert av datascientist og deepfake-forsker Siwei Luy, er moderne modeller i stand til å produsere stabile ansikter uten forvrengning eller forvrengning, mens stemme-kloning har krysset en “umulig å skille” terskel.
Sannheten er at deepfakes går foran oppdaging. Hva teknologiselskaper selger som morsomme verktøy for å generere alt fra olympiske gymnastikk-rutiner til sofistikerte bakgrunnsskoger, har også blitt utnyttet av kriminelle til å angripe bedrifter og enkeltpersoner. Bare i første halvår 2025, fremkalte deepfake-hendelser tap på 356 millioner USD for selskaper og 541 millioner USD for enkeltpersoner.
Tradisjonell deepfake-oppdaging – inkludert identifisering av vannmerker, airbrushede ansikter og metadata-kontroller – feiler. Og, mens stemme-deepfakes forblir den nest vanligste formen for AI-aktivert svindel og stemme-phishing (vishing) økte 442% i 2025, er konsekvensene allerede følt.
“Et par sekunder med audio er nå nok til å generere en overbevisende kopi – komplett med naturlig intonasjon, rytme, betoning, emosjon, pauser og pustelyder,” skrev Lyu .
Vitenskapen om å lytte til mennesker
Kintsugi, et helse-teknologiselskap som utvikler AI-stemme-biomarkør-teknologi for å oppdage tegn på klinisk depresjon og angst. Deres arbeid startet fra en tilsynelatende enkel premisse: vi må lytte til mennesker.
“Jeg startet Kintsugi på grunn av et problem jeg selv opplevde. Jeg tilbrakte nesten fem måneder med å ringe min leverandør for å få en første terapi-time, og ingen returnerte noen gang mine samtaler. Jeg fortsatte å prøve – men jeg husker å tenke veldig tydelig at hvis dette var min far eller min bror, ville de ha stoppet lenge før jeg gjorde,” sa CEO Grace Chang i samtale med Unite.AI.
Det California-baserte selskapet ble grunnlagt i 2019 som en løsning på det som Chang beskrev som en “triage-bottleneck”. Grunnleggeren trodde på at å oppdage alvorlighetsgrad tidligere og passivt kunne hjelpe folk til å komme til riktig nivå av omsorg raskere. Og, gjennom Kintsugi Voice, identifiserer stemme-biomarkør-teknologien klinisk depresjon og angst.
Forskning viser at AI-drevet tale- og stemme-analyse kan brukes som en biomarkør for mentale helse-tilstander. En studie fra mai 2025 fant at akustiske biomarkører kan oppdage tidlige tegn på mentale helse- og neurodivergens, og argumenterte for å integrere sang-analyser i kliniske settinger for å vurdere pasienters potensielle kognitive nedgang.
Stemme-målinger har en nøyaktighetsrate på 78% til 96% i å identifisere mennesker med depresjon versus de uten, ifølge den amerikanske psykiatriske foreningen. En annen studie brukte en en-minutters verbal flytighetstest hvor en person navnga så mange ord som mulig innen en gitt kategori – og fant 70% til 83% nøyaktighet i å oppdage når en person hadde både depresjon og angst.
For å vurdere brukernes mentale helse, ber Kintsugi om en kort taleklipp, etterfulgt av at deres stemme-biomarkør-teknologi analyserer tonehøyde, intonasjon, tone og pauser – markører funnet å være assosiert med tilstander som depresjon, angst, bipolar lidelse og demens.
Hva Chang ikke opprinnelig innsett, var at teknologien hadde låst opp ett av sikkerhetsindustriens mest presserende samtidsutfordringer: å identifisere hva som gjør menneskestemmer menneskelige.
Fra mentale helse-til omsorg til cybersikkerhet
Mens hun deltok på et toppmøte i New York i slutten av 2025, nevnte Chang til en venn i cybersikkerhetsfeltet at hennes teams eksperimentering med syntetiske stemmer hadde vært skuffende.
“Vi utforsket syntetisk data for å forbedre trening for våre mentale helse-modeller, men de genererte stemmene var så forskjellige fra ekte menneskestemmer at vi kunne si nesten 100% av tiden,” sa hun.
“Han stoppet meg og sa: ‘Grace – det er ikke et løst problem i sikkerhet.’ Det var øyeblikket alt klikket. Siden da har samtaler med sikkerhets-, finansielle tjenester og telekomselskaper bekreftet hvor raskt deepfake-stemme-angrep øker – og hvor virkelig behovet er å skille menneskestemmer fra syntetiske stemmer i live-samtaler,” la CEOen til.
I april i fjor advarte FBI mot en skadelig tekst- og stemme-meldingskampanje som utgav seg for å være kommunikasjon fra senior amerikanske tjenestemenn og rettet seg mot tidligere regjeringsarbeidere og deres kontakter. Store nasjonale banker i USA ble også angrepet med 5,5 gjennomsnittlige daglige stemme-manipulasjons-svindel-forsøk, og sykehus-personale ved Vanderbilt University Medical Center rapporterte vishing-angrep fra personer som utga seg for å være venner, overordnede og kolleger.
Uansett, deepfakes var ikke opprinnelig en del av Kintsugis arbeid. Mens selskapets team hadde brukt standard-modeller som Cartesia, Sesame og ElevenLabs til å eksperimentere med syntetiske stemmer for administrative call-senter-agenter og utgående arbeidsflyter, var deepfake-svindel ikke deres fokus i en travel og tilgjengelig marked med modeller som Sora.
Menneskelige signaler som indikerer stemme-autentisitet er de samme biomarkørene som gjør noen menneskelige i første omgang. Uavhengig av språk eller semantikk, opererer Kintsugi Voice med signalbehandling og den fysiske latentheten til tale, og fanger subtile timing, prosodisk variabilitet, kognitiv belastning og fysiologiske markører som reflekterer hvordan tale produseres … ikke hva som sies.
“Syntetiske stemmer kan lyde flytende, men de bærer ikke de samme biologiske og kognitive artefakter,” sa Chang. Selskapets modell er konsekvent en top-decile-presterer i oppdaging-nøyaktighet, og bruker så lite som 3 til 5 sekunder med audio.
Kintsugi kan være revolusjonerende for de som sliter med mentale helse-problemer, spesielt i områder hvor å få behandling med profesjonelle tar tid og ressurser. På samme måte kan teknologien være en revolusjon for deepfake-oppdaging og cybersikkerhet generelt: autentisitets-oppdaging i stedet for deepfake-gjenkjenning.
Fremtiden ligger på menneske-sentrert teknologi
Cybersikkerhet har lenge vært fokusert på skadelig bruk av teknologier eller gjerningspersoner selv. Kintsugis tilfeldige oppdagelse, derimot, satser på menneskeheten selv.
“Vi opererer på et helt annet overflateområde: menneskelig autentisitet selv. LLM-er kan ikke pålitelig oppdage LLM-generert innhold, og artefakt-baserte metoder er skjøre. Å fange store, klinisk merkte datasamlinger som koderer virkelig menneskelig variasjon er dyrt, langsomt og utenfor kjernekompetansen til de fleste sikkerhetsselskaper — noe som gjør denne tilnærmingen vanskelig å gjenta,” noterte Chang.
Selskapets tilnærming antyder også en bredere skift: tverrfaglig innovasjon. De som er front-runners i helse-omsorg kan være de som leder an i AI-basert vishing-oppdaging, like som de som er innovatører i rom-teknologi kan støtte opp nye nødsituasjons-mekanismer, eller spill-arkitektur og byplanlegging.
For Chang planlegger hun å bli en standard for å verifisere ekte mennesker og, til slutt, ekte intensjoner gjennom stemme-interaksjoner.
“Like som HTTPS ble en standard tillitslag for nettet, tror vi at ‘bevis på menneske’ vil bli et grunnleggende lag for stemme-baserte systemer. Signal er begynnelsen på denne infrastrukturen,” sa hun.
Ettersom generativ AI fortsetter å akselerere, kan de mest effektive sikkerhetstiltakene komme fra å forstå hva som gjør mennesker … menneskelige.












