AI-modeller och plattformar
Hur ett mentalhälsotool för AI oavsiktligt upptäckte exakt djupfalsk upptäckt

När techjätten Open AI lanserade sitt flaggskepp Sora 2 video- och audiogenereringsmodell i september 2025, har djupfalska videor översvämmat sociala medieplattformar, vilket gjort publiken alltmer bekant med potentiellt farliga hyperrealistiska innehåll.
Även om Open AI ansåg att det ansvarsfulla lanseringen av Sora 2 var en topprioritet, påstod de att det skulle ge användarna “verktygen och valmöjligheterna att ha kontroll över vad de ser i sina flöden” och kontroll över deras likhet från början till slut, en oktober 2025 studie fann att modellen producerade falska påståenden i 80% av fallen.
Från videor som mimikerade nyhetsrapporter om en moldavisk valtjänsteman som förstörde röster till fabricerade scener av en toddler som grips av invandringsmyndigheter eller en Coca-Cola (KO ) -talesman som tillkännagav att företaget inte skulle sponsra Super Bowl, är insatserna för att producera missinformation i en sammanlänkad värld högre än någonsin.
Bortom Sora: Vishing
Även innan Open AI:s verktyg lanserades, var skapandet och den online-spridningen av djupfalska filer på uppgång. Enligt en september 2025-rapport från cybersäkerhetsföretaget DeepStrike, ökade djupfalska innehåll från 500 000 i 2023 till en hisnande 8 miljoner i 2025, varav mycket användes för bedrägliga ändamål.
Trenden visar inga tecken på att avta; AI-bedrägeri i USA förväntas nå 40 miljarder USD i 2027.
En sådan ökning är inte begränsad till mängd. Med verktyg som Sora 2 och Googles Veo 3, är innehåll med AI-genererade ansikten, röster och fullständiga prestationer mer realistiska än någonsin. Som signaliserades av datavetare och djupfalskforskare Siwei Luy, kan samtida modeller producera stabila ansikten utan förvrängning eller distorsion, medan röstkloning har korsat en “otydlig tröskel”. (GOOGL )
Sanningen är att djupfalska överträffar upptäckt. Vad teknologiföretag säljer som roliga verktyg för att generera allt från olympiska gymnastikrutiner till sofistikerade bakgrundsljud, har också använts av brottslingar för att attackera företag och individer. Bara under första halvåret 2025 utlöste djupfalska incidenter förluster på 356 miljoner USD för företag och 541 miljoner USD för individer.
Traditionell djupfalsk upptäckt – inklusive identifiering av vattenmärken, airbrushade ansikten och metadatakontroller – fungerar inte. Och, eftersom röstdjupfalska förblir den andra vanligaste formen av AI-aktiverat bedrägeri och röstfiske (vishing) ökade med 442% i 2025, är konsekvenserna redan märkbara.
“Ett par sekunder av ljud räcker nu för att generera en övertygande klon – komplett med naturlig intonation, rytm, betoning, känslor, pauser och andningsljud”, skrev Lyu .
Vetenskapen om att lyssna på människor
Kintsugi, ett hälso- och sjukvårdsteknikföretag som utvecklar AI-röstbiomarkeringsteknik för att upptäcka tecken på klinisk depression och ångest. Deras arbete började med en enkel premis: vi måste lyssna på människor.
“Jag startade Kintsugi på grund av ett problem jag upplevde personligen. Jag tillbringade nästan fem månader med att ringa min leverantör för att boka en första terapitid, och ingen återringde mig någonsin. Jag fortsatte att försöka – men jag minns att jag tänkte mycket tydligt att om detta var min pappa eller min bror, skulle de ha slutat långt innan jag gjorde”, sa VD Grace Chang i en konversation med Unite.AI.
Det Kalifornienbaserade företaget grundades 2019 som en lösning på det som Chang beskrev som en “triageflaska”. Grundaren trodde att tidig upptäckt och passiv detektering kunde hjälpa människor att komma till rätt nivå av vård snabbare. Och, genom Kintsugi Voice, identifierar röstbiomarkeringstekniken klinisk depression och ångest.
Forskning finns i överflöd som bevisar den framgångsrika användningen av AI-driven tal- och röstanalys som en biomarkör för psykiska hälsotillstånd. En maj 2025-rapport, till exempel, fann att akustiska biomarkörer kan upptäcka tidiga tecken på psykisk hälsa och neurodivergens, och argumenterade för integrationen av sånganalyser i kliniska miljöer för att bedöma patienternas potentiella kognitiva nedgång.
Röståtgärder har i själva verket en noggrannhetsgrad på 78% till 96% för att identifiera personer med depression jämfört med de som inte har det, enligt den amerikanska psykiatriska föreningen. En annan studie använde ett ettminuters verbalt test där en person namngav så många ord som möjligt inom en given kategori – och fann 70% till 83% noggrannhet i att upptäcka när en person hade både depression och ångest.
För att bedöma sina användares psykiska hälsa ber Kintsugi om en kort talklipp, efter vilken deras röstbiomarkeringsteknik analyserar tonhöjd, intonation, ton och pauser – markörer funna att vara associerade med tillstånd som depression, ångest, bipolär sjukdom och demens.
Vad Chang inte förstod var att tekniken hade låst upp en av säkerhetsindustrins mest pressande samtida utmaningar: att identifiera vad som gör mänskliga röster mänskliga.
Från mentalvård till cybersäkerhet
Medan hon deltog i en konferens i New York i slutet av 2025, nämnde Chang för en vän inom cybersäkerhetsområdet att hennes teams experiment med syntetiska röster hade varit besvikande.
“Vi undersökte syntetiska data för att förbättra utbildningen för våra modeller för mental hälsa, men de genererade rösterna var så olika från äkta mänskligt tal att vi kunde avgöra nästan 100% av tiden”, sa hon.
“Han stoppade mig och sa: ‘Grace – det är inte ett löst problem inom säkerhet.’ Det var ögonblicket då allt klickade. Sedan dess har samtal med säkerhets-, finansiella tjänste- och telekommunikationsföretag bekräftat hur snabbt djupfalska röstattacker ökar – och hur verkligt behovet är att skilja mänskliga röster från syntetiska röster i realtidssamtal”, tillade VD:n.
I april förra året varnade FBI om en skadlig text- och röstmeddelandekampanj som utgav sig för att vara kommunikationer från seniora amerikanska tjänstemän och riktade sig till före detta regeringsarbetare och deras kontakter. Stora nationella banker i USA utsattes för 5,5 genomsnittliga dagliga röstmanipulationsförsök, och sjukhuspersonalen vid Vanderbilt University Medical Center rapporterade vishing-attacker från bedragare som utgav sig för att vara vänner, chefer och kollegor.
Djupfalska var inte ursprungligen en del av Kintsugis arbete. Medan företagets team hade använt sig av färdiga modeller som Cartesia, Sesame och ElevenLabs för att experimentera med syntetiska röster för administrativa callcenteragenter och utgående arbetsflöden, var djupfalska bedrägeri inte deras fokus i en trång och tillgänglig marknad med modeller som Sora.
Mänskliga signaler som indikerar röstautenticitet är dock samma biomarkörer som gör en person mänsklig från första början. Oavsett språk eller semantik fungerar Kintsugi Voice med signalbehandling och den fysiska latensen i talet, och fångar subtila timing, prosodisk variabilitet, kognitiv belastning och fysiologiska markörer som återspeglar hur talet produceras… inte vad som sägs.
“Syntetiska röster kan låta flytande, men de bär inte samma biologiska och kognitiva artefakter”, sa Chang. Företagets modell är konsekvent en topp-decile-presterare i upptäcktsnoggrannhet, med så lite som 3 till 5 sekunder av ljud.
Kintsugi kan vara revolutionerande för de som kämpar med mental hälsa, särskilt i områden där att få behandling med proffs tar tid och resurser. På samma sätt utgör deras teknik en revolution för djupfalsk upptäckt och cybersäkerhet i allmänhet: autenticitetsupptäckt snarare än djupfalsk igenkänning.
Framtiden ligger i mänsklig teknik
Cybersäkerhet har länge fokuserat på skadlig användning av teknologi eller förövare själva. Kintsugis oavsiktliga upptäckt satsar dock på mänskligheten själv.
“Vi opererar på en helt annan yta: mänsklig autenticitet själv. LLM kan inte tillförlitligt upptäcka LLM-genererat innehåll, och artefaktbaserade metoder är sköra. Att fånga stora, kliniskt märkta datamängder som kodar verklig mänsklig variabilitet är dyrt, långsamt och utanför de flesta säkerhetsföretags kärnkompetens – vilket gör denna approach svår att replikera”, noterade Chang.
Företagets tillvägagångssätt antyder också en bredare förändring: tvärvetenskaplig innovation. De som ligger i framkant inom hälso- och sjukvård kan leda vägen i AI-stödd vishing-upptäckt, liksom de som innovatörer inom rymdteknik kan stödja nya nödsvarsmekanismer, eller spelare arkitektur och stadsplanering.
Vad gäller Chang planerar hon att bli en standard för att verifiera riktiga människor och, till slut, riktiga avsikter genom röstinteraktioner.
“Liksom HTTPS blev en standard för webben, tror vi att ‘bevis på mänsklig’ kommer att bli en grundläggande lager för röstbaserade system. Signal är början på den infrastrukturen”, sa hon.
Medan generativ AI fortsätter att accelerera, kan de mest effektiva skydden komma från att förstå vad som gör människor… väl, mänskliga.












