AI-mallit ja alustat

Miten mielenterveys AI-työkalu vahingossa keksi tarkan syväväärennös-havaitsemisen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun teknologiajätti Open AI julkaisi lippulaivansa Sora 2 -video- ja äänigeneraattorimallin syyskuussa 2025, syväväärennös-videot tulvivat sosiaalisen median alustoille, ja yleisö tutustui yhä enenevissä määrin mahdollisesti vaarallisiin hyperrealistisiin sisältöihin.

Vaikka Open AI piti Sora 2:n vastuullista julkaisua ensisijaisena tavoitteenaan, väittäen, että se antaisi käyttäjille “työkalut ja vaihtoehdot olla mukana siinä, mitä he näkevät syötteessään” ja valvontaa heidän kaltaisuudestaan loppuun asti, lokakuun 2025 tutkimus osoitti, että malli tuotti vääräksi väittämiä sisältäviä videoita 80 %:ssa tapauksista.

Videot, jotka jäljittelevät uutisraportteja moldovalaisen vaaliviranomaisen tuhoamasta äänestyslippuista valheellisiin kohtauksiin, joissa Coca-Colan edustaja ilmoittaa, että yhtiö ei sponsoroi Super Bowlia, ovat panneet korkeat vedot tuottamaan virheellistä tietoa verkostoituneessa maailmassa.

Soran ulkopuolella: Vishing

Jo ennen Open AI:n työkalun julkaisua syväväärennösten luominen ja verkossa levittäminen olivat kasvamassa. Kyberturvallisuusyhtiö DeepStriken mukaan syväväärennös-sisältö kasvoi 500 000:sta 2023 vuonna hämmästyttäviin 8 miljoonaan vuonna 2025, ja suurin osa siitä käytettiin petollisiin tarkoituksiin.

Trendi ei näytä hidastuvan; Yhdysvalloissa AI-petokset odotetaan yltävän 40 miljardiin Yhdysvaltain dollariin vuoteen 2027 mennessä.

Tällainen kasvu ei rajoitu määrään. Työkalujen kanssa, kuten Sora 2 ja Google (GOOGL ):n Veo 3, AI-generoituja kasvoja, ääniä ja täysipainoista esitystä voidaan nykyään tehdä realistisemmaksi kuin koskaan aiemmin. Kuten tietokoneen ja syväväärennös-tutkija Siwei Lyu on korostanut, nykyiset mallit pystyvät tuottamaan vakaat kasvot ilman vääristymää, ja äänen kloonaus on ylittänyt “erottamattoman kynnyksen”.

Totuus on, että syväväärennökset ohittavat havaitsemisen. Mitä teknologia-yritykset myyvät hauskoina työkaluina, joilla voidaan luoda kaikkea olympialaisten voimistelurutiineista monimutkaisiin taustameloodeihin, on myös hyödynnetty rikollisilla tavoilla kohdistamaan yrityksiä ja yksityishenkilöitä.

Vaatimattoman syväväärennös-havaitsemisen perinteinen tapa – mukaan lukien vedenmerkkien tunnistaminen, airbrush-kasvot ja metadata-tarkastukset – epäonnistuu. Ja, koska ääni-syväväärennökset pysyvät toisinaan yleisimpänä muoto AI-kiihdytetyn petosta ja ääni-phishingin (vishing) kasvua 442 %:lla vuonna 2025, seuraukset ovat jo havaittavissa.

“Muutamassa sekunnissa äänitallennetta riittää luomaan vakuuttava klooni – täydellinen luonnollisella intonaatiolla, rytmiikalla, korostuksella, tunteella, taukoilla ja hengitysmelulla”, Lyu kirjoitti.

Ihmisten kuuntelun tiede

Kintsugi, terveydenhuollon startup-yritys, joka kehittää ääni-biomerkkerteknologiaa kliinisen masennuksen ja ahdistuksen havaitsemiseksi. Heidän työnsä alkoi yksinkertaisesta oletuksesta: meidän on kuunneltava ihmisiä.

”Aloin Kintsugin, koska minulla oli henkilökohtainen ongelma. Viimeistelin lähes viisi kuukautta soittamalla hoitajalle, jotta saisin aikaiseksi alkuvaiheen terapia-ajan, ja kukaan ei koskaan vastannut puheluihini. Yritin jatkuvasti – mutta muistan ajatelleeni selvästi, että jos tämä olisi isäni tai veljeni, he olisivat lopettaneet paljon aikaisemmin kuin minä”, toimitusjohtaja Grace Chang sanoi keskustellessaan Unite.AI:n kanssa.

Kalifornialainen yritys perustettiin vuonna 2019 ratkaisuksi sille, mitä Chang kuvasi “triage-puljetteluna”. Perustaja uskoi, että vakavuuden havaitseminen aiemmin ja passiivisesti voisi auttaa saamaan ihmiset oikeaan hoitoon nopeammin. Ja Kintsugi Voice -ääni-biomerkkiteknologian kautta voidaan tunnistaa kliininen masennus ja ahdistus.

Tutkimus osoittaa, että ääni- ja puhetanalyytikkaa voidaan käyttää onnistuneesti biomerkkerinä mielenterveyden tiloissa. Esimerkiksi toukokuun 2025 tutkimuksessa todettiin, että akustiset biomerkkerit voivat havaita varhaisia merkkejä mielenterveyden ja neurodivergenssin tiloista, ja väitettiin, että lauluanalyysien tulisi olla osa kliinisiä arviointeja potilaiden mahdollisen kognitiivisen heikentymisen arvioimiseksi.

Ääni-mittauksilla on todellakin 78 %:n ja 96 %:n tarkkuusaste masennuksen ja ilman sitä olevien henkilöiden tunnistamisessa American Psychiatric Associationin mukaan. Toisessa tutkimuksessa käytettiin yhden minuutin sanasuoritustestiä, jossa yksilö nimesi mahdollisimman monta sanaa annetussa kategoriassa – ja havaittiin 70 %:n ja 83 %:n tarkkuusaste, kun tutkittava henkilöllä oli sekä masennus että ahdistus.

Kintsugi pyytää käyttäjiltään lyhyen puhetallenteen, jonka jälkeen heidän ääni-biomerkkiteknologiansa analysoi sävelkorkeutta, intonaatiota, ääntä ja taukoja – merkkejä, joiden on havaittu liittyvän tiloihin, kuten masennukseen, ahdistukseen, bipolaariseen häiriöön ja dementian.

Mitä Chang ei aluksi kuitenkaan tajunnut, oli se, että teknologia oli avannut yhden turvallisuusalan nykyisistä haasteista: tunnistamaan, mitä tekee ihmisäänen inhimilliseksi.

Mielenterveydenhoidosta kyberturvalle

Ollessaan New Yorkissa järjestetyssä huippukokouksessa vuoden 2025 lopulla Chang mainitsi ystävälleen turvallisuuden parissa toimivalle, että heidän tiiminsä kokeilut synteettisillä äänillä olivat pettyneitä.

”Olimme tutkineet synteettistä dataa koulutusmateriaaliksi mielenterveyden mallejamme, mutta generoitud äänet olivat niin erilaisia kuin aito ihmisääni, että voimme tunnistaa lähes 100 %:ssa tapauksista”, hän sanoi.

”Hän pysäytti minut ja sanoi: ’Grace – tämä ei ole ratkaistu ongelma turvallisuuden parissa.’ Se oli hetki, jolloin kaikki klikkesi paikoilleen. Sen jälkeen keskusteluissa turvallisuuden, rahoituksen ja tietoliikennealan yritysten kanssa on vahvistettu, kuinka nopeasti syväväärennös-äänihyökkäykset ovat kasvamassa – ja kuinka todellinen on tarve erottaa ihmisen ja synteettisen äänen välillä reaaliaikaisissa puheluissa”, toimitusjohtaja lisäsi.

Huhtikuussa edellisvuonna FBI varoitti vaarallista teksti- ja ääniviestikampanjasta, joka esittäytyi Yhdysvaltain viranomaisten viestienä ja kohdistui entisiin hallituksen työntekijöihin ja heidän yhteyshenkilöihinsä. Suuret kansalliset pankit Yhdysvalloissa olivat myös kohdennettu keskimäärin 5,5 päivittäisellä äänimanipulaatiopetoksella, ja Vanderbiltin yliopiston lääketieteellisen keskuksen henkilökunta raportoi vishing-hyökkäyksiä, joissa esiintyivät valehenkilöt ystävinä, esimiehinä ja työtoverina.

Syväväärennökset eivät kuitenkaan aluksi vaikuttaneet Kintsugin työhön. Vaikka yrityksen tiimi oli käyttänyt valmiita malleja, kuten Cartesia, Sesame ja ElevenLabs, kokeilemaan synteettisiä ääniä asiakaspalvelukeskuksille ja ulospäin suunnattujen työnkulkujen osalta, syväväärennös-petos ei ollut heidän fokuksensa tiiviissä ja helposti saatavilla olevassa markkinassa, jossa oli malleja, kuten Sora.

Ihmisen äänen aitoutta osoittavat signaalit ovat samat biomerkkerit, jotka tekevät jonkun inhimilliseksi. Riippumatta kielestä tai semantiikasta Kintsugi Voice toimii signaali-prosessoinnin ja puheen fyysisen viiveen kanssa, ja havaitsee hienoiset ajalliset, prosodiset muutokset, kognitiivisen kuormituksen ja fysiologiset merkit, jotka heijastavat, miten puhetta tuotetaan… eikä sitä, mitä sanotaan.

”Synteettiset äänet voivat kuulosta sujuvilta, mutta ne eivät sisällä samoja biologisia ja kognitiivisia artefakteja”, Chang sanoi. Yrityksen malli on jatkuvasti yksi parhaista havaitsemistarkkuudessa, ja se käyttää vain 3-5 sekuntia äänitallennetta.

Kintsugi voi olla vallankumouksellinen niille, joilla on mielenterveyden haasteita, erityisesti alueilla, joissa ammattilaisten kanssa tapaaminen vie aikaa ja resursseja. Samalla yrityksen teknologia merkitsee vallankumousta syväväärennös-havaitsemiselle ja kyberturvalle yleensä: aitoutta havaitseminen, ei syväväärennösten tunnistaminen.

Tulevaisuus perustuu inhimilliselle teknologialle

Kyberturvalle on pitkään keskittynyt pahantahtoiseen teknologian käyttöön tai itse uhriin. Kintsugin vahingossa tehty löytö panee kuitenkin ihmisyyden itsensä.

”Toimimme täysin eri pinnalla: inhimillisen aitouden itsessään. LLM:t eivät pysty luotettavasti havaitsemaan LLM:llä generoituja sisältöjä, ja artefakti-pohjaiset menetelmät ovat hauraita. Suurten, kliinisesti merkittyjen tietojoukkojen kerääminen, joka koodaa todellisen inhimillisen muuntelun, on kallista, hidasta ja useimpien turvallisuusyritysten ydinosaamisen ulottumattomissa — mikä tekee tämän lähestymistavan haasteelliseksi”, Chang huomautti.

Yrityksen lähestymistapa viittaa myös laajempaan muutokseen: alueiden ylittävään innovaatioon. Terveydenhuollon edelläkävijät saattavat johtaa AI-tukeista vishing-havaitsemista, kuten avaruusteknologian innovaattorit voivat tukea uusia hätätilannejärjestelmiä tai pelaamisen arkkitehtuuri ja kaupunkisuunnittelu.

Chang aikoo tulla standardiksi todellisten ihmisten ja lopulta todellisen aikomisen todistamiseksi ääniviestinnässä.

”Kuten HTTPS:stä tuli verkon oletusarvoinen luottamuksen kerros, uskomme, että ’ihmisen todistus’ tulee olemaan perustava kerros äänipohjaisiin järjestelmiin. Signaali on tämän infrastruktuurin alku”, hän sanoi.

Kun generatiivinen AI jatkaa kiihtymistään, tehokkaimmat turvallisuusvarmistukset saattavat tulla ymmärtämällä, mitä tekee ihmiset… hyvin, inhimilliseksi.

Salomé on Medellínissä syntynyt journalisti ja vanhempi toimittaja Espacio Media Incubatorissa. Taustansa historiassa ja politiikassa Salomén työ korostaa uusien teknologioiden sosiaalista merkitystä. Hän on ollut mukana Al Jazeera, Latin America Reports ja The Sociable julkaisuissa muun muassa.