Modele și platforme AI
Cum a descoperit accidental un instrument de sănătate mintală AI o detecție precisă a deepfake-urilor

În timp ce gigantul tehnologic Open AI a lansat modelul său generativ de video și audio Sora 2 în septembrie 2025, videourile deepfake au inondat platformele de socializare, făcând audiența tot mai familiară cu conținutul hiper-realistic și potențial periculos.
Deși Open AI a considerat lansarea responsabilă a Sora 2 ca o prioritate de top, afirmând că va oferi utilizatorilor „uneltele și opțiunile de a fi în controlul a ceea ce văd în fluxul lor” și controlul asupra asemănării de la capăt la capăt, un studiu din octombrie 2025 a constatat că modelul a produs videouri false în 80% din cazuri.
De la videouri care imită rapoarte de știri despre un funcționar electoral din Moldova care distruge buletine de vot la scene fabricate cu un copil reținut de ofițerii de imigrări sau un purtător de cuvânt al Coca-Cola care anunță că compania nu va sponsoriza Super Bowl, mizele pentru producerea de informații false într-o lume interconectată nu pot fi mai mari.
Dincolo de Sora: Vishing
Chiar înainte ca instrumentul Open AI să fie lansat, crearea și diseminarea online a fișierelor deepfake erau în creștere. Conform unui raport din septembrie 2025 al firmei de securitate cibernetică DeepStrike, conținutul deepfake a crescut de la 500.000 în 2023 la 8 milioane în 2025, multe dintre acestea fiind utilizate în scopuri frauduloase.
Tendința nu arată semne de oprire; frauda cu AI în Statele Unite este prevăzută să ajungă la 40 de miliarde de dolari americani până în 2027.
Un astfel de val nu este limitat la cantitate. Cu unelte precum Sora 2 și Veo 3 de la Google (GOOGL ), conținutul generat de inteligența artificială cu fețe, voci și reprezentații complete este mai realist ca oricând. Așa cum a semnalat omul de știință și cercetător al deepfake-urilor Siwei Lyu, modelele contemporane sunt capabile să producă fețe stabile fără deformări, în timp ce clonarea vocii a depășit un „prag de nediferențiere”.
Adevărul este că deepfake-urile depășesc detecția. Ce ceea ce companiile tehnologice vând ca unelte divertismente pentru a genera totul, de la rutine de gimnastică olimpică la peisaje sonore sofisticate, a fost utilizat și de criminali pentru a ținta întreprinderi și persoane. Doar în primul semestru al anului 2025, incidentele deepfake au provocat pierderi de 356 de milioane de dolari americani pentru companii și 541 de milioane de dolari americani pentru persoane.
Detecția tradițională a deepfake-urilor – inclusiv identificarea semnelor de apă, fețelor retușate și verificarea metadatelor – eșuează. Și, pe măsură ce deepfake-urile vocale rămân a doua formă cea mai frecventă de fraudă cu inteligență artificială și phishing de voce (vishing) a crescut cu 442% în 2025, consecințele sunt deja resimțite.
„Câteva secunde de audio sunt suficiente pentru a genera un clon convingător – complet cu intonație naturală, ritm, accent, emoție, pauze și zgomot de respirație,” a scris Lyu.
Știința ascultării oamenilor
Kintsugi, o companie de sănătate care dezvoltă tehnologie de biomarker vocal AI pentru a detecta semnele de depresie clinică și anxietate. Lucrarea lor a început de la o premisă aparent simplă: trebuie să ascultăm oamenii.
„Am început Kintsugi din cauza unei probleme pe care am experimentat-o personal. Am petrecut aproape cinci luni sunând la furnizorul meu pentru a programa o întâlnire inițială de terapie, și nimeni nu mi-a răspuns niciodată la apeluri. Am continuat să încerc – dar îmi amintesc că m-am gândit foarte clar că, dacă ar fi fost tatăl meu sau fratele meu, ar fi renunțat mult mai devreme decât mine,” a spus CEO Grace Chang într-o conversație cu Unite.AI.
Compania cu sediul în California a fost fondată în 2019 ca o soluție pentru ceea ce Chang a descris ca o „blocaj de triaj”. Fondatorul a crezut că detectarea gravității mai devreme și pasivă ar putea ajuta oamenii să ajungă la nivelul potrivit de îngrijire mai repede. Și, prin Kintsugi Voice, biomarkerii vocali identifică depresia clinică și anxietatea.
Cercetările abundă și demonstrează utilizarea cu succes a analizei vorbirii și a vocii conduse de inteligența artificială ca biomarker pentru afecțiuni mintale. Un studiu din mai 2025, de exemplu, a constatat că biomarkerii acustici pot detecta semnele timpurii ale sănătății mintale și neurodivergenței și a argumentat pentru integrarea analizei cântecului în mediile clinice pentru a evalua declinul cognitiv potențial al pacienților.
Măsurătorile vocale, de fapt, au o rată de acuratețe de 78% la 96% în identificarea persoanelor cu depresie versus cele fără, conform Asociației Americane de Psihiatrie. Un alt studiu a utilizat un test de fluorență verbală de un minut în care o persoană a numit cât mai multe cuvinte dintr-o categorie dată – găsind o acuratețe de 70% la 83% în detectarea subiectului care avea atât depresie, cât și anxietate.
Pentru a evalua starea de sănătate mintală a utilizatorilor, Kintsugi solicită un clip scurt de vorbire, după care tehnologia sa de biomarker vocal analizează pitch-ul, intonația, tonul și pauzele – markeri găsiți a fi asociați cu afecțiuni precum depresia, anxietatea, tulburarea bipolară și demența.
Ce nu a realizat inițial Chang, totuși, a fost că tehnologia a deblocat una dintre cele mai presante provocări contemporane ale industriei securității: identificarea a ceea ce face vocile umane umane.
De la îngrijirea sănătății mintale la securitatea cibernetică
În timp ce participa la un summit în New York la sfârșitul anului 2025, Chang i-a menționat unui prieten din domeniul securității cibernetice că experimentarea echipei sale cu voci sintetice a fost dezamăgitoare.
„Am explorat date sintetice pentru a îmbunătăți formarea modelului nostru de sănătate mintală, dar vocile generate au fost atât de diferite de vorbirea umană autentică, încât am putut spune aproape 100% din timp,” a spus ea.
„El m-a oprit și mi-a spus: «Grace, aceasta nu este o problemă rezolvată în securitate.» Acesta a fost momentul în care totul a devenit clar. De atunci, conversațiile cu companii de securitate, servicii financiare și telecomunicații au confirmat cât de repede atacurile de voce deepfake sunt în creștere – și cât de reală este nevoia de a distinge vocile umane de cele sintetice în apelurile live,” a adăugat CEO-ul.
În aprilie anul trecut, FBI a avertizat asupra unei campanii de mesaje text și vocale malicioase care s-a prezentat ca comunicări de la funcționari superiori ai Statelor Unite și a vizat foști lucrători guvernamentali și contactele lor. Băncile naționale mari din Statele Unite au fost, de asemenea, țintite cu 5,5 încercări zilnice de fraudă prin manipularea vocii, iar personalul spitalului Vanderbilt University Medical Center a raportat atacuri de vishing de la persoane care se pretindeau a fi prieteni, supraveghetori și colegi.
Indiferent, deepfake-urile nu au fost inițial luate în considerare în munca Kintsugi. În timp ce echipa companiei a folosit modele off-the-shelf precum Cartesia, Sesame și ElevenLabs pentru a experimenta cu voci sintetice pentru agenți de call center administrativ și fluxuri de lucru ieșire, frauda deepfake nu a fost focusul lor într-un mediu de piață aglomerat și accesibil care prezintă modele precum Sora.
Semnalele umane care indică autenticitatea vocii, totuși, sunt aceiași biomarkeri care fac ca cineva să fie uman în primul rând. Indiferent de limbă sau semantică, Kintsugi Voice funcționează cu procesarea semnalului și latenta fizică a vorbirii, capturând timpi subtili, variabilitatea prosodică, încărcătura cognitivă și markerii fiziologici care reflectă modul în care vorbirea este produsă… nu ceea ce se spune.
„Vocile sintetice pot suna fluent, dar nu posedă aceleași artefacte biologice și cognitive,” a spus Chang. Modelul companiei este constant un performer de top în acuratețea detectării, utilizând doar 3 până la 5 secunde de audio.
Kintsugi poate fi revoluționară pentru cei care se luptă cu sănătatea mintală, în special în zonele în care obținerea tratamentului cu profesioniști necesită timp și resurse. În același timp, tehnologia sa reprezintă o revoluție pentru detectarea deepfake și securitatea cibernetică în general: detectarea autenticității și nu recunoașterea deepfake-urilor.
Viitorul se află în tehnologia centrată pe om
Securitatea cibernetică a fost mult timp axată pe utilizarea malignă a tehnologiilor sau a autorilor înșiși. Descoperirea accidentală a Kintsugi, totuși, se bazează pe umanitate însăși.
„Operăm pe o suprafață complet diferită: autenticitatea umană însăși. LLM-urile nu pot detecta conținutul generat de LLM în mod fiabil, iar metodele bazate pe artefacte sunt fragile. Capturarea unor seturi de date mari și etichetate clinic care codifică variabilitatea umană reală este scumpă, lentă și în afara expertizei de bază a majorității companiilor de securitate – ceea ce face ca această abordare să fie dificil de replicat,” a remarcat Chang.
Abordarea startup-ului sugerează, de asemenea, o schimbare mai amplă: inovarea transversală. Cei care sunt în fruntea sănătății ar putea conduce încărcătura în detectarea vishing-ului bazat pe inteligența artificială, la fel cum inovatorii din tehnologia spațială ar putea sprijini noi mecanisme de răspuns la urgențe, sau arhitecții și planificatorii urbani.
În ceea ce privește Chang, ea plănuiește să devină un standard pentru verificarea oamenilor reali și, în cele din urmă, a intenției reale prin interacțiuni vocale.
„La fel cum HTTPS a devenit un strat de încredere implicit pentru web, credem că «dovada umană» va deveni un strat fundamental pentru sistemele bazate pe voce. Signal este începutul acestei infrastructuri,” a spus ea.
Pe măsură ce inteligența artificială generativă continuă să accelereze, cele mai eficiente măsuri de protecție ar putea veni din înțelegerea a ceea ce face oamenii… să fie oameni.












