Modele i platformy AI
Jak narzędzie AI do zdrowia psychicznego przypadkowo odkryło dokładną detekcję głębokich fałszerstw

Gdy gigant technologiczny Open AI wprowadził swój flagowy model generacyjny wideo i audio Sora 2 we wrześniu 2025 roku, fałszywe filmy zalewają platformy mediów społecznościowych, sprawiając, że widzowie stają się coraz bardziej zaznajomieni z potencjalnie niebezpiecznymi hiperrealistycznymi treściami.
Chociaż Open AI uznał odpowiedzialne wprowadzenie Sora 2 za najwyższy priorytet, twierdząc, że da to użytkownikom „narzędzia i opcje, aby kontrolować to, co widzą w swoim feedzie” i kontrolę nad ich podobieństwem od końca do końca, badanie z października 2025 roku wykazało, że model produkował fałszywe filmy 80% czasu.
Od filmów, które naśladują raporty informacyjne urzędnika wyborczego z Mołdawii niszczącego karty wyborcze do sfabrykowanych scen, w których urzędnik imigracyjny zatrzymuje małe dziecko lub rzecznik Coca-Cola ogłasza, że firma nie będzie sponsorować Super Bowl, stawka na produkcję dezinformacji w świecie połączonym nie może być wyższa.
Poza Sora: Vishing
Nawet przed wprowadzeniem narzędzia Open AI, tworzenie i rozpowszechnianie plików głębokich fałszerstw w Internecie było w zwyżkowej tendencji. Według raportu z września 2025 roku firmy bezpieczeństwa cybernetycznego DeepStrike, treści głębokich fałszerstw wzrosły z 500 000 w 2023 roku do imponujących 8 milionów w 2025 roku, z których większość była wykorzystywana do celów oszustw.
Trend nie pokazuje żadnych oznak spowolnienia; oszustwa AI w samych Stanach Zjednoczonych spodziewa się osiągnąć 40 miliardów dolarów amerykańskich do 2027 roku.
Taki wzrost nie jest ograniczony do ilości. Z narzędziami takimi jak Sora 2 i Google (GOOGL ) Veo 3, treści generowane przez AI twarzy, głosów i pełnych występów są teraz bardziej realistyczne niż kiedykolwiek. Jak sygnalizował komputerowy naukowiec i badacz głębokich fałszerstw Siwei Lyu, współczesne modele są w stanie produkować stabilne twarze bez zniekształceń lub odkształceń, a klonowanie głosu przekroczyło „niemożliwy do odróżnienia” próg.
Prawda jest taka, że głębokie fałszerstwa wyprzedzają wykrywanie. To, co firmy technologiczne sprzedają jako zabawne narzędzia do generowania wszystkiego, od rutyn treningowych olimpijskich do zaawansowanych tłów, zostało również wykorzystane przez przestępców do atakowania firm i osób.
Tylko w pierwszej połowie 2025 roku incydenty z głębokimi fałszerstwami spowodowały straty w wysokości 356 milionów dolarów amerykańskich dla firm i 541 milionów dolarów amerykańskich dla osób fizycznych.
Tradycyjne wykrywanie głębokich fałszerstw – w tym identyfikowanie znaczników wodnych, retuszowanych twarzy i sprawdzanie metadanych – nie powodzi się. A gdy głębokie fałszerstwa głosowe pozostają drugim najczęstszym rodzajem oszustw z użyciem AI i oszustw głosowych (vishing) wzrosły o 442% w 2025 roku, konsekwencje są już odczuwalne.
„Kilka sekund dźwięku wystarcza teraz, aby wygenerować przekonywującą kopię – wraz z naturalną intonacją, rytmem, akcentem, emocją, pauzami i hałasem oddechu”, napisał Lyu.
Nauka słuchania ludzi
Kintsugi, startup z branży zdrowia psychicznego, rozwija technologię biomarkerów głosowych AI w celu wykrycia objawów depresji klinicznej i lęku. Ich praca rozpoczęła się od pozornie prostej premiery: musimy słuchać ludzi.
„Założyłem Kintsugi z powodu problemu, który doświadczyłem osobiście. Spędziłem prawie pięć miesięcy, dzwoniąc do mojego dostawcy, aby umówić się na pierwszą wizytę terapeutyczną, i nikt nie oddzwonił. Kontynuowałem – ale pamiętam, że myślałem bardzo wyraźnie, że gdyby to był mój ojciec lub brat, przestaliby znacznie wcześniej niż ja”, powiedział CEO Grace Chang w rozmowie z Unite.AI.
Firma z siedzibą w Kalifornii została założona w 2019 roku jako rozwiązanie „wąskiego gardła triażu”. Założyciel wierzył, że wykrywanie ciężkości wcześniej i biernie mogłoby pomóc ludziom uzyskać odpowiedni poziom opieki szybciej. A przez Kintsugi Voice, biomarkery głosowe identyfikują depresję kliniczną i lęk.
Badania potwierdzają skuteczne wykorzystanie analizy mowy i głosu napędzanej przez AI jako biomarkera stanów zdrowia psychicznego. Na przykład, artykuł z maja 2025 roku wykazał, że biomarkery akustyczne mogą wykryć wczesne objawy zdrowia psychicznego i neurodywergencji, a także argumentował za integracją analizy śpiewu w środowiskach klinicznych w celu oceny potencjalnego spadku poznawczego pacjentów.
Miary głosowe mają rzeczywiście wskaźnik dokładności od 78% do 96% w identyfikowaniu osób z depresją w porównaniu z tymi, którzy jej nie mają, według Amerykańskiego Towarzystwa Psychiatrycznego. Inne badanie wykorzystało jeden minutowy test fluencji werbalnej, w którym osoba wymieniła tyle słów, ile tylko mogła w danej kategorii – stwierdzając 70% do 83% dokładności w wykryciu, czy osoba miała depresję i lęk.
Aby ocenić stan zdrowia psychicznego swoich użytkowników, Kintsugi prosi o krótki klip mowy, po czym jego technologia biomarkerów głosowych analizuje wysokość, intonację, ton i pauzy – markery stwierdzono, że są związane z stanami takimi jak depresja, lęk, zaburzenie dwubiegunowe i demencja.
Co Chang nie zrozumiał początkowo, było to, że technologia odblokowała jeden z najbardziej palących współczesnych wyzwań branży bezpieczeństwa: identyfikację tego, co sprawia, że głosy ludzkie są ludzkie.
Z opieki zdrowia psychicznego do bezpieczeństwa cybernetycznego
Podczas uczestniczenia w szczycie w Nowym Jorku pod koniec 2025 roku, Chang powiedział do przyjaciela z branży bezpieczeństwa, że eksperymenty jego zespołu z syntetycznymi głosami były rozczarowujące.
„Eksperymentowaliśmy z danymi syntetycznymi, aby uzupełnić szkolenie naszych modeli zdrowia psychicznego, ale wygenerowane głosy były tak różne od autentycznej mowy ludzkiej, że mogliśmy powiedzieć prawie 100% czasu”, powiedziała.
„On przestał i powiedział: „Grace, to nie jest rozwiązane w bezpieczeństwie”. To był moment, kiedy wszystko się kliknęło. Od tego czasu rozmowy z firmami z branży bezpieczeństwa, usług finansowych i telekomunikacyjnych potwierdziły, jak szybko ataki głosowe głębokich fałszerstw rosną – i jak pilnie potrzebne jest odróżnianie głosów ludzkich od syntetycznych w czasie rzeczywistym”, dodała CEO.
W kwietniu ubiegłego roku FBI ostrzegało przed złośliwą kampanią wiadomości tekstowych i głosowych, która podszywała się pod komunikaty od wysokich urzędników Stanów Zjednoczonych i celowała w byłych pracowników rządu i ich kontakty. Duże banki narodowe w Stanach Zjednoczonych były również atakowane przez średnio 5,5 dziennych prób oszustw głosowych, a personel szpitala Vanderbilt University Medical Center zgłaszał ataki vishingowe od osób podszywających się pod przyjaciół, przełożonych i współpracowników.
Niezależnie od tego, głębokie fałszerstwa nie były początkowo uwzględnione w pracy Kintsugi. Podczas gdy zespół firmy używał modeli typu Cartesia, Sesame i ElevenLabs do eksperymentowania z syntetycznymi głosami dla agentów call center i workflow outbound, oszustwa głębokich fałszerstw nie były ich celem wśród rynku, na którym dostępne były modele takie jak Sora.
Sygnały na poziomie ludzkim, które wskazują na autentyczność głosu, są tymi samymi biomarkerami, które sprawiają, że ktoś jest człowiekiem. Niezależnie od języka lub semantyki, Kintsugi Voice działa z przetwarzaniem sygnału i fizyczną latencją mowy, przechwytując subtelne czasowanie, zmienność prozodyczną, obciążenie poznawcze i markery fizjologiczne, które odzwierciedlają, jak jest wytwarzana mowa… a nie to, co się mówi.
„Głosy syntetyczne mogą brzmieć płynnie, ale nie posiadają tych samych artefaktów biologicznych i poznawczych”, powiedziała Chang. Model firmy jest stale wśród najlepszych wykonawców pod względem dokładności wykrywania, używając tylko 3 do 5 sekund dźwięku.
Kintsugi może być rewolucyjne dla tych, którzy mają trudności ze zdrowiem psychicznym, szczególnie w obszarach, w których uzyskanie leczenia z profesjonalistami wymaga czasu i zasobów. W tym samym stopniu technologia firmy stanowi rewolucję w wykrywaniu głębokich fałszerstw i bezpieczeństwie cybernetycznym: wykrywanie autentyczności zamiast rozpoznawania głębokich fałszerstw.
Przyszłość leży w technologiach ukierunkowanych na człowieka
Bezpieczeństwo cybernetyczne długo koncentrowało się na szkodliwym użyciu technologii lub samych sprawcach. Przypadkowe odkrycie Kintsugi jednak stawia na samego człowieka.
„Działamy na zupełnie innej powierzchni: samej autentyczności ludzkiej. LLM nie mogą niezawodnie wykryć treści generowanej przez LLM, a metody oparte na artefaktach są kruche. Przechwycenie dużych, klinicznie oznaczonych zbiorów danych, które kodują rzeczywistą zmienność ludzką, jest drogie, wolne i poza podstawową ekspertyzą większości firm bezpieczeństwa — co sprawia, że ten podejście jest trudne do powielenia”, zauważyła Chang.
Podejście startupu sugeruje również szerszy trend: innowacje międzydomenowe. Ci, którzy są na czele w opiece zdrowotnej, mogą poprowadzić ład w wykrywaniu oszustw głosowych z użyciem AI, tak jak innowatorzy w technologiach kosmicznych mogą wspierać nowe mechanizmy reagowania w sytuacjach awaryjnych, lub architekci i planiści miast mogą wspierać architekturę i planowanie miast.
Jeśli chodzi o Chang, planuje stać się standardem dla weryfikacji prawdziwych ludzi i ostatecznie prawdziwych intencji za pośrednictwem interakcji głosowych.
„Tak jak HTTPS stało się warstwą zaufania domyślnego dla sieci, wierzymy, że „dowód ludzki” stanie się warstwą podstawową dla systemów opartych na głosie. Sygnał jest początkiem tej infrastruktury”, powiedziała.
Ponieważ sztuczna inteligencja generatywna nadal przyspiesza, najskuteczniejsze zabezpieczenia mogą pochodzić z zrozumienia, co sprawia, że ludzie są… no cóż, ludźmi.












