Modely a platformy AI
Jak nástroj pro duševní zdraví AI náhodou objevil přesnou detekci Deepfake

Když technologický gigant Open AI spustil svou vlajkovou loď Sora 2 video a audio generativní model v září 2025, deepfake videa zaplavila sociální média, čímž se publikum stalo stále více熟ým s potenciálně nebezpečným hyper-reálným obsahem.
Ačkoli Open AI považoval zodpovědný spuštění Sora 2 za nejvyšší prioritu, tvrdil, že poskytne uživatelům „nástroje a možnost být ve správě nad tím, co vidí ve svém feedu“ a kontrolu nad jejich podobiznou od začátku do konce, říjnová studie z roku 2025 zjistila, že model produkoval falešné tvrzení videa 80 % času.
Od videí, která napodobovala zprávy o moldavském úředníkovi, který ničil volební lístky, až po vymyšlené scény, ve kterých byl batole zadržen imigračními úředníky nebo mluvčí Coca-Coly oznámil, že společnost nebude sponzorovat Super Bowl, sázky na výrobu dezinformací v propojeném světě nemohly být vyšší.
Mimo Sora: Vishing
I předtím, než Open AI spustil svůj nástroj, byla tvorba a online šíření deepfake souborů na vzestupu. Podle září 2025 zprávy kyberbezpečnostní firmy DeepStrike se deepfake obsah zvýšil z 500 000 v roce 2023 na ohromujících 8 milionů v roce 2025, z nichž většina byla použita pro podvodné účely.
Trend ukazuje, že se nezastaví; AI podvody v USA alone se očekává, že dosáhne 40 miliard USD do roku 2027.
Takový nárůst není omezen na množství. S nástroji jako Sora 2 a Googleovým Veo 3 je obsah generovaných AI obličejů, hlasů a plnohodnotných výkonů nyní realističtější než kdykoli předtím. Jak signál počítačového vědce a deepfake výzkumníka Siwei Luy, současné modely jsou schopny produkovat stabilní tváře bez deformací nebo zkreslení, zatímco voice cloning překročil „nerozeznatelný práh“.
Pravda je, že deepfakes předhánějí detekci. Co technologické společnosti prodávají jako zábavné nástroje pro generování všeho od olympijských gymnastických rutin až po sofistikované zvukové kulisy, bylo také využito kriminálníky k cílení na podniky a jednotlivce. Jen v prvních šesti měsících roku 2025 deepfake incidenty způsobily ztráty ve výši 356 milionů USD pro společnosti a 541 milionů USD pro jednotlivce.
Tradiční detekce deepfakes – včetně identifikace vodítek, retušovaných tváří a kontrol metadat – selhává. A zatímco voice deepfakes zůstávají druhým nejčastějším formou AI-podporovaného podvodu a voice phishing (vishing) vzrostl o 442 % v roce 2025, důsledky jsou již cítit.
„Několik sekund audio nyní stačí k vygenerování přesvědčivého klonu – včetně přirozené intonace, rytmu, zdůraznění, emocí, pauz a dýchacích hluků,“ napsal Lyu .
Věda naslouchání lidem
Kintsugi, healthtech startup, který vyvíjí AI hlasové biomarker technologii pro detekci příznaků klinické deprese a úzkosti. Jejich práce začala z jednoduché premisy: musíme naslouchat lidem.
„Založila jsem Kintsugi kvůli problému, který jsem osobně zažila. Strávila jsem téměř pět měsíců voláním svého poskytovatele, abych naplánovat počáteční terapeutické sezení, a nikdo mi nikdy nevrátil hovor. Pokračovala jsem – ale pamatuji si, že jsem si myslela velmi jasně, že kdyby to byl můj otec nebo bratr, přestali by dlouho předtím, než jsem přestala já,“ řekla CEO Grace Chang v rozhovoru s Unite.AI.
Kalifornská společnost byla založena v roce 2019 jako řešení „triage bottleneck“. Zakladatelka věřila, že detekce závažnosti dříve a pasivně by mohla pomoci lidem dostat se k správné úrovni péče rychleji. A prostřednictvím Kintsugi Voice, hlasové biomarkery identifikují klinickou deprese a úzkost.
Výzkum potvrzuje úspěšné použití AI-podporované řečové a hlasové analýzy jako biomarkeru pro duševní zdraví. Červnová studie z roku 2025, například, zjistila, že akustické biomarkery mohou detekovat časná znamení duševního zdraví a neurodivergence, a argumentovala pro integraci analýz zpěvu v klinických prostředích pro hodnocení kognitivního poklesu pacientů.
Hlasové míry, ve skutečnosti, mají přesnost 78 % až 96 % při identifikaci lidí s depresemi versus těch bez nich, podle Americké psychiatrické asociace. Další studie použila jednominutový verbální fluency test, ve kterém jedinec jmenoval tolik slov, kolik mohl, v dané kategorii – nalezená 70 % až 83 % přesnost při detekci, zda subjekt měl deprese a úzkost.
Kintsugi žádá krátký hlasový klip, po kterém jeho hlasový biomarker technologii analyzuje tón, intonaci, tón a pauzy – markery nalezené být spojené s podmínkami, jako je deprese, úzkost, bipolární porucha a demence.
Co Chang původně nevěděla, však bylo, že technologie odemkla jednu z bezpečnostních průmyslových nejnaléhavějších současných výzev: identifikace toho, co dělá lidské hlasy lidskými.
Z duševní péče do kybernetické bezpečnosti
Zatímco se zúčastňovala summitu v New Yorku na konci roku 2025, Chang zmínila svému příteli v oblasti kybernetické bezpečnosti, že její tým experimentoval se syntetickými hlasy.
„Byli jsme zkoumali syntetická data pro školení našich modelů duševního zdraví, ale generované hlasy byly tak odlišné od autentických lidských hlasů, že jsme mohli říci téměř 100 % času,“ řekla.
„Zastavil mě a řekl: „Grace – to není vyřešený problém v bezpečnosti.“ To byl moment, kdy všechno zapadlo. Od té doby konverzace se zabezpečením, finančními službami a telekomunikačními společnostmi potvrdily, jak rychle deepfake hlasové útoky rostou – a jak reálná je potřeba rozlišovat lidské a syntetické hlasy v živých hovorech,“ dodala CEO.
V dubnu loňského roku FBI varovala před zlomyslnou textovou a hlasovou zprávou, která se vydávala za komunikaci od seniorů úředníků USA a cílené na bývalé vládní pracovníky a jejich kontakty. Velké národní banky v USA byly také cíleny průměrně 5,5 denními pokusy o hlasové manipulaci a hospitalizační personál na Vanderbilt University Medical Center hlásila vishing útoky od impersonátorů, kteří se vydávali za přátele, nadřízené a kolegy.
Deepfakes původně nefigurovaly v práci Kintsugi. Zatímco tým společnosti používal off-the-shelf modely, jako je Cartesia, Sesame a ElevenLabs, pro experimentování se syntetickými hlasy pro administrativní call centra a outbound workflows, deepfake podvody nebyly jejich zaměřením uprostřed dostupného trhu s modely, jako je Sora.
Lidské signály, které indikují autenticitu hlasu, jsou stejné biomarkery, které dělají někoho lidským. Nezávisle na jazyku nebo sémantice, Kintsugi Voice funguje se signálovou procesí a fyzickou latencí řeči, zachycuje jemné časování, prosodickou variabilitu, kognitivní zátěž a fyziologické markery, které odrážejí, jak je řeč produkována… ne co je řečeno.
„Syntetické hlasy mohou znít plynule, ale nemají stejné biologické a kognitivní artefakty,“ řekla Chang. Model společnosti je konzistentně top-decile performer v detekční přesnosti, používající pouze 3 až 5 sekund audio.
Kintsugi může být revoluční pro ty, kteří bojují s duševním zdravím, zejména v oblastech, kde je obtížné získat odbornou péči. Stejně tak její technologie představuje revoluci pro detekci deepfakes a kybernetickou bezpečnost obecně: autentizační detekce místo detekce deepfakes.
Budoucnost leží v lidsky zaměřené technologii
Kybernetická bezpečnost se dlouho soustředila na zneužití technologií nebo pachatele samotné. Náhodné objevy Kintsugi, však vsází na lidskost sama o sobě.
„Fungujeme na úplně jiné povrchu: lidské autenticitě sama. LLMs nemohou spolehlivě detekovat LLM-generovaný obsah, a metody založené na artefaktech jsou křehké. Zachycení velkých, klinicky označených dat, která kódují skutečnou lidskou variabilitu, je drahé, pomalé a mimo hlavní odbornost většiny bezpečnostních společností — což činí tento přístup obtížným pro replikaci,“ poznamenala Chang.
Přístup startupu také naznačuje širší posun: inovace napříč doménami. Ti, kteří jsou v čele v oblasti zdravotní péče, mohou vést útok v AI-podporované detekci vishingu, stejně jako ti, kteří jsou inovátory ve vesmírné technologii, mohou podporovat nové mechanismy pro nouzové reakce, nebo architekti a urbanisté.
Chang plánuje stát se standardem pro ověření skutečných lidí a nakonec skutečné záměry prostřednictvím hlasových interakcí.
„Stejně jako HTTPS se stalo výchozím bezpečnostním vrstvou pro web, věříme, že „důkaz lidskosti“ se stane základním vrstvou pro hlasové systémy. Signal je začátek této infrastruktury,“ řekla.
Jak generativní AI pokračuje ve zrychlování, nejúčinnější záruky mohou pocházet z pochopení toho, co dělá lidi… prostě lidskými.












