AIモデルとプラットフォーム
メンタルヘルスAIツールが偶然に発見した正確なディープフェイク検出

テクノロジー大手Open AIが2025年9月に旗艦のSora 2ビデオとオーディオ生成モデルを発売したとき、ディープフェイク動画がソーシャルメディアプラットフォームを氾濫し、視聴者は潜在的に危険な超現実的なコンテンツにますます慣れ親しんできた。
Open AIは、Sora 2の責任ある発売を最優先事項とみなし、主張したように、ユーザーに「自分が見るコンテンツを制御するためのツールと選択肢」を与え、自分自身の似姿をエンドツーエンドで制御できるようにしたが、2025年10月の調査では、このモデルは80%の時間に偽の主張動画を生成したことが発覚した。
モルドバの選挙担当官が投票用紙を破棄するニュースリポートを模倣した動画から、移民官が幼児を拘束する場面やコカ・コーラのスポークスパーソンがスーパーボウルのスポンサーになることを発表する場面まで、誤情報を生み出すための賭けは、相互接続された世界ではさらに高まっている。
ソラを超えて:フィッシング
Open AIのツールが発売される前から、ディープフェイクファイルの作成とオンラインでの拡散は増加していた。サイバーセキュリティ企業DeepStrikeの2025年9月の報告によると、ディープフェイクコンテンツは2023年の50万件から2025年の800万件に急増し、その多くは詐欺目的で使用された。
この傾向は止まる兆しを見せていない。米国でのAI詐欺は2027年までに400億ドルに達することが予測されており、2025年上半期だけで、企業は3億5600万ドル、個人は5億4100万ドルの損失を出した。
Sora 2やGoogleのVeo 3のようなツールにより、AI生成された顔、声、フルボディパフォーマンスのコンテンツは今までで最もリアルなものとなっている。コンピュータサイエンティストでディープフェイク研究者のSiwei Lyuは、現在のモデルは歪みや歪曲なしに安定した顔を生成でき、声のクローニングは区別できないしきい値を超えたと示唆した。
ディープフェイクは検出を上回っている。テクノロジー企業が「楽しいツール」として販売するものは、オリンピックの体操競技ルーチンから洗練されたバックグラウンドサウンドスケープまで、すべてを生成するために使用されており、同時に犯罪者もビジネスや個人を標的にするために使用している。2025年上半期だけで、ディープフェイク事件は企業に3億5600万ドル、個人に5億4100万ドルの損失をもたらした。
従来のディープフェイク検出方法、つまりウォーターマークの特定、エアブラシで加工された顔やメタデータのチェックなどは、効果を失っている。声のディープフェイクは、AIを使用した詐欺の2番目に多い形態であり、声によるフィッシング(2025年には442%増加した)が増加しているため、影響はすでに現れている。
「数秒のオーディオだけで、自然なイントネーション、リズム、強調、感情、パウゼ、呼吸ノイズを伴う説得力のあるクローンを生成できる」とLyuは書いた。
人間を聞く科学
Kintsugiは、臨床的うつ病と不安を検出するためのAIボイスバイオマーカーテクノロジーを開発しているヘルスケアスタートアップである。彼らの仕事は、人間を聞くという単純な前提から始まった。
「私はKintsugiを創設したのは、自分自身で経験した問題があったからです。私は5ヶ月近くかけて、セラピストの初回予約を試みるために電話をかけ続けましたが、誰も電話に応じてくれませんでした。私は何度も試みましたが、もしも私の父や兄が同じ状況にあったら、もっと早く諦めていたに違いないと思いました」と、CEOのGrace ChangはUnite.AIとの対話で述べた。
カリフォルニア州を拠点とするこの会社は、2019年に「トライアージュボトルネック」としてChangが説明した問題を解決するために設立された。創設者は、重症度を早期に、受動的に検出できることで、適切なケアレベルに人々をより迅速に導くことができると信じていた。Kintsugi Voiceを通じて、ボイスバイオマーカーは臨床的うつ病と不安を特定する。
AI駆動のスピーチおよび声分析を精神保健状態のバイオマーカーとして使用することの成功を示す研究は数多く存在する。2025年5月の論文では、発見されたように、音響バイオマーカーは早期の精神保健と神経発達の兆候を検出でき、臨床現場での歌唱分析の統合を主張し、認知機能の低下を評価するために患者への潜在的な認知低下を評価することを主張した。
声の尺度は、実際には、うつ病がある人とない人の区別において78%から96%の精度で認識できることがわかっている。アメリカ精神医学協会によると。別の研究では、1分間の言語フローセンステストで、個人に可能な限り多くの単語を特定のカテゴリで言ってもらうと、70%から83%の精度で、対象者がうつ病と不安を両方持っているかどうかを検出できた。
Kintsugiは、ユーザーに短いスピーチクリップを要求し、その後、声のバイオマーカーテクノロジーでピッチ、イントネーション、トーン、ポーズなどを分析する。うつ病、不安症、双極性障害、認知症などの状態に関連するマーカーである。
しかし、Changは、当初、テクノロジーが解決したセキュリティ業界の最も重要な課題の1つである、人間の声が人間であることを特定する方法を発見したことを認識していなかった。
メンタルヘルスケアからサイバーセキュリティへ
2025年末のニューヨークでのサミットで、Changはサイバーセキュリティ分野の友人に、合成音声の実験が失敗に終わったことを伝えた。
「私たちは、精神保健モデルをトレーニングするために合成データを使用しようとしていましたが、生成された音声は本物の人間のスピーチと比べて大きく異なっていたので、ほとんどの場合、100%の確率でそれらを区別できました」と彼女は述べた。
「彼は私を止めて、『グレース、セキュリティではこれは解決されていない問題です』と言った。そこで全てが理解できた。以来、セキュリティ、金融サービス、テレコム企業との会話で、ディープフェイク音声攻撃がどれほど急速に増加しているか、また、実時間の電話での人間の声と合成音声を区別する必要性がどれほど高いかが確認された」と、CEOは付け加えた。
2025年4月、FBIは、米国上級官僚を装った悪意のあるテキストおよび音声メッセージキャンペーンについて警告した。米国では、大手国立銀行が平均5.5回/日の音声操作詐欺の標的となり、バンダービルト大学医療センターの病院スタッフは、友人、上司、同僚を装うなりすましによるフィッシング攻撃に遭遇した。
Kintsugiのチームは、ディープフェイク詐欺に焦点を当てていなかったが、Cartesia、Sesame、ElevenLabsなどのオフザシェルフモデルを使用して、管理的なコールセンター代理人やアウトバウンドワークフロー用の合成音声で実験を行っていた。
人間の声の真贋を示す人間レベルの信号は、人間が人間であることを示すのと同じバイオマーカーである。言語や意味に関係なく、Kintsugi Voiceは信号処理と音声の物理的遅延で動作し、微妙なタイミング、プロソディ的変異、認知負荷、生理的マーカーを捉える。これらは、話し手の生理的および認知的特性を反映するものである。
「合成音声は流暢に聞こえるかもしれないが、同じ生物学的および認知的アーティファクトを持っていない」とChangは述べた。同社のモデルは、検出精度のトップ10パーセンタイルのパフォーマーであり、わずか3〜5秒のオーディオで動作する。
Kintsugiは、特に専門家による治療を受けるのに時間とリソースがかかる地域でのメンタルヘルスに苦しむ人々にとって革命的となる可能性がある。同様に、そのテクノロジーはディープフェイク検出とサイバーセキュリティ全般に革命をもたらす。ディープフェイクの認識ではなく、真正性の検出である。
人間中心のテクノロジーの未来
サイバーセキュリティは、長い間、技術の悪用や加害者そのものに焦点を当ててきた。しかし、Kintsugiの偶発的な発見は、人間性そのものに賭けている。
「私たちは、完全に異なる表面で動作しています。人間の真正性そのものに焦点を当てています。LLMはLLM生成コンテンツを信頼性高く検出できないし、成果物ベースの方法は脆い。実際の人間の変異性をエンコードした、大規模な臨床的にラベル付けされたデータセットを取得することは、高価で遅く、ほとんどのセキュリティ企業の専門外なので、このアプローチは複製が難しい」とChangは指摘した。
スタートアップのアプローチは、より広範な変化も示唆している。ヘルスケアのトレンドセッターは、AIを活用したフィッシング検出の先頭に立つかもしれない。同様に、宇宙テクノロジーのイノベーターは、新しい緊急対応メカニズムをサポートする可能性がある。ゲームアーキテクチャと都市計画も同様である。
Changは、最終的には、声のやり取りを通じて、真正な人間と真正な意図を検証するための標準になることを計画している。
「HTTPSがウェブの信頼性のレイヤーになったのと同様に、人間の証明が声ベースのシステムの基盤となるレイヤーになることを私たちは信じている。Signalはそのインフラストラクチャーの始まりだ」と彼女は述べた。
ジェネレーティブAIが進化を続ける中、最も効果的な安全対策は、人間が人間であることを理解することから来るかもしれない。












