サイバーセキュリティ

AIトレーニングデータのセキュリティを確保する方法

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)には大量のデータが必要です。今日の環境では、多くの公開データセットが利用可能であり、毎日大量のデータが生成されるため、必要な情報を収集することは常に課題ではありません。しかし、セキュリティを確保することは別の問題です。

AIトレーニングデータセットの巨大さとAIモデルへの影響により、サイバー犯罪者からの注目を集めることになります。AIへの依存度が高まるにつれて、開発チームはトレーニングデータを安全に保つための注意を払う必要があります。

AIトレーニングデータのセキュリティ強化の必要性

AIモデルをトレーニングするために使用するデータは、実世界の個人、企業、またはイベントを反映する可能性があります。したがって、個人情報(PII)を大量に管理している可能性があり、漏洩した場合に重大なプライバシー侵害につながる可能性があります。2023年、MicrosoftはAI研究プロジェクト中に38テラバイトのプライベート情報を意図せず公開しました。

AIトレーニングデータセットは、さらに有害なアドバーサリアル攻撃にも脆弱です。サイバー犯罪者は、データにアクセスできる場合、データを操作して機械学習モデルの信頼性を低下させることができます。これはデータポイズニングとして知られる攻撃タイプであり、AI開発者は影響を察知するまでに遅すぎる可能性があります。

研究によると、データセットの0.001%を汚染するだけでAIモデルを破壊することができます。適切な保護がない場合、このような攻撃はモデルが実世界で実装されたときに重大な影響を及ぼす可能性があります。例えば、汚染された自律走行アルゴリズムは歩行者に気付かない可能性があり、履歴書スキャナAIツールは偏った結果を生成する可能性があります。

軽微な状況では、攻撃者はトレーニングデータセットから機密情報を盗むことができます。さらに、データベースへのアクセスを認可されたユーザーから制限し、身代金を要求する可能性があります。

AIが生活やビジネスに重要性を増すにつれて、サイバー犯罪者はトレーニングデータベースを標的にすることでより多くの利益を得る可能性があります。これらのリスクは、さらに心配なものになります。

AIトレーニングデータのセキュリティを確保する5つのステップ

これらの脅威を考慮して、AIモデルをトレーニングする際のセキュリティを重視する必要があります。以下は、AIトレーニングデータをセキュリティを確保するための5つのステップです。

1. トレーニングデータセット内の機密情報を最小限に抑える

最も重要な対策の1つは、トレーニングデータセット内の機密情報を削減することです。データベース内のPIIまたはその他の貴重な情報が少ないほど、ハッカーにとっての標的となる可能性は低くなります。さらに、漏洩が発生した場合の影響も軽微になります。

AIモデルは、トレーニング段階で実世界の情報を使用する必要がないことがよくあります。合成データは貴重な代替手段です。合成データでトレーニングされたモデルは、実世界のデータでトレーニングされたモデルと同等か、それ以上の精度を達成できます。ただし、生成されたデータセットは実世界のデータと同じように見え、動作するようにする必要があります。

代わりに、既存のデータセットから機密情報(名前、住所、金融情報など)を削除することができます。モデルでこれらの要素が必要な場合、ダミーデータで置き換えるか、レコード間で交換することを検討します。

2. トレーニングデータへのアクセスを制限する

トレーニングデータセットをコンパイルした後、データへのアクセスを制限する必要があります。最小権限の原則に従い、ユーザーまたはプログラムが正しく機能するために必要なものだけにアクセスを許可します。トレーニングプロセスに関与していない場合は、誰もデータベースを表示または操作する必要がありません。

アクセス制限は、ユーザーを信頼できる方法で検証する場合にのみ有効です。ユーザー名とパスワードだけでは不十分です。マルチファクタ認証(MFA)は不可欠です。MFAは、約80〜90%のアカウントに対する攻撃を阻止しますが、すべてのMFA方法は同等ではありません。テキストベースとアプリベースのMFAは、メールベースの代替手段よりも一般的に安全です。

ソフトウェアとデバイスも制限する必要があります。トレーニングデータベースにアクセスできるツールは、AIモデル自体とトレーニング中にデータを管理するプログラムだけです。

3. データを暗号化してバックアップする

暗号化は別の重要な保護対策です。すべての機械学習アルゴリズムが暗号化されたデータで活性化することはできませんが、分析中にデータを暗号化して復号化できます。分析が完了したら、再び暗号化します。代わりに、情報を暗号化されたまま分析できるモデル構造を検討します。

何かが起こった場合に備えて、トレーニングデータのバックアップを保持することは重要です。バックアップは、プライマリコピーとは異なる場所に保存する必要があります。データセットの重要性によっては、オフラインバックアップとクラウドバックアップの両方を保持する必要がある場合があります。バックアップもすべて暗号化することを忘れないでください。

暗号化については、方法を慎重に選択する必要があります。より高い標準が常に望ましいですが、量子攻撃の脅威が増大するにつれて、量子耐性のある暗号化アルゴリズムを検討することもできます。

4. アクセスと使用状況を監視する

他の対策を講じたとしても、サイバー犯罪者は防御を突破する可能性があります。したがって、AIトレーニングデータへのアクセスと使用状況パターンを継続的に監視する必要があります。

この場合、自動化された監視ソリューションが必要になる可能性があります。ほとんどの組織には、24時間体制で不正なアクティビティを監視するためのスタッフが不足しているからです。自動化は、不正なアクティビティが発生したときに迅速に対応するため、平均して2.22ドルでデータ漏洩コストを削減できます。

誰かがデータセットにアクセスしたり、変更したり、またはそれとやり取りしたりするたびに、すべてを記録します。不正なアクティビティに対する潜在的な脆弱性を監視するだけでなく、定期的に大きな傾向を確認します。承認されたユーザーの行動は時間の経過とともに変わる可能性があり、権限の変更や行動バイオメトリクス(使用する場合)が必要になる可能性があります。

5. リスクを定期的に再評価する

同様に、AI開発チームは、サイバーセキュリティが1回限りの対策ではなく、継続的なプロセスであることを認識する必要があります。攻撃方法は急速に進化し、一部の脆弱性や脅威は気付かれる前にすり抜ける可能性があります。安全性を維持する唯一の方法は、セキュリティ体制を定期的に再評価することです。

少なくとも1年に1回、AIモデル、トレーニングデータ、およびそれらに影響を与えたセキュリティインシデントを確認します。データセットとアルゴリズムを監査して、正常に機能し、汚染された、誤解を招く、または有害なデータがないことを確認します。必要に応じて、不審な点に気付いた場合にセキュリティ制御を適応させます。

ペネトレーションテストも有益です。ここでは、セキュリティ専門家が防御を突破しようと試みて、防御をテストします。サイバーセキュリティ専門家の17%以外のすべてが、少なくとも1年に1回ペネトレーションテストを実施しています。ペネトレーションテストを実施する専門家の72%は、組織での侵害を防いだと信じています。

サイバーセキュリティは安全なAI開発の鍵

倫理的で安全なAI開発は、機械学習への依存に関する潜在的な問題がより目立つようになるにつれて、ますます重要性を増しています。トレーニングデータベースをセキュリティを確保することは、この要求を満たすための重要なステップです。

AIトレーニングデータは、サイバー犯罪のリスクを無視できないほど貴重で脆弱です。今日からこれらの5つのステップに従って、モデルとデータセットを安全に保ちます。

Zac Amosは、人工知能に焦点を当てたテックライターです。彼はまた、 ReHackのフィーチャー編集者でもあり、そこでは彼の作品をより多く読むことができます。