Andersonの視点
MLaaS:バリアシオナル・オートエンコーダーを用いたAPI駆動型モデル盗難の防止

Machine Learning As a Service(MLaaS)は、APIを介して顧客にシステムの洞察を提供することで、研究とモデル訓練の成果を商品化しています。ただし、システムの推論はこれらのトランザクションを通じてある程度明らかになる可能性がありますが、コアモデルのアーキテクチャ、モデルの有用性を定義する重み、そしてモデルの有用性をもたらした特定のトレーニングデータは、複数の理由により厳密に保護されます。
まず、フレームワークは多くの場合、無料またはオープンソース(FOSS)のコードリポジトリを利用しており、潜在的なライバルも同様の目的を達成するためにこれらのリポジトリを利用する可能性があります。さらに、モデルの重みは多くの場合、モデルのトレーニングデータをライバルモデルよりも優れて解釈する能力の95%以上を表し、莫大な投資の価値、つまり研究時間と業界レベルの高性能GPUでのモデルトレーニングの価値を表しています。
また、モデルのトレーニングデータセットの背後にある独自のデータと公開されているデータの混合は、潜在的に問題となる可能性があります。データが「オリジナル」の場合、APIユーザーはAPIを介したリクエストを通じてデータ構造またはコンテンツを推測することができ、これにより、データの価値を再現することができます。データのスキーマを理解することで(実用的には再現可能)、またはデータの特徴を調整する重みを再現することで(空だが有効なアーキテクチャを作成することができます)、これは莫大な投資の価値を再現することができます。
データの洗浄
さらに、機械学習モデルの潜在的な空間でのデータの抽象化は、著作権者が自分のオリジナルの作品が許可なくモデルに組み込まれたかどうかを理解することを困難にします。
現在の世界的な規制の寛容な気候は、次の5〜10年間で厳しくなりそうです。EUの人工知能に関する規制案には、データの出典に関する規制と、データ収集会社が研究目的のウェブスクレイピングに関するドメイン規制を回避することを難しくする透明性の枠組みが含まれています。他の政府、米国を含む、は長期的に同様の規制枠組みに取り組んでいます。
機械学習分野が実証実験文化から商業的なエコシステムへと進化するにつれて、データに関する制限を侵害したと判断されたモデルの場合、法的責任を負う可能性があります。
したがって、APIコールを介したデータソースの推測に関するリスクは、モデル逆転やその他の方法による産業スパイのみではなく、発生する知的財産保護のための法医学的方法にも関係します。
API駆動型の抽出を介したアドバーサリアル攻撃の開発
一部の機械学習フレームワークは、 historicalデータの大きなコーパスから単一の決定的なモデルを導き出すのではなく、常にトレーニングデータとアルゴリズムを更新しています。これには、リアルタイムデータがサービス価値のために重要なトラフィック情報やその他の分野のシステムが含まれます。
モデルロジックまたはデータ重み付けがAPIを介して体系的にポーリングすることで「マッピング」できる場合、これらの要素はシステムに対するアドバーサリアル攻撃の形で使用される可能性があります。悪意のあるデータは、ターゲットシステムがそれを拾う可能性のある領域に残されたり、データ収集ルーチンが他の方法で侵入されたりする可能性があります。
したがって、API中心のマッピングに対する対策は、機械学習モデルのセキュリティにも影響します。
API駆動型の抽出の防止
APIコールを介したモデルのアーキテクチャと特定のソースデータの推測を防ぐための方法を提供するために、近年いくつかの研究が行われています。最新のものは、バンガロールのインド科学研究所とマサチューセッツ州ケンブリッジにあるAIベースのソフトウェアプラットフォームであるNferenceの研究者による共同研究で、概説されています。
「Stateful Detection of Model Extraction Attacks」と題されたこの研究では、VarDetectというシステムを提案しています。初期のコードはGitHubで利用可能です。
VarDetectはサーバー側で実行され、APIへのユーザー要求を継続的に監視し、モデル抽出パターン攻撃の3つの異なるパターンを探します。研究者は、VarDetectがこれらの3つのタイプすべてに対して初めての防御メカニズムであると報告しています。さらに、防御メカニズムを回避しようとする攻撃者の対抗策にも対処できます。攻撃者は、攻撃パターンを休止させたり、要求の量を増やして攻撃を隠そうとすることがありますが、VarDetectはこれらの対策にも対応できます。
VarDetectは、バリアシオナル・オートエンコーダー(VAE)を使用して、受信リクエストに対するヒューリスティックスタイルの評価プローブを作成します。以前の方法とは異なり、このシステムは独自のデータでトレーニングされ、攻撃者のデータへのアクセスが不要になります。これは以前のアプローチの弱点であり、ありそうもないシナリオです。

プロジェクトのカスタムモデルは、スイス連邦工科大学とコーネルテックによって2016年に開発された研究、2017年のPRADA論文で最初に示された「問題ドメイン」データへのノイズの追加、そしてインド科学研究所の2020年のActiveThief研究によってインスパイアされた、パブリック画像のクロールから派生しています。

VarDetectで使用される5つのデータセットの無害なサンプルと「悪性」サンプルの比較。
オンボードのデータセットの特徴と一致する頻度分布は、抽出シグナルとしてフラグが付けられます。
研究者は、通常のリクエストパターンから、ベニグナなエンドユーザーがシステムで偽陽性を引き起こす可能性があることを認めています。これにより、通常の使用が妨げられる可能性があります。したがって、VarDetectデータセットに追加され、ホストシステムの好みに応じてローリングトレーニングスケジュールを通じてアルゴリズムに組み込まれる可能性のある、システムでは「安全」であると認識されるシグナルが存在する可能性があります。













