インタビュー

エイミー・ステイアー、Gretel.aiのプリンシパルマシンラーニングサイエンティスト – インタビューシリーズ

mm
Unite.AI を Google の優先ソースに追加

エイミー・ステイアーは、世界で最も先進的なプライバシー・エンジニアリング・プラットフォームであるGretel.aiのプリンシパルマシンラーニングサイエンティストです。Gretelは、データ駆動型テクノロジーの基盤にプライバシーを設計することを容易にします。そのAIベースのオープンソースライブラリは、機密情報を変換、匿名化、合成するために設計されています。

エイミーは、20年以上の経験を持つ、高度なマシンラーニングとデータサイエンスの専門家です。彼女の情熱はビッグデータであり、機密情報の中に隠された知恵をマシンラーニング、データマイニング、人工知能、統計学の技術を使用して抽出することです。彼女は、予測モデリング、分類、クラスタリング、異常検出、データ視覚化、アンサンブル方法、情報検索、サイバーセキュリティ分析、NLP、レコメンドモデル、ユーザー行動分析に熟練しています。

コンピューターサイエンスとマシンラーニングのキャリアを追求することに関心を持つきっかけは何でしたか?

私の純粋で、隠された、永続的なデータへの愛です。データの力、謎、魅力、潜在性は私を常に魅了してきました。コンピューターサイエンスとマシンラーニングは、その潜在性を活用するためのツールです。また、研究と製品の交差点で働くことは非常に楽しいです。ブレーディングエッジのアイデアを少し押し進めて、次にそれらを既存の、有形の製品ニーズに合わせて形作ることは非常に満足感があります。

読者が初めて合成データについて聞いた場合、説明できますか?

合成データは、元のデータと同じように見え、同じように機能しますが、特定のユースケースを満たすために十分に異なるデータです。最も一般的なユースケースは、元のデータのプライバシーを保護する必要性です。別のユースケースは、元のデータセットのサイズを増やすために追加のデータを作成する必要性です。さらに別のユースケースは、元のデータセット内のクラス不均衡や人口統計的偏りを解決するのに役立ちます。

合成データにより、必要なデータが存在しない場合でも、新しい革新的な製品やソリューションを開発し続けることができます。

Gretelプラットフォームは、APIを介して合成データを作成する方法を教えてください。

Gretelプライバシー・エンジニアリングAPIを使用すると、データをGretelに取り込み、抽出できるデータを探索できます。これらのAPIは、コンソールで使用されているものと同じです。APIを公開することで、開発者とデータサイエンティストがGretelを中心に自分のワークフローを構築できるようにすることを目指しています。

コンソールでは合成データを作成することが非常に簡単ですが、APIを使用すると、合成データの作成をワークフローに統合できます。私はAPIを使用することを好みます。なぜなら、それにより、特定のユースケースに合わせて合成データの作成をカスタマイズできるからです。

Gretelが提供する合成データの品質を評価するためのツールについて説明できますか?

合成データの作成後、Gretelは合成データ品質スコア(SQS)とプライバシー保護レベルグレード(PPL)が含まれるレポートを生成します。

SQSスコアは、生成された合成データが元のデータセットと同じ統計的特性を保持している程度の推定値です。この意味で、SQSスコアは、合成データセットから得られた科学的結論が、元のデータセットを使用した場合と同じであるかどうかの信頼度または有用性スコアと見なすことができます。

合成データ品質スコアは、個々の品質メトリックの組み合わせによって計算されます。フィールド分布安定性、フィールド相関安定性、ディープ構造安定性です。

フィールド分布安定性は、合成データが元のデータと同じフィールド分布を保持している程度の尺度です。フィールド相関安定性は、合成データが元のデータと同じフィールド間の相関を保持している程度の尺度です。ディープ構造安定性は、合成データの統計的完全性を評価するもので、元のデータと合成データの両方に対して主成分分析(PCA)を実行し、結果を比較することで評価されます。

Gretelのプライバシーフィルタはどのように機能しますか?

Gretelプライバシーフィルタは、合成データに対する攻撃の性質に関する多くの研究の結果です。プライバシーフィルタにより、合成データの弱点が攻撃者によって悪用されるのを防ぎます。2つのプライバシーフィルタがあります。最初のフィルタは類似性フィルタで、2番目のフィルタは外れ値フィルタです。類似性フィルタは、トレーニングレコードと非常に似ている合成レコードの作成を防ぎます。これらは、元のデータに関する洞察を得るために攻撃者によって標的にされるものです。2番目のプライバシーフィルタは外れ値フィルタで、トレーニングデータによって定義される空間内で外れ値と見なされる合成レコードの作成を防ぎます。合成データセット内で明らかになる外れ値は、メンバーシップ推論攻撃、属性推論攻撃、その他の多くの攻撃によって悪用される可能性があります。これらは深刻なプライバシー上のリスクです。

合成データは、AIの偏りを軽減するのにどのように役立ちますか?

最も一般的なテクニックは、AIシステムに供給されるデータの代表的偏りを解決することです。たとえば、データに強いクラス不均衡がある場合、またはデータに人口統計的偏りがある場合、Gretelは、不均衡を測定し、合成データでそれを解決するためのツールを提供します。データ内の偏りを除去することで、多くの場合、AIシステム内の偏りも除去できます。

あなたは新しいマシンラーニング技術について学ぶことを楽しんでいます。新しい技術について最新の情報をどのように保っていますか?

読み、読み、さらに読みます!私は1日を始めるために、新しいML技術について読むことを楽しんでいます。Mediumは私をよく知っています。私はTowards Data Science、Analytics Vidhya、The Sequenceなどの記事を読むことを楽しんでいます。Facebook (META ) AI、Google (GOOGL ) AI、OpenMinedには優れたブログがあります。NeurIPS、ICML、ICLR、AISTATSなどの優れた会議もあります。

また、引用トレイルを追跡し、好きな論文と似ている論文を見つけて、特定の関心事を理解し、常にバックグラウンドで私が興味を持つ可能性のある論文を探しているツールもあります。Zeta Alphaは、私がよく使用するツールの1つです。

最後に、同僚が同じ関心事を持っていることは、非常に重要です。Gretelでは、MLチームは私たちが探索する分野に関連する研究論文を追跡し、頻繁に面白い論文について議論するために集まります。

マシンラーニングの将来についてのあなたのビジョンは何ですか?

データへの簡単なアクセスにより、マシンラーニングにおける革新的な時代が到来し、それがヘルスケア、金融、製造、生物科学などの幅広い分野における革新を促進します。歴史的に、マシンラーニングにおける多くの画期的な進歩は、豊富なデータの存在に帰因できます。ただし、歴史的に、多くの研究は、プライバシーに関する懸念によりデータにアクセスしたり共有したりできないことによって妨げられてきました。Gretelのようなツールがこの障壁を除去するにつれて、データへのアクセスは民主化されます。マシンラーニングコミュニティ全体が、わずかな大規模企業ではなく、豊富で大規模なデータセットへのアクセスから利益を得ることになります。

Gretelについてさらに共有したいことはありますか?

もし、あなたがデータを愛しているなら、あなたはGretelを愛するでしょう(明らかに私はGretelを愛しています!)。データへの簡単なアクセスは、私が知るすべてのデータサイエンティストにとって、長年の間、困難でした。Gretelでは、私たちが可能な限り簡単にプライベートで共有可能なデータを作成するためのコンソールとAPIを作成したことを誇りに思っています。私たちは、データは共有されるときに最も貴重であると強く信じています。

素晴らしいインタビューと洞察を共有してくれてありがとう。さらに詳しく知りたい読者は、Gretel.aiを訪問してください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。