インタビュー
インテグレート.aiのマシンラーニング製品担当VPロシャナク・ホーマンファー氏へのインタビュー

ロシャナク(ロ)・ホーマンファー氏は、integrate.aiのマシンラーニング製品担当VPです。この会社は、開発者が機密データをリスクなく利用して世界の最も重要な問題を解決することを支援しています。ロシャナク氏は、複雑なAIの概念を簡素化し、ユーザーのニーズと結び付ける才能があります。この専門知識を活かし、integrate.aiのミッションであるプライバシー強化技術へのアクセスの民主化の最前線に立っています。
データサイエンスとマシンラーニングに興味を持ったきっかけは何ですか?
私はロボティクスからスタートしました。ロボティクスのさまざまな側面を試み、溶接ラボを焼き尽くした後、私は自分の分野のAI側面に惹かれ、そこでマシンラーニングの素晴らしい世界に入りました。
現在の役割と1日の平均的な様子を説明してください。
私はintegrate.aiの製品担当VPです。integrate.aiは、開発者が機密データをリスクなく利用して世界の最も重要な問題を解決することを支援するSaaS会社です。私たちは、分散データの将来のためのプライバシー安全なマシンラーニングと分析ツールを構築しています。
私の日常では、さまざまな機能を持つチームと協力して3つのことを達成するために働いています。
私たちは、将来の知能がどのように見えるか、そして私たちがその将来をどのように形作ることができるかについて考えています。
私たちは、顧客の痛み点を理解し、顧客の仕事をより影響力があり効率的にするための革新について考えています。
私たちは、製品開発において、常にビジョンと顧客のフィードバックを考慮し、チームと協力して最も優れた機能を提供するように努めています。
合成データは現在マシンラーニングで人気がありますが、integrate.aiは多少異なるアプローチをとっています。合成データが望ましい選択肢ではないアプリケーションは何ですか?
合成データが最適な解決策ではない場合を理解するには、まず合成データが最適な場合を理解する必要があります。合成データは、モデル化対象が少量の実データしか利用できないか、まったく利用できない場合に最適です。たとえば、コールドスタート問題やテキストおよび画像ベースのモデルトレーニングで合成データは解決策として機能します。時には、モデルをトレーニングするのに必要なデータが足りない場合があり、合成データは解決策として輝きます。
しかし、合成データは、実データがプライバシー規制、集中化コスト、またはその他の相互運用性の障壁によりシロ化されている状況で使用されることが増えています。これは合成データの誤用です。このようなユースケースでは、合成データの作成の適切な抽象化レベルを決定するのが難しく、低品質の合成データが生成され、将来的なデバッグが難しいバイアスや問題が生じる可能性があります。さらに、合成データでトレーニングされたモデルは、実データでトレーニングされたモデルに比べて性能が低いことがあります。
integrate.aiは連邦学習ソリューションを提供することに特化しています。連邦学習とは何ですか?
従来のマシンラーニングでは、すべてのモデルトレーニングデータを1つのデータベースに集中させる必要があります。連邦学習では、モデルは分散化されたデータセット、つまり2つ以上の個別のデータベースに存在するデータでトレーニングできます。連邦学習のしくみは、モデルの一部をデータが存在する場所でトレーニングし、モデルパラメータを参加データセット間で共有して、改良されたグローバルモデルを生成することです。データがシステム内で移動しないため、組織はプライバシー、セキュリティ規制、コスト、またはその他の中央集権化に関する懸念なくモデルをトレーニングできます。
一般的に、連邦学習でアクセス可能なトレーニングデータは、中央集権的なデータに比べて品質が高い傾向があります。なぜなら、中央集権的なデータは、1つの場所でのアクセス性の容易さのために、グラニュラリティを失うことが多いからです。
企業は連邦学習の最適なユースケースをどのように特定しますか?
連邦学習は、データへのアクセスまたは従来の集中型マシンラーニングインフラストラクチャへのデータの移動が困難な状況向けに構築されたマシンラーニングテクノロジースタックです。如果以下の症状に直面している場合、連邦学習が適しています:
- アナリティクスとマシンラーニングを搭載したスマート製品を提供していますが、データが顧客所有であるため、製品にネットワーク効果を作成できない。
- パートナーからデータを取得するために、長いマスターサービス契約またはデータ共有契約を通じて作業しています。
- 特にデータパートナーシップの結果が不明確な状況で、パートナーとの間でコラボレーション契約を形成するのに多くの時間を費やしています。
- データセットの所有者ですが、評判への影響を恐れてデータのモニタリングを行っていません。
- すでにデータをモニタリングしていますが、データを共有するために多くの時間、労力、金銭を費やしています。
- インフラストラクチャがクラウドへの移行の間に残されましたが、アナリティクスとマシンラーニングが必要です。
- 同じ組織に属する子会社がありますが、直接データを共有できません。
- 扱っているデータセットが大きすぎて移動するのが難しい、またはETLパイプラインのコストが高すぎます。
- 大きな影響を与えることができるアプリケーションまたは機会がありますが、実現するために必要なデータが自分ではありません。
- マシンラーニングモデルが頭打ちになり、さらに改善する方法がわかりません。
差分プライバシーは連邦学習と共に使用されることがよくあります。差分プライバシーとは具体的に何ですか?
差分プライバシーは、同時にマシンラーニングの力を利用しながらプライバシーを確保するためのテクニックです。標準の匿名化テクニックとは異なる数学を使用して、ローカルモデルトレーニング中にノイズを追加し、データセットの統計的特性のほとんどを保持しながら、個々のデータが特定されるリスクを制限します。
理想的な実装では、差分プライバシーはリスクをほぼゼロに近づけながら、モデル性能を維持します。つまり、データの匿名化のために必要なすべてのセキュリティを提供し、モデル結果の品質を低下させることなく、データの匿名化を実現します。
差分プライバシーは、integrate.aiのプラットフォームにデフォルトで含まれており、開発者はモデルパラメータから個々のデータを推測できないことを保証できます。
integrate.aiの連邦学習プラットフォームのしくみを説明してください。
私たちのプラットフォームは、連邦学習と差分プライバシーテクノロジーを利用して、機密データソース上で機械学習と分析の幅広い機能を解放します。モデルトレーニングや分析などの操作はローカルで実行され、結果のみが安全かつ機密性の高い方法で集約されます。
integrate.aiは、開発者ツールとしてパッケージ化されており、開発者は簡単なSDKとクラウドサービスを使用して、ほぼどのソリューションにもこれらの機能をシームレスに統合できます。プラットフォームが統合されると、エンドユーザーは機密データセットを跨いで共同作業を行い、データ管理者は完全な管理権を保持できます。integrate.aiを統合したソリューションは、実験ツールとしても、プロダクションレディなサービスとしても機能できます。
このプラットフォームは精密診断でどのように使用できますか?
私たちが協力しているパートナーのネットワークの1つ、オートイズム共有イニシアチブは、オートイズム診断と遺伝子データのサンプルに関する情報を収集して、さまざまな遺伝子型と表現型がオートイズム診断とどのように関連しているかを理解するために使用されます。各個々のデータサイトには、機械学習モデルを実行するのに十分なデータセットがありませんが、集団的に意味のあるサンプルサイズを作成します。しかし、データの移動はセキュリティとプライバシーのリスクが高く、規制や病院のポリシーにより、これらの研究機関は常にデータの共有を避けてきました。
別のネットワークでは、研究者は、各患者についてより包括的な歴史を使用して、臨床試験への割り当てを改善しようとしています。
関与するさまざまな研究機関には、各患者についてさまざまな情報へのアクセスがあります。1つの研究所には患者さんの医療スキャンへのアクセスがあり、別の研究所には患者さんのゲノム情報へのアクセスがあり、別の研究所には患者さんの臨床試験結果へのアクセスがあります。しかし、これらの組織は直接データを共有できません。
integrate.aiのソリューションを使用すると、各組織はデータ管理者からデータを移動せずに、目的のために他の組織のデータにアクセスできます。つまり、内部ポリシーに従っています。
プライバシーを理解しやすくすることの重要性と、integrate.aiがこれをどのように可能にするかについて議論してください。
プライバシーを理解しやすくすることは、歴史的に閉鎖的であったビジネスや組織の多くの扉を開くことになります。GDPR、CCPA、HIPAAなどのプライバシー規制は非常に複雑で、業界、地域、データの種類によって異なるため、組織はどのデータプロジェクトがプライバシーに安全であるかを判断するのが難しいことがあります。規制要件の各チェックボックスを確認するのではなく、integrate.aiの連邦学習プラットフォームには、差分プライバシー、ホモモルフィック暗号化、安全なマルチパーティ計算が組み込まれており、開発者とデータ管理者は規制要件を満たすプロジェクトを作成できることを安心して知ることができます。
integrate.aiについてさらに何か追加の情報がある場合は、ぜひ共有してください。
integrate.aiのソリューションは、機密データソース上で、コンプライアント、プライバシーを保護し、セキュアなマシンラーニングと分析を可能にする、開発者にとって非常に使いやすいツールです。シンプルなAPIを通じて、機密データ上の契約や規制の複雑さが抽象化され、データサイエンティストとソフトウェア開発者は、現在のインフラストラクチャとワークフローに最小限の影響で作業負荷を安全に管理できます。
素晴らしいインタビュー、ありがとうございました。詳細については、integrate.aiを訪れてください。












