インタビュー
アレックス・ラトナー、Snorkel AIのCEO兼共同創設者 – インタビュー・シリーズ

アレックス・ラトナーは、Snorkel AIのCEO兼共同創設者です。Snorkel AIは、スタンフォードAIラボから生まれた会社です。
Snorkel AI は、手動のAI開発プロセスをプログラム的な解決策に変換することで、AI開発を迅速かつ実用的に行えるようにします。Snorkel AIにより、企業は独自のワークロードに合わせてAIを開発でき、独自のデータと知識を使用して10〜100倍高速にAIを開発できます。
コンピューターサイエンスに最初に惹かれたのは何ですか?
コンピューターサイエンスには、若い頃に学ぶ2つの非常に興奮する側面があります。一つは、教師に待たなくても、自分で学びたいペースで学べることです。二つは、誰にも許可を求めずに、自分で作ることができることです!
私は子供の頃にプログラミングを始めました。私はその精度が必要なプロセスを抽象化し、モジュラーにエンコードするプロセスを楽しんでいました。
後で、大人としてコンピューターサイエンスに戻りました。私はコンサルティングの仕事で、特許コーパスを分析するためのスクリプトを書くように頼まれたことがありました。誰もが特許として認めた人間の知識が利用可能だったのに、技術的なテキストや多様なデータを分析するのが非常に難しいことに気づきました。
これが私をコンピューターサイエンスの道に戻らせたきっかけでした。最終的にスタンフォード大学の大学院で、NLP(自然言語処理)に焦点を当てて研究しました。
スタンフォード大学在籍中に、Snorkelオープンソースプロジェクトを立ち上げ、リードしました。初期の経緯についてお話しください。
当時、業界の人々と同様に、新しいアルゴリズムの開発に焦点を当てていました。スタンフォード大学の医者や科学者と協力して、現実世界の問題に取り組んでいました。しかし、毎回、新しいモデルやアルゴリズムを提示すると、「いいえ、ラベル付きのトレーニングデータが必要ですが、作る時間がありません」と言われることが多かったです。
私たちは、ラベル付けとキュレーションのプロセスが大きな問題であることを認識しました。そこで、すべての焦点をそこに当てました。そうして、Snorkelプロジェクトと「データ中心のAI」の概念が生まれました。
Snorkelにはデータ中心のAIアプローチがあります。モデル中心のAI開発とはどう違うのでしょうか?
データ中心のAIとは、より良いデータを構築してより良いモデルを構築することを意味します。
これは、モデル中心のAIとは対照的ですが、協力関係にあります。モデル中心のAIでは、データが静的なものであると仮定し、データサイエントリストや研究者はモデルアーキテクチャやパラメータを調整してより良い結果を得ようとします。
研究者たちはモデル中心のAIでも優れた研究をしていますが、オフザシェルフのモデルや自動ML技術が大幅に改善されたため、モデル選択は生産時にコモディティ化されています。そうした場合、モデルを改善する最も良い方法は、より良いデータを提供することです。
データ中心のAIアプローチの核となる原則は何ですか?
データ中心のAIの核となる原則は、より良いデータがより良いモデルを構築するということです。
私たちの学術研究では、これを「データプログラミング」と呼んでいます。アイデアは、十分なロバストなモデルに十分な入力と出力の例を与えると、モデルはそれらのパターンを複製する方法を学習します。
しかし、データのほとんどにはラベルが付いていないか、または有用なラベルが付いていないことがあります。手動でラベルを付けるには、単調な作業、時間、人間の労力が必要です。
ラベル付きのデータセットを持つことは、品質を保証するものではありません。人間のミスがどこにでも潜んでいます。最終的なモデルのパフォーマンスを低下させることは、パラメータの調整では補うことができません。研究者たちは、オープンソースのデータセットに誤ってラベル付けされたレコードを見つけたこともあります。
データ中心のAIがプログラム的なものであるということは何を意味しますか?
手動でデータをラベル付けすることは、重大な課題を提起します。そうするには、多くの人間の労力が必要であり、時にはその労力が高価になる可能性があります。例えば、医療文書は医者だけがラベル付けできます。
また、手動ラベル付けのスプリントは、単発のプロジェクトになることが多いでしょう。ラベル付け者は、データを特定のスキーマに従ってラベル付けします。如果ビジネスのニーズが変化し、異なるラベルのセットが必要になる場合、ラベル付け者は最初からやり直さなければなりません。
プログラム的なデータ中心のAIアプローチは、これらの問題を軽減します。Snorkel AIのプログラム的なラベル付けシステムは、既存のモデル、既存のラベル、外部の知識ベースからの信号を組み合わせて、確率的なラベルを大規模に開発します。主な信号源は、データサイエントリストと協力してラベル付け関数を構築する専門家です。これらの関数は、専門家の判断をスケーラブルなルールにエンコードし、1つの決定の労力を数十または数百のデータポイントに影響させることを可能にします。
このフレームワークは柔軟性もあります。ビジネスのニーズが変化して新しいラベルが必要になった場合、ユーザーはラベル付け関数を追加、削除、または調整して、新しいラベルを数時間で適用できます。
このデータ中心のアプローチは、ラベル付けされていないデータを迅速にスケーリングすることを可能にしますか?
私たちのプログラム的なデータ中心のAIアプローチは、各選択の影響を増幅することで、ラベル付けされていないデータを迅速にスケーリングすることを可能にします。専門家が初期の小さなグラウンドトゥルースを確立した後、データサイエントリストと協力してラベル付け関数を定義し、迅速にモデルをトレーニングし、ラベル付け関数の影響を分析し、必要に応じてラベル付け関数を追加、削除、または調整します。
各サイクルでモデルパフォーマンスが向上し、プロジェクトの目標を満たすまで続きます。これにより、数ヶ月に及ぶデータラベル付けの作業を数時間に短縮できます。Snorkelの研究プロジェクトでは、2人の研究者が1日で20,000の文書をラベル付けしました。手動ラベル付けでは、10週間以上かかる作業でした。
Snorkel AIには、Snorkel Flow、Snorkel GenGlow、Snorkel Foundryなど、複数のAIソリューションがあります。これらの違いは何ですか?
Snorkel AIスイートは、ユーザーがラベル付け関数(例:ドキュメント内のキーワードやパターンを検索)を作成して、数分で数百万のデータポイントをプログラム的にラベル付けできるようにします。
これにより、企業は独自のデータを生産可能なモデルに変換して価値を抽出する時間を短縮できます。Snorkel AIにより、企業は人間の判断と専門知識を効率的に組み込むことで、人間が関与するアプローチをスケーリングできます。
これにより、より透明性と説明可能なAIが実現し、企業は偏見を管理し、責任ある成果を達成できます。
具体的には、Snorkel AIにより、フォーチュン500企業は次のことができます:
- モデルをトレーニングまたはRAGを強化するために、高品質のラベル付けされたデータを開発します。
- ファインチューニングでLLMをカスタマイズします。
- LLMを小さくて安価なモデルに蒸留します。
- 事前トレーニングでドメインおよびタスク固有のLLMを構築します。
あなたは画期的な論文をいくつか書いてきました。どれが最も重要な論文だと思いますか?
1つの重要な論文は、データプログラミング(ラベル付けトレーニングデータをプログラム的に)とSnorkelに関するものでした。
Snorkelの将来のビジョンは何ですか?
私は、Snorkelが、AIに真剣に取り組むすべての大企業にとって、信頼できるパートナーになることを目指しています。
Snorkel Flowは、大企業のデータサイエンスチームにとって、ユビキタスなツールになるはずです。企業が、組織のためにカスタマイズされた大規模言語モデルをファインチューニングしたり、画像分類モデルを構築したり、シンプルで展開可能なロジスティック回帰モデルを構築したりする場合でもです。
企業が必要とするモデルに関係なく、高品質のラベル付けされたデータが必要です。
素晴らしいインタビュー、詳しく知りたい読者はSnorkel AIを訪れてください。












