インタビュー
キリル・ソロドスキフ、TheStage AIの共同創設者兼CEO – インタビュー・シリーズ

キリル・ソロドスキフ、Ph.D.、はTheStage AIの共同創設者兼CEOであり、また10年以上の実務経験を持つAI研究者および起業家です。2024年、彼はTheStage AIを共同創設し、任意のハードウェア・プラットフォーム上でのニューラル・ネットワークの自動化を実現するために450万ドルを調達しました。
以前、Huaweiのチーム・リーダーとして、キリルはQualcomm (QCOM ) NPU用のAIカメラ・アプリケーションの加速を指揮し、P50およびP60スマートフォンのパフォーマンスに貢献し、数多くの特許を取得しました。彼の研究は、CVPRやECCVなどの第一級のカンファレンスで発表され、賞や業界での認知を得ています。また、ポッドキャストをホストしています。
あなたをTheStage AIの共同創設者にしたきっかけは何ですか?また、学術研究からスタートアップの創業者としてのインファレンス・オプティマイゼーションに取り組むようになった経緯は何ですか?
TheStage AIの基礎は、Huaweiでの私の仕事に端を発します。そこで私はニューラル・ネットワークの自動化と最適化に深く関わっていました。こうした取り組みは、私たちが達成した革新的な成果の基盤となりました。モデルをトレーニングすることは一つのことですが、モデルを現実の世界で効率的に動作させることは別の挑戦です。デプロイは、多くの素晴らしいアイデアが実現しない原因となっているボトルネックです。ChatGPTのようなモデルをユーザーに使いやすくするには、多くのバックエンドの課題があります。技術的な観点から見ると、ニューラル・ネットワークの最適化は、パラメータを最小限に抑えながらパフォーマンスを高く維持することです。これは、多くの革新の余地がある難しい数学の問題です。
手動のインファレンス・オプティマイゼーションは長い間AIのボトルネックでした。TheStage AIはこのプロセスをどのように自動化し、ゲーム・チェンジャーとなるのか説明してください。
TheStage AIは、AIのボトルネックであるニューラル・ネットワークの手動圧縮と加速に取り組んでいます。ニューラル・ネットワークには数十億のパラメータがあり、どのパラメータを削減してパフォーマンスを向上させるかを手動で判断することはほぼ不可能です。ANNA(Automated Neural Networks Analyzer)はこのプロセスを自動化し、どのレイヤーを最適化から除外するかを判断します。ZIP圧縮が最初に自動化されたのと同様です。
これは、AIの採用をより迅速かつ費用対効果の高いものにするゲーム・チェンジャーです。高価な手動プロセスに頼るのではなく、スタートアップはモデルを自動的に最適化できます。テクノロジーは、ビジネスにパフォーマンスとコストの明確な理解を提供し、効率性とスケーラビリティを保証します。
TheStage AIは、インファレンス・コストを最大5倍削減することができます。従来の方法と比較して、TheStage AIの最適化・テクノロジーは何が特に効果的ですか?
TheStage AIは、従来の方法を超えたアプローチで出力コストを最大5倍削減します。ANNAは、ニューラル・ネットワーク全体に同じアルゴリズムを適用するのではなく、ネットワークをより小さなレイヤーに分割し、各部分にどのアルゴリズムを適用するかを決定して、望ましい圧縮とモデルの品質を両立します。賢い数学的ヒューリスティックと効率的な近似を組み合わせることで、アプローチは高スケーラビリティを実現し、ビジネス全般のAI採用を容易にします。また、特定のハードウェア(例:iPhoneまたはNVIDIA GPU)向けにコンパイラ設定を最適化することで、パフォーマンスを微調整し、品質を維持したまま速度を向上させることができます。
TheStage AIのインファレンス・アクセラレーションは、PyTorchのネイティブ・コンパイラと比較してどうなりますか?また、AI開発者にとってどのような利点がありますか?
TheStage AIは、PyTorchのネイティブ・コンパイラを大幅に上回るインファレンス・アクセラレーションを実現します。PyTorchは、モデルを実行するたびにコンパイルする「ジャスト・イン・タイム」コンパイル方法を使用します。これにより、スタートアップ時間が長くなることがあり、場合によっては数分またはそれ以上かかります。スケーラブルな環境では、これは非効率性を生み出し、特に新しいGPUを追加してユーザー負荷の増加に対応する必要がある場合、ユーザー体験に影響を及ぼす遅延を生み出す可能性があります。
一方、TheStage AIでは、モデルを事前にコンパイルすることができます。つまり、モデルが準備できたら、すぐにデプロイできます。これにより、ロールアウトが速くなり、サービス効率が向上し、コストが節約されます。開発者は、従来のコンパイルのボトルネックなく、AIモデルを迅速にデプロイおよびスケールできます。これにより、高需要のユースケースに対してより効率的で反応性の高いサービスを提供できます。
QLIPツールキットについてさらに説明してください。モデルのパフォーマンスを向上させる上でどのように役立つのか?
QLIPは、TheStage AIのPythonライブラリであり、さまざまなハードウェア(例:GPUやNPU)向けに新しい最適化アルゴリズムを迅速に構築するための基本的なプリミティブを提供します。ツールキットには、量子化、プルーニング、仕様、コンパイル、サービングなどのコンポーネントが含まれており、すべて効率的でスケーラブルなAIシステムを開発する上で重要です。
QLIPが際立つのは、その柔軟性です。AIエンジニアは、わずか数行のコードで新しいアルゴリズムをプロトタイプ化および実装できます。たとえば、最近の量子化ニューラルネットワークに関するAIカンファレンスの論文を、QLIPのプリミティブを使用して数分で動作するアルゴリズムに変換できます。これにより、開発者は最新の研究成果をモデルに簡単に統合できますが、柔軟性のないフレームワークでは制限されません。
従来のオープンソース・フレームワークとは異なり、QLIPでは誰でも新しい最適化手法を追加できます。これにより、チームは急速に進化するAIのランドスケープで先んじることができ、パフォーマンスを向上させつつ、将来の革新に対する柔軟性を確保できます。
あなたはHuaweiのP50およびP60カメラ用のAI量子化フレームワークに貢献しました。あの経験はあなたのAI最適化へのアプローチをどのように形作ったのか?
HuaweiのP50およびP60カメラ用のAI量子化フレームワークに取り組んだ経験は、私に貴重な洞察を与えました。特に、最適化をどのようにしてストリームライン化し、スケールアップできるかという点でです。当初、PyTorchで完全なニューラルネットワークの実行グラフを扱うのは厳格で、量子化アルゴリズムはレイヤーごとに手動で実装する必要がありました。Huaweiでは、モデルを入力すると自動的に量子化のコードを生成するフレームワークを構築しました。手動作業を排除しました。
これにより、私はAI最適化の自動化が、品質を犠牲にすることなく速度を実現することについての重要性を理解しました。私が開発し、特許を取得したアルゴリズムの1つは、Huaweiにとって特に重要でした。特に、KirinプロセッサからQualcommへの移行が必要になった際に、チームが迅速にニューラルネットワークをQualcommのアーキテクチャに適応させることができ、パフォーマンスや精度の低下がなかったためです。
プロセスをストリームライン化し、自動化することで、開発時間を1年以上から数ヶ月に短縮することができました。これは、数百万人が使用する製品に大きな影響を与えました。ANNAに取り組む際には、このアプローチを心がけています。
あなたの研究はCVPRやECCVで発表されました。AI効率性の分野で最も誇れるブレークスルーについて教えてください。
AI効率性の分野で私の成果について聞かれたとき、私はいつもCVPR 2023で口頭発表に選ばれた私たちの論文を思い出します。口頭発表に選ばれることは、たった12の論文しか選ばれないため、珍しいことです。私たちの論文は、通常は注目を集めるジェネレーティブAIとは異なり、ニューラルネットワークの分析と圧縮に焦点を当てたものでした。
私たちは、ニューラルネットワークが効率的に動作するために必要なパラメーターの数を理解するのに役立つ方法を開発しました。関数解析の手法を適用し、離散的な構成から連続的な構成に移行することで、良好な圧縮結果を達成しながら、変更をモデルに統合する能力を維持することができました。論文では、コミュニティによって使用されたことがないいくつかの新しいアルゴリズムも紹介しました。
これは、私がAI分野で最初に発表した論文であり、私の共同創設者を含む私たちのチームの共同努力の結果でした。私たちにとって大きなマイルストーンでした。
Integral Neural Networks(INNs)について説明してください。ディープラーニングにおける重要な革新であるINNsの特徴は何ですか?
従来のニューラルネットワークは、サイズとパラメータが事前に決定された固定マトリックス(エクセル表のようなもの)を使用します。一方、INNsはネットワークを連続関数として記述し、柔軟性を大幅に高めます。連続的な波を表すピンが付いたブランケットを想像してください。
INNsの魅力は、利用可能なリソースに応じて、動的に「圧縮」または「拡張」できることです。アナログ信号が音にデジタル化されるのと同様です。ネットワークを品質を損なうことなく圧縮できます。必要に応じて、再トレーニングせずにネットワークを拡張できます。
これをテストし、従来の圧縮方法では品質の著しい低下が生じることがわかりましたが、INNsは圧縮されても元の品質を維持しています。数学的根拠はAIコミュニティにとって非伝統的ですが、実用的な結果を達成する能力が真の価値があります。
TheStage AIは量子アニーリング・アルゴリズムに取り組んでいます。近い将来、量子コンピューティングがAI最適化にどのような役割を果たすと思いますか?
量子コンピューティングとAI最適化の関係について言及すると、量子システムは問題を解決するためのまったく新しいアプローチを提供します。私たちは量子アニーリング・アルゴリズムを最初から開発しませんでした。D-Waveのような企業は、量子コンピュータ向けの離散最適化タスク用のPythonライブラリを提供しています。
ここでのアイデアは、ニューラルネットワークを直接量子コンピュータにロードするのではなく、さまざまな劣化の下での動作を近似し、量子チップが処理できるシステムに適合させることです。
将来的には、量子システムは、従来のシステムが苦労する精度とスケーラビリティでネットワークを最適化できる可能性があります。量子システムの利点は、組み込みの並列性にあります。クラシカルシステムは、追加のリソースを使用してこれをシミュレートできますが、量子コンピューティングは、特に大規模で複雑なネットワークを効果的にモデル化する方法が見つかれば、最適化プロセスを大幅に高速化する可能性があります。
真の可能性は、量子コンピューティングを使用して巨大で複雑な最適化タスクを解決し、パラメータを小さくて管理可能なグループに分解することです。量子や光コンピューティングなどのテクノロジーは、従来のコンピューティングが提供できるものを超えたAIの最適化の可能性を提供します。
TheStage AIの長期的なビジョンは何ですか?5〜10年以内にインファレンス・オプティマイゼーションはどうなりますか?
TheStage AIの長期的な目標は、誰でも望ましい特性を持つ最適化されたニューラルネットワークにアクセスできる、グローバルなモデル・ハブになることです。スマートフォンやその他のデバイス用です。目標は、ユーザーがパラメータを入力すると、システムが自動的にネットワークを生成する、ドラッグ・アンド・ドロップの体験を提供することです。ネットワークがすでに存在しない場合は、ANNAを使用して自動的に作成されます。
私たちの目標は、ニューラルネットワークをユーザーのデバイスで直接実行し、コストを20〜30倍削減することです。将来的には、ユーザーのデバイスが計算を処理するため、クラウド・サーバーへの依存が大幅に削減され、コストがほぼゼロになる可能性があります。これは、モデル圧縮とハードウェア・アクセラレーションの進歩と組み合わせて、AIの展開を大幅に効率化することになります。
また、センサー、チップ、ロボティクスなどのハードウェア・ソリューションとテクノロジーを統合することを計画しています。例えば、宇宙や暗闇、ダストなどの極限環境で機能するAIカメラを構築することを目指しています。これにより、AIを幅広い用途で使用できるようになり、特定のハードウェアやユースケース向けのカスタム・ソリューションを作成できるようになります。
素晴らしいインタビュー、ありがとうございます。詳しく知りたい読者は、TheStage AIを訪問してください。












