インタビュー
Val Bercovici、WEKAチーフAIオフィサー – インタビューシリーズ

Val Bercovici、WEKAのチーフAIオフィサーは、次世代人工知能を支える技術の進化に注力するAI・データインフラのエグゼクティブです。2025年1月にWEKAのチーフAIオフィサーとして入社して以来、AIエージェント基盤の構築、トレーニングと推論ワークロードの高速化、AIコンピュートの経済性向上に取り組んできました。WEKAでの役割に加えて、BercoviciはHome DockのAIアドバイザー、FermiHDIとThe Hiveの戦略アドバイザー、PencilDATAの議長を務めており、AI、サイバーセキュリティ、ブロックチェーン、クラウドコンピューティング、データインフラにわたる活動を行っています。彼のキャリアは、データ集約型AIシステムを支える新興技術の開発と助言に長年焦点を当ててきたことを示しています。
WEKAは、人工知能、機械学習、ハイパフォーマンスコンピューティング、その他のアクセラレートワークロードの厳しいデータ要件に対応するソフトウェア定義プラットフォームを構築するAIネイティブデータインフラ企業です。WEKA Data Platformは、オンプレミス、クラウド、ハイブリッド、エッジ環境を横断して動作できる統合アーキテクチャを提供し、ストレージのボトルネックを排除し、GPUの利用率を向上させ、AIモデルのトレーニングと推論を加速します。同社は新興の推論エコノミーとエージェントAIを中心に技術を位置付けており、膨大な規模で高スループット・低レイテンシなデータアクセスを実現しつつ、複雑なAIデータパイプラインを簡素化するインフラを提供しています。WEKAは、世界で最もパフォーマンス要求の高いコンピューティング環境で活動するエンタープライズ、クラウドプロバイダー、研究機関、AI開発者にサービスを提供しています。
あなたのキャリアは、NetAppの初期クラウド戦略策定やKubernetes創設ガバナンスボードへの参加からWEKAでのAIインフラ構築まで多岐にわたります。この変遷は、次のAIフェーズに向けたインフラ準備に対する考え方にどのような影響を与えましたか?
私のキャリアの各時代は同じパターンで定義されています: ボトルネックが移動し、業界はそれに気付くまでに何年もかかります。初期のクラウドとKubernetesの時代、コンピュートが弾性化し、オーケストレーションが新たなボトルネックとなるのを見てきました。SolidFire買収後にCTOを務めたNetAppを離れたとき、私は「高速」とは何かを知っていると思っていました: 本番ワークロード下での真にランダムなファーストバイト読み取りが数ミリ秒というレベルです。
WEKAに参加した理由は純粋にオタク的でした。ある指標が示したのは、キャッシュなしのランダムバイト読み取りが70マイクロ秒で、これはストレージクラスの数値ではありませんでした。このクラスのシステムでマイクロ秒レベルのレイテンシを実現できるとは考えてもいませんでした。そこで閃いたのが「この技術はメモリ向けアプリケーション、RedisやKVキャッシュのようなDRAMクラスのアプリケーションにも使える」ということです。そしてちょうどそのタイミングで、業界がモデルの収益化を迫られ、エージェントが登場してメモリ全体をゲームに変えたため、推論がトレーニングを上回り始めました。
これが私がAIインフラに持ち込む視点です。私たちはこのシナリオを以前にも見てきました。Cloud FinOpsは、企業が単位経済性の厳格さなしにインフラを立ち上げ、請求書に驚かされた結果として生まれました。AIも同じ曲線をたどり、さらに速く進んでいます。企業がトークン予算をはるかに超えるAPI消費請求に直面し、トークンマックス化に抵抗し始めたとき、AI FinOpsの台頭が見られます。ここが、推論を安価なユーティリティとして扱うのをやめ、トークン効率を財務的ディシプリンとして管理し始めるポイントです。AI FinOpsはトークノミクスから始まります: 推論スタックのハードウェア・ソフトウェア層すべてを最適化し、トークンあたりの単位コストを下げることです。現在、スタックで最大の無駄は、メモリとデータ(いわゆる「デコード」)を待機している高価なGPUや新しいASICがアイドル状態になることです。これを解決できる者が次のAIフェーズを支配します。
ホワイトハウスは新しいAI安全性フレームワークの詳細を非公開にしています。企業は、何がテストされるか、何が求められるか正確に分からない段階で、規制要件にどう備えるべきでしょうか?
企業は最終的なチェックリストを待つべきではありません。具体的なテスト項目は変わりますが、その根底にある義務は変わりません: AIモデルが何をしたか、どのデータに触れたか、特定の時点でどのように振る舞ったかを示す必要があります。そして待機はもはや選択肢ではありません。EU AI法が今月施行され、ほとんどのエージェントオーケストレーションを高リスクに分類しています。
つまり、準備作業はインフラ作業です。データ系譜、可観測性、再現性、そして要求に応じてモデル状態を再構築できる能力は、企業が正しく整備すべき重要項目です。さらに、出力前にガードレールモデルを実装し、セマンティック防御層に対してレイテンシとトークン予算を設定する必要があります。これらの機能を今構築すれば、あらゆるフレームワークは単なるフォーマット作業に過ぎません。最終規則を待ってから対応すると、説明責任をシステムに後付けすることになり、最初から組み込むよりも高コストになります。
最終的に、安全なAIを構築する解決策は、より多くのAIを、最適かつ意図的に適用することです。
AI安全性テストが新たに求めるインフラ要件はどのようなものになる可能性があり、従来のモデル訓練や推論とはどのように異なるでしょうか?
トレーニングはホースのように大量のデータをモデルに流し続ける安定したパターンです。安全性テストはその逆で、何千もの評価シナリオ、繰り返しのプロービング、バージョン間の行動比較、そして終わりのないレッドチーミングが求められます。
このプロファイルは重要です。安全性の訓練・テストはバースト的で、読取重視、比較的です。膨大な中間状態を生成・消費します。ガードレールモデルは本質的に異種混在で層状であり、厳しいレイテンシ予算内で実装され、評価に新たな安全基準を加幅させます。高度なサイバー対応モデルの場合、ワークロードはエピソード的ではなく24/7の永続的なものになります。テストを一度だけ実行して結果を保存するのではなく、コンピュート、メモリ、データ帯域と競合しながら本番環境でエージェントスウォームワークロードを継続的に走らせる必要があります。品質と速度の次に、多くのインフラはこの第3の原則に対応できていません。
測定上の問題もあります。現在のAIベンチマークは8,000トークン以下、1つのプロンプトと1つの応答で測ります。これは人工的なベンチマークだと冗談で言います。2026年中頃には、実際のエージェントワークロードが10万〜40万トークンのコンテキストを数千回のターンで処理します。もし安全性評価がこれらの玩具ベンチマークを踏襲すれば、実在しない世界向けにシステムを認証することになります。規制当局はすでにNISTがエージェントセキュリティ評価ツールをオープンソース化し、初期結果は既知のベースラインの数倍の速度でエージェントハイジャック攻撃が成功していることを示しています。これこそが安全フレームワークが収束すべき、継続的で敵対的、かつ高コストなテストの姿です。
組織は将来のコンプライアンスや安全性ワークロード向けに余剰のコンピュートやデータ容量を構築すべきでしょうか?それとも不確実性に備えるより効率的な設計方法はありますか?
余剰GPUを購入し、稼働率が上がるのを待つだけでは、減価償却中のハードウェアに資本が滞留します。
効率的な答えは、プロダクションと評価ワークロードを別スタックなしで柔軟に切り替えられるインフラです。これは根本的にデータ問題です。データを効率的に移動・再利用し、ワークロード間でコンテキストを保持し、アクセラレータを実際の作業で忙しくさせれば、コンプライアンスは追加コストではなくインクリメンタルなコストになります。AIの経済性は、トークン、バイト、ワットあたりの価値抽出にますます依存します。これを正しく行えば、同じインフラで3〜4倍の価値を生み出すか、ラックフットプリントを最大75%削減できます。コンプライアンスは同じ基準で評価されるべきです。
現在のフレームワークは高度なクローズドモデルに焦点を当て、オープンウェイトモデルを除外しています。この二つのカテゴリを別々に扱うことで、どのようなインフラやセキュリティ上の課題が生じ得るでしょうか?
クローズドモデルとオープンウェイトモデルを別々に扱うと、同じ機能を持つ技術に対して二つのコンプライアンスフレームワークが生まれ、そのギャップがリスクの温床となります。
オープンウェイトモデルは、元プロバイダーが全く可視性を持たない環境でファインチューニングやデプロイが可能です。プロバイダーを規制しても効果がありません。すでに分かれている点は: 今年は最新のクローズドフロンティアモデルに輸出規制が適用されましたが、オープンウェイトモデルは国境を越えて自由に流通し、現在は公開能力リーダーボードの上位に位置しています。しかし、行政はフロンティアモデルを定義し、ガバナンスはモデル自体だけでなく、モデルが稼働する場所、アクセスするデータ、保持されるプロンプト・レスポンス・メタデータ、変更履歴、そしてスケールでガバナンスされたAIを支えるインフラまで可視化する必要があります。ISO27001やSOC2の新たな更新が求められるでしょう。
私の答えは「信頼するが検証する」です。インフラがトークン容量を提供できれば、出力前に任意のモデル(国内外、オープン・クローズド問わず)に対して異種ガードレールを実行できます。客観的な検証は、モデルの出所に基づく盲目的な信頼や不信よりも優れています。オープンモデルが普及すれば、検証機能はインフラ層に組み込まれ、企業が差別化するポイントになります。ポリシーはどのモデルを許可するかを決め、インフラはそれらのモデルを責任ある経済的にデプロイできるかを判断します。
AIエージェントがより自律的になり、長いコンテキストで動作するようになると、組織がモニタリングや安全性に割り当てるデータ、メモリ、コンピュートはどの程度変化しますか?
チャットボットは「プロンプト」と「レスポンス」だけです。自律エージェントは実行中のプロセスで、数十のシステムに触れ、情報を取得し、中間的な意思決定を行い、数時間または数日間にわたって状態を蓄積しながらタスクを完了します。
個々のトークンやレスポンスをサンプリングして監視することはできません。エージェントが何を知っていたか、いつ知っていたか、次に何をしたかという全シーケンスを捕捉する必要があります。エージェントが稼働するたびに状態は拡大し、メモリ、データ移動、インフラの要件も増大します。モニタリングは単なるロギング機能から、独自のリソース予算を持つ第一級ワークロードへと変わります。
ここで防御が緊急課題となります。AIのメモリ問題はセキュリティ問題へと変化しています。コーディングエージェントは起動→配布→終了が可能ですが、サイバーセキュリティエージェントはそう簡単に終了できません。日々のシフト交代や頻繁なモデル更新、数週間にわたって実行されていた多段階攻撃キャンペーンを、現在は機械速度で協調的に実行できるようになっています。AIの作業メモリが数分ごとに破棄され再計算されると、インシデントの1時間目に異常を検知したエージェントは2時間目にその記憶を失います。攻撃者はその問題を抱えていません。彼らのエージェントは継続的に脆弱性を特定・追跡し、トークノミクス最適化された機械速度でキルチェーンを完了させます。したがって、AI駆動のサイバー防御は24時間体制で自律的に動作する必要があります。これは理論的な話ではありません。セキュリティベンダーは現在、24/7の永続的サイバーエージェントに備えており、最初に気付くのはチャットワークロードとは全く異なる経済性だということです。GPUラックや冷却装置すら設置できない施設でエッジにエージェントを走らせる必要がある組織もあります。エンタープライズAIの真のテストは、瞬間的な推論ではなく、持続的なコンテキスト保持です。これはトークン消耗の戦いであり、スケールで永続コンテキストメモリを解決できる者が、エンタープライズAIにおける最初の水平キラーアプリ(常時オンのブルーエージェントスウォーム)を実現します。
「コンテキストメモリ」の重要性が高まる中、AIワークロードが単なるチャットから永続エージェントへと移行することで、監査、再現、またはAIの振る舞い調査においてもコンテキストメモリは重要になるでしょうか?
はい、非常に重要なユースケースです。長年、メモリはパフォーマンスの話題でした: GPUにどれだけ速くデータを供給できるか、どれだけコンテキストを保持できるか。エージェントが自律的に行動し始めると、同じメモリが証拠となります。エージェントが数日間にわたって蓄積したコンテキストに基づいて意思決定した場合、最終的なプロンプトと出力だけではなぜその行動を取ったかはほとんど分かりません。説明は蓄積された状態にあります。
技術的に言えば、その状態の大半はKVキャッシュに格納されており、業界は依然としてそれを使い捨てのスクラッチスペースとして扱っています。もしその状態を保持し、効率的に取得できれば、システムが行動した瞬間に何を知っていたかを再構築できます。チームはまずデバッグに利用し、次に安全性評価に、最終的には調査に活用するでしょう。コンテキストメモリを捨てることは、AIが何をしたかを説明する唯一の記録を捨てることと同義です。
AI規制が最終的にモデルの入力、出力、チェックポイント、データ系譜、エージェント活動などの情報を大幅に保持することを企業に求める可能性はありますか?それはAIインフラアーキテクチャにどのような影響を与えるでしょうか?
方向性としては、はい。AIシステムがより重要になるにつれ、可視性要件はパイプラインのすべてのステップをカバーするよう拡大します。すでに初期のシグナルが見えてきており: チームは監査目的で安価なオブジェクトストレージ層に古いコンテキストメモリを保持する計画を立てています。規制がそれを義務付ける前に。
監視の不変性を保証する認証は必須です。悪意あるエージェントによるログやフォレンジックアーティファクトの改ざんは日常化しており、集中型の完全性攻撃に耐えうる暗号検証システムが必要です。単純な透明性ログやハッシュチェーンだけでは、協調エージェントスウォームの共謀能力に対抗できません。高度に分散された公開ブロックチェーンアーキテクチャは、この課題に最適であり、サイバーセキュリティのC-I-A三要素の中で見過ごされがちな「Integrity」価値を際立たせます。
保持は単なる大規模な不変ストレージ問題ではありません。課題は、その情報を信頼でき、整理され、インデックス化され、そして期限内に高速に取得できるように保つことです。規制当局、インシデント対応、法廷のいずれかの期限が来たときに有用でなければなりません。ペタバイト規模のエージェント活動をクエリできなければ、記録ではなく負債です。アーキテクチャのシフトは「もっとストレージ」から「客観的に検証可能で永続的、クエリ可能なAIデータをコアワークロードとして設計したインフラ」へと変わります。
多くの組織はGPUの追加購入に注力していますが、AIワークロードが拡大し安全性要件が高まる中で、目に見えにくいインフラのボトルネックはどこに現れると考えますか?
GPUが見出しになるのは予算項目として無視できないからですが、GPUや新しいデコード最適化アクセラレータ(ASIC+SRAM)は実際の制約になることは稀です。メモリ帯域、データ重力と移動、ストレージ性能、ネットワークが、アクセラレータが生産的に働くか待機状態になるかを決定します。
AIがコンテキスト重視になるにつれ、メモリウォールが決定的な制約となります。GPUを増やし続けても、トークンを再計算したりコンテキストをシステム間でシャッフルしたりするサイクルに費やすだけなら、無駄な作業に対して支払うことになります。メモリウォールをスケールさせるとは、データ層を共有ストレージのように振る舞わせつつ、真のメモリ速度で動作させることです。HBMに近い速度は、現在登場しているKVキャッシュオフロードソリューションの利益センター波にとって重要です: どれもトークノミクスが成立する真のメモリクラス性能を提供しなければなりません。KVキャッシュの保持価値はコストセンターの議論であり、利益センターの二次的な話題です。キャッシュからコンテキストを読む速度が再計算より遅いなら、ビジネス上の価値はありません。重要なのはGPUの数ではなく、各GPUがどれだけ生産的に働くかです。AIの経済性は、トークン、バイト、ワットあたりの価値抽出に帰着し、安全性要件はその数式のステークスをさらに高めます。
将来的に、AI安全性とコンプライアンスはサイバーセキュリティが専用レイヤーとして確立したように、独立したインフラワークロードになると予想しますか?
AI安全性とコンプライアンスは独立したワークロードとして確立し、サイバーセキュリティのパラレルは両方向に当てはまります。セキュリティが偶発的な取り組みではなく、業界がそれを必須と認識した時点で独自レイヤーとなりました。AI安全性も、モデルがより高度かつ自律的になるにつれて必須の軌道をたどります。
しかし、セキュリティが陥った過ちから学ぶべきです。セキュリティは別スタック・別予算・別チームとして後付けで問題を発見するボルトオンになりました。安全性インフラはその失敗を繰り返すべきではありません。モニタリング、評価、監査可能性、そして不変保持はAIインフラ自体に組み込み、設計段階から共創すべきです。
多くの人が見落としがちなのは: 安全なAIにはより多くのAIが必要だということです。ガードレールモデルは無料ではありません。エージェントの実行中に継続的にトレーニング、ファインチューニング、推論が求められます。トークンレイテンシ予算が具体化します: 各応答には固定ウィンドウがあり、そのウィンドウ内で処理できるトークンが多いほど、出力前に実行できる検証が増えます。フロンティアモデルの真の脅威はエージェント的応用です。エージェントは高頻度の推論ループとして走り、長時間にわたりモデル呼び出しを繰り返します。各ループは「観測・方向付け・決定・行動」で構成され、各ステップがトークンを消費します。これがAIセキュリティをトークン消耗の戦争に変えます。攻撃者はレッドエージェントスウォームを、守備側はブルーエージェントスウォームを展開し、ドルとワットあたりのトークン生成量が勝負を決します。トークノミクスは攻撃と防御の両方のクリティカルパスです。この夏、主要モデルリポジトリに対するレッドエージェントスウォーム攻撃が業界を目覚めさせ、数日で安全AIアライアンスが結成されたことが転換点となりました。同時に、処理トークン量は兆から京へと拡大し続けています。
安全性が常時オンの要件になると、そのコンピュート、メモリ、データコストはもはやオーバーヘッドではなく、AI運用の根本的な単位経済に組み込まれます。早期にこれを内部化した企業は安全性を設計入力として扱い、他の企業はそれを税金のように扱うでしょう。
素晴らしいインタビューをありがとうございました。詳しく知りたい読者はぜひ WEKA をご訪問ください。












