インタビュー
スティーブ・ネムザー、シニアディレクター、AI成長&イノベーション、TELUS Digital – インタビューシリーズ

スティーブ・ネムザー、シニアディレクター、AI成長&イノベーション、TELUS Digitalは、次世代のAIシステムのためのAIトレーニングデータとインフラストラクチャの開発に焦点を当てたイニシアチブを主導しています。彼の仕事には、深い研究モデル、強化学習環境、ワールドモデルデータ、主権AIイニシアチブ、AIリスク緩和フレームワークのためのデータセットの開発が含まれます。彼は、データセットの偏りを解決し、AIトレーナーにとって公正な労働条件をサポートすることなど、責任あるAIの実践に強い重点を置いています。彼のキャリアの初期には、VeriTest Labsを設立し、Microsoft (MSFT ) 、Intel (INTC ) 、Oracle (ORCL ) 、Sun Microsystemsなどの初期のテクノロジー企業が第三者ソフトウェアエコシステムを構築するのを支援しました。その後、Lionbridgeに買収されました。
TELUS Digitalは、世界的なテクノロジーサービス企業であり、組織がデジタルプラットフォームとAIパワードソリューションを設計、構築、運用するのを支援しています。TELUS Digitalは、数十カ国の国々でサービスを提供し、AIトレーニングデータと注釈、デジタル製品エンジニアリング、顧客体験管理などのサービスを提供しています。TELUS Digitalのプラットフォームとサービスは、テクノロジー、金融、ヘルスケア、テレコミュニケーション、ゲームなどの業界の企業を支援し、運用を近代化し、先進的なAI機能を展開するのを支援します。
あなたのAIテスト、データ検証、責任ある展開に関する経験を考えると、言語駆動型の生成AIから、現実世界の状況と結果について推論することを目的としたワールドモデルへのシフトをどう見ていますか?特に、現在のTELUS Digitalでの役割ではどうですか?
大規模言語モデル(LLM)は、基本的にパターン予測システムです。パターン予測は、静的なコーパスから学習したパターンに基づいて、次のトークンを予測することによって行われます。そうすることで、回答を生成しますが、モデルは、実際には、世界の状態を変化させる方法をモデル化していません。
ワールドモデルは、異なるアプローチを取ります。次の単語またはトークンを予測するのではなく、ワールドモデルの目標は、システムの次の状態を予測することです。システムの状態遷移をモデル化することで、環境がアクションに応じてどのように進化するかをシミュレートすることができます。実践的には、仮説的推論を可能にし、モデルは、決定を下す前にさまざまな可能な結果を評価することができます。対話システムの場合、これにより、より信頼性の高い意思決定と計画が可能になります。
このシフトは、責任ある展開についても私たちの考え方を変えます。従来の生成AIシステムでは、偏りや幻覚などの問題に重点が置かれていました。モデルが環境やアクションについて推論するように進化するにつれて、他のリスクがより顕著になります。
たとえば、組織は「シミュレーションからリアルワールドへのギャップ」を考慮する必要があります。シミュレーション環境で学習した行動は、現実の条件にきれいに翻訳されない可能性があります。分布シフトも重要な懸念事項となります。モデルが展開時に遭遇する環境は、トレーニングに使用したデータと異なる可能性があります。
これは、私の役割で重要な焦点となっているテストと検証が重要となる理由です。AIシステムが言語生成を超えて、環境とやり取りし、決定を下すようになると、組織は、モデルが現実の条件下で信頼性を持って動作することを確認するための厳格な評価フレームワークが必要になります。
多くの人々は、大規模言語モデルに精通していますが、ワールドモデルについてはあまり理解されていません。ワールドモデルは、LLMが基本的に苦手とする問題を解決しようとしています。簡単に説明すると、それは何ですか?
ワールドモデルは、現在の状態とアクションが与えられたときに「次に何が起こるか」を予測するシステムです。式は次のとおりです:状態 + アクション → 次の状態
もし私がリンゴを持っていてそれを放したとしたら、ワールドモデルはリンゴが落ちることを予測します。リンゴがどのように見えているか、または人々がリンゴを落とすことについて何と言っているかを知っているのではなく、物理学の理解に基づいて結果を予測します。洗練されたワールドモデルは、私が同じことを国際宇宙ステーションで行った場合と地球の表面で行った場合の違いを予測することもできます。
これは、LLMとは異なります。LLMは、次のトークンを予測します:「このトークンのシーケンスが与えられた場合、次のトークンは何ですか?」テキストに基づいてトレーニングされています。世界について人間が書いたもの、世界そのものではありません。リンゴが落ちるのは、読んだからです。しかし、リンゴの落下をシミュレートする内部物理エンジンはありません。
別の言い方をすると、LLMは、質問への回答の次の単語を統計的に予測するのが得意ですが、現実世界を理解するには、言語の記述と結束を超えて行く必要があります。ワールドモデルは、状況が段階的にどのように進化するか、現在の状態と起こりそうなアクションが与えられたときに次の状態は何か、制約は何かを理解しようとします。
ワールドモデルは、行動を取る前に結果をシミュレートできるAIシステムを可能にすることがよく言及されています。実践では、これはどのように見えますか?また、研究環境の外で信頼性を持って機能するシステムが現れるには、どのくらいの時間が必要ですか?
この質問に答えるのは難しいです。ワールドモデルの用語はかなり自由に使用されており、その意味はコンテキストによって変わります。ワールドモデルの単純な定義は、エージェントが現在の状態環境をシミュレートし、将来の状態を予測し、下流の結果について推論できることを可能にするものです。研究者は、ワールドモデルを表現方法と処理方法に基づいてより細かく分類する傾向があります。潜在的なワールドモデル、生成的なワールドモデル、Joint-Embedding Predictive Architecture(JEPA)モデルがあります。
潜在的なワールドモデルは、すでに研究室を出て、自動運転、倉庫運用、産業運用、農業などのアプリケーションで活用されています。生成的なワールドモデルは、ゲームエンジンの開発、自走車のユースケース、体現されたAIのユースケース、建築のレンダリングの作成などに登場しています。
JEPAアプローチは、業界の有名人であるYan LeCunが推進しているもので、抽象的な表現空間で結果を予測するのではなく、ピクセルを生成します。ロボットは主に制御された環境に限定されていましたが、JEPAはそれを変えています。ロボットをオープンエンドのリアルワールド環境に移行させることができます。自走車は良い例です。いくつかの車両は、Genie 3を使用して、トレーニングとレアイベントの処理を改善するための超リアルなインタラクティブシミュレーションを生成しています。
明らかに、サンドボックス環境からリアルワールドへの移行をスケールアップするには、安全性と信頼性のテストが必要です。
企業として、ワールドモデルが有意義な価値をもたらすことが期待される最初の場所はどこでしょうか?ロボティクス、自律的な意思決定システム、デジタルツイン、またはより抽象的なビジネス環境ではどこでしょうか?
私の直感は、デジタルツインが最初に実用的な価値をもたらす可能性が高いです。現実世界のシステムの状態を複製して、行動を起こす前にシナリオをテストできるようにします。たとえば、サプライチェーンシステムでは、メーカーはコンポーネントパートナーネットワークのツインを作成できます。シミュレーションはセンサーデータ、ログ、テレメトリデータでフィードされ、ホルムーズ海峡が閉鎖された場合に何が起こるかなどの質問に答えることができます。したがって、実際の物流を変更する前に、出荷を再ルーティングするテストができます。これにより、システムの監視からシミュレーションへの移行が可能になります。
ロボティクスにおけるワールドモデルの有意義な価値は、並行して進行しています。ロボットが物理学の基本的な特性、たとえば表面の摩擦を理解することで、エンボディドAIの展開が加速するでしょう。
あなたのキャリアの多くは、データセットの収集、注釈、検証に焦点を当ててきました。静的なテキストトレーニングから、システムに世界がどのように動くかを教えるように移行する場合、データの課題はどのように変化しますか?
ワールドモデルを可能にするデータ収集状況は、昨日のLLMトレーニング方法から大きな転換が必要です。まず、巨大な事前トレーニングデータコーパスが利用できないことです。ロボティクス研究者は、物理的知能とワールドモデルをトレーニングするために必要なデータが、GPT2と同等のパフォーマンスポイントに到達するために必要なデータの1/1000に過ぎないと推測しています。
したがって、データセットを構築するには時間がかかります。エンボディドAIの場合、多感覚データセットの数百万時間の注釈付きデータが必要になります。テレオペレーションの一部、シミュレーション環境からのもの、一部はIsaac Simからのものです。TELUS Digitalでは、テキストからマルチモーダル、そしてマルチセンサーおよびシミュレーションデータセットにシフトしています。コンピュータービジョンにおける強力なデータ収集および注釈付けのバックグラウンドによって支援されています。数年前からこの分野で先駆けてきました。
事前トレーニングデータと注釈付きのファインチューニングデータの希少性に加えて、強化学習のスケーラビリティを高めるための新しいパラダイム、たとえばGPTやRLの概念が必要になる可能性があります。
ワールドモデルは、出力のみを生成するのではなく、決定を下します。従来の生成AIシステムと比較して、これはどのような新しい安全性またはガバナンスのリスクをもたらしますか?
多くの安全性とガバナンスのリスクがあります。ワールドモデルは、基本的にエージェント操作をサポートするように設計されているためです。今日のAIエージェントに関する懸念はすべて、ワールドモデルシナリオでも適用されます。重要な意思決定には、交通安全、職業安全、ヘルスケア、財務、日常活動に関連するすべての分野で人間の監督が必要です。
ワールドモデルに特有の例は、シミュレーショントレーニングデータとリアルワールド環境のギャップです。表面の微小な変化は、シミュレーションでトレーニングされたロボットにとってリアルワールドを混沌としたものにする可能性があります。
別のリスクは、人間の行動に関連しています。システムがより自律的になるにつれて、人間はそれに大きく依存し、監督が緩くなる可能性があり、最終的にシステムは必要な再調整を受けられなくなります。
偏見と信頼は、AIの採用における大きな障壁のままです。AIシステムが複雑なリアルワールドまたは社会的環境でモデル化および行動を開始するにつれて、これらの懸念はどのように進化しますか?
一般の人々からC-suiteまで、AIモデルに対する信頼と信頼性はすでに低く、短期的には大きな変化は見られません。
AIの力があまりにも少数の手に集中していること、AIが仕事を奪うこと、AIの偏りが代表されていないグループに不利な影響を与えること、モデルが健康、キャリア、財務に影響を与える決定を下すこと、モデルが同意なしに知的財産を使用すること、AIのディープフェイクに関する懸念など、既に高いレベルで懸念されています。幹部は、労働力の移行の処理、データプライバシー、規制遵守、AI「軍拡競争」で競合他社に後れを取ることについて心配しています。
AIの基礎モデルビルダーが、自律型兵器や大量監視などの使用についての利用条件を緩和するように政府から圧力を受けているという最近のニュースは、これらの懸念をさらに高めています。ワールドモデルベースのロボットのより広範な展開も同様の影響を及ぼすでしょう。
一方で、AIの採用と信頼性が広がっている兆候もあります。たとえば、コードエージェントが過去数ヶ月でどのように普及したかを見てみましょう。ソフトウェア開発マネージャーは、コードエージェントに高い信頼性を持っています。ソフトウェア開発の方法は、PRD開発からリリース後のリグレッションテストまで、根本的に変化しています。ソフトウェア開発の世界は、信頼性の高いコードエージェントのおかげで、光速で進化しています。他のユースケースでも、信頼性が高まると、同様に採用が進むと予想しています。
信頼性を築くための解決策には、トレーニング段階での多様なデータセットと環境、デプロイ前の赤チームテストとストレステストが必要です。規制当局の積極的な監督も必要です。いくつかの団体は、モデルビルダーが新しいモデルをリリースする前に「社会的影響報告書」を提供することを義務付けることを提案しています。これは、環境影響評価(EIR)と同様です。
TELUS Digitalでは、実際の企業と実際のユーザーに対してAIを大規模に展開することが多くあります。ワールドモデルなどのアイデアは、透明性、労働力への影響、顧客の信頼性の維持などの実際的な懸念とどのように交差しますか?
明確にするために、TELUS Digitalは、基礎モデルビルダーと直接協力し、また企業とAIモデルを展開する企業と協力しています。私たちのプレイフィールドはエンドツーエンドです。

実際的な懸念に関する質問は、信頼に関する前の質問に関連しています。労働力の信頼について見てみましょう。ワールドモデルを活用したAIがより普及するにつれて、幹部は、従業員、契約者、顧客とに対して透明性を保つ必要があります。モデルが何に優れているか、それらがどのようにトレーニングされたか、どのデータを使用してトレーニングしたか、どのようなガードレールが設けられているか、人間の監督がどこにあるかについて、明確なコミュニケーションが必要です。企業のリーダーは、従業員に、新しいモデルの価値を示す必要があります。たとえば、仕事の面倒な作業をすべて行うことです。また、影響を受ける労働者が新しい出現する仕事に移行するための移行パスを示す必要があります。白身の労働者は、現実時間でこれに対処していますが、ワールドモデルの活用された自動化が拡大するにつれて、多くの手作業が影響を受けることになります。
AIの進歩について、研究者と一般の人々の認識の間には、拡大するギャップがあります。ワールドモデルのような進歩を、信頼性を築きながら過大な能力を主張せずに、どのように伝えることができますか?
再び、モデルが何に優れているか、モデルがどうトレーニングされたか、人間の監督がどこにあるかについて、透明性が必要です。モデルが偏りを軽減する方法について、現実世界でのモデル能力とユースケースの実証、長期的な研究を実施することで、一般の人々と労働者の信頼性を高めることができます。
最後に、ワールドモデルについて、過度に楽観的または過度に慎重な、一般的な誤解を挙げてください。すぐに訂正する必要があります。
一般の人々がワールドモデルについて知っている限りでは、誤解は、ワールドモデルが「すべて」の物理学と科学を理解する必要があるということです。ワールドモデルは、より早くロールアウトします。個々のユースケースは、狭められます。自律型車両は、交通のダイナミクスと道路関連の物理学のみを理解する必要があります。現在の状態(たとえば、小学校の近くにいるか、背の高いシルエットを持つ近くのSUVの存在など)が、視覚と意思決定にどのように影響するかを理解する必要があります。自律型車両は、ソフレの焼き方の根底にある物理学を理解する必要はありません。
素晴らしいインタビュー、詳しく知りたい読者は、TELUS Digitalを訪問してください。












