AIモデルとプラットフォーム

オープンAIのオペレーターのすべて

mm
Unite.AI を Google の優先ソースに追加

オープンAIは、最近数週間で基盤を整えている。ほとんどのユーザーがChatGPT Tasksを利用し始めたばかりだったが、これは新機能で、ユーザーがタスクをスケジュールしてトリガーできる。これは、企業がより重要なものに備えていた。

昨日のOperatorのリリースは、人工知能が向かっている方向を示すもう一つの明確な信号である。情報を単に処理するモデルから、我々と一緒に積極的に働くことができるエージェントへの移行である。

毎日、私たちは数えきれない時間をウェブサイトのナビゲーション、フォームの入力、サービス予約、デジタルタスクの管理に費やしている。人工知能は、主にアドバイスを提供したりテキストを処理したりすることしかできなかった。Operatorは、最近の他のエージェントの発表とともに、AnthropicのComputer UseやGoogleのProject Marinerのように、このダイナミクスを完全に変える。

ここでの技術的成果は大きい。オープンAIは、ウェブインターフェイスと同じように見て、人間のように相互作用することができる人工知能を作成した。画面をキャプチャし、視覚的なレイアウトを理解し、クリックする場所、入力するテキスト、ナビゲーションの方法について決定する。

オペレーターエージェントについて知るべきこと: 多くのAIツールは、APIや特殊な統合の後ろに閉じ込められているが、Operatorは、ウェブと同じように動作する。画面を見て、コンテキストを理解し、直接アクションを実行する。

オペレーターの実際のパフォーマンスの詳細

AI企業がベンチマークを発表するとき、それが実際に何を意味するかを注意深く見ることが重要である。Operatorのパフォーマンスは、さまざまなテスト環境で異なる物語を語る。

最も印象的なメトリックは、Operatorの87%の成功率であるWebVoyagerベンチマークである。これは重要である。なぜなら、WebVoyagerは、AmazonやGoogle Mapsのような、日常的に利用する実際のウェブサイトをテストするからである。これは、制御されたラボテストではない。野外でのパフォーマンスである。

しかし、他のベンチマークを見ると、より微妙な絵が見える。

  • WebArenaベンチマーク 58.1%の成功率。シミュレートされたウェブサイトで、ショッピングやコンテンツ管理などのタスクをテストする。ここでのパフォーマンスの低さは、構造化された環境と非構造化された環境でAIエージェントがどのように処理するかについて、重要なことを明らかにする。
  • OSWorldベンチマーク 38.1%の成功率。これは、複数のステップが必要なタスク、例えば、EメールからのPDFを組み合わせることをテストする。パフォーマンスの著しい低下は、AIエージェントが複数のコンテキストスイッチを必要とするタスクの現在の限界を示す。

これらの数字が私にとって興味深いのは、人間の学習パターンをどのように反映しているかである。私たちは通常、人工的なテストシナリオよりも、実際の環境でよりよく実行する。Operatorが実際のウェブサイトで優れている一方で、シミュレートされたもので苦労していることは、そのトレーニングが実用的な有用性よりも理論的なパフォーマンスを優先していることを示唆する。

これらのベンチマークは、ブラウザーオートメーションで新しい記録を樹立するが、さまざまなテストでの成功率の違いは、オープンAIの戦略について、重要なことを教えてくれる。

あなた自身のウェブブラウジングについて考えてみてください。ほとんどのタスクは、フォームの入力、購入、予約、アポイントメントの設定など、シンプルなものである。これが、Operatorの87%の成功率が輝くところである。パフォーマンスが低下する、より複雑なタスクは、人間の監視が貴重であるタスクである。

このデータは、オープンAIが意図的に選択をしていることを示唆する。一般的なタスクを最初に完璧にし、次に徐々により複雑な操作に拡大する。これは、即時の有用性よりも理論的な能力を優先する、実用的アプローチである。

AIエージェントのベンチマーク (オープンAI)

オープンAIのオペレーターの背後にある戦略

オープンAIのOperatorへのアプローチは、慎重に計画された戦略を明らかにする。

まず、タイミングを考えてみましょう。最近の機能のロールアウト、例えば、ChatGPT Tasksは、単に機能を追加することではなく、ユーザーを自律エージェントに準備させることだった。

しかし、本当に興味深いのは、オープンAIがCUAモデルをAPIを介して公開する計画にあることである。これは、開発者が独自のコンピュータ使用エージェントを作成できることを意味する。

これの意味は重大である。

  1. 統合の可能性
  • 既存のワークフローへの直接的な統合
  • 特定のビジネスニーズ向けのカスタムエージェント
  • 業界別の自動化ソリューション
  1. 将来の開発パス
  • Plus、Team、Enterpriseユーザーへの拡大
  • ChatGPTとの直接統合
  • 地理的拡大(ただし、ヨーロッパは規制要件により、より長くかかる)

戦略的パートナーシップも物語っている。オープンAIは、DoorDash (DASH ) 、Instacart、OpenTableなどの企業と協力しているが、Stockton市のような公共部門の組織とも協力している。

これは、AIエージェントが単なるアシスタントではなく、デジタルシステムとどのように相互作用するかを形作る上で、不可欠な部分になる将来を示唆する。

これが実際にあなたにとって意味すること

私たちは、AIが質問に答えるだけでなく、デジタル生活で積極的に参加する段階に入っている。

あなたの日常のオンラインタスクについて考えてみましょう。複雑な、戦略的な仕事ではなく、繰り返しのタスクについてです。旅行オプションの調査、標準化されたフォームの入力、さまざまなウェブソースからのデータの収集、ルーティンタスクの管理などです。これが、Operatorが最初にデジタルな忙しい作業を排除するところです。しかし、これは終わりではありません。時間の経過とともに、AIエージェントはより複雑なワークフローを完了することができるようになるでしょう。

初期のパフォーマンスデータも、重要なことを教えてくれる。Operatorは、87%の成功率で、ルーチンタスクに優れている。早期に採用し、効果的に統合することができるユーザーは、重大な生産性の優位性を得ることができる。

統合のタイムラインは、オープンAIの慎重なアプローチを明らかにする。アメリカのProユーザーから始まり、次にPlus、Team、Enterpriseユーザーに拡大し、最終的にChatGPTに直接統合する。

私たちは、AIツールがどのように機能するかという根本的な変化を観察している。実際にあなたが自分に問うべき質問は、変化に適応するかどうかではなく、どのように戦略的に適応するかである。技術は進化するが、原則は残る。AIは、質問に答えることから、行動を起こすことへの移行である。早期にこの変化を理解する者は、ツールがワークフローに統合される方法を形作る上で、重大な優位性を得ることができる。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。