ソートリーダー

マーケティングで「ベストLLM」という概念が存在しない理由

mm
Unite.AI を Google の優先ソースに追加

新しい大規模言語モデルがリリースされるたびに、同じ約束が伴うことが多い。より大きなコンテキストウィンドウ、より強力な推論、より優れたベンチマークパフォーマンスである。しかしその後、AIに精通したマーケターは、既に使用しているモデルが古くなっているのではないかという不安を感じ始める。切り替えてすべてを再トレーニングする価値があるのか。何もしないと後手に回されるのではないか。

その不安は理解できる。ただし、それは間違っている。

マーケターが毎日頼るシステムを構築する責任がある私から見ると、このパターンはチームやワークフロー全体で長期にわたって繰り返されるものである。

製品やプラットフォームの観点から見ると、過去数年で明らかになったことは、すべてのマーケティングタスクで一貫して最も優れたパフォーマンスを発揮する単一のモデルは存在しないということである。世界中のマーケティングチームがグローバルキャンペーンを立ち上げるペースでモデル革新が進むのを目の当たりにしているので、現実のマーケティング業務の要件は、単一のモデル戦略で長期にわたって成り立つにはあまりに繊細であることが明らかである。

「正しい」モデルを選択することは重要ではない。なぜなら、すべてのタスクに適した単一のモデルは存在しないからである。重要なのは、モデルを継続的に評価し、マーケターが行おうとしている特定の作業にそれらをマッチングできるシステムを設計することである。これは、個々のマーケターが管理するべきものではなく、ツールが管理するべきものである。実用的には、単純である。どのモデルが「ベスト」であるかを尋ねるのをやめ、ツールがモデルが変更されても適応できるかどうかを尋ね始めるのである。

マーケティングにおける「ベストモデル」思考の崩壊

LLMに関するほとんどの公的な議論は、一般的なベンチマークを中心に行われる。数学の問題、推論の課題、標準化された試験である。これらのベンチマークは、研究の進歩を示す有用な信号であるが、現実のタスクのパフォーマンスを予測するのは弱い。

マーケティングコンテンツは、特定の製品またはサービスについてであることが多い。特定の対象者に向けて書かれることが多い。ブランドの声、トーン、基準を一貫して反映する必要がある。

例えば、さまざまなモデルが異なるタイプのマーケティング作業で優れていることがわかっている。いくつかのモデルは、ブランドの声でコピーを作成することに優れているが、他のモデルは、複雑な技術文書を理解し、ブログ投稿に凝縮することに優れている。私たちは、これらの能力を迅速に評価し、現実的にテストすることでこれを学ぶ。たとえば、Gemini 3 Proが2025年11月末にリリースされたとき、私たちのチームはそれを統合してテストし、24時間以内に選択された顧客に提供し、抽象的なベンチマークではなく、現実のマーケティングワークフローに適合するかどうかを評価した。

このパターンは、逸話的なものではない。研究は、LLMのパフォーマンスがタスク依存性が高く、モデルは書き込み、要約、推論、命令の実行タスクで有意な変動を示すことを強調している。一般的な推論テストで優れたパフォーマンスを示すモデルでも、制約のある、ブランドに敏感なコンテンツ生成で苦労する可能性がある。

さらに重要なのは、モデルリーダーシップの変更が、プロバイダーが異なる機能、コスト構造、トレーニングアプローチを最適化するにつれて、毎月発生することである。マーケティングのすべてのユースケースで「ベスト」であるプロバイダーが存在するという考えは、すでに時代遅れである。

リリースを追うことの隠れたコスト

チームがモデルリリースを手動で追跡し、ツールを反応的に切り替えようとするとき、運用コストが累積する。マーケターは、次のようなものを経験する。

  • ワークフローの混乱。プロンプト、テンプレート、プロセスが常に調整される必要があるため。
  • 出力品質の不一致。異なるモデルが異なるタスクで異なる動作をするため。
  • 意思決定の疲労。評価時間が生産的な作業に取って代わるため。

私はマーケティングチームが、プロバイダーを切り替えるために丸4分の1の年を費やすのを見てきた。ただし、慎重に調整したプロンプトが期待どおりに機能しないことが多い。ブランドの声が一致していたコンテンツが、突然違うように聞こえる。1つのワークフローに慣れていたチームメンバーが、新しい学習曲線に直面する。約束されたパフォーマンスの向上は、混乱を正当化するにはほとんどない。

業界の研究は一貫して、AIの価値のほとんどは、モデルレイヤーではなく、統合と変更管理で失われていることを示している。製品の観点から見ると、最大のリスクは、ワークフローを単一のモデルに結びつけることである。そうすると、技術的なロックインが生じ、改善がより困難になる。

より耐久性のあるアプローチ:LLM最適化システム

より堅牢なアプローチは、変動を前提としてシステムを設計することである。

LLM最適化システムでは、モデルは固定の依存関係ではなく、交換可能なコンポーネントとして扱われる。パフォーマンスは、抽象的なベンチマークではなく、実際のワークフローを使用して継続的に評価される。異なるモデルは、観測された結果ではなく、理論的な能力に基づいて、異なるタスクにルーティングできる。

これは、ソーシャルメディアのキャプション生成を、簡潔さとパンチに優れたモデルにルーティングし、長文のブログコンテンツを、一貫性を保つモデルにルーティングすることを意味するかもしれない。戦略を支援するエージェントは、推論に優れた別のモデルを使用するかもしれない。システムは、各タスクタイプでどのモデルが最も適切であるかを自動的に判断する。

ユーザーの観点から見ると、このプロセスは透明であるべきである。私はここで好きなアナロジーを使用する。フランス料理では、ソース、レデュース、シーズニングなど、すべてのコンポーネントにテクニックが存在する。食事をする人は、各食材がどこから来たかを知る必要がない。彼らはただ、より良い食事を体験するだけである。

マーケターも同じ原則が適用される。基盤となるエンジンは変更されるが、ワークフローは安定したままである。改善は、ブランドの整合性、コンテンツの満足度、結果の一貫性の向上という形で徐々に表れる。チームがツールを再学習する必要がないため、より一貫した結果と、ワークフローの混乱が少なくなり、モデルが下層で変更されても、である。

ベンチマークよりも測定が重要

モデルに関する決定は、実際のワークフローで測定可能な改善をもたらす場合にのみ重要である。パブリックベンチマークは方向性のある洞察を提供するが、マーケティング固有の運用上の質問には答えを与えない。

  • このモデルはブランドの声がより信頼性の高いものになるか。
  • このモデルは製品の知識をより少ないエラーで組み込むか。
  • このモデルは編集時間またはガバナンスのボトルネックを削減するか。

最近の研究は、適用されたLLMシステムにおける人間の関与とタスク固有のテストの重要性を強調している。規模では、これらの信号は、リーダーボードのランキングよりも価値を予測するのにはるかに優れている。

エージェントシフトが賭けを上げる

AIシステムがよりエージェント的になるにつれて、計画、草案作成、繰り返し、実行が行われるが、直接の監督が少なくなる。同時に、人間が毎回の決定を監督することは、より困難になる。

これは、エージェントシステムに関する現在の研究と一致する。ツールとモデルの選択は、信頼性と安全性に大きな影響を与える。 この環境では、モデル選択は、ユーザーの好みではなく、インフラストラクチャーの決定となる。システム自体が、各ワークフローのコンポーネントが、その瞬間の最も適切なモデルによって動作していることを保証する必要がある。

変化を受け入れること

見出しが続いてくる。新しいモデルがリリースされる。LLMのパフォーマンスのリーダーシップは続いて変化する。

成功は、モデル変動を吸収できるシステムを構築することである。そうすることで、マーケターは迅速に仕事をスケールし、品質とブランドの整合性を維持し、実際に影響を与える仕事に集中できる。

私は、マーケティングにおけるAIの未来は、モデル変更を仕事をする人にとって無関係にすることであると真正に信じている。マーケターには、6か月ごとにモデルを再トレーニングするよりも、重要なことをすることがあるからだ。

ブライアン・ツァオは、Jasperのチーフ・プロダクト・オフィサーです。Jasperはマーケティング・エージェント・プラットフォームであり、ブライアンはプロダクト、エンジニアリング、成長、データチームを率いています。Jasper以前は、Dropboxの成長とデータ担当VP、Namelyのプロダクトとデザイン担当VP、Mattermarkのプロダクト、デザイン、データ担当VPなどのシニアリーダーシップを務めてきました。彼は、カリフォルニア大学バークレー校で情報管理システムの修士号、サンディエゴ大学で認知科学の学士号を取得しています。