ソートリーダー
クロード「ネルフ」論争はクロードについてではない。誰かの決定に依存する運用が何を起こすかについてである。

今年の初め、AMDのAI担当シニアディレクターであるステラ・ローレンツォは、約7,000のクロードコードセッションから得られたテレメトリデータを公開し、エンジニアが感じていたものの表現できなかったことを明らかにしました。1月から3月にかけて、可視的な推論の深さが73%減少したように見え、タスクあたりのAPI呼び出しが80倍に増加し、モデルは編集前に読み取るファイルが大幅に減少していました。数字はすぐに広まりました。解釈もさらに広がりました。
Anthropicはこの説明を否定しています。会社は、変更は新しい適応型思考メカニズムとデフォルトとしての中程度の努力への移行を含む、意図的な製品の決定を反映していることを示しています。独立した分析家も、方法論のいくつかの部分に異議を唱えています。論争は続いており、合理的な人々は実際に何が起こったのかについて意見が分かれています。
しかし、重要なのは、これらのシステムの上でビジネスを運営している場合、どちらが劣化したか、または意図的な調整だったかは、企業の運営者が直面したものとは無関係です。彼らはそれを予測できませんでした。彼らはそれを制御できませんでした。そして、起こっていることを理解する前に、生産でそれを感じた人もいました。これが本当の話であり、Anthropicに特有のものではありません。
これは依存関係の問題であり、モデル問題ではありません。
私たちが説明しているものには名前があります。モデルフラジリティです。これは、ミッションクリティカルな運用が単一のモデルの動作に密接に結びついており、モデルレイヤーでの変更、つまりチューニングの決定、新しいデフォルト、容量駆動型ルーティングの変更、または静的な廃止が、バッファーも警告もなく、ビジネスに直接影響を与える状態です。
これは新しいパターンではありません。GPT-4は2023年に同様のものを経験しました。クロード3.5は2024年に同様のものを経験しました。クロードオプスは現在同様のものを経験しています。次のフロンティアモデルでも起こり、次のものでも起こります。どのベンダーも悪意を持って行動しているわけではありません。コスト、待ち時間、スケールを世界規模で最適化するフロンティアモデルは、フロンティアベンダーが行う必要があることです。彼らのインセンティブと、上にそれらを使用して運用を行う企業のインセンティブは関連しています。彼らは同一ではありません。彼らは決して同一ではありません。
私たちは2023年にQurrentを開始し、企業ソフトウェアサイクルがどのように展開するかについての歴史的な知識を持っています。会社はAIに投資します。デモは機能します。パイロットは機能します。次に、それがライブになり、モデルレイヤーで何かが変化し、突然顧客が問題を所有することになります。彼らはワークフローを維持し、後退を追跡し、混乱を吸収する人々です。私はそれが持続可能な企業運用モデルであると考えていませんでした。
企業版の物語は運用上のものであり、技術的なものではありません。
開発者にとって、現在の状況は不便です。トークン予算はより速く消費されます。コーディングセッションは停止します。ベンチマークは失望します。これは実際の問題ですが、回復可能なものです。
財務運用、コンプライアンスワークフロー、受取金と支払金、複雑なバックオフィスプロセスを実行している企業にとって、賭けは異なります。これらのワークフローは、悪い週を吸収できません。エラーは複合します。ボリュームは複合します。SLAは内部の好みではなく、実際の顧客への約束です。モデルが高リスクプロセスで低性能になったと判断されると、誰も気づいていない場合でも、損害は蓄積され続けます。
これをより困難にするのは、AIに先んじて単一モデル上に内部エージェントを構築しようとした多くの企業が、その基盤が不完全であったことを発見していることです。最初のエージェントは簡単な部分でした。構築されなかったのは、周囲のインフラストラクチャーでした。行動の変化を顧客に達する前に検出する評価フレームワーク、モデルが低性能になったときに自動的に作業をルーティングするフォールオーバーロジック、および毎四半期に変化する景色に追いつくことができる継続的なガバナンス。这些ギャップは、管理可能なままには留まりません。それらは、ベンダーの決定を追跡するために誰も予算を立てていない、誰もスタッフを配置していない、恒久的なエンジニアリング機能に成長します。
実際の生産における回復力の実像。
Qurrentでは、デジタルワークフォースを最初からモデル非依存として構築しました。これは、マーケティング上の立場ではなく、建築上の要件でした。各タスクは、継続的に評価される、最適なパフォーマンスのモデルにルーティングされます。より優れたモデルがリリースされると、顧客は自動的にそれを受け取ります。現在のモデルが特定のワークフローで低性能になると、オーケストレーションレイヤーは数秒以内に作業をルーティングし、人間の介入や誰かが2時にSlackスレッドに目覚めることなく行います。
その下で、自動シミュレーションは、生産ワークフローに対して24時間体制で実行され、出力が予想される動作と一致するかどうかを測定します。ドリフトは、インフラストラクチャレイヤーで検出され、運用チームがそれを感じる前に、そして誰かがそれを知る前に検出されます。さらに、各デジタルワーカーによる決定はすべてログされ、レビュー可能です。完全なガラスボックスです。なぜなら、見えないものは管理できないからです。
これらはプレミアム機能ではありません。これらは、企業規模でAIを運用するための入場料です。多くの企業は、ニュースサイクルの真ん中でこれを学んでいます。これは、学ぶための高価な方法です。
今四半期に問うべき質問。
あなたの運用が最も依存するモデルが来四半期に悪い週を迎えた場合、あなたのどのワークフローがそれを感じるでしょうか。どうやってそれを知ることができるでしょうか。どのくらいの速さでそれを回避できるでしょうか。
2番目の質問に対する答えが「顧客から聞く」となれば、運用は生産に準備ができていません。規模で実行されているパイロットです。区別は、多くのリーダーがそれを実感するまでに重要です。
現在の論争は、間接的に役に立ちます。CFOとCOOがこれを注視しているすべての人は、実際の運用負荷の下でのモデルフラジリティの見た目を無料でプレビューしました。彼らはそれを自分で支払わなくても済みました。正しい対応は、モデルを切り替えることではありません。単一のものに依存しない運用を構築することです。
テクノロジーは続けて変化します。それがこの市場で唯一の確実性です。この10年を最も強く終える企業は、正しいモデルを選択したものではありません。運用が気にする必要のないものです。












