AIモデルとプラットフォーム

クロードの問題はサーバーの問題だった – それが実際に起こったこと

mm
Unite.AI を Google の優先ソースに追加

クロードについて話しましょう。過去1ヶ月間クロードを使っていた人は、何かが間違っていることを感じたはずです。

6週間前から、クロードのユーザーは頭を抱えました。8月初めから、クロードに関する苦情がReddit、X、開発者フォーラムに氾濫しました。

問題は様々でした:

  • 以前は正常に動作していたコードが突然壊れた
  • クロードがファイルに変更を加えたと主張したが、実際には変更していなかった
  • 英語の応答に突然タイ語または中国語の文字が現れた
  • 指示が完全に無視された
  • 同じプロンプトに対して、質の大きく異なる応答が返された
  • クロード・コードのユーザーが「ロボトミーされた」と感じた

苦情はひどくなり、8月末までに、人々はアンソロジーがクロードを秘密に絞り込んでお金を節約しているのではないかと考え始めました。陰謀論はどこでも見られました – もしかしたらピーク時間中に品質を低下させているのかもしれません。もしかしたら、コストを削減するために、静かに安価なモデルに切り替えたのかもしれません。もしかしたら、これはサーバーのコストを管理するために意図的に低下させたのかもしれません。

ユーザーはクロード・プロを支払っていたのに、クロード・ライトのようなものを受け取っていました。クロードを中心にワークフローを構築した開発者たちは、突然生産性が低下するのを見ていました。ただし、一部のユーザーは問題を経験していませんでした。これにより、状況はさらに複雑になりました。

アンソロジーはついに認めた:ああ、私たちは問題を抱えていた

数週間のユーザーの苦情と増加する苛立ちの後、アンソロジーは巨大な技術的ポストモーテムを公開しました。それは基本的に「あなたは正しかった。クロードは壊れていた。ここに何が起こったのか」と言っているのです。

答えは興味深いです。

実は1つの問題ではありませんでした。3つの完全に独立したインフラストラクチャのバグがあり、同時に発生して、AIの低下の完璧な嵐を引き起こしました。彼らは絞り込んでいなかったし、コーナーカットしていなかった。彼らはただ3つの別々のものが同時に壊れたのです。

私が何が間違っていたのかを詳しく説明しましょう。なぜなら、これは実際に予期せぬ方法でAIシステムが失敗する方法についての役立つ洞察だからです。

3つのバグのメルトダウン:カオスのタイムライン

ソース:アンソロジー

バグ #1:間違ったサーバーの問題

これは、経験していなかった人なら面白いことです。クロード・ソネット4は、200,000トークンコンテキストを処理するように設計されていました。しかし、8月5日から、一部のリクエストは、1ミリオントークンコンテキスト用に構成されたサーバーにルーティングされました。

初期的には、0.8%のリクエストのみが影響を受けました。問題ないと思ったでしょう。違います。

8月29日、ルーティングロジックの更新により、この小さな問題が大きな問題になりました。突然、ピーク時に16%のソネット4リクエストが間違ったサーバーにルーティングされました。ルーティングは「スティッキー」でした。間違ったサーバーにルーティングされると、引き続き間違ったサーバーにルーティングされました。

影響:

  • 約30%のクロード・コードユーザーが、ウィンドウ中に少なくとも1つのリクエストを間違ったサーバーにルーティングされました
  • 影響を受けたユーザーの応答時間が低下しました
  • 同じユーザーが繰り返し問題を経験しましたが、他のユーザーは問題を経験しませんでした

バグ #2:ランダム文字ジェネレーター

8月25日、アンソロジーはTPUサーバーに誤った構成をデプロイしました。その結果、クロードは英語の応答に突然タイ語と中国語の文字を挿入し始めました。

クロードにPythonコードをデバッグしてもらい、次のようになったと想像してください:

defcalculate_total(items)

total = 0

for item in items

総計 += item.price # <- 何?

return 合計

これは影響しました:

  • オプス4.1とオプス4:8月25日から28日
  • ソネット4:8月25日から9月2日

技術的な原因は、文字の生成エラーによって、そこに存在するはずのない文字に高い確率が割り当てられたためです。クロードが次の単語を選択するための基本的なメカニズムを破壊しました。

バグ #3:不可視コンパイラーバグ

これはエンジニアリングの観点から見ると恐ろしいものです。GoogleのXLAコンパイラに潜伏していた潜在的なバグがありました。アンソロジーが8月25日にトークン選択を改善するコードをデプロイしたときに、それを偶然にトリガーしました。

このバグが何をしたかは、本当に奇妙でした。クロードがテキストを生成するときに、最も可能性の高いトークンを意図的に除外することになりました。クロードは正しい答えを知っていたのですが、それを言えるように物理的に阻止されていました。

本当にひどいのは、2024年12月にこのバグを回避していたのに、実際にはそれを修正していなかったということです。8月に「根本的な原因」を「修正」したときに、回避策を取り除き、実際の問題を引き起こしました。

6週間かかった理由

あなたは思うでしょう:世界クラスのエンジニアを持つアンソロジー社が6週間かかったのはなぜですか?

答えは、これらのシステムが実際にどれほど複雑であるかを明らかにしています:

1. プライバシーコントロールがデバッグを妨げた

「私たちの内部のプライバシーとセキュリティコントロールは、エンジニアがクロードとのユーザーのやり取りにアクセスする方法と時期を制限しています。特に、ユーザーがフィードバックとして報告しない場合です。」

ユーザーが明示的にフィードバックを報告しない限り、エンジニアは何が壊れているのか見ることができませんでした。プライバシーにはよかったのですが、デバッグにはひどかったのです。

2. バグが自分自身を隠した

クロードは、個々のミスから回復することが多かったので、低下は正常な変動のように見えました。ベンチマークと評価はそれを検出しませんでした。モデルはテストに合格するのに十分な自我修復をしました。

3. マルチプラットフォームカオス

クロードはAWS Trainium、NVIDIAGPU、およびGoogle TPUs – 3つの完全に異なるハードウェアプラットフォームで動作します。各バグは各プラットフォームで異なる方法で現れました:

  • AWS Bedrock:ピーク時に0.18%のソネット4リクエストが影響を受けた
  • Google Vertex AI:0.0004%未満が影響を受けた
  • Direct API:最大16%が影響を受けた

これにより、複数の無関係な問題のように見えました。

4. 重なり合う症状

3つのバグが同時に発生したため、症状はすべての方向に散在していました。1人のユーザーはタイ語の文字を取得するかもしれませんが、別のユーザーは低下した応答を取得するかもしれません。3人目は完全に正常なパフォーマンスを見せるかもしれません。明確なパターンはありませんでした。

これがAIの信頼性のために実際に意味すること

このサーガは、現在のAIシステムの状態について、重要なことを明らかにしています。彼らは見た目よりもはるかに壊れやすいです。

私たちは、AIモデル自体について話しているのではありません。私たちは、

  • リクエストを間違った場所にルーティングできるルーティングインフラストラクチャ
  • 異なる動作をするハードウェア固有の実装
  • 月間潜伏できるコンパイラーバグ
  • 小さな問題を大きな障害に拡大できるロードバランサー

1つの誤った構成、1つのコンパイラーバグ、1つのルーティングエラー – そして突然、AIアシスタントがコーディングを忘れたり、話すべきでない言語を話し始めたりします。

実際に修正されたか?

アンソロジーは、9月16日までに3つの問題をすべて解決したと述べています。彼らは:

  • ルーティングロジックを修正しました
  • 問題のある構成をロールバックしました
  • 近似から正確なトップk演算に切り替えました(パフォーマンスを犠牲にして精度を上げました)
  • 継続的な生産モニタリングを追加しました

しかし、ユーザーはまだ問題を報告しています。一部の開発者は、クロード・コードが依然として以前のパフォーマンスに比べて低下していると主張しています。もしそうなら、

  • バグの残留的な影響
  • まだ特定されていない新しい問題
  • 数週間の問題の後での心理的偏見
  • 実際の継続的な低下

…まだわかりません。

結論

この状況は、複雑なAIシステムが予期せぬ方法で失敗する方法についての完璧なケーススタディです。3つの別々のバグが数週間の間に発生し、診断と修正に6週間かかった、質の低下の認識を生み出しました。

アンソロジーに透明性を提供したことを認めなければなりません。詳細な技術的ポストモーテムを公開することは、ほとんどの会社が行うことではありません。しかし、これは私たちが依存しているこれらのシステムがどれほど多くのことが間違っているかを示しています。

クロードまたは他のLLM上に構築しているすべての人のために:冗長性、検証、バックアッププランが必要です。なぜなら、最も優れたAIシステムでも、3つの異なる問題が同時に発生し、それが実際に何が起こっているのかを理解するには数週間かかる可能性があるからです。

これらのAIモデルをサポートするインフラストラクチャは、モデル自体と同じくらい重要です。現在、インフラストラクチャは深刻な成長の痛みを示しています。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。