AIモデルとプラットフォーム
AmazonエンジニアがAI支出を削減する措置を講じる

Amazonの(AMZN )エンジニアチームは、手書きコードからAIモデルへの移行によってプロジェクト予算が大幅に超過したケースを発見しました。 AnthropicのClaude Sonnetを使用したジョブでは、1,800万ドルが費やされましたが、プロジェクトは実現しませんでした。 2026年7月28日の内部ミーティングで、シニアエンジニアはスタッフにこれらのケースを説明し、「壊滅的に高額」と述べました。 フィナンシャルタイムズによると、複数の出席者によると、エンジニアは将来のプロジェクトの支出を制限する自動ガードレールを構築中であると述べました。
最大の例は、Amazonの小売サイトの製品リストと著者レコードを照合することでした。費用は予算の860%以上となり、5ヶ月後に問題が発覚し、デプロイも失敗しました。 2つの小さなケースも示されました。 1つは、財務監査ツールに関する541,000ドルの予期せぬ費用でした。 もう1つは、Amazonのロジスティクスネットワークの配送速度を改善するために行われた作業で、134,000ドルの費用がかかりましたが、2週間以上かけて問題が発覚しました。
Amazonは、技術の使用方法を「実験し、学び、改善し」ていると述べています。 また、少数の分離された例を通常のビジネスとして提示することは、チームがAIとどのように協力しているかを歪曲していると述べました。 これらのケースは、約30万人の社員が働く企業の中で、わずかな数のグループに適用されました。
トークン請求がコーディングミスに与える影響
スタッフは、従来のシステムではほとんど費用がかからないミスが、モデルによって実行されると高額になることを知らされました。 原因は価格表にあります。 Anthropicは、Claude Sonnet 4.5および4.6に対して、入力トークン1ミリオンあたり3ドル、出力トークン1ミリオンあたり15ドルを請求しています。 Sonnet 5は、2026年8月31日まで、入力トークン1ミリオンあたり2ドル、出力トークン1ミリオンあたり10ドルで提供されます。 Sonnetの標準入力価格では、1,800万ドルで約600億の入力トークンが購入できます。
リトライループが同じコンテキストを再送信するか、バッチジョブがサンプルではなくカタログ全体を指す場合、例外はスローされず、クラッシュも発生しません。 請求書が生成され、請求書はビルドログではなく毎月の請求サイクルで到着します。 ミスの距離と数字が、悪い構成を5ヶ月間の問題に変えるのです。
請求の単位も変わりました。 Anthropicのドキュメントによると、Claude 4.7以降のモデルは、新しいトークナイザーを使用しており、同じテキストに対して約30%多くのトークンを生成します。 したがって、同じヘッドラインレートで同じ作業を行うと、新しいモデルでは請求額が高くなります。 フラットシートからメーター化トークンへの移行が背景です。 Unite.AIは、Claude Fable 5がメーター化ユーティリティとして価格設定されたときと、常にオンのClaudeエージェントの安い時代が終わったときにそれについて報道しました。
AWSがすでに販売しているコントロール
この問題の解決策は、AmazonのBedrockの価格設定ページに公開されています。 バッチ推論は、オンデマンドレートの半額で実行されます。 フレックスサービス階層では、標準価格の50%割引が適用され、優先階層では、速度が必要な作業に対して75%のプレミアムが適用されます。 インテリジェントプロンプトルーティングには、1,000リクエストあたり1ドルがかかります。 この機能は、よりシンプルなプロンプトを同じファミリーのより安いモデルにプッシュし、AWSによると、精度を損なうことなくコストを最大30%削減できます。
Anthropic側では、さらに2つの機能があります。 キャッシュ読み取りは、標準入力レートの10分の1で請求されます。 したがって、固定システムプロンプトまたはドキュメントを再送信するのは、キャッシングが有効になると安い部分になります。 Claude Haiku 4.5は、Sonnetのレートの3分の1である、入力トークン1ミリオンあたり1ドル、出力トークン1ミリオンあたり5ドルで提供されています。 これは、デフォルトでフロンティアモデルを選択したチームにとって、利用可能な最大の単一の節約です。
これらはすべて、ワークロードごとの決定です。 どのモデルを使用するか、コンテキストがキャッシュされるか、ジョブがインタラクティブに実行されるかバッチウィンドウで実行されるか、またアカウントにどの程度の上限があるかです。 ベンダーは、Spectro CloudのPaletteAI推論ランチャパッドなどの、コストを抑制するための適用レイヤーを販売し始めています。 これは、AIトークンのコストを下げようとする企業を対象としています。
Amazonが変更すること
Amazonはすでに、間違った方向を指すインセンティブを1つ削除しました。 2026年初めに、社員のKiro開発者プラットフォームの使用状況をランク付けしていた内部リーダーボードを閉鎖しました。 スタッフは、トークン消費量を増やしてランクを上げようとしていたため、これは「トークンマックス」と呼ばれる習慣が生まれました。 エンジニアが説明した自動ガードレールは、次の手段です。 これにより、予算の適用が毎月のレビューではなくデプロイパスに組み込まれるようになります。
規模が理由です。 Amazonは2026年全体で約2,000億ドルの資本支出を計上する予定です。 その大部分はAIとデータセンターのインフラストラクチャに費やされる予定です。 会社の四半期収益は約1,800億ドルです。 会社は2026年7月30日終了後の四半期結果を発表し、資本支出ラインが最も注目を集めるでしょう。 ガードレールが機能するかどうかを示す指標は、小さく内部的です。 逃げたジョブがどのくらいの速さでフラグされますか。 著者マッチングプロジェクトは、その基準を5ヶ月に設定しました。 自動チェックはそれをビルドに移動させることを目的としています。












