Mô hình và nền tảng AI
Các kỹ sư Amazon di chuyển để hạn chế chi tiêu AI sau khi vượt quá ngân sách

Các đội kỹ sư của Amazon (AMZN ) đã phát hiện ra các trường hợp mà việc chuyển đổi công việc từ mã viết tay sang mô hình AI đã vượt quá ngân sách dự án, bao gồm 1,8 triệu đô la chi cho Anthropic’s Claude Sonnet trên một công việc không bao giờ được vận hành. Các kỹ sư cao cấp đã trình bày các trường hợp này cho nhân viên tại một cuộc họp nội bộ vào ngày 28 tháng 7 năm 2026 và mô tả kết quả là “tốn kém đến mức thảm họa”, theo Financial Times báo cáo, trích dẫn nhiều người quen thuộc với buổi trình bày. Họ cho biết họ đang xây dựng các rào cản tự động để hạn chế chi tiêu cho các dự án trong tương lai.
Ví dụ lớn nhất là khớp hồ sơ tác giả với danh sách sản phẩm trên trang bán lẻ của Amazon. Chi tiêu đã vượt quá 860% so với ngân sách dự án, mất 5 tháng để phát hiện ra và việc triển khai đã thất bại. Hai trường hợp nhỏ hơn được trình bày cùng với nó: khoảng 541.000 đô la chi phí không dự kiến cho một tập hợp các công cụ kiểm toán tài chính và 134.000 đô la cho công việc cải thiện tốc độ giao hàng trên mạng lưới hậu cần của Amazon, được phát hiện sau hơn hai tuần.
Amazon cho biết họ đang “thử nghiệm, học hỏi và cải thiện” cách sử dụng công nghệ này, bao gồm cả việc thúc đẩy hiệu quả chi phí. Công ty cũng cho biết rằng việc trình bày một số ví dụ bị cô lập như một hoạt động kinh doanh thông thường sẽ làm sai lệch cách các nhóm làm việc với AI và các trường hợp này chỉ bao gồm một số nhóm nhỏ trong lực lượng lao động doanh nghiệp khoảng 300.000 người.
Token billing ảnh hưởng đến lỗi mã hóa như thế nào
Nhân viên được thông báo rằng những sai lầm gần như không tốn kém trong các hệ thống thông thường sẽ trở nên tốn kém khi một mô hình thực hiện công việc. Lý do nằm trong danh sách giá. Anthropic tính phí 3 đô la cho mỗi triệu token đầu vào và 15 đô la cho mỗi triệu token đầu ra cho Claude Sonnet 4.5 và 4.6, với Sonnet 5 ở mức giới thiệu 2 đô la và 10 đô la cho đến ngày 31 tháng 8 năm 2026 trước khi chuyển sang cùng mức giá. Ở mức giá đầu vào tiêu chuẩn của Sonnet, 1,8 triệu đô la mua được khoảng 600 tỷ token đầu vào.
Một vòng lặp thử lại gửi lại cùng một ngữ cảnh hoặc một công việc hàng loạt chỉ vào toàn bộ danh mục thay vì một mẫu sẽ không tạo ra bất kỳ ngoại lệ nào và không làm sập hệ thống. Nó tạo ra một hóa đơn và hóa đơn đến trong chu kỳ hóa đơn hàng tháng thay vì trong nhật ký xây dựng. Khoảng cách giữa sai lầm và số tiền là điều khiến một cấu hình sai trở thành một vấn đề trong 5 tháng.
Đơn vị hóa đơn cũng đã thay đổi. Tài liệu của Anthropic cho biết rằng Claude 4.7 và các mô hình sau đó sử dụng một tokenizer mới tạo ra khoảng 30% nhiều token hơn cho cùng một văn bản, vì vậy cùng một công việc sẽ được tính phí cao hơn trên một mô hình mới với cùng mức giá tiêu đề. Sự thay đổi rộng lớn hơn từ chỗ ngồi cố định sang token được đo lường là bối cảnh: Unite.AI đã bao gồm nó khi Claude Fable 5 đến với giá như một tiện ích được đo lường và một lần nữa khi kỷ nguyên rẻ của các tác nhân Claude luôn bật kết thúc.
Các điều khiển AWS đã bán
Các công tắc cho vấn đề chính xác này được xuất bản trên trang giá Bedrock của Amazon. Trình diễn hàng loạt chạy ở mức giá thấp hơn 50% so với giá yêu cầu. Một cấp dịch vụ Flex mang lại mức giảm giá 50% so với giá tiêu chuẩn, với cấp độ Priority ở mức cao hơn 75% cho công việc cần tốc độ. Intelligent Prompt Routing có giá 1 đô la cho mỗi 1.000 yêu cầu và đẩy các yêu cầu đơn giản hơn đến một mô hình rẻ hơn trong cùng một họ, điều mà AWS cho biết có thể giảm chi phí xuống 30% mà không ảnh hưởng đến độ chính xác.
Anthropic bổ sung thêm hai điều. Một lần đọc bộ nhớ đệm được định giá ở mức một phần mười của mức giá đầu vào tiêu chuẩn, vì vậy việc gửi lại một lời nhắc hệ thống cố định hoặc tài liệu là phần rẻ nhất một lần bộ nhớ đệm được bật. Và Claude Haiku 4.5 được liệt kê ở mức 1 đô la và 5 đô la cho mỗi triệu token, chỉ bằng một phần ba mức giá của Sonnet, đây là mức tiết kiệm đơn lẻ lớn nhất có sẵn cho bất kỳ nhóm nào đã chọn mô hình tiền phong bằng mặc định.
Mỗi một trong số đó là quyết định cho từng công việc: mô hình nào, liệu ngữ cảnh có được lưu vào bộ nhớ đệm hay không, liệu công việc chạy tương tác hay trong một cửa sổ hàng loạt và trần mà tài khoản mang theo. Các nhà cung cấp đã bắt đầu bán chính lớp thực thi, bao gồm PaletteAI inference launchpad của Spectro Cloud, được định hướng cho các doanh nghiệp đang cố gắng giữ chi phí token thấp.
Amazon đang thay đổi điều gì
Amazon đã loại bỏ một động lực chỉ vào hướng sai. Đầu năm 2026, họ đã đóng một bảng xếp hạng nội bộ xếp hạng việc sử dụng nền tảng Kiro của nhân viên sau khi nhân viên đã làm tăng việc sử dụng token của họ để leo lên bảng xếp hạng, một thói quen đã có tên là “tokenmaxxing”. Các rào cản tự động mà các kỹ sư đã mô tả là bước tiếp theo, đưa việc thực thi ngân sách vào đường dẫn triển khai thay vì xem xét hàng tháng.
Quy mô giải thích tại sao 1,8 triệu đô la đọc như một câu chuyện quản trị chứ không phải là một câu chuyện tài chính. Amazon dự kiến sẽ chi khoảng 200 tỷ đô la cho chi tiêu vốn trong năm 2026, hầu hết trong số đó là cho cơ sở hạ tầng AI và trung tâm dữ liệu, so với doanh thu hàng quý gần 180 tỷ đô la. Công ty sẽ công bố kết quả quý thứ hai sau khi thị trường đóng cửa vào ngày 30 tháng 7 năm 2026 và dòng chi tiêu vốn sẽ nhận được sự chú ý lớn nhất. Biện pháp cho thấy liệu các rào cản có hiệu quả hay không là nhỏ hơn và nội bộ: tốc độ một công việc chạy trốn được gắn cờ. Dự án khớp tác giả đã đặt thanh này ở mức 5 tháng và các kiểm tra tự động được thiết kế để di chuyển nó vào quá trình xây dựng.












