Lãnh đạo tư tưởng

Chi phí ẩn của AI ở quy mô lớn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Vào 1 tháng 6, 2026, GitHub đã vĩnh viễn ngừng sử dụng “premium requests” trả phí cố định cho Copilot và thay thế chúng bằng tín dụng AI dựa trên mức sử dụng. Khi các hoá đơn đầu tiên theo mô hình mới đến một tháng sau, một số người dùng agentic đã thấy các hoá đơn mà họ không chuẩn bị: Một nhà phát triển báo cáo chi phí hàng tháng tăng từ $29 lên $750 cho các quy trình agentic nặng nhất.

Đó là một ví dụ rõ ràng về sự chuyển đổi rộng hơn trên thị trường công cụ AI trong suốt năm 2026 – và có thể đang chờ các tổ chức vẫn trả phí cố định hiện nay.

Các tổ chức tính toán số giờ họ tiết kiệm được. Nhiều tổ chức không tính những gì mà mức phí cố định giữ ẩn: việc tiêu thụ ngữ cảnh và các lần thử lại sau lỗi. Các chi phí khác không bao giờ xuất hiện trên hoá đơn của nhà cung cấp, bao gồm thời gian dành cho việc xem xét đầu ra và duy trì prompt. Khi việc thanh toán chuyển sang tiêu thụ thực tế, các tổ chức thiếu kỷ luật chi phí có nguy cơ nhận được hoá đơn gây bất ngờ tương tự như mô hình mới của Copilot đã gây bất ngờ cho một số người dùng.

Ngữ cảnh không ai tính giá

AI dĩ nhiên cần ngữ cảnh; điều này không còn tranh cãi. Câu hỏi là ngữ cảnh được gửi có thực sự liên quan hay chỉ vì tiện lợi mà có sẵn. Gửi toàn bộ tài liệu là cách nhanh nhất để cung cấp thông tin cho mô hình. Tuy nhiên, nó không tự động là cách rẻ nhất hay tốt nhất.

Vào tháng 5 năm 2026, Phòng thí nghiệm Kinh tế số của Stanford đã công bố một phân tích về các nhiệm vụ mã hóa agentic trên tám mô hình tiên tiến và phát hiện rằng các nhiệm vụ này tiêu thụ tới một nghìn lần nhiều token hơn một cuộc trò chuyện mã đơn giản, với yếu tố chính không phải là đầu ra của mô hình mà là ngữ cảnh đầu vào mà nó gửi lại liên tục. Agent đọc lại toàn bộ lịch sử của mình ở mỗi bước tiếp theo. Cùng một nhiệm vụ, chạy nhiều lần, mức tiêu thụ token thay đổi lên tới ba mươi lần.

Độ chính xác cũng không tăng tuyến tính theo khối lượng ngữ cảnh: nó thường đạt đỉnh ở mức vừa phải và sau đó chỉ tăng chi phí mà không tăng giá trị.

Vậy nên, sự mù quáng về token không phải là AI không cần ngữ cảnh. Đó là thực tế rằng nếu không có đo lường, không ai đặt câu hỏi liệu tất cả ngữ cảnh đó có thực sự cần thiết hay không. Với mức phí cố định, câu hỏi này dễ bị bỏ qua. Với việc thanh toán dựa trên tiêu thụ, nó trở thành một phần của chi phí.

Khi Bạn Trả Giá Cho Thất Bại Hai Lần

Các quy trình agentic mang lại một chi phí khác mà hầu như không bao giờ xuất hiện trong các tính toán ROI. Hãy tưởng tượng một chuỗi đơn giản gồm mười bước, mỗi bước có 95% khả năng chạy đúng khi xét riêng lẻ. Điều này nghe có vẻ đáng tin cậy, nhưng khi kết hợp lại, chuỗi đó chỉ có khoảng 60% khả năng hoàn thành toàn bộ quá trình mà không có lỗi nào.

Trong một quy trình gửi lại ngữ cảnh đã tích lũy ở mỗi lần gọi, mỗi lần thất bại và lần thử lại sau đó không chỉ tốn chi phí cho bước lặp lại: bạn còn phải trả lại cho mọi thứ đã gửi trước đó.

Đó là một nỗi đau chung mà hầu hết mọi người gặp phải khi xây dựng pipeline agentic đầu tiên. Tôi cũng đã trải qua. Ban đầu, chỉ có một vài agent, vấn đề này không quan trọng lắm. Nhưng khi pipeline mở rộng, mỗi lần chạy thất bại trở nên đắt đỏ hơn, và điều đó đã khiến tôi bắt đầu hỏi mỗi agent cần ngữ cảnh gì và cách lưu trữ nó, thay vì chỉ hỏi liệu quá trình có thành công hay không.

Phân tích tương tự tính toán rằng một agent mười bước với độ tin cậy 95% mỗi bước tiêu tốn khoảng 40% token nhiều hơn cho các lần thử lại so với một hệ thống hoàn toàn đáng tin cậy. Đây là một chi phí bạn sẽ thấy trên hoá đơn nhưng có khả năng sẽ không xuất hiện trong bất kỳ bảng tính ROI nào.

Giám sát Không Phải Lỗi. Nó Thuộc Vào Ngân Sách

Điểm này cần được nêu ra một cách chính xác, vì rất dễ sai lầm. Việc xem xét đầu ra AI không phải là lỗi hệ thống; đó là một phần hợp pháp, dự kiến trong quá trình làm việc với AI, giống như việc kiểm tra mã là một phần hợp pháp khi làm việc với các nhà phát triển. Vấn đề không phải là đầu ra được xem xét. Vấn đề là công việc này hầu như không bao giờ được tính vào việc tính toán mức độ tiết kiệm thực tế của AI.

Viện Work AI của Glean đã khảo sát 6.000 công nhân và phát hiện rằng tự động hóa giúp họ tiết kiệm khoảng 11 giờ mỗi tuần, nhưng gần sáu giờ rưỡi trong số những giờ đó được dành cho các nhiệm vụ bảo trì: cung cấp ngữ cảnh cho hệ thống AI, kiểm tra công việc của chúng và sửa lỗi. Vì vậy, mức tiết kiệm thực tế gần hơn là bốn giờ rưỡi – ít hơn một nửa so với con số tiêu đề. AI vẫn tiết kiệm thời gian, chỉ không nhiều như số đầu tiên gợi ý.

Prompt Cần Bảo Trì, Không Chỉ Của Tác Giả

Hiện nay, các prompt hoạt động giống như mã sản xuất: một bản cập nhật mô hình, một thay đổi ngữ cảnh hoặc một chỉnh sửa nhỏ có vẻ có thể làm thay đổi cách chúng hoạt động. Nếu không có việc quản lý phiên bản và kiểm thử, những thay đổi này có thể âm thầm gây ra vấn đề. Các bài kiểm tra hồi quy, vốn là tiêu chuẩn đối với mã, vẫn thường bị bỏ qua khi xác minh prompt. Một thay đổi trông như một chỉnh sửa nhỏ trong một câu có thể đến môi trường sản xuất và làm giảm độ chính xác mà không ai nhận ra cho đến khi vấn đề tích tụ thành một hiện tượng có thể nhìn thấy.

Xây dựng một khung đánh giá đúng đắn – bao gồm bộ test và các bài kiểm tra hồi quy tự động cho mỗi thay đổi – là công việc bổ sung mà hầu như không bao giờ xuất hiện trong tính toán “AI tiết kiệm thời gian”.

Token Rẻ Hơn, Hoá Đơn Cao Hơn

GitHub Copilot không phải là ngoại lệ. Một khảo sát được CFO Dive trích dẫn cho thấy gần bảy trong mười công ty ở Hoa Kỳ báo cáo ít nhất một phần ngân sách AI bị vượt mức trong năm qua, phần lớn trước khi chuyển hoàn toàn sang mô hình thanh toán dựa trên tiêu thụ, chứ không phải sau khi chuyển sang.

Bain & Company, trong phân tích về kinh tế token vào tháng 6, đưa ra một nghịch lý mô tả tình huống một cách tốt nhất: giá mỗi token đã giảm một nửa trong năm, trong khi tiêu thụ trong cùng kỳ tăng 4,5 lần.

Mô hình trở nên rẻ hơn, nhưng hóa đơn vẫn cao cứng. Các công ty chuyển sang các mô hình mới hơn, giao cho các tác nhân những nhiệm vụ phức tạp hơn và tìm ra nhiều quy trình làm việc hơn cho chúng. Một token rẻ hơn không đồng nghĩa với chi tiêu thấp hơn; nó đồng nghĩa với việc có nhiều lý do hơn để tiêu thụ một token.

Cách Chuẩn Bị Trước Khi Hóa Đơn Đến

Khung làm việc sau đây không nhằm mục đích sử dụng ít AI hơn. Nó nhằm mục đích hiểu rõ chi phí AI trước khi bạn quyết định mở rộng quy mô.

  1. Đầu tiên, hãy có được khả năng hiển thị

Cho đến khi bạn có thể phân tách tiêu thụ theo đội, quy trình làm việc, ứng dụng và nhiệm vụ đã hoàn thành, mọi mở rộng đều là một cược mù. Khả năng hiển thị này cũng không miễn phí: đối với các quy trình làm việc có tính tác nhân đặc biệt, việc truy vết từng bước, ghi lại những gì đã xảy ra và lý do, cũng như giám sát các vòng lặp không kiểm soát đòi hỏi thời gian và công cụ kỹ thuật riêng. Hãy dự trù chi phí này như một phần của chi phí vận hành AI, chứ không phải là một suy nghĩ phụ sau này.

  1. Tính lại ROI trên cơ sở ròng

Trừ thời gian dành cho việc xem xét, sửa lỗi và bảo trì prompt khỏi số giờ tiết kiệm được được báo cáo. Nếu mục đích của trường hợp sử dụng là tiết kiệm thời gian và kết quả ròng là âm hoặc không thể xác minh, thì nó chưa sẵn sàng để mở rộng. Khi lợi ích dự kiến là chất lượng, năng lực, giảm rủi ro hoặc doanh thu, hãy đo lường kết quả đó một cách trực tiếp.

  1. Áp dụng kỷ luật chi phí, nhưng không đồng đều

Một mức giới hạn chi tiêu cứng nhắc hợp lý khi thất bại có chi phí thấp: công cụ nội bộ, tác nhân thử nghiệm, môi trường phát triển. Đối với các chức năng quan trọng, hướng tới khách hàng – ví dụ như trợ lý dịch vụ khách hàng – một mức giới hạn cứng không khả thi, vì nó tạo ra rủi ro ngừng hoạt động. Ở đó, bạn cần các biện pháp dự phòng theo tầng cho mô hình rẻ hơn và cảnh báo sớm, thay vì cắt hoàn toàn khi đạt mức 0.

  1. Xem prompt và đánh giá như tài sản kỹ thuật

Phiên bản hoá, kiểm thử và xem xét các thay đổi trước khi triển khai, giống như cách bạn quản lý mã sản xuất.

Bước Vào Đợt Gia Hạn Với Dữ Liệu Của Riêng Bạn

Giá cả của nhà cung cấp khó đánh giá nếu không có dữ liệu tiêu thụ của riêng bạn. Trước khi gia hạn hoặc thay đổi mô hình, hãy tính toán chi phí các quy trình làm việc hiện tại của bạn theo các điều khoản đề xuất. Mục tiêu không chỉ là thương lượng để có mức giá thấp hơn. Đó là để biết mức giá sẽ hoạt động như thế nào ở mức tiêu thụ thực tế của bạn, thay vì phát hiện sau khi nhận hoá đơn.

Ba việc bạn có thể làm trong tuần này: kiểm tra xem bạn có thể phân tách tiêu thụ AI theo đội và quy trình làm việc không; chọn một trường hợp sử dụng và đặt thời gian dành cho việc xem xét bên cạnh số giờ được báo cáo là đã tiết kiệm; và tìm hiểu nơi một mức giới hạn chi tiêu cứng có thể gây ra ngừng hoạt động thay vì kiểm soát chi phí.

Chi phí AI có thể được quản lý. Chỉ không phải khi bạn lần đầu tiên phát hiện chúng từ hoá đơn.

Zuzana Drotárová lãnh đạo phân tích kinh doanh tại Avenga, giám sát ~100 nhà phân tích trên các chương trình doanh nghiệp ở CZ & SK. Cô tập trung vào các cấu trúc hoạt động và quyết định mà xác định liệu các sáng kiến doanh nghiệp, bao gồm AI, có hoạt động trong sản xuất hay không.