Lãnh đạo tư tưởng

Tại sao chi phí token đang phá vỡ ngân sách của các CFO vào năm 2026

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Chi phí token AI đã chuyển từ một chi tiết công nghệ nhỏ bé thành một vấn đề ngân sách ở cấp độ hội đồng quản trị trong chưa đầy một năm. Mười hai tháng trước, “chi phí token” chưa xuất hiện trong danh sách các mục mà hầu hết các CFO chú ý — giờ đây nó xuất hiện ở mọi nơi không đúng: trên các bản tin, bản ghi nhớ nội bộ, các lệnh đóng băng ngân sách và các cuộc gọi báo cáo kết quả tài chính.

Uber đã cho các kỹ sư của mình truy cập vào Claude Code vào cuối năm 2025. Đến tháng 4 năm 2026, công ty đã tiêu hết toàn bộ ngân sách AI coding hàng năm chỉ trong bốn tháng. Phản ứng của họ là đặt giới hạn chi tiêu ở mức 1.500 USD cho mỗi nhân viên, mỗi tháng, cho mỗi công cụ, như Bloomberg đã đưa tin lần đầu. Cho phép sử dụng đồng thời hai công cụ coding có tính năng tự động (ví dụ Claude và Cursor) và mức giới hạn này tăng gấp đôi lên 3.000 USD mỗi tháng, tương đương 36.000 USD mỗi năm cho một kỹ sư. Ước tính Uber có khoảng 4.000 kỹ sư, tương đương chi tiêu AI khoảng 144 triệu USD.

Chi phí của Meta có thể còn lớn hơn. Một bản ghi nhớ nội bộ cảnh báo rằng chi phí token AI đang trên đà đạt hàng tỷ đô la vào năm 2026. Nguyên nhân nằm trong cơ chế hoạt động quy mô của các agent. Khi một agent AI kết nối với cơ sở mã để sửa lỗi hoặc viết phần mềm, nó xử lý hàng nghìn token ngữ cảnh nền với mỗi lời nhắc. Khi đưa điều này vào một tổ chức có quy mô như Meta, cộng thêm việc công ty thúc đẩy kỹ sư sử dụng Claude, việc sử dụng token không chỉ tăng mà còn bùng nổ.

Theo Ramp’s Chỉ số AI, một chỉ số theo dõi các khoản thanh toán thực tế của nhà cung cấp trên hơn 70,000 doanh nghiệp, 1% cao nhất của các công ty đang áp dụng AI hiện đang chi tiêu khoảng 7.500 đô la mỗi nhân viên, mỗi tháng, cho AI, và khoản chi đó đang tăng 14,1% so với tháng trước. Các giám đốc tại công ty khởi nghiệp tuyển dụng AI Mercor đã công khai nói rằng chi phí token AI đang bắt đầu gần bằng, hoặc vượt qua, mức lương của nhân viên tại một số tổ chức.

Có một bài học rút ra ở đây. Nếu các công ty công nghệ lớn nhất thế giới có thể ngạc nhiên trước chi phí này, bất kỳ ai cũng có thể. Việc tiêu thụ token đã trở thành một danh mục chi phí mới thực sự, một thứ không tồn tại trong bất kỳ báo cáo P&L nào cách đây hai năm. Nó không hành xử giống như chi phí phần mềm mà các đội tài chính đã mất hàng thập kỷ để mô hình hoá và đưa vào các tính toán ROI truyền thống. Hiểu tại sao chi phí token AI lại hành xử khác biệt đáng kể so với chi phí phần mềm truyền thống là bước đầu tiên để kiểm soát chúng.

Tại sao chi phí token AI lại khó dự đoán đến vậy

Việc lập ngân sách phần mềm truyền thống dựa trên một giả định đơn giản: chi phí tăng theo số lượng nhân viên. Thêm mười nhân viên đồng nghĩa với mười chỗ ngồi, với mức giá đã biết. Dễ dàng dự báo và lên kế hoạch khi công ty mở rộng hoặc cấp phép các nền tảng phần mềm mới.

Token AI phá vỡ giả định đó. Chi phí tăng theo mức sử dụng, không phải theo số lượng nhân viên, và mức sử dụng lại rất không đồng đều, khó dự đoán, và trong trường hợp các agent tự động, thậm chí không liên quan tới con người ngồi trước bàn phím. Một kỹ sư duy nhất chạy một phiên coding có tính năng agent có thể tiêu tốn hàng ngàn đô la trong một tháng mà không có cảnh báo, vì đồng hồ vẫn chạy dù kết quả có hữu ích hay không. Nhiều mô hình cũng tạo ra hàng nghìn token ẩn, không nhìn thấy chỉ để “suy nghĩ” từng bước trước khi trả lời, làm tăng chi phí cho mỗi lời nhắc.

Đó là phần mà hầu hết các tổ chức chưa tính vào: mỗi đô la chi tiêu cho AI có tính năng agent mới đều phải có nguồn tài trợ. Đối với hầu hết các CFO, đây không phải là sai sót làm tròn được hấp thụ bởi quỹ đổi mới; chúng ta đang nói tới hàng triệu đô la chi tiêu mới mà không tồn tại hai năm trước. Điều này trở thành một sự đánh đổi thực tế so với số lượng nhân viên, các khoản đầu tư công nghệ khác, hoặc ngân sách tự do ở các bộ phận khác của doanh nghiệp.

Ba cấp độ rủi ro chi tiêu AI doanh nghiệp

Khi xem xét cách các tổ chức thực tế chi tiêu cho AI, chúng ta có thể thấy một mô hình rõ ràng hơn đang xuất hiện. Rủi ro chi phí AI không được phân bố đồng đều. Nó tập trung ở những vị trí cụ thể, và có khả năng chỉ một trong ba cấp độ hiện đang được kiểm soát trong một tổ chức điển hình ngày nay.

Người dùng doanh nghiệp trong bộ phận bán hàng, marketing và vận hành chủ yếu sử dụng các công cụ tính phí theo chỗ ngồi: 20 đến 30 USD cho mỗi người dùng, mỗi tháng, cố định. Đây là cấp độ mà bộ tài chính đã biết cách lập ngân sách, vì nó hoạt động giống hệt như mọi mục SaaS khác mà họ đã mua trong hai mươi năm qua.

Các nhà phát triển sử dụng công cụ coding có tính năng agent là nguồn gốc của những câu chuyện kiểu Uber và toàn bộ danh mục vừa chuyển từ phí cố định sang giá tính theo mức tiêu thụ. GitHub Copilot đã chuyển sang thanh toán dựa trên token vào tháng 6 năm 2026, và các nhà phát triển dự đoán hoá đơn sẽ tăng từ 29 USD lên 750 USD mỗi tháng, và từ 50 USD lên 3.000 USD mỗi tháng trong các phiên làm việc agent nặng. Uber không phải là ngoại lệ ở đây, mà là một cái nhìn sớm về hướng đi của toàn bộ danh mục.

Các agent tự động là cấp độ mà hầu như không ai đã mô hình hoá được. Không có khái niệm “chỗ ngồi” cho một agent. Nó chạy không cần giám sát, khởi tạo các sub‑agent, thử lại khi gặp lỗi, và tiêu thụ token suốt thời gian hoạt động, bất kể có tạo ra giá trị hay không. Đây là lớp có dữ liệu chi phí và tiền lệ lập ngân sách ít nhất.

Nói một cách đơn giản: cấp độ mà các CFO cảm thấy thoải mái nhất cũng là rủi ro tài chính nhỏ nhất. Hai cấp độ đang làm tăng ngân sách là những cấp độ đang chuyển ra khỏi mô hình giá dự đoán được ngay khi mức sử dụng tăng nhanh nhất.

Đóng khoảng trống quản lý chi phí AI

Sợi chỉ chung xuyên qua Uber, Meta và tập dữ liệu Ramp rộng hơn là sự thiếu hụt khả năng quan sát. Hầu hết các tổ chức không có một lớp trung gian giữa nhân viên hoặc đại lý mở công cụ. Các giới hạn chi tiêu như của Uber là biện pháp thô, áp dụng sau khi xảy ra, cho một vấn đề thực sự cần giải pháp ở phía trên.

Đó là khoảng trống mà một loại công cụ mới, thường được gọi là điều phối đại lý hoặc cổng đại lý, được xây dựng để giải quyết: định tuyến mỗi nhiệm vụ tới mô hình rẻ nhất có khả năng xử lý, thực thi giới hạn chi tiêu trước khi chúng bị vượt quá, và cung cấp cho tài chính một công cụ đo lường thời gian thực thay vì bất ngờ hàng tháng.

Loại công cụ này đang phát triển nhanh, và đã bắt đầu chia thành một vài lớp riêng biệt. Một lớp là cổng kiểm soát chi phí, nằm giữa các ứng dụng của tổ chức và các nhà cung cấp mô hình, thêm các giới hạn chi tiêu theo đội, tự động định tuyến tới các mô hình rẻ hơn cho các nhiệm vụ đơn giản, và lưu trữ phản hồi, những công cụ mà Uber đã phải thực hiện thủ công khi áp đặt giới hạn của mình. Lớp thứ hai là điều phối đại lý, tập trung vào việc phối hợp nhiều đại lý làm việc cùng nhau, với khả năng hiển thị chi phí ngày càng được tích hợp sẵn thay vì gắn thêm. Và một lớp mới, hướng tới tài chính, đang bắt đầu xử lý chi tiêu AI cách các đội FinOps đã lâu dài xử lý chi phí đám mây: phân bổ theo đội và tính năng, lập ngân sách, và xem xét hàng tháng thay vì phát hiện sau khi đã xảy ra.

Tiếp theo là một cách tiếp cận kiến trúc nhằm hạn chế chi tiêu bằng cách giảm phụ thuộc vào các LLM lớn. Một số công ty đã bắt đầu tạo ra kiến trúc hỗn hợp SLM/LLM, trong đó các mô hình ngôn ngữ nhỏ được đào tạo trên một tập hợp hẹp các nhiệm vụ doanh nghiệp (ví dụ: chính sách nội bộ, dịch vụ khách hàng, xử lý tài liệu vay, phân tích bảng vận chuyển). Kinh tế học của cách tiếp cận này có thể rất hấp dẫn.

Theo một so sánh LLM doanh nghiệp năm 2026, với một triệu cuộc trò chuyện hàng tháng, chi phí LLM tiên tiến được lưu trữ dao động từ 15.000 đến 75.000 USD mỗi tháng, trong khi một mô hình ngôn ngữ nhỏ được tinh chỉnh và triển khai nội bộ chỉ tốn từ 150 đến 800 USD mỗi tháng ở cùng khối lượng. Goldman Sachs, ví dụ, quản lý chi tiêu AI quy mô lớn thông qua một cổng mô hình trung tâm, phân loại mỗi yêu cầu theo loại nhiệm vụ và định tuyến tới mô hình có chi phí hiệu quả nhất cho công việc, từ các mô hình mã nguồn mở nhẹ đến các LLM tiên tiến, tất cả đều nằm trong ranh giới bảo mật riêng của họ.

Sợi chỉ chung là hầu hết các công cụ hiện nay được xây dựng bởi và cho các kỹ sư, nhằm tăng tốc năng suất của họ thông qua việc sử dụng các đại lý. Lớp mà hầu hết các tổ chức vẫn còn thiếu là lớp được thiết kế để trả lời trực tiếp câu hỏi của CFO: đội nào, ngân sách nào, chúng ta dự báo chi phí như thế nào và trường hợp sử dụng kinh doanh được hỗ trợ bởi chi tiêu này là gì? Đó là khoảng trống có khả năng quan trọng nhất khi chi tiêu AI dựa trên đại lý tiếp tục tăng lên.

Hai năm trước, không có bất kỳ mục nào như vậy trong bảng cân đối. Ngày nay, chi phí token AI là một trong những mục tăng nhanh nhất và ít được hiểu nhất trên bảng cân đối, và quản lý chi phí AI đang nhanh chóng trở thành một lĩnh vực tài chính cốt lõi thay vì một dự án phụ. Chúng ta đã chứng kiến câu chuyện tương tự khi điện toán đám mây lần đầu được áp dụng và chi phí bùng nổ trong làn sóng đầu tiên. Các tổ chức đang lên kế hoạch triển khai AI dựa trên đại lý nên ngay bây giờ tiến hành cuộc trò chuyện giữa kỹ thuật và tài chính và đưa ra một phương pháp quản lý. Uber và Meta đã cho thấy điều gì xảy ra khi bạn chỉ xử lý sau khi đã xảy ra thay vì trước đó.

Bob là một nhà lãnh đạo công nghệ và kinh doanh cấp cao với hơn 30 năm kinh nghiệm trong lĩnh vực bán hàng, phát triển kinh doanh, tiếp thị, triển khai toàn cầu, phát triển sản phẩm, vận hành và quản lý P&L.