Mô hình và nền tảng AI

OpenAI Cắt Giá API Trên Hai Tầng GPT-5.6 Rẻ Hơn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

OpenAI đã giảm giá API của hai mô hình GPT-5.6 thấp hơn vào ngày 30 tháng 7 năm 2026, cắt giảm 80% giá của tầng rẻ nhất và 20% giá của tầng trung vào ngày 30 tháng 7 năm 2026, trong khi để giá của mô hình hàng đầu không đổi. Thay đổi này được ghi lại trong nhật ký thay đổi API của công ty và đã được áp dụng trên thẻ giá được công bố.

Đối với mỗi triệu token đầu vào và đầu ra, giá tiêu chuẩn hiện tại là:

  • GPT-5.6 Luna: 20 xu và 1,20 đô la, giảm từ 1 đô la và 6 đô la
  • GPT-5.6 Terra: 2 đô la và 12 đô la, giảm từ 2,50 đô la và 15 đô la
  • GPT-5.6 Sol: 5 đô la và 30 đô la, không đổi, khớp với giá của người tiền nhiệm GPT-5.5 vẫn còn

Cả ba tầng đã đạt được khả năng sẵn sàng chung vào ngày 9 tháng 7 năm 2026 với giá cao hơn, điều này đặt việc định giá lại chỉ ba tuần sau khi gia đình bắt đầu hoạt động thương mại.

Giảm giá áp dụng cho mọi cấp độ dịch vụ trên bảng, không chỉ là mức giá tiêu đề. Xử lý批 và Flex, cả hai đều có giá bằng một nửa so với giá tiêu chuẩn, hiện đặt Luna ở mức 10 xu đầu vào và 60 xu đầu ra. Các lần đọc đầu vào được lưu vào bộ nhớ đệm, giảm giá 90%, giảm xuống còn 2 xu mỗi triệu token trên Luna và 20 xu trên Terra. Các yêu cầu ngữ cảnh dài, được tính theo giá gấp đôi so với tốc độ đầu vào và 1,5 lần so với tốc độ đầu ra, sẽ ở mức 40 xu và 1,80 đô la cho Luna. Người mua đi qua Amazon Bedrock sẽ được tính phí bởi AWS, và OpenAI lưu ý rằng những mức giá này có thể khác với mức giá của riêng họ.

Các tầng rẻ hơn là nơi lưu lượng truy cập sản xuất khối lượng lớn sống: phân loại, trích xuất, định tuyến yêu cầu, soạn thảo lần đầu và các vòng lặp dài nơi một hướng dẫn người dùng có thể kích hoạt hàng chục cuộc gọi mô hình trước khi trả về câu trả lời. Việc cắt giảm năm lần trên tầng hấp thụ khối lượng đó thay đổi số học về những khối lượng nào đáng để tự động hóa.

Nơi các tầng rẻ hơn ngồi so với Claude

Ở mức 20 xu vào và 1,20 đô la ra, Luna dưới mức giá của mô hình Haiku 4.5 rẻ nhất của Anthropic, với mức giảm năm lần về đầu vào và khoảng bốn lần về đầu ra, theo trang giá của Anthropic. Tầng Terra mới nằm dưới mức 3 đô la và 15 đô la mà Claude Sonnet 5 dự kiến sẽ tính phí khi mức giá giới thiệu của 2 đô la và 10 đô la hết hạn vào ngày 31 tháng 8 năm 2026. Ở đầu của cả hai dòng, Sol vẫn đắt hơn về đầu ra so với Opus 5, mà Anthropic định giá ở mức 5 đô la và 25 đô la.

Xử lý ưu tiên trở thành Chế độ Nhanh

Cùng một mục nhật ký thay đổi cũng loại bỏ Xử lý Ưu tiên và thay thế nó bằng Chế độ Nhanh. Đối với Sol, OpenAI cho biết Chế độ Nhanh chạy với tốc độ lên đến 2,5 lần so với tốc độ tiêu chuẩn với giá gấp đôi, và việc chuyển đổi này tương thích ngược: các yêu cầu đã được gắn thẻ cho xử lý ưu tiên sẽ được chuyển đến Chế độ Nhanh mà không cần thay đổi mã. Giá cho Chế độ Nhanh là 10 đô la và 60 đô la cho Sol, 4 đô la và 24 đô la cho Terra, và 40 xu và 2,40 đô la cho Luna.

Anthropic bán cùng một sản phẩm với cùng tên và cùng điều khoản — chế độ nhanh cho Opus 5, lên đến 2,5 lần nhanh hơn với giá tiêu chuẩn gấp đôi. Hai thẻ giá hiện tại hội tụ trên suy luận cố định khu vực. OpenAI tính phụ thu 10% trên các mô hình được phát hành vào hoặc sau ngày 5 tháng 3 năm 2026 khi khách hàng yêu cầu cư trú dữ liệu; Anthropic tính phí suy luận chỉ ở Mỹ ở mức 1,1 lần so với giá tiêu chuẩn.

Điều gì làm cho các tầng rẻ hơn trở nên rẻ hơn

OpenAI đã công bố kế toán của mình một ngày trước khi cắt giảm. Trong một bài đăng kỹ thuật ngày 29 tháng 7 năm 2026, năm thành viên trong nhân viên kỹ thuật của công ty đã mô tả các tối ưu hóa trên suy luận và khung đỡ đại lý đằng sau Codex và ChatGPT Work. Sol, chạy bên trong Codex, đã viết lại các hạt nhân GPU sản xuất của công ty; kết hợp với công việc hạt nhân rộng lớn hơn, OpenAI cho biết rằng đã cắt giảm chi phí phục vụ cuối cùng bằng 20%. Sol cũng thiết kế lại mô hình dự thảo giải mã suy đoán của chính nó trên hàng trăm thí nghiệm, mà công ty tín nhiệm với việc tăng hiệu quả tạo token hơn 15%.

Đó là những con số của OpenAI cho riêng chồng của họ. Bài đăng kết thúc với cam kết chuyển “các cải tiến dưới mui xe trở lại cho người dùng và khách hàng của chúng tôi dưới dạng trí tuệ hiệu quả về chi phí và có sẵn rộng rãi hơn.” Thẻ giá đã theo sau một ngày sau đó.

Công việc khung đỡ chỉ vào trung tâm chi phí mà việc cắt giảm giá đang chỉ. OpenAI giới hạn đầu ra công cụ ở 10.000 token theo mặc định và giữ lịch sử mô hình có thể nhìn thấy chỉ để thêm, vì vậy một vòng lặp đại lý gửi lại hướng dẫn và định nghĩa công cụ của nó tại mỗi bước sẽ đánh vào bộ nhớ đệm đầu vào thay vì trả tiền giá đầy đủ. Trên một nhiệm vụ đòi hỏi 30 yêu cầu mô hình, đó là 30 cơ hội để tránh tính toán lại cùng một tiền tố.

Các mức giá mới được áp dụng khi người mua đang kiểm toán chi tiêu suy luận và mở rộng các nhóm tiếp xúc với mô hình: nghiên cứu của OpenAI cho thấy nhân viên sử dụng ChatGPT vượt ra ngoài chức danh công việc của họ. Tổ chức kỹ thuật của Amazon đã chuyển sang giới hạn chi tiêu AI sau khi vượt quá ngân sách vào cùng ngày, và OpenAI đã giao hàng các giới hạn chi tiêu cứng cho các tổ chức và dự án API vào ngày 22 tháng 7 năm 2026, cho phép quản trị viên đặt một trần hàng tháng sẽ bắt đầu trả về lỗi một lần chi tiêu được theo dõi đạt đến nó.

Đối với một nhóm đã định tuyến khối lượng công việc đến Luna, cùng một cuộc gọi bây giờ có giá một phần năm so với trước, với trần mà họ có thể đặt trong bảng điều khiển. Với giá của Sol không đổi, quyết định trực tiếp vẫn ở nơi OpenAI đã đặt nó kể từ khi gia đình này được giao: tầng nào mà mỗi yêu cầu đòi hỏi.

Aiden Cross là một chiến lược gia được tạo bởi AI tại Unite.AI, chuyên về chiến lược sản phẩm AI, thực hiện và các thách thức thực tế khi chuyển đổi các mô hình thử nghiệm thành các sản phẩm sẵn sàng cho thị trường. Công việc của ông tập trung vào cách các công ty khởi nghiệp và các đội doanh nghiệp chuyển từ các nguyên mẫu và demo sang các hệ thống đáng tin cậy được sử dụng bởi khách hàng thực sự.
Với quan điểm thực tế và chi tiết, Aiden phân tích các bản đồ sản phẩm, chiến lược tiếp thị, quyết định nền tảng và các lựa chọn tổ chức mà quyết định liệu các sáng kiến AI có thành công hay không. Ông đặc biệt chú ý đến các thực tế triển khai, việc áp dụng của người dùng, các hạn chế về cơ sở hạ tầng và sự phù hợp giữa khả năng kỹ thuật và giá trị kinh doanh.
Các bài viết được viết bởi Aiden Cross được tạo bởi AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo sự rõ ràng, chính xác và phạm vi bao quát có trách nhiệm về cách các sản phẩm AI được xây dựng, vận chuyển và mở rộng trong thế giới thực.