Mô hình và nền tảng AI

Anthropic Liên Kết Giá Claude Opus 5.5 Với Các Phiên Lập Trình Dài Hơn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic báo cáo vào ngày 24 tháng 9 năm 2026 rằng các phiên Claude Code đã trở nên dài hơn và nặng hơn về ngữ cảnh trong sáu tháng qua, chi tiết trong một bài đăng trên blog Claude cách mà cơ chế định giá và lưu trữ của Claude Opus 5.5 giải quyết sự thay đổi này. Công ty ước tính chi phí vận hành của Opus 5.5 khoảng 40% thấp hơn Opus 5 cho một khối lượng công việc tính theo token tiêu chuẩn.

Sáu Tháng Dữ Liệu Sử Dụng Claude Code

Bài đăng, do Michael Segner viết, dựa trên dữ liệu sử dụng tổng hợp từ tháng 3 đến tháng 9 năm 2026. Số lượng lời nhắc mỗi phiên vẫn ổn định, theo báo cáo, trong khi công việc bên trong mỗi lời nhắc tăng: mô hình giờ làm việc 3.3 lần lâu hơn cho mỗi lời nhắc và thực hiện hơn 40% cuộc gọi mô hình trên mỗi lời nhắc, và các lần gián đoạn giảm 68%. Các nhà phát triển hiện kết nối máy chủ công cụ hoặc sử dụng kỹ năng khoảng gấp đôi tần suất, và dán văn bản vào lời nhắc ít hơn một phần ba.

Lượng ngữ cảnh trong mỗi yêu cầu tăng 2.6 lần trong khoảng thời gian này, và tỷ lệ token đầu vào‑đầu ra chuyển từ 189:1 lên 324:1. Anthropic giải thích các con số này như các nhà phát triển đang hướng tới một mô hình làm việc lâu hơn, được thông tin tốt hơn cho các nhiệm vụ lớn hơn, mở rộng hơn, và cho biết khoản tiết kiệm từ Opus 5.5 là lớn nhất đối với những phiên dài hơn, ngữ cảnh cao hơn khi việc sử dụng được tính phí theo token.

Phân tích dựa trên việc Anthropic phát hành Claude Opus 5.5, phiên bản này có giá thấp hơn Opus 5. Khi ra mắt đã đặt mức giá, bài đăng ngày 24 tháng 9 và một phân tích đi kèm được công bố vào ngày 22 tháng 9 năm 2026 bởi Addy Osmani đã xem xét ý nghĩa của những mức giá này đối với các khối lượng công việc Claude Code thực tế.

Giá Token và Giảm Giá Đọc Bộ Nhớ Đệm

Đối với việc sử dụng tính phí theo token, Anthropic đã giảm giá token đầu vào và đầu ra 20% và cắt giảm giá đọc token đã lưu trong bộ nhớ đệm 60%. Công ty cho biết việc giảm giá đọc bộ nhớ đệm có trọng lượng lớn nhất vì các lần đọc bộ nhớ đệm chiếm phần lớn chi phí của công việc tác nhân và lập trình, và họ nói rằng tính đến thời điểm xuất bản, một token đã lưu trong bộ nhớ đệm trên Opus 5.5 chỉ tốn một phần năm chi phí của các mô hình cạnh tranh và vượt trội hơn chúng.

Phân tích đi kèm của Osmani liệt kê giá danh sách API của Opus 5.5 là 4 USD mỗi triệu token đầu vào, 20 USD mỗi triệu token đầu ra, và 0.20 USD mỗi triệu lần đọc bộ nhớ đệm. Với những mức giá này, một lần đọc bộ nhớ đệm tốn 5% so với một token đầu vào mới, trong khi ghi vào bộ nhớ đệm tốn 1.25 lần giá token đầu vào cho bộ nhớ đệm 5 phút và gấp đôi giá token đầu vào cho bộ nhớ đệm một giờ, mỗi lần truy cập đều làm mới thời gian sống miễn phí. Trên các gói Pro, Max hoặc Team, mức giá thấp hơn của Opus 5.5 được chuyển sang giới hạn gói nên chúng kéo dài khoảng 25% hơn so với Opus 5; ưu đãi giảm giá đọc bộ nhớ đệm bổ sung chỉ áp dụng cho giá API.

Tận Dụng Các Thay Đổi Bảo Vệ Bộ Nhớ Đệm

Ngay cả khi ngữ cảnh trên mỗi yêu cầu tăng khoảng 2.6 lần, tỷ lệ đầu vào không có trong bộ nhớ đệm đã giảm hơn 50% trong khoảng thời gian sáu tháng, theo báo cáo. Nó ghi nhận một loạt các thay đổi của Claude Code giảm các lần phá vỡ bộ nhớ đệm vô tình, bao gồm các gián đoạn nhỏ như làm mới đăng nhập và các gián đoạn lớn hơn như thêm hướng dẫn giữa cuộc trò chuyện hoặc tải công cụ theo yêu cầu. Trên Opus 5.5 và Fable 5.1, các nhà phát triển cũng có thể thay đổi mức nỗ lực giữa các phiên mà không cần đặt lại bộ nhớ đệm.

Tài liệu tài liệu lưu trữ prompt chính thức chỉ ra rằng hành vi mức nỗ lực áp dụng khi có khóa API hoặc đăng ký Claude, và không áp dụng trên Amazon Bedrock, nền tảng Agent của Google Cloud, hoặc cổng Claude apps, cũng không khi cờ CLAUDECODEDISABLEEXPERIMENTALBETAS được bật hoặc một tổ chức có cấu hình HIPAA.

Cài đặt promptCacheTtl hoặc biến môi trường CLAUDECODEPROMPTCACHETTL chọn thời gian sống dài hơn, và cả hai điều khiển đều yêu cầu Claude Code v2.1.242 trở lên.

Các subagent được fork hiện bắt đầu từ bộ nhớ đệm của phiên cha thay vì phải trả phí để xử lý lại cùng ngữ cảnh. Tài liệu giải thích rằng một fork tiếp nhận lời nhắc hệ thống, bộ công cụ và toàn bộ lịch sử hội thoại của cha, vì vậy yêu cầu mở đầu của nó đọc trực tiếp từ bộ nhớ đệm của cha.

Ít Vòng Quay Hơn Mỗi Nhiệm Vụ

Anthropic báo cáo rằng Opus 5.5 có thể hoàn thành một nhiệm vụ với ít vòng quay hơn so với các mô hình khác. Theo bài đăng, Zeta Labs ghi nhận ít vòng quay và ít lời gọi công cụ hơn mỗi nhiệm vụ so với Opus 5, với chi phí gần một nửa, và hoàn thành gấp đôi số nhiệm vụ khó nhất của họ.

Bài đăng cảnh báo rằng mô hình này sẽ không áp dụng cho mọi nhiệm vụ, trích dẫn phân tích của Osmani: “Trong một nhiệm vụ được định phạm vi rõ ràng, cả hai mô hình đều hoàn thành với số vòng quay gần như bằng nhau, và việc cắt giảm giá là tất cả những gì bạn nhận được. Khoảng cách nên lớn nhất trong các nhiệm vụ mở rộng, nơi một mô hình có thể tiêu tốn nhiều vòng quay cho ý tưởng sai lệch.”

Anthropic cũng báo cáo rằng Opus 5.5 tạo ra đầu ra nhanh hơn hơn 30% so với Opus 5. Sự tăng tốc này không làm thay đổi việc sử dụng token và tỷ lệ hit bộ nhớ đệm; bài đăng lưu ý rằng nó rút ngắn thời gian chờ trong các lần chạy dài khi Claude làm việc không cần giám sát nhiều hơn.

Bài viết kết thúc bằng các thực hành bảo vệ các lần đọc được lưu trong bộ nhớ đệm: chạy /usage trong Claude Code để xem phần nào của một phiên đang được phục vụ từ bộ nhớ đệm, chọn mô hình khi phiên bắt đầu thay vì chuyển đổi giữa chừng, chạy compaction trước khi rời khỏi thay vì sau đó, và trên một API key hoặc nhà cung cấp đám mây, bật thời gian sống bộ nhớ đệm một giờ cho các phiên dài.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.