Lãnh đạo tư tưởng
Vấn đề bộ nhớ của Trí tuệ nhân tạo: Tại sao hiệu suất ngữ cảnh dài lại thay đổi mọi thứ và những gì cần thiết để thực hiện nó một cách chính xác

Một đồng nghiệp quên mọi cuộc trò chuyện trước khi nó kết thúc sẽ không tồn tại lâu trong hầu hết các công việc. Tuy nhiên, nhiều doanh nghiệp Trí tuệ nhân tạo hoạt động theo cách đó. Phiên kết thúc và ngữ cảnh biến mất cùng với nó. Một người tiêu dùng đưa ra các câu hỏi một lần có thể hầu như không nhận thấy, nhưng một công ty chạy một quy trình kéo dài hơn một lần ngồi sẽ chạm vào giới hạn gần như ngay lập tức.
Công việc thực sự được chuyển tiếp từ một phiên này sang phiên khác, và một quyết định được đưa ra vào thứ Năm thường dựa trên quyết định được đưa ra vào thứ Hai, với suy nghĩ đằng sau nó cần phải tồn tại trong khoảng thời gian giữa. Một Trí tuệ nhân tạo xóa sạch khi phiên kết thúc có thể hoạt động tốt trong phiên đó và vẫn không đóng góp gì cho một nhiệm vụ chạy trong một tuần.
Trí tuệ nhân tạo doanh nghiệp đã thay đổi âm thầm những gì nó đòi hỏi từ một mô hình. Trong nhiều năm, các mô hình được đánh giá chủ yếu dựa trên lượng kiến thức mà chúng đã hấp thụ. Các doanh nghiệp hiện nay cần chúng phải giữ đúng thông tin trong tầm nhìn khi công việc diễn ra, một khả năng đòi hỏi một loại kỹ thuật hiệu quả khác. Cho đến nay, khả năng duy trì mức độ kiến thức bền vững này đã không được đạt được do lượng bộ nhớ lớn (GPU), tính toán và chi phí cần thiết để mở rộng khả năng này. Việc duy trì độ trễ chấp nhận được và mức độ ảo giác của mô hình trở thành một thách thức khi sử dụng đồng thời khi ngữ cảnh dài được sử dụng. Có nhu cầu ngày càng tăng về khả năng kiến thức như vậy và không đủ bộ nhớ và tính toán để đáp ứng. Vì vậy, điều này đặt ra câu hỏi: làm thế nào để đạt được trí tuệ chính xác hơn với quy mô lớn và ít cơ sở hạ tầng và dấu chân?
Bàn làm việc và Tủ hồ sơ
Hai thứ được gộp chung dưới tiêu đề bộ nhớ, và chúng hoạt động đủ khác biệt để phần còn lại của bài viết này phụ thuộc vào việc giữ chúng riêng biệt.
Bắt đầu với cửa sổ ngữ cảnh, đó là lượng thông tin mà một mô hình có thể nhận vào và suy luận trong một lần. Nó hoạt động như bề mặt của một bàn làm việc. Một bàn nhỏ chỉ nhận một vài trang tại một thời điểm, vì vậy mọi thứ khác phải chờ trong một ngăn kéo và được lấy ra và xóa khi bạn đi, trong khi một bàn lớn cho phép toàn bộ hồ sơ nằm mở cùng một lúc khi bạn làm việc trên nó. Những gì bàn giữ sẽ bị quét sạch vào cuối ngày, mỗi ngày.
Bộ nhớ bền vững là tủ hồ sơ bên cạnh bàn. Hệ thống chọn những gì để lưu trữ và kéo nó trở lại khi nó trở nên liên quan, vì vậy một điều gì đó xảy ra trong tuần này có thể thông tin cho những gì nó làm vào tuần sau. Cửa hàng đó mang qua các phiên và cần phải có quyết định của riêng nó về những gì để lưu, cách tổ chức nó và khi nào để đưa nó trở lại.
Phần lớn công việc kỹ thuật có thể nhìn thấy đã đi vào bàn. Các cửa sổ từng giữ vài nghìn token hiện chạy đến hàng trăm nghìn, và các mô hình lớn nhất từ OpenAI và Anthropic đạt đến khoảng một triệu.
Thuật ngữ cho công việc này, ‘kỹ thuật ngữ cảnh’, đến từ Tobi Lutke của Shopify và được phổ biến bởi Andrej Karpathy vào giữa năm 2025. Kỹ năng cốt lõi trong bất kỳ ứng dụng Trí tuệ nhân tạo nghiêm túc nào, Karpathy viết, là lấp đầy cửa sổ với thông tin đúng cho bước tiếp theo. Ông ấy sử dụng một phép ẩn dụ về phần cứng – mô hình như một bộ xử lý, cửa sổ như bộ nhớ làm việc của nó. Những người thực hành đã áp dụng thuật ngữ này nhanh chóng, vì họ đã quay quanh ý tưởng này mà không có nhãn cho nó.
Việc có một Bàn làm việc Lớn hơn Không Giải quyết Vấn đề Bộ nhớ
Đây là nơi di chuyển rõ ràng – chỉ cần tiếp tục mở rộng bàn – gặp rắc rối.
Những nhà nghiên cứu tại Stanford đã chỉ ra vào năm 2024 rằng khi thông tin mà một mô hình cần nằm ở giữa một đầu vào dài, độ chính xác của nó giảm mạnh so với cùng một sự kiện được đặt ở đầu hoặc cuối. Họ gọi nó là ‘mất trong giữa’, và nó vẫn giữ ngay cả đối với các mô hình được thiết kế cho ngữ cảnh dài. Việc đặt nhiều thông tin hơn trước một mô hình, điều đó cho thấy, không giống như mô hình sử dụng nó một cách đáng tin cậy.
Hiệu ứng này đã được duy trì khi các nhóm khác đi tìm nó, và một nghiên cứu năm 2025 chạy 18 mô hình tiền phong chống lại các đầu vào ngày càng dài đã tìm thấy hiệu suất suy giảm tốt trước khi cửa sổ thậm chí còn đầy, một mẫu mà các tác giả của nó đặt tên là sự suy giảm ngữ cảnh. Việc mở rộng bàn và việc mô hình suy luận sạch sẽ trên mọi thứ trên nó là hai vấn đề riêng biệt, và cái đầu tiên không giải quyết được cái thứ hai.
Sự Curation Kiếm được Hơn so với Khả năng
Kỹ thuật ngữ cảnh đã phát triển thành một lĩnh vực dựa trên điều này, với một cuộc khảo sát năm 2025 dựa trên hơn 1.400 bài báo đã nêu ra các phương pháp của nó và Gartner đã tư vấn cho khách hàng vào tháng 7 năm 2025 để ưu tiên ngữ cảnh hơn các lời nhắc. Nghệ thuật đã chuyển từ việc viết một hướng dẫn sắc nét hơn sang việc lắp ráp một tập hợp đầu vào sắc nét hơn cho mô hình để làm việc từ đó.
Một bàn lớn hơn làm tăng ставka về những gì bạn chọn để đặt trên nó. Đổ một toàn bộ cửa hàng tài liệu lên bề mặt và vài trang quan trọng sẽ bị mất trong tiếng ồn, mâu thuẫn và các phiên bản lỗi thời, nơi một lựa chọn chặt chẽ hơn về những gì thực sự liên quan đến nhiệm vụ cho phép mô hình cùng thực hiện tốt hơn. Sự phán quyết nằm ở việc những gì thuộc về trước mô hình, cách nó được khung, khi nó xuất hiện và những gì vẫn còn trong tủ.
Đây là những gì RAG (tái tạo tăng cường) được xây dựng: cắt các tài liệu thành các mảnh và lấy lại những mảnh có vẻ liên quan, để làm việc xung quanh một cửa sổ quá nhỏ để giữ toàn bộ tài liệu. Giả sử một tranh chấp hợp đồng xoay quanh một điều khoản trên trang 200. Cách tiếp cận thông thường cắt hợp đồng thành các mảnh và để một hệ thống lấy lại những mảnh có vẻ liên quan. Đánh giá trang 200 là không liên quan và mô hình không bao giờ nhìn thấy điều khoản.
Một cửa sổ có kích thước cho toàn bộ hợp đồng bỏ qua bước lấy lại hoàn toàn và đưa mô hình điều khoản cùng với mọi thứ xung quanh nó. Liệu mô hình có đọc một đầu vào dài tốt hay không là vấn đề độ tin cậy từ phần trước, và đó là một vấn đề tốt hơn để được để lại so với một hệ thống lấy lại im lặng quyết định điều khoản không đáng được chuyển tiếp.
Trong một Phiên và Sau Đó
Ngữ cảnh dài là những gì cho phép một tác nhân Trí tuệ nhân tạo làm việc trên một công việc dài thay vì một trao đổi duy nhất. Một tác nhân xử lý một đánh giá tuân thủ nhiều ngày hoặc một nhà cung cấp trên tàu giữ toàn bộ công việc trong cửa sổ khi nó chạy, vì vậy mỗi bước dựa trên toàn bộ trạng thái của công việc. Một cửa sổ đủ dài có thể thay thế cho bộ nhớ trong một phiên.
Đó cũng là nơi sự tương似 dừng lại. Bất cứ điều gì hệ thống nên nhớ lại vào tuần sau, một khi phiên này đã đóng, phải sống ở một nơi mà cửa sổ không phải là.
Xây dựng loại bộ nhớ này mang lại một tập hợp vấn đề khác, nhiều trong số đó ngành công nghiệp chỉ mới bắt đầu đối mặt. Việc đào tạo của tôi trong tâm lý học và khoa học thần kinh khiến sự so sánh với bộ nhớ của con người khó bỏ qua. Chúng tôi không lấy lại một bản ghi hoàn hảo của một sự kiện. Mỗi lần chúng tôi nhớ lại, chúng tôi xây dựng lại nó, và những sai sót nhỏ có thể dần dần trở thành một phần của phiên bản được chấp nhận. Một bộ nhớ máy có thể phát triển một vấn đề tương tự khi thông tin được lưu trữ được tóm tắt, hợp nhất hoặc viết lại nhiều lần. Theo thời gian, bản ghi có thể di chuyển xa hơn khỏi sự kiện ban đầu trừ khi ai đó kiểm tra nó, sửa lỗi và loại bỏ thông tin đã trở nên không đáng tin cậy.
Nhiều công ty triển khai những hệ thống này đã không gặp phải những vấn đề này và ít công ty đã giải quyết chúng. Điều tôi sẽ theo dõi trong một nhà cung cấp không phải là kích thước của cửa sổ mà họ quảng cáo. Một mô hình giữ 10 triệu token có giá trị nhỏ nếu hầu hết những gì nó giữ là lỗi thời, không liên quan hoặc sai. Các câu trả lời của nó có thể trông có căn cứ trong khi dựa trên tài liệu mà doanh nghiệp không bao giờ nên tin tưởng. Điều kiếm được tiền là sự phán quyết về những gì để giữ và khả năng suy luận chính xác trên tất cả thông tin, trên một phần nhỏ của chi phí cơ sở hạ tầng và dấu chân. Đó là làm được nhiều hơn với ít hơn, và không phải tất cả các cửa sổ lớn hơn đều đi kèm với khả năng thực sự này.












