Mô hình và nền tảng AI

Không, Họ Không Đang Giới Hạn Claude – Thực Ra Là Tồi Tệ Hơn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Được rồi, hãy nói về những gì đã xảy ra với Claude, vì nếu bạn đã sử dụng nó trong suốt tháng qua, bạn có thể đã nhận thấy có điều gì đó không ổn.

Trong sáu tuần qua, người dùng Claude đã mất trí. Bắt đầu từ đầu tháng 8, khiếu nại bắt đầu tràn ngập Reddit, X, và diễn đàn dành cho nhà phát triển. Các vấn đề đều nằm rải rác:

  • Mã code từng hoạt động hoàn hảo bỗng dưng bị hỏng
  • Claude sẽ tuyên bố nó đã thực hiện các thay đổi đối với các tệp khi nó không
  • Các ký tự Thái Lan hoặc Trung Quốc ngẫu nhiên xuất hiện trong các phản hồi tiếng Anh
  • Hướng dẫn bị hoàn toàn bỏ qua
  • Cùng một lời nhắc có thể tạo ra các phản hồi chất lượng khác nhau
  • Người dùng Claude Code nói rằng nó cảm thấy “bị cắt giảm” so với trước

Khiếu nại trở nên tồi tệ đến mức vào cuối tháng 8, mọi người đã tin rằng Anthropic đang bí mật giới hạn Claude để tiết kiệm tiền. Các lý thuyết âm mưu đã xuất hiện khắp nơi – có thể họ đang giảm chất lượng trong giờ cao điểm, có thể họ đã thay thế bí mật một mô hình rẻ hơn, có thể đây là sự suy giảm cố ý để quản lý chi phí máy chủ.

Người dùng đang trả tiền cho Claude Pro và nhận được những gì cảm giác như Claude Lite. Các nhà phát triển đã xây dựng các quy trình xung quanh Claude bỗng dưng thấy năng suất của họ bị giảm. Tuy nhiên, một số người dùng không gặp phải bất kỳ vấn đề nào, điều này làm mọi thứ trở nên phức tạp hơn.

Anthropic Cuối Cùng Đã Admit: Yeah, Chúng Tôi Đã Gặp Vấn Đề

Sau nhiều tuần khiếu nại của người dùng và sự thất vọng ngày càng tăng, Anthropic vừa phát hành một bản phân tích kỹ thuật hậu phẫu lớn rằng cơ bản nói:

Và câu trả lời rất thú vị.

Thật ra, đó không phải là một vấn đề. Đó là ba lỗi cơ sở hạ tầng riêng biệt, tất cả đều xảy ra cùng một lúc, tạo ra một cơn bão hoàn hảo của sự suy giảm AI. Họ không giới hạn. Họ không cắt giảm. Họ chỉ có ba thứ bị hỏng đồng thời theo những cách mà họ mất sáu tuần để hiểu và sửa.

Hãy để tôi giải thích chính xác những gì đã xảy ra sai, vì đây thực sự là một cái nhìn có ích về cách các hệ thống AI này có thể thất bại theo những cách mà không ai dự đoán.

Sự Sụp Đổ Của Ba Lỗi: Một Dòng Thời Gian Của Sự Hỗn Loạn

Nguồn: Anthropic

Lỗi #1: Vấn Đề Máy Chủ Sai

Điều này gần như hài hước nếu bạn không phải là người trải qua nó. Claude Sonnet 4 được thiết kế để xử lý 200.000 ngữ cảnh token. Nhưng bắt đầu từ ngày 5 tháng 8, một số yêu cầu được định tuyến đến các máy chủ được cấu hình cho 1 triệu ngữ cảnh token.

Ban đầu, chỉ 0,8% yêu cầu bị ảnh hưởng. Không có vấn đề lớn, đúng không? Sai.

Vào ngày 29 tháng 8, một bản cập nhật bộ cân bằng tải thông thường đã biến vấn đề nhỏ này thành một vấn đề lớn. Bỗng dưng, tại thời điểm cao điểm, 16% yêu cầu Sonnet 4 được gửi đến các máy chủ sai. Và định tuyến là “dính”. Một khi bạn bị định tuyến sai, bạn sẽ tiếp tục bị định tuyến sai.

Tác động:

  • Khoảng 30% người dùng Claude Code đang hoạt động trong khoảng thời gian đó đã có ít nhất một yêu cầu bị định tuyến sai
  • Thời gian phản hồi giảm mạnh đối với người dùng bị ảnh hưởng
  • Cùng một người dùng sẽ gặp phải vấn đề này nhiều lần trong khi những người khác không gặp vấn đề gì

Lỗi #2: Máy Tạo Ký Tự Ngẫu Nhiên

Vào ngày 25 tháng 8, Anthropic đã triển khai một cấu hình sai cho máy chủ TPU của họ. Kết quả là Claude bắt đầu chèn các ký tự Thái Lan và Trung Quốc vào các phản hồi tiếng Anh một cách ngẫu nhiên.

Hãy tưởng tượng bạn yêu cầu Claude gỡ lỗi mã Python của bạn và nhận được điều này:

def calculate_total(items)

total = 0

for item in items

總計 += item.price # <- Cái gì?

return ผลรวม

Điều này ảnh hưởng đến:

  • Opus 4.1 và Opus 4: 25-28 tháng 8
  • Sonnet 4: 25 tháng 8 – 2 tháng 9

Nguyên nhân kỹ thuật là một lỗi tạo token đã gán xác suất cao cho các ký tự không có lý do gì để có mặt. Nó thực sự phá vỡ cơ chế cơ bản về cách Claude chọn từ tiếp theo để nói.

Lỗi #3: Lỗi Biên Dịch Vô Hình

Đây là lỗi đáng sợ từ góc độ kỹ thuật. Có một lỗi tiềm ẩn trong trình biên dịch XLA của Google (GOOGL ) đã nằm im lặng. Khi Anthropic triển khai mã để cải thiện việc chọn token vào ngày 25 tháng 8, họ vô tình kích hoạt nó.

Những gì lỗi này làm là thực sự kỳ lạ – nó sẽ khiến Claude vô tình loại trừ token có khả năng cao nhất khi tạo văn bản. Claude biết câu trả lời đúng nhưng bị ngăn cản nói nó.

Phần thực sự bị hỗn loạn? Họ đã thực sự khắc phục lỗi này vào tháng 12 năm 2024 mà không nhận ra nó. Khi họ “sửa” những gì họ nghĩ là nguyên nhân gốc rễ vào tháng 8, họ đã loại bỏ giải pháp và giải phóng vấn đề thực sự.

Tại Sao Nó Đã Dành Sáu Tuần Để Sửa

Bạn có thể tự hỏi: làm thế nào một công ty như Anthropic, với các kỹ sư hàng đầu thế giới, lại mất sáu tuần để tìm ra vấn đề này?

Câu trả lời tiết lộ mức độ phức tạp thực sự của các hệ thống này:

1. Kiểm Soát Quyền Riêng Tư Chặn Debugging

“Các kiểm soát quyền riêng tư và bảo mật nội bộ của chúng tôi hạn chế cách và khi các kỹ sư có thể truy cập các tương tác của người dùng với Claude, đặc biệt là khi những tương tác đó không được báo cáo cho chúng tôi dưới dạng phản hồi.”

Họ không thể nhìn thấy những gì bị hỏng trừ khi người dùng báo cáo nó một cách rõ ràng. Tốt cho quyền riêng tư, nhưng tồi tệ cho việc gỡ lỗi.

2. Các Lỗi Ẩn Themselves

Claude thường phục hồi từ các lỗi cá nhân, khiến sự suy giảm trông giống như sự biến động bình thường chứ không phải là sự thất bại hệ thống. Các điểm chuẩn và đánh giá của họ không bắt được nó vì mô hình sẽ tự sửa đủ để vượt qua các bài kiểm tra.

3. Sự Hỗn Loạn Đa Nền Tảng

Claude chạy trên AWS Trainium, NVIDIA GPU và Google TPUs – ba nền tảng phần cứng hoàn toàn khác nhau. Mỗi lỗi biểu hiện khác nhau trên mỗi nền tảng:

  • AWS Bedrock: 0,18% yêu cầu Sonnet 4 bị ảnh hưởng tại thời điểm cao điểm
  • Google Vertex AI: Dưới 0,0004% bị ảnh hưởng
  • Trực tiếp API: Lên đến 16% bị ảnh hưởng

Điều này làm cho nó trông giống như nhiều vấn đề không liên quan chứ không phải là ba lỗi cụ thể.

4. Triệu Chứng Overlapping

Với ba lỗi hoạt động đồng thời, các triệu chứng đều nằm rải rác. Một người dùng có thể nhận được các ký tự Thái Lan, người khác có thể nhận được phản hồi suy giảm, người thứ ba có thể thấy hiệu suất hoàn hảo. Không có mẫu rõ ràng nào để theo dõi.

Điều Này Thực Sự Có Nghĩa Là Gì Đối Với Sự Tin Cậy Của AI

Cả câu chuyện này tiết lộ điều gì đó quan trọng về trạng thái hiện tại của các hệ thống AI: chúng dễ bị tổn thương hơn nhiều so với vẻ ngoài.

Chúng tôi không chỉ nói về mô hình AI chính nó. Chúng tôi đang nói về:

  • Cơ sở hạ tầng định tuyến có thể gửi yêu cầu đến sai nơi
  • Các triển khai cụ thể phần cứng có thể hành xử khác nhau
  • Các lỗi trình biên dịch có thể nằm im lặng trong nhiều tháng
  • Các bộ cân bằng tải có thể khuếch đại các vấn đề nhỏ thành các sự cố lớn

Một cấu hình sai, một lỗi trình biên dịch, một lỗi định tuyến – và bỗng dưng trợ lý AI của bạn quên cách mã hóa hoặc bắt đầu nói các ngôn ngữ mà nó không nên.

Liệu Nó Đã Được Sửa Chữa?

Anthropic cho biết họ đã giải quyết tất cả ba vấn đề kể từ ngày 16 tháng 9. Họ đã:

  • Sửa lỗi logic định tuyến
  • Rút lại các cấu hình có vấn đề
  • Chuyển từ các hoạt động top-k gần đúng sang chính xác (đánh đổi hiệu suất cho độ chính xác)
  • Thêm giám sát sản xuất liên tục

Nhưng người dùng vẫn đang báo cáo các vấn đề. Một số nhà phát triển cho rằng Claude Code vẫn cảm thấy suy giảm so với hiệu suất trước đó. Cho dù đó là:

  • Hiệu ứng còn lại từ các lỗi
  • Các vấn đề mới chưa được xác định
  • Sự thiên vị tâm lý sau nhiều tuần gặp vấn đề
  • Hoặc sự suy giảm thực sự tiếp tục

…chúng tôi vẫn chưa biết.

Kết Luận

Tình huống này là một trường hợp nghiên cứu hoàn hảo về cách các hệ thống AI phức tạp có thể thất bại theo những cách hoàn toàn không lường trước được. Ba lỗi riêng biệt, tất cả đều kích hoạt trong vài tuần, tạo ra một nhận thức về sự suy giảm chất lượng lớn mà mất sáu tuần để chẩn đoán và sửa.

Chúng ta có thể dành một chút tín nhiệm cho Anthropic vì sự minh bạch. Việc xuất bản một bản phân tích kỹ thuật hậu phẫu chi tiết là điều mà hầu hết các công ty sẽ không làm. Nhưng nó cũng cho thấy có bao nhiêu thứ có thể sai sót dưới mui của những hệ thống mà chúng ta đang ngày càng phụ thuộc.

Đối với bất kỳ ai xây dựng trên Claude hoặc bất kỳ LLM nào: bạn cần sự dư thừa, xác thực và kế hoạch dự phòng. Bởi vì như chúng ta vừa thấy, ngay cả những hệ thống AI tốt nhất cũng có thể có ba vấn đề khác nhau đồng thời, và có thể mất vài tuần trước khi bất kỳ ai tìm ra những gì thực sự đang xảy ra.

Cơ sở hạ tầng hỗ trợ các mô hình AI này quan trọng không kém chính các mô hình. Và hiện tại, cơ sở hạ tầng đó đang cho thấy một số cơn đau lớn khi trưởng thành.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.