Lãnh đạo tư tưởng
Cuộc tranh luận “Nerfing” của Claude không phải về Claude. Đó là về những gì xảy ra khi các hoạt động của bạn chạy trên quyết định của người khác.

Đầu năm nay, Stella Laurenzo, Giám đốc cấp cao về Trí tuệ nhân tạo tại AMD, đã xuất bản dữ liệu đo từ gần 7.000 phiên họp Claude Code, ghi lại điều mà các kỹ sư đã cảm nhận nhưng khó diễn đạt: giữa tháng 1 và tháng 3, độ sâu của lý lẽ có thể nhìn thấy giảm 73%, số lượng cuộc gọi API trên mỗi nhiệm vụ tăng gấp 80 lần, và mô hình đọc ít tệp hơn trước khi thực hiện chỉnh sửa. Các con số lan truyền nhanh chóng. Việc giải thích lan truyền nhanh hơn.
Anthropic phản bác cách diễn giải. Công ty cho biết những thay đổi phản ánh các quyết định sản phẩm có chủ ý, bao gồm một cơ chế suy nghĩ thích ứng mới và chuyển sang nỗ lực trung bình làm mặc định. Các nhà phân tích độc lập cũng đã phản đối một số phần của phương pháp luận. Cuộc tranh luận vẫn đang diễn ra, và những người hợp lý có quan điểm khác nhau về những gì thực sự đã xảy ra.
Nhưng đây là phần quan trọng nếu bạn đang điều hành một doanh nghiệp trên các hệ thống này: cho dù đó là sự suy giảm hay điều chỉnh có chủ ý hay không, điều đó không thay đổi những gì các nhà vận hành doanh nghiệp đã trải qua. Họ không thể dự đoán được. Họ không thể kiểm soát được. Và một số trong số họ cảm nhận được điều đó trong sản xuất trước khi hiểu rõ những gì đang xảy ra. Đó là câu chuyện thực sự, và nó không liên quan gì đến Anthropic cụ thể.
Đây là một vấn đề phụ thuộc, không phải vấn đề mô hình.
Điều chúng tôi đang mô tả có một tên: sự mong manh của mô hình. Đó là tình trạng trong đó các hoạt động quan trọng của nhiệm vụ được gắn chặt với hành vi của một mô hình duy nhất, vì vậy bất kỳ thay đổi nào tại lớp mô hình, cho dù đó là quyết định điều chỉnh, mặc định mới, thay đổi định tuyến do khả năng hoặc loại bỏ im lặng, sẽ ảnh hưởng trực tiếp đến doanh nghiệp, mà không có bộ đệm và không có cảnh báo.
Đây không phải là một mẫu mới. GPT-4 đã trải qua một phiên bản của nó vào năm 2023. Claude 3.5 đã trải qua một phiên bản vào năm 2024. Claude Opus đang trải qua một phiên bản bây giờ. Điều đó sẽ xảy ra lại với mô hình tiền phong tiếp theo, và mô hình tiếp theo sau đó. Không phải vì bất kỳ nhà cung cấp nào đang hành động không trung thực, mà vì tối ưu hóa mô hình tiền phong cho chi phí, độ trễ và quy mô ở khối lượng toàn cầu là chính xác những gì các nhà cung cấp tiền phong phải làm. Các khuyến khích và khuyến khích của một doanh nghiệp đang chạy các hoạt động sản xuất trên chúng là liên quan. Chúng không giống nhau. Chúng không bao giờ sẽ giống nhau.
Chúng tôi đã bắt đầu Qurrent vào năm 2023 và có kiến thức lịch sử để biết cách các chu kỳ phần mềm doanh nghiệp diễn ra: Một công ty đầu tư vào Trí tuệ nhân tạo. Demo hoạt động. Phiên bản thử nghiệm hoạt động. Sau đó nó đi trực tiếp, điều gì đó thay đổi tại lớp mô hình, và đột nhiên khách hàng sở hữu vấn đề. Họ là những người duy trì các quy trình làm việc, theo đuổi các hồi quy, hấp thụ sự gián đoạn. Điều đó không bao giờ có ý nghĩa đối với tôi như một mô hình bền vững cho các hoạt động doanh nghiệp.
Phiên bản doanh nghiệp của câu chuyện này là hoạt động, không phải kỹ thuật.
Đối với các nhà phát triển, tình hình hiện tại là không tiện lợi. Ngân sách token bị cháy nhanh hơn. Các phiên họp mã hóa bị đình trệ. Các điểm chuẩn thất vọng. Đó là một vấn đề thực sự, nhưng đó là một vấn đề có thể khắc phục.
Đối với các doanh nghiệp đang chạy các hoạt động tài chính, các quy trình làm việc về tuân thủ, các tài khoản phải thu và phải trả, và các quy trình văn phòng phức tạp, các ставка là khác nhau. Các quy trình làm việc này không thể hấp thụ một tuần tồi tệ. Các lỗi tích lũy. Khối lượng tích lũy. Các SLA là các cam kết với khách hàng thực sự, không phải là sở thích nội bộ. Khi một mô hình bắt đầu hoạt động dưới mức trong một quy trình quan trọng, thiệt hại sẽ tích lũy cho dù ai đó đã nhận thấy hay chưa.
Điều làm cho điều này khó khăn hơn là hầu hết các công ty đã cố gắng vượt lên bằng cách xây dựng các tác nhân nội bộ trên một mô hình duy nhất hiện đang phát hiện ra nền tảng đó là không đầy đủ. Tác nhân đầu tiên là phần dễ dàng. Điều không được xây dựng là cơ sở hạ tầng xung quanh: các khuôn khổ đánh giá để phát hiện sự trôi dạt hành vi trước khi nó đến với khách hàng, logic chuyển đổi dự phòng để chuyển hướng công việc tự động khi mô hình bắt đầu hoạt động dưới mức, và quản lý liên tục có khả năng theo kịp với một phong cảnh thay đổi mỗi quý. Ba khoảng trống đó không còn quản lý được; chúng phát triển thành một chức năng kỹ thuật vĩnh viễn mà không ai dự toán cho, được nhân viên bởi những người có công việc cơ bản là theo dõi các quyết định được thực hiện bởi các nhà cung cấp mà họ không có ảnh hưởng.
Điều gì thực sự trông như sự bền vững trong sản xuất.
Tại Qurrent, chúng tôi đã xây dựng lực lượng lao động kỹ thuật số để trở thành mô hình không phụ thuộc từ đầu, không phải là một vị trí tiếp thị mà là một yêu cầu kiến trúc. Mỗi nhiệm vụ được định tuyến đến mô hình hoạt động tốt nhất cho nhiệm vụ đó, được đánh giá liên tục. Khi một mô hình tốt hơn được giao, khách hàng sẽ nhận được nó tự động. Khi một mô hình hiện tại suy giảm trên một quy trình làm việc cụ thể, lớp điều phối sẽ chuyển hướng công việc đó trong vài giây, mà không cần can thiệp của con người và mà không cần ai thức dậy để đọc một chuỗi Slack vào lúc 2 giờ sáng.
Dưới đó, các mô phỏng tự động chạy chống lại các quy trình làm việc sản xuất quanh đồng hồ, đo lường xem liệu đầu ra có khớp với hành vi dự kiến. Sự trôi dạt được phát hiện tại lớp cơ sở hạ tầng, trước khi đội ngũ hoạt động cảm nhận được và lâu trước khi khách hàng cảm nhận được. Và mỗi quyết định được thực hiện bởi mỗi công nhân kỹ thuật số được ghi nhật ký và có thể xem xét lại, một hộp thủy tinh hoàn toàn, vì bạn không thể quản lý những gì bạn không thể nhìn thấy.
Đây không phải là các tính năng cao cấp. Đó là giá vé để chạy Trí tuệ nhân tạo trong sản xuất với quy mô doanh nghiệp. Hầu hết các công ty đang học điều đó trong giữa một chu kỳ tin tức, điều đó là cách tốn kém để tìm hiểu.
Câu hỏi đáng được hỏi trong quý này.
Nếu mô hình mà hoạt động của bạn phụ thuộc vào nhiều nhất có một tuần tồi tệ vào quý tới, bao nhiêu quy trình làm việc của bạn sẽ cảm nhận được điều đó? Làm thế nào bạn sẽ biết? Và bạn có thể định tuyến xung quanh nó nhanh như thế nào?
Nếu câu trả lời cho câu hỏi thứ hai là “chúng tôi sẽ nghe từ khách hàng”, thì hoạt động đó không sẵn sàng cho sản xuất. Đó là một phiên bản thử nghiệm đang chạy với quy mô, và sự khác biệt đó quan trọng hơn những gì hầu hết các nhà lãnh đạo nhận ra cho đến khi nó không quan trọng.
Cuộc tranh luận hiện tại, theo một cách gián tiếp, là hữu ích. Mỗi CFO và COO đang theo dõi sự việc này vừa nhận được một bản xem trước miễn phí về những gì sự mong manh của mô hình trông như thế nào dưới tải hoạt động thực sự, mà không phải trả tiền cho nó mình. Câu trả lời đúng là không phải để chuyển sang mô hình khác. Đó là để xây dựng các hoạt động không phụ thuộc vào một mô hình duy nhất.
Công nghệ sẽ tiếp tục thay đổi. Đó là sự chắc chắn duy nhất trong thị trường này. Các doanh nghiệp sẽ mạnh nhất khi kết thúc thập kỷ này sẽ không phải là những doanh nghiệp đã chọn mô hình đúng. Họ sẽ là những doanh nghiệp mà hoạt động của họ không bao giờ phải quan tâm.












