Lãnh đạo tư tưởng

Không, Trí Tuệ Nhân Tạo Không Bị Đóng Băng. Bạn Đang Nhìn Vào Bảng Điểm Sai

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các nhà điều hành đang bắt đầu nghi ngờ về lộ trình trí tuệ nhân tạo của họ. Sau sự gia tăng ban đầu của các công cụ tạo ra vào năm 2023, điều tự nhiên là phải đặt câu hỏi liệu động lực có đang chậm lại hay không. Nhưng câu hỏi đó đã hiểu sai bảng điểm. Tiến bộ trí tuệ nhân tạo không bị đình trệ. Nó đã thay đổi.

Điều mà trước đây cảm giác như sự thay đổi theo cấp số nhân trên bề mặt, viết lách thông thạo, tóm tắt bóng bẩy, hiện đang xảy ra trong các lĩnh vực sâu sắc và quan trọng hơn: lý luận, mã, điều phối quy trình và hiểu biết đa phương thức. Những tiến bộ này ít nổi bật hơn, nhưng có tác động nhiều hơn. Nếu bạn vẫn đo lường trí tuệ nhân tạo bằng khả năng viết một đoạn văn tốt hơn, bạn đang bỏ lỡ sự chuyển đổi thực sự.

Lợi Ích Thật Sự Đang Xảy Ra Ở Nơi Làm Việc

Tiến bộ đang tăng tốc ở nơi quan trọng nhất. Trên các tiêu chuẩn mới, nghiêm ngặt như GPQA, đánh giá lý luận khoa học cấp sau đại học, hiệu suất mô hình đã tăng gần 49% điểm mỗi năm. Trên MMMU, kiểm tra nhiệm vụ đa miền và đa phương thức, điểm số tăng gần 19 điểm. SWE-bench, một tiêu chuẩn yêu cầu sửa lỗi cơ sở mã thực và vượt qua các thử nghiệm tự động, đã nhảy từ 4,4% đến hơn 71% trong một năm.

Đây không phải là những cải tiến nhỏ. Chúng cho thấy rằng các mô hình ngôn ngữ lớn đang掌握 các nhiệm vụ đòi hỏi sự chính xác, lý luận và tích hợp trên các hệ thống phức tạp. SWE-bench, đặc biệt, vượt ra ngoài các vấn đề đồ chơi để chứng minh liệu các mô hình có thể tham gia vào việc phát triển phần mềm thực sự, một ngưỡng mà trước đây dường như còn vài năm.

Đồng thời, các doanh nghiệp đang thay đổi kỳ vọng của họ. Không còn đủ để các mô hình chỉ là “thông minh chung” mà chúng phải hữu ích cụ thể. Sự chuyển dịch hướng tới các mô hình thích nghi với lĩnh vực, hệ thống kết nối công cụ và khuôn khổ đa tác nhân phản ánh nhu cầu ngày càng tăng về hiệu suất hoạt động, có thể kiểm toán và tích hợp vào các quy trình làm việc thực tế.

Câu Chuyện Không Phù Hợp Với Thực Tế

Vậy tại sao nó cảm giác như mọi thứ đang chậm lại? Có hai lý do. Thứ nhất, các tiêu chuẩn ban đầu thu hút sự chú ý, tóm tắt văn bản, tạo email và các nhiệm vụ trò chuyện đơn giản, đã đạt đến trần tự nhiên. Một khi mô hình thực hiện nhất quán ở mức 90% độ chính xác trên các nhiệm vụ đó, lợi ích dường như tối thiểu. Đây là hiệu ứng trần, không phải là sự đình trệ trong tiến bộ.

Các cải tiến ngày nay liên quan đến bộ nhớ ngữ cảnh dài, tích hợp công cụ, lý luận thời gian suy luận và độ chính xác cụ thể của lĩnh vực. Những khả năng này không tạo ra các bản demo lan truyền, nhưng chúng tăng cường đáng kể những gì các mô hình có thể làm trong các quy trình làm việc thực tế. Trong khi các tiêu chuẩn ngôn ngữ truyền thống đang đạt đến trần, các tiêu chuẩn hoạt động gắn liền với lý luận thực tế, sử dụng công cụ và độ tin cậy của doanh nghiệp đang cải thiện nhanh hơn bao giờ hết. Khoảng cách đó giải thích sự không đồng bộ: những người quan sát thông thường nhìn thấy sự đình trệ vì bề mặt không thay đổi, nhưng những người thực hành nhìn thấy sự chuyển đổi đang xảy ra ngay bên dưới nó.

Từ Bản Demo Đến Triển Khai

Trí tuệ nhân tạo không còn bị giới hạn trong các bản demo bóng bẩy hoặc các nguyên mẫu hẹp. Nó đang vượt qua ngưỡng vào triển khai chính thống, đặc biệt là trong các môi trường doanh nghiệp nơi độ tin cậy, độ chính xác và hiệu suất giao hàng quan trọng. Sự chuyển dịch sang các hệ thống có cấu trúc, cụ thể cho từng nhiệm vụ, đã đang diễn ra.

Đến năm 2026, 40% ứng dụng doanh nghiệp sẽ tích hợp các tác nhân trí tuệ nhân tạo, một bước nhảy vĩ đại từ chỉ 5% vào năm 2025. Những tác nhân này được thiết kế không chỉ để phản hồi các yêu cầu, mà để thực hiện các nhiệm vụ, điều phối quy trình và mang lại kết quả cụ thể trên các lĩnh vực như tài chính, an ninh mạng và hoạt động khách hàng.

Sự tiến hóa này phản ánh một sự thay đổi kỹ thuật sâu sắc. Các nhà phát triển trí tuệ nhân tạo hàng đầu, bao gồm OpenAI, đang chuyển từ việc mở rộng quy mô thô sang lý luận thời gian suy luận, cho phép các mô hình suy nghĩ qua các vấn đề, xác thực đầu ra và tương tác với các công cụ bên ngoài một cách động. Điều mà trước đây trông giống như tự động hóa hẹp đang trở thành một thứ gì đó mạnh mẽ hơn: các tác nhân có thể lập kế hoạch, thích nghi và thực hiện một cách đáng tin cậy. Điều này không phải là trí tuệ nhân tạo lớn hơn. Đó là trí tuệ nhân tạo thông minh hơn, được xây dựng cho công việc thực sự.

Và công việc thực sự đó đang được đo lường, không chỉ tưởng tượng. Các doanh nghiệp đang chuyển từ các chu kỳ chứng minh khái niệm sang các triển khai sẵn sàng cho sản xuất với các chỉ số hiệu suất chính và mục tiêu kinh doanh gắn liền với kết quả. Giai đoạn trưởng thành này ít liên quan đến tính mới mẻ và nhiều hơn về độ tin cậy.

Sai Lầm Các Nhà Điều Hành Đang Sắp Thực Hiện

Rủi ro thực sự mà các nhà lãnh đạo doanh nghiệp đang đối mặt ngày nay không phải là tiến bộ trí tuệ nhân tạo đã đình trệ. Đó là họ sẽ tin rằng nó đã đình trệ và tạm dừng đầu tư vào chính xác thời điểm khi các khả năng đang tăng tốc bên dưới bề mặt.

Các tổ chức đang dẫn đầu không chờ đợi việc tiết lộ tiếp theo theo kiểu GPT. Họ đang tích hợp trí tuệ nhân tạo ngày nay vào các quy trình làm việc có giá trị cao, đa chức năng và mang lại tác động kinh doanh có thể đo lường. Hơn hai phần ba các tổ chức sử dụng trí tuệ nhân tạo báo cáo giảm đáng kể chi phí hoặc tăng trưởng doanh thu trực tiếp gắn liền với các triển khai này. Những người áp dụng thành công nhất là những người tích hợp trí tuệ nhân tạo trên nhiều chức năng kinh doanh và tự động hóa toàn bộ chuỗi quy trình.

Vẫn còn nhiều nhóm điều hành bị kẹt trong việc sử dụng các khuôn khổ đánh giá lỗi thời. Họ dựa vào các tiêu chuẩn học thuật không còn phản ánh sự phức tạp của các nhiệm vụ doanh nghiệp thực tế. Họ tối ưu hóa quá mức cho hiệu quả token trong khi bỏ qua giá trị hoạt động của độ chính xác, khả năng phục hồi và tích hợp.

Điều này không chỉ là một sự chậm trễ kỹ thuật, mà còn là một sự chậm trễ chiến lược. Khoảng cách giữa các công ty đã điều chỉnh lại cách tiếp cận trí tuệ nhân tạo của họ và những công ty chưa làm như vậy đang ngày càng rộng. Và sớm thôi, nó sẽ không được đo lường bằng số lượng mô hình được triển khai, mà bằng thị phần được nắm giữ và thời gian thực hiện giá trị.

Làm Thế Nào Để Đánh Giá Lại Trí Tuệ Nhân Tạo

Đã đến lúc cập nhật bảng điểm. Các tổ chức cần theo dõi việc hoàn thành nhiệm vụ đầy đủ, điều phối công cụ và quy trình làm việc đa phương thức. Các mô hình nên được đánh giá không chỉ dựa trên việc chúng “trả lời một câu hỏi”, mà dựa trên việc chúng hoàn thành một nhiệm vụ đa bước, phục hồi sau khi thất bại và tạo ra đầu ra tích hợp vào các hệ thống hiện có.

Các tiêu chuẩn như GPQA, MMMU và SWE-bench là một bước khởi đầu. Nhưng các tiêu chuẩn nội bộ được xây dựng xung quanh lĩnh vực và quy trình làm việc cụ thể của doanh nghiệp là quan trọng hơn.

Trí tuệ nhân tạo hiện đại có khả năng mang lại kết quả có giá trị cao, nhưng chỉ khi bạn kiểm tra các kết quả quan trọng.

Điều định nghĩa cho làn sóng thành công tiếp theo sẽ không phải là các mô hình có số lượng tham số lớn nhất, mà là các hệ thống hoạt động đáng tin cậy trong một ngữ cảnh kinh doanh cụ thể. Độ chính xác, khả năng kiểm toán, hỗ trợ chuỗi công cụ và phục hồi sau khi lỗi sẽ mang nhiều trọng lượng hơn là sự thông thạo hoặc giọng điệu.

Phương Tiện Đã Chuyển Đổi

Trí tuệ nhân tạo không bị đình trệ. Nó đang di chuyển vào các lớp nơi công việc thực sự xảy ra, nơi các hệ thống phải lý luận, xác thực và tương tác trên các lĩnh vực. Nó đang rời bỏ giai đoạn mới mẻ và bước vào giai đoạn cơ sở hạ tầng.

Các công ty hiểu sự thay đổi này đã bắt đầu xây dựng lợi thế. Họ không theo đuổi bản demo lan truyền tiếp theo. Họ đang nắm bắt năng suất thực, cải thiện thời gian giải quyết và mở rộng quy trình với độ chính xác và tốc độ.

Nếu bạn vẫn đang nhìn vào bảng điểm cũ, bạn đang bỏ lỡ những điểm được ghi ở nơi khác. Những nhà lãnh đạo tiếp theo sẽ không phải là những người chờ đợi pháo hoa. Họ sẽ là những người nhìn thấy qua tiếng ồn và hành động dựa trên tín hiệu thực sự.

Steve Wilson là Giám đốc Trưởng về Trí tuệ Nhân tạo tại Exabeam, nơi ông lãnh đạo việc phát triển các giải pháp an ninh mạng tiên tiến dựa trên trí tuệ nhân tạo cho các doanh nghiệp toàn cầu. Là một nhà điều hành công nghệ giàu kinh nghiệm, Wilson đã dành sự nghiệp của mình để kiến trúc các nền tảng đám mây quy mô lớn và các hệ thống bảo mật cho các tổ chức thuộc Fortune 2000. Ông được kính trọng trong cộng đồng trí tuệ nhân tạo và an ninh mạng vì đã kết nối chuyên môn kỹ thuật sâu sắc với ứng dụng doanh nghiệp thực tế. Wilson cũng là tác giả của Sổ tay của Nhà phát triển về Bảo mật Mô hình Ngôn ngữ Lớn (O’Reilly Media), một hướng dẫn thực tế để bảo mật hệ thống GenAI trong các chồng phần mềm hiện đại.