Lãnh đạo tư tưởng
Các mô hình mở ngày càng tốt hơn. Kinh tế ngày càng rắc rối hơn.

Các mô hình AI rõ ràng tốt hơn so với 18 tháng trước. Nhưng khi tôi bắt đầu xem xét sâu hơn, các giải thích thông thường cho tiến bộ đó không hợp lý.
Chúng không cải thiện chỉ vì chúng lớn hơn. “Mã nguồn mở đang thắng” chỉ đúng một phần. Và lời khuyên xem xét điểm chuẩn đoán đã ít hữu ích hơn tôi mong đợi. Điều này mất một thời gian để tôi chấp nhận.
Vì vậy tôi đã thu thập 18 tháng dữ liệu trên 46 mô hình từ tám phòng thí nghiệm. Tôi muốn hiểu liệu trí tuệ có đang trở thành một hàng hoá, liệu các mô hình mở có bắt kịp ranh giới tiên tiến, và các công ty nên đo lường gì khi lựa chọn các hệ thống mà họ sẽ xây dựng trên đó.
Kết luận chính rất đơn giản: điểm chuẩn đoán không thực sự là thuộc tính của một mô hình. Nó phản ánh mô hình, phần mềm và ngữ cảnh xung quanh nó, và lượng thời gian cũng như sức mạnh tính toán mà nó được phép sử dụng. Công bố một con số duy nhất, bạn đã che giấu hai yếu tố còn lại.
Tuy nhiên, những hệ quả lại rộng hơn nhiều. Các công ty đang so sánh các mô hình riêng lẻ trong khi họ nên đánh giá toàn bộ hệ thống phải thực hiện công việc.
Các chuẩn đoán che giấu hệ thống
Khi tôi ngừng nhìn vào các điểm tổng hợp và so sánh mô hình từng bài kiểm tra, khoảng cách giữa các mô hình mở hàng đầu và các mô hình độc quyền không phải là một con số duy nhất.
Trong SWE-bench Verified, một bài kiểm tra cũ đã xuất hiện trong vô số thông báo mô hình, khoảng cách là 0,2 điểm. Trong SWE-bench Pro, một bài kiểm tra mới được thiết kế cho công việc phần mềm đa ngôn ngữ thực tế với cấu hình tiêu chuẩn, khoảng cách là 18,2 điểm.
Khoảng cách mô hình dường như phụ thuộc vào chuẩn đoán
| Chuẩn đoán | Khoảng cách | Trạng thái |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Bão hòa, phát hiện nhiễm bẩn |
| GPQA Diamond | 2.0 pts | Bão hòa, mức trần khoảng 92–95% |
| Terminal-Bench 2.1 | 4.9 pts | Thực tế, có tính năng tự động |
| Humanity’s Last Exam | 9.8 pts | Thực tế, suy luận tiên tiến |
| SWE-bench Pro | 18.2 pts | Thực tế, khung chuẩn hoá |
Nguồn: Phân tích của Jaspreet Singh về các mô hình mở và độc quyền hàng đầu, tháng 7 năm 2026.
Cùng một mô hình cũng có thể nhận được các điểm số khác nhau tùy thuộc vào người thực hiện bài kiểm tra. Kimi K3 đạt 80,9% trên Terminal-Bench 2.1 trong một đánh giá độc lập và 88,3% khi nhà sản xuất của nó báo cáo kết quả. Sự chênh lệch 7,4 điểm này lớn hơn khoảng cách mở-so với ranh giới trên ba trong năm chuẩn đoán mà tôi đã phân tích.
Một mô hình nhận hướng dẫn thông qua phần mềm xung quanh, dựa vào ngữ cảnh được cung cấp, sử dụng các công cụ có thể truy cập, và hoạt động trong ngân sách suy luận do nhà phát triển đặt ra. Thay đổi các điều kiện này, kết quả cũng sẽ thay đổi.
Các chuẩn đoán công khai hữu ích để hiểu hướng tiến bộ. Tuy nhiên, chúng là nền tảng kém cho việc quyết định gì sẽ hoạt động trong công ty của bạn.
Độ tin cậy tự động thay đổi phép tính
Điều này trở nên quan trọng hơn khi AI chuyển từ trả lời câu hỏi sang thực hiện một chuỗi hành động.
Hãy lấy một quy trình làm việc gồm 20 bước, trong đó AI thực hiện đúng mỗi bước 95% thời gian. Điều này nghe có vẻ đáng tin cậy. Tuy nhiên, trên toàn bộ chuỗi, quy trình chỉ thành công 36% thời gian.
Một mô hình tốt hơn có thể cải thiện khả năng thành công ở mỗi bước, đặc biệt trong công việc tự động khó khăn. Chính kỹ thuật xung quanh quyết định liệu một bước sai lầm có làm hỏng toàn bộ công việc hay không. Lưu tiến độ, xác minh kết quả, thử lại một cách an toàn và phục hồi sau thất bại thường phân biệt giữa một buổi trình diễn thuyết phục và một sản phẩm đáng tin cậy.
Lựa chọn mô hình vẫn quan trọng. Nhưng mô hình có điểm số cao nhất không tự động tạo ra hệ thống đáng tin cậy nhất.
Chọn mô hình dựa trên công việc
Dữ liệu ủng hộ một kết luận hẹp hơn so với những gì mỗi phía trong tranh luận mở-so với độc quyền thường đưa ra.
Các mô hình mở có tính cạnh tranh cho công việc ngắn hạn, định nghĩa rõ ràng, nơi kết quả có thể đo lường trực tiếp. Phân loại, trích xuất, tóm tắt và sinh có cấu trúc ngày càng thuộc vào danh mục này.
Các mô hình tiên tiến vẫn xứng đáng với mức giá cao hơn trong các nhiệm vụ tự động dài hơn, tuân thủ chỉ dẫn dưới áp lực, và công việc mà thất bại tốn kém để phát hiện sau này. Đó là nơi các chuẩn đoán mới cho thấy khoảng cách gần 18 điểm hơn là bằng không, và nơi lớp bảo mật do nhà cung cấp mô hình cung cấp mang lại giá trị.
Các công ty nên chọn mô hình dựa trên nhiệm vụ, nhưng không nên cho rằng việc chuyển đổi là miễn phí. Ngữ cảnh, lập luận và bộ nhớ đệm lời nhắc không di chuyển một cách sạch sẽ giữa các nhà cung cấp. Một mô hình rẻ hơn có thể trở nên đắt hơn nếu việc thay đổi hệ thống buộc công việc phải bắt đầu lại hoặc thêm các lớp kỹ thuật và quản trị.
Lựa chọn mô hình đang trở nên ít cố định hơn. Việc chuyển đổi vẫn là một quyết định kiến trúc.
Khi Trí Tuệ Trở Nên Rẻ, Phán Đoán Vẫn Đắt Giá
Khả năng đa năng có năng lực đang trở nên vô cùng rẻ. Tuy nhiên, ở đỉnh của đường cong, mỗi điểm hiệu năng bổ sung lại tốn nhiều hơn điểm trước. Chín điểm cuối cùng của khả năng tốn khoảng mười lần so với mọi thứ phía dưới chúng.
Hầu hết các công ty không cần mô hình mạnh nhất cho mọi yêu cầu. Họ cần biết công việc nào xứng đáng với nó.
Tóm tắt, trích xuất, phân loại, soạn thảo và dịch đang tiến tới khả năng tiện ích. Điều còn khan hiếm là phán đoán: biết câu trả lời nào trong năm đáp án khả dĩ là đúng, nhận ra câu hỏi sai, và quyết định khi nào dừng lại và hỏi con người.
Phán đoán xuất phát từ ngữ cảnh sở hữu, quy tắc kinh doanh, quy trình làm việc, kiến thức lịch sử và kỹ thuật kiểm chứng công việc cũng như kiểm soát lỗi.
Xây Dựng Đánh Giá Mà Không Ai Khác Có Thể Thực Hiện
Đối với doanh nghiệp, tiêu chuẩn giá trị nhất được xây dựng từ công việc riêng của mình.
Tạo một bộ đánh giá riêng với 50 đến 200 nhiệm vụ thực tế từ doanh nghiệp của bạn. Giữ hệ thống xung quanh cố định, chạy các bài kiểm tra lặp lại, và chấm điểm dựa trên việc công việc đã hoàn thành đúng hay không thay vì mức độ mượt mà của câu trả lời.
Áp dụng cùng một kỷ luật cho chi phí. Chi phí trên mỗi token có thể gây hiểu lầm khi một mô hình suy luận lâu hơn, yêu cầu nhiều lần thử lại, hoặc tạo ra nhiều công việc hơn cho người kiểm tra. Hãy đo chi phí trên mỗi kết quả được chấp nhận thay vì trên mỗi token.
Bắt đầu với một số lượng nhỏ mô hình. Định hướng công việc ngay từ đầu thay vì thay đổi nhà cung cấp giữa chừng. Đếm tải trọng an ninh, quản trị và vận hành của mỗi nhà cung cấp bổ sung cùng với giá quảng cáo của họ.
Thị trường sẽ tiếp tục tạo ra các tiêu chuẩn mới thắng cuộc, và các công ty sẽ tiếp tục bị cám dỗ xây dựng lại chiến lược AI quanh mỗi tiêu chuẩn đó. Cách tiếp cận tốt hơn là chọn mô hình cho công việc, sau đó đánh giá toàn bộ hệ thống dưới các điều kiện mà nó phải hoạt động.
Tiêu chuẩn mà nên định hướng kiến trúc của bạn là tiêu chuẩn chỉ công ty của bạn mới có thể thực hiện.












