Mô hình và nền tảng AI
Trần thuật 75%: Liệu các mô hình AI đã đạt đến đỉnh cao hiệu suất với các phương pháp hiện tại?

Anthropic và OpenAI đã công bố các mô hình AI tiên phong hai ngày cách nhau, với cả hai đạt được độ chính xác gần như giống nhau là 74-75% trên các tiêu chuẩn mã hóa công nghiệp, cho thấy một giới hạn hiệu suất tiềm năng cho các kiến trúc AI hiện tại trong khi tiếp cận phân phối và triển khai theo những cách khác nhau.
Việc phát hành gần như đồng thời này đặt ra những câu hỏi cơ bản về việc liệu sự phát triển AI đã đạt đến một điểm cao nguyên với các phương pháp đào tạo hiện tại, ngay cả khi các công ty phân kỳ mạnh mẽ về cách cung cấp các khả năng này cho người dùng và nhà phát triển trên toàn thế giới.
Điểm hội tụBenchmark chỉ ra cột mốc kỹ thuật
Claude Opus 4.1, được phát hành vào ngày 5 tháng 8 bởi Anthropic, đã đạt được 74,5% trên SWE-bench Verified, tiêu chuẩn mã hóa công nghiệp. OpenAI’s GPT-5, được công bố vào ngày 7 tháng 8, đã đạt được 74,9% trên cùng một thử nghiệm – một sự ràng buộc thống kê cho thấy cả hai công ty đã đẩy các kiến trúc hiện tại đến các giới hạn tương tự mặc dù làm việc độc lập.
Sự khác biệt 0,4% giữa các mô hình nằm trong biên độ của tiếng ồn thống kê cho các tiêu chuẩn như vậy.
Các phương pháp tiếp cận kiến trúcTuy nhiên, lại phân kỳ đáng kể. OpenAI đã xây dựng GPT-5 như một hệ thống đa mô hình với định tuyến thông minh – các truy vấn được chỉ đạo đến các trình trả lời nhanh cho các nhiệm vụ đơn giản, các mô hình suy luận cho các vấn đề phức tạp, hoặc các phiên bản mini khi giới hạn tính toán được đạt đến. Anthropic duy trì một phương pháp mô hình đơn với Opus 4.1, ưu tiên tính nhất quán hơn là tối ưu hóa chuyên dụng.

Nguồn: Anthropic
Chiến lược phân phối tiết lộ các triết lý cạnh tranh
OpenAI đã đưa GPT-5 vào sử dụng ngay lập tức cho tất cả người dùng ChatGPT, bao gồm cả những người dùng miễn phí – đạt khoảng 700 triệu người dùng hoạt động hàng tuần mà không mất phí. Microsoft (MSFT ) cũng tích hợp mô hình này trên GitHub Copilot, Visual Studio Code, M365 Copilot và các nền tảng Azure.
Anthropic duy trì các hạn chế truy cập truyền thống, cung cấp Opus 4.1 cho người dùng Claude trả phí, thông qua Claude Code cho các nhà phát triển và thông qua truy cập API. Công ty này dường như tập trung vào phục vụ các nhà phát triển và doanh nghiệp yêu cầu hiệu suất đáng tin cậy và nhất quán hơn là tối đa hóa phạm vi phân phối.
Giá của GPT-5 rất cạnh tranh, với các nhà phát triển lưu ý đến tỷ lệ chi phí trên khả năng mà có thể gây áp lực cho các đối thủ cạnh tranh để điều chỉnh chiến lược định giá của họ.
Các yêu cầu cơ sở hạ tầng thay đổi kinh tế của ngành
Các yêu cầu tính toán cho thấy quy mô lớn của sự phát triển AI tiên phong. OpenAI được cho là duy trì một hợp đồng hàng năm 30 tỷ đô la với Oracle cho khả năng (ORCL ), sau khi đào tạo GPT-5 trên Microsoft Azure sử dụng GPU NVIDIA H200. Meta đã công bố kế hoạch chi 72 tỷ đô la cho cơ sở hạ tầng AI trong năm 2025 alone.
Cả hai công ty đều báo cáo những cải tiến đáng kể trong các ứng dụng thực tế ngoài các tiêu chuẩn thô. OpenAI cho biết GPT-5 thể hiện “khoảng 45% ít hơn các lỗi so với GPT-4o” khi tìm kiếm web được bật, với chế độ suy nghĩ đạt được kết quả tương tự như mô hình o3 của họ trong khi sử dụng 50-80% ít hơn các token – một lợi ích hiệu quả đáng kể.
GitHub báo cáo Opus 4.1 cho thấy “các lợi ích hiệu suất đáng kể trong việc tái cấu trúc mã đa tệp”, trong khi Cursor, một trợ lý mã hóa AI phổ biến, mô tả GPT-5 là “đáng chú ý thông minh, dễ dàng điều khiển”, theo tài liệu dành cho nhà phát triển của OpenAI.

Nguồn: OpenAI
Trần thuật kỹ thuật gợi ý sự thay đổi mô hình trước mắt
Sự hội tụ trên các chỉ số hiệu suất tương tự trên các công ty cho thấy các mô hình đào tạo hiện tại có thể đang đạt đến giới hạn của chúng. Nhiều mô hình tập trung xung quanh 74-75% độ chính xác trên các tiêu chuẩn mã hóa cho thấy những cải tiến lớn tiếp theo có thể yêu cầu những đổi mới cơ bản hơn là việc mở rộng theo cấp số nhân.
Các thỏa hiệp kiến trúc giữa hệ thống định tuyến phức tạp của OpenAI và phương pháp thống nhất của Anthropic phản ánh các triết lý khác nhau mà không có người chiến thắng rõ ràng. Hệ thống đa mô hình của GPT-5 cung cấp tính linh hoạt nhưng giới thiệu các điểm thất bại tiềm năng, trong khi tính nhất quán của Claude có thể hy sinh hiệu suất chuyên dụng cho độ tin cậy.
Sự dân chủ hóa của các khả năng AI tiên phong – với các tính năng mà hai năm trước đây có giá hàng nghìn đô la mỗi năm nay có sẵn miễn phí – đang đẩy nhanh việc áp dụng trên các ngành công nghiệp. Chuyển đổi này từ AI như một dịch vụ cao cấp sang cơ sở hạ tầng tiện ích có thể cho phép các loại ứng dụng hoàn toàn mới.
Ảnh hưởng thị trường và các bước tiếp theo
Các nhà quan sát trong ngành dự đoán Anthropic sẽ phản ứng lại chiến lược định giá của OpenAI, mặc dù có thể không thông qua việc khớp giá trực tiếp. Google’s DeepMind và Meta, tương đối im lặng trong những thông báo này, được dự đoán sẽ thực hiện các động thái trong những tháng tới.
Cửa sổ 48 giờ giữa các phát hành đã tiết lộ sự chuyển đổi của AI từ công nghệ thử nghiệm sang cơ sở hạ tầng đáng tin cậy. Khi nhiều công ty đạt được điểm chuẩn gần như giống nhau với sự khác biệt về tỷ lệ phần trăm, cạnh tranh chuyển sang hiệu quả triển khai, chất lượng tích hợp và độ tin cậy của dịch vụ.
Các cải tiến thực tế quan trọng hơn là sự thống trị của tiêu chuẩn. SWE-bench Verified đo lường khả năng của AI trong việc xác định và sửa các lỗi thực trong phần mềm mã nguồn mở, và cả hai mô hình đều đại diện cho những bước tiến đáng kể trong khả năng mã hóa tự động.
Khi các mô hình AI trở nên tinh vi hơn trong khả năng suy luận và mã hóa, cuộc cạnh tranh đang chuyển từ các chỉ số hiệu suất thô sang triển khai thực tế và độ tin cậy trong các môi trường sản xuất. Sự thật bất ngờ? Sự ổn định này có thể cho phép thay đổi chuyển đổi hơn là một đột phá khác.












