Mô hình và nền tảng AI

Kết Thúc Thời Kỳ Tăng Cường: Tại Sao Các Đột Phá Thuật Toán Quan Trọng Hơn Kích Cỡ Mô Hình

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Trong suốt thập kỷ qua, sự tiến bộ trong trí tuệ nhân tạo đã được thúc đẩy bởi quy mô. Các tập dữ liệu lớn hơn, nhiều tham số hơn và sức mạnh tính toán lớn hơn đã trở thành công thức cho thành công. Các nhóm cạnh tranh để tạo ra các mô hình lớn hơn, đo lường tiến bộ bằng nghìn tỷ tham số và petabyte dữ liệu đào tạo. Chúng ta gọi đây là thời kỳ tăng cường. Nó đã thúc đẩy nhiều tiến bộ trí tuệ nhân tạo mà chúng ta thấy ngày nay, nhưng chúng ta hiện đang tiếp cận một giới hạn mà việc chỉ làm cho các mô hình lớn hơn không còn là cách tiếp cận hiệu quả, thông minh hoặc bền vững nhất. Do đó, sự tập trung đang chuyển từ quy mô thô sang các đột phá trong thuật toán. Trong bài viết này, chúng ta sẽ xem xét tại sao việc tăng cường bằng chính nó không đủ và cách giai đoạn tiếp theo của phát triển trí tuệ nhân tạo sẽ phụ thuộc vào sự đổi mới thuật toán.

Định Luật Của Sự Giảm Dần Trong Việc Tăng Cường Mô Hình

Thời kỳ tăng cường được xây dựng trên nền tảng thực nghiệm vững chắc. Các nhà nghiên cứu quan sát rằng việc tăng kích thước của các mô hình và tập dữ liệu có thể dẫn đến những lợi ích dự đoán được trong hiệu suất. Mẫu này trở nên извест như định luật tăng cường. Những định luật này nhanh chóng trở thành cẩm nang cho các phòng thí nghiệm trí tuệ nhân tạo hàng đầu, thúc đẩy cuộc đua xây dựng các hệ thống lớn hơn. Cuộc đua đó đã dẫn đến sự ra đời của các mô hình ngôn ngữ lớn và các mô hình nền tảng hiện đang cung cấp năng lượng cho nhiều ứng dụng trí tuệ nhân tạo ngày nay. Tuy nhiên, giống như mọi đường cong tăng trưởng, sự tăng cường này của trí tuệ nhân tạo đang bắt đầu giảm dần. Chi phí để phát triển các mô hình thậm chí còn lớn hơn đang tăng mạnh. Việc đào tạo một hệ thống hiện đại tiêu thụ nhiều năng lượng như một thị trấn nhỏ, gây ra những lo ngại nghiêm trọng về môi trường. Chi phí tài chính quá cao đến mức chỉ một số tổ chức có thể cạnh tranh. Trong khi đó, chúng ta đang quan sát thấy những dấu hiệu rõ ràng của sự giảm dần. Việc tăng gấp đôi số lượng tham số không còn tăng gấp đôi khả năng. Những cải tiến cũng chỉ là dần dần, chỉ tinh chỉnh kiến thức hiện có thay vì mở khóa các khả năng mới. Giá trị thu được cho mỗi đô la và watt chi tiêu đang giảm. Chiến lược tăng cường đang đạt đến giới hạn kinh tế và kỹ thuật.

Phương Tiện Mới: Hiệu Suất Thuật Toán

Giới hạn của các định luật tăng cường đã đẩy các nhà nghiên cứu tập trung vào hiệu suất thuật toán. Thay vì dựa vào sức mạnh thô, họ đã bắt đầu tập trung vào thiết kế các thuật toán thông minh hơn, sử dụng tài nguyên hiệu quả hơn. Các tiến bộ gần đây minh họa sức mạnh của sự thay đổi này. Ví dụ, kiến trúc Transformer, được thúc đẩy bởi cơ chế chú ý, đã thống trị trí tuệ nhân tạo trong nhiều năm. Nhưng chú ý đi kèm với một điểm yếu: nhu cầu tính toán của nó tăng nhanh với độ dài chuỗi. Mô hình Không Gian Trạng Thái (SSMs), như Mamba, đang nổi lên như một sự thay thế hứa hẹn cho Transformer. Bằng cách cho phép lý luận chọn lọc hiệu quả hơn, SSMs có thể đạt được hiệu suất của các Transformer lớn hơn nhiều trong khi chạy nhanh hơn và sử dụng ít bộ nhớ hơn.

Một ví dụ khác về hiệu suất thuật toán là sự trỗi dậy của Mô hình Hỗn Hợp Của Chuyên Gia (MoE). Thay vì kích hoạt toàn bộ mạng lưới khổng lồ cho mỗi đầu vào, hệ thống MoE định tuyến các nhiệm vụ đến chỉ một tập hợp con nhỏ hơn của các mạng lưới nhỏ hơn, hoặc “chuyên gia”. Mô hình có thể có hàng tỷ tham số tổng cộng, nhưng mỗi tính toán chỉ sử dụng một phần nhỏ trong số đó. Điều này giống như có một thư viện khổng lồ nhưng chỉ mở một vài cuốn sách bạn cần để trả lời một câu hỏi, thay vì đọc mọi cuốn sách trong tòa nhà mỗi lần. Kết quả là khả năng của một mô hình khổng lồ với hiệu suất của một mô hình nhỏ hơn nhiều.

Ví dụ khác kết hợp những ý tưởng này là DeepSeek-V3, một mô hình Mixture-of-Experts được tăng cường với Chú Ý Tiềm Năng Đa Đầu (MLA). MLA cải thiện chú ý truyền thống bằng cách nén các trạng thái khóa-giá trị, cho phép mô hình xử lý các chuỗi dài hiệu quả, tương tự như SSMs, trong khi vẫn giữ được những điểm mạnh của Transformer. Với 236 tỷ tham số tổng cộng nhưng chỉ một phần nhỏ được kích hoạt cho mỗi nhiệm vụ, DeepSeek-V3 cung cấp hiệu suất hàng đầu trong các lĩnh vực như mã hóa và lý luận, tất cả trong khi trở nên dễ tiếp cận và ít tốn tài nguyên hơn so với các mô hình tăng cường lớn tương đương.

Những ví dụ này không chỉ là những trường hợp riêng lẻ. Chúng đại diện cho một xu hướng rộng lớn hơn hướng tới thiết kế thông minh và hiệu quả hơn. Các nhà nghiên cứu hiện đang tập trung vào cách làm cho các mô hình nhanh hơn, nhỏ hơn và ít phụ thuộc vào dữ liệu mà không hy sinh hiệu suất.

Tại Sao Sự Thay Đổi Này Quan Trọng

Sự chuyển đổi từ việc dựa vào quy mô sang tập trung vào các đột phá thuật toán có những tác động đáng kể đối với lĩnh vực trí tuệ nhân tạo. Đầu tiên, nó làm cho trí tuệ nhân tạo trở nên dễ tiếp cận hơn với mọi người. Thành công không còn phụ thuộc chỉ vào việc có máy tính mạnh nhất. Một nhóm nghiên cứu nhỏ có thể tạo ra một thiết kế mới vượt trội so với các mô hình được xây dựng với ngân sách lớn hơn nhiều. Điều này thay đổi sự đổi mới từ một cuộc đua về tài nguyên thành một cuộc đua về ý tưởng và chuyên môn. Do đó, các trường đại học, các công ty khởi nghiệp và các phòng thí nghiệm độc lập hiện có thể đóng vai trò lớn hơn, ngoài các công ty công nghệ lớn.

Thứ hai, nó giúp làm cho trí tuệ nhân tạo trở nên hữu ích hơn trong các tình huống hàng ngày. Một mô hình có 500 tỷ tham số có thể trông ấn tượng trong các nghiên cứu, nhưng kích thước khổng lồ của nó làm cho nó khó và tốn kém để sử dụng trong thực tế. Ngược lại, các lựa chọn hiệu quả như Mamba hoặc Mô hình Hỗn Hợp Của Chuyên Gia có thể chạy trên phần cứng tiêu chuẩn, bao gồm cả thiết bị ở rìa của mạng. Sự dễ sử dụng này là chìa khóa để đưa trí tuệ nhân tạo vào các ứng dụng phổ biến, chẳng hạn như công cụ chẩn đoán trong chăm sóc sức khỏe hoặc tính năng dịch tức thời trên điện thoại thông minh.

Thứ ba, nó giải quyết vấn đề về tính bền vững. Nhu cầu năng lượng để xây dựng và vận hành các mô hình trí tuệ nhân tạo khổng lồ đang trở thành một thách thức lớn đối với môi trường. Bằng cách nhấn mạnh vào hiệu suất, chúng ta có thể cắt giảm đáng kể lượng khí thải carbon từ công việc trí tuệ nhân tạo.

Cái Gì Đến Tiếp Theo: Thời Kỳ Thiết Kế Trí Tuệ

Chúng ta đang bước vào cái mà có thể được gọi là thời kỳ thiết kế trí tuệ. Câu hỏi không còn là làm thế nào để làm cho mô hình lớn hơn, mà là làm thế nào để thiết kế một mô hình vốn dĩ thông minh và hiệu quả hơn.

Sự thay đổi này sẽ mang lại những đổi mới trên nhiều lĩnh vực nghiên cứu cốt lõi. Một trong những lĩnh vực mà chúng ta có thể mong đợi những tiến bộ là kiến trúc mô hình trí tuệ nhân tạo. Các mô hình mới như mô hình không gian trạng thái đã đề cập có thể thay đổi cách các mạng lưới thần kinh xử lý dữ liệu. Ví dụ, kiến trúc được truyền cảm hứng từ hệ thống động đang chứng minh là mạnh mẽ hơn trong các thí nghiệm. Một điểm tập trung khác sẽ là các phương pháp đào tạo giúp mô hình học hiệu quả với ít dữ liệu hơn. Ví dụ, những tiến bộ trong học không có dữ liệu và học với ít dữ liệu đang làm cho trí tuệ nhân tạo trở nên hiệu quả hơn về dữ liệu, trong khi các kỹ thuật như định hướng kích hoạt cho phép cải thiện hành vi mà không cần đào tạo lại. Sự tinh chỉnh sau đào tạo và việc sử dụng dữ liệu tổng hợp đang giảm nhu cầu đào tạo một cách đáng kể, đôi khi lên đến 10.000 lần.

Chúng ta cũng sẽ thấy sự quan tâm ngày càng tăng đối với các mô hình lai, chẳng hạn như trí tuệ nhân tạo thần kinh-ký hiệu. Trí tuệ nhân tạo thần kinh-ký hiệu đang nổi lên như một xu hướng chính vào năm 2025, kết hợp khả năng nhận dạng mẫu của học thần kinh với sức mạnh logic của các hệ thống ký hiệu để có giải thích tốt hơn và ít phụ thuộc vào dữ liệu. Các ví dụ bao gồm AlphaGeometry 2AlphaProof, cho phép Google DeepMind giành được thành tích vàng tại IMO 2025. Mục tiêu là phát triển các hệ thống không chỉ dự đoán từ tiếp theo dựa trên thống kê mà còn hiểu và lý luận về thế giới theo cách giống con người.

Kết Luận

Thời kỳ tăng cường là điều cần thiết và đã mang lại sự phát triển đáng kể cho trí tuệ nhân tạo. Nó đã mở rộng các giới hạn của những gì có thể và cung cấp các công nghệ nền tảng mà chúng ta dựa vào ngày nay. Nhưng giống như bất kỳ công nghệ nào trưởng thành, chiến lược ban đầu cuối cùng sẽ cạn kiệt tiềm năng của nó. Những đột phá lớn tiếp theo sẽ không đến từ việc thêm nhiều lớp vào ngăn xếp. Thay vào đó, chúng sẽ xuất hiện từ việc tái thiết ngăn xếp chính nó.

Tương lai thuộc về những người đổi mới trong thuật toán, kiến trúc và khoa học cơ bản của học máy. Đó là một tương lai nơi trí tuệ được đo lường không bằng số lượng tham số, mà bằng sự tinh tế của thiết kế. Sự thúc đẩy để tạo ra các thuật toán thông minh hơn mới chỉ bắt đầu. Sự chuyển đổi này mở ra cánh cửa cho trí tuệ nhân tạo trở nên dễ tiếp cận hơn, bền vững hơn và thực sự thông minh hơn.

Tiến sĩ Tehseen Zia là Giáo sư Liên kết có thời hạn tại Đại học COMSATS Islamabad, nắm giữ bằng Tiến sĩ về Trí tuệ Nhân tạo từ Đại học Công nghệ Vienna, Áo. Chuyên về Trí tuệ Nhân tạo, Học máy, Khoa học Dữ liệu và Thị giác Máy tính, ông đã có những đóng góp đáng kể với các ấn phẩm trên các tạp chí khoa học uy tín. Tiến sĩ Tehseen cũng đã dẫn dắt các dự án công nghiệp khác nhau với tư cách là Điều tra viên Chính và từng là Tư vấn viên Trí tuệ Nhân tạo.