Lãnh đạo tư tưởng
DeepSeek: Hiệu suất tăng, không phải là một bước ngoặt trong đổi mới AI
Sự phấn khích gần đây xung quanh DeepSeek, một mô hình ngôn ngữ lớn (LLM) tiên tiến, là dễ hiểu khi nó mang lại hiệu suất đáng kể cho lĩnh vực này. Tuy nhiên, một số phản ứng đối với việc phát hành của nó dường như hiểu lầm tầm ảnh hưởng của nó. DeepSeek đại diện cho một bước tiến trong quỹ đạo phát triển dự kiến của LLM, nhưng nó không báo hiệu một sự thay đổi cách mạng hướng tới trí tuệ nhân tạo tổng quát (AGI), cũng không đánh dấu một sự chuyển đổi đột ngột trong trọng tâm của đổi mới AI.
Thay vào đó, thành tựu của DeepSeek là một tiến bộ tự nhiên dọc theo một con đường đã được lập bản đồ – một sự tăng trưởng theo cấp số nhân trong công nghệ AI. Nó không phải là một sự thay đổi mô hình đột ngột, mà là một lời nhắc nhở mạnh mẽ về tốc độ thay đổi công nghệ đang tăng tốc.
Cải thiện hiệu suất của DeepSeek: Một bước tiến dọc theo quỹ đạo dự kiến
Cốt lõi của sự phấn khích xung quanh DeepSeek nằm ở những cải thiện hiệu suất ấn tượng của nó. Những đổi mới của nó chủ yếu là về việc làm cho LLM trở nên nhanh hơn và rẻ hơn, điều này có những ý nghĩa quan trọng đối với kinh tế và khả năng tiếp cận của các mô hình AI. Tuy nhiên, mặc dù có sự phấn khích, những tiến bộ này không phải là mới mẻ, mà là sự tinh chỉnh của các phương pháp hiện có.
Trong những năm 1990, việc kết xuất đồ họa máy tính cao cấp đòi hỏi siêu máy tính. Ngày nay, điện thoại thông minh có khả năng thực hiện cùng một nhiệm vụ. Tương tự, nhận dạng khuôn mặt – một công nghệ từng là một lĩnh vực hẹp, có chi phí cao – đã trở thành một tính năng phổ biến, sẵn có trên điện thoại thông minh. DeepSeek phù hợp với mẫu công nghệ này: một tối ưu hóa của các khả năng hiện có, mang lại hiệu suất, nhưng không phải là một phương pháp mới, đột phá.
Đối với những người quen thuộc với các nguyên tắc của sự tăng trưởng công nghệ, sự tiến bộ nhanh chóng này không phải là điều bất ngờ. Lý thuyết về Điểm kỳ dị Công nghệ, cho rằng sự tiến bộ đang tăng tốc trong các lĩnh vực quan trọng như AI, dự đoán rằng những đột phá sẽ trở nên thường xuyên hơn khi chúng ta tiến gần đến điểm kỳ dị. DeepSeek chỉ là một khoảnh khắc trong xu hướng đang diễn ra này, và vai trò của nó là làm cho các công nghệ AI hiện có trở nên dễ tiếp cận và hiệu quả hơn, chứ không phải là một bước nhảy vọt vào các khả năng mới.
Đổi mới của DeepSeek: Tinh chỉnh kiến trúc, không phải là một bước nhảy đến AGI
Đóng góp chính của DeepSeek là tối ưu hóa hiệu suất của các mô hình ngôn ngữ lớn, đặc biệt là thông qua kiến trúc Mixture of Experts (MoE). MoE là một kỹ thuật học tập hợp tập thành lập đã được sử dụng trong nghiên cứu AI trong nhiều năm. Những gì DeepSeek đã làm đặc biệt tốt là tinh chỉnh kỹ thuật này, kết hợp các biện pháp hiệu suất khác để giảm thiểu chi phí tính toán và làm cho LLM trở nên phải chăng hơn.
- Hiệu suất của tham số: Thiết kế MoE của DeepSeek chỉ kích hoạt 37 tỷ trong số 671 tỷ tham số tại bất kỳ thời điểm nào, giảm yêu cầu tính toán xuống chỉ 1/18 so với LLM truyền thống.
- Học tăng cường cho lý luận: Mô hình R1 của DeepSeek sử dụng học tăng cường để nâng cao lý luận chuỗi suy nghĩ, một khía cạnh quan trọng của mô hình ngôn ngữ.
- Đào tạo đa token: Khả năng của DeepSeek-V3 trong việc dự đoán nhiều mảnh văn bản cùng lúc tăng hiệu suất của quá trình đào tạo.
Những cải thiện này làm cho các mô hình DeepSeek trở nên rẻ hơn đáng kể để đào tạo và chạy so với các đối thủ như OpenAI hoặc Anthropic. Mặc dù đây là một bước tiến quan trọng cho sự tiếp cận của LLM, nhưng nó vẫn là một sự tinh chỉnh kỹ thuật chứ không phải là một đột phá khái niệm hướng tới AGI.
Tác động của AI mã nguồn mở
Một trong những quyết định đáng chú ý nhất của DeepSeek là việc làm cho các mô hình của nó trở thành mã nguồn mở – một sự khác biệt rõ ràng so với các phương pháp độc quyền, đóng của các công ty như OpenAI, Anthropic và Google. Cách tiếp cận mã nguồn mở này, được đề xướng bởi các nhà nghiên cứu AI như Yann LeCun của Meta, thúc đẩy một hệ sinh thái AI phi tập trung hơn, nơi đổi mới có thể phát triển mạnh thông qua sự phát triển tập thể.
Lý do kinh tế đằng sau quyết định mã nguồn mở của DeepSeek cũng rõ ràng. AI mã nguồn mở không chỉ là một quan điểm triết học mà còn là một chiến lược kinh doanh. Bằng cách làm cho công nghệ của mình có sẵn cho một loạt các nhà nghiên cứu và nhà phát triển, DeepSeek đang định vị mình để được hưởng lợi từ các dịch vụ, tích hợp doanh nghiệp và lưu trữ có thể mở rộng, thay vì chỉ dựa vào việc bán các mô hình độc quyền. Cách tiếp cận này mang lại cho cộng đồng AI toàn cầu khả năng tiếp cận các công cụ cạnh tranh và giảm sự kiểm soát của các gã khổng lồ công nghệ lớn của phương Tây đối với lĩnh vực này.
Vai trò ngày càng tăng của Trung Quốc trong cuộc đua AI
Đối với nhiều người, việc DeepSeek đạt được đột phá từ Trung Quốc có thể là một điều bất ngờ. Tuy nhiên, sự phát triển này không nên được xem với sự sốc hoặc như một phần của cuộc cạnh tranh địa chính trị. Sau khi dành nhiều năm quan sát cảnh quan AI của Trung Quốc, rõ ràng là quốc gia này đã đầu tư đáng kể vào nghiên cứu AI, dẫn đến một nhóm tài năng và chuyên môn ngày càng tăng.
Thay vì xem sự phát triển này như một thách thức đối với sự thống trị của phương Tây, nó nên được xem như một dấu hiệu của bản chất ngày càng toàn cầu của nghiên cứu AI. Sự hợp tác cởi mở, chứ không phải là cạnh tranh dân tộc, là con đường đầy hứa hẹn nhất để phát triển AGI một cách có trách nhiệm và đạo đức. Một nỗ lực phân tán toàn cầu, chứ không phải là một nỗ lực tập trung vào một quốc gia hoặc tập đoàn, có nhiều khả năng sản xuất ra một AGI phục vụ lợi ích của toàn nhân loại, thay vì chỉ phục vụ lợi ích của một quốc gia hoặc tập đoàn duy nhất.
Ý nghĩa rộng lớn hơn của DeepSeek: Nhìn vượt ra ngoài LLM
Mặc dù nhiều sự phấn khích xung quanh DeepSeek xoay quanh hiệu suất của nó trong không gian LLM, nhưng điều quan trọng là phải bước lại và xem xét ý nghĩa rộng lớn hơn của sự phát triển này.
Mặc dù có khả năng ấn tượng, các mô hình dựa trên transformer như LLM vẫn còn xa so với việc đạt được AGI. Chúng thiếu những phẩm chất thiết yếu như trừu tượng thành phần và lý luận tự chỉ đạo, điều cần thiết cho trí tuệ tổng quát. Mặc dù LLM có thể tự động hóa một loạt các nhiệm vụ kinh tế và tích hợp vào các ngành công nghiệp khác nhau, nhưng chúng không đại diện cho cốt lõi của sự phát triển AGI.
Nếu AGI xuất hiện trong thập kỷ tới, nó không thể dựa hoàn toàn vào kiến trúc transformer. Các mô hình thay thế, như OpenCog Hyperon hoặc tính toán mô phỏng thần kinh, có thể là cơ bản hơn trong việc đạt được trí tuệ tổng quát thực sự.
Sự hàng hóa hóa của LLM sẽ thay đổi đầu tư AI
Cải thiện hiệu suất của DeepSeek đẩy nhanh xu hướng hàng hóa hóa LLM. Khi chi phí của những mô hình này tiếp tục giảm, các nhà đầu tư có thể bắt đầu tìm kiếm những đột phá lớn tiếp theo trong AI ngoài kiến trúc LLM truyền thống. Chúng ta có thể thấy một sự thay đổi trong việc tài trợ cho các kiến trúc AGI vượt qua transformer, cũng như đầu tư vào phần cứng AI thay thế, như chip mô phỏng thần kinh hoặc đơn vị xử lý liên kết.
Phi tập trung sẽ định hình tương lai của AI
Khi cải thiện hiệu suất của DeepSeek làm cho việc triển khai mô hình AI trở nên dễ dàng hơn, chúng cũng góp phần vào xu hướng rộng lớn hơn là phi tập trung hóa kiến trúc AI. Với trọng tâm vào quyền riêng tư, khả năng tương tác và kiểm soát của người dùng, AI phi tập trung sẽ giảm sự phụ thuộc của chúng ta vào các công ty công nghệ lớn, tập trung. Xu hướng này là quan trọng để đảm bảo rằng AI phục vụ nhu cầu của dân số toàn cầu, chứ không phải bị kiểm soát bởi một số ít người chơi mạnh.
Vị trí của DeepSeek trong vụ nổ Cambrian của AI
Tóm lại, mặc dù DeepSeek là một cột mốc quan trọng trong hiệu suất của LLM, nhưng nó không phải là một sự thay đổi cách mạng trong cảnh quan AI. Thay vào đó, nó tăng tốc tiến bộ dọc theo một quỹ đạo đã được thiết lập. Tác động rộng lớn hơn của DeepSeek được cảm nhận ở một số lĩnh vực:
- Áp lực lên các công ty đã thành lập: DeepSeek thách thức các công ty như OpenAI và Anthropic phải suy nghĩ lại mô hình kinh doanh của họ và tìm ra cách thức mới để cạnh tranh.
- Khả năng tiếp cận AI: Bằng cách làm cho các mô hình chất lượng cao trở nên phải chăng hơn, DeepSeek dân chủ hóa việc tiếp cận công nghệ tiên tiến.
- Cạnh tranh toàn cầu: Vai trò ngày càng tăng của Trung Quốc trong phát triển AI cho thấy bản chất toàn cầu của đổi mới, không bị giới hạn ở phương Tây.
- Tiến bộ theo cấp số nhân: DeepSeek là một ví dụ rõ ràng về việc tiến bộ nhanh chóng trong AI đang trở thành tiêu chuẩn.
Quan trọng nhất, DeepSeek phục vụ như một lời nhắc nhở rằng trong khi AI đang tiến bộ nhanh chóng, AGI thực sự có thể xuất hiện thông qua các phương pháp mới, nền tảng chứ không phải tối ưu hóa các mô hình hiện tại. Khi chúng ta chạy đua tới Điểm kỳ dị, điều quan trọng là phải đảm bảo rằng sự phát triển AI vẫn còn phi tập trung, mở và hợp tác.
DeepSeek không phải là AGI, nhưng nó đại diện cho một bước tiến quan trọng trong hành trình liên tục hướng tới AI chuyển đổi.












