Mô hình và nền tảng AI

DeepSeek Vượt Qua Rào Cản Chi Phí Với 5,6 Triệu Đô La

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Lời khuyên thông thường về trí tuệ nhân tạo cho rằng xây dựng mô hình ngôn ngữ lớn (LLM) đòi hỏi phải có túi tiền sâu – thường là hàng tỷ đô la đầu tư. Nhưng DeepSeek, một công ty khởi nghiệp trí tuệ nhân tạo của Trung Quốc, vừa phá vỡ khuôn mẫu đó với thành tựu mới nhất của họ: phát triển một mô hình trí tuệ nhân tạo thế giới với chỉ 5,6 triệu đô la.

Mô hình V3 của DeepSeek có thể cạnh tranh với những gã khổng lồ trong ngành như Gemini của Google (GOOGL )các sản phẩm mới nhất của OpenAI, tất cả trong khi sử dụng một phần nhỏ tài nguyên tính toán thông thường. Thành tựu này đã thu hút sự chú ý của nhiều nhà lãnh đạo trong ngành, và điều làm cho nó đặc biệt đáng chú ý là công ty đã đạt được điều này mặc dù phải đối mặt với các hạn chế xuất khẩu của Mỹ, hạn chế quyền truy cập của họ vào các chip Nvidia mới nhất (NVDA ).

Kinh Tế Của Trí Tuệ Nhân Tạo Hiệu Quả

Số liệu kể một câu chuyện thuyết phục về hiệu quả. Trong khi hầu hết các mô hình trí tuệ nhân tạo tiên tiến đòi hỏi giữa 16.000 và 100.000 GPU để đào tạo, DeepSeek đã quản lý với chỉ 2.048 GPU chạy trong 57 ngày. Việc đào tạo mô hình tiêu thụ 2,78 triệu giờ GPU trên chip Nvidia H800 – một con số khiêm tốn đáng chú ý cho một mô hình 671 tỷ tham số.

Để đặt điều này vào перспектив, Meta cần khoảng 30,8 triệu giờ GPU – khoảng 11 lần công suất tính toán hơn – để đào tạo mô hình Llama 3 của họ, thực tế có ít tham số hơn ở 405 tỷ. Phương pháp của DeepSeek giống như một lớp học về tối ưu hóa dưới các ràng buộc. Làm việc với GPU H800 – các chip trí tuệ nhân tạo được Nvidia thiết kế đặc biệt cho thị trường Trung Quốc với khả năng giảm – công ty đã biến những hạn chế tiềm năng thành đổi mới. Thay vì sử dụng các giải pháp sẵn có cho giao tiếp bộ xử lý, họ đã phát triển các giải pháp tùy chỉnh tối đa hóa hiệu quả.

Trong khi các đối thủ cạnh tranh tiếp tục hoạt động dưới giả định rằng đầu tư khổng lồ là cần thiết, DeepSeek đang chứng minh rằng sự sáng tạo và sử dụng tài nguyên hiệu quả có thể san bằng sân chơi.

Kỹ Thuật Để Tạo Ra Điều Không Thể

Thành tựu của DeepSeek nằm ở phương pháp kỹ thuật đổi mới,展示 rằng đôi khi những đột phá có tác động nhất đến từ việc làm việc trong các ràng buộc chứ không phải ném tài nguyên vô hạn vào một vấn đề.

Ở trung tâm của sự đổi mới này là một chiến lược gọi là “cân bằng tải không mất phụ”. Hãy nghĩ về nó như là việc điều phối một hệ thống xử lý song song khổng lồ nơi truyền thống, bạn sẽ cần các quy tắc và phạt phức tạp để giữ mọi thứ chạy trơn tru. DeepSeek đã lật ngược sự khôn ngoan thông thường này, phát triển một hệ thống tự nhiên duy trì sự cân bằng mà không có gánh nặng của các phương pháp truyền thống.

Đội ngũ cũng tiên phong trong một kỹ thuật gọi là “Dự đoán nhiều token” (MTP) – một kỹ thuật cho phép mô hình suy nghĩ trước bằng cách dự đoán nhiều token cùng một lúc. Trong thực tế, điều này dịch thành một tỷ lệ chấp nhận ấn tượng 85-90% cho những dự đoán này trên nhiều chủ đề, mang lại tốc độ xử lý nhanh hơn 1,8 lần so với các phương pháp trước đó.

Cấu trúc kỹ thuật chính nó là một kiệt tác về hiệu quả. Mô hình V3 của DeepSeek sử dụng một phương pháp kết hợp các chuyên gia với tổng cộng 671 tỷ tham số, nhưng điều thông minh ở đây là nó chỉ kích hoạt 37 tỷ cho mỗi token. Sự kích hoạt chọn lọc này có nghĩa là họ nhận được lợi ích của một mô hình khổng lồ trong khi vẫn duy trì hiệu quả thực tế.

Sự lựa chọn của họ về khuôn khổ đào tạo chính xác hỗn hợp FP8 là một bước nhảy vĩ đại khác. Thay vì chấp nhận các hạn chế thông thường của độ chính xác giảm, họ đã phát triển các giải pháp tùy chỉnh duy trì độ chính xác trong khi giảm đáng kể yêu cầu bộ nhớ và tính toán.

Hiệu Ứng Gợn Sóng Trong Hệ Sinh Thái Trí Tuệ Nhân Tạo

Tác động của thành tựu DeepSeek lan rộng ra ngoài mô hình thành công đơn lẻ.

Đối với sự phát triển trí tuệ nhân tạo của châu Âu, đột phá này đặc biệt quan trọng. Nhiều mô hình tiên tiến không đến được EU vì các công ty như Meta và OpenAI không thể hoặc không muốn thích nghi với Đạo Luật Trí Tuệ Nhân Tạo của EU. Phương pháp của DeepSeek cho thấy xây dựng trí tuệ nhân tạo tiên tiến không luôn đòi hỏi phải có cụm GPU khổng lồ – điều quan trọng hơn là sử dụng tài nguyên có sẵn một cách hiệu quả.

Sự phát triển này cũng cho thấy làm thế nào các hạn chế xuất khẩu có thể thúc đẩy đổi mới. Sự tiếp cận hạn chế với phần cứng cao cấp của DeepSeek đã buộc họ phải suy nghĩ khác biệt, dẫn đến các tối ưu hóa phần mềm có thể không bao giờ xuất hiện trong một môi trường giàu tài nguyên. Nguyên tắc này có thể thay đổi cách chúng ta tiếp cận phát triển trí tuệ nhân tạo trên toàn cầu.

Các ý nghĩa về việc dân chủ hóa là sâu sắc. Trong khi các gã khổng lồ trong ngành tiếp tục đốt tiền tỷ, DeepSeek đã tạo ra một bản kế hoạch cho sự phát triển trí tuệ nhân tạo hiệu quả và tiết kiệm chi phí. Điều này có thể mở cửa cho các công ty nhỏ và các tổ chức nghiên cứu trước đây không thể cạnh tranh do hạn chế tài nguyên.

Tuy nhiên, điều này không có nghĩa là cơ sở hạ tầng tính toán quy mô lớn đang trở nên lỗi thời. Ngành công nghiệp đang chuyển sự tập trung vào việc mở rộng thời gian suy luận – thời gian một mô hình cần để tạo ra câu trả lời. Khi xu hướng này tiếp tục, tài nguyên tính toán đáng kể vẫn sẽ cần thiết, có khả năng thậm chí nhiều hơn theo thời gian.

Nhưng DeepSeek đã thay đổi cơ bản cuộc trò chuyện. Các ý nghĩa lâu dài là rõ ràng: chúng ta đang bước vào một kỷ nguyên nơi tư duy sáng tạo và sử dụng tài nguyên hiệu quả có thể quan trọng hơn sức mạnh tính toán thô. Đối với cộng đồng trí tuệ nhân tạo, điều này có nghĩa là tập trung không chỉ vào tài nguyên chúng ta có, mà còn vào cách chúng ta sử dụng chúng một cách sáng tạo và hiệu quả.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.