Lãnh đạo tư tưởng

Sự chia cách kỹ thuật số mới trong Trí tuệ nhân tạo: Tại sao các mô hình sẵn sàng cho Edge, dựa trên CPU sẽ giành chiến thắng trong cuộc chiến về chi phí

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Thị trường trí tuệ nhân tạo (AI) toàn cầu đang mở rộng với tốc độ chóng mặt. Vào năm 2024, nó đã được đánh giá là 257,68 tỷ đô la, với dự báo sẽ đạt 371,71 tỷ đô la vào cuối năm 2025 và tăng vọt lên 2,4 nghìn tỷ đô la vào năm 2032. Đó là gần một sự tăng trưởng gấp 10 lần trong chưa đầy một thập kỷ, một quỹ đạo mà cạnh tranh với một số cuộc bùng nổ công nghệ chuyển đổi nhất trong lịch sử hiện đại.

Trong thập kỷ qua, khoảng 1.500 công ty trí tuệ nhân tạo mới được thành lập đã mỗi công ty nhận được đầu tư vượt quá 1,5 triệu đô la, cho thấy không chỉ một làn sóng đổi mới mà còn là sự hiện diện mạnh mẽ của sự cạnh tranh khốc liệt. Các công ty đã thành lập cũng không ngồi yên. Theo một báo cáo ngành công nghiệp của McKinsey vào tháng 1, một tỷ lệ đáng kinh ngạc là 92% của các tổ chức dự định sẽ tăng chi tiêu cho AI trong ba năm tới.

Nhưng khi việc áp dụng AI tăng tốc, cơ sở hạ tầng hỗ trợ nó đang bắt đầu xuất hiện những vết nứt. Trong hai năm qua, AI đã chuyển từ những bản demo hấp dẫn sang các khối lượng công việc thực tế, liên tục.

Chúng ta không chỉ đối mặt với vấn đề về chất lượng mô hình, mà còn là về nơi và cách thức chạy những mô hình đó. Một sự chia cách kỹ thuật số mới đang hình thành, không phải xung quanh việc tiếp cận dữ liệu hoặc tài năng, mà xung quanh chiến lược tính toán. Các tổ chức phải đối mặt với một ngã rẽ quan trọng: tiếp tục dựa vào hệ thống dựa trên đơn vị xử lý đồ họa (GPU) nặng, tập trung vào đám mây, hoặc chấp nhận các kiến trúc mỏng hơn, sẵn sàng cho Edge, dựa trên bộ xử lý trung tâm (CPU) đầu tiên, những kiến trúc này rẻ hơn để chạy ở quy mô lớn, dễ dàng triển khai trong các môi trường đa dạng và phù hợp hơn với nhu cầu về quyền riêng tư và độ trễ.

Những lựa chọn kiến trúc này rất quan trọng vì gánh nặng thực sự không nằm ở việc xây dựng mô hình, mà ở việc chạy chúng ngày qua ngày. Đây là nơi chi phí suy luận nhanh chóng vượt qua việc đào tạo và định nghĩa kinh tế của AI ở quy mô lớn.

Suy luận đang Ăn vào Ngân sách AI

Trong khi các tiêu đề thường nhấn mạnh vào chi phí khổng lồ của việc đào tạo các mô hình tiên phong, suy luận là hóa đơn không bao giờ ngừng. Chỉ số AI của Stanford năm 2025 cho biết rằng những tiến bộ nhanh chóng trong các mô hình nhỏ đã giảm chi phí để đạt được hiệu suất “GPT-3.5 cấp” hơn 280 lần giữa cuối năm 2022 và cuối năm 2024. Tuy nhiên, cùng một báo cáo cũng nhấn mạnh sự quan tâm của ngành công nghiệp đối với việc tối ưu hóa hiệu quả suy luận.

Giá GPU trên đám mây đã làm tăng áp lực. Thuê các trường hợp GPU cao cấp có thể, trong khoảng thời gian từ 3 đến 5 năm, có chi phí gần gấp đôi so với việc mua thiết bị đó trực tiếp. Tính linh hoạt rất hữu ích cho các khối lượng công việc đột biến, nhưng các “thuê” suy luận dài hạn im lặng làm cạn kiệt ngân sách. Ngay cả NVIDIA, một công ty mà doanh nghiệp của họ phụ thuộc vào các bộ tăng tốc, đã dành cả năm qua để tối ưu hóa suy luận trên toàn bộ ngăn xếp của họ. Điều này cho thấy rằng chiến trường thực sự đang chuyển từ hiệu suất đào tạo sang kinh tế phục vụ.

Sự khan hiếm chi phí này có nghĩa là các tổ chức không sẵn sàng hoặc không thể thay đổi chiến lược tính toán của họ có nguy cơ bị tụt lại phía sau.

Tại sao Edge (và CPUs) Thay đổi Đường Cong Chi Phí

Thực tế khắc nghiệt là suy luận dựa trên GPU tạo ra kinh tế không bền vững. Chạy các khối lượng công việc AI lớn, thời gian thực trên các GPU đắt tiền không chỉ làm tăng chi phí mà còn đẩy nhanh sự khấu hao của phần cứng. Các chu kỳ đổi mới di chuyển rất nhanh, thường ít hơn 18 tháng giữa các thế hệ chip mới, khiến cho các khoản đầu tư vào cơ sở hạ tầng mất giá trị nhanh chóng. Điều này đã dẫn đến những cảnh báo từ các nhà phân tích về chi phí khấu hao liên quan đến việc mua chip AI khi họ đang cắt giảm dự báo lợi nhuận. Ví dụ, Alphabet dự kiến sẽ chấp nhận 28 tỷ đô la chi phí khấu hao vào năm 2026.

Các nhà máy, phòng khám, cửa hàng bán lẻ, thiết bị di động là nơi AI sẽ ngày càng cần hoạt động. Việc chuyển mọi yêu cầu đến một cụm GPU tập trung thường là công cụ sai cho công việc vì nó tốn kém, tiêu tốn năng lượng và dễ bị ảnh hưởng bởi độ trễ và lo ngại về quyền riêng tư.

Các môi trường Edge không phải là các trang trại GPU đồng nhất. Chúng là các đội xe đa dạng của CPU: máy chủ, máy tính để bàn được thiết kế chắc chắn, máy tính xách tay và thiết bị cầm tay. Sự đa dạng này làm cho CPU trở thành nền tảng tự nhiên cho việc triển khai AI tiết kiệm chi phí.

Trong bức tranh mới này, CPU không chỉ là một giải pháp thay thế, mà là con đường thông minh về chi phí để đạt được AI có thể mở rộng và dễ tiếp cận.

GPU như “Máy bay Tư nhân” của AI

Khi các mô hình trở nên lớn hơn và phức tạp hơn, chúng đòi hỏi nhiều sức mạnh GPU hơn, điều này không chỉ làm tăng chi phí cơ sở hạ tầng và năng lượng mà còn tập trung các khả năng AI tiên tiến vào tay những người có thể chi trả cho chúng.

Các nghiên cứu cho thấy rằng các mô hình sinh tổng hợp lớn, đa năng thường sử dụng nhiều năng lượng hơn và tạo ra lượng khí thải carbon đáng kể hơn trên mỗi 1.000 suy luận so với các hệ thống nhỏ hơn, chuyên dụng. Ngay cả khi kiểm soát số lượng tham số, các kiến trúc dựa trên GPU làm tăng cả rào cản tài chính và hoạt động. Theo thời gian, điều này tạo ra một nút thắt, khiến cho các công ty khởi nghiệp, nhà nghiên cứu và các cộng đồng thiếu nguồn lực gặp khó khăn trong việc tiếp cận các công cụ AI tiên tiến.

Đây là một vấn đề về tính độc quyền: GPU giống như máy bay tư nhân của AI, chúng nhanh và mạnh mẽ, nhưng chỉ có thể tiếp cận được với một vòng tròn nhỏ của các tổ chức được tài trợ tốt.

Nhưng việc công nhận những hạn chế này không có nghĩa là loại bỏ hoàn toàn GPU. Chúng vẫn là lựa chọn tuyệt vời cho một số lớp mô hình và mẫu thông lượng. Một chiến lược dựa trên CPU đầu tiên không phải là chống lại GPU. Đó là một giải pháp thông minh về chi phí.

Cách tiếp cận này mở rộng khả năng tiếp cận và đảm bảo rằng việc triển khai AI được thúc đẩy bởi hiệu quả, không phải bởi uy tín. Thay vì một tương lai được định nghĩa bởi tính độc quyền của GPU, CPU mở ra cánh cửa cho việc triển khai AI có thể mở rộng, bền vững và bao gồm.

Sự Chuyển đổi Cần thiết sang Các Mô hình Dựa trên CPU

Nếu nền kinh tế AI muốn mở rộng một cách bền vững, giải pháp là phải tưởng tượng lại cách các mô hình được đào tạo và triển khai. Một cách tiếp cận là ưu tiên dữ liệu có entropy cao và các trường hợp ngoại lệ trong quá trình đào tạo. Những đầu vào này thúc đẩy tiến bộ có ý nghĩa và có thể giảm nhu cầu về các tập dữ liệu lớn, cho phép các mô hình chạy với ít tham số hơn trong khi vẫn giữ hiệu quả cao.

Bằng cách đủ nhỏ để hoạt động trên các CPU hàng tiêu dùng, dù đó là máy tính xách tay, điện thoại thông minh, máy chủ hay thiết bị Internet của vạn vật (IoT), những mô hình này giảm đáng kể chi phí suy luận và tiêu thụ năng lượng. Chúng cũng cho phép xử lý thời gian thực trực tiếp trên thiết bị, cắt giảm độ trễ và tăng cường quyền riêng tư bằng cách giữ dữ liệu nhạy cảm ở địa phương.

Sự chuyển đổi này không chỉ về chi phí; nó cũng về công bằng. Trong các lĩnh vực như chăm sóc sức khỏe, nơi “sa mạc” về khả năng tiếp cận đã tồn tại, việc triển khai CPU sẵn sàng cho Edge có thể bắc cầu các khoảng cách bằng cách cung cấp các công cụ AI tiên tiến trực tiếp vào các phòng khám, trung tâm cuộc gọi hoặc thiết bị hiện trường mà không cần dựa vào các nguồn tính toán tập trung khan hiếm. Kết quả là sự áp dụng rộng rãi hơn, độ bền cao hơn và sự phân phối công bằng hơn của các lợi ích AI.

Từ Quyền lực đến Khả năng Tiếp cận: CPU như Người Bình đẳng Vĩ đại trong AI

Những năm tới sẽ không chỉ kiểm tra ai có thể xây dựng các mô hình AI mạnh mẽ nhất, mà còn ai có thể cung cấp chúng một cách hiệu quả, bền vững và ở quy mô lớn. Các mô hình sẵn sàng cho Edge, tối ưu hóa CPU cung cấp một con đường tiến bộ. Bằng cách cho phép AI chạy hiệu quả trên phần cứng hàng tiêu dùng, chúng giảm các rào cản cho các công ty khởi nghiệp và nhà nghiên cứu, giảm sự phụ thuộc vào các chuỗi cung ứng dễ bị tổn thương và mang các ứng dụng tiên tiến vào các môi trường nơi các cụm GPU tập trung là không thực tế.

Đánh giá cơ sở hạ tầng AI thông qua các chỉ số như chi phí tổng thể trên mỗi giờ chuyển đổi, điểm triển khai và sẵn sàng cho Edge đảm bảo rằng các giải pháp được đánh giá không chỉ bởi độ chính xác của điểm chuẩn mà còn bởi khả năng mở rộng một cách hợp lý và bao gồm trong thế giới thực.

Đặt cược là rất cao. Nếu ngành công nghiệp tiếp tục coi GPU là mặc định, khả năng tiếp cận sẽ vẫn là độc quyền, sự đổi mới sẽ được tập trung và sự khuếch tán vào các dịch vụ công, chăm sóc sức khỏe và các lĩnh vực thiếu nguồn lực sẽ bị chậm lại. Nhưng nếu các chiến lược sẵn sàng cho Edge, dựa trên CPU đầu tiên chiếm ưu thế, AI có thể trở nên mạnh mẽ hơn, riêng tư hơn và bền vững hơn. Điều này không chỉ san bằng sân chơi, mà còn định nghĩa lại nó.

Ritu Mehrotra, Người sáng lập và Giám đốc điều hành của Shunya Labs là một nhà lãnh đạo giàu kinh nghiệm trong lĩnh vực công nghệ tiêu dùng và trí tuệ nhân tạo, đã mở rộng các công ty trên khắp Bắc Mỹ, châu Á và châu Âu. Một người sống sót sau bệnh ung thư, cô hiện đang cam kết cải thiện sức khỏe tâm thần toàn cầu bằng cách phá vỡ các rào cản về tiếp cận, chất lượng và chi phí.