Lãnh đạo tư tưởng
Tương lai của Trí tuệ nhân tạo sinh (Generative AI) là Edge

Sự ra đời của ChatGPT và Trí tuệ nhân tạo sinh (Generative AI) nói chung là một bước ngoặt trong lịch sử công nghệ và được so sánh với sự ra đời của Internet và điện thoại thông minh. Trí tuệ nhân tạo sinh đã thể hiện tiềm năng vô tận trong khả năng tham gia vào các cuộc trò chuyện thông minh, vượt qua các kỳ thi, tạo ra các chương trình/mã phức tạp và tạo ra các hình ảnh và video hấp dẫn. Mặc dù các GPU chạy hầu hết các mô hình Trí tuệ nhân tạo sinh trong đám mây – cả cho đào tạo và suy luận – nhưng đây không phải là một giải pháp có thể mở rộng lâu dài, đặc biệt là cho suy luận, do các yếu tố như chi phí, năng lượng, độ trễ, quyền riêng tư và bảo mật. Bài viết này sẽ giải quyết từng yếu tố này cùng với các ví dụ động viên để di chuyển các công việc tính toán Trí tuệ nhân tạo sinh đến Edge.
Hầu hết các ứng dụng chạy trên các bộ xử lý hiệu suất cao – либо trên thiết bị (ví dụ: điện thoại thông minh, máy tính để bàn, máy tính xách tay) hoặc trong các trung tâm dữ liệu. Khi tỷ lệ ứng dụng sử dụng Trí tuệ nhân tạo tăng lên, các bộ xử lý chỉ có CPU trở nên không đủ. Hơn nữa, sự mở rộng nhanh chóng trong các công việc Trí tuệ nhân tạo sinh đang tạo ra nhu cầu tăng trưởng theo cấp số nhân đối với các máy chủ được trang bị Trí tuệ nhân tạo với các GPU đắt tiền và ngốn năng lượng, điều này lại làm tăng chi phí cơ sở hạ tầng. Các máy chủ được trang bị Trí tuệ nhân tạo này có thể có giá lên đến 7 lần so với giá của một máy chủ thông thường và các GPU chiếm 80% chi phí thêm này.
Ngoài ra, một máy chủ dựa trên đám mây tiêu thụ 500W đến 2000W, trong khi một máy chủ được trang bị Trí tuệ nhân tạo tiêu thụ từ 2000W đến 8000W – gấp 4 lần! Để hỗ trợ các máy chủ này, các trung tâm dữ liệu cần các mô-đun làm mát và nâng cấp cơ sở hạ tầng bổ sung – điều này có thể cao hơn甚至 so với khoản đầu tư tính toán. Các trung tâm dữ liệu đã tiêu thụ 300 TWH mỗi năm, gần 1% tổng tiêu thụ năng lượng toàn cầu. Nếu xu hướng áp dụng Trí tuệ nhân tạo tiếp tục, thì có thể tới 5% tiêu thụ năng lượng toàn cầu sẽ được sử dụng bởi các trung tâm dữ liệu vào năm 2030. Ngoài ra, có một khoản đầu tư chưa từng có vào các trung tâm dữ liệu Trí tuệ nhân tạo sinh. Dự kiến, các trung tâm dữ liệu sẽ tiêu thụ tới 500 tỷ đô la cho chi phí vốn bằng cách năm 2027, chủ yếu do nhu cầu cơ sở hạ tầng Trí tuệ nhân tạo.

Tiêu thụ điện của các trung tâm dữ liệu, đã là 300 TwH, sẽ tăng đáng kể với việc áp dụng Trí tuệ nhân tạo sinh.
Chi phí tính toán Trí tuệ nhân tạo cũng như tiêu thụ năng lượng sẽ cản trở việc áp dụng rộng rãi Trí tuệ nhân tạo sinh. Các thách thức về khả năng mở rộng có thể được vượt qua bằng cách di chuyển tính toán Trí tuệ nhân tạo đến Edge và sử dụng các giải pháp xử lý được tối ưu hóa cho các công việc Trí tuệ nhân tạo. Với cách tiếp cận này, khách hàng cũng nhận được các lợi ích khác, bao gồm độ trễ, quyền riêng tư, độ tin cậy và khả năng tăng lên.
Tính toán đi theo dữ liệu đến Edge
Kể từ một thập kỷ trước, khi Trí tuệ nhân tạo xuất hiện từ thế giới học thuật, đào tạo và suy luận của các mô hình Trí tuệ nhân tạo đã diễn ra trong đám mây/trung tâm dữ liệu. Với phần lớn dữ liệu được tạo ra và tiêu thụ tại Edge – đặc biệt là video – việc di chuyển suy luận của dữ liệu đến Edge sẽ cải thiện tổng chi phí sở hữu (TCO) cho các doanh nghiệp do giảm chi phí mạng và tính toán. Trong khi chi phí suy luận Trí tuệ nhân tạo trên đám mây là định kỳ, chi phí suy luận tại Edge là một khoản chi phí phần cứng một lần. Về cơ bản, việc bổ sung hệ thống với một bộ xử lý Trí tuệ nhân tạo Edge sẽ giảm chi phí hoạt động tổng thể. Giống như việc di chuyển các công việc Trí tuệ nhân tạo thông thường đến Edge (ví dụ: thiết bị, thiết bị), các công việc Trí tuệ nhân tạo sinh sẽ theo sát. Điều này sẽ mang lại tiết kiệm đáng kể cho các doanh nghiệp và người tiêu dùng.
Sự di chuyển đến Edge kết hợp với một bộ tăng tốc Trí tuệ nhân tạo hiệu quả để thực hiện các chức năng suy luận sẽ mang lại các lợi ích khác. Trước hết trong số đó là độ trễ. Ví dụ, trong các ứng dụng trò chơi, các nhân vật không phải người chơi (NPC) có thể được kiểm soát và tăng cường bằng Trí tuệ nhân tạo sinh. Sử dụng các mô hình LLM chạy trên bộ tăng tốc Trí tuệ nhân tạo Edge trong một máy console hoặc máy tính, người chơi có thể đưa ra các mục tiêu cụ thể cho các nhân vật này, để chúng có thể tham gia vào câu chuyện một cách có ý nghĩa. Độ trễ thấp từ suy luận Edge cục bộ sẽ cho phép các nhân vật NPC nói và di chuyển phản hồi với các lệnh và hành động của người chơi trong thời gian thực. Điều này sẽ mang lại một trải nghiệm chơi game cực kỳ hấp dẫn trong một cách hiệu quả về chi phí và năng lượng.
Trong các ứng dụng như chăm sóc sức khỏe, quyền riêng tư và độ tin cậy cực kỳ quan trọng (ví dụ: đánh giá bệnh nhân, khuyến nghị thuốc). Dữ liệu và các mô hình Trí tuệ nhân tạo sinh liên quan phải được đặt tại chỗ để bảo vệ dữ liệu bệnh nhân (quyền riêng tư) và bất kỳ sự cố mạng nào sẽ chặn truy cập vào các mô hình Trí tuệ nhân tạo trong đám mây có thể là thảm họa. Một thiết bị Trí tuệ nhân tạo Edge chạy một mô hình Trí tuệ nhân tạo sinh được thiết kế riêng cho từng khách hàng doanh nghiệp – trong trường hợp này là một nhà cung cấp dịch vụ chăm sóc sức khỏe – có thể giải quyết các vấn đề về quyền riêng tư và độ tin cậy một cách liền mạch trong khi cung cấp độ trễ thấp hơn và chi phí thấp hơn.

Trí tuệ nhân tạo sinh trên các thiết bị Edge sẽ đảm bảo độ trễ thấp trong trò chơi và bảo vệ dữ liệu bệnh nhân cũng như tăng cường độ tin cậy cho chăm sóc sức khỏe.
Nhiều mô hình Trí tuệ nhân tạo sinh chạy trên đám mây có thể gần một nghìn tỷ tham số – những mô hình này có thể giải quyết các truy vấn mục đích chung một cách hiệu quả. Tuy nhiên, các ứng dụng cụ thể của doanh nghiệp đòi hỏi các mô hình phải cung cấp kết quả liên quan đến trường hợp sử dụng. Hãy lấy ví dụ về một trợ lý Trí tuệ nhân tạo sinh được xây dựng để nhận đơn hàng tại một nhà hàng nhanh – để hệ thống này có thể tương tác với khách hàng một cách liền mạch, mô hình Trí tuệ nhân tạo sinh cơ bản phải được đào tạo trên các mục menu của nhà hàng, cũng như biết về các chất gây dị ứng và thành phần. Kích thước mô hình có thể được tối ưu hóa bằng cách sử dụng một siêu mô hình Ngôn ngữ Lớn (LLM) để đào tạo một mô hình LLM nhỏ hơn, khoảng 10-30 tỷ tham số, và sau đó sử dụng tinh chỉnh thêm với dữ liệu cụ thể của khách hàng. Một mô hình như vậy có thể cung cấp kết quả với độ chính xác và khả năng tăng lên. Và với kích thước mô hình nhỏ hơn, nó có thể được triển khai hiệu quả trên một bộ tăng tốc Trí tuệ nhân tạo tại Edge.
Trí tuệ nhân tạo sinh sẽ thắng tại Edge
Sẽ luôn có nhu cầu về Trí tuệ nhân tạo sinh chạy trên đám mây, đặc biệt là cho các ứng dụng mục đích chung như ChatGPT và Claude. Nhưng khi nói đến các ứng dụng cụ thể của doanh nghiệp, như chức năng điền sinh của Adobe Photoshop hoặc Github copilot, Trí tuệ nhân tạo sinh tại Edge không chỉ là tương lai, mà còn là hiện tại. Các bộ tăng tốc Trí tuệ nhân tạo được thiết kế riêng là chìa khóa để làm cho điều này trở nên khả thi, đặc biệt là cho các ứng dụng như vậy.












