Lãnh đạo tư tưởng

Ngừng Thiết Kế Hạ Tầng AI Xung Quanh GPU

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Tại sao các MSP nên bắt đầu với khối tải công việc, không phải phần cứng

Dành năm phút tại một hội nghị AI và bạn có thể dễ dàng rời đi với niềm tin rằng mọi triển khai AI thành công đều bắt đầu bằng việc mua thêm GPU. Điều này dễ hiểu. Phần cứng chiếm ưu thế trong các cuộc trò chuyện. Khách hàng nghe nói về các hệ thống Blackwell, mạng InfiniBand, các đám mây siêu quy mô, và các cụm AI ngày càng khổng lồ. Các nhà cung cấp tự nhiên hướng tới những bộ tăng tốc và hệ thống nhanh nhất mới nhất vì chúng hấp dẫn, liên quan và tương đối dễ đưa ra thị trường.

Vấn đề không phải là tính toán không quan trọng. Nó quan trọng vô cùng.

Vấn đề là bắt đầu từ đó có thể khiến các tổ chức đặt câu hỏi sai. Thị trường AI không còn ở giai đoạn thử nghiệm. AI đang được đưa vào sản xuất, các công ty đang đầu tư tiền thật và họ mong đợi những kết quả kinh doanh có thể đo lường được. Các quyết định về hạ tầng đã trở nên quan trọng hơn rất nhiều so với hai năm trước. Tuy nhiên, chưa đủ các quyết định được đưa ra dựa trên yêu cầu kinh doanh – các quyết định dựa trên công nghệ vẫn chiếm ưu thế.

Câu hỏi đầu tiên không nên là “GPU nào chúng ta nên mua?”

“Khối tải công việc nào chúng ta đang cố gắng hỗ trợ?” nên là trọng tâm.

Thay đổi tưởng như nhỏ bé này ảnh hưởng đến hầu hết các quyết định hạ tầng tiếp theo.

Không Có Một Kiến Trúc AI Chuẩn

Một trong những hiểu lầm lớn nhất trên thị trường là tồn tại một bản thiết kế chuẩn cho hạ tầng AI. Thực tế không có.

Chúng ta thường nói về AI như thể nó chỉ là một khối tải duy nhất. Trên thực tế, AI bao gồm một loạt các ứng dụng kinh doanh với yêu cầu rất khác nhau. Nền tảng AI thoại không có cùng yêu cầu hạ tầng với chẩn đoán hình ảnh y tế. Khai thác tri thức khác với tạo hình ảnh. Phát hiện gian lận không giống như phân tích dự đoán, và cũng không giống như xử lý video. Tất cả đều sử dụng AI. Chúng chỉ sử dụng hạ tầng theo cách khác nhau.

Bạn không thực sự đang thiết kế hạ tầng cho “AI”. Bạn đang thiết kế hạ tầng cho một ứng dụng kinh doanh tình cờ sử dụng AI. Sự khác biệt này rất quan trọng. Mỗi khối tải công việc đều đặt ra những yêu cầu độc đáo cho hạ tầng hỗ trợ. Một số cần tài nguyên tính toán mạnh mẽ. Những thứ khác lại phụ thuộc nhiều vào hiệu năng lưu trữ vì chúng liên tục truy xuất các bộ dữ liệu lớn. Một số bị giới hạn bởi băng thông mạng, trong khi một khối tải khác lại sống còn dựa vào độ trễ vì mỗi mili giây đều ảnh hưởng đến trải nghiệm khách hàng.

Cũng có một thực tế thực tiễn. Hạ tầng mà mô hình được thiết kế cho không phải lúc nào cũng có sẵn khi đến thời điểm triển khai. Tình trạng thiếu phần cứng, thời gian giao hàng dài, hoặc hạn chế thời gian triển khai có thể buộc các tổ chức phải sử dụng GPU, bộ tăng tốc hoặc cấu hình hạ tầng khác so với kế hoạch ban đầu. Điều đó có thể đòi hỏi phải tối ưu lại mô hình. Hoặc thậm chí thiết kế lại mô hình quanh phần cứng mà họ thực sự có thể triển khai.

Yêu cầu bảo mật và quản trị cũng mang tính đặc thù theo khối tải. Ứng dụng xử lý thông tin công cộng có yêu cầu hoàn toàn khác so với ứng dụng xử lý giao dịch tài chính, hồ sơ y tế, hoặc tài sản trí tuệ độc quyền. Bảo vệ dữ liệu, quản lý danh tính và truy cập, tuân thủ, chủ quyền dữ liệu, sao lưu, khôi phục và tính sẵn sàng không thể chỉ được thêm vào sau khi triển khai. Chúng là những quyết định kiến trúc.

Yêu cầu kinh doanh lại tạo thêm một lớp. Ứng dụng cần mở rộng nhanh như thế nào? Chi phí vận hành mức nào là chấp nhận được? Mức độ sẵn sàng mà doanh nghiệp yêu cầu là bao nhiêu? Tổ chức có thể quản lý mức độ phức tạp nào một cách thực tế? Những câu hỏi này sẽ có câu trả lời khác nhau tùy từng khách hàng. Đó là lý do không có một mô hình hạ tầng AI “một kích cỡ phù hợp cho tất cả”.

Các tổ chức bắt đầu với một đám mây, nền tảng phần cứng hoặc nhà cung cấp ưa thích không nhất thiết sẽ có hạ tầng AI đúng. Những người dẫn đầu bắt đầu với khối tải công việc và thiết kế kiến trúc quanh mục tiêu kinh doanh.

Đào Tạo Là Điểm Nhấn. Suy Luận Mang Lại Giá Trị Kinh Doanh.

Sự mê hoặc của ngành công nghiệp với việc đào tạo là một lý do khác khiến các cuộc trò chuyện về hạ tầng AI có thể đi sai hướng.

Đào tạo một mô hình ngôn ngữ lớn là một thách thức kỹ thuật phi thường. Cần các bộ dữ liệu khổng lồ, các cụm GPU quy mô lớn, tiêu thụ năng lượng đáng kể, và hạ tầng có khả năng hoạt động ở công suất tối đa trong nhiều ngày, tuần, hoặc thậm chí tháng. Điều này tốn kém, ấn tượng về mặt kỹ thuật và tự nhiên thu hút sự chú ý.

Tuy nhiên, hầu hết các tổ chức không đang xây dựng mô hình tiên tiến tiếp theo. Họ đang xây dựng các ứng dụng dịch vụ khách hàng, hệ thống AI thoại, trợ lý đồng hành cho nhân viên, trợ lý tri thức, công cụ tìm kiếm, nền tảng tóm tắt tài liệu, hệ thống phát hiện gian lận, và hàng chục ứng dụng thực tiễn khác bằng cách sử dụng các mô hình đã được đào tạo sẵn.

Đó là các khối tải suy luận, và suy luận thay đổi phương trình hạ tầng. Thay vì tối ưu duy nhất cho tính toán tối đa, các tổ chức có thể cần tối ưu cho thời gian phản hồi nhanh, độ trễ thấp, chi phí vận hành dự đoán được và hiệu năng ổn định.

Một khách hàng không quan tâm GPU nền tảng mạnh mẽ đến mức nào nếu chatbot mất năm giây để trả lời. Người gọi không quan tâm thông số kỹ thuật của cụm AI nếu trợ lý thoại thường xuyên hiểu sai yêu cầu hoặc chậm trễ trong cuộc hội thoại. Họ chỉ biết rằng ứng dụng không hoạt động tốt.

Do đó, thiết kế mọi môi trường AI như thể bạn đang đào tạo một mô hình nền tảng thường là cách tiếp cận sai và thường gây tốn kém không cần thiết.

Mục tiêu của hầu hết khách hàng MSP không phải là xây dựng cụm GPU lớn nhất thế giới. Việc đưa các ứng dụng AI vào sản xuất nhanh chóng, đáng tin cậy, an toàn và kinh tế là mục tiêu.

Thách thức là tìm ra cân bằng đúng giữa hiệu năng, bảo mật, khả năng mở rộng, độ bền và chi phí cho các khối tải mà họ thực sự đang chạy.

Có Thể GPU Không Phải Là Điểm Tắc Nghẽn Của Bạn

GPU đã trở thành ngôi sao của hạ tầng AI. Chúng đắt đỏ, khó mua và dễ so sánh, khiến chúng trở thành trung tâm của vô số cuộc trò chuyện hạ tầng. Tuy nhiên, GPU có thể không phải là yếu tố kìm hãm khi một ứng dụng AI đã vào giai đoạn sản xuất.

“Chúng ta cần bao nhiêu GPU?” không phải là câu hỏi chúng ta nên đặt, mà là “Điều gì sẽ làm chậm ứng dụng này sau sáu tháng tới?”

Câu trả lời có thể nằm ở nơi khác trong kiến trúc.

Lưu trữ là một ví dụ điển hình. Các khối tải AI tiêu thụ lượng dữ liệu khổng lồ – và các bộ dữ liệu này sẽ tiếp tục tăng theo thời gian. Ngay cả một GPU cực mạnh cũng có thể mất thời gian chờ đợi thay vì làm việc, nếu lưu trữ không cung cấp thông tin đủ nhanh. Dữ liệu đó cũng cần được bảo vệ, sao lưu, lưu trữ, bảo mật và quản lý trong suốt vòng đời.

Cũng không kém phần quan trọng, mạng. Băng thông, độ trễ, lưu lượng east‑west và giao tiếp giữa các cụm AI đều ảnh hưởng đến hiệu năng ứng dụng. Một môi trường tính toán được thiết kế tốt không thể bù đắp vô hạn cho một mạng lưới kém thiết kế.

Thêm vào đó, bảo mật phải được tích hợp vào kiến trúc ngay từ đầu. Các câu hỏi cần giải quyết trước khi đưa vào sản xuất bao gồm: dữ liệu nhạy cảm nằm ở đâu, mạng được phân đoạn như thế nào, khối tải giao tiếp qua kết nối riêng hay công cộng, và các yêu cầu tuân thủ và chủ quyền dữ liệu được đáp ứng ra sao.

Một yếu tố dễ bị bỏ qua khác là kết nối. Mặc dù chúng không tạo ra tiêu đề rầm rộ, nhưng đa dạng sợi quang, đa dạng tuyến đường, quan hệ peering và vị trí địa lý có thể ảnh hưởng quan trọng đến trải nghiệm người dùng – chưa kể đến độ bền của nền tảng.

Khách hàng cuối không biết và không quan tâm GPU nào đang nằm trong rack. Họ quan tâm liệu ứng dụng có phản hồi ngay lập tức hay để họ phải chờ đợi.

Cơ sở hạ tầng vật lý cũng cần được chú ý. Khả năng cung cấp điện, công suất làm mát, mật độ rack và khả năng mở rộng quyết định liệu triển khai thành công ngày hôm nay có thể đáp ứng tăng trưởng ngày mai hay không.

Rồi còn trọng lực dữ liệu. Khi các bộ dữ liệu mở rộng, việc di chuyển hàng petabyte thông tin giữa các vị trí chỉ vì tính toán nằm ở nơi khác trở nên ngày càng kém hiệu quả. Trong nhiều trường hợp, đưa tính toán gần hơn với dữ liệu vừa thực tế vừa tiết kiệm chi phí.

Đây là lý do kiến trúc quan trọng.

Hãy nghĩ đến một chiếc xe đua – chỉ vì nó có động cơ tốt nhất không đồng nghĩa với việc nó sẽ thắng. Hộp số, lốp xe, hệ thống treo, đường đua và đặc biệt là tài xế cũng đều quan trọng. Hạ tầng AI hoạt động tương tự.

Những tổ chức tạo ra giá trị lớn nhất từ AI không nhất thiết là những người sở hữu cụm GPU lớn nhất. Họ sẽ là những người hiểu cách mọi lớp hạ tầng phối hợp với nhau.

Đó là sự khác biệt giữa việc mua hạ tầng và việc thiết kế hạ tầng.

Một Khung Kế Hoạch Ưu Tiên Khối Tải Công Việc

MSP có cơ hội thay đổi cuộc trò chuyện về hạ tầng.

Thay vì bắt đầu với:

  • GPU nào?
  • Đám mây nào?
  • Nhà cung cấp nào?

Hãy bắt đầu với khối tải công việc:

  • Vấn đề kinh doanh nào chúng ta đang giải quyết?
  • Đây là khối tải đào tạo hay suy luận?
  • Ứng dụng có thể chịu được độ trễ bao nhiêu?
  • Dữ liệu nằm ở đâu, và sẽ tăng nhanh như thế nào?
  • Yêu cầu bảo mật, tuân thủ và chủ quyền nào áp dụng?
  • Khối tải sẽ mở rộng như thế nào?
  • Mức độ sẵn sàng mà doanh nghiệp yêu cầu là bao nhiêu?
  • Mức độ rủi ro vận hành nào là chấp nhận được?
  • Chi phí vận hành môi trường này sẽ tăng như thế nào khi sử dụng mở rộng?

Các câu trả lời nên quyết định kiến trúc. Không phải ngược lại.

Cơ Hội Cho Các MSP

Sự chuyển đổi này thay đổi vai trò của MSP.

Khách hàng không cần một đối tác khác chỉ để bán cho họ hạ tầng. Họ cần một đối tác có thể giúp họ đưa ra các quyết định hạ tầng tốt hơn.

Cách tiếp cận ưu tiên khối tải công việc là bắt buộc vì nó cho phép MSP đánh giá tính toán, lưu trữ, mạng, kết nối, bảo mật, vị trí dữ liệu, sẵn sàng và chi phí như một kiến trúc duy nhất – thay vì các quyết định mua sắm riêng lẻ.

Theo cách này, bạn có thể kiểm soát chi phí, cải thiện hiệu năng và xác định rủi ro vận hành và bảo mật trước khi ứng dụng đưa vào sản xuất.

Một mô hình kinh doanh tốt hơn cho MSP cũng được tạo ra.

MSP có thể xây dựng các dịch vụ định kỳ có giá trị cao quanh kiến trúc, triển khai, tối ưu, bảo mật, quản lý vòng đời, hoạch định năng lực và cải tiến liên tục – thay vì chỉ cạnh tranh bằng việc giảm biên lợi nhuận phần cứng.

Giá trị không nằm ở việc đề xuất GPU mới nhất hay nền tảng đám mây mới nhất. Nó nằm ở việc biết khi nào khách hàng cần chúng, khi nào không cần, và những gì khác cần được thiết kế quanh chúng.

Hạ tầng AI cuối cùng không phải là quyết định phần cứng. Đó là quyết định kiến trúc do khối tải công việc, dữ liệu và kết quả kinh doanh mà khách hàng muốn đạt được quyết định.

Những MSP hiểu được sự khác biệt này sẽ được định vị để trở thành một thứ có giá trị hơn rất nhiều so với các nhà cung cấp hạ tầng.

Họ sẽ trở thành những người khách hàng tin tưởng để giúp quyết định hạ tầng thực sự họ cần.

Richard Copeland là Giám đốc Điều hành của Leaseweb USA. Ông chịu trách nhiệm quản lý hoạt động kinh doanh của công ty tại chín trung tâm dữ liệu trên khắp Hoa Kỳ, đồng thời thực hiện và phát triển tầm nhìn và chiến lược của công ty trong khu vực. Trong hơn 20 năm, Richard đã đảm nhiệm các vị trí lãnh đạo bán hàng quan trọng và quản lý tài khoản tại Leaseweb USA và Verizon Business. Richard tốt nghiệp Cử nhân Khoa học tại Virginia Commonwealth University. Ông đam mê làm việc cùng đội ngũ để đạt được mục tiêu của công ty, duy trì cân bằng công việc và cuộc sống cho nhân viên, và đảm bảo sự hài lòng của khách hàng. Trong thời gian rảnh, Richard thích tập thể dục, xem phim và thể thao, và dành thời gian cho gia đình và bạn bè