Mô hình và nền tảng AI
Các nhà nghiên cứu tạo ra sự thay thế cho GPU

Các nhà khoa học máy tính từ Đại học Rice, cùng với các cộng tác viên từ Intel (INTC ), đã phát triển một sự thay thế tiết kiệm chi phí hơn cho GPU. Thuật toán mới này được gọi là “động cơ học sâu sub-linear” (SLIDE), và nó sử dụng các đơn vị xử lý trung tâm (CPUs) chung mà không có phần cứng gia tốc chuyên dụng.
Kết quả được trình bày tại Trung tâm Hội nghị Austin, nơi tổ chức hội nghị hệ thống học máy MLSys.
Một trong những thách thức lớn nhất trong trí tuệ nhân tạo (AI) là phần cứng gia tốc chuyên dụng như các đơn vị xử lý đồ họa (GPUs). Trước khi có những phát triển mới, người ta tin rằng để tăng tốc công nghệ học sâu, việc sử dụng phần cứng gia tốc chuyên dụng là cần thiết.
Nhiều công ty đã đặt sự quan trọng vào việc đầu tư vào GPUs và phần cứng chuyên dụng cho học sâu, chịu trách nhiệm cho các công nghệ như trợ lý kỹ thuật số, nhận dạng khuôn mặt và hệ thống khuyến nghị sản phẩm. Một công ty như vậy là Nvidia (NVDA ), tạo ra GPU Tensor Core Tesla (TSLA ) V100. Nvidia gần đây đã báo cáo tăng 41% doanh thu quý thứ tư so với năm trước.
Sự phát triển của SLIDE mở ra những khả năng hoàn toàn mới.
Anshumali Shrivastava là giáo sư trợ lý tại Trường Kỹ thuật Brown của Rice và đã giúp phát minh SLIDE cùng với các sinh viên sau đại học Beidi Chen và Tharun Medini.
“Các thử nghiệm của chúng tôi cho thấy SLIDE là sự thực hiện thông minh đầu tiên của học sâu trên CPU có thể vượt qua phần cứng gia tốc GPU trên các tập dữ liệu khuyến nghị quy mô công nghiệp với các kiến trúc kết nối đầy đủ lớn,” Shrivastava nói.
SLIDE vượt qua thách thức của GPUs vì cách tiếp cận hoàn toàn khác nhau đối với học sâu. Hiện tại, kỹ thuật đào tạo tiêu chuẩn cho các mạng nơ-ron sâu là “truyền ngược”, và nó yêu cầu nhân ma trận. Công việc này yêu cầu sử dụng GPUs, vì vậy các nhà nghiên cứu đã thay đổi đào tạo mạng nơ-ron để nó có thể được giải quyết bằng các bảng băm.
Cách tiếp cận mới này giảm đáng kể tải trọng tính toán cho SLIDE. Nền tảng GPU tốt nhất hiện nay mà các công ty như Amazon (AMZN ) và Google (GOOGL ) sử dụng cho học sâu dựa trên đám mây có tám Tesla V100, và giá của nó là khoảng 100.000 đô la.
“Chúng tôi có một trong phòng thí nghiệm, và trong trường hợp thử nghiệm của chúng tôi, chúng tôi đã thực hiện một khối lượng công việc hoàn hảo cho V100, một công việc có hơn 100 triệu tham số trong các mạng kết nối đầy đủ lớn phù hợp với bộ nhớ GPU,” Shrivastava nói. “Chúng tôi đã đào tạo nó với gói phần mềm tốt nhất hiện có, Google’s TensorFlow, và nó mất 3 giờ rưỡi để đào tạo.
“Sau đó, chúng tôi đã chứng minh rằng thuật toán mới của chúng tôi có thể thực hiện đào tạo trong một giờ, không trên GPU mà trên CPU Xeon 44 lõi,” ông tiếp tục.
Băm là một phương pháp lập chỉ mục dữ liệu được phát minh vào những năm 1990 cho tìm kiếm trên internet. Các phương pháp số được sử dụng để mã hóa lượng thông tin lớn thành một chuỗi chữ số, được gọi là băm. Các băm được liệt kê để tạo ra các bảng có thể được tìm kiếm nhanh chóng.
“Nó sẽ không có ý nghĩa gì khi thực hiện thuật toán của chúng tôi trên TensorFlow hoặc PyTorch vì điều đầu tiên họ muốn làm là chuyển đổi bất cứ điều gì bạn đang làm thành một vấn đề nhân ma trận,” Chen nói. “Đó chính xác là điều chúng tôi muốn tránh. Vì vậy, chúng tôi đã viết mã C++ của mình từ đầu.”
Theo Shrivastava, lợi thế lớn nhất của SLIDE là nó song song về dữ liệu.
“Bằng cách song song về dữ liệu, tôi có nghĩa là nếu tôi có hai trường hợp dữ liệu mà tôi muốn đào tạo, hãy nói rằng một là hình ảnh của một con mèo và cái kia là một chiếc xe buýt, chúng sẽ kích hoạt các nơ-ron khác nhau, và SLIDE có thể cập nhật, hoặc đào tạo trên những cái này độc lập,” ông nói. “Điều này là một sự sử dụng song song tốt hơn cho CPUs.”
“Đổi lại, so với GPU, là chúng tôi yêu cầu một bộ nhớ lớn,” ông nói. “Có một hệ thống phân cấp bộ nhớ trong bộ nhớ chính, và nếu bạn không cẩn thận với nó, bạn có thể gặp phải một vấn đề gọi là thrashing bộ nhớ, nơi bạn nhận được nhiều lỗi bộ nhớ.”
SLIDE đã mở cửa cho những cách mới để thực hiện học sâu, và Shrivastava tin rằng nó chỉ là bước đầu tiên.
“Chúng tôi chỉ mới chạm vào bề mặt,” ông nói. “Còn rất nhiều điều chúng tôi có thể làm để tối ưu hóa. Chúng tôi đã không sử dụng vector hóa, ví dụ, hoặc các gia tốc tích hợp trong CPU, như Intel Deep Learning Boost. Có rất nhiều thủ thuật khác mà chúng tôi có thể sử dụng để làm cho nó nhanh hơn.”












