Mô hình và nền tảng AI
Học Tập Trên Thiết Bị Vĩnh Cửu Gần More Với Kỹ Thuật Đào Tạo Mới

Một nhóm các nhà nghiên cứu tại MIT và MIT-IBM Watson AI Lab đã phát triển một kỹ thuật mới cho phép đào tạo trên thiết bị sử dụng ít hơn một phần tư megabyte bộ nhớ. Sự phát triển mới này là một thành tựu ấn tượng vì các giải pháp đào tạo khác thường cần hơn 500 megabyte bộ nhớ, vượt quá khả năng 256 kilobyte của hầu hết các bộ điều khiển.
Bằng cách đào tạo một mô hình học máy trên thiết bị thông minh, nó có thể thích nghi với dữ liệu mới và đưa ra dự đoán tốt hơn. Tuy nhiên, quá trình đào tạo thường yêu cầu nhiều bộ nhớ, vì vậy nó thường được thực hiện trên máy tính tại trung tâm dữ liệu trước khi mô hình được triển khai trên thiết bị. Quá trình này tốn kém hơn và gây ra các vấn đề về quyền riêng tư so với kỹ thuật mới được phát triển bởi nhóm.
Các nhà nghiên cứu đã phát triển các thuật toán và khuôn khổ để giảm thiểu lượng tính toán cần thiết để đào tạo một mô hình, làm cho quá trình nhanh hơn và hiệu quả hơn về bộ nhớ. Kỹ thuật này có thể giúp đào tạo một mô hình học máy trên một bộ điều khiển trong vài phút.
Kỹ thuật mới cũng giúp bảo vệ quyền riêng tư vì nó giữ dữ liệu trên thiết bị, điều này quan trọng khi dữ liệu nhạy cảm được sử dụng. Đồng thời, khuôn khổ cải thiện độ chính xác của mô hình khi so sánh với các phương pháp khác.
Song Han là giáo sư phụ tá tại Bộ phận Kỹ thuật Điện và Khoa học Máy tính (EECS), thành viên của MIT-IBM Watson AI Lab và là tác giả chính của bài báo nghiên cứu.
“Nghiên cứu của chúng tôi cho phép các thiết bị IoT không chỉ thực hiện suy luận mà còn liên tục cập nhật các mô hình AI cho dữ liệu mới được thu thập, mở ra con đường cho việc học tập trên thiết bị vĩnh cửu,” Han nói. “Sử dụng tài nguyên thấp làm cho học sâu trở nên dễ tiếp cận hơn và có thể có phạm vi rộng hơn, đặc biệt là đối với các thiết bị cạnh mạng có công suất thấp.”
Bài báo này bao gồm các tác giả đồng dẫn là Ji Lin và Ligeng Zhu, cũng như các nghiên cứu sinh sau tiến sĩ Wei-Ming Chen và Wei-Chen Wang của MIT. Nó cũng bao gồm Chuang Gan, thành viên nghiên cứu chính tại MIT-IBM Watson AI Lab.
Làm Cho Quá Trình Đào Tạo Hiệu Quả Hơn
Để làm cho quá trình đào tạo hiệu quả hơn và ít tốn bộ nhớ hơn, nhóm đã dựa vào hai giải pháp thuật toán. Đầu tiên là cập nhật thưa thớt, sử dụng thuật toán xác định các trọng số quan trọng nhất để cập nhật trong mỗi vòng đào tạo. Thuật toán đóng băng các trọng số một lần cho đến khi độ chính xác giảm xuống một ngưỡng nhất định, tại đó nó dừng lại. Các trọng số còn lại sau đó được cập nhật và các hoạt động tương ứng với các trọng số bị đóng băng không cần được lưu trữ trong bộ nhớ.
“Cập nhật toàn bộ mô hình rất tốn kém vì có nhiều hoạt động, vì vậy mọi người thường chỉ cập nhật lớp cuối cùng, nhưng như bạn có thể tưởng tượng, điều này làm tổn thương độ chính xác,” Han nói. “Đối với phương pháp của chúng tôi, chúng tôi chọn cập nhật những trọng số quan trọng và đảm bảo độ chính xác được bảo toàn hoàn toàn.”
Giải pháp thứ hai được nhóm phát triển liên quan đến đào tạo lượng tử và đơn giản hóa các trọng số. Một thuật toán đầu tiên làm tròn các trọng số xuống chỉ tám bit thông qua một quá trình lượng tử hóa, cũng cắt giảm lượng bộ nhớ cho đào tạo và suy luận, với suy luận là quá trình áp dụng một mô hình vào một tập dữ liệu và tạo ra dự đoán. Thuật toán sau đó dựa vào một kỹ thuật gọi là tỷ lệ缩 thang lượng tử (QAS), hoạt động như một nhân để điều chỉnh tỷ lệ giữa trọng số và gradient. Điều này giúp tránh bất kỳ sự giảm độ chính xác nào có thể phát sinh từ đào tạo lượng tử.
Các nhà nghiên cứu đã phát triển một hệ thống gọi là động cơ đào tạo nhỏ, chạy các đổi mới thuật toán trên một bộ điều khiển đơn giản không có hệ điều hành. Để hoàn thành nhiều công việc hơn trong giai đoạn biên dịch, trước khi triển khai mô hình trên thiết bị cạnh, hệ thống thay đổi thứ tự của các bước trong quá trình đào tạo.
“Chúng tôi đẩy nhiều tính toán, chẳng hạn như tự động phân biệt và tối ưu hóa đồ thị, sang thời gian biên dịch. Chúng tôi cũng cắt tỉa mạnh các toán tử dư thừa để hỗ trợ cập nhật thưa thớt. Một khi đã ở thời gian chạy, chúng tôi có ít công việc hơn để thực hiện trên thiết bị,” Han nói.
Kỹ Thuật Hiệu Quả Cao
Trong khi các kỹ thuật truyền thống được thiết kế cho đào tạo nhẹ thường cần khoảng 300 đến 600 megabyte bộ nhớ, tối ưu hóa của nhóm chỉ cần 157 kilobyte để đào tạo một mô hình học máy trên một bộ điều khiển.
Khuôn khổ đã được thử nghiệm bằng cách đào tạo một mô hình tầm nhìn máy tính để phát hiện người trong hình ảnh, và nó đã học cách hoàn thành nhiệm vụ này trong chỉ 10 phút. Phương pháp này cũng có thể đào tạo một mô hình nhanh hơn 20 lần so với các phương pháp khác.
Các nhà nghiên cứu sẽ hiện áp dụng các kỹ thuật này vào các mô hình ngôn ngữ và các loại dữ liệu khác. Họ cũng muốn sử dụng kiến thức thu được này để thu nhỏ các mô hình lớn hơn mà không mất độ chính xác, điều này cũng có thể giúp giảm dấu chân carbon của việc đào tạo các mô hình học máy quy mô lớn.












