Mô hình và nền tảng AI
Các nhà nghiên cứu phát hiện ra các mạng con hiệu quả cao trong mạng nơ-ron học sâu
Mạng nơ-ron học sâu thường rất lớn và yêu cầu lượng tính toán khổng lồ, nhưng một khám phá mới cho thấy cách này có thể được cắt giảm để hoàn thành nhiệm vụ một cách hiệu quả hơn. Jonathan Frankle và nhóm của ông tại MIT đã đưa ra “giả thuyết vé số”, cho thấy có các mạng con tinh gọn hơn trong mạng nơ-ron lớn hơn. Những mạng con này có thể hoàn thành nhiệm vụ tại tay với ít yêu cầu tính toán hơn, với một trong những thách thức lớn nhất là tìm ra những mạng con này, hoặc vé số trúng thưởng như nhóm gọi chúng.
Đội ngũ đã phát hiện ra các mạng con này trong BERT, kỹ thuật học máy hàng đầu cho xử lý ngôn ngữ tự nhiên (NLP). NLP, một lĩnh vực con của trí tuệ nhân tạo (AI), chịu trách nhiệm giải mã và phân tích ngôn ngữ của con người, và nó được sử dụng cho các ứng dụng như tạo văn bản dự đoán và rô-bốt trò chuyện.
Tuy nhiên, BERT rất lớn và yêu cầu sức tính toán siêu máy tính, điều này không thể tiếp cận được với hầu hết người dùng. Với khám phá mới về các mạng con này, nó có thể mở ra khả năng tiếp cận, cho phép nhiều người dùng hơn sử dụng công nghệ để phát triển các công cụ NLP.
“Chúng tôi đang đạt đến điểm mà chúng tôi sẽ phải làm cho các mô hình này trở nên tinh gọn và hiệu quả hơn,” Frankle nói.
Theo ông, sự phát triển này có thể “giảm thiểu rào cản gia nhập” cho NLP.
BERT – “Quá đắt đỏ”
BERT là cơ bản cho những thứ như công cụ tìm kiếm của Google và đã nhận được rất nhiều sự chú ý kể từ khi Google phát hành nó vào năm 2018. Nó là một phương pháp để tạo ra mạng nơ-ron và được đào tạo bằng cách cố gắng nhiều lần để điền vào đoạn văn bản trống. Một trong những tính năng ấn tượng nhất của BERT là tập dữ liệu đào tạo ban đầu khổng lồ của nó.
Sau đó, nó có thể được điều chỉnh bởi người dùng cho các nhiệm vụ cụ thể, chẳng hạn như rô-bốt trò chuyện dịch vụ khách hàng, nhưng một lần nữa, nó yêu cầu lượng tính toán khổng lồ, với khả năng đạt tới 1 tỷ tham số.
“Một mô hình BERT tiêu chuẩn ngày nay – loại phổ biến – có 340 triệu tham số,” Frankle nói. “Điều này thực sự quá đắt đỏ. Điều này vượt quá khả năng tính toán của bạn hoặc tôi.”
Theo tác giả chính Tianlong Chen từ Đại học Texas tại Austin, các mô hình như BERT “bị ảnh hưởng bởi kích thước mạng khổng lồ”, nhưng nhờ nghiên cứu mới, “giả thuyết vé số dường như là một giải pháp.”
Các mạng con hiệu quả
Chen và nhóm đã tìm kiếm một mô hình nhỏ hơn nằm trong BERT và họ so sánh hiệu suất của các mạng con được phát hiện với mô hình BERT ban đầu. Điều này được thử nghiệm trên nhiều nhiệm vụ NLP khác nhau, bao gồm trả lời câu hỏi và điền từ trống trong một câu.
Đội ngũ đã phát hiện ra các mạng con thành công có kích thước giảm từ 40 đến 90% so với mô hình BERT ban đầu, với tỷ lệ thực tế phụ thuộc vào nhiệm vụ. Ngoài ra, họ có thể xác định chúng trước khi tinh chỉnh nhiệm vụ cụ thể, điều này dẫn đến giảm thêm chi phí tính toán. Một lợi thế khác là một số mạng con được chọn cho một nhiệm vụ cụ thể có thể được tái sử dụng cho một nhiệm vụ khác.
“Tôi khá ngạc nhiên khi điều này thực sự hoạt động,” Frankle nói. “Điều này không phải là điều tôi cho là đương nhiên. Tôi đang mong đợi một kết quả phức tạp hơn so với những gì chúng tôi nhận được.”
Theo Ari Morcos, một nhà khoa học tại Facebook (META ) AI Research, khám phá này là “thuyết phục”, và “Những mô hình này đang trở nên phổ biến rộng rãi. Vì vậy, điều quan trọng là phải hiểu xem giả thuyết vé số có đúng hay không.”
Morcos cũng nói rằng nếu những mạng con này có thể chạy với ít yêu cầu tính toán hơn, thì điều này sẽ “rất có tác động khi những mô hình siêu lớn này hiện đang rất tốn kém để chạy.”
“Tôi không biết chúng tôi có thể lớn đến mức nào khi sử dụng những tính toán kiểu siêu máy tính này,” Frankle thêm. “Chúng tôi sẽ phải giảm thiểu rào cản gia nhập.”
“Hy vọng là điều này sẽ giảm thiểu chi phí, điều này sẽ làm cho nó trở nên dễ tiếp cận hơn với mọi người… với những người nhỏ chỉ có một chiếc laptop,” ông kết luận.
Nghiên cứu này sẽ được trình bày tại Hội nghị về Hệ thống Xử lý Thông tin Nơ-ron.












