Lãnh đạo tư tưởng
Làm thế nào chúng ta có thể sử dụng Học sâu với Dữ liệu Nhỏ? – Lãnh đạo Tư duy

Khi nói đến việc theo dõi các xu hướng an ninh mạng mới nhất, quá trình cập nhật các phát triển gần đây có thể trở nên khá nhàm chán vì có rất nhiều tin tức để theo dõi. Tuy nhiên, những ngày này, tình hình đã thay đổi đáng kể, vì các lĩnh vực an ninh mạng dường như đang xoay quanh hai từ – học sâu.
Mặc dù chúng tôi ban đầu bị sốc bởi sự phủ sóng rộng rãi mà học sâu đang nhận được, nhưng nó nhanh chóng trở nên rõ ràng rằng sự cường điệu xung quanh học sâu là hoàn toàn xứng đáng. Giống như bộ não con người, học sâu cho phép một mô hình AI đạt được kết quả chính xác cao, bằng cách thực hiện các nhiệm vụ trực tiếp từ văn bản, hình ảnh và âm thanh.
Cho đến thời điểm này, nó được tin rằng học sâu phụ thuộc vào một tập dữ liệu lớn, tương tự như mức độ dữ liệu được lưu trữ bởi các gã khổng lồ Thung lũng Silicon như Google và Facebook để giải quyết các vấn đề phức tạp nhất trong một tổ chức. Tuy nhiên, trái với niềm tin phổ biến, các doanh nghiệp có thể tận dụng sức mạnh của học sâu, ngay cả khi chỉ có quyền truy cập vào một tập dữ liệu hạn chế.
Trong một nỗ lực nhằm giúp các độc giả của chúng tôi có được kiến thức cần thiết để trang bị cho tổ chức của họ với học sâu, chúng tôi đã biên soạn một bài viết đi sâu vào (không có ý chơi chữ) một số cách mà các doanh nghiệp có thể tận dụng lợi ích của học sâu mặc dù chỉ có quyền truy cập vào dữ liệu hạn chế hoặc “nhỏ”.
Tuy nhiên, trước khi chúng ta có thể đi vào phần chính của bài viết, chúng tôi muốn đưa ra một gợi ý nhỏ nhưng rất quan trọng – bắt đầu đơn giản. Trước khi bạn bắt đầu xây dựng các mạng nơ-ron phức tạp đến mức có thể xuất hiện trong một bộ phim khoa học viễn tưởng, hãy bắt đầu bằng cách thử nghiệm với một số mô hình đơn giản và truyền thống (ví dụ: rừng ngẫu nhiên) để làm quen với phần mềm.
Với điều đó, hãy đi thẳng vào một số cách mà các doanh nghiệp có thể kết hợp công nghệ học sâu trong khi chỉ có quyền truy cập vào dữ liệu hạn chế.
#1- Tinh chỉnh mô hình cơ sở:
Como chúng tôi đã đề cập ở trên, bước đầu tiên mà các doanh nghiệp cần thực hiện sau khi đã xây dựng một mô hình học sâu cơ bản đơn giản là tinh chỉnh nó cho vấn đề cụ thể đang được giải quyết.
Tuy nhiên, việc tinh chỉnh một mô hình cơ sở nghe có vẻ khó hơn trên giấy so với thực tế. Ý tưởng cơ bản đằng sau việc tinh chỉnh một tập dữ liệu lớn để đáp ứng nhu cầu cụ thể của một doanh nghiệp là đơn giản – bạn lấy một tập dữ liệu lớn, có một số điểm tương đồng với lĩnh vực bạn hoạt động, và sau đó tinh chỉnh các chi tiết của tập dữ liệu gốc bằng dữ liệu hạn chế của bạn.
Về việc có được tập dữ liệu lớn, các chủ doanh nghiệp có thể dựa vào ImageNet, cung cấp một giải pháp dễ dàng cho các vấn đề phân loại hình ảnh. Tập dữ liệu được lưu trữ bởi ImageNet cho phép các tổ chức truy cập vào hàng triệu hình ảnh, được chia thành nhiều lớp hình ảnh, có thể hữu ích cho các doanh nghiệp từ nhiều lĩnh vực khác nhau, bao gồm nhưng không giới hạn ở hình ảnh động vật, v.v.
Nếu quá trình tinh chỉnh một mô hình đã được đào tạo trước để phù hợp với nhu cầu cụ thể của tổ chức của bạn vẫn còn quá phức tạp, chúng tôi khuyên bạn nên tìm kiếm sự giúp đỡ từ internet, vì một tìm kiếm đơn giản trên Google sẽ cung cấp cho bạn hàng trăm hướng dẫn về cách tinh chỉnh một tập dữ liệu.
#2- Thu thập thêm dữ liệu:
Mặc dù điểm thứ hai trong danh sách của chúng tôi có thể có vẻ thừa thãi đối với một số độc giả hoài nghi của chúng tôi, nhưng thực tế vẫn còn – khi nói đến học sâu, tập dữ liệu càng lớn, bạn càng có khả năng đạt được kết quả chính xác hơn.
Mặc dù bản chất của bài viết này nằm ở việc cung cấp cho các doanh nghiệp một tập dữ liệu hạn chế, chúng tôi đã thường xuyên gặp phải những “người đứng đầu” coi việc đầu tư vào việc thu thập dữ liệu tương đương với việc phạm một tội lỗi.
Đó là một thực tế phổ biến rằng các doanh nghiệp có xu hướng bỏ qua lợi ích của học sâu chỉ vì họ không sẵn sàng đầu tư thời gian và công sức vào việc thu thập dữ liệu. Nếu doanh nghiệp của bạn không chắc chắn về lượng dữ liệu cần thu thập, chúng tôi khuyên bạn nên vẽ các đường học tập, khi dữ liệu bổ sung được tích hợp vào mô hình, và quan sát sự thay đổi trong hiệu suất của mô hình.
Trái với niềm tin phổ biến được nhiều CSO và CISO nắm giữ, đôi khi cách tốt nhất để giải quyết vấn đề là thông qua việc thu thập thêm dữ liệu liên quan. Vai trò của CSO và CISO rất quan trọng trong trường hợp này vì luôn có nguy cơ bị tấn công mạng. Năm 2019, tổng chi tiêu toàn cầu cho an ninh mạng lên tới 103,1 tỷ USD, và con số này tiếp tục tăng. Để đặt điều này vào góc nhìn, hãy xem xét một ví dụ đơn giản – giả sử bạn đang cố gắng phân loại kim cương hiếm, nhưng chỉ có một tập dữ liệu hạn chế. Theo giải pháp rõ ràng nhất cho vấn đề, thay vì tận hưởng mô hình cơ sở, hãy thu thập thêm dữ liệu!
#3- Tăng cường dữ liệu:
Mặc dù hai điểm đầu tiên chúng tôi đã thảo luận ở trên đều rất hiệu quả trong việc cung cấp một giải pháp dễ dàng cho hầu hết các vấn đề liên quan đến việc triển khai học sâu vào các doanh nghiệp có tập dữ liệu nhỏ, chúng phụ thuộc rất nhiều vào may mắn để giải quyết vấn đề.
Nếu bạn không thể thành công trong việc tinh chỉnh một tập dữ liệu hiện có, chúng tôi khuyên bạn nên thử tăng cường dữ liệu. Cách thực hiện tăng cường dữ liệu rất đơn giản. Thông qua quá trình tăng cường dữ liệu, tập dữ liệu đầu vào được thay đổi hoặc tăng cường theo cách mà nó tạo ra một đầu ra mới, mà không thực sự thay đổi giá trị nhãn.
Để đưa ý tưởng về tăng cường dữ liệu vào góc nhìn cho độc giả của chúng tôi, hãy xem xét một bức ảnh của một con chó. Khi được xoay, người xem ảnh vẫn có thể nhận ra đó là ảnh của một con chó. Đây chính xác là những gì tăng cường dữ liệu tốt hy vọng đạt được, so với một ảnh của con đường được xoay, thay đổi góc độ và để lại nhiều không gian cho thuật toán học sâu đi đến một kết luận không chính xác và đánh bại mục đích của việc triển khai học sâu.
Khi nói đến việc giải quyết các vấn đề liên quan đến phân loại hình ảnh, tăng cường dữ liệu đóng vai trò quan trọng trong lĩnh vực này và cung cấp nhiều kỹ thuật tăng cường dữ liệu giúp mô hình học sâu có được sự hiểu biết sâu sắc về các phân loại hình ảnh khác nhau.
Hơn nữa, khi nói đến việc tăng cường dữ liệu – các khả năng gần như vô tận. Các doanh nghiệp có thể triển khai tăng cường dữ liệu theo nhiều cách, bao gồm NLP và thí nghiệm GAN, cho phép thuật toán tạo ra dữ liệu mới.
#4- Triển khai hiệu ứng tập thể:
Công nghệ học sâu quy định rằng mạng được xây dựng trên nhiều lớp. Tuy nhiên, trái với niềm tin phổ biến được nhiều người nắm giữ, thay vì xem mỗi lớp như một “hàng cấp bậc ngày càng tăng” của các tính năng, lớp cuối cùng phục vụ mục đích cung cấp một cơ chế tập thể.
Niềm tin rằng các doanh nghiệp có quyền truy cập vào một tập dữ liệu hạn chế hoặc nhỏ nên chọn xây dựng mạng của họ sâu cũng được chia sẻ trong một bài viết NIPs, phản ánh niềm tin chúng tôi đã thể hiện ở trên. Các doanh nghiệp với tập dữ liệu nhỏ có thể dễ dàng thao túng hiệu ứng tập thể để có lợi cho họ, chỉ bằng cách xây dựng mạng học sâu của họ sâu, thông qua tinh chỉnh hoặc một số phương pháp thay thế.
#5- Tích hợp mã hóa tự động:
Mặc dù điểm thứ năm chúng tôi đã xem xét có được một mức độ thành công tương đối – chúng tôi vẫn ủng hộ việc sử dụng mã hóa tự động để tiền đào tạo một mạng và khởi tạo mạng một cách chính xác.
Một trong những lý do lớn nhất, ngoài các cuộc tấn công mạng, tại sao các doanh nghiệp không thể vượt qua các rào cản ban đầu của việc tích hợp học sâu là do khởi tạo kém, và nhiều cạm bẫy của nó. Đào tạo không giám sát thường dẫn đến thực hiện kém hoặc không chính xác công nghệ học sâu, nơi mã hóa tự động có thể tỏa sáng.
Ý tưởng cơ bản đằng sau một mạng nơ-ron quy định việc tạo ra một mạng nơ-ron dự đoán bản chất của tập dữ liệu được nhập. Nếu bạn không chắc chắn về cách sử dụng một mã hóa tự động, có nhiều hướng dẫn trực tuyến cung cấp hướng dẫn rõ ràng.
Kết luận:
Vào cuối bài viết, chúng tôi muốn tái khẳng định những gì chúng tôi đã nói trong suốt bài viết, với một bổ sung – tích hợp kiến thức lĩnh vực cụ thể vào quá trình học tập! Không chỉ việc tích hợp kiến thức quý giá giúp tăng tốc quá trình học tập, mà nó cũng cho phép công nghệ học sâu tạo ra kết quả tốt hơn và chính xác hơn.












