Lãnh đạo tư tưởng

Chuẩn bị Dữ liệu Con người cho Học máy là Tốn nhiều Tài nguyên: Hai Phương pháp này là then chốt để Giảm Chi phí

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

By: Dattaraj Rao, Chief Data Scientist, Persistent Systems

Giống như bất kỳ hệ thống nào phụ thuộc vào dữ liệu đầu vào, Học máy (ML) phải tuân theo nguyên tắc “rác vào – rác ra”. Dữ liệu sạch và được dán nhãn chính xác là nền tảng để xây dựng bất kỳ mô hình ML nào. Một thuật toán đào tạo ML hiểu các mẫu từ dữ liệu thực tế và từ đó, học cách tổng quát hóa trên dữ liệu chưa từng thấy. Nếu chất lượng dữ liệu đào tạo của bạn thấp, thì sẽ rất khó khăn để thuật toán ML liên tục học hỏi và suy diễn.

Hãy nghĩ về nó theo cách đào tạo một con chó. Nếu bạn không đào tạo con chó một cách chính xác với các lệnh hành vi cơ bản (đầu vào) hoặc làm điều đó không chính xác / không chính xác, bạn không bao giờ có thể mong đợi con chó học hỏi và mở rộng thông qua quan sát vào các hành vi tích cực phức tạp hơn vì các đầu vào cơ bản ban đầu là không có hoặc có lỗi, để bắt đầu. Đào tạo đúng cách là tốn thời gian và thậm chí tốn kém nếu bạn đưa một chuyên gia vào, nhưng phần thưởng là rất lớn nếu bạn làm điều đó từ đầu.

Khi đào tạo một mô hình ML, việc tạo ra dữ liệu chất lượng đòi hỏi một chuyên gia lĩnh vực phải dành thời gian để dán nhãn dữ liệu. Điều này có thể bao gồm việc chọn một cửa sổ với đối tượng mong muốn trong một hình ảnh hoặc gán một nhãn cho một mục nhập văn bản hoặc một bản ghi cơ sở dữ liệu. Đặc biệt là với dữ liệu không cấu trúc như hình ảnh, video và văn bản, chất lượng dán nhãn đóng vai trò quan trọng trong việc xác định chất lượng mô hình. Thông thường, dữ liệu không có nhãn như hình ảnh thô và văn bản là dồi dào – nhưng dán nhãn là nơi nỗ lực cần được tối ưu hóa. Đây là phần con người trong vòng đời của ML và thường là phần tốn kém và tốn thời gian nhất của bất kỳ dự án ML nào.

Công cụ dán nhãn dữ liệu như Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS và DataRobot human-in-the-loop不断 được cải thiện về chất lượng và cung cấp giao diện trực quan cho các chuyên gia lĩnh vực. Tuy nhiên, việc giảm thiểu thời gian cần thiết bởi các chuyên gia lĩnh vực để dán nhãn dữ liệu vẫn là một thách thức đáng kể cho các doanh nghiệp ngày nay – đặc biệt là trong một môi trường mà tài năng khoa học dữ liệu bị giới hạn nhưng lại rất được săn đón. Đây là nơi hai phương pháp mới để chuẩn bị dữ liệu được áp dụng.

Học tập Chủ động

Học tập chủ động là một phương pháp mà mô hình ML chủ động yêu cầu một chuyên gia lĩnh vực về các bản ghi cụ thể. Ở đây, trọng tâm không phải là nhận được một bản ghi hoàn chỉnh trên dữ liệu không có nhãn, mà chỉ nhận được các điểm dữ liệu được dán nhãn đúng cách để mô hình có thể học hỏi tốt hơn. Ví dụ, trong lĩnh vực chăm sóc sức khỏe và khoa học đời sống, một công ty chẩn đoán chuyên về việc phát hiện sớm ung thư để giúp các bác sĩ đưa ra quyết định dựa trên dữ liệu. Trong quá trình chẩn đoán, họ cần dán nhãn hình ảnh quét CT với các khối u cần được突出.

Sau khi mô hình ML học hỏi từ một vài hình ảnh với các khối u được đánh dấu, với học tập chủ động, mô hình sẽ chỉ yêu cầu người dùng dán nhãn hình ảnh nơi nó không chắc chắn về sự hiện diện của một khối u. Những điểm này sẽ là các điểm ranh giới, khi được dán nhãn sẽ tăng cường sự tự tin của mô hình. Ở nơi mô hình tự tin trên một ngưỡng nhất định, nó sẽ tự dán nhãn thay vì yêu cầu người dùng dán nhãn. Đây là cách học tập chủ động cố gắng xây dựng các mô hình chính xác trong khi giảm thiểu thời gian và nỗ lực cần thiết để dán nhãn dữ liệu. Các khuôn khổ như modAL có thể giúp tăng cường hiệu suất phân loại bằng cách yêu cầu thông minh các chuyên gia lĩnh vực dán nhãn các trường hợp thông tin nhất.

Giám sát Yếu

Giám sát yếu là một phương pháp mà dữ liệu ồn ào và không chính xác hoặc các khái niệm trừu tượng có thể được sử dụng để cung cấp các chỉ dẫn cho việc dán nhãn một lượng lớn dữ liệu không được giám sát. Phương pháp này thường sử dụng các trình dán nhãn yếu và cố gắng kết hợp chúng trong một phương pháp tổng hợp để xây dựng dữ liệu được dán nhãn chất lượng. Nỗ lực là để cố gắng kết hợp kiến thức lĩnh vực vào một hoạt động dán nhãn tự động.

Ví dụ, nếu một Nhà cung cấp Dịch vụ Internet (ISP) cần một hệ thống để đánh dấu tập dữ liệu email là spam hoặc không phải spam, chúng ta có thể viết các quy tắc yếu như kiểm tra các cụm từ như “đề xuất”, “chúc mừng”, “miễn phí”, v.v., thường được liên kết với email spam. Các quy tắc khác có thể là email từ các mẫu địa chỉ nguồn cụ thể có thể được tìm kiếm bằng biểu thức chính quy. Các hàm yếu này sau đó có thể được kết hợp bởi một khuôn khổ giám sát yếu như Snorkel và Skweak để xây dựng dữ liệu đào tạo chất lượng cao hơn.

Học máy ở cốt lõi là về việc giúp các công ty mở rộng quy trình theo cấp số nhân theo cách không thể đạt được thủ công. Tuy nhiên, Học máy không phải là ma thuật và vẫn phụ thuộc vào con người để a) thiết lập và đào tạo các mô hình một cách chính xác từ đầu và b) can thiệp khi cần thiết để đảm bảo mô hình không trở nên quá lệch đến mức kết quả không còn hữu ích và có thể phản tác dụng hoặc tiêu cực.

Mục tiêu là tìm cách giúp tự động hóa và tối ưu hóa các phần của sự tham gia con người để tăng thời gian đưa ra thị trường và kết quả nhưng vẫn giữ trong giới hạn của độ chính xác tối ưu. Điều được chấp nhận rộng rãi là việc có được dữ liệu được dán nhãn chất lượng là phần tốn kém nhất nhưng cực kỳ quan trọng của một dự án Học máy. Đây là một không gian đang phát triển, và rất nhiều nỗ lực đang được thực hiện để giảm thời gian dành bởi các chuyên gia lĩnh vực và cải thiện chất lượng của các bản ghi dữ liệu. Việc khám phá và tận dụng học tập chủ động và giám sát yếu là một chiến lược vững chắc để đạt được điều này trên nhiều ngành và trường hợp sử dụng.

Dattaraj Rao, Chief Data Scientist tại Persistent Systems, là tác giả của cuốn sách “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Tại Persistent Systems, Dattaraj lãnh đạo AI Research Lab khám phá các thuật toán tiên tiến trong Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI, v.v. và chứng minh tính khả dụng trong lĩnh vực Y tế, Ngân hàng và Công nghiệp. Dattaraj có 11 bằng sáng chế trong Machine Learning và Computer Vision.