Nền tảng AI

Mô hình học máy sẵn có so với mô hình học máy tùy chỉnh?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khi nào xây dựng tốt hơn mua giải pháp sẵn có?

Các công ty có thể tham gia vào các phương pháp phát triển mô hình khác nhau. Từ các dịch vụ học máy được quản lý hoàn toàn, tất cả các cách đến các mô hình tùy chỉnh. Tùy thuộc vào yêu cầu kinh doanh, chuyên môn có sẵn và các hạn chế về kế hoạch, họ phải đưa ra quyết định: họ nên phát triển các giải pháp tùy chỉnh từ đầu? Hay họ nên chọn một dịch vụ sẵn có?

Đối với tất cả các giai đoạn của công việc học máy, một quyết định phải được đưa ra về cách các mảnh ghép khác nhau sẽ phù hợp với nhau. Từ thu thập dữ liệu, chuẩn bị và trực quan hóa, tất cả các cách đến kỹ thuật tính năng, đào tạo mô hình và đánh giá, các kỹ sư học máy liên tục tự hỏi mình câu hỏi相同: Liệu nó sẽ là một giải pháp được thực hiện tùy chỉnh, được viết và phát triển từ đầu? Hay nó sẽ là một dịch vụ sẵn có?

Nhưng khi nào xây dựng tốt hơn mua giải pháp sẵn có? Các yếu tố phân biệt chính giữa hai phương pháp: nỗ lực tiền xử lý, tốc độ phát triển và chuyên môn yêu cầu.

Các yếu tố cần xem xét khi quyết định sử dụng mô hình học máy sẵn có hoặc mô hình học máy tùy chỉnh?

Nỗ lực tiền xử lý

Các dự án học máy đang đối mặt với tất cả các loại thách thức, nhưng có lẽ thách thức lớn nhất là sự sẵn có của dữ liệu đào tạo. Thiếu dữ liệu đào tạo có thể dừng một dự án trước khi nó thậm chí bắt đầu. Trước khi một dự án thậm chí bắt đầu, nó có thể phải đối mặt với các chi phí tiền xử lý đáng kể từ việc thu thập dữ liệu, gắn nhãn dữ liệu, làm sạch và tiền xử lý. Đây là cái bẫy nổi tiếng mà nhiều dự án học máy thất bại: tiền xử lý kết thúc chiếm 80% tài nguyên được phân bổ, trong khi rất ít tài nguyên còn lại cho việc đào tạo và đánh giá mô hình thực tế.

Các giải pháp sẵn có giảm bớt căng thẳng và khó khăn của nỗ lực tiền xử lý. Chúng được xây dựng để thực hiện các hoạt động phổ biến nhất với chỉ một chút cấu hình yêu cầu. Điều tốt nhất về chúng là: các giải pháp sẵn có tồn tại cho tất cả các giai đoạn của công việc học máy.

Mặt khác, các giải pháp tùy chỉnh thường yêu cầu nhiều nỗ lực tiền xử lý hơn. Điều đó không có nghĩa là chúng cần được loại bỏ hoàn toàn: chúng vẫn được yêu cầu để tinh chỉnh một giai đoạn học máy nhất định đến các chi tiết của vấn đề được giải quyết. Một tập dữ liệu đặc biệt bẩn có thể yêu cầu một số quy tắc làm sạch đặc biệt. Đồng thời, một tập tính năng cụ thể có thể yêu cầu kỹ thuật tính năng tùy chỉnh, cũng như kiến trúc mạng nơ-ron có thể yêu cầu điều chỉnh nhẹ. Trong trường hợp này, các giải pháp tùy chỉnh được xây dựng từ đầu có khả năng đáp ứng tất cả các nhu cầu.

Tốc độ phát triển

Các giải pháp sẵn có tập trung vào cấu hình hơn là thực hiện. Thay vì phân bổ tài nguyên để tìm ra điều gì nên được thực hiện, các nhóm học máy sẽ tập trung vào làm thế nào các mảnh ghép khác nhau sẽ phù hợp với nhau. Cách tiếp cận này cho phép các công ty, nhà nghiên cứu và kỹ sư nhanh chóng thực hiện các nguyên mẫu và bằng chứng về khái niệm. Thay vì tái tạo bánh xe, các giải pháp sẵn có cho phép tận dụng kiến thức hiện có, do đó tiết kiệm thời gian phát triển.

Các giải pháp tùy chỉnh được thực hiện từ đầu được biết đến là chậm hơn về tốc độ phát triển. Điều này là do nhu cầu bảo trì tăng của chúng: các kỹ sư phải tìm ra cả điều gìlàm thế nào của giải pháp. Tương tự, giải pháp phức tạp hơn, thời gian tài nguyên cần thiết để đảm bảo khả năng mở rộng và sẵn sàng của nó trong khi sản xuất. Từ góc độ này, các giải pháp tùy chỉnh và nỗ lực thời gian là tỷ lệ thuận: giải pháp càng phức tạp, càng yêu cầu nhiều thời gian.

Thông thường, tuy nhiên, sự thật nằm ở giữa: một cơ sở mã hiện có sẽ được tái cấu trúc và thích nghi với nhu cầu của dự án hiện tại. Điều này là trường hợp của phương pháp đào tạo mô hình chuyển giao nổi tiếng.

Chuyên môn

Giống như có nhiều lớp tại đó Học máy được thực hiện, có nhiều cấp độ chuyên môn tại đó các mô hình học máy có thể được phát triển, từ các giao diện không cần mã đến xây dựng mô hình từ đầu.

Các giải pháp sẵn có tồn tại mà rất ít chuyên môn học máy là cần thiết. Bằng cách sử dụng các giao diện trực quan và thậm chí các phương pháp kéo và thả, nó đã trở nên rất đơn giản cho bất kỳ ai (từ các nhà phân tích kinh doanh đến các kỹ sư phần mềm) để xây dựng và triển khai một số loại mô hình học máy. Mặc dù cách tiếp cận đơn giản này đến phát triển mô hình có thể hoạt động cho mục đích nguyên mẫu, nó không thể đáp ứng các yêu cầu của hệ thống sản xuất.

Chuyên môn vẫn được yêu cầu để cấu hình, thiết lập và bảo trì các giải pháp sẵn có trong sản xuất. Các giải pháp thay thế, vá lỗi, kết nối với các giao diện API khác nhau và giải quyết các vấn đề triển khai là các nhiệm vụ phổ biến được yêu cầu để đảm bảo hiệu suất của mô hình trong môi trường sản xuất.

Các giải pháp tùy chỉnh thường được thực hiện ở mức cơ sở hạ tầng và không có cách nào khác: chuyên môn chắc chắn là cần thiết. Tùy thuộc vào quy mô công ty và mục tiêu dự án, các đội đa chức năng có thể được yêu cầu để duy trì các hệ thống sản xuất. Các nhà khoa học dữ liệu, kỹ sư học máy và các nhà phân tích kinh doanh cùng nhau để hiểu kết quả suy luận và duy trì các mô hình sản xuất.

Nên sử dụng gì: mô hình học máy sẵn có hay mô hình học máy tùy chỉnh?

Một giải pháp học máy sẽ được xây dựng từ nhiều thành phần và dịch vụ riêng lẻ cần phải kết hợp thành một giải pháp gắn kết. Nó không bao giờ là về việc đi 100% tùy chỉnh hoặc đi 100% sẵn có vì các vấn đề kinh doanh khác nhau yêu cầu các giải pháp khác nhau. Hầu hết thời gian, các giải pháp dựa trên học máy được xây dựng bằng cách kết hợp cả hai: các dịch vụ sẵn có để trích xuất thông tin chung, kết hợp với các mô hình tùy chỉnh để tăng độ chính xác và mô hình hóa kiến thức cụ thể của miền.

Bí quyết là biết khi nào thực hiện các giải pháp tùy chỉnh từ đầu và哪 phần của dự án có thể tận dụng lợi ích của các dịch vụ sẵn có. Điều này phụ thuộc rất nhiều vào loại vấn đề được giải quyết, yêu cầu kinh doanh, dữ liệu có sẵn và các hạn chế tổng thể của môi trường phát triển.

Để biết thêm về AI và xu hướng công nghệ, xem Josh Miramant, CEO của Blue Orange Digital’s các giải pháp dựa trên dữ liệu cho Chuỗi cung ứng, Tự động hóa tài liệu chăm sóc sức khỏe, và nhiều hơn nữa.

Bạn cũng có thể thích:

Sử dụng NLP để phân loại bình luận trên mạng xã hội

Cách xử lý ngôn ngữ được cải thiện thông qua mô hình BERT mã nguồn mở của Google (GOOGL )

Josh Miramant là CEO và người sáng lập của Blue Orange Digital, một cơ quan hàng đầu về khoa học dữ liệu và học máy có văn phòng tại New York City và Washington DC. Miramant là một diễn giả nổi tiếng, nhà tương lai học và là cố vấn chiến lược kinh doanh và công nghệ cho các công ty doanh nghiệp và khởi nghiệp. Ông giúp các tổ chức tối ưu hóa và tự động hóa kinh doanh của họ, triển khai các kỹ thuật phân tích dựa trên dữ liệu và hiểu được ý nghĩa của các công nghệ mới như trí tuệ nhân tạo, dữ liệu lớn và Internet của vạn vật.