Лідери думок

Підготовка людських даних для машинного навчання – ресурсоємкий процес: ці дві підходи критичні для зниження витрат

mm
Додайте Unite.AI до бажаних джерел у Google

Автор: Даттарах Рао, Головний вчений-дата, Persistent Systems

Як і будь-яка система, що залежить від даних, машинне навчання (ML) підпорядковується аксіомі “сміття-всміття”. Чисті та точно позначені дані є основою для побудови будь-якої моделі ML. Алгоритм навчання ML розпізнає закономірності з фактичних даних і навчається генералізовувати на невидимих даних. Якщо якість ваших тренувальних даних низька, то алгоритму ML буде дуже важко продовжувати навчання та екстраполювати.

Подумайте про це в термінах навчання домашньої тварини. Якщо ви не зможете належним чином навчити тварину основним поведінковим командам (вхідними даними) або зробите це неправильно/неточно, ви ніколи не зможете очікувати, що тварина навчиться та розширить свої знання через спостереження за більш складними позитивними поведінками, оскільки основні входи були відсутні або мали помилки з самого початку. Правильне навчання потребує часу та може бути дорого, якщо ви залучите експерта, але результат буде великим, якщо ви все зробите правильно з самого початку.

Під час навчання моделі ML створення якісних даних вимагає від експерта-доменіста витратити час на позначення даних. Це може включати вибір вікна з бажаним об’єктом на зображенні або призначення мітки для текстового входу чи запису бази даних. Особливо для неструктурованих даних, таких як зображення, відео та текст, якість позначення відіграє велику роль у визначенні якості моделі. Зазвичай, незапозначені дані, такі як сирі зображення та текст, є надлишковими, але позначення – це місце, де потрібно оптимізувати зусилля. Це частина людського циклу в життєвому циклі ML і зазвичай є найбільш дорогим та трудомістким етапом будь-якого проекту ML.

Інструменти позначення даних, такі як Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS та DataRobot human-in-the-loop, постійно покращуються та забезпечують інтуїтивні інтерфейси для експертів-доменістів. Однак мінімалізація часу, необхідного експертам-доменістам для позначення даних, все ще залишається значною проблемою для підприємств сьогодні – особливо в середовищі, де таланти даних обмежені, але знаходяться у високому попиті. Саме тут на сцену виходять два нових підходи до підготовки даних.

Активне навчання

Активне навчання – це метод, при якому модель ML активно запитує у експерта-доменіста конкретні позначення. Тут увага зосереджена не на отриманні повного позначення незапозначених даних, а лише на отриманні правильних даних, щоб модель могла краще навчатися. Наприклад, у сфері охорони здоров’я та наук про життя діагностична компанія, що спеціалізується на ранньому виявленні раку, щоб допомогти клініцистам приймати обґрунтовані рішення щодо лікування пацієнтів. У рамках процесу діагностики їм потрібно позначити зображення комп’ютерної томографії з пухлинами, які потрібно виділити.

Після того, як модель ML навчається на декількох зображеннях з позначеними пухлинами, активне навчання моделі запитує у користувачів позначення лише тих зображень, де вона не впевнена у присутності пухлини. Це будуть граничні точки, які, коли позначені, збільшать впевненість моделі. Там, де модель впевнена вище певного порогу, вона сама позначить дані, а не попросить користувача зробити це. Таким чином, активне навчання намагається допомогти побудувати точні моделі, зменшуючи час та зусилля, необхідні для позначення даних. Фреймворки, такі як modAL, можуть допомогти підвищити якість класифікації, інтелектуально запитуючи у експертів-доменістів позначення найбільш інформативних екземплярів.

Слабке наглядання

Слабке наглядання – це підхід, при якому використовуються шумні та неточні дані або абстрактні концепції для надання вказівок щодо позначення великої кількості незапозначених даних. Цей підхід зазвичай використовує слабкі позначувачі та намагається поєднати їх у ансамблевому підході для побудови якісних позначених даних. Зусилля спрямовані на включення знань домену в автоматизовану діяльність позначення.

Наприклад, якщо інтернет-провайдер需要 систему для позначення наборів електронної пошти як спам чи не спам, ми могли б написати слабкі правила, такі як перевірка фраз, таких як “пропозиція”, “вітання”, “безкоштовно” тощо, які переважно асоціюються зі спам-повідомленнями. Інші правила могли б бути поштовими адресами від конкретних шаблонів джерел, які можна знайти за допомогою регулярних виразів. Ці слабкі функції можна було б поєднати за допомогою слабкого нагляду фреймворку, такого як Snorkel і Skweak, для побудови покращених якісних тренувальних даних.

ML у своєму ядрі полягає в тому, щоб допомогти компаніям масштабувати процеси експоненційно тим способами, які фізично неможливо досягти вручну. Однак ML не є магією і все ще залежить від людей, щоб а) правильно налаштувати та натренувати моделі з самого початку і б) втрутитися, коли це необхідно, щоб модель не стала настільки знівеченою, що результати будуть не тільки не корисними, але й контрпродуктивними чи негативними.

Мета полягає в тому, щоб знайти способи, які допоможуть оптимізувати та автоматизувати частини людського втручання, щоб збільшити час виходу на ринок та результати, але при цьому залишатися в межах оптимальної точності. Всесвітньо визнано, що отримання якісних позначених даних є найбільш дорогим, але надзвичайно важливим етапом будь-якого проекту ML. Це еволюційна галузь, і зараз багато зусиль спрямовано на зменшення часу, витраченого експертами-доменістами, та покращення якості позначення даних. Розгляд та використання активного навчання та слабкого нагляду є солідною стратегією для досягнення цього в різних галузях та випадках застосування.

Dattaraj Rao, Головний науковець даних у Persistent Systems, є автором книги “Keras to Kubernetes: Подорож моделі машинного навчання у виробництво.” У Persistent Systems Dattaraj очолює лабораторію досліджень штучного інтелекту, яка досліджує найновіші алгоритми у галузі комп'ютерного зору, розуміння природної мови, ймовірнісного програмування, навчання з підкріпленням, пояснюваного штучного інтелекту тощо та демонструє їх застосування у галузі охорони здоров'я, банківської справи та промисловості. Dattaraj має 11 патентів у галузі машинного навчання та комп'ютерного зору.