Myslitelé
Příprava lidských dat pro strojové učení je náročná na zdroje: Tyto dva přístupy jsou kritické pro snížení nákladů

Autor: Dattaraj Rao, Chief Data Scientist, Persistent Systems
Stejně jako u každého systému, který závisí na vstupních datech, je strojové učení (ML) závislé na axiomu „špatný vstup – špatný výstup“. Čisté a přesně označené údaje jsou základem pro vytvoření jakéhokoli modelu ML. Algoritmus pro školení ML rozumí vzorcům z ground-truth dat a z nich se učí, jak generalizovat na neviditelná data. Pokud je kvalita vašich trénovacích dat nízká, bude velmi obtížné pro algoritmus ML, aby neustále učil a extrapoloval.
Přemýšlejte o tom v souvislosti s trénováním psa. Pokud selháte v řádném tréninku psa s fundamentálními behaviorálními příkazy (vstupy) nebo to děláte nesprávně/neprecizně, nikdy nemůžete očekávat, že pes naučí a expanduje prostřednictvím pozorování do složitějších pozitivních chování, protože základní vstupy byly chybějící nebo vadné od začátku. Řádný trénink je časově náročný a dokonce i nákladný, pokud si přizvete odborníka, ale odměna je velká, pokud to uděláte správně od začátku.
Při tréninku modelu ML je vytvoření kvalitních dat vyžaduje, aby odborník z domény strávil čas označováním dat. To může zahrnovat výběr okna s požadovaným objektem na obrázku nebo přiřazení štítku k textu nebo záznamu v databázi. Zvláště pro nestrukturovaná data, jako jsou obrázky, videa a text, hraje kvalita označování velkou roli při určování kvality modelu. Obvykle je nelabelovaných dat, jako surových obrázků a textu, hojné – ale označování je tam, kde je třeba optimalizovat úsilí. To je část lidského zapojení do životního cyklu ML a obvykle je to nejdražší a nejnáročnější část jakéhokoli projektu ML.
Nástroje pro označování dat, jako jsou Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS a DataRobot human-in-the-loop, se neustále zlepšují a poskytují intuitivní rozhraní pro odborníky z domény. Nicméně minimalizace času, který odborníci z domény potřebují k označování dat, je stále významnou výzvou pro podniky dnes – zejména v prostředí, kde je talent pro datové vědy omezený, ale zároveň velmi žádaný. To je místo, kde přicházejí do hry dva nové přístupy k přípravě dat.
Aktivní učení
Aktivní učení je metoda, při které model ML aktivně dotazuje odborníka z domény na konkrétní označení. Zde se zaměřujeme ne na získání úplného označení nelabelovaných dat, ale pouze na získání správných datových bodů, aby model mohl lépe učit. Vzít například zdravotnictví a životní vědy, diagnostickou společnost, která se specializuje na časnou detekci rakoviny, aby pomohla klinickým pracovníkům učinit informovaná data-riziková rozhodnutí o péči o pacienty. Jako součást svého diagnostického procesu potřebují označit CT skenovací obrázky s tumory, které je třeba zvýraznit.
Po tom, co se model ML naučí z několika obrázků s označenými tumory, aktivní učení model poté požádá uživatele o označení pouze těch obrázků, u kterých je model nejistý o přítomnosti tumoru. Tyto budou hraniční body, které, když budou označeny, zvýší důvěru modelu. Tam, kde je model jistý nad určitou prahovou hodnotou, provede samo-označení, místo aby žádal uživatele o označení. To je způsob, jak aktivní učení snaží pomoci budovat přesné modely, zatímco snižuje čas a úsilí potřebné k označení dat. Rámcové modAL mohou pomoci zvýšit klasifikační výkon inteligentním dotazováním odborníků z domény na označení nejvíce informativních instancí.
Slabá supervize
Slabá supervize je přístup, při kterém se používají šumivé a nepřesné údaje nebo abstraktní koncepty k poskytování indikací pro označení velkého množství nesupervizovaných dat. Tento přístup obvykle využívá slabých označníků a snaží se je kombinovat v ensemble přístupu k vytvoření kvalitních označených dat. Úsilí je zaměřeno na začlenění znalostí domény do automatizované označní činnosti.
Příklad: Pokud by poskytovatel internetových služeb (ISP) potřeboval systém pro označení e-mailových dat jako spam nebo ne-spam, mohli bychom napsat slabá pravidla, jako je kontrola frází, jako „nabídka“, „blahopřání“, „zdarma“ atd., které jsou většinou spojeny se spamovými e-maily. Další pravidla by mohla být e-maily z konkrétních vzorců zdrojových adres, které lze vyhledat pomocí regulárních výrazů. Tato slabá funkce by mohla být poté kombinována rámcem slabé supervize, jako je Snorkel a Skweak, aby se vytvořila vylepšená kvalita trénovacích dat.
Strojové učení je ve své podstatě o pomoci společnostem škálovat procesy exponenciálně způsoby, které jsou fyzicky nemožné dosáhnout ručně. Nicméně strojové učení není magie a stále závisí na lidech, aby a) nastavili a trénovali modely správně od začátku a b) zasáhli, když je třeba, aby se ujistili, že model se nestane tak zkreslený, že výsledky již nejsou užitečné a mohou být sogar kontraproduktivní nebo negativní.
Cílem je najít způsoby, které pomohou streamlinovat a automatizovat části lidského zapojení, aby se zvýšil čas na trh a výsledky, zatímco se zůstává v rámci optimální přesnosti. Je všeobecně uznáváno, že získání kvalitních označených dat je nejdražší, ale extrémně důležitou částí projektu ML. To je evoluční prostor a mnoho úsilí je nyní zaměřeno na snížení času stráveného odborníky z domény a zlepšení kvality označení dat. Prozkoumání a využití aktivního učení a slabé supervize je solidní strategie pro dosažení tohoto cíle napříč několika průmyslovými odvětvími a použitími.












