Modely a platformy AI

data2vec: Milník v oblasti samořízeného učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Modely strojového učení se tradičně spoléhaly na označená data pro školení a tradičně řečeno, školení modelů na označených datech vede k přesným výsledkům. Nicméně, hlavní nevýhodou použití označených dat jsou vysoké náklady na anotaci, které rostou s velikostí školicích dat. Vysoké náklady na anotaci jsou velkou překážkou pro vývojáře, zejména při práci na velkém projektu se značným množstvím školicích dat.

Aby se vyřešil problém s anotací, vývojáři přišli s konceptem SSL nebo samořízeného učení. Samořízené učení je proces strojového učení, při kterém se model učí sám na základě části vstupních dat. Model samořízeného učení se snaží využít vztah mezi daty místo použití označených dat.

Kromě samořízeného učení existují další metody a modely pro školení modelů strojového učení bez použití označených dat. Nicméně, většina těchto metod má dvě hlavní problémy

  1. Často jsou specializovány pro jednu modalitu, jako je obraz nebo text.
  2. Vyžadují velké množství výpočetního výkonu.

Tyto omezení jsou velkou překážkou, proč lidský mozek může naučit se z jednoho typu dat mnohem účinněji ve srovnání s modelem AI, který se spoléhá na samostatné modely a školicí data pro rozlišení mezi obrazem, textem a řečí.

Aby se vyřešil problém s jednou modalitou, Meta AI vydala data2vec, první samořízený algoritmus, který se učí vzory informací z tří různých modalit: obraz, text a řeč. Díky implementaci algoritmu data2vec mohou být porozumění textu aplikována na problém segmentace obrazu nebo nasazena v úkolu rozpoznání řeči.

V tomto článku budeme hovořit o modelu data2vec podrobněji. Budeme diskutovat o metodě, související práci, architektuře a výsledcích modelu, aby jste měli jasnou představu o algoritmu data2vec.

Úvod do data2vec: Základní myšlenka

Ačkoli základní koncept samořízeného učení je aplikován napříč modalitami, skutečné cíle a algoritmy se liší, protože byly navrženy s ohledem na jednu modalitu. Navrhování modelu pro jednu modalitu je důvodem, proč stejný samořízený algoritmus nemůže fungovat účinně napříč různými typy školicích dat.

Aby se překonala výzva prezentovaná modely a algoritmy pro jednu modalitu, Meta AI vydala data2vec, algoritmus, který používá stejnou metodiku učení pro počítačové vidění, NLP nebo řeč.

Základní myšlenka za algoritmem data2vec spočívá v použití maskovaného pohledu na vstupní data pro předpověď latentních reprezentací plných vstupních dat v samo-destilovaném nastavení s pomocí standardní architektury Transformer. Takže místo modalitně specifických objektů, jako jsou obrazy, text nebo hlas, které jsou lokální povahy, algoritmus data2vec předpovídá latentní reprezentace s informacemi z celých školicích dat.

Proč potřebuje AI průmysl algoritmus data2vec?

Modely samořízeného učení vytvářejí reprezentace školicích dat pomocí lidsky anotovaných štítků a je to jeden z hlavních důvodů pokroku v NLP a počítačovém vidění. Tyto reprezentace samořízeného učení jsou důvodem, proč úkoly, jako je rozpoznání řeči a strojové učení, nasazují nesupervizované učení ve svých modelech.

Do teď se samořízené algoritmy zaměřovaly na jednotlivé modality, což vede k učení偏 a specifickým návrhům v modelech. Jednotlivé modalitně specifické samořízené algoritmy vytvářejí výzvy v různých aplikacích AI, včetně počítačového vidění a NLP.

Například existuje slovník řečových jednotek v zpracování řeči, které mohou definovat samořízený úkol v NLP. Podobně v počítačovém vidění mohou vývojáři buď regresovat vstupní data, naučit se diskrétní vizuální tokeny nebo naučit se reprezentace invariantní vůči augmentaci dat. Ačkoli tyto učení偏 jsou užitečné, je obtížné potvrdit, zda se tyto偏 generalizují na jiné modalitně.

Algoritmus data2vec je významným milníkem v oblasti samořízeného učení, protože se zaměřuje na zlepšení více modalit, nikoli pouze jedné. Kromě toho algoritmus data2vec nezávisí na rekonstrukci vstupních dat nebo kontrastivním učení.

Důvod, proč svět potřebuje data2vec, je ten, že algoritmus data2vec má potenciál urychlit pokrok v AI a přispět k vývoji modelů AI, které mohou se učit o různých aspektech svého okolí bezproblémově. Vědci doufají, že algoritmus data2vec umožní vývoj více adaptabilních modelů AI a ML, které jsou schopné provádět highly pokročilé úkoly beyond toho, co mohou dělat současné modely AI.

Co je algoritmus data2vec?

Data2vec je sjednocený rámec, který se zaměřuje na implementaci samořízeného strojového učení napříč různými datovými modalitami, včetně obrazů, řeči a textu.

Algoritmus data2vec se zaměřuje na vývoj modelů ML, které mohou se učit obecné vzory v prostředí mnohem lépe, a to udržováním učení objektu uniformního napříč různými modalitami. Model data2vec sjednocuje algoritmus učení, ale stále se učí reprezentace pro každou modalitu jednotlivě.

S vydáním algoritmu data2vec doufá Meta AI, že to bude mít za následek efektivní a jednodušší multimodální učení.

Jak funguje algoritmus data2vec?

Algoritmus data2vec kombinuje učení latentních reprezentací s maskovanou předpovědí, ačkoli používá více síťových vrstev jako cíle pro generalizaci latentních reprezentací. Model specificky trénuje síť Transformer, která je pak použita buď v učitel nebo student režimu.

V režimu učitele model nejprve vytváří reprezentace vstupních dat, které slouží jako cíle v úkolu učení. V režimu studenta model kóduje maskovanou verzi vstupních dat, která je pak použita pro předpověď plných datových reprezentací.

Obrázek výše reprezentuje, jak model data2vec používá stejný proces učení pro různé modalitně. V prvním kroku model vytváří reprezentace vstupních dat (učitel režim). Model pak regresuje tyto reprezentace na základě maskované verze vstupních dat.

Kromě toho, protože algoritmus data2vec používá latentní reprezentace vstupních dat, může být považován za zjednodušenou verzi modalitně specifických návrhů, jako je vytváření vhodných cílů normalizací vstupních dat nebo učení pevné sady vizuálních tokenů. Nicméně, klíčový rozdíl mezi data2vec a jinými algoritmy je, že data2vec používá samo-pozornost, aby udělal cílovou reprezentaci kontextualizovanou a kontinuální. Naopak, jiné samořízené modely učení používají pevnou sadu cílů, které jsou založeny na lokálním kontextu.

Metoda data2vec

Model data2vec je trénován předpovědí modelových reprezentací vstupních dat na základě částečného pohledu na vstupní data. Jak je vidět na obrázku, tvář psa je maskována, určitá část hlasové poznámky je maskována a slovo „s“ je maskováno v textu.

Model nejprve kóduje maskovanou verzi školicího vzorku (student režim) a pak kóduje ne-maskovanou verzi vstupních dat pro konstrukci trénovacích cílů se stejným modelem, ale pouze když je parametricky jako exponenciální průměr modelových váh (učitel režim). Kromě toho, cílové reprezentace kódují informace přítomné ve školicím vzorku a v režimu studenta, úkolem učení je předpovědět tyto reprezentace, když je dán částečný pohled na vstupní data.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.