Modely a platformy AI
Vícemodalní učení se stává prominentním mezi vývojáři umělé inteligence
Venture Beat (VB) věnoval jednu ze svých týdenních zpráv výhodám vícemodalního učení při vývoji umělé inteligence. Jejich podnětem byla zpráva od ABI Research na toto téma.
Klíčový koncept spočívá v tom, že “datové sady jsou základní stavební kameny systémů umělé inteligence,” a že bez datových sad “modely nemohou naučit vztahy, které informují jejich předpovědi.” Zpráva ABI předpovídá, že “zatímco celková instalovaná základna zařízení umělé inteligence poroste z 2,69 miliardy v roce 2019 na 4,47 miliardy v roce 2024, relativně málo z nich bude v krátkodobém horizontu interoperabilních.”
To by mohlo představovat značnou ztrátu času, energie a zdrojů, “namísto toho, aby kombinovaly gigabajty až petabajty dat proudících skrze ně do jednoho modelu nebo rámce umělé inteligence, budou pracovat nezávisle a heterogenně, aby daly smysl datům, která jim jsou k dispozici.”
ABI navrhuje vícemodalní učení, metodologii, která by mohla konsolidovat data “z různých senzorů a vstupů do jednoho systému. Vícemodalní učení může nést komplementární informace nebo trendy, které se často stávají zjevnými pouze tehdy, když jsou všechny zahrnuty do procesu učení.”
VB představuje životaschopný příklad, který zvažuje obrázky a textové popisky. “Pokud jsou různé slova spárována s podobnými obrázky, je pravděpodobné, že tato slova jsou použita k popisu stejné věci nebo objektu. Naopak, pokud některá slova vypadají vedle různých obrázků, to naznačuje, že tyto obrázky reprezentují stejný objekt. Daní tomu by mělo být možné pro model umělé inteligence předpovědět objekty obrázků z textových popisů, a skutečně, řada akademických prací prokázala, že tomu tak je.”
Navzdory možným výhodám ABI poznamenává, že i technologičtí giganti jako IBM, Microsoft (MSFT ), Amazon (AMZN ) a Google (GOOGL ) se nadále zaměřují převážně na unimodální systémy. Jedním z důvodů je, že takový přechod by představoval výzvy.
Přesto výzkumníci ABI předpokládají, že “celkový počet dodaných zařízení poroste z 3,94 milionu v roce 2017 na 514,12 milionu v roce 2023, poháněný přijetím v segmentech robotiky, spotřební elektroniky, zdravotní péče a médií a zábavy.” Mezi příklady společností, které již implementují vícemodalní učení, citují Waymo, které používá takové přístupy k vývoji “hyper-aware samořídících vozidel,” a Intel Labs (INTC ), kde inženýrský tým společnosti “vyšetřuje techniky pro sběr dat senzorů v reálném prostředí.”
Hlavní inženýr Intel Labs Omesh Tickoo vysvětlil VB, že “co jsme udělali, bylo použití technik k určení kontextu, jako je čas dne, a vyvinuli jsme systém, který vám řekne, kdy je data senzoru nejsou nejvyšší kvality. Daná tato důvěra, váží různé senzory proti sobě v různých intervalech a zvolí správnou kombinaci, aby nám dala odpověď, kterou hledáme.”
VB poznamenává, že unimodální učení zůstane dominantní tam, kde je vysoce efektivní – v aplikacích, jako je rozpoznávání obrázků a zpracování přirozeného jazyka. Současně předpovídá, že “jak se elektronika stává levnější a výpočetní kapacity se stávají škálovatelnějšími, vícemodalní učení pravděpodobně pouze poroste na významu.”












