AI-modeller och plattformar

Multimodalt lÃĪrande blir allt mer framtrÃĪdande bland AI-utvecklare

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Venture Beat (VB) ÃĪgnade en av sina veckorapporter ÃĨt fÃķrdelarna med multimodalt lÃĪrande vid utveckling av artificiell intelligens. Deras utgÃĨngspunkt var en rapport frÃĨn ABI Research om ÃĪmnet.

Den viktiga idÃĐn ligger i det faktum att “datamÃĪngder ÃĪr de grundlÃĪggande byggstenarna i AI-system,” och att utan datamÃĪngder “kan modellerna inte lÃĪra sig de relationer som informerar deras fÃķrutsÃĪgelser.” ABI-rapporten fÃķrutspÃĨr att “medan den totala installerade basen av AI-enheter kommer att vÃĪxa frÃĨn 2,69 miljarder 2019 till 4,47 miljarder 2024, kommer relativt fÃĨ att vara interoperabla pÃĨ kort sikt.”

Detta kan representera en betydande slÃķseri med tid, energi och resurser, “i stÃĪllet fÃķr att kombinera gigabyte till petabyte av data som strÃķmmar genom dem i en enda AI-modell eller ramverk, kommer de att fungera oberoende och heterogent fÃķr att ge mening ÃĨt de data de matas med.”

FÃķr att Ãķvervinna detta fÃķreslÃĨr ABI multimodalt lÃĪrande, en metodik som kunde konsolidera data “frÃĨn olika sensorer och inmatningar till ett enda system. Multimodalt lÃĪrande kan bÃĪra kompletterande information eller trender, som ofta bara blir uppenbara nÃĪr de alla ingÃĨr i lÃĪrandeprocessen.”

VB presenterar ett trovÃĪrdigt exempel som ÃķvervÃĪger bilder och textbeskrivningar. “Om olika ord ÃĪr parade med liknande bilder, ÃĪr det troligt att dessa ord anvÃĪnds fÃķr att beskriva samma saker eller fÃķremÃĨl. OmvÃĪnt, om vissa ord visas bredvid olika bilder, antyder detta att dessa bilder representerar samma fÃķremÃĨl. Med tanke pÃĨ detta borde det vara mÃķjligt fÃķr en AI-modell att fÃķrutsÃĪga bildfÃķremÃĨl frÃĨn textbeskrivningar, och faktiskt har en mÃĪngd akademisk litteratur bevisat att detta ÃĪr fallet.”

Trots de mÃķjliga fÃķrdelarna noterar ABI att ÃĪven teknikjÃĪttar som IBM, Microsoft (MSFT ), Amazon (AMZN ) och Google (GOOGL ) fortfarande fokuserar frÃĪmst pÃĨ unimodala system. En av anledningarna ÃĪr de utmaningar som en sÃĨdan vÃĪxling skulle representera.

ÄndÃĨ fÃķrutspÃĨr ABI-forskarna att “den totala mÃĪngden enheter som levereras kommer att vÃĪxa frÃĨn 3,94 miljoner 2017 till 514,12 miljoner 2023, driven av antagande i robotik, konsument, hÃĪlsovÃĨrd och media och underhÃĨllningssegmenten.” Bland exemplen pÃĨ fÃķretag som redan implementerar multimodalt lÃĪrande nÃĪmner de Waymo, som anvÃĪnder sÃĨdana tillvÃĪgagÃĨngssÃĪtt fÃķr att bygga “hyper-medvetna sjÃĪlvkÃķrande fordon,” och Intel Labs (INTC ), dÃĪr fÃķretagets ingenjÃķrsteam “utreder tekniker fÃķr sensordatainsamling i realvÃĪrldsmiljÃķer.”

Intel Labs huvudingenjÃķr Omesh Tickoo fÃķrklarade fÃķr VB att “Vad vi gjorde var att, med hjÃĪlp av tekniker fÃķr att faststÃĪlla sammanhang, sÃĨsom tid pÃĨ dagen, byggde vi ett system som berÃĪttar fÃķr dig nÃĪr en sensors data inte ÃĪr av hÃķgsta kvalitet. Givet den fÃķrtroendevÃĪrdigheten vÃĪger det olika sensorer mot varandra vid olika intervall och vÃĪljer rÃĪtt mix fÃķr att ge oss det svar vi letar efter.”

VB noterar att unimodalt lÃĪrande kommer att fÃķrbli dominerande dÃĪr det ÃĪr mycket effektivt – i tillÃĪmpningar som bildigenkÃĪnning och naturlig sprÃĨkbehandling. Samtidigt fÃķrutspÃĨr det att “nÃĪr elektronik blir billigare och berÃĪkningar blir mer skalbara, kommer multimodalt lÃĪrande sannolikt bara att Ãķka i betydelse.”

FÃķre detta diplomat och ÃķversÃĪttare fÃķr UN, fÃķr nÃĪrvarande frilansjournalist/fÃķrfattare/forskare, med fokus pÃĨ modern teknik, artificiell intelligens och modern kultur.