AI-modeller og plattformer
Multimodalt lÃĶring blir mer fremtredende blant AI-utviklere
Venture Beat (VB) viet ett av sine ukentlige rapporter til fordelen med multimodalt lÃĶring i utviklingen av kunstig intelligens. Deres utlÃļsende faktor var en rapport fra ABI Research om saken.
Hovedkonseptet ligger i at âdatamengder er grunnleggende byggestener for AI-systemer,â og at uten datamengder, âkan modellene ikke lÃĶre relasjonene som informerer deres prediksjoner.â ABI-rapporten forutser at âmens den totale installerte basen av AI-enheter vil vokse fra 2,69 milliarder i 2019 til 4,47 milliarder i 2024, vil komparativt fÃĨ vÃĶre interoperable pÃĨ kort sikt.â
Dette kan representere en betydelig spilltids-, energi- og ressursÃļkt, âi stedet for ÃĨ kombinere gigabyte til petabyte med data som flyter gjennom dem i ett enkelt AI-modell eller ramme, vil de arbeide uavhengig og heterogent for ÃĨ gi mening til dataene de mates.â
For ÃĨ overvinne dette, foreslÃĨr ABI multimodalt lÃĶring, en metode som kunne konsolidere data âfra forskjellige sensorer og inndata i ett enkelt system. Multimodalt lÃĶring kan bÃĶre komplementÃĶr informasjon eller trender, som ofte bare blir tydelig nÃĨr de alle er inkludert i lÃĶringprosessen.â
VB presenterer et gyldig eksempel som tar hensyn til bilder og tekstlegginger. âHvis forskjellige ord er parret med lignende bilder, er disse ordene sannsynligvis brukt til ÃĨ beskrive de samme tingene eller objektene. Omvendt, hvis noen ord dukker opp ved siden av forskjellige bilder, antyder dette at disse bildene representerer det samme objektet. Gitt dette, burde det vÃĶre mulig for en AI-modell ÃĨ forutsi bildeobjekter fra tekstbeskrivelser, og faktisk, en rekke akademiske litteratur har bevist at dette er tilfelle.â
Til tross for de mulige fordelen, merker ABI at selv teknologigigantene som IBM, Microsoft (MSFT ), Amazon (AMZN ) og Google (GOOGL ) fortsatt fokuserer hovedsakelig pÃĨ unimodale systemer. En av grunnene til dette er de utfordringene en slik omstilling ville representere.
Likevel forutser ABI-forskerne at âdet totale antallet enheter som leveres vil vokse fra 3,94 millioner i 2017 til 514,12 millioner i 2023, drevet av adopsjon i robotikk-, forbruker-, helse- og medie- og underholdningssegmentene.â Blant eksemplene pÃĨ selskaper som allerede implementerer multimodalt lÃĶring, nevner de Waymo, som bruker slike tilnÃĶrminger til ÃĨ bygge âhyper-oppmerksomme selvkjÃļrende kjÃļretÃļy,â og Intel Labs (INTC ), hvor selskapets ingeniÃļrteam âundersÃļker teknikk for sensor-data-samling i sanntidsmiljÃļ.â
Intel Labsâ hovedingeniÃļr Omesh Tickoo forklarte til VB at âHva vi gjorde, var ÃĨ bruke teknikk for ÃĨ finne kontekst, som tid pÃĨ dagen, og bygge et system som forteller deg nÃĨr en sensors data ikke er av hÃļyeste kvalitet. Gitt denne tillitsverdigheten, veier det forskjellige sensorer mot hverandre pÃĨ forskjellige intervaller og velger riktig blanding for ÃĨ gi oss svaret vi sÃļker.â
VB merker at unimodalt lÃĶring vil forbli dominerende der det er hÃļyt effektivt â i applikasjoner som bildegenkjenning og naturlig sprÃĨkbehandling. Samtidig forutser det at âetterhvert som elektronikken blir billigere og beregning mer skalerbar, vil multimodalt lÃĶring sannsynligvis bare Ãļke i prominens.â












