AI-modeller og plattformer

Multimodalt lÃĶring blir mer fremtredende blant AI-utviklere

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

Venture Beat (VB) viet ett av sine ukentlige rapporter til fordelen med multimodalt lÃĶring i utviklingen av kunstig intelligens. Deres utlÃļsende faktor var en rapport fra ABI Research om saken.

Hovedkonseptet ligger i at “datamengder er grunnleggende byggestener for AI-systemer,” og at uten datamengder, “kan modellene ikke lÃĶre relasjonene som informerer deres prediksjoner.” ABI-rapporten forutser at “mens den totale installerte basen av AI-enheter vil vokse fra 2,69 milliarder i 2019 til 4,47 milliarder i 2024, vil komparativt fÃĨ vÃĶre interoperable pÃĨ kort sikt.”

Dette kan representere en betydelig spilltids-, energi- og ressursÃļkt, “i stedet for ÃĨ kombinere gigabyte til petabyte med data som flyter gjennom dem i ett enkelt AI-modell eller ramme, vil de arbeide uavhengig og heterogent for ÃĨ gi mening til dataene de mates.”

For ÃĨ overvinne dette, foreslÃĨr ABI multimodalt lÃĶring, en metode som kunne konsolidere data “fra forskjellige sensorer og inndata i ett enkelt system. Multimodalt lÃĶring kan bÃĶre komplementÃĶr informasjon eller trender, som ofte bare blir tydelig nÃĨr de alle er inkludert i lÃĶringprosessen.”

VB presenterer et gyldig eksempel som tar hensyn til bilder og tekstlegginger. “Hvis forskjellige ord er parret med lignende bilder, er disse ordene sannsynligvis brukt til ÃĨ beskrive de samme tingene eller objektene. Omvendt, hvis noen ord dukker opp ved siden av forskjellige bilder, antyder dette at disse bildene representerer det samme objektet. Gitt dette, burde det vÃĶre mulig for en AI-modell ÃĨ forutsi bildeobjekter fra tekstbeskrivelser, og faktisk, en rekke akademiske litteratur har bevist at dette er tilfelle.”

Til tross for de mulige fordelen, merker ABI at selv teknologigigantene som IBM, Microsoft (MSFT ), Amazon (AMZN ) og Google (GOOGL ) fortsatt fokuserer hovedsakelig pÃĨ unimodale systemer. En av grunnene til dette er de utfordringene en slik omstilling ville representere.

Likevel forutser ABI-forskerne at “det totale antallet enheter som leveres vil vokse fra 3,94 millioner i 2017 til 514,12 millioner i 2023, drevet av adopsjon i robotikk-, forbruker-, helse- og medie- og underholdningssegmentene.” Blant eksemplene pÃĨ selskaper som allerede implementerer multimodalt lÃĶring, nevner de Waymo, som bruker slike tilnÃĶrminger til ÃĨ bygge “hyper-oppmerksomme selvkjÃļrende kjÃļretÃļy,” og Intel Labs (INTC ), hvor selskapets ingeniÃļrteam “undersÃļker teknikk for sensor-data-samling i sanntidsmiljÃļ.”

Intel Labs’ hovedingeniÃļr Omesh Tickoo forklarte til VB at “Hva vi gjorde, var ÃĨ bruke teknikk for ÃĨ finne kontekst, som tid pÃĨ dagen, og bygge et system som forteller deg nÃĨr en sensors data ikke er av hÃļyeste kvalitet. Gitt denne tillitsverdigheten, veier det forskjellige sensorer mot hverandre pÃĨ forskjellige intervaller og velger riktig blanding for ÃĨ gi oss svaret vi sÃļker.”

VB merker at unimodalt lÃĶring vil forbli dominerende der det er hÃļyt effektivt – i applikasjoner som bildegenkjenning og naturlig sprÃĨkbehandling. Samtidig forutser det at “etterhvert som elektronikken blir billigere og beregning mer skalerbar, vil multimodalt lÃĶring sannsynligvis bare Ãļke i prominens.”

Tidligere diplomat og oversetter for FN, nÃĨ frilans journalist/forfatter/forsker, med fokus pÃĨ moderne teknologi, kunstig intelligens og moderne kultur.