AI-modeller og platforme

Multimodal lÃĶring bliver mere fremtrÃĶdende blandt AI-udviklere

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Venture Beat (VB) har viet en af sine ugentlige rapporter til fordelene ved multimodal lÃĶring i udviklingen af kunstig intelligens. Deres prompt var en rapport af ABI Research om emnet.

NÃļglekonceptet ligger i, at “datasÃĶt er grundlÃĶggende byggesten for AI-systemer,” og at uden datasÃĶt, “kan modellerne ikke lÃĶre relationerne, der underbygger deres forudsigelser.” ABI-rapporten forudser, at “mens den samlede antal installerede AI-enheder vil vokse fra 2,69 milliarder i 2019 til 4,47 milliarder i 2024, vil kun fÃĨ af dem vÃĶre interoperable pÃĨ kort sigt.”

Dette kunne reprÃĶsentere en betydelig spild af tid, energi og ressourcer, “i stedet for at kombinere gigabytes til petabytes af data, der flyder gennem dem i ÃĐt AI-model eller ramme, vil de arbejde uafhÃĶngigt og heterogent for at give mening til data, de fÃĨr.”

For at overvinde dette, foreslÃĨr ABI multimodal lÃĶring, en metode, der kunne konsolidere data “fra forskellige sensorer og indgange i ÃĐt system. Multimodal lÃĶring kan bÃĶre komplementÃĶr information eller tendenser, der ofte kun bliver tydelige, nÃĨr de alle er inkluderet i lÃĶreprocessen.”

VB prÃĶsenterer et viablet eksempel, der tager billeder og tekstbeskrivelser i betragtning. “Hvis forskellige ord er parret med lignende billeder, er disse ord sandsynligvis brugt til at beskrive de samme ting eller objekter. Omvendt, hvis nogle ord vises ved siden af forskellige billeder, antyder dette, at disse billeder reprÃĶsenterer det samme objekt. Givet dette, burde det vÃĶre muligt for en AI-model at forudsige billedobjekter fra tekstbeskrivelser, og faktisk har en mÃĶngde akademisk litteratur bevist, at dette er tilfÃĶldet.”

Trods de mulige fordele, bemÃĶrker ABI, at selv teknologigiganter som IBM, Microsoft (MSFT ), Amazon (AMZN ) og Google (GOOGL ) fortsat fokuserer overvejende pÃĨ unimodale systemer. En af ÃĨrsagerne er udfordringerne, en sÃĨdan skift ville reprÃĶsentere.

Alligevel forudser ABI-forskerne, at “det samlede antal enheder, der skal leveres, vil vokse fra 3,94 millioner i 2017 til 514,12 millioner i 2023, drevet af adoption i robotteknologi, forbruger-, sundheds- og medie- og underholdningssegmenterne.” Blandt eksemplerne pÃĨ virksomheder, der allerede implementerer multimodal lÃĶring, nÃĶvner de Waymo, der bruger sÃĨdanne tilgange til at bygge “hyper-tilstedevÃĶrende selv kÃļrende kÃļretÃļjer,” og Intel Labs (INTC ), hvor virksomhedens ingeniÃļrteam “undersÃļger teknikker til sensor data-samling i virkelige miljÃļer.”

Intel Labs’ principal ingeniÃļr Omesh Tickoo forklarede til VB, at “det, vi gjorde, var ved at bruge teknikker til at finde kontekst, sÃĨsom tid pÃĨ dagen, byggede vi et system, der fortÃĶller os, nÃĨr en sensors data ikke er af hÃļjeste kvalitet. Givet denne tillidsvÃĶrdighedsvÃĶrdi, vÃĶger det forskellige sensorer mod hinanden pÃĨ forskellige intervaller og vÃĶlger den rette blanding for at give os svaret, vi sÃļger.”

VB bemÃĶrker, at unimodal lÃĶring vil forblive dominerende, hvor det er hÃļjst effektivt – i ansÃļgninger som billedgenkendelse og naturlig sprogbehandling. Samtidig forudser de, at “nÃĨr elektronik bliver billigere og beregning mere skalerbar, vil multimodal lÃĶring sandsynligvis kun stige i fremtrÃĶdende.”

Tidligere diplomat og oversÃĶtter for FN, nuvÃĶrende freelance journalist/forfatter/forsker, fokuserer pÃĨ moderne teknologi, kunstig intelligens og moderne kultur.