AI-modeller og platforme
Multimodal lÃĶring bliver mere fremtrÃĶdende blandt AI-udviklere
Venture Beat (VB) har viet en af sine ugentlige rapporter til fordelene ved multimodal lÃĶring i udviklingen af kunstig intelligens. Deres prompt var en rapport af ABI Research om emnet.
NÃļglekonceptet ligger i, at âdatasÃĶt er grundlÃĶggende byggesten for AI-systemer,â og at uden datasÃĶt, âkan modellerne ikke lÃĶre relationerne, der underbygger deres forudsigelser.â ABI-rapporten forudser, at âmens den samlede antal installerede AI-enheder vil vokse fra 2,69 milliarder i 2019 til 4,47 milliarder i 2024, vil kun fÃĨ af dem vÃĶre interoperable pÃĨ kort sigt.â
Dette kunne reprÃĶsentere en betydelig spild af tid, energi og ressourcer, âi stedet for at kombinere gigabytes til petabytes af data, der flyder gennem dem i ÃĐt AI-model eller ramme, vil de arbejde uafhÃĶngigt og heterogent for at give mening til data, de fÃĨr.â
For at overvinde dette, foreslÃĨr ABI multimodal lÃĶring, en metode, der kunne konsolidere data âfra forskellige sensorer og indgange i ÃĐt system. Multimodal lÃĶring kan bÃĶre komplementÃĶr information eller tendenser, der ofte kun bliver tydelige, nÃĨr de alle er inkluderet i lÃĶreprocessen.â
VB prÃĶsenterer et viablet eksempel, der tager billeder og tekstbeskrivelser i betragtning. âHvis forskellige ord er parret med lignende billeder, er disse ord sandsynligvis brugt til at beskrive de samme ting eller objekter. Omvendt, hvis nogle ord vises ved siden af forskellige billeder, antyder dette, at disse billeder reprÃĶsenterer det samme objekt. Givet dette, burde det vÃĶre muligt for en AI-model at forudsige billedobjekter fra tekstbeskrivelser, og faktisk har en mÃĶngde akademisk litteratur bevist, at dette er tilfÃĶldet.â
Trods de mulige fordele, bemÃĶrker ABI, at selv teknologigiganter som IBM, Microsoft (MSFT ), Amazon (AMZN ) og Google (GOOGL ) fortsat fokuserer overvejende pÃĨ unimodale systemer. En af ÃĨrsagerne er udfordringerne, en sÃĨdan skift ville reprÃĶsentere.
Alligevel forudser ABI-forskerne, at âdet samlede antal enheder, der skal leveres, vil vokse fra 3,94 millioner i 2017 til 514,12 millioner i 2023, drevet af adoption i robotteknologi, forbruger-, sundheds- og medie- og underholdningssegmenterne.â Blandt eksemplerne pÃĨ virksomheder, der allerede implementerer multimodal lÃĶring, nÃĶvner de Waymo, der bruger sÃĨdanne tilgange til at bygge âhyper-tilstedevÃĶrende selv kÃļrende kÃļretÃļjer,â og Intel Labs (INTC ), hvor virksomhedens ingeniÃļrteam âundersÃļger teknikker til sensor data-samling i virkelige miljÃļer.â
Intel Labsâ principal ingeniÃļr Omesh Tickoo forklarede til VB, at âdet, vi gjorde, var ved at bruge teknikker til at finde kontekst, sÃĨsom tid pÃĨ dagen, byggede vi et system, der fortÃĶller os, nÃĨr en sensors data ikke er af hÃļjeste kvalitet. Givet denne tillidsvÃĶrdighedsvÃĶrdi, vÃĶger det forskellige sensorer mod hinanden pÃĨ forskellige intervaller og vÃĶlger den rette blanding for at give os svaret, vi sÃļger.â
VB bemÃĶrker, at unimodal lÃĶring vil forblive dominerende, hvor det er hÃļjst effektivt â i ansÃļgninger som billedgenkendelse og naturlig sprogbehandling. Samtidig forudser de, at ânÃĨr elektronik bliver billigere og beregning mere skalerbar, vil multimodal lÃĶring sandsynligvis kun stige i fremtrÃĶdende.â












