Modele și platforme AI
Învățarea Multimodală Devine Prominentă Printre Dezvoltatorii de IA
Venture Beat (VB) a dedicat unul dintre rapoartele sale săptămânale avantajelor învățării multimodale în dezvoltarea inteligenței artificiale. Promptul lor a fost un raport de la ABI Research pe această temă.
Conceptul cheie se află în faptul că “seturile de date sunt blocuri de construcție fundamentale ale sistemelor de inteligență artificială,” și că fără seturi de date, “modelele nu pot învăța relațiile care informează predicțiile lor.” Raportul ABI prezice că “în timp ce baza totală instalată de dispozitive cu IA va crește de la 2,69 miliarde în 2019 la 4,47 miliarde în 2024, comparativ puține vor fi interoperabile pe termen scurt.”
Acest lucru poate reprezenta o pierdere considerabilă de timp, energie și resurse, “în loc să combine gigabați până la petabați de date care curg prin ele într-un singur model sau cadru de IA, acestea vor funcționa independent și eterogen pentru a da sens datelor pe care le primesc.”
Pentru a depăși acest lucru, ABI propune învățarea multimodală, o metodologie care ar putea consolida date “de la diverse senzori și intrări într-un singur sistem. Învățarea multimodală poate purta informații complementare sau tendințe, care adesea devin evidente doar atunci când sunt incluse în procesul de învățare.”
VB prezintă un exemplu viabil care ia în considerare imagini și texte de subtitrare. “Dacă diferite cuvinte sunt pereche cu imagini similare, aceste cuvinte sunt probabil folosite pentru a descrie aceleași lucruri sau obiecte. Invers, dacă anumite cuvinte apar lângă imagini diferite, acest lucru implică faptul că aceste imagini reprezintă același obiect. Având în vedere acest lucru, ar trebui să fie posibil pentru un model de IA să prezică obiecte de imagine din descrieri de text, și, într-adevăr, o serie de literatură academică a demonstrat că acest lucru este valabil.”
În ciuda avantajelor posibile, ABI notează că chiar și giganții tehnologici precum IBM, Microsoft (MSFT ), Amazon (AMZN ) și Google (GOOGL ) continuă să se concentreze în principal pe sisteme unimodale. Unul dintre motivele pentru care se întâmplă acest lucru este reprezentat de provocările pe care o astfel de schimbare le-ar implica.
Cu toate acestea, cercetătorii ABI anticipă că “numărul total de dispozitive livrate va crește de la 3,94 milioane în 2017 la 514,12 milioane în 2023, stimulat de adoptarea în segmentele de robotică, consum, îngrijire a sănătății și divertisment.” Printre exemplele de companii care implementează deja învățarea multimodală, ei menționează Waymo, care folosește astfel de abordări pentru a construi “vehicule autonome hiper-conștiente,” și Intel Labs (INTC ), unde echipa de ingineri a companiei “investighează tehnici pentru colectarea datelor de senzor în medii reale.”
Inginerul principal al Intel Labs, Omesh Tickoo, a explicat pentru VB că “Ce am făcut a fost să folosim tehnici pentru a determina contextul, cum ar fi ora zilei, și am construit un sistem care ne spune când datele unui senzor nu sunt de cea mai bună calitate. Având în vedere această valoare de încredere, sistemul cântărește diferiți senzori la intervale diferite și alege amestecul potrivit pentru a ne oferi răspunsul pe care îl căutăm.”
VB notează că învățarea unimodală va rămâne predominantă acolo unde este foarte eficientă – în aplicații precum recunoașterea imaginilor și procesarea limbajului natural. În același timp, ei prezic că “pe măsură ce electronica devine mai ieftină și computarea mai scalabilă, învățarea multimodală va crește probabil în importanță.”












