AI-mallit ja alustat

Suuren multimodaalisen mallin esittely: Muokkaamassa kielen mallien maisemaa vuonna 2024

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kun kohtaamme maailman, aistimme (näkeminen, kuuleminen, haistaminen) tarjoavat monipuolisen valikoiman tietoa, ja ilmaissemme itseämme eri viestintätavoilla, kuten kasvojen ilmeillä ja eleillä. Nämä aistit ja viestintätavat kutsutaan yhdessä modaaliksi, edustaen eri tapoja, joilla havaitsemme ja viestimme. Inspiroitu tästä ihmisen kyvystä, suuren multimodaalisen mallin (LMM) kehittäminen, joka yhdistää generatiivisen ja multimodaalisen tekoälynn, on käynnissä ymmärtääkseen ja luodakseen sisältöä eri tyypeissä, kuten tekstin, kuvien ja äänen. Tässä artikkelissa tutkimme tätä uudella tavalla nousevaa alaa, etsimällä, mitä LMM:t (suuret multimodaaliset mallit) ovat, miten ne rakennetaan, olemassa olevat esimerkit, haasteet, joita ne kohtaavat, ja mahdolliset sovellukset.

Generatiivisen tekoälyn kehitys vuonna 2024: Suurista kielen malleista suuriin multimodaalisiin malleihin

McKinsey on nimennyt vuoden 2023 läpimurtovuodeksi generatiiviselle tekoälylle, josta on seurannut useita edistysaskelia alalla. Olemme todistaneet merkittävän nousun suurten kielen mallien suosiota, jotka ovat taitavia ymmärtämään ja generoimaan ihmismäistä kieltä. Lisäksi kuvien generoimismallit ovat kehittyneet merkittävästi, osoittaen kykynsä luoda visuaalisia esityksiä tekstipohjaisista syötteistä. Kuitenkin huolimatta merkittävistä edistysaskelista yksittäisissä modaaliteorioissa, kuten tekstin, kuvien tai äänen, generatiivinen tekoäly on kohdannut haasteita yhdistää nämä modaalit generoinnissa. Koska maailma on luonteeltaan multimodaalinen, on tekoälylle tärkeää pystyä käsittelemään multimodaalista tietoa. Tämä on välttämätöntä merkityksellisen vuorovaikutuksen luomiseksi ihmisten kanssa ja onnistuneen toiminnan toteuttamiseksi todellisissa tilanteissa.

Seurauksena moni tekoälyntutkija odottaa LMM:ien nousua seuraavaksi eturintamaksi tekoälyn tutkimuksessa ja kehityksessä vuonna 2024. Tämä kehittyvä eturintama keskittyy parantamaan generatiivisen tekoälyn kykyä prosessoida ja tuottaa monipuolisia tulosteita, kattavasti tekstin, kuvien, äänen, videon ja muiden modaalien. On tärkeää korostaa, että ei kaikki multimodaaliset järjestelmät kelpaavat LMM:iksi. Mallit kuten Midjourney ja Stable Diffusion eivät kuulu LMM-luokkaan pääasiassa, koska ne puuttuvat LLM:istä, jotka ovat perustavanlaatuinen komponentti LMM:issä. Toisin sanoen voidaan kuvailla LMM:itä LLM:ien laajennuksena, antaen niille kyvyn käsitellä monia modaaliteorioita taitavasti.

Miten LMM:t toimivat?

Vaikka tutkijat ovat tutkineet erilaisia lähestymistapoja LMM:ien rakentamiseen, ne tyypillisesti koostuvat kolmesta olennaisesta komponentista ja toiminnasta. Ensinnäkin, kooderit käytetään kullekin datamodaalille luomaan datan esityksiä (kutsutaan upotukseksi) kyseiselle modaalille. Toiseksi, erilaisia mekanismeja käytetään upotuksien kohdistamiseen eri modaaliteorioista yhtenäiseen multimodaaliseen upotusavaruuteen. Kolmanneksi, generatiivisille malleille LLM käytetään luomaan tekstivastauksia. Koska syötteet voivat koostua tekstistä, kuvista, videoista ja äänistä, tutkijat työskentelevät uusien tavojen kehittämisessä, jotta kielen mallit voivat ottaa huomioon eri modaaliteoriat vastauksia antaessaan.

LMM:ien kehitys vuonna 2023

Alla on lueteltu joitakin merkittäviä LMM:itä, jotka kehitettiin vuonna 2023.

  • LLaVA on avoimen lähdekoodin LMM, jota kehittivät yhdessä Wisconsinin yliopisto, Microsoft (MSFT ) Research ja Columbian yliopisto. Malli pyrkii tarjoamaan avoimen lähdekoodin version multimodaalisesta GPT4:stä. Hyödyntäen Meta Llama LLM:ää, se sisällyttää CLIP-visuaalisen kooderin vahvasta visuaalisesta ymmärtämisestä. LLaVA:n terveydenhuoltoon keskittyvä variantti, jota kutsutaan LLaVA-Mediksi, voi vastata kysymyksiin, jotka liittyvät biolääketieteellisiin kuvien analyysiin.
  • ImageBind on Meta kehittämä avoimen lähdekoodin malli, joka jäljittelee ihmisen havainnon kykyä liittää multimodaalista tietoa. Malli integroi kuusi modaaliteoriaa – tekstin, kuvat/videot, äänen, 3D-mittaukset, lämpötilatiedot ja liiketiedot – ja oppii yhdenmukaisen edustamistavan näiden erilaisten tietotyyppien yli. ImageBind voi liittää esineitä valokuvissa attribuutteihin, kuten ääniin, 3D-muotoihin, lämpötilaan ja liikkeeseen. Mallia voidaan käyttää esimerkiksi tekstistä tai äänestä koostuvan kohtauksen generoimiseen.
  • SeamlessM4T on Meta kehittämä multimodaalinen malli, joka pyrkii edistämään viestintää monikielisissä yhteisöissä. SeamlessM4T on erinomainen käännös- ja transkriptiotöissä, tukeen puheesta puheeseen, puheesta tekstiin, tekstistä puheeseen ja tekstistä tekstiin käännöksiä. Malli käyttää epäautoregressiivista teksti-yksikködekooderia näiden käännösten suorittamiseen. Parannettu versio, SeamlessM4T v2, toimii perustana malleille, kuten SeamlessExpressive ja SeamlessStreaming, korostaa ilmaisun säilyttämistä kielten yli ja toimittaa käännökset minimoiden viiveen.
  • GPT4, jota on kehittänyt OpenAI, on edistysaskel sen edeltäjään, GPT3.5:een. Vaikka yksityiskohtaiset arkkitehtuurin tiedot eivät ole täysin julkaistu, GPT4 on tunnettu sulavasta integraatiosta teksti-, visuaali- ja äänimalleista. Malli voi generoida tekstin sekä kirjoitetuista että graafisista syötteistä. Se on erinomainen useissa tehtävissä, kuten kuvien huumorin kuvaamisessa, tekstin tiivistämisessä valokuvista ja vastaamisessa taitavasti kysymyksiin, jotka sisältävät kaavioita. GPT4 on myös tunnettu sopeutumiskyvystään käsitellä monenlaisia syötedataformaatteja.
  • Gemini, jonka on kehittänyt Google DeepMind, erottuu olemalla luonteeltaan multimodaalinen, sallien samanaikaisen vuorovaikutuksen eri tehtävissä ilman yksittäisten modaaliteorioiden yhdistämistä. Tämä malli hallitsee helposti sekä tekstin että erilaiset audiovisuaaliset syötteet, osoittaen kykynsä generoida tulosteita sekä tekstin että kuvamuodossa.

Suuret multimodaaliset mallit haasteet

  • Lisäämällä enemmän data-modaaliteorioita: Useimmat olemassa olevat LMM:t toimivat tekstien ja kuvien kanssa. LMM:ien on kuitenkin kehittymistä tekstien ja kuvien ulkopuolelle, sisällyttäen modaaliteorioita, kuten videoita, musiikkia ja 3D-malleja.
  • Monipuolisen tietojoukon saatavuus: Yksi suurimmista haasteista multimodaalisten generatiivisten tekoälymallien kehittämisessä ja koulutuksessa on suurten ja monipuolisten tietojoukkojen tarve, jotka sisältävät useita modaaliteorioita. Esimerkiksi kouluttaakseen mallin, joka generoi sekä tekstin että kuvia, tietojoukon on sisällettävä sekä teksti- että kuvatiedostoja, jotka liittyvät toisiinsa.
  • Monimodaalisten tulosteiden generointi: Vaikka LMM:t voivat käsitellä monimodaalisia syötteitä, monipuolisten tulosteiden, kuten tekstin ja grafiikan yhdistämisen, generointi on edelleen haaste.
  • Ohjeiden seuraaminen: LMM:illä on haasteena hallita vuorovaikutusta ja seuraamista tehtävissä, siirtymällä yksinkertaisesta täydentämisestä.
  • Monimodaalinen päättely: Vaikka nykyiset LMM:t ovat erittäin taitavia muuttaa yhtä modaaliteoriaa toiseksi, monimodaalisen tiedon sulava integrointi monimutkaisiin päättelytehtäviin, kuten ratkaisemiseen kirjallisia sana-ongelmia älykuulo-ohjeiden perusteella, on edelleen haasteellinen tehtävä.
  • LMM:ien pakkaaminen: LMM:ien resursseja vaativa luonne asettaa merkittävän esteen, mikä tekee niistä käytännössä mahdottomia reunalaiteilla, joilla on rajoitettu laskentaresursseja. LMM:ien pakkaaminen tehostamaan tehokkuutta ja soveltamista resursseja rajoittaville laitteille on tärkeä alue, jota tutkitaan jatkuvasti.

Mahdolliset sovellukset

  • Koulutus: LMM:illä on potentiaalia muuttaa koulutusta generoimalla monipuolisia ja viihdyttäviä oppimateriaaleja, jotka yhdistävät tekstin, kuvat ja äänen. LMM:t tarjoavat kattavan palautteen tehtävistä, edistävät yhteisöllistä oppimista, ja parantavat taitojen kehittymistä interaktiivisten simulaatioiden ja todellisten esimerkkien kautta.
  • Terveydenhuolto: Toisin kuin perinteiset yhden modaaliteorian tekoälyjärjestelmät, LMM:t parantavat lääketieteellistä diagnostiikkaa yhdistämällä useita modaaliteorioita. Ne myös tukkivat viestintää kieliesteiden yli terveydenhuollon tarjoajien ja potilaiden välillä, toimien keskitetyssä varastona erilaisille tekoälysovelluksille sairaaloissa.
  • Taiteen ja musiikin generointi: LMM:t voivat erottua taiteen ja musiikin luomisessa yhdistämällä eri modaaliteorioita ainutlaatuisten ja ilmaisevien tulosteiden aikaansaamiseksi. Esimerkiksi taiteen LMM voi yhdistää visuaalisen ja äänellisen elementit, tarjoamalla immersiivisen kokemuksen. Vastaavasti musiikin LMM voi integroida instrumentaalisen ja vokaalisen elementit, johtuen dynaamisista ja ilmaisevista sävellyksistä.
  • Henkilökohtaiset suositukset: LMM:t voivat analyysin avulla ymmärtää käyttäjien preferenssejä eri modaaliteorioissa ja tarjota henkilökohtaisia suosituksia sisällön kuluttamiseen, kuten elokuviin, musiikkiin, artikkeleihin tai tuotteisiin.
  • Sään ennustaminen ja ympäristön seuranta: LMM:t voivat analyysin avulla tulkita eri modaaliteorioita, kuten satelliittikuvia, ilmakehän olosuhteita ja historiallisia malleja, parantaen tarkkuutta sään ennustamisessa ja ympäristön seurannassa.

Yhteenveto

Suurten multimodaalisten mallien (LMM) maisema merkitsee merkittävää läpimurtoa generatiivisessa tekoälyssä, lupaavan edistystä useilla aloilla. Kun nämä mallit sulavasti yhdistävät eri modaaliteorioita, kuten tekstin, kuvat ja äänen, niiden kehitys avaa ovia muodonmuutoksellisiin sovelluksiin terveydenhuollossa, koulutuksessa, taiteessa ja henkilökohtaisissa suosituksissa. Kuitenkin haasteet, kuten modaaliteorioiden lisääminen ja resursseja vaativien mallien pakkaaminen, korostavat jatkuvaa tutkimusta, jota tarvitaan LMM:ien täydellisen potentiaalin toteuttamiseksi.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.