AI-mallit ja alustat

Metan Llama 3.2: Uudelleenmäärittelemällä avoimen lähdekoodin generatiivista tekoälyä laitteistopohjaisilla ja monitiloilla ominaisuuksilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Metan viimeisin Llama 3.2:n julkaisu, joka on uusin versio Llama-avainkieli mallisarjassa, on merkittävä kehitysaskel avoimen lähdekoodin generatiivisen tekoäly ekosysteemin evoluutiossa. Tämä päivitys laajentaa Llaman kykyjä kahdella tavalla. Toisaalta Llama 3.2 mahdollistaa monitilaisten tietojen prosessoinnin – yhdistämällä kuvat, tekstin ja muut tiedot – ja tekee edistyneistä tekoälyominaisuuksista helpommin saatavilla laajemmalle yleisölle. Toisaalta se laajentaa sen käyttömahdollisuuksia reunalaiteilla, luoden jännittäviä mahdollisuuksia reaaliaikaisille, laitteistopohjaisille tekoälysovelluksille. Tässä artikkelissa tarkastelemme tätä kehitystä ja sen vaikutuksia tekoälyn tulevaisuuden käyttöönottoon.

Llaman evoluutio

Metan matka Llaman kanssa alkoi alkuvuonna 2023, ja siitä lähtien sarja on kokenut räjähdysmäisen kasvun ja omaksumisen. Llaman 1:n aloittamisesta, joka oli rajoitettu ei-kaupalliseen käyttöön ja saatavilla vain valituille tutkimuslaitoksille, sarja siirtyi avoimen lähdekoodin alueelle Llaman 2:n julkaisun myötä vuonna 2023. Llaman 3.1:n julkaisu aiemmin tänä vuonna oli merkittävä askel evoluutiossa, sillä se esitteli suurimman avoimen lähdekoodin mallin 405 miljardilla parametrilla, joka on joko tasolla tai ylittää sen omat kilpailijat. Viimeisin julkaisu, Llama 3.2, vie tämän askelen eteenpäin esittelemällä uudet kevyet ja visiopohjaiset mallit, jotka tekevät laitteistopohjaisen tekoälyn ja monitilaisten toimintojen saataville. Metan sitoutuminen avoimuuteen ja muokattavuuteen on mahdollistanut Llaman johtavan mallin aseman avoimen lähdekoodin yhteisössä. Yritys uskoo, että pysymällä sitoutuneena avoimuuteen ja saatavuuteen voidaan edistää tekoälyinnovaatioita tehokkaammin – ei vain kehittäjille ja liiketoiminnalle, vaan kaikille ympäri maailmaa.

Llaman 3.2 esittely

Llama 3.2 on Metan Llaman uusin versio, joka sisältää joukon kielimalleja, jotka on suunniteltu täyttämään erilaiset vaatimukset. Suurimmat ja keskikokoiset mallit, joissa on 90 ja 11 miljardia parametrejä, on suunniteltu käsittelemään monitilaisten tietojen prosessointia, mukaan lukien teksti ja kuvat. Nämä mallit voivat tulkita tehokkaasti kaavioita, graafeja ja muita visuaalisen tiedon muotoja, mikä tekee niistä soveltuvia sovellusten rakentamiseen alueilla, kuten tietokoneen näkö, asiakirjojen analyysi ja lisätty todellisuus. Kevyet mallit, joissa on 1 miljardi ja 3 miljardia parametrejä, on otettu käyttöön erityisesti mobiililaitteissa. Nämä tekstipohjaiset mallit erottuvat monikielisessä tekstin generoinnissa ja työkalupohjaisissa sovelluksissa, mikä tekee niistä erittäin tehokkaita tehtävissä, kuten hakupohjaisessa generoinnissa, yhteenvetojen luomisessa ja mukautettujen agenttiperusteisten sovellusten luomisessa reunalaiteilla.

Llaman 3.2 merkitys

Tämä Llaman 3.2:n julkaisu voidaan tunnistaa kahden avainalueen edistymisenä.

Uusi aikakausi monitilaiselle tekoälylle

Llama 3.2 on Metan ensimmäinen avoimen lähdekoodin malli, joka sisältää sekä tekstin että kuvan prosessointikyky. Tämä on merkittävä kehitysaskel avoimen lähdekoodin generatiivisen tekoälyn evoluutiossa, sillä se mahdollistaa mallin analyysin ja reagoinnin visuaalisiin syötteisiin tekstuaalisten tietojen ohella. Esimerkiksi käyttäjät voivat nyt ladata kuvia ja saada yksityiskohtaisia analyysejä tai muokkauksia luonnollisen kielen ohjeiden perusteella, kuten esineiden tunnistamisen tai kuvatekstien luomisen. Mark Zuckerberg korosti tätä ominaisuutta julkaisun aikana, sanomalla, että Llama 3.2 on suunniteltu “mahdollistamaan monia mielenkiintoisia sovelluksia, jotka vaativat visuaalista ymmärrystä” . Tämä integraatio laajentaa Llaman soveltamisalaa aloille, jotka riippuvat monitilaisista tiedoista, mukaan lukien vähittäiskauppa, terveydenhuolto, koulutus ja viihde.

Laitteistopohjainen toiminnallisuus saatavuuden vuoksi

Yksi Llaman 3.2:n erottuvista ominaisuuksista on sen optimointi laitteistopohjaiselle käyttöönotolle, erityisesti mobiiliympäristöissä. Mallin kevyet versiot, joissa on 1 miljardi ja 3 miljardia parametrejä, on suunniteltu erityisesti suorittamaan älypuhelimilla ja muilla reunalaiteilla, jotka perustuvat Qualcomm- ja Mediatek-tekniikkaan. Tämä ominaisuus mahdollistaa kehittäjille sovellusten luomisen ilman laajaa laskentaresurssien tarvetta. Lisäksi nämä malliversiot erottuvat monikielisessä tekstin prosessoinnissa ja tukevat pidempää kontekstipituutta 128K tokenia, mikä mahdollistaa käyttäjille luonnollisen kielen prosessointisovellusten kehittämisen omilla kielillään. Lisäksi nämä mallit sisältävät työkalupohjaiset ominaisuudet, jotka mahdollistavat käyttäjille agenteille perustuvien sovellusten käytön, kuten kalenterikutsujen hallinnan ja matkojen suunnittelun suoraan laitteillaan.

Laitteistopohjaisen tekoälymallien käyttöönoton mahdollistaminen mahdollistaa avoimen lähdekoodin tekoälyn ylittää pilvilaskennan haasteet, mukaan lukien viiveongelmat, tietoturvariskit, korkeat toimintakustannukset ja riippuvuus internet-yhteydestä. Tämä edistysaskel voi muuttaa aloja, kuten terveydenhuolto, koulutus ja logistiikka, jotka voivat käyttää tekoälyä ilman pilvinfrastruktuurin tai tietoturvaongelmien rajoituksia ja reaaliaikaisissa tilanteissa. Tämä myös avaa oven tekoälylle päästä alueille, joilla on rajoitettu yhteydenpito, demokratisoiden pääsyn edistyneisiin teknologioihin maailmanlaajuisesti.

Kilpailukyky

Meta raportoi, että Llama 3.2 on suoriutunut kilpailijoiden vertaisesti johtavien mallien kanssa OpenAI:sta ja Anthropicista suorituskyvyn suhteen. He väittävät, että Llama 3.2 ylittää kilpailijoita, kuten Claude 3-Haiku ja GPT-4o-mini, useissa benchmark-testeissä, mukaan lukien ohjeiden seuraamisen ja sisällön yhteenvetojen tehtävissä. Tämä kilpailuetu on olennainen Meta:lle, sillä se pyrkii varmistamaan, että avoimen lähdekoodin tekoäly pysyy tasolla omistajan malleja nopeasti kehittyvässä generatiivisen tekoälyn alalla.

Llaman pinorakenne: Yksinkertaistamalla tekoälyn käyttöönottoa

Yksi Llaman 3.2:n julkaisun avainasioista on Llaman pinorakenteen esittely. Tämä työkalupakkaus tekee kehittäjille helpommaksi työskennellä Llaman malleja eri ympäristöissä, mukaan lukien yksisoluiset, paikalliset, pilvi- ja laitteistopohjaiset asetukset. Llaman pinorakenne sisältää tuen RAG- ja työkalupohjaisille sovelluksille, tarjoamalla joustavan ja kattavan kehyksen generatiivisten tekoälymallien käyttöönotolle. Yksinkertaistamalla käyttöönoton prosessia Meta mahdollistaa kehittäjille Llaman mallien helpon integroimisen sovelluksiin, olipa kyse sitten pilvi-, mobiili- tai työpöytäympäristöistä.

Lopputulos

Metan Llama 3.2 on merkittävä hetki avoimen lähdekoodin generatiivisen tekoälyn evoluutiossa, asettamalla uudet mittapuut saatavuudelle, toiminnalle ja monipuolisuudelle. Sen laitteistopohjaisilla kyvyillä ja monitilaisella prosessoinnilla tämä malli avaa muunnoksellisia mahdollisuuksia aloilla, kuten terveydenhuolto, koulutus, kun taas osoittaa kriittisiä huolenaiheita, kuten yksityisyyttä, viivettä ja infrastruktuurirajoituksia. Mahdollistamalla kehittäjille edistyneiden tekoälysovellusten käyttöönoton paikallisesti ja tehokkaasti, Llama 3.2 laajentaa tekoälysovellusten piiriä ja demokratisoi pääsyn edistyneisiin teknologioihin maailmanlaajuisesti.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.