AI-mallit ja alustat
MINT-1T: Laajentamalla avoimia monimodaalisia tietoja kymmenkertaiseksi
Suurten monimodaalisten mallien (LMM) kouluttamiseen tarvitaan laajamittaisia tietoja, joissa on sekoitettuna kuvia ja tekstiä vapaamuotoisesti. Vaikka avoimet LMM:t ovat kehittyneet nopeasti, on edelleen suuri puute monimodaalisista sekoitetuista tietoja avoimessa lähdekoodissa. Näiden tietojen merkitystä ei voida liioitella, sillä ne muodostavat perustan edistyneiden tekoälyjärjestelmien luomiseksi, jotka pystyvät ymmärtämään ja luomaan sisältöä eri muodoissa. Riittävän kattavien ja sekoitettujen tietojen puute rajoittaa merkittävästi LMM:ien kehittämismahdollisuuksia. Nämä tiedot mahdollistavat mallien oppimisen monipuolisista syötteistä, mikä tekee niistä monipuolisempia ja tehokkaampia erilaisissa sovelluksissa. Lisäksi tällaisten tietojen niukkuus aiheuttaa haasteen avoimen lähdekoodin yhteisölle, joka riippuu jaetusta resursseista innovaation ja yhteistyön edistämiseksi.
Avoimet LMM:t ovat tehneet merkittäviä edistysaskelia viime vuosina, mutta niiden kasvu on hidastunut laajamittaisten sekoitettujen tietojen rajallisesta saatavuudesta. Tämän esteen voittamiseksi tarvitaan yhteisiä ponnistelua tietojen kuratointiin, annotointiin ja julkaisemiseen, jotta voidaan tukea monimodaalisten mallien jatkuvaista kehittämistä ja hienosäätöä. Lisäksi näiden tietojen luominen ja jakaminen edellyttävät useiden teknisten ja logististen esteiden voittamista. Tietojen kerääminen on oltava laaja-alainen ja edustava eri konteksteja, joissa LMM:t tullaan käyttämään. Annotointi vaatii huolellista harkintaa, jotta sekoitetut kuvien ja tekstin järjestykset ovat sellaisia, jotka parantavat mallin oppimiskykyä. Lisäksi varmistettaessa, että tiedot ovat avoimia, on otettava huomioon oikeudelliset ja eettiset seikat, jotka liittyvät tietosuojaa ja käyttöoikeuksiin. Laadukkaiden, laajamittaisten monimodaalisten sekoitettujen tietojen saatavuuden laajentaminen on välttämätöntä tekoälytutkimuksen ja -kehityksen tulevaisuudelle. Osoittamalla tämän puutteen, tekoälyyhteisö voi edistää suurempaa innovaatiota ja yhteistyötä, mikä johtaa tehokkaampien ja monipuolisempien LMM:ien luomiseen, jotka pystyvät ratkaisemaan monimutkaisia, todellisia maailman ongelmia.
Tästä lähtien, MINT-1T on suurin ja monipuolisin avoin monimodaalinen sekoitettu tieto, joka on julkaistu tähän asti. MINT-1T: 10-kertaisesti laajempi mittakaava, joka sisältää yhden biljoonan teksti-tokenin ja 3,4 miljardia kuvaa verrattuna aiempiin avoimiin tietoihin. MINT-1T-tieto esittelee myös aiemmin julkaisemattomia lähteitä, kuten PDF-tiedostoja ja ArXiv-artikkeleita. Koska monimodaaliset sekoitetut tiedot eivät skaalautu helposti, on tärkeää, että MINT-1T-tieto jakaa tietojen kuratointiprosessin, jotta muut voivat suorittaa kokeita näillä tietojen variantteja. MINT-1T-tieto osoittaa, että sen menetelmä on kilpailukykyinen; LMM-mallit, jotka on koulutettu MINT-1T:llä, ovat vertailukelpoisia (joskin jonkin verran) aiempiin avoimiin tietoihin, OBELICS:iin.
MINT-1T: Monimodaalinen tieto yhden biljoonan tokenilla
Suuret avoimet esikoulutus-tiedot ovat olleet ratkaisevia tutkimusyhteisölle datan insinööritaitojen ja avoimien mallien kehittämisessä. Tekstialueella varhaiset työt, kuten C4 ja The Pile, olivat avainasemassa mahdollistaen yhteisölle kouluttaa ensimmäiset avoimet suuret kielen mallit, kuten GPT-J, GPT-Neo ja muut. Nämä perustavat ponnistelut loivat myös tien myöhemmille parannuksille tietojen suodatusmenetelmissä ja skaalautuvuudessa. Vastaavasti kuvatekstialueella suuret avoimet tiedot ovat innoittaneet innovaatioita paremmissa tietojen kuratointimenetelmissä, kuten Data filtering networks ja T-MARS. On havaittavissa siirtymä eturintamalaboratorioista kouluttamaan suuria monimodaalisia malleja (LMM), jotka vaativat laajamittaisia monimodaalisia sekoitettuja tietoja, jotka koostuvat vapaamuotoisista kuvien ja tekstin sequensseistä. Kun eturintamamallien kyky kehittyy nopeasti, on ilmenevässä kuilu monimodaalisten koulutustietojen saatavuudessa avoimien ja suljettujen mallien välillä. Nykyiset avoimet monimodaaliset sekoitetut tiedot ovat pienempiä ja vähemmän monipuolisia kuin niiden tekstipohjaiset vastineet, jotka perustuvat pääasiassa HTML-dokumentteihin, mikä rajoittaa tietojen laajuutta ja monipuolisuutta. Tämä rajoitus haittaa avoimien LMM:ien kehittämistä ja luo epätasapuolisuuden avoimien ja suljettujen mallien välillä.
… (Translation continues as per the original content, maintaining the same structure and formatting.)












