AI-mallit ja alustat

Näe, ajattele, selitä: Näkemisen ja kielen mallien nousu tekoälyssä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Noin vuosikymmen sitten tekoäly jakautui kuvantunnistukseen ja kielen ymmärtämiseen. Näkemismallit pystyivät havaitsemaan objekteja, mutta eivät voineet kuvailla niitä, ja kielimallit pystyivät generoimaan tekstin, mutta eivät voineet “nähdä”. Nykyään tämä ero häviää nopeasti. Näkemisen ja kielen mallit (VLM) yhdistävät visuaalisen ja kielellisen osaamisen, jolloin ne voivat tulkita kuvia ja selittää niitä tavalla, joka tuntuu lähes inhimilliseltä. Se, mikä tekee niistä todella merkittäviä, on heidän askelkohtainen päättelyprosessinsa, jota kutsutaan ajatusketjuksi, joka auttaa muuttamaan nämä mallit voimallisiksi ja käytännöllisiksi työkaluiksi eri aloilla, kuten terveydenhuollossa ja koulutuksessa. Tässä artikkelissa tutkimme, miten VLM:t toimivat, miksi heidän päättelynsä on tärkeää ja miten ne muuttavat aloja lääketieteestä itseohjautuviin autoihin.

Näkemisen ja kielen mallien ymmärtäminen

Näkemisen ja kielen mallit, eli VLM:t, ovat tekoälyn tyyppi, joka voi ymmärtää sekä kuvia että tekstin samaan aikaan. Toisin kuin vanhemmat tekoälyjärjestelmät, jotka pystyivät käsittelemään vain tekstin tai kuvia, VLM:t yhdistävät nämä kaksi taitoa. Tämä tekee niistä erittäin monipuolisia. Ne voivat tarkastella kuvaa ja kuvailla, mitä siinä tapahtuu, vastata videoon liittyviin kysymyksiin tai jopa luoda kuvia kirjallisen kuvaus perusteella.

Esimerkiksi, jos pyydät VLM:ää kuvaamaan koiran juoksevan puistossa. VLM ei vain sanoo, “Siinä on koira.” Se voi kertoa, “Koira juoksee pallon lähellä suurta tammea.” Se näkee kuvan ja yhdistää sen sanoihin järkevällä tavalla. Tämä kyky yhdistää visuaalinen ja kielellinen ymmärtäminen luo monia mahdollisuuksia, kuten auttaminen kuvien etsimisessä verkossa tai avustaminen monimutkaisemmissa tehtävissä, kuten lääketieteellisessä kuvantunnistuksessa.

VLM:t toimivat yhdistämällä kaksi tärkeää osaa: näkemisen järjestelmän, joka analysoi kuvia, ja kielellisen järjestelmän, joka prosessoi tekstin. Näkemisosuus huomioi yksityiskohtia, kuten muotoja ja värejä, kun taas kielellinen osuus muuttaa nämä yksityiskohdat lauseiksi. VLM:t on koulutettu massiivisilla tietokannoilla, jotka sisältävät miljardeja kuva- ja tekstipareja, antaen niille laajan kokemuksen kehittää vahva ymmärtäminen ja korkea tarkkuus.

Mitä ajatusketju merkitsee VLM:issä

Ajatusketju, eli CoT, on tapa tehdä tekoälylle mahdolliseksi ajatella askel kohtaisesti, aivan kuten me ratkaistaessaan ongelman jakamalla sen pienempiin osiin. VLM:issä se tarkoittaa, että tekoäly ei vain anna vastausta, kun kysyt siitä jotain kuvasta, vaan se myös selittää, miten se päätyi siihen, selittäen jokaisen loogisen askelen tiellä.

Oletetaan, että näytät VLM:ille kuvan syntymäpäiväkakusta kynttilöineen ja kysyt, “Kuinka vanha henkilö on?” Ilman CoT:ia se saattaa vain arvata numeron. CoT:n kanssa se ajattelee asiaa läpi: “Ok, näen kakun kynttilöineen. Kynttilät näyttävät usein henkilön ikää. Laskekaamme niitä, siinä on 10. Joten henkilö on luultavasti 10-vuotias.” Voit seurata päättelyä, kun se kehittyy, mikä tekee vastauksesta luotettavamman.

Samoin, kun VLM:ille näytetään liikennekuvaa ja kysytään, “Onko turvallista ylittää?” VLM saattaa ajatella: “Jalankulkijan valo on punainen, joten et saa ylittää. Lähellä on myös auto, joka on liikkeessä, eikä se ole pysähtynyt. Tämä tarkoittaa, ettei ole turvallista tällä hetkellä.” Kulkien näiden askelten läpi, tekoäly näyttää tarkalleen, mitä se huomioi kuvassa ja miksi se tekee päätöksiä.

Miksi ajatusketju on tärkeä VLM:issä

CoT-päättelyn integrointi VLM:ihin tuo useita avainetuja.

Ensinnäkin, se tekee tekoälystä helpommin luotettavan. Kun se selittää askelensa, saat selkeän ymmärryksen siitä, miten se päätyi vastaukseen. Tämä on tärkeää aloilla, kuten terveydenhuollossa. Esimerkiksi, kun tarkastellaan aivokuvaa, VLM saattaa sanoa: “Näen varjon aivopuoliskon vasemmalla puolella. Se alue hallitsee puhetta, ja potilas on vaikeuksissa puhumisessa, joten se saattaa olla kasvain.” Lääkäri voi seurata logiikkaa ja tuntemaan itsensä varmaksi tekoälyn syötteestä.

Toiseksi, se auttaa tekoälyä ratkaisemaan monimutkaisia ongelmia. Jakamalla asiat, se voi käsitellä kysymyksiä, jotka vaativat enemmän kuin nopean vilkaisun. Esimerkiksi, kynttilöiden laskeminen on yksinkertaista, mutta turvallisuuden määrittäminen kiireisellä kadulla vaatii useita askelia, kuten valojen tarkastelun, autojen havaitsemisen ja nopeuden arvioimisen. CoT mahdollistaa tekoälylle monimutkaisuuden käsittelyn jakamalla sen useisiin askeliin.

Lopulta, se tekee tekoälystä sopeutuvammaksi. Kun se ajattelee askel kohtaisesti, se voi soveltaa tietämystään uusiin tilanteisiin. Jos se ei ole koskaan nähnyt tietynlaisen kakun aiemmin, se voi silti ymmärtää kynttilöiden ja iän yhteyden, koska se ajattelee asiaa läpi, eikä vain luota muistettuihin malleihin.

Miten ajatusketju ja VLM:t määrittävät aloja uudelleen

Ajatusketjun ja VLM:ien yhdistelmä vaikuttaa merkittävästi eri aloilla:

  • Terveydenhuolto: Lääketieteessä VLM:t, kuten Google Med-PaLM 2 (GOOGL ), käyttävät CoT:ia monimutkaisten lääketieteellisten kysymysten jakamiseen pienempiin diagnostisiin askeliin. Esimerkiksi, kun annetaan röntgenkuva ja oireita, kuten yskää ja päänsärkyä, tekoäly saattaa ajatella: “Nämä oireet voivat olla flunssaa, allergiaa tai jotain vakavampaa. Ei turvonneita imusolmukkeita, joten se ei ole todennäköisesti vakava infektio. Keuhkot näyttävät selkeiltä, joten se ei ole luultavasti keuhkokuume.” Se käy vaihtoehdot läpi ja päätyy vastaukseen, antaen lääkärille selkeän selityksen työskenneltäväksi.
  • Itseohjautuvat autot: Itseohjautuvissa autoissa CoT-parannetut VLM:t parantavat turvallisuutta ja päätöksentekoa. Esimerkiksi, itseohjautuva auto voi analyysoida liikennekuvaa askel kohtaisesti: tarkastaa jalankulkijoiden merkkejä, tunnistaa liikkuvia ajoneuvoja ja päättää, onko turvallista jatkaa. Järjestelmät, kuten Wayve LINGO-1, generoivat luonnollisen kielen kommentaarion selittääkseen toimia, kuten hidastamista pyöräilijän vuoksi. Tämä auttaa insinöörejä ja matkustajia ymmärtämään ajoneuvon päättelyprosessia. Askeltainen logiikka mahdollistaa myös paremman käsittelyn epätavallisia tiemekoja yhdistämällä visuaalisen tiedon kontekstuaaliseen tietoon.
  • Geospatial-analyysi: Google Gemini -malli soveltaa CoT-päättelyä spatiaalisiin tietoihin, kuten kartoista ja satelliittikuvista. Esimerkiksi, se voi arvioida hurrikaanin vahinkoa yhdistämällä satelliittikuvia, sääennusteita ja demograafisia tietoja, ja generoida selkeitä visualisointeja ja vastauksia monimutkaisiin kysymyksiin. Tämä nopeuttaa kriisivastetta tarjoamalla päättäjille ajantasaisia ja hyödyllisiä näkemyksiä ilman teknistä asiantuntemusta.
  • Robotiikka: Robotiikassa CoT:n ja VLM:ien yhdistäminen mahdollistaa robotien paremman suunnittelun ja moniosaisen tehtävien suorittamisen. Esimerkiksi, kun robotti tehtäväksi annetaan esineen nostaminen, CoT-käyttöön otettu VLM mahdollistaa sille esineen tunnistamisen, parhaiden otteiden määrittämisen, esteettömän reitin suunnittelun ja liikkeen suorittamisen, kaiken selittäen askel kohtaisesti. Projektit, kuten RT-2, osoittavat, miten CoT mahdollistaa robotien sopeutumisen uusiin tehtäviin ja monimutkaisiin käskyihin selkeän päättelyn kautta.
  • Koulutus: Opetuksessa tekoälyopettajat, kuten Khanmigo, käyttävät CoT:ia opettaakseen paremmin. Matemaattisessa ongelman ratkaisemisessa se voi opastaa opiskelijaa: “Ensinnäkin, kirjoita yhtälö. Seuraavaksi, saa muuttuja erilleen vähentämällä 5 molemmista puolista. Nyt, jaa 2:lla.” Sen sijaan, että se antaisi vastauksen, se käy prosessin läpi, auttaen opiskelijoita ymmärtämään käsitteitä askel kohtaisesti.

Lopputulos

Näkemisen ja kielen mallit (VLM:t) mahdollistavat tekoälylle kuvien ja niiden selitysten tulkinnan ihmismäisellä, askelkohtaisella päättelyllä ajatusketjun (CoT) kautta. Tämä lähestymistapa lisää luotettavuutta, sopeutuvuutta ja ongelmanratkaisukykyä aloilla, kuten terveydenhuollossa, itseohjautuvissa autoissa, geospatial-analyysissä, robottiassa ja koulutuksessa. Muuttaessaan, miten tekoäly ratkaisee monimutkaisia tehtäviä ja tukee päätöksentekoa, VLM:t asettavat uuden standardin luotettavalle ja käytännölliselle älytekniikalle.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.