AI-mallit ja alustat

Vallankumous AI: n Applein ReALM: n kanssa: Älykkäiden avustajien tulevaisuus

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tekoälymaailmassa Apple (AAPL ) on hiljaisesti kehittänyt uraauurtavaa lähestymistapaa, joka voi määritellä uudelleen, miten vuorovaikutamme iPhone-laitteidemme kanssa. ReALM, tai Viittauksen ratkaisu kielen mallinnuksena, on tekoälymalli, joka lupailee tuoda uuden tason kontekstuaalista tietoisuutta ja vaivatonta apua.

Teknologia-alalla buzzaa innostuneesti OpenAI:n GPT-4:n ja muiden suurten kielen mallien ympärillä, Applein ReALM edustaa ajattelutavan muutosta – siirtymistä pelkästään pilvipohjaisesta tekoälystä enemmän henkilökohtaiseen, laitteistopohjaiseen lähestymistapaan. Tavoitteena on luoda älykäs avustaja, joka todella ymmärtää sinut, maailmasi ja arkipäiväisten digitaalisten vuorovaikutusten monimutkaisen koostumuksen.

ReALM:n ytimessä on kyky ratkaista viittaukset – ne epäselvät pronominit kuten “se“, “he” tai “se“, joita ihmiset navigoivat helposti kontekstuaalisten vihjeiden ansiosta. Tekoälyavustajille nämä ovat kuitenkin pitkään olleet este, johtaan turhauttaviin väärinymmärryksiin ja epäjohdonmukaiseen käyttökokemukseen.

Kuvittele tilanne, jossa pyydät Siriltä “löytämään minulle terveellinen resepti sen mukaan, mitä on jääkaapissani, mutta jätä sienet – en pidä niistä.” ReALM:n avulla iPhone ymmärtäisi viittaukset ruudulla oleviin tietoihin (jääkaapin sisältö) ja muistaisi henkilökohtaiset mieltymyksesi (sienten vastaisuus) ja laajemman kontekstin reseptin etsimiseen näiden parametreiden mukaan.

Tämä taso kontekstuaalista tietoisuutta on kvanttiaskel eteenpäin nykyisten tekoälyavustajien avainsanamallista. Kouluttamalla suuria kielen malleja ratkaisemaan viittauksia kolmessa avainalueessa – keskustelussa, ruudulla ja taustalla – ReALM pyrkii luomaan todella älykkään digitaalisen kumppanin, joka tuntuu vähemmän kuin robottinen ääniavustaja ja enemmän kuin oman ajatteluprosessin laajennus.

Keskustelun alue: Muistamalla mitä edellä

Keskustelutekoälyssä ReALM käsittelee pitkään olemassa ollutta haaste – ylläpitää koherenssia ja muistia useiden vuorovaikutusten aikana. Sen kyvyn ansiosta ratkaista viittauksia keskustelun aikana ReALM voisi lopulta toteuttaa luonnollisen, edestakaisen vuorovaikutuksen digitaalisen avustajasi kanssa.

Kuvittele pyytäväsi Siriltä “muistuttaa minua varata liput lomallesi, kun saan palkan perjantaina.” ReALM:n avulla Siri ymmärtäisi kontekstin (loma-aikeet, joita saatettiin käydä aiemmassa keskustelussa tai ruudulla olevissa tiedoissa) ja liittäisi “palkan” säännölliseen palkkapäivään.

Tämä taso keskusteluintelligenssiä tuntuu todelliselta edistysaskelelta, mahdollistaen vaivattomat monivuorovaikutukset ilman turhauttavaa kontekstin uudelleen selittämistä tai toistoa.

Ruudun alue: Antamalla avustajalle silmät

Todennäköisesti ReALM:n merkittävin puoli on kuitenkin sen kyky ratkaista viittauksia ruudulla oleviin entiteetteihin – ratkaiseva askel kohti todella käsivapautta, ääniohjattua käyttökokemusta.

Applein tutkimuspaperi käsittelee uudenlaista tekniikkaa visuaalisen tiedon koodaamiseksi laitteen ruudulta muotoon, jota suuret kielen mallit voivat prosessoida. Rakentamalla ruudun ulkoasun tekstipohjaiseen edustukseen ReALM voi “nähdä” ja ymmärtää eri ruudulla olevien elementtien väliset suhteet.

Kuvittele tilannetta, jossa katsot ravintoloiden listaa ja pyydät Siriltä “ohjeita siihen, joka on Main Streetillä.” ReALM:n avulla iPhone ymmärtäisi viittauksen tiettyyn sijaintiin ja sitoi sen relevanttiin ruudulla olevaan entiteettiin – ravintolan listaukseen, joka vastaa kuvausta.

Tämä taso visuaalista ymmärtämistä avaa mahdollisuuksia toimia viittauksilla sovelluksissa ja verkkosivuilla, integroida tuleviin AR-liittymiin ja jopa havaita ja reagoida oikeasti maailman esineisiin ja ympäristöihin laitteen kameran kautta.

Tutkimuspaperi Applein ReALM-mallista käsittelee yksityiskohtaisesti, miten järjestelmä koodaa ruudulla olevat entiteetit ja ratkaisee viittauksia eri konteksteissa. Tässä on yksinkertaistettu selitys algoritmeista ja esimerkeistä, jotka paperissa esitetään:

  1. Ruudulla olevien entiteettien koodaus: Paperi tutkii useita strategioita koodata ruudun elementtejä tekstuaaliseen muotoon, jota suuret kielen mallit voivat prosessoida. Yksi lähestymistapa on ryhmitellä lähellä olevia objekteja niiden spatialisen lähimmyyden perusteella ja luoda vihjeitä, jotka sisältävät nämä ryhmitetyt objektit. Tämä menetelmä voi kuitenkin johtaa liian pitkiin vihjeisiin, kun entiteettien määrä kasvaa.

Tutkijat ottivat lopulta käyttöön lähestymistavan, jossa ruutu parsitaan ylhäältä alas, vasemmalta oikealle, ja ulkoasu esitetään tekstuaalisessa muodossa. Tämä saavutetaan algoritmin 2 avulla, joka järjestää ruudulla olevat objektit niiden keskipistekoordinaattien mukaan, määrittää pystytasot ryhmittelemällä objektit tietyn marginaalin sisällä, ja rakentaa ruudun parsen liittämällä nämä tasot välilehdillä erotettuina objekteina samalla rivillä.

Lisäämällä relevantit entiteetit (tässä tapauksessa puhelinnumerot) tekstuaaliseen edustukseen, suuret kielen mallit voivat ymmärtää ruudun kontekstin ja ratkaista viittauksia vastaavasti.

  1. Viittauksen ratkaisun esimerkit: Paperi esittää useita esimerkkejä ReALM-mallin kyvystä ratkaista viittauksia eri konteksteissa:

a. Keskustelun viittaukset: Pyynnössä “Siri, löydä minulle terveellinen resepti sen mukaan, mitä on jääkaapissani, mutta jätä sienet – en pidä niistä”, ReALM voi ymmärtää ruudun kontekstin (jääkaapin sisältö), keskustelun kontekstin (reseptin etsintä) ja käyttäjän mieltymykset (sienten vastaisuus).

b. Taustan viittaukset: Esimerkissä “Siri, soita se kappale, joka soi supermarketissa aiemmin”, ReALM voi mahdollisesti havaita ja tunnistaa taustan ääniä ja ratkaista viittauksen tiettyyn kappaleeseen.

c. Ruudun viittaukset: Pyynnössä “Siri, muistuta minua varata liput lomallesi, kun saan palkan perjantaina”, ReALM voi yhdistää tietoa käyttäjän rutiineista (palkkapäivä), ruudun keskusteluista tai verkkosivuista (loma-aikeet) ja kalenterista ymmärtääkseen ja toimintakseen pyynnön mukaan.

Nämä esimerkit osoittavat ReALM:n kyvyn ratkaista viittauksia keskustelun, ruudun ja taustan konteksteissa, mahdollistaen luonnollisemman ja vaivattomamman vuorovaikutuksen älykkäiden avustajien kanssa.

Taustan alue

Siirtymällä keskustelun ja ruudun kontekstien lisäksi ReALM tutkii myös kykyä ratkaista viittauksia taustaan liittyviin entiteetteihin – niiden ääri-ilmiöihin ja prosesseihin, joita nykyiset tekoälyavustajamme usein ohittavat.

Kuvittele tilannetta, jossa pyydät Siriltä “soittamaan kappaleen, joka soi supermarketissa aiemmin.” ReALM:n avulla iPhone voisi mahdollisesti havaita ja tunnistaa taustan ääniä, jolloin Siri voisi vaivattomasti hakea ja soittaa haluamasi kappaleen.

Tämä taso taustatietoisuutta tuntuu ensimmäiseltä askeleelta kohti todella ubiikkiutta, kontekstuaalista tekoälyapua – digitaalista kumppania, joka ymmärtää sekä sanasi että arkipäiväisten kokemusten rikkaan koostumuksen.

Laitteistopohjaisen tekoälyn lupaama: Yksityisyys ja personointi

Vaikka ReALM:n ominaisuudet ovat ilman väliä vaikuttavia, sen merkittävin etu lienee Applein pitkäaikainen sitoutuminen laitteistopohjaiseen tekoälyyn ja käyttäjien yksityisyyteen.

Toisin kuin pilvipohjaiset tekoälymallit, jotka riippuvat käyttäjätietojen lähettämisestä etäpalvelimille prosessointia varten, ReALM on suunniteltu toimimaan kokonaan iPhone- tai muilla Apple-laitteilla. Tämä ei ainoastaan vastaa tietosuojaa koskevia huolenaiheita vaan myös avaa uusia mahdollisuuksia tekoälyavuksi, jotka todella ymmärtävät ja mukautuvat yksilöllisesti.

Opettamalla suoraan laitteistotiedoista – keskusteluista, sovellus käytöstä, jopa taustan aistitietojen kaltaisista syötteistä – ReALM voisi mahdollisesti luoda hyperhenkilökohtaisen digitaalisen avustajan, joka on räätälöity yksilöllisiin tarpeisiisi, mieltymyksiisi ja päivittäisiin rutiineihisi.

Tämä taso personointia tuntuu paradigman muutokselta nykyisten tekoälyavustajien yhden kokoa sopii kaikille -lähestymistavasta, joka usein kamppailee sopeutuakseen yksilöllisiin käyttäjien ominaispiirteisiin ja konteksteihin.

ReALM-250M-malli saavuttaa vaikuttavat tulokset:

    • Keskustelun ymmärtäminen: 97.8
    • Synteettisen tehtävän ymmärtäminen: 99.8
    • Ruudun tehtävän suorituskyky: 90.6
    • Näkemättömän alueen käsittely: 97.2

Eettiset huomioonotot

Tietysti, tällaisen henkilökohtaisen ja kontekstuaalisen tietoisuuden tasolla tulee mukaan joukko eettisiä huomioonottoja yksityisyydestä, avoimuudesta ja tekoälyjärjestelmien potentiaalisesta vaikutuksesta tai jopa manipuloinnista käyttäjän käyttäytymisessä.

Kun ReALM saa syvemmän ymmärryksen arkipäiväisestä elämästäsi – ruokatottumuksistasi ja median kulutusmallistasi sosiaalisiin vuorovaikutuksiisi ja henkilökohtaisiin mieltymyksiisi – on riski, että tämä teknologia käytetään tapaa, joka loukkaa käyttäjien luottamusta tai rikkoaa eettisiä rajoja.

Applein tutkijat ovat tietoisia tästä jännitteestä ja tunnustavat paperissaan tarpeen löytää tasapaino, jossa toimitaan sekä todella avustavana tekoälykokemuksena että kunnioittaen käyttäjien yksityisyyttä ja toimintavapautta.

Tämä haaste ei ole ainutlaatuinen Applelle tai ReALM:lle – se on keskustelu, johon koko teknologia-alan on osallistuttava, kun tekoälyjärjestelmät tulevat yhä monimutkaisemmiksi ja integroiduksi arkeen.

Kohti älykkämpää ja luonnollisempaa tekoälykokemusta

Kun Apple jatkaa laitteistopohjaisen tekoälyn rajojen venyttämistä malleilla kuten ReALM, lupaava todella älykäs ja kontekstuaalinen digitaalinen avustaja tuntuu lähempänä kuin koskaan aiemmin.

Kuvittele maailmaa, jossa Siri (tai mikä tahansa tulevaisuuden tekoälyavustaja) tuntuu vähemmän kuin irtautunut ääni pilvestä ja enemmän kuin oman ajatteluprosessin laajennus – kumppani, joka ymmärtää sekä sanasi että arkipäiväisen digitaalisen elämän rikkaan koostumuksen, päivittäiset rutiinit ja yksilölliset mieltymykset ja kontekstit.

Täydellisesti toimien viittauksilla sovelluksissa ja verkkosivuilla, ennakoiden tarpeitasi sijainnin, toiminnan ja taustan aistitietojen perusteella, ReALM edustaa merkittävää askelta kohti luonnollisempaa ja vaivattomampaa tekoälykokemusta, joka häivyttää rajat digitaalisen ja fyysisen maailman välillä.

Toteuttaakseen tämän visio, vaaditaan enemmän kuin pelkästään tekninen innovaatio – se vaatii myös eettistä lähestymistapaa tekoälyn kehittämiseen, joka priorisoi käyttäjien yksityisyyden, avoimuuden ja toimintavapauden.

Kun Apple jatkaa ReALM:n kykyjen hienostamista ja laajentamista, teknologia-alalla odotetaan innostuneesti, miten tämä uraauurtava tekoälymalli muokkaa älykkäiden avustajien tulevaisuutta ja vie meidät uuden aikakauden todella henkilökohtaiseen ja kontekstuaaliseen laskentaan.

Onko ReALM lupaamassa ylittää jopa mahtavan GPT-4:n, aika näyttää. Mutta yksi asia on varma: älykkäiden avustajien aika, jotka todella ymmärtävät meidät – sanamme, maailmamme ja arkipäiväisen elämämme rikkaan koostumuksen – on jo täällä, ja Applein uusin innovaatio saattaa olla tämän vallankumouksen eturintamassa.

Olen viettänyt viimeiset viisi vuotta uppoutumalla kiinnostavaan koneoppimisen ja syvän oppimisen maailmaan. Minun intohimoni ja asiantuntemukseni ovat johtaneet minun osallistumiseen yli 50:een monipuoliseen ohjelmistosuunnitteluhankkeeseen, joissa on erityisesti painottunut AI/ML. Minun jatkuva uteliaisuuteni on myös ohjannut minun luontaisen kielen prosessoinnin pariin, jota haluan tutkia tarkemmin.