AI-modeller og plattformer
Revolusjonere AI med Apples ReALM: Fremtiden for intelligente assistenter

Av
Aayush Mittal Mittal
I det stadig utviklende landskapet av kunstig intelligens, har Apple (AAPL ) vært stille pioneerer av en banebrytende tilnærming som kan omdefinere hvordan vi samhandler med våre iPhones. ReALM, eller Reference Resolution as Language Modeling, er en AI-modell som lover å bringe et nytt nivå av kontekstuell bevissthet og sømløs assistanse.
Mens teknologiverdenen buzzer med spenning over OpenAI’s GPT-4 og andre store språkmodeller (LLM), representerer Apples ReALM en skifte i tenkning – en bevegelse bort fra å bare stole på sky-basert AI til en mer personlig, på-enhet-tilnærming. Målet? Å skape en intelligent assistent som virkelig forstår deg, din verden og den intrikate tapestryen av dine daglige digitale interaksjoner.
I hjertet av ReALM ligger evnen til å løse referanser – disse ambigue pronomenene som “den”, “de” eller “det” som mennesker navigerer med lettighet takket være kontekstuelle hint. For AI-assistenter, however, har dette lenge vært en hindring, som har ført til frustrerende misforståelser og en ujevn brukeropplevelse.
Forestall en situasjon der du ber Siri om å “finn en sunn oppskrift basert på hva som er i kjøleskapet mitt, men hold mushrooms – jeg hater dem.” Med ReALM, ville din iPhone ikke bare forstå referansene til på-skjermen informasjon (innholdet i kjøleskapet) men også huske dine personlige preferanser (mislikning av mushrooms) og den bredere konteksten av å finne en oppskrift tilpasset disse parameterne.
Dette nivået av kontekstuell bevissthet er et kvantum-sprang fra den nøkkelord-matching-tilnærmingen til de fleste nåværende AI-assistenter. Ved å trene LLM til å sømløst løse referanser over tre nøkkel-domener – konversasjon, på-skjerm og bakgrunn – har ReALM som mål å skape en virkelig intelligent digital kompanjong som føles mindre som en robotisk stemme-assistent og mer som en utvidelse av dine egne tankeprosesser.
Det konversasjonelle domenet: Huske hva som kom før
Konversasjonell AI, ReALM takler en langvarig utfordring: å opprettholde kohesjon og minne over flere dialog-runder. Med dens evne til å løse referanser innen en pågående konversasjon, kunne ReALM endelig levere på løftet om en naturlig, frem-og-tilbake-interaksjon med din digitale assistent.
Forestall at du ber Siri om å “påminn meg om å bestille billetter til min ferie når jeg får lønn på fredag.” Med ReALM, ville Siri ikke bare forstå konteksten av dine ferieplaner (potensielt hentet fra en tidligere konversasjon eller på-skjermen informasjon) men også ha bevisstheten til å koble “få lønn” til din vanlige lønnsrutine.
Dette nivået av konversasjonell intelligens føles som et virkelig sprang fremover, som muliggjør sømløse multi-runde dialoger uten frustrasjonen av å måtte forklare konteksten eller gjenta deg selv.
Det på-skjerm-domenet: Gi din assistent øyne
Kanskje det mest banebrytende aspektet av ReALM, er likevel dens evne til å løse referanser til på-skjerm-entiteter – et avgjørende skritt mot å skape en virkelig håndfri, stemme-drevet brukeropplevelse.
Apples forskningsrapport diskuterer en ny teknikk for å kode visuell informasjon fra din enhets skjerm i en format som LLM kan prosessere. Ved å rekonstruere layoutet av din skjerm i en tekst-basert representasjon, kan ReALM “se” og forstå de romlige relasjonene mellom ulike på-skjerm-elementer.
Forestall en situasjon der du ser på en liste over restauranter og ber Siri om “veibeskrivelse til den på Main Street.” Med ReALM, ville din iPhone ikke bare forstå referansen til en bestemt lokasjon, men også knytte den til den relevante på-skjerm-entiteten – restaurantlisten som matcher denne beskrivelsen.
Dette nivået av visuell forståelse åpner opp en verden av muligheter, fra å kunne håndtere referanser innen apper og nettsider til å integrere med fremtidige AR-grensesnitt og sogar oppfatte og svare på sanntids-objekter og miljøer gjennom din enhets kamera.
Forskningsrapporten om Apples ReALM-modell diskuterer de intrikate detaljene om hvordan systemet koder på-skjerm-entiteter og løser referanser over ulike kontekster. Her er en forenklet forklaring av algoritmene og eksemplene som er gitt i rapporten:
- Koding av på-skjerm-entiteter: Rapporten utforsker flere strategier for å kode på-skjerm-elementer i en tekst-basert format som kan prosesseres av en stor språkmodell (LLM). En tilnærming innebærer å gruppere omgivende objekter basert på deres romlige nærhet og generere promter som inkluderer disse grupperte objekter. Imidlertid kan denne metoden føre til overlangt promter når antallet entiteter øker.
Den endelige tilnærmingen som forskerne har valgt, er å parse skjermen i en topp-til-bunn, venstre-til-høyre rekkefølge, representere layoutet i en tekst-basert format. Dette oppnås gjennom Algoritme 2, som sorterer på-skjerm-objekter basert på deres sentrum-koordinater, bestemmer vertikale nivåer ved å gruppere objekter innen en bestemt margin, og konstruerer på-skjerm-parse ved å konkatenerer disse nivåene med tabulatorer som skiller objekter på samme linje.
Ved å injisere de relevante entitetene (telefonnumre i dette tilfelle) i den tekst-baserte representasjonen, kan LLM forstå på-skjerm-konteksten og løse referanser deretter.
- Eksempler på referanse-løsning: Rapporten gir flere eksempler for å illustrere ReALM-modellens evne til å løse referanser over ulike kontekster:
a. Konversasjonelle referanser: For en forespørsel som “Siri, finn en sunn oppskrift basert på hva som er i kjøleskapet mitt, men hold mushrooms – jeg hater dem,” kan ReALM forstå på-skjerm-konteksten (innholdet i kjøleskapet), konversasjons-konteksten (finne en oppskrift) og brukerens preferanser (mislikning av mushrooms).
b. Bakgrunns-referanser: I eksemplet “Siri, spill den sangen som spilte på supermarkedet tidligere,” kan ReALM potensielt fange og identifisere ambient lyd-biter for å løse referansen til den spesifikke sangen.
c. På-skjerm-referanser: For en forespørsel som “Siri, påminn meg om å bestille billetter til ferien når jeg får lønn på fredag,” kan ReALM kombinere informasjon fra brukerens rutiner (lønnsdag), på-skjerm-konversasjoner eller nettsider (ferieplaner) og kalenderen for å forstå og handle på forespørselen.
Disse eksemplene demonstrerer ReALM’s evne til å løse referanser over konversasjonelle, på-skjerm og bakgrunns-kontekster, og muliggjør en mer naturlig og sømløs interaksjon med intelligente assistenter.
Det bakgrunns-domenet
Ved å gå utover bare konversasjonelle og på-skjerm-kontekster, utforsker ReALM også evnen til å løse referanser til bakgrunns-entiteter – disse perifere hendelsene og prosessene som ofte går uoppmerket forbi våre nåværende AI-assistenter.
Forestall en situasjon der du ber Siri om å “spill den sangen som spilte på supermarkedet tidligere.” Med ReALM, kunne din iPhone potensielt fange og identifisere ambient lyd-biter, og la Siri sømløst hente og spille av sporet du hadde i mente.
Dette nivået av bakgrunns-bevissthet føles som det første skrittet mot virkelig ubegrenset, kontekst-bevisst AI-assistanse – en digital kompanjong som ikke bare forstår dine ord, men også den rike tapestryen av dine daglige erfaringer.
Løftet om på-enhet-AI: Personvern og tilpasning
Mens ReALM’s evner er uten tvil imponerende, ligger kanskje dens mest betydelige fordel i Apples langvarige forpliktelse til på-enhet-AI og bruker-privatliv.
I motsetning til sky-basert AI-modeller som avhenger av å sende brukerdata til fjerne servere for prosessering, er ReALM designet for å fungere helt på din iPhone eller andre Apple-enheter. Dette ikke bare adresserer bekymringer rundt data-privatliv, men åpner også opp nye muligheter for AI-assistanse som virkelig forstår og tilpasser seg deg som enkeltperson.
Ved å lære direkte fra dine på-enhet-data – dine konversasjoner, app-bruksmønster og sogar ambient sanntids-innganger – kunne ReALM potensielt skape en hyper-tilpasset digital assistent tilpasset dine unike behov, preferanser og daglige rutiner.
Dette nivået av tilpasning føles som en paradigmeskifte fra den en-størrelse-passer-til-alle-tilnærmingen til nåværende AI-assistenter, som ofte sliter med å tilpasse seg enkeltbrukeres egenheter og kontekster.
ReALM-250M-modellen oppnår imponerende resultater:
-
- Konversasjonell forståelse: 97.8
- Syntetisk oppgave-forståelse: 99.8
- På-skjerm-oppgave-ytelse: 90.6
- Usett domene-håndtering: 97.2
De etiske overveielser
Selvfølgelig, med et så høyt nivå av tilpasning og kontekstuell bevissthet, kommer en rekke etiske overveielser rundt privatliv, transparens og muligheten for at AI-systemer kan påvirke eller sogar manipulere bruker-atferd.
Mens ReALM får en dypere forståelse av dine daglige liv – fra dine spisevaner og medie-forbruksmønster til dine sosiale interaksjoner og personlige preferanser – er det en risiko for at denne teknologien kan brukes på måter som krenker bruker-tillit eller krysser etiske grenser.
Apples forskere er godt klar over denne spenningen, og erkjenner i sin rapport behovet for å finne en balanse mellom å levere en virkelig hjelpsom, tilpasset AI-opplevelse og respektere bruker-privatliv og handlefrihet.
Dette er ikke en utfordring som er unik for Apple eller ReALM – det er en samtale som hele teknologibransjen må engasjere seg i, mens AI-systemer blir stadig mer avanserte og integrert i våre daglige liv.
Mot en smartere, mer naturlig AI-opplevelse
Mens Apple fortsetter å drive grensene for på-enhet-AI med modeller som ReALM, føles løftet om en virkelig intelligent, kontekst-bevisst digital assistent nærmere enn noen gang før.
Forestall en verden der Siri (eller hva denne AI-assistenten måtte hete i fremtiden) føles mindre som en avkoppet stemme fra skyen og mer som en utvidelse av dine egne tankeprosesser – en partner som ikke bare forstår dine ord, men også den rike tapestryen av dine digitale liv, dine daglige rutiner og dine unike preferanser og kontekster.
Fra å kunne håndtere referanser innen apper og nettsider til å forutse dine behov basert på din lokasjon, aktivitet og ambient sanntids-innganger, representerer ReALM et betydelig skritt mot en mer naturlig, sømløs AI-opplevelse som utvisker grensene mellom våre digitale og fysiske verdener.
Selvfølgelig, å realisere denne visjonen, vil kreve mer enn bare teknisk innovasjon – det vil også kreve en tenksom, etisk tilnærming til AI-utvikling som prioriterer bruker-privatliv, transparens og handlefrihet.
Mens Apple fortsetter å forbedre og utvide ReALM’s evner, vil teknologibransjen uten tvil følge med spenning, ivrig etter å se hvordan denne banebrytende AI-modellen former fremtiden for intelligente assistenter og innfører en ny æra av virkelig tilpasset, kontekst-bevisst databehandling.
Om ReALM holder løftet om å overgå selv den mægtige GPT-4, gjenstår å se. Men en ting er sikkert: tiden for AI-assistenter som virkelig forstår oss – våre ord, våre verdener og den rike tapestryen av våre daglige liv – er godt i gang, og Apples siste innovasjon kan meget vel være i forkant av denne revolusjonen.
Jeg har brukt de siste fem årene på å dykke ned i den fasiniserende verden av Maskinlæring og Dypt Læring. Min lidenskap og ekspertise har ledet meg til å bidra til over 50 ulike programvareprosjekter, med særlig fokus på AI/ML. Min pågående nysgjørhet har også trukket meg mot Naturlig Språkbehandling, et felt jeg er ivrig etter å utforske videre.
Oppdag mer


Ford skal bruke Apple Maps-data i sitt driver-assist-system


Apple gjør Siri om til en kontekst-bevisst AI-assistent og lanserer et AI-operativsystem for 2 milliarder enheter


Hvorfor de fleste moderne apper vil være nytteløse i AI-alderen


Apple blokkerer oppdateringer for vibe-kodingapps på grunn av App Store-regler


Gemini 3.1 Pro Setter Ny Rekord for Resonneringsgevinster


Apple bringer Agentic AI-koding til Xcode med Claude og Codex

