AI-modeller och plattformar
Revolutionerar AI med Apples ReALM: Framtiden för intelligenta assistenter

Av
Aayush Mittal Mittal
I den ständigt föränderliga landskapet av artificiell intelligens har Apple (AAPL ) tyst pioneerat en banbrytande approach som kan omdefiniera hur vi interagerar med våra iPhones. ReALM, eller Reference Resolution som Language Modeling, är en AI-modell som lovar att bringa en ny nivå av kontextuell medvetenhet och sömlös assistans.
Medan tech-världen surrar av upphetsning över OpenAI:s GPT-4 och andra stora språkmodeller (LLM), representerar Apples ReALM en skift i tänkande – en rörelse bort från att enbart förlita sig på molnbaserad AI till en mer personlig, enhetsbaserad approach. Målet? Att skapa en intelligent assistent som verkligen förstår dig, din värld och den intrikata väven av dina dagliga digitala interaktioner.
I hjärtat av ReALM ligger förmågan att lösa referenser – de tvetydiga pronomen som “den”, “de” eller “det” som människor navigerar med lätthet tack vare kontextuella ledtrådar. För AI-assistenter har detta dock länge varit ett hinder, vilket har lett till frustrerande missförstånd och en ojämn användarupplevelse.
Tänk dig en scenario där du ber Siri att “hitta en hälsosam recept baserat på vad som finns i min kylskåp, men uteslut svamp – jag hatar dem.” Med ReALM skulle din iPhone inte bara förstå referenserna till på-skärminformationen (innehållet i ditt kylskåp) utan också komma ihåg dina personliga preferenser (ogillar svamp) och den bredare kontexten av att hitta ett recept anpassat till dessa parametrar.
Denna nivå av kontextuell medvetenhet är ett kvantsprång från den nyckelordsmatchningsapproach som de flesta nuvarande AI-assistenter använder. Genom att träna LLM att sömlöst lösa referenser över tre nyckeldomäner – konversationell, på-skärm och bakgrund – syftar ReALM till att skapa en verkligt intelligent digital kompanjon som känns mindre som en robotröst och mer som en utvidgning av dina egna tankeprocesser.
Den konversationella domänen: Komma ihåg vad som kom före
Konversationell AI, ReALM tacklar en långvarig utmaning: att upprätthålla sammanhang och minne över flera konversationsomgångar. Med dess förmåga att lösa referenser inom en pågående konversation kunde ReALM slutligen infria löftet om en naturlig, växelvis interaktion med din digitala assistent.
Tänk dig att du ber Siri att “påminna mig att boka biljetter till min semester när jag får lön på fredag.” Med ReALM skulle Siri inte bara förstå kontexten av din semesterplan (potentiellt insamlad från en tidigare konversation eller på-skärminformation) utan också ha medvetenheten att koppla “få lön” till din regelbundna löneutbetalning.
Denna nivå av konversationsintelligens känns som ett verkligt språng framåt, vilket möjliggör sömlösa multi-omgångskonversationer utan frustrationen av att ständigt förklara kontext eller upprepa dig själv.
Den på-skärm-domänen: Ge din assistent ögon
Kanske den mest banbrytande aspekten av ReALM ligger i dess förmåga att lösa referenser till på-skärmsentiteter – ett avgörande steg mot att skapa en verkligt handsfree, röststyrd användarupplevelse.
Apples forskningsartikel diskuterar en ny teknik för att koda visuell information från din enhets skärm i ett format som LLM kan bearbeta. Genom att i princip rekonstruera layouten av din skärm i en textbaserad representation kan ReALM “se” och förstå de rumsliga relationerna mellan olika på-skärms-element.
Tänk dig en scenario där du tittar på en lista med restauranger och ber Siri att “ge mig vägbeskrivning till den på Main Street.” Med ReALM skulle din iPhone inte bara förstå referensen till en specifik plats utan också koppla den till den relevanta på-skärmsentiteten – restauranglistningen som matchar den beskrivningen.
Denna nivå av visuell förståelse öppnar upp en värld av möjligheter, från att sömlöst agera på referenser inom appar och webbplatser till att integrera med framtida AR-gränssnitt och till och med uppfatta och svara på verkliga objekt och miljöer genom din enhets kamera.
Forskningsartikeln om Apples ReALM-modell diskuterar de intrikata detaljerna om hur systemet kodar på-skärmsentiteter och löser referenser över olika sammanhang. Här är en förenklad förklaring av algoritmerna och exemplen som ges i artikeln:
- Kodning av på-skärmsentiteter: Artikeln utforskar flera strategier för att koda på-skärms-element i ett textbaserat format som kan bearbetas av en Large Language Model (LLM). En approach innebär att klustra omgivande objekt baserat på deras rumsliga närhet och generera prompts som inkluderar dessa klustrade objekt. Men denna metod kan leda till onödigt långa prompts när antalet entiteter ökar.
Den slutliga approachen som forskarna antog är att parska skärmen i en topp-till-botten, vänster-till-höger ordning, representera layouten i ett textbaserat format. Detta uppnås genom Algoritm 2, som sorterar på-skärmsobjekten baserat på deras centrumkoordinater, bestämmer vertikala nivåer genom att gruppera objekt inom en viss marginal och konstruerar på-skärmsparsen genom att konkatenera dessa nivåer med flikar som separerar objekt på samma rad.
Genom att injicera relevanta entiteter (telefonnummer i detta fall) i den textbaserade representationen kan LLM förstå på-skärmskontexten och lösa referenser enligt.
- Exempel på referenslösning: Artikeln tillhandahåller flera exempel för att illustrera ReALM-modellens förmåga att lösa referenser över olika sammanhang:
a. Konversationsreferenser: För en begäran som “Siri, hitta en hälsosam recept baserat på vad som finns i min kylskåp, men uteslut svamp – jag hatar dem”, kan ReALM förstå på-skärmskontexten (innehållet i ditt kylskåp), konversationskontexten (att hitta ett recept) och användarens preferenser (ogillar svamp).
b. Bakgrundsreferenser: I exemplet “Siri, spela den låt som spelades på stormarknaden tidigare”, kan ReALM potentiellt fånga och identifiera bakgrundsaudiosnuttar för att lösa referensen till den specifika låten.
c. På-skärmsreferenser: För en begäran som “Siri, påminna mig att boka biljetter till semestern när jag får lön på fredag”, kan ReALM kombinera information från användarens rutiner (löneutbetalning), på-skärmskonversationer eller webbplatser (semesterplaner) och kalendern för att förstå och agera på begäran.
Dessa exempel demonstrerar ReALM:s förmåga att lösa referenser över konversations-, på-skärms- och bakgrundscontext, vilket möjliggör en mer naturlig och sömlös interaktion med intelligenta assistenter.
Bakgrundsdomänen
Utöver konversations- och på-skärmskontext, utforskar ReALM också förmågan att lösa referenser till bakgrundsentiteter – de perifera händelser och processer som ofta går obemärkta förbi våra nuvarande AI-assistenter.
Tänk dig en scenario där du ber Siri att “spela den låt som spelades på stormarknaden tidigare.” Med ReALM kunde din iPhone potentiellt fånga och identifiera bakgrundsaudiosnuttar, vilket möjliggör för Siri att sömlöst hämta och spela upp låten du hade i åtanke.
Denna nivå av bakgrundsmedvetenhet känns som det första steget mot en verkligt allomfattande, kontextuell AI-assistans – en digital kompanjon som inte bara förstår dina ord, men också den rika väven av dina dagliga upplevelser.
Löftet om enhetsbaserad AI: Sekretess och personanpassning
Medan ReALM:s förmågor är utan tvekan imponerande, ligger dess kanske mest signifikanta fördel i Apples långvariga åtagande till enhetsbaserad AI och användarsekretess.
Till skillnad från molnbaserade AI-modeller som förlitar sig på att skicka användardata till avlägsna servrar för bearbetning, är ReALM utformad för att fungera helt på din iPhone eller andra Apple-enheter. Detta adresserar inte bara problem kring datasekretess, utan öppnar också upp nya möjligheter för AI-assistans som verkligen förstår och anpassar sig till dig som individ.
Genom att lära direkt från din enhetsdata – dina konversationer, appanvändningsmönster och till och med bakgrunds-sensoriska indata – kunde ReALM potentiellt skapa en hyperpersonlig digital assistent anpassad till dina unika behov, preferenser och dagliga rutiner.
Denna nivå av personanpassning känns som en paradigmförändring från den enhetliga approachen hos nuvarande AI-assistenter, som ofta kämpar för att anpassa sig till enskilda användares egenheter och sammanhang.
ReALM-250M-modellen uppnår imponerande resultat:
-
- Konversationsförståelse: 97,8
- Syntetisk uppgiftsförståelse: 99,8
- På-skärmsuppgiftsprestation: 90,6
- Osett domänhantering: 97,2
Etiska överväganden
Självklart, med en sådan hög grad av personanpassning och kontextuell medvetenhet, kommer en mängd etiska överväganden kring sekretess, transparens och risken för att AI-system kan påverka eller till och med manipulera användarbetende.
När ReALM får en djupare förståelse för ditt dagliga liv – från dina matvanor och mediekonsumtionsmönster till dina sociala interaktioner och personliga preferenser – finns det en risk för att denna teknik används på sätt som kränker användarförtroende eller korsar etiska gränser.
Apples forskare är väl medvetna om denna spänning och erkänner i sin artikel behovet av att hitta en balans mellan att leverera en verkligt hjälpsam, personanpassad AI-upplevelse och respektera användarsekretess och handlingsfrihet.
Denna utmaning är inte unik för Apple eller ReALM, utan en konversation som hela tech-industrin måste hantera när AI-system blir alltmer avancerade och integrerade i våra dagliga liv.
Mot en smartare, mer naturlig AI-upplevelse
Medan Apple fortsätter att driva gränserna för enhetsbaserad AI med modeller som ReALM, känns löftet om en verkligt intelligent, kontextuell digital assistent mer överkomlig än någonsin tidigare.
Tänk dig en värld där Siri (eller vad denna AI-assistent kan kallas i framtiden) känns mindre som en avkroppad röst från molnet och mer som en utvidgning av dina egna tankeprocesser – en partner som inte bara förstår dina ord, utan också den rika väven av ditt digitala liv, dina dagliga rutiner och dina unika preferenser och sammanhang.
Från att sömlöst agera på referenser inom appar och webbplatser till att förutse dina behov baserat på din plats, aktivitet och bakgrunds-sensoriska indata, representerar ReALM ett signifikant steg mot en mer naturlig, sömlös AI-upplevelse som suddar ut gränserna mellan vår digitala och fysiska värld.
För att förverkliga denna vision kommer det att krävas mer än bara teknisk innovation – det kommer också att kräva en genomtänkt, etisk approach till AI-utveckling som prioriterar användarsekretess, transparens och handlingsfrihet.
Medan Apple fortsätter att förfinare och expandera ReALM:s förmågor, kommer tech-världen utan tvekan att se på med spänning, ivriga att se hur denna banbrytande AI-modell formar framtiden för intelligenta assistenter och inleder en ny era av verkligt personanpassad, kontextuell datoranvändning.
Om ReALM infriar sitt löfte att överträffa till och med den mäktiga GPT-4 återstår att se. Men en sak är säker: åldern för AI-assistenter som verkligen förstår oss – våra ord, vår värld och den rika väven av våra dagliga liv – är väl på gång, och Apples senaste innovation kan mycket väl vara i framkanten av denna revolution.
Jag har tillbringat de senaste fem åren med att dyka djupt in i den fascinerande världen av Maskinlärning och Djupinlärning. Min passion och expertis har lett mig till att bidra till över 50 olika mjukvaruprojekt, med särskild fokus på AI/ML. Min pågående nyfikenhet har också lett mig mot Naturlig Språkbehandling, ett område som jag är angelägen om att utforska vidare.
Upptäck mer


Ford kommer att dirigera Apple Maps-data till sitt förarassistanssystem


Apple förvandlar Siri till en kontextmedveten AI-assistent och presenterar ett AI-operativsystem för 2 miljarder enheter


Varför de flesta moderna appar kommer att vara värdelösa i AI-eran


Apple blockerar uppdateringar för Vibe Coding-appar på grund av App Store-regler


Gemini 3.1 Pro Sätter Rekord i Resonemangsförmåga


Apple för med Agentic AI-kodning till Xcode med Claude och Codex

