AI-modeller og platforme
Revolutionering af AI med Apples ReALM: Fremtiden for intelligente assistenter

Af
Aayush Mittal Mittal
I den konstant udviklende landskab af kunstig intelligens har Apple (AAPL ) stillet en banebrydende tilgang, der kan omdefinere, hvordan vi interagerer med vores iPhones. ReALM, eller Reference Resolution som Language Modeling, er en AI-model, der lover at bringe en ny niveau af kontekstuel bevidsthed og gnidningsløs assistance.
Mens tech-verdenen buzzzer med ophidselse over OpenAI’s GPT-4 og andre store sprogmodeller (LLM’er), repræsenterer Apples ReALM en skift i tænkning – en bevægelse væk fra at afhænge udelukkende af cloud-baseret AI til en mere personlig, på-enhed-tilgang. Målet? At skabe en intelligent assistent, der virkelig forstår dig, din verden og den komplekse væv af dine daglige digitale interaktioner.
I hjertet af ReALM ligger evnen til at løse referencer – disse ambigue pronominer som “det“, “de” eller “den“, som mennesker navigerer med lethed takket være kontekstuelle hints. For AI-assistenter har dette dog længe været en hindring, der har ført til frustrerende misforståelser og en uafhængig brugeroplevelse.
Forestil dig en situation, hvor du beder Siri om at “find en sund opskrift baseret på, hvad der er i mit køleskab, men undlad svampe – jeg hader dem.” Med ReALM ville din iPhone ikke kun forstå referencerne til på-skærmen-information (indholdet af dit køleskab) men også huske dine personlige præferencer (had til svampe) og den bredere kontekst af at finde en opskrift, der er tilpasset disse parametre.
Dette niveau af kontekstuel bevidsthed er et kvantespring fra den nøgleord-matching-tilgang, der er typisk for de fleste nuværende AI-assistenter. Ved at træne LLM’er til at løse referencer på tværs af tre nøgle-domæner – konversation, på-skærmen og baggrund – sigter ReALM mod at skabe en virkelig intelligent digital makker, der føles mindre som en robotisk stemmeassistent og mere som en udvidelse af dine egne tankeprocesser.
Den konversationelle domæne: Huske, hvad der kom før
Konversations-AI, ReALM tackler en længevarende udfordring: at opretholde kohærens og hukommelse på tværs af multiple vendinger i en samtale. Med sin evne til at løse referencer inden for en pågående samtale kunne ReALM endelig indfri løftet om en naturlig, frem-og-tilbage-interaktion med din digitale assistent.
Forestil dig, at du beder Siri om at “huske mig at booke billetter til min ferie, når jeg får løn fredag.” Med ReALM ville Siri ikke kun forstå konteksten af dine ferieplaner (muligvis hentet fra en tidligere samtale eller på-skærmen-information) men også have bevidstheden om at forbinde “at få løn” til din regulære løn-dag-rutine.
Dette niveau af konversations-intelligens føles som et sandt spring fremad, der muliggør gnidningsløse multi-vending-samtaler uden frustrationen over at gentage kontekst eller gentage dig selv.
Den på-skærmen-domæne: At give din assistent øjne
Måske er den mest banebrydende aspekt af ReALM dog dens evne til at løse referencer til på-skærmen-entiteter – et afgørende skridt mod at skabe en virkelig hånd-fri, stemme-drevet brugeroplevelse.
Apples forskningspapir diskuterer en ny teknik til at kodificere visuel information fra din enheds skærm i et format, der kan behandles af LLM’er. Ved at rekonstruere layoutet af din skærm i en tekst-baseret repræsentation kan ReALM “se” og forstå de rumlige relationer mellem forskellige på-skærmen-elementer.
Forestil dig en situation, hvor du kigger på en liste over restauranter og beder Siri om “vejledning til den på Main Street.” Med ReALM ville din iPhone ikke kun forstå referencen til en bestemt lokalitet men også binde den til den relevante på-skærmen-entitet – restauranten, der matcher denne beskrivelse.
Dette niveau af visuel forståelse åbner op for en verden af muligheder, fra gnidningsløst at agere på referencer inden for apps og websites til at integrere med fremtidige AR-grænseflader og endda opfatte og reagere på virkelige objekter og omgivelser gennem din enheds kamera.
Forskningspapiret om Apples ReALM-model taler til de detaljerede detaljer om, hvordan systemet kodificerer på-skærmen-entiteter og løser referencer på tværs af forskellige kontekster. Her er en forenklet forklaring af algoritmerne og eksemplerne, der er givet i papiret:
- Kodificering af på-skærmen-entiteter: Papiret udforsker flere strategier til at kodificere på-skærmen-elementer i et tekst-format, der kan behandles af en Large Language Model (LLM). En tilgang indebærer at gruppere omgivende objekter baseret på deres rumlige nærhed og generere prompts, der inkluderer disse grupperede objekter. Men denne metode kan føre til excessivt lange prompts, når antallet af entiteter øges.
Den endelige tilgang, der er valgt af forskerne, er at parse skærmen i en top-til-bund, venstre-til-højre-rækkefølge, repræsenterer layoutet i et tekst-format. Dette opnås gennem Algoritme 2, der sorterer på-skærmen-objekter baseret på deres center-koordinater, bestemmer vertikale niveauer ved at gruppere objekter inden for en vis margin og konstruerer på-skærmen-parse ved at konkatenerer disse niveauer med tabs, der adskiller objekter på samme linje.
Ved at injicere de relevante entiteter (telefonnumre i dette tilfælde) i den tekst-baserede repræsentation kan LLM’eren forstå på-skærmen-konteksten og løse referencer derefter.
- Eksempler på reference-løsning: Papiret giver flere eksempler for at illustrere ReALM-modellens evne til at løse referencer på tværs af forskellige kontekster:
a. Konversations-referencer: For en anmodning som “Siri, find en sund opskrift baseret på, hvad der er i mit køleskab, men undlad svampe – jeg hader dem,” kan ReALM forstå på-skærmen-konteksten (indholdet af dit køleskab), konversations-konteksten (at finde en opskrift) og brugerens præferencer (had til svampe).
b. Baggrund-referencer: I eksemplet “Siri, afspil den sang, der blev afspillet i supermarkedet tidligere,” kan ReALM potentielt fange og identificere baggrundslyd-klip til at løse referencen til den specifikke sang.
c. På-skærmen-referencer: For en anmodning som “Siri, husk mig at booke billetter til min ferie, når jeg får løn fredag,” kan ReALM kombinere information fra brugerens rutiner (løn-dag), på-skærmen-samtaler eller websites (ferieplaner) og kalenderen for at forstå og agere på anmodningen.
Disse eksempler demonstrerer ReALM’s evne til at løse referencer på tværs af konversations-, på-skærmen- og baggrundskontekster, hvilket muliggør en mere naturlig og gnidningsløs interaktion med intelligente assistenter.
Den baggrund-domæne
Ved at gå ud over kun konversations- og på-skærmen-kontekster udforsker ReALM også evnen til at løse referencer til baggrund-entiteter – disse perifere begivenheder og processer, der ofte går ubemærket hen for vores nuværende AI-assistenter.
Forestil dig en situation, hvor du beder Siri om at “afspil den sang, der blev afspillet i supermarkedet tidligere.” Med ReALM kunne din iPhone potentielt fange og identificere baggrundslyd-klip, så Siri kan gnidningsløst hente og afspille den sang, du havde i tankerne.
Dette niveau af baggrund-bevidsthed føles som det første skridt mod virkelig ubegrænset, kontekst-bevidst AI-assistance – en digital makker, der ikke kun forstår dine ord, men også den komplekse væv af dine daglige oplevelser.
Løftet om på-enhed-AI: Privatliv og personliggørelse
Mens ReALM’s evner uden tvivl er imponerende, ligger dens mest betydningsfulde fordel måske i Apples langvarige engagement for på-enhed-AI og bruger-privatliv.
I modsætning til cloud-baserede AI-modeller, der afhænger af at sende brugerdata til fjerne servere til behandling, er ReALM designet til at fungere helt på din iPhone eller andre Apple-enheder. Dette løser ikke kun bekymringer omkring data-privatliv, men åbner også op for nye muligheder for AI-assistance, der virkelig forstår og tilpasser sig dig som enkeltperson.
Ved at lære direkte fra din på-enhed-data – dine samtaler, app-anvendelsesmønstre og endda baggrundssensoriske input – kunne ReALM potentielt skabe en hyper-personlig digital assistent, der er tilpasset dine unikke behov, præferencer og daglige rutiner.
Dette niveau af personliggørelse føles som en paradigmeskift fra den en-size-fits-all-tilgang, der er typisk for nuværende AI-assistenter, der ofte kæmper med at tilpasse sig enkeltbrugeres særheder og kontekster.
ReALM-250M-modellen opnår imponerende resultater:
-
- Konversations-forståelse: 97.8
- Syntetisk opgave-forståelse: 99.8
- På-skærmen-opgave-ydelse: 90.6
- Uset domæne-håndtering: 97.2
De etiske overvejelser
Selvfølgelig kommer der med så højt et niveau af personliggørelse og kontekstuel bevidsthed en række etiske overvejelser om privatliv, gennemsigtighed og muligheden for, at AI-systemer kan påvirke eller endda manipulere brugeradfærd.
Da ReALM får en dybere forståelse af dine daglige liv – fra dine spisevaner og medieforbrugs-mønstre til dine sociale interaktioner og personlige præferencer – er der en risiko for, at denne teknologi kan blive brugt på måder, der krænker bruger-tillid eller overskride etiske grænser.
Apples forskere er meget bevidste om denne spænding og erkender i deres papir behovet for at finde en balance mellem at levere en virkelig hjælpsom, personlig AI-oplevelse og respektere bruger-privatliv og handlefrihed.
Dette udfordring er ikke unikt for Apple eller ReALM – det er en samtale, som hele tech-industrien må forholde sig til, da AI-systemer bliver mere avancerede og integreret i vores daglige liv.
Mod en smartere, mere naturlig AI-oplevelse
Mens Apple fortsætter med at udvide grænserne for på-enhed-AI med modeller som ReALM, føles løftet om en virkelig intelligent, kontekst-bevidst digital assistent nærmere end nogensinde før.
Forestil dig en verden, hvor Siri (eller hvad denne AI-assistent måtte hedde i fremtiden) føles mindre som en afkorporeret stemme fra skyen og mere som en udvidelse af dine egne tankeprocesser – en partner, der ikke kun forstår dine ord, men også den komplekse væv af dine digitale liv, dine daglige rutiner og dine unikke præferencer og kontekster.
Fra at agere gnidningsløst på referencer inden for apps og websites til at forudse dine behov baseret på din lokalitet, aktivitet og baggrundssensoriske input repræsenterer ReALM et betydningsfuldt skridt mod en mere naturlig, gnidningsløs AI-oplevelse, der udvisker grænserne mellem vores digitale og fysiske verdener.
Selvfølgelig vil realiseringen af denne vision kræve mere end blot teknisk innovation – det vil også kræve en tankefuld, etisk tilgang til AI-udvikling, der prioriterer bruger-privatliv, gennemsigtighed og handlefrihed.
Mens Apple fortsætter med at forfine og udvide ReALM’s evner, vil tech-verdenen uden tvivl følge med spænding, ivrig efter at se, hvordan denne banebrydende AI-model former fremtiden for intelligente assistenter og indleder en ny æra af virkelig personlig, kontekst-bevidst computing.
Om ReALM lever op til sit løfte om at overgå selv den mægtige GPT-4, skal blot vente og se. Men en ting er sikker: tiden for AI-assistenter, der virkelig forstår os – vores ord, vores verdener og den komplekse væv af vores daglige liv – er godt i gang, og Apples seneste innovation kan meget vel være i forkanten af denne revolution.
Jeg har brugt de sidste fem år på at dykke ned i den fascinerende verden af Machine Learning og Deep Learning. Min passion og ekspertise har ført mig til at bidrage til over 50 forskellige software-ingeniørprojekter, med en særlig fokus på AI/ML. Min fortsatte nysgerrighed har også ført mig mod Natural Language Processing, et felt jeg er ivrig efter at udforske yderligere.
Opdag mere


Ford vil integrere Apple Maps-data i sin driver-assist-system


Apple forvandler Siri til en kontekstbevidst AI-assistent og afslører et AI-operativsystem til 2 milliarder enheder


Hvorfor de fleste moderne apps vil være nytteløse i AI-alderen


Apple Blokere Opdateringer Til Vibe Coding Apps Over App Store Regler


Gemini 3.1 Pro sætter rekord i forbedret tænkning


Apple bringer Agentic AI-kodning til Xcode med Claude og Codex

