AI-modeller og platforme

Fra Siri til ReALM: Apples rejse mod smartere stemmeassistenter

mm
Føj Unite.AI til dine foretrukne kilder på Google

Siden Siri’s lancering i 2011 har Apple (AAPL ) konsekvent været i frontlinjen for innovation inden for stemmeassistenter, tilpasset globale brugernes behov. Introduktionen af ReALM markerer et betydningsfuldt punkt i denne rejse, og giver et glimt ind i den udviklende rol for stemmeassistenter i vores interaktion med enhederne. Denne artikel undersøger effekterne af ReALM på Siri og de potentielle retninger for fremtidige stemmeassistenter.

Stemmeassistenterne opstår: Siri’s oprindelse

Rejsen begyndte, da Apple integrerede Siri, et sofistikeret kunstig intelligenssystem, i sine enheder, og ændrede, hvordan vi interagerer med vores teknologi. Oprindeligt udviklet af SRI International, blev Siri den guldstandard for stemmeaktiverede assistenter. Brugere kunne udføre opgaver som internetsøgninger og planlægning gennem simple stemmekommandoer, og udvidede grænserne for konversationsgrænseflader og antændte en konkurrenceskab i markedet for stemmeassistenter.

Siri 2.0: En ny æra for stemmeassistenter

Da Apple forbereder sig på lanceringen af iOS 18Worldwide Developers Conference (WWDC) i juni 2024, bygger forventningerne op inden for tech-samfundet til, hvad der forventes at blive en betydningsfuld udvikling af Siri. Denne nye fase, kendt som Siri 2.0, lover at bringe generative AI-fremgang til fronten, og potentielt transformere Siri til en endnu mere sofistikeret virtuel assistent. Selvom de eksakte forbedringer forbliver fortrolige, er tech-verdenen i gang med udsigten til, at Siri kan nå nye højder i konversationsintelligens og personlig brugerinteraktion, ved at udnytte den slags sofistikerede sprogindlæringsmodeller, der ses i teknologier som ChatGPT. I denne kontekst antyder introduktionen af ReALM, en kompakt sprogmodel, mulige forbedringer, som Siri 2.0 muligvis kan introducere for sine brugere. De følgende afsnit vil diskutere rollen af ReALM og dens potentielle indflydelse som et vigtigt skridt i den fortsatte udvikling af Siri.

Præsentation af ReALM

ReALM, som står for Reference Resolution As Language Modeling, er en specialiseret sprogmodel, der er dygtig til at afkode kontekstuelle og tvetydige referencer under samtaler, som f.eks. “den ene” eller “dette”. Den adskiller sig ved sin evne til at behandle konversations- og visuelle referencer og omdanne dem til en tekstformat. Denne funktion giver ReALM mulighed for at fortolke og interagere med skærmlayout og -elementer uden problemer inden for en dialog, en kritisk funktion til nøjagtig håndtering af forespørgsler i visuelt afhængige kontekster.

ReALM’s arkitektur strækker sig fra mindre versioner som ReALM-80M til større som ReALM-3B, og er optimeret til at være komputermæssigt effektive til integration i mobile enheder. Denne effektivitet giver mulighed for konstant præstation med reduceret strømforbrug og mindre belastning på behandlingsressourcer, vigtigt for at forlænge batteriliv og give hurtige responsider på en række enheder.

Desuden er ReALM’s design tilpasset modulære opdateringer, hvilket giver mulighed for en problemfri integration af de seneste fremgang i referenceopløsning. Denne modulære tilgang giver ikke kun models adaptivitet og fleksibilitet, men sikrer også dens langsigtede levedygtighed og effektivitet, og giver mulighed for at imødekomme udviklende brugerbehov og teknologiske standarder på en bred vifte af enheder.

ReALM vs. sprogmodeller

Mens traditionelle sprogmodeller som GPT-3.5 hovedsagelig behandler tekst, tager ReALM en multimodal vej, lignende modeller som Gemini, ved at arbejde med både tekst og visuelt indhold. I modsætning til de bredere funktioner af GPT-3.5 og Gemini, som håndterer opgaver som tekstgenerering, forståelse og billedskabelse, er ReALM specifikt rettet mod at afkode konversations- og visuelle kontekster. Dog, i modsætning til multimodale modeller som Gemini, som direkte behandler visuelt og tekstindhold, oversætter ReALM visuelt indhold af skærme til tekst, annoterer enheder og deres rumlige detaljer. Denne omformning giver ReALM mulighed for at fortolke skærminhold i en tekstuel måde, og giver mulighed for en mere præcis identifikation og forståelse af skærmelementer.

Hvordan ReALM kan transformere Siri?

ReALM kan potentielt forbedre Siri’s evner, og omdanne den til en mere intuitiv og kontekstbevidst assistent. Her er, hvordan det muligvis kan påvirke:

  • Bedre kontekstforståelse: ReALM specialiserer sig i at afkode tvetydige referencer i samtaler, og kan potentielt forbedre Siri’s evne til at forstå kontekstafhængige forespørgsler. Dette giver brugerne mulighed for at interagere med Siri på en mere naturlig måde, da den kan forstå referencer som “afspil den sang igen” eller “ring hende” uden yderligere detaljer.
  • Forbedret skærminteraktion: Med sin evne til at fortolke skærmlayout og -elementer inden for en dialog, kan ReALM give Siri mulighed for at integrere mere flydende med en enheds visuelle indhold. Siri kan derefter udføre kommandoer relateret til skærmelementer, som f.eks. “åbn appen ved siden af Mail” eller “rul ned på denne side”, og udvide dens nytte i forskellige opgaver.
  • Personliggørelse: Ved at lære af tidligere interaktioner, kan ReALM forbedre Siri’s evne til at tilbyde personlige og adaptive svar. Over tid kan Siri muligvis forudsige brugernes behov og præferencer, og foreslå eller initiere handlinger baseret på tidligere adfærd og kontekstforståelse, lignende en kyndig personlig assistent.
  • Forbedret tilgængelighed: ReALM’s kontekstuelle og referenceforståelsesevner kan potentielt have en betydelig positiv effekt på tilgængelighed, og gøre teknologi mere inklusiv. Siri, drevet af ReALM, kan fortolke og håndtere vagt eller delvis kommandoer præcist, og giver mulighed for en lettere og mere naturlig brug af enheder for personer med fysiske eller visuelle handicaps.

ReALM og Apples AI-strategi

ReALM’s lancering afspejler en nøgleaspekt af Apples AI-strategi, med fokus på på-enhed-intelligens. Denne udvikling er i tråd med den bredere industrielle trend af edge-computing, hvor data behandles lokalt på enheder, reducerer latency, konserverer båndbredde og sikrer brugerdata på enheden selv.

ReALM-projektet viser også Apples bredere AI-mål, med fokus ikke kun på kommandoeksekvering, men også på en dybere forståelse og forudsigelse af brugernes behov. ReALM repræsenterer et skridt mod fremtidige innovationer, hvor enheder kan give mere personlige og prædictive støtte, informeret af en dyb forståelse af brugernes vaner og præferencer.

Bottom Line

Apples udvikling fra Siri til ReALM højligter en fortsat udvikling i stemmeassistent-teknologi, med fokus på forbedret kontekstforståelse og brugerinteraktion. ReALM markerer en skiftning mod mere intelligente, personlige og privatbevidste stemmeassistenter, i tråd med den industrielle trend af edge-computing til forbedret på-enhed-behandling og sikkerhed.

Dr. Tehseen Zia er en fastansat lektor ved COMSATS University Islamabad, med en ph.d. i AI fra Vienna University of Technology, Østrig. Specialiseret i kunstig intelligens, maskinlæring, datavidenskab og computer vision, har han gjort betydelige bidrag med publikationer i anerkendte videnskabelige tidsskrifter. Dr. Tehseen har også ledet forskellige industrielle projekter som hovedundersøger og fungeret som AI-rådgiver.