AI-modeller och plattformar

Från Siri till ReALM: Apples resa mot smartare röstassistenter

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Sedan Siri lanserades 2011 har Apple (AAPL ) varit i framkant när det gäller innovation inom röstassistenter, anpassat till globala användarbehov. Introduktionen av ReALM markerar en betydande punkt i denna resa, och erbjuder en glimt av den utvecklande rollen för röstassistenter i vår interaktion med enheterna. Denna artikel undersöker effekterna av ReALM på Siri och de potentiella riktningarna för framtida röstassistenter.

Röstassistenter på uppgång: Siris ursprung

Resan började när Apple integrerade Siri, ett sofistikerat artificiellt intelligenssystem, i sina enheter, och förvandlade hur vi interagerar med vår teknik. Ursprungligen från teknologi utvecklad av SRI International, blev Siri den gyllene standarden för röstaktiverade assistenter. Användare kunde utföra uppgifter som internet-sökningar och schemaläggning genom enkla röstkommandon, och utvidgade gränserna för konversationsgränssnitt och tände en konkurrenskraftig tävling på röstassistent-marknaden.

Siri 2.0: En ny era för röstassistenter

Medan Apple förbereder sig för lanseringen av iOS 18Worldwide Developers Conference (WWDC) i juni 2024, byggs förväntningar inom tech-samhället för vad som förväntas vara en betydande utveckling av Siri. Denna nya fas, som kallas Siri 2.0, lovar att ta generativa AI-förbättringar till främsta rummet, och potentiellt förvandla Siri till en ännu mer sofistikerad virtuell assistent. Medan de exakta förbättringarna förblir konfidentiella, är tech-världen i uppror med utsikten att Siri uppnår nya höjder i konversationsintelligens och personlig användarinteraktion, med hjälp av den sortens sofistikerade språkinlärningsmodeller som ses i teknologier som ChatGPT. I detta sammanhang antyder introduktionen av ReALM, en kompaktspråkmodell, möjliga förbättringar som Siri 2.0 kan introducera för sina användare. Följande avsnitt kommer att diskutera rollen för ReALM och dess potentiella inflytande som en viktig steg i den pågående utvecklingen av Siri.

Presentation av ReALM

ReALM, som står för Reference Resolution As Language Modeling, är en specialiserad språkmodell som är skicklig på att tolka kontextuella och tvetydiga referenser under samtal, som “den där” eller “det här”. Den sticker ut för sin förmåga att bearbeta konversations- och visuella referenser, och omvandla dem till en textformat. Denna funktion möjliggör för ReALM att tolka och interagera med skärm-layouter och element smidigt inom en dialog, en kritisk funktion för att hantera frågor i visuellt beroende sammanhang.

Arkitekturen för ReALM sträcker sig från mindre versioner som ReALM-80M till större som ReALM-3B, och är optimerade för att vara beräknings-effektiva för integration i mobila enheter. Denna effektivitet möjliggör för konsekvent prestanda med minskad effektanvändning och mindre belastning på bearbetningsresurser, viktigt för att förlänga batteritid och tillhandahålla snabba svarstider på en mängd olika enheter.

Dessutom möjliggör ReALMs design modulära uppdateringar, vilket underlättar den smidiga integrationen av de senaste framstegen inom referenslösning. Denna modulära tillvägagångssätt inte bara förbättrar modellens anpassningsförmåga och flexibilitet, utan säkerställer också dess långsiktiga livskraft och effektivitet, och möjliggör för den att möta utvecklande användarbehov och tekniska standarder över en bred spektrum av enheter.

ReALM vs. Språkmodeller

Medan traditionella språkmodeller som GPT-3.5 huvudsakligen bearbetar text, tar ReALM en multimodal väg, liknande modeller som Gemini, genom att arbeta med både text och visuella element. Till skillnad från de breda funktionerna i GPT-3.5 och Gemini, som hanterar uppgifter som textgenerering, förståelse och bildskapande, är ReALM särskilt inriktad på att tolka konversations- och visuella sammanhang. Men till skillnad från multimodala modeller som Gemini, som direkt bearbetar visuell och textdata, översätter ReALM visuellt innehåll på skärmar till text, annoterar entiteter och deras spatiala detaljer. Denna omvandling möjliggör för ReALM att tolka skärminnehållet på ett textuellt sätt, och underlättar en mer exakt identifiering och förståelse av referenser på skärmen.

Hur ReALM kan förvandla Siri?

ReALM kan avsevärt förbättra Siris förmågor, och förvandla den till en mer intuitiv och kontextmedveten assistent. Här är hur det kan påverka:

  • Bättre kontextuell förståelse: ReALM är specialiserad på att tolka tvetydiga referenser i samtal, och kan potentialt förbättra Siris förmåga att förstå kontextberoende frågor. Detta skulle möjliggöra för användare att interagera med Siri på ett mer naturligt sätt, eftersom den kunde förstå referenser som “spela den låten igen” eller “ringa henne” utan ytterligare detaljer.
  • Förbättrad skärminteraktion: Med sin förmåga att tolka skärm-layouter och element inom dialoger, kunde ReALM möjliggöra för Siri att integrera mer smidigt med en enhets visuella innehåll. Siri kunde då utföra kommandon relaterade till skärmelement, som “öppna appen bredvid Mail” eller “scrolla ner på den här sidan”, och utöka sin användbarhet i olika uppgifter.
  • Personligisering: Genom att lära av tidigare interaktioner, kunde ReALM förbättra Siris förmåga att erbjuda personliga och anpassade svar. Över tiden kunde Siri förutsäga användarbehov och preferenser, och föreslå eller initiera åtgärder baserat på tidigare beteende och kontextuell förståelse, liknande en kunnig personlig assistent.
  • Förbättrad tillgänglighet: De kontextuella och referensförståelseförmågorna hos ReALM kunde avsevärt gynna tillgänglighet, och göra tekniken mer inkluderande. Siri, som drivs av ReALM, kunde tolka otydliga eller ofullständiga kommandon korrekt, och underlätta enklare och mer naturlig enhetsanvändning för personer med fysiska eller visuella funktionshinder.

ReALM och Apples AI-strategi

ReALMs lansering reflekterar en nyckelaspekt av Apples AI-strategi, som betonar enhetsbaserad intelligens. Denna utveckling stämmer överens med den bredare branschtrenden av edge computing, där data bearbetas lokalt på enheter, och minskar latency, sparar bandbredd och säkerställer användardata på enheten själv.

ReALM-projektet visar också Apples bredare AI-mål, som fokuserar inte bara på kommandouppfyllelse, utan också på en djupare förståelse och förutsägelse av användarbehov. ReALM representerar ett steg mot framtida innovationer, där enheter kunde erbjuda mer personliga och förutsägbara stöd, informerat av en djup förståelse av användarvanor och preferenser.

Sammanfattning

Apples utveckling från Siri till ReALM betonar en fortsatt utveckling inom röstassistentteknik, med fokus på förbättrad kontextförståelse och användarinteraktion. ReALM signalerar en övergång till mer intelligenta, personliga och sekretessmedvetna röstassistenter, som stämmer överens med branschtrenden av edge computing för förbättrad enhetsbaserad bearbetning och säkerhet.

Dr. Tehseen Zia är en fast anställd biträdande professor vid COMSATS University Islamabad, med en doktorsexamen i AI från Vienna University of Technology, Österrike. Specialiserad på artificiell intelligens, maskinlärning, datavetenskap och datorseende, har han gjort betydande bidrag med publikationer i ansedda vetenskapliga tidskrifter. Dr. Tehseen har också lett olika industriprojekt som huvudutredare och tjänstgjort som AI-konsult.