Modele i platformy AI
Rewolucjonizacja sztucznej inteligencji z Apple’s ReALM: Przyszłość inteligentnych asystentów

Przez
Aayush Mittal Mittal
W ciągle ewoluującym krajobrazie sztucznej inteligencji, Apple (AAPL ) cicho prowadzi przełomowy projekt, który może zdefiniować, jak będziemy wchodzić w interakcje z naszymi iPhone’ami. ReALM, czyli Reference Resolution as Language Modeling, to model sztucznej inteligencji, który obiecuje przynieść nowy poziom świadomości kontekstowej i bezproblemowej asysty.
Podczas gdy świat techniki buzzy z ekscytacją nad OpenAI’s GPT-4 i innymi dużymi modelami językowymi (LLM), ReALM Apple’a reprezentuje zmianę myślenia – odejście od polegania wyłącznie na chmurowej sztucznej inteligencji w kierunku bardziej personalizowanego, urządzeniowego podejścia. Celem jest stworzenie inteligentnego asystenta, który naprawdę rozumie ciebie, twój świat i skomplikowaną tькькькькькькькькькькькькьkkę twoich codziennych interakcji cyfrowych.
W sercu ReALM leży zdolność do rozwiązywania odniesień – tych niejednoznacznych zaimków, takich jak “to“, “oni” lub “to“, które ludzie nawigują z łatwością dzięki kontekstowym wskazówkom. Dla asystentów sztucznej inteligencji jednak było to długo przeszkodą, prowadzącą do frustrujących nieporozumień i rozczarowującego doświadczenia użytkownika.
Wyobraź sobie sytuację, w której prosisz Siri o “znalezienie zdrowej receptury na podstawie tego, co jest w twojej lodówce, ale bez grzybów – nie lubisz ich”. Z ReALM, twój iPhone nie tylko zrozumie odniesienia do informacji na ekranie (zawartość twojej lodówki), ale także zapamięta twoje osobiste preferencje (niechęć do grzybów) i szerszy kontekst znalezienia receptury dostosowanej do tych parametrów.
Ten poziom świadomości kontekstowej jest skokiem kwantowym od podejścia dopasowania słów kluczowych większości obecnych asystentów sztucznej inteligencji. Poprzez szkolenie LLM do bezproblemowego rozwiązywania odniesień w trzech kluczowych dziedzinach – konwersacyjnej, na ekranie i tle – ReALM ma na celu stworzenie prawdziwie inteligentnego towarzysza cyfrowego, który czuje się mniej jak głos robota i bardziej jak rozszerzenie twoich własnych procesów myślowych.
Domena konwersacyjna: Pamiętanie o tym, co było wcześniej
Sztuczna inteligencja konwersacyjna, ReALM zajmuje się długoletnim wyzwaniem: utrzymanie spójności i pamięci w trakcie wielu tur dialogu. Z jego zdolnością do rozwiązywania odniesień w trakcie trwającej konwersacji, ReALM może wreszcie spełnić obietnicę naturalnej, dwukierunkowej interakcji z twoim cyfrowym asystentem.
Wyobraź sobie, że prosisz Siri o “przypomnienie, aby zarezerwować bilety na wakacje, kiedy dostaniesz pieniądze w piątek”. Z ReALM, Siri nie tylko zrozumie kontekst twoich planów wakacyjnych (potencjalnie pozyskanych z poprzedniej konwersacji lub informacji na ekranie), ale także będzie miała świadomość, aby połączyć “dostanie pieniędzy” z twoim regularnym harmonogramem wypłat.
Ten poziom inteligencji konwersacyjnej wydaje się prawdziwym skokiem do przodu, umożliwiającym bezproblemowe, wieloturów dialogi bez frustracji z powodu ciągłego wyjaśniania kontekstu lub powtarzania się.
Domena na ekranie: Dając twojemu asystentowi oczy
Być może najbardziej przełomowy aspekt ReALM leży w jego zdolności do rozwiązywania odniesień do jednostek na ekranie – kluczowy krok w kierunku stworzenia prawdziwie bezręcznego, sterowanego głosem doświadczenia użytkownika.
Artykuł badawczy Apple omawia nowatorską technikę kodowania informacji wizualnych z ekranu twojego urządzenia w format, który LLM może przetworzyć. Poprzez odtworzenie układu twojego ekranu w reprezentacji opartej na tekście, ReALM może “zobaczyć” i zrozumieć relacje przestrzenne między różnymi elementami na ekranie.
Rozważ sytuację, w której patrzysz na listę restauracji i prosisz Siri o “wskazówki do tej na Main Street”. Z ReALM, twój iPhone nie tylko zrozumie odniesienie do określonej lokalizacji, ale także powiąże ją z odpowiednią jednostką na ekranie – listą restauracji pasującą do tego opisu.
Ten poziom zrozumienia wizualnego otwiera świat możliwości, od bezproblemowego działania na odniesienia w aplikacjach i na stronach internetowych po integrację z przyszłymi interfejsami AR i nawet postrzeganie i reagowanie na obiekty i środowiska rzeczywiste za pomocą kamery twojego urządzenia.
Artykuł badawczy na temat modelu ReALM Apple omawia szczegółowe informacje o tym, jak system koduje jednostki na ekranie i rozwiązuje odniesienia w różnych kontekstach. Oto uproszczona wyjaśnienie algorytmów i przykładów przedstawionych w artykule:
- Kodowanie jednostek na ekranie: Artykuł omawia kilka strategii kodowania elementów na ekranie w formacie tekstowym, który może być przetworzony przez LLM. Jednym z podejść jest grupowanie otaczających obiektów na podstawie ich przestrzennej bliskości i generowanie podpowiedzi, które zawierają te zgrupowane obiekty. Jednak ten sposób może prowadzić do nadmiernie długich podpowiedzi, gdy liczba jednostek wzrasta.
Ostateczne podejście przyjęte przez badaczy polega na parsowaniu ekranu w kolejności od góry do dołu, lewej do prawej, reprezentując układ w formacie tekstowym. To jest osiągane za pomocą algorytmu 2, który sortuje obiekty na ekranie na podstawie ich współrzędnych środka, określa poziomy pionowe, grupując obiekty w ramach określonej granicy, i konstruuje parse ekranu, łącząc te poziomy z tabulatorami, oddzielającymi obiekty na tym samym poziomie.
Poprzez wstrzyknięcie odpowiednich jednostek (numery telefonu w tym przypadku) do reprezentacji tekstowej, LLM może zrozumieć kontekst na ekranie i rozwiązać odniesienia odpowiednio.
- Przykłady rozwiązywania odniesień: Artykuł zawiera kilka przykładów, aby zilustrować możliwości modelu ReALM w rozwiązywaniu odniesień w różnych kontekstach:
a. Odwołania konwersacyjne: Dla prośby “Siri, znajdź mi zdrową recepturę na podstawie tego, co jest w mojej lodówce, ale bez grzybów – nie lubię ich”, ReALM może zrozumieć kontekst na ekranie (zawartość twojej lodówki), kontekst konwersacyjny (znalezienie receptury) i twoje preferencje (niechęć do grzybów).
b. Odwołania tła: W przykładzie “Siri, odtwórz tę piosenkę, która grała w supermarketze wcześniej”, ReALM może potencjalnie przechwycić i zidentyfikować fragmenty dźwięku, aby rozwiązać odniesienie do określonej piosenki.
c. Odwołania na ekranie: Dla prośby “Siri, przypomnij mi, aby zarezerwować bilety na wakacje, kiedy dostanę pensję w piątek”, ReALM może połączyć informacje z twoich rutyn (dzień wypłaty), konwersacji na ekranie lub stronach internetowych (planów wakacyjnych) i kalendarza, aby zrozumieć i działać na prośbę.
Te przykłady demonstrują zdolność ReALM do rozwiązywania odniesień w kontekstach konwersacyjnych, na ekranie i tle, umożliwiając bardziej naturalną i bezproblemową interakcję z inteligentnymi asystentami.
Domena tła
Przechodząc poza konteksty konwersacyjne i na ekranie, ReALM bada także możliwość rozwiązywania odniesień do jednostek tła – tych peryferyjnych zdarzeń i procesów, które często pozostają niezauważone przez naszych obecnych asystentów sztucznej inteligencji.
Wyobraź sobie sytuację, w której prosisz Siri o “odtworzenie tej piosenki, która grała w supermarketze wcześniej”. Z ReALM, twój iPhone mógłby potencjalnie przechwycić i zidentyfikować fragmenty dźwięku, pozwalając Siri na bezproblemowe odtworzenie utworu, o którym myślałeś.
Ten poziom świadomości tła wydaje się pierwszym krokiem w kierunku prawdziwie wszechobecnej, kontekstowo świadomej asysty sztucznej inteligencji – cyfrowego towarzysza, który nie tylko rozumie twoje słowa, ale także bogatą tькькькькькькькькьkkę twoich codziennych doświadczeń.
Obietnica sztucznej inteligencji na urządzeniu: Prywatność i personalizacja
Podczas gdy możliwości ReALM są niewątpliwie imponujące, być może jego największa zaleta leży w długoletnim zaangażowaniu Apple w sztuczną inteligencję na urządzeniu i prywatność użytkownika.
W przeciwieństwie do modeli sztucznej inteligencji opartych na chmurze, które polegają na wysyłaniu danych użytkownika do serwerów zdalnych w celu przetworzenia, ReALM jest zaprojektowany, aby działać całkowicie na twoim iPhone’u lub innych urządzeniach Apple. To nie tylko rozwiązuje obawy dotyczące prywatności danych, ale także otwiera nowe możliwości asysty sztucznej inteligencji, która naprawdę rozumie i dostosowuje się do ciebie jako jednostki.
Poprzez uczenie się bezpośrednio z twoich danych na urządzeniu – twoich rozmów, wzorców użycia aplikacji i nawet sensorycznych danych ambientalnych – ReALM mógłby potencjalnie stworzyć hiperpersonalizowanego cyfrowego asystenta dostosowanego do twoich unikalnych potrzeb, preferencji i codziennych rutyn.
Ten poziom personalizacji wydaje się paradygmatyczną zmianą w podejściu “jedno rozmiar pasuje do wszystkich” obecnych asystentów sztucznej inteligencji, które często mają trudności z adaptacją do indywidualnych użytkowników i ich kontekstów.
ReALM-250M model osiąga imponujące wyniki:
-
- Zrozumienie konwersacyjne: 97.8
- Zrozumienie zadań syntetycznych: 99.8
- Wydajność zadań na ekranie: 90.6
- Obsługa nieznanego domeny: 97.2
Rozważania etyczne
Oczywiście, z takim wysokim poziomem personalizacji i świadomości kontekstowej pojawia się szereg rozważań etycznych dotyczących prywatności, przejrzystości i potencjalnego wpływu systemów sztucznej inteligencji na zachowanie użytkownika.
Podczas gdy ReALM zyskuje głębsze zrozumienie twoich codziennych doświadczeń – od twoich nawyków żywieniowych i wzorców konsumpcji mediów po twoje interakcje społeczne i osobiste preferencje – istnieje ryzyko, że ta technologia będzie wykorzystywana w sposób, który narusza zaufanie użytkownika lub przekracza granice etyczne.
Badacze Apple są świadomi tego napięcia, uznając w swoim artykule potrzebę znalezienia równowagi między dostarczaniem naprawdę pomocnego, personalizowanego doświadczenia sztucznej inteligencji a poszanowaniem prywatności i autonomii użytkownika.
To wyzwanie nie jest unikalne dla Apple czy ReALM – jest to rozmowa, którą cały przemysł technologiczny musi prowadzić, gdy systemy sztucznej inteligencji stają się coraz bardziej zaawansowane i integrują się z naszym codziennym życiem.
W kierunku bardziej inteligentnego i naturalnego doświadczenia sztucznej inteligencji
Podczas gdy Apple kontynuuje rozwijanie granic sztucznej inteligencji na urządzeniu z modelami takimi jak ReALM, obietnica prawdziwie inteligentnego, kontekstowo świadomego cyfrowego asystenta wydaje się bliższa niż kiedykolwiek wcześniej.
Wyobraź sobie świat, w którym Siri (lub jakikolwiek inny asystent sztucznej inteligencji w przyszłości) czuje się mniej jak oddalony głos z chmury i bardziej jak rozszerzenie twoich własnych procesów myślowych – partner, który nie tylko rozumie twoje słowa, ale także bogatą tькькькькькькькькьkkę twojego cyfrowego życia, twoich codziennych rutyn i twoich unikalnych preferencji i kontekstów.
Od bezproblemowego działania na odniesienia w aplikacjach i na stronach internetowych po anticipowanie twoich potrzeb na podstawie twojej lokalizacji, aktywności i sensorycznych danych ambientalnych, ReALM reprezentuje znaczący krok w kierunku bardziej naturalnego, bezproblemowego doświadczenia sztucznej inteligencji, które zaciera granice między naszymi światami cyfrowymi i fizycznymi.
Oczywiście, realizacja tej wizji wymaga więcej niż tylko innowacji technologicznych – wymaga także przemyślanego, etycznego podejścia do rozwoju sztucznej inteligencji, które priorytetem jest prywatność, przejrzystość i autonomia użytkownika.
Podczas gdy Apple kontynuuje udoskonalanie i rozwijanie możliwości ReALM, świat techniki będzie z pewnością obserwował z zainteresowaniem, aby zobaczyć, jak ten przełomowy model sztucznej inteligencji kształtuje przyszłość inteligentnych asystentów i wprowadza nową erę prawdziwie personalizowanej, kontekstowo świadomej informatyki.
Czy ReALM spełni swoją obietnicę przewyższania nawet potężnego GPT-4, pozostaje do zobaczenia. Ale jedna rzecz jest pewna: era asystentów sztucznej inteligencji, które naprawdę rozumieją nas – nasze słowa, nasze światy i bogatą tькькькькькькькькьkkę naszego codziennego życia – jest w pełnym toku, a najnowsza innowacja Apple może być na czele tej rewolucji.
Przez ostatnie pięć lat zanurzałem się w fascynującym świecie Machine Learning i Deep Learning. Moja pasja i ekspertyza doprowadziły mnie do udziału w ponad 50 różnorodnych projektach inżynierii oprogramowania, ze szczególnym uwzględnieniem AI/ML. Moja nieustanna ciekawość również skierowała mnie w stronę Natural Language Processing, dziedziny, którą chcę dalej eksplorować.
Odkryj więcej


Ford będzie wykorzystywał dane z Apple Maps w swoim systemie wspomagania kierowcy


Apple Przekształca Siri w Asystenta AI Świadomego Kontekstu i Prezentuje System Operacyjny AI dla 2 Miliardów Urządzeń


Dlaczego Większość Współczesnych Aplikacji Będzie Przestarzała w Erze Sztucznej Inteligencji


Apple Blokuje Aktualizacje Dla Aplikacji Vibe Coding Ze Względu Na Reguły Sklepu App Store


Gemini 3.1 Pro osiąga rekordowe zyski w rozumowaniu


Apple wprowadza kodowanie agentic AI do Xcode z Claude i Codex

