Modele i platformy AI

Od Siri do ReALM: Podróż Apple’a ku inteligentniejszym asystentom głosowym

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Od czasu premiery Siri w 2011 roku Apple (AAPL ) nieustannie znajduje się na czele innowacji w dziedzinie asystentów głosowych, dostosowując się do potrzeb użytkowników na całym świecie. Wprowadzenie ReALM stanowi znaczący punkt w tej podróży, dając nam wgląd w ewoluującą rolę asystentów głosowych w naszym współczesnym korzystaniu z urządzeń. Artykuł ten bada wpływ ReALM na Siri oraz potencjalne kierunki rozwoju przyszłych asystentów głosowych.

Wzrost asystentów głosowych: Geneza Siri

Podróż zaczęła się, gdy Apple zintegrowało Siri, zaawansowany system sztucznej inteligencji, z urządzeniami, zmieniając sposób, w jaki interaktywnie korzystamy z technologii. Pochodząc z technologii opracowanej przez SRI International, Siri stało się złotym standardem dla asystentów aktywowanych głosowo. Użytkownicy mogli wykonywać zadania, takie jak wyszukiwania w Internecie i planowanie, za pomocą prostych poleceń głosowych, poszerzając granice interfejsów konwersacyjnych i rozpoczynając wyścig w rynku asystentów głosowych.

Siri 2.0: Nowa era asystentów głosowych

W związku z przygotowaniami Apple do wydania iOS 18 na Worldwide Developers Conference (WWDC) w czerwcu 2024 roku, rośnie oczekiwanie w społeczności technologicznej dotyczące tego, co ma być znaczącą ewolucją Siri. Ta nowa faza, określana jako Siri 2.0, obiecuje przynieść postępy w dziedzinie generatywnej sztucznej inteligencji, potencjalnie transformując Siri w jeszcze bardziej zaawansowanego wirtualnego asystenta. Chociaż dokładne udoskonalenia pozostają niejawne, świat techniki jest podekscytowany perspektywą, że Siri osiągnie nowe wysokości w inteligencji konwersacyjnej i personalizowanej interakcji z użytkownikiem, wykorzystując rodzaj zaawansowanych modeli językowych, jakie można znaleźć w technologiach takich jak ChatGPT. W tym kontekście wprowadzenie ReALM, kompaktowego modelu językowego, sugeruje możliwe udoskonalenia, które Siri 2.0 mogłoby wprowadzić dla swoich użytkowników. Poniższe sekcje omówią rolę ReALM i jego potencjalny wpływ jako ważny krok w nieustannym rozwoju Siri.

Przedstawienie ReALM

ReALM, co oznacza Reference Resolution As Language Modeling, jest specjalistycznym modelem językowym, który jest zdolny do odczytywania kontekstowych i wieloznacznych odniesień w trakcie konwersacji, takich jak “ten jeden” lub “to”. Wyróżnia się on zdolnością do przetwarzania konwersacyjnych i wizualnych odniesień, przekształcając je w format tekstowy. Ta zdolność pozwala ReALM na interpretowanie i interakcję z układami ekranu i elementami w sposób płynny w ramach dialogu, co jest kluczową cechą dla dokładnego obsługiwanie zapytań w kontekstach zależnych od wizualizacji.

Architektura ReALM obejmuje mniejsze wersje, takie jak ReALM-80M, aż do większych, takich jak ReALM-3B, zoptymalizowane pod kątem efektywności obliczeniowej, aby umożliwić integrację z urządzeniami przenośnymi. Ta efektywność pozwala na stałą wydajność z redukcją zużycia energii i mniejszym obciążeniem zasobów przetwarzania, co jest ważne dla przedłużenia żywotności baterii i zapewnienia szybkich czasów odpowiedzi na różnych urządzeniach.

Ponadto, projekt ReALM umożliwia aktualizacje modułowe, ułatwiając płynną integrację najnowszych postępów w dziedzinie rozwiązywania odniesień. Ten modułowy podejście nie tylko zwiększa elastyczność i adaptacyjność modelu, ale również zapewnia jego długoterminową żywotność i skuteczność, pozwalając mu spełniać ewoluujące potrzeby użytkowników i standardy technologiczne w szerokim spektrum urządzeń.

ReALM vs. Modele językowe

Podczas gdy tradycyjne modele językowe, takie jak GPT-3.5, głównie przetwarzają tekst, ReALM podąża drogą multimodalną, podobnie jak modele takie jak Gemini, pracując z tekstem i wizualizacjami. W przeciwieństwie do szerszych funkcjonalności GPT-3.5 i Gemini, które obsługują zadania takie jak generowanie tekstu, zrozumienie i tworzenie obrazów, ReALM jest szczególnie ukierunkowany na odczytywanie kontekstów konwersacyjnych i wizualnych. Jednak w przeciwieństwie do multimodalnych modeli, takich jak Gemini, które bezpośrednio przetwarzają dane wizualne i tekstowe, ReALM tłumaczy zawartość wizualną ekranu na tekst, dodając adnotacje i szczegóły przestrzenne. Ten proces konwersji pozwala ReALM na interpretowanie zawartości ekranu w sposób tekstowy, ułatwiając bardziej precyzyjne identyfikowanie i zrozumienie odniesień na ekranie.

Jak ReALM może przekształcić Siri?

ReALM może znacząco udoskonalić możliwości Siri, przekształcając ją w bardziej intuicyjnego i kontekstowo świadomego asystenta. Oto, jak to może wpłynąć:

  • Lepsze zrozumienie kontekstu: ReALM specjalizuje się w odczytywaniu wieloznacznych odniesień w konwersacjach, potencjalnie znacznie poprawiając zdolność Siri do zrozumienia kontekstowo zależnych zapytań. To pozwoliłoby użytkownikom na bardziej naturalną interakcję z Siri, gdyż mogłaby ona zrozumieć odniesienia takie jak “zagraj tę piosenkę ponownie” lub “zadzwoń do niej” bez dodatkowych szczegółów.
  • Poprawiona interakcja z ekranem: Dzięki swojej zdolności do interpretowania układów ekranu i elementów w ramach dialogu, ReALM mógłby umożliwić Siri bardziej płynną integrację z wizualną zawartością urządzenia. Siri mogłaby wtedy wykonywać polecenia związane z elementami na ekranie, takimi jak “otwórz aplikację obok Mail” lub “przewiń w dół na tej stronie”, rozszerzając swoją użyteczność w różnych zadaniach.
  • Personalizacja: Poprzez naukę z poprzednich interakcji, ReALM mógłby poprawić zdolność Siri do oferowania personalizowanych i adaptacyjnych odpowiedzi. Z czasem Siri mogłaby przewidywać potrzeby i preferencje użytkownika, sugerując lub inicjując działania na podstawie poprzedniego zachowania i zrozumienia kontekstu, podobnie jak wiedzący osobisty asystent.
  • Poprawiona dostępność: Możliwości ReALM w zakresie zrozumienia kontekstu i odniesień mogłyby znacznie przyczynić się do poprawy dostępności, czyniąc technologię bardziej inkluzywną. Siri, wspierana przez ReALM, mogłaby dokładnie interpretować niejasne lub częściowe polecenia, ułatwiając łatwiejsze i bardziej naturalne korzystanie z urządzenia dla osób z niepełnosprawnościami fizycznymi lub wzrokowymi.

ReALM i strategia AI Apple

Wprowadzenie ReALM odzwierciedla kluczowy aspekt strategii AI Apple, podkreślając inteligencję na urządzeniu. Ten rozwój jest zgodny z szerszym trendem branżowym w zakresie obliczeń na krawędzi, gdzie dane są przetwarzane lokalnie na urządzeniach, redukując opóźnienia, oszczędzając przepustowość i zabezpieczając dane użytkownika na samym urządzeniu.

Projekt ReALM również prezentuje szersze cele AI Apple, koncentrując się nie tylko na wykonywaniu poleceń, ale również na głębszym zrozumieniu i przewidywaniu potrzeb użytkownika. ReALM reprezentuje krok w kierunku przyszłych innowacji, w których urządzenia mogą zapewnić bardziej personalizowaną i przewidywalną pomoc, poinformowaną o głębokim zrozumieniu zwyczajów i preferencji użytkownika.

Podsumowanie

Rozwój Apple od Siri do ReALM podkreśla nieustanną ewolucję w technologiach asystentów głosowych, koncentrując się na poprawie zrozumienia kontekstu i interakcji z użytkownikiem. ReALM symbolizuje przesunięcie w kierunku bardziej inteligentnych, personalizowanych i świadomych prywatności asystentów głosowych, zgodnie z trendem branżowym w zakresie obliczeń na krawędzi, aby poprawić przetwarzanie na urządzeniu i bezpieczeństwo.

Dr. Tehseen Zia jest profesorem nadzwyczajnym w COMSATS University Islamabad, posiada tytuł doktora w dziedzinie sztucznej inteligencji na Vienna University of Technology, Austria. Specjalizując się w sztucznej inteligencji, uczeniu maszynowym, nauce o danych i widzeniu komputerowym, wniósł znaczący wkład poprzez publikacje w renomowanych czasopismach naukowych. Dr. Tehseen Zia również kierował różnymi projektami przemysłowymi jako główny badacz i pełnił funkcję konsultanta ds. sztucznej inteligencji.