Моделі та платформи ШІ

Революціонізуючи штучний інтелект з Apple’s ReALM: Майбутнє інтелектуальних помічників

mm
Додайте Unite.AI до бажаних джерел у Google

У постійно змінюваному ландшафті штучного інтелекту Apple (AAPL ) тихо просунула новаторський підхід, який може переозначити те, як ми взаємодіємо зі своїми iPhone. ReALM, або Reference Resolution as Language Modeling, – це модель штучного інтелекту, яка обіцяє принести новий рівень контекстної свідомості та безперервної допомоги.

Як світ технологій бурхливо обговорює OpenAI’s GPT-4 та інші великі мови моделей (LLM), ReALM Apple представляє зміну у думках – перехід від залежності лише від хмарного штучного інтелекту до більш персоналізованого, на-пристрої підходу. Метою є створення інтелектуального помічника, який真正но розуміє вас, ваш світ та складну тканину ваших щоденних цифрових взаємодій.

У серці ReALM лежить здатність розв’язувати посилання – ті двозначні займенники, як “воно“, “вони” або “те“, які люди легко навигують завдяки контекстним сигналам. Для штучних інтелектуальних помічників, однак, це довго було каменем спотикання, що призводило до розчаровуючих непорозумінь та роз’єднаного користувацького досвіду.

П уявіть сценарій, у якому ви просите Siri “знайти мені здоровий рецепт на основі того, що є у моїй холодильнику, але без грибів – я їх ненавиджу”. З ReALM ваш iPhone не лише зрозуміє посилання на інформацію на екрані (зміст вашої холодильнику), але й запам’ятає ваші особисті вподобання (неприязнь до грибів) та ширший контекст пошуку рецепту відповідно до цих параметрів.

Цей рівень контекстної свідомості – це квантовий стрибок від підходу співпадіння ключових слів більшості поточних штучних інтелектуальних помічників. Навчуючи LLM розв’язувати посилання безперешкодно через три ключові домени – розмовний, на-екрані та фоновий – ReALM спрямований на створення真正но інтелектуального цифрового компаньйона, який відчувається менше як роботизований голосовий помічник та більше як розширення ваших власних мислительних процесів.

Розмовний домен: Пам’ятання того, що було раніше

Розмовний штучний інтелект, ReALM займається довгостроковим викликом: підтриманням узгодженості та пам’яті протягом декількох поворотів діалогу. З його здатністю розв’язувати посилання в рамках тривалого діалогу, ReALM міг би нарешті виконати обіцянку природної, безперервної взаємодії з вашим цифровим помічником.

П уявіть, що ви просите Siri “нагадати мені забронювати квитки на мою відпустку, коли я отримаю зарплату у п’ятницю”. З ReALM Siri не лише зрозуміє контекст вашої відпустки (потенційно витягнутий з попередньої розмови або інформації на екрані), але й матиме свідомість зв’язати “отримання зарплати” з вашим регулярним графіком оплати.

Цей рівень розмовної інтелектуальності відчувається як真正ний стрибок вперед, що дозволяє безперешкодні багаторазові діалоги без розчаровуючих повторень контексту або повторення себе.

На-екранний домен: Надання вашому помічнику очей

Можливо, найбільш новаторський аспект ReALM лежить у його здатності розв’язувати посилання на сутності на екрані – це критичний крок до створення真正но безперешкодного, голосового користувацького досвіду.

Дослідницька робота Apple обговорює новий метод кодування візуальної інформації з екрана вашого пристрою у формат, який можуть обробляти LLM. Будучи зрештою реконструкцією макету вашого екрана у текстовому представленні, ReALM може “бачити” та розуміти просторові відносини між різними елементами на екрані.

П уявіть сценарій, у якому ви дивитеся на список ресторанів та просите Siri “направити мене до того, який знаходиться на вулиці Мейн”. З ReALM ваш iPhone не лише зрозуміє посилання на конкретне місце, але й пов’язує його з відповідною сутністю на екрані – рестораном, який відповідає цьому опису.

Цей рівень візуального розуміння відкриває світ можливостей, від безперешкодної дії щодо посилань у додатках та веб-сайтах до інтеграції з майбутніми інтерфейсами доповненої реальності та навіть сприйняття та реакції на реальні об’єкти та середовища через камеру вашого пристрою.

Дослідницька робота щодо моделі ReALM Apple обговорює складні деталі того, як система кодує сутності на екрані та розв’язує посилання у різних контекстах. Ось спрощене пояснення алгоритмів та прикладів, наданих у статті:

  1. Кодування сутностей на екрані: Стаття досліджує декілька стратегій кодування елементів на екрані у текстовому форматі, який може бути оброблений великою мовною моделлю (LLM). Один із підходів включає кластеризацію навколишніх об’єктів на основі їх просторової близькості та генерацію запитів, які включають ці кластеризовані об’єкти. Однак цей метод може привести до надмірно довгих запитів при збільшенні кількості сутностей.

Остатній підхід, прийнятий дослідниками, полягає у тому, щоб розібрати екран у порядку зверху вниз, зліва направо, представляючи макет у текстовому форматі. Це досягається за допомогою Алгоритму 2, який сортує об’єкти на екрані на основі їх центрових координат, визначає вертикальні рівні, групуючи об’єкти у певному маржі, та будує розібраний екран, конкатенуючи ці рівні з вкладеними об’єктами на одному рядку.

Вставляючи відповідні сутності (номери телефонів у цьому випадку) у текстове представлення, LLM може зрозуміти контекст на екрані та розв’язати посилання відповідно.

  1. Приклади розв’язання посилань: Стаття надає декілька прикладів, щоб проілюструвати можливості моделі ReALM у розв’язанні посилань у різних контекстах:

а. Розмовні посилання: Для запиту типу “Siri, знайдіть мені здоровий рецепт на основі того, що є у моїй холодильнику, але без грибів – я їх ненавиджу”, ReALM може зрозуміти контекст на екрані (зміст вашої холодильнику), розмовний контекст (знаходження рецепту) та ваші вподобання (неприязнь до грибів).

б. Фонові посилання: У прикладі “Siri, проіграйте ту пісню, яка грала у супермаркеті раніше”, ReALM потенційно може захопити та ідентифікувати фрагменти фонової музики, щоб розв’язати посилання на конкретну пісню.

в. Посилання на екрані: Для запиту типу “Siri, нагадайте мені забронювати квитки на відпустку, коли я отримаю зарплату у п’ятницю”, ReALM може поєднати інформацію з ваших розкладів (день оплати), розмов на екрані або веб-сайтах (планів відпустки) та календаря, щоб зрозуміти та виконати запит.

Ці приклади демонструють здатність ReALM розв’язувати посилання у розмовних, на-екранних та фонових контекстах, що дозволяє більш природну та безперешкодну взаємодію з інтелектуальними помічниками.

Фоновий домен

Переходячи за межі лише розмовного та на-екранного контекстів, ReALM також досліджує здатність розв’язувати посилання на фонові сутності – ті периферійні події та процеси, які часто залишаються непоміченими нашими поточними штучними інтелектуальними помічниками.

П уявіть сценарій, у якому ви просите Siri “проіграйте ту пісню, яка грала у супермаркеті раніше”. З ReALM ваш iPhone потенційно міг би захопити та ідентифікувати фрагменти фонової музики, що дозволило б Siri безперешкодно вивести та проіграти трек, про який ви думали.

Цей рівень фонової свідомості відчувається як перший крок до真正ної універсальної, контекстно-чутливої штучної інтелектуальної допомоги – цифрового компаньйона, який не лише розуміє ваші слова, але й багату тканину ваших щоденних переживань.

Обіцянка на-пристрої штучного інтелекту: Конфіденційність та персоналізація

Хоча можливості ReALM безумовно вражаючі, можливо, його найбільш значуща перевага лежить у довгостроковому зобов’язанні Apple щодо на-пристрої штучного інтелекту та конфіденційності користувача.

На відміну від хмарних моделей штучного інтелекту, які залежать від відправки даних користувача на віддалені сервери для обробки, ReALM розроблений для роботи повністю на вашому iPhone або інших пристроях Apple. Це не лише вирішує питання щодо конфіденційності даних, але й відкриває нові можливості для штучної інтелектуальної допомоги, яка真正но розуміє та адаптується до вас як до окремої особи.

Навчаючись безпосередньо з ваших даних на пристрої – ваших розмов, закономірностей використання додатків та навіть фонових сенсорних входів – ReALM потенційно міг би створити гіпер-персоналізованого цифрового помічника, адаптованого до ваших унікальних потреб, вподобань та щоденних розкладів.

Цей рівень персоналізації відчувається як зміна парадигми від підходу “один розмір для всіх” поточних штучних інтелектуальних помічників, які часто борються з адаптацією до індивідуальних особливостей та контекстів користувачів.

Модель ReALM-250M досягає вражаючих результатів:

    • Розуміння розмов: 97,8
    • Синтетичне розуміння завдань: 99,8
    • Виконання завдань на екрані: 90,6
    • Обробка невидимих доменів: 97,2

Етичні розгляди

Звісно, з таким високим рівнем персоналізації та контекстної свідомості виникає ряд етичних питань щодо конфіденційності, прозорості та потенційного впливу штучної інтелектуальної системи на поведінку користувача.

Як ReALM набуває глибшого розуміння вашого щоденного життя – від ваших харчових звичок та закономірностей споживання медіа до ваших соціальних взаємодій та особистих вподобань – існує ризик того, що ця технологія буде використовуватися способами, які порушують довіру користувача або перетинають етичні межі.

Дослідники Apple гостро усвідомлюють цього напруження, визнаючи у своїй статті необхідність досягнення балансу між забезпеченням真正но корисного, персоналізованого досвіду штучного інтелекту та повагою до конфіденційності та свободи дії користувача.

Цей виклик не унікальний для Apple чи ReALM, звичайно – це розмова, з якою вся технологічна галузь повинна боротися, оскільки штучні інтелектуальні системи стають дедалі більш складними та інтегрованими у наш щоденний досвід.

До розумнішого, більш природнього досвіду штучного інтелекту

Як Apple продовжує розширювати межі на-пристрої штучного інтелекту з моделями типу ReALM, обіцянка真正но інтелектуального, контекстно-чутливого цифрового помічника відчувається ближчою, ніж будь-коли раніше.

П уявіть світ, у якому Siri (або якесь інше ім’я цього штучного інтелекту в майбутньому) відчувається менше як відокремлений голос із хмари та більше як розширення ваших власних мислительних процесів – партнер, який не лише розуміє ваші слова, але й багату тканину вашого цифрового життя, ваших щоденних розкладів та унікальних вподобань та контекстів.

Від безперешкодної дії щодо посилань у додатках та веб-сайтах до передбачення ваших потреб на основі вашого місця розташування, діяльності та фонових сенсорних входів, ReALM представляє значущий крок до більш природнього, безперешкодного досвіду штучного інтелекту, який стирає межі між цифровим та фізичним світом.

Звісно, реалізації цього бачення буде потрібно не лише технічна інновація – це також вимагатиме вдумливого, етичного підходу до розробки штучного інтелекту, який ставить на перше місце конфіденційність користувача, прозорість та свободу дії.

Як Apple продовжує удосконалювати та розширювати можливості ReALM, технологічний світ, безумовно, буде спостерігати з напруженим інтересом, бажаючи побачити, як ця новаторська модель штучного інтелекту формуватиме майбутнє інтелектуальних помічників та запроваджуватиме нову еру真正но персоналізованого, контекстно-чутливого комп’ютерного досвіду.

Чи ReALM справді виправдає свою обіцянку перевершити навіть могутній GPT-4, залишається бути побаченим. Але одне є певним: епоха штучних інтелектуальних помічників, які真正но розуміють нас – наші слова, наш світ та багату тканину нашого щоденного життя – вже розпочалася, і остання інновація Apple може бути на передовій цієї революції.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.