Лідери думок

Думати поза межами коробки, щоб рухатися інноваціями штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Для багатьох з нас, хто інновує в сфері штучного інтелекту, ми працюємо в невідомій території. Враховуючи, як швидко компанії зі штучним інтелектом розробляють нові технології, можна вважати, що робота поза сценою є самозрозумілою. Але в галузі, як XR, де місія полягає в тому, щоб стерти межі між реальним і цифровим світом — зараз не багато історичних даних або досліджень, на які можна спертися; тому нам потрібно думати поза межами коробки.

Хоча найзручніше сприймати звичайну мудрість машинного навчання та перевірені практики, це часто не можливо (або повне рішення) в нових галузях. Щоб вирішити проблеми, які раніше не були вирішені, їх потрібно підходити до нових способів.

Це виклик, який змушує вас пам’ятати, чому ви вступили в галузь інженерії, науки про дані чи розробки продукції: пристрасть до відкриття. Я відчуваю це кожен день на своїй роботі в Ultraleap, де ми розробляємо програмне забезпечення, яке може відстежувати та реагувати на рухи людської руки в середовищі змішаної реальності. Так багато того, що ми вважали, що знаємо про навчання моделей машинного навчання, перевернулося в нашій роботі, оскільки людська рука — разом з об’єктами та середовищем, з яким вона зустрічається — дуже непередбачувана.

Ось кілька підходів, яких моja команда та я дотримуємося, щоб переосмислити експериментування та науку про дані, щоб привнести інтуїтивне взаємодію в цифровий світ, яке є точним і відчувається так само природньо, як у реальному світі.

Інновування в межах

Коли інновуєш в новій галузі, ти часто стикаєшся з обмеженнями, які здаються взаємно суперечливими. Моя команда займається захопленням тонкостей рухів руки та пальців, а також того, як руки та пальці взаємодіють зі світом навколо них. Все це упаковано в моделі відстеження рук, які все ще входять у апаратне забезпечення XR з обмеженою обчислювальною потужністю. Це означає, що наші моделі — хоча й складні та складні — повинні займати значно менше місця та споживати значно менше енергії (до 1/100 000) порівняно з величезними LLM, які домінують в заголовках. Це представляє нам цікавий виклик, який вимагає безжалісного експериментування та оцінки наших моделей у їхньому реальному застосуванні.

Але безліч тестів та експериментів варті того: створення потужної моделі, яка все ще забезпечує низьку вартість висновку, споживання енергії та затримку, — це диво, яке можна застосувати в обчисленнях на краю навіть поза межами XR-простору.

Обмеження, з якими ми стикаємося під час експериментування, також вплинуть на інші галузі. Деякі підприємства матимуть унікальні виклики через тонкостей у своїх галузях застосування, тоді як інші можуть мати обмежені дані для роботи через те, що вони знаходяться в нішевому ринку, який великі технологічні гравці ще не торкнулися.

Хоча рішення “один розмір для всіх” можуть бути достатніми для деяких завдань, багато галузей застосування повинні вирішувати реальні, складні проблеми, специфічні для їхнього завдання. Наприклад, лінії збирання автомобілів реалізують моделі машинного навчання для інспекції дефектів. Ці моделі повинні мати справу з дуже високою роздільною здатністю зображень, необхідною для ідентифікації малих дефектів на великій поверхні автомобіля. У цьому випадку застосування вимагає високої продуктивності, але проблема, яку потрібно вирішити, полягає в тому, як досягти низької частоти кадрів, але високої роздільної здатності моделі.

Оцінка архітектур моделей для руху інноваціями

Хороший набір даних — це рухова сила будь-якої успішної прориву штучного інтелекту. Але що робить набір даних “хорошим” для певної мети? І коли ти розв’язуєш раніше невирішені проблеми, як ти можеш довіряти, що існуючі дані будуть актуальними? Ми не можемо припускати, що метрики, які є хорошими для деяких завдань машинного навчання, перекладаються на конкретну бізнес-задачу. Це місце, де нам потрібно йти проти загальноприйнятих “правд” машинного навчання та активно досліджувати, як ми маркуємо, очищуємо та застосовуємо як симульовані, так і реальні дані.

Від природи нашої галузі є складною для оцінки та вимагає ручної якості забезпечення – зробленої вручну. Ми не тільки дивимося на якість метрик наших даних. Ми ітеруємо наші набори даних та джерела даних і оцінюємо їх на основі якостей моделей, які вони виробляють у реальному світі. Коли ми переоцінюємо, як ми оцінюємо та класифікуємо наші дані, ми часто знаходимо набори даних або тенденції, які ми могли б інакше пропустити. Тепер з цими наборами даних та безліччю експериментів, які показали нам, на які дані не слід покладатися, ми відкрили новий шлях, якого раніше не бачили.

Остання платформа відстеження рук Ultraleap, Hyperion, — це чудовий приклад цього. Покращення наших наборів даних допомогло нам розробити більш складне відстеження рук, яке може точно відстежувати мікрожести, а також рухи рук, навіть коли користувач тримає об’єкт.

 Одна мала крок назад, один великий крок вперед

Хоча темп інновацій, здається, ніколи не сповільнюється, ми можемо. Ми займаємося експериментуванням, навчанням, розробкою та коли ми беремо час, щоб зробити саме це, ми часто створюємо щось значно цінніше, ніж коли ми йдемо за книгою та поспішаємо випустити наступну технологічну інновацію. Не має заміни проривам, які відбуваються, коли ми досліджуємо наші анотації даних, ставимо під сумнів наші джерела даних та переозначуємо метрики якості самих себе. І єдиний спосіб, яким ми можемо зробити це, — експериментувати в реальному застосуванні з виміряною продуктивністю моделі проти завдання. Навіть не бачачи незвичайних вимог та обмежень як обмежуючих, ми можем взяти ці виклики та перетворити їх на можливості для інновацій та, врешті-решт, конкурентної переваги.

Яйн Воллес є директором з машинного навчання та досліджень відстежування в Ultraleap, глобальному лідері у сфері комп'ютерного бачення та машинного навчання. Він є комп'ютерним вченим, який цікавиться дослідженнями та розробкою систем штучного інтелекту, орієнтованих на застосування. В Ultraleap Яйн очолює свою команду досліджень відстежування руху рук, щоб забезпечити нові взаємодії в AR, VR, MR, поза домом та в будь-якому іншому місці, де ви взаємодієте з цифровим світом. Він здобув ступінь магістра інженерії у сфері комп'ютерних систем та програмної інженерії в Університеті Йорка та ступінь доктора філософії з інформатики (штучний інтелект) в Університеті Едінбурга.