Моделі та платформи ШІ
Трансформери бачення подолали виклики завдяки новому методу «Патч-кластерної уваги»
Технології штучного інтелекту (ШІ), особливо Трансформери бачення (ViTs), показали великий потенціал у розпізнаванні та категоризації об’єктів на зображеннях. Однак їхнє практичне застосування було обмежене двома значними викликами: високими вимогами до обчислювальної потужності та відсутністю прозорості у процесі прийняття рішень. Тепер група дослідників розробила проривне рішення: нову методологію, відому як «Патч-кластерна увага» (PaCa). PaCa спрямована на підвищення можливостей ViTs у розпізнаванні, класифікації та сегментації об’єктів на зображеннях, одночасно вирішуючи давні проблеми обчислювальних вимог та прозорості у процесі прийняття рішень.
Подолання викликів ViTs: Огляд нового рішення
Трансформери, завдяки своїм високим можливостям, є одними з найвпливовіших моделей у світі ШІ. Потужність цих моделей була розширена на візуальні дані через ViTs, клас трансформерів, які тренуються на візуальних даних. Незважаючи на величезний потенціал, який пропонують ViTs у тлумаченні та розумінні зображень, вони були обмежені двома значними проблемами.
По-перше, через те, що зображення містять величезну кількість даних, ViTs вимагають великої обчислювальної потужності та пам’яті. Ця складність може бути перевищена для багатьох систем, особливо при обробці високорозріблених зображень. По-друге, процес прийняття рішень у ViTs часто є заплутаним та не прозорим. Користувачам складно зрозуміти, як ViTs розрізняють різні об’єкти або особливості на зображенні, що є важливим для багатьох застосувань.
Однак інноваційна методологія PaCa пропонує рішення обидвох цих викликів. «Ми подолали виклик, пов’язаний з обчислювальними та пам’ятними вимогами, використовуючи техніки кластеризації, які дозволяють трансформеру краще ідентифікувати та зосередитися на об’єктах на зображенні», пояснює Тяньфу У, відповідальний автор статті про цю роботу та асоційований професор кафедри електротехніки та комп’ютерних наук університету штату Північна Кароліна.
Використання технік кластеризації в PaCa суттєво знижує обчислювальні вимоги, перетворюючи задачу з квадратичної на лінійну. У далі пояснює процес: «Кластеризуючи, ми робимо цей процес лінійним, коли кожна менша одиниця повинна порівнюватися лише з попередньо визначеною кількістю кластерів».
Кластеризація також служить для уточнення процесу прийняття рішень у ViTs. Процес формування кластерів показує, як ViT вирішує, які особливості важливі для групування секцій даних зображення. Оскільки ШІ створює лише обмежену кількість кластерів, користувачі можуть легко зрозуміти та вивчити процес прийняття рішень, суттєво покращуючи інтерпретованість моделі.
Методологія PaCa перевершує інші передові ViTs
Через комплексне тестування дослідники виявили, що методологія PaCa перевершує інші ViTs у кількох аспектах. У далі пояснює: «Ми виявили, що PaCa перевершує SWin і PVT у всіх аспектах». Процес тестування показав, що PaCa перевершує інші ViTs у класифікації та ідентифікації об’єктів на зображеннях та сегментації, ефективно окреслюючи межі об’єктів на зображеннях. Крім того, було виявлено, що вона є більш ефективною у використанні часу, виконуючи завдання швидше, ніж інші ViTs.
Заохочені успіхом PaCa, команда дослідників планує进一步 розвивати цю методологію, тренуючи її на більших базових наборах даних. Роблячи це, вони сподіваються розширити межі того, що зараз можливе у сфері зображень, заснованій на ШІ.
Стаття «PaCa-ViT: Навчання патч-кластерної уваги у Трансформерах бачення» буде представлена на майбутній конференції IEEE/CVF з комп’ютерного бачення та розпізнавання образів. Це важливий етап, який може відкрити шлях до більш ефективних, прозорих та доступних систем ШІ.












