Моделі та платформи ШІ
Представляємо SAM 2: нову відкриту модель Meta для сегментації об’єктів у реальному часі у відео та зображеннях
За останні кілька років світ штучного інтелекту зробив значні кроки вперед у сфері основних моделей штучного інтелекту для обробки тексту, з досягненнями, які трансформували галузі від служби підтримки клієнтів до юридичного аналізу. Однак, коли мова йде про обробку зображень, ми тільки починаємо розглядати цю сферу. Складність візуальних даних та труднощі навчання моделей для точної інтерпретації та аналізу зображень створили значні перешкоди. Коли дослідники продовжують вивчати основні моделі штучного інтелекту для зображень та відео, майбутнє обробки зображень у штучному інтелекті обіцяє інновації у сфері охорони здоров’я, автономних транспортних засобів та інших галузей.
Сегментація об’єктів, яка полягає у визначенні точних пікселів у зображенні, що відповідають об’єкту інтересу, є критичним завданням у комп’ютерному баченні. Традиційно це завдання полягало у створенні спеціалізованих моделей штучного інтелекту, що вимагало великої інфраструктури та великих обсягів анотованих даних. У минулому році Meta представила Модель сегментації будь-чого (SAM), основну модель штучного інтелекту, яка спрощує цей процес, дозволяючи користувачам сегментувати зображення за допомогою простої команди. Ця інновація зменшила потребу у спеціалізованій експертизі та великих обчислювальних ресурсах, зробивши сегментацію зображень більш доступною.
Тепер Meta робить ще один крок вперед з SAM 2. Ця нова ітерація не тільки покращує наявні можливості SAM щодо сегментації зображень, але й розширює їх на обробку відео. SAM 2 може сегментувати будь-який об’єкт у зображеннях та відео, навіть ті, з якими вона раніше не зустрічалася. Це досягнення є кроком вперед у сфері комп’ютерного бачення та обробки зображень, забезпечуючи більш універсальний та потужний інструмент для аналізу візуального контенту. Нижче ми розглядаємо цікаві досягнення SAM 2 та її потенціал для трансформації різних галузей.
Представляємо Модель сегментації будь-чого (SAM)
Традиційні методи сегментації або вимагають ручної корекції, відомої як інтерактивна сегментація, або великих обсягів анотованих даних для автоматичної сегментації у попередньо визначені категорії. SAM є основною моделлю штучного інтелекту, яка підтримує інтерактивну сегментацію за допомогою універсальних команд, таких як кліки, рамки або текстові введення. Вона також може бути донастроєна з мінімальними даними та обчислювальними ресурсами для автоматичної сегментації. Навчена на понад 1 мільярд різноманітних анотацій зображень, SAM може обробляти нові об’єкти та зображення без потреби у спеціалізованому зборі даних або донастроюванні.
SAM працює з двома основними компонентами: кодувальником зображення, який обробляє зображення, та кодувальником команди, який обробляє введення, такі як кліки або текст. Ці компоненти поєднуються з легким декодером для передбачення масок сегментації. Як тільки зображення оброблено, SAM може створити сегмент за всього 50 мілісекунд у веб-браузері, роблячи її потужним інструментом для інтерактивних завдань у реальному часі. Для створення SAM дослідники розробили триступеневий процес збору даних: допоміжну анотацію моделлю, поєднання автоматичної та допоміжної анотації, та повністю автоматичне створення масок. Цей процес призвів до створення набору даних SA-1B, який включає понад 1,1 мільярд масок на 11 мільйонах ліцензованих, захищених приватністю зображень — що робить його у 400 разів більшим, ніж будь-який інший існуючий набір даних. Вражаюча продуктивність SAM пояснюється цим обширним та різноманітним набором даних, забезпечуючи краще представництво по різних географічних регіонах порівняно з попередніми наборами даних.
Представляємо SAM 2: крок від зображень до відеосегментації
Базуючись на основі SAM, SAM 2 призначена для сегментації об’єктів у реальному часі у зображеннях та відео. На відміну від SAM, яка зосереджена лише на статичних зображеннях, SAM 2 обробляє відео, розглядаючи кожний кадр як частину безперервної послідовності. Це дозволяє SAM 2 краще обробляти динамічні сцени та зміни контенту. Для сегментації зображень SAM 2 не тільки покращує можливості SAM, але й працює у три рази швидше під час інтерактивних завдань.
SAM 2 зберігає ту саму архітектуру, що й SAM, але вводить механізм пам’яті для обробки відео. Ця функція дозволяє SAM 2 зберігати інформацію з попередніх кадрів, забезпечуючи послідовну сегментацію об’єктів незалежно від змін руху, освітлення або окулювання. За допомогою посилання на попередні кадри SAM 2 може уточнювати свої передбачення масок протягом всього відео.
Модель навчена на новому наборі даних, SA-V dataset, який включає понад 600 000 анотацій масок на 51 000 відео з 47 країн. Цей різноманітний набір даних охоплює як цілі об’єкти, так і їх частини, покращуючи точність SAM 2 у сегментації відео реального світу.
SAM 2 доступна як відкрита модель під ліцензією Apache 2.0, роблячи її доступною для різних застосунків. Meta також поділилася набором даних, використаним для SAM 2, під ліцензією CC BY 4.0. Крім того, існує веб-демонстрація, яка дозволяє користувачам досліджувати модель та бачити, як вона працює.
Потенційні випадки використання
Можливості SAM 2 у сегментації об’єктів у реальному часі для зображень та відео відкрили численні інноваційні застосування у різних галузях. Наприклад, деякі з цих застосунків включають:
- Охорона здоров’я та діагностика: SAM 2 може суттєво покращити допомогу під час хірургічних операцій у реальному часі, сегментуючи анатомічні структури та визначаючи аномалії під час прямої трансляції у операційній. Вона також може покращити аналіз медичних зображень, забезпечуючи точну сегментацію органів або пухлин у медичних сканах.
- Автономні транспортні засоби: SAM 2 може покращити системи автономних транспортних засобів, підвищуючи точність виявлення об’єктів шляхом безперервної сегментації та відстеження пішоходів, транспортних засобів та дорожніх знаків по кадрах відео. Її здатність обробляти динамічні сцени також підтримує адаптивні системи навігації та уникнення зіткнень, розпізнавючи та реагуючи на зміни середовища у реальному часі.
- Інтерактивні медіа та розваги: SAM 2 може покращити додатки доповненої реальності (AR), точно сегментуючи об’єкти у реальному часі, що робить легшим для віртуальних елементів поєднуватися з реальним світом. Вона також вигідно впливає на відеомонтаж, автоматизуючи сегментацію об’єктів у кадрах, що спрощує процеси, такі як видалення фону та заміну об’єктів.
- Моніторинг навколишнього середовища: SAM 2 може допомогти у відстежуванні дикої природи, сегментуючи та моніторячи тварин у відеокадрах, підтримуючи дослідження видів та вивчення середовища проживання. У разі реагування на стихійні лиха вона може оцінювати збитки та спрямовувати зусилля з реагування, точно сегментуючи пошкоджені території та об’єкти у відеопотоці.
- Роздрібна торгівля та електронна комерція: SAM 2 може покращити візуалізацію продуктів у електронній комерції, забезпечуючи інтерактивну сегментацію продуктів у зображеннях та відео. Це може дати клієнтам можливість переглядати товари з різних кутів та контекстів. Для інвентаризації вона допомагає рітейлерам відстежувати та сегментувати товари на полицях у реальному часі, оптимізуючи облік запасів та покращуючи загальний контроль інвентарю.
Передбачення обмежень SAM 2: практичні рішення та майбутні вдосконалення
Хоча SAM 2 працює добре з зображеннями та короткими відео, вона має деякі обмеження, які слід враховувати для практичного використання. Вона може мати труднощі з відстежуванням об’єктів через значні зміни точки зору, тривалі окулювання або у переповнених сценах, особливо у розширених відео. Ручна корекція з інтерактивними кліками може допомогти подолати ці питання.
У переповнених середовищах з об’єктами, що виглядають схожими, SAM 2 іноді може неправильно ідентифікувати цілі, але додаткові команди у пізніших кадрах можуть вирішити цю проблему. Хоча SAM 2 може сегментувати кілька об’єктів, її ефективність знижується, оскільки вона обробляє кожен об’єкт окремо. Майбутні оновлення могли б вигідно вплинути на інтеграцію спільної контекстної інформації для покращення продуктивності.
SAM 2 також може пропустити дрібні деталі з швидко рухомими об’єктами, і передбачення можуть бути нестабільними по кадрах. Однак подальше навчання могло б подолати це обмеження. Хоча автоматичне створення анотацій покращилось, людські аннотатори все ще необхідні для перевірки якості та вибору кадрів, і подальша автоматизація могла б підвищити ефективність.
Висновок
SAM 2 представляє собою суттєвий крок вперед у сегментації об’єктів у реальному часі для зображень та відео, базуючись на основі, закладеній її попередником. Покращуючи можливості та розширюючи функціональність на динамічний відеоконтент, SAM 2 обіцяє трансформувати різні галузі, від охорони здоров’я та автономних транспортних засобів до інтерактивних медіа та роздрібної торгівлі. Хоча залишаються виклики, особливо у обробці складних та переповнених сцен, відкрита модель SAM 2 заохочує безперервне вдосконалення та адаптацію. З її потужною продуктивністю та доступністю SAM 2 готова стимулювати інновації та розширити можливості у сфері комп’ютерного бачення та за її межами.












