Modele i platformy AI
Odkrywanie SAM 2: Nowy Otwarty Model Podstawowy Meta dla Segregacji Obiektów w Czasie Rzeczywistym w Filmach i Obrazach
W ciągu ostatnich kilku lat, świat sztucznej inteligencji (AI) doświadczył znaczących postępów w zakresie modeli podstawowych do przetwarzania tekstu, z postępami, które przekształciły branże od obsługi klienta do analizy prawniczej. Jednak w przypadku przetwarzania obrazów, tylko zaczynamy dotykać powierzchni. Złożoność danych wizualnych i wyzwania związane z tworzeniem modeli, które mogą dokładnie interpretować i analizować obrazy, stanowią znaczące przeszkody. Podczas gdy badacze kontynuują eksplorację modeli podstawowych dla obrazów i filmów, przyszłość przetwarzania obrazów w AI ma potencjał dla innowacji w dziedzinach takich jak opieka zdrowotna, pojazdy autonomiczne i poza nimi.
Segregacja obiektów, która polega na wskazaniu dokładnych pikseli w obrazie, które odpowiadają obiektowi zainteresowania, jest krytycznym zadaniem w dziedzinie widzenia komputerowego. Tradycyjnie, wymagało to tworzenia specjalistycznych modeli AI, co wymagało rozległej infrastruktury i dużej ilości danych anotowanych. W zeszłym roku, Meta wprowadziło Model Segregacji Dowolnego Obiektu (SAM), model podstawowy AI, który upraszcza ten proces, pozwalając użytkownikom na segregację obrazów za pomocą prostego podpowiedzenia. Ta innowacja zmniejszyła potrzebę specjalistycznej wiedzy i rozległych zasobów obliczeniowych, czyniąc segregację obrazów bardziej dostępną.
Teraz, Meta idzie o krok dalej z SAM 2. Ta nowa iteracja nie tylko poprawia istniejące możliwości segregacji obrazów SAM, ale także rozszerza je na przetwarzanie filmów. SAM 2 może segregować dowolny obiekt w obrazach i filmach, nawet te, które nie były wcześniej spotykane. Ten postęp jest skokiem do przodu w dziedzinie widzenia komputerowego i przetwarzania obrazów, dostarczając bardziej wszechstronne i potężne narzędzie do analizy treści wizualnych. Poniżej, eksplorujemy ekscytujące postępy SAM 2 i jego potencjał do przekształcenia różnych dziedzin, od opieki zdrowotnej i pojazdów autonomicznych po interaktywne media i handel.
Wprowadzenie do Modelu Segregacji Dowolnego Obiektu (SAM)
Tradycyjne metody segregacji wymagają ręcznej korekty, znanej jako interaktywna segregacja, lub rozległych danych anotowanych do automatycznej segregacji do predefiniowanych kategorii. SAM jest modelem podstawowym AI, który obsługuje interaktywną segregację za pomocą uniwersalnych podpowiedzeń, takich jak kliknięcia, pola lub dane wejściowe tekstowe. Może być również dostosowany z minimalnymi danymi i zasobami obliczeniowymi do automatycznej segregacji. Wytrenowany na ponad 1 miliardzie różnorodnych anotacji obrazów, SAM może obsługiwać nowe obiekty i obrazy bez potrzeby zbierania danych niestandardowych lub dostosowywania. SAM składa się z dwóch głównych komponentów: enkodera obrazu, który przetwarza obraz, i enkodera podpowiedzenia, który obsługuje dane wejściowe, takie jak kliknięcia lub tekst. Te komponenty łączą się z lekkim dekodorem, aby przewidzieć maski segregacji. Po przetworzeniu obrazu, SAM może utworzyć segment w zaledwie 50 milisekundach w przeglądarce internetowej, czyniąc go potężnym narzędziem do zadań interaktywnych w czasie rzeczywistym.
Odkrywanie SAM 2: Skok z Segregacji Obrazów do Segregacji Filmów
Budując na fundamencie SAM, SAM 2 został zaprojektowany do segregacji obiektów w czasie rzeczywistym, z podpowiedzeniami, zarówno w obrazach, jak i filmach. W przeciwieństwie do SAM, który koncentruje się wyłącznie na statycznych obrazach, SAM 2 przetwarza filmy, traktując każdy klatkę jako część ciągłej sekwencji. To umożliwia SAM 2 lepsze radzenie sobie z dynamicznymi scenami i zmieniającą się zawartością. Dla segregacji obrazów, SAM 2 nie tylko poprawia możliwości SAM, ale także działa trzykrotnie szybciej w zadaniach interaktywnych.
SAM 2 zachowuje tę samą architekturę, co SAM, ale wprowadza mechanizm pamięci do przetwarzania filmów. Ta funkcja pozwala SAM 2 na śledzenie informacji z poprzednich klatek, zapewniając spójną segregację obiektów, pomimo zmian w ruchu, oświetleniu lub zakryciu. Odwołując się do poprzednich klatek, SAM 2 może udoskonalić swoje przewidywania masek w całym filmie.
Model został wytrenowany na nowo opracowanym zbiorze danych, SA-V dataset, który zawiera ponad 600 000 anotacji masklet na 51 000 filmach z 47 krajów. Ten zróżnicowany zbiór danych obejmuje zarówno całe obiekty, jak i ich części, co poprawia dokładność SAM 2 w segregacji filmów w świecie rzeczywistym.
SAM 2 jest dostępny jako model open-source pod licencją Apache 2.0, co czyni go dostępnym do różnych zastosowań. Meta udostępniło również zbiór danych użyty do SAM 2 pod licencją CC BY 4.0. Dodatkowo, istnieje demo internetowe, które pozwala użytkownikom na eksplorację modelu i zobaczenie, jak działa.
Potencjalne Zastosowania
Możliwości SAM 2 w segregacji obiektów w czasie rzeczywistym, z podpowiedzeniami, zarówno w obrazach, jak i filmach, odblokowały wiele innowacyjnych zastosowań w różnych dziedzinach. Na przykład, niektóre z tych zastosowań to:
- Diagnostyka Medyczna: SAM 2 może znacząco poprawić asystowanie chirurgiczne w czasie rzeczywistym, segregując struktury anatomiczne i identyfikując anomalie podczas transmisji wideo w sali operacyjnej. Może również poprawić analizę obrazów medycznych, dostarczając dokładną segregację organów lub guzów w skanach medycznych.
- Pojazdy Autonomiczne: SAM 2 może poprawić systemy pojazdów autonomicznych, poprawiając dokładność wykrywania obiektów za pomocą ciągłej segregacji i śledzenia pieszych, pojazdów i znaków drogowych na klatkach wideo. Jego zdolność do radzenia sobie z dynamicznymi scenami również wspiera systemy nawigacji adaptacyjnej i unikania kolizji, rozpoznając i reagując na zmiany środowiskowe w czasie rzeczywistym.
- Interaktywne Media i Rozrywka: SAM 2 może poprawić aplikacje rzeczywistości rozszerzonej, segregując obiekty w czasie rzeczywistym, co ułatwia wirtualnym elementom mieszanie się z światem rzeczywistym. Korzysta również z edycji wideo, automatyzując segregację obiektów w nagraniach, co upraszcza procesy, takie jak usuwanie tła i zastępowanie obiektów.
- Monitorowanie Środowiska: SAM 2 może pomóc w śledzeniu zwierząt, segregując i monitorując je w nagraniach wideo, wspierając badania gatunków i studia siedlisk. W odpowiedzi na klęski żywiołowe, może ocenić uszkodzenia i kierować wysiłkami ratowniczymi, segregując i identyfikując obszary i obiekty dotknięte na transmisjach wideo.
- Handel i E-Commerce: SAM 2 może poprawić wizualizację produktów w e-commerce, umożliwiając interaktywną segregację produktów w obrazach i filmach. To daje klientom możliwość wyświetlania produktów z różnych kątów i kontekstów. Dla zarządzania zapasami, pomaga detalistom śledzić i segregować produkty na półkach w czasie rzeczywistym, upraszczając inwentaryzację i poprawiając ogólny zarządzanie zapasami.
Pokonywanie Ograniczeń SAM 2: Praktyczne Rozwiązania i Przyszłe Ulepszenia
Chociaż SAM 2 działa dobrze z obrazami i krótkimi filmami, ma pewne ograniczenia, które należy wziąć pod uwagę w praktyce. Może mieć trudności ze śledzeniem obiektów przez znaczące zmiany punktu widzenia, długie zakrycia lub w zatłoczonych scenach, szczególnie w dłuższych filmach. Korekta ręczna z interaktywnymi kliknięciami może pomóc w rozwiązaniu tych problemów.
W zatłoczonych środowiskach z podobnymi obiektami, SAM 2 może czasami błędnie identyfikować cele, ale dodatkowe podpowiedzenia w późniejszych klatkach mogą rozwiązać ten problem. Chociaż SAM 2 może segregować wiele obiektów, jego wydajność maleje, ponieważ przetwarza każdy obiekt oddzielnie. Przyszłe aktualizacje mogą skorzystać z integrowania współdzielonych informacji kontekstowych, aby poprawić wydajność.
SAM 2 może również pomijać drobne szczegóły z szybko poruszającymi się obiektami, a przewidywania mogą być niestabilne między klatkami. Jednak dalsze szkolenie może rozwiązać to ograniczenie. Chociaż automatyczne generowanie anotacji uległo poprawie, anotatorzy ludzcy są nadal niezbędni do kontroli jakości i wyboru klatek, a dalsza automatyzacja mogłaby poprawić wydajność.
Podsumowanie
SAM 2 reprezentuje znaczący skok do przodu w segregacji obiektów w czasie rzeczywistym, zarówno w obrazach, jak i filmach, budując na fundamencie położonym przez jego poprzednika. Poprawiając możliwości i rozszerzając funkcjonalność do dynamicznej zawartości wideo, SAM 2 obiecuje przekształcić wiele dziedzin, od opieki zdrowotnej i pojazdów autonomicznych po interaktywne media i handel. Chociaż pozostają wyzwania, szczególnie w radzeniu sobie z złożonymi i zatłoczonymi scenami, otwarty charakter SAM 2 zachęca do ciągłej poprawy i adaptacji. Z jego potężnymi możliwościami i dostępnością, SAM 2 jest gotowy do napędzania innowacji i rozszerzania możliwości w dziedzinie widzenia komputerowego i poza nią.












