AI-modeller og platforme
Præsentation af SAM 2: Meta’s nye open-source grundmodel til realtid objektsegmentering i videoer og billeder
I de seneste få år har AI-verdenen set betydelige fremskridt i grundlæggende AI til tekstbehandling, med fremskridt, der har forvandlet brancher fra kundeservice til juridisk analyse. Dog, når det kommer til billedbehandling, er vi kun lige begyndt at kradsede overfladen. Kompleksiteten af visuelle data og udfordringerne ved at træne modeller til at nøjagtigt fortolke og analysere billeder har præsenteret betydelige hindringer. Da forskere fortsætter med at udforske grundlæggende AI til billeder og videoer, har fremtiden for billedbehandling i AI potentiale for innovationer inden for sundhedspleje, selvstændige køretøjer og andet.
Objektsegmentering, som indebærer at pege på de præcise pixels i et billede, der svarer til et objekt af interesse, er en kritisk opgave i computer vision. Traditionelt har dette involveret oprettelse af specialiserede AI-modeller, som kræver omfattende infrastruktur og store mængder annoterede data. Sidste år introducerede Meta Segment Anything Model (SAM), en grundlæggende AI-model, der forenkler denne proces ved at tillade brugere at segmentere billeder med en simpel prompt. Denne innovation reducerede behovet for specialiseret ekspertise og omfattende beregningsressourcer, og gjorde billedsegmentering mere tilgængelig.
Nu tager Meta dette skridt videre med SAM 2. Denne nye iteration forbedrer ikke kun SAM’s eksisterende billedsegmenteringsfunktioner, men udvider dem også til videobehandling. SAM 2 kan segmentere ethvert objekt i både billeder og videoer, selv hvis det ikke tidligere er blevet mødt. Denne fremgang er et spring fremad i computer vision og billedbehandling, og tilbyder et mere fleksibelt og kraftfuldt værktøj til analyse af visuelt indhold. Herunder udforsker vi de spændende fremskridt i SAM 2 og dens potentiale til at omdefinere feltet computer vision.
Præsentation af Segment Anything Model (SAM)
Traditionelle segmenteringsmetoder kræver enten manuel finjustering, kendt som interaktiv segmentering, eller omfattende annoterede data til automatisk segmentering i foruddefinerede kategorier. SAM er en grundlæggende AI-model, der understøtter interaktiv segmentering ved hjælp af fleksible prompts som klik, bokse eller tekstindtastninger. Den kan også finjusteres med minimal data og beregningsressourcer til automatisk segmentering. Trænet på over 1 milliard diverse billedannoteringer kan SAM håndtere nye objekter og billeder uden behov for brugerdefineret dataindsamling eller finjustering.
SAM fungerer med to hovedkomponenter: en billedencoder, der behandler billedet, og en promptencoder, der håndterer indtastninger som klik eller tekst. Disse komponenter kommer sammen med en letvægtsdecoder til at forudsige segmenteringsmasker. Når billedet er behandlet, kan SAM oprette et segment på blot 50 millisekunder i en webbrowser, hvilket gør det til et kraftfuldt værktøj til realtid, interaktive opgaver. For at bygge SAM udviklede forskerne en tretrinsproces til dataindsamling: modelassisteret annotation, en blanding af automatisk og assisteret annotation, og fuldt automatisk maskeskapning. Denne proces resulterede i SA-1B datasettet, som indeholder over 1,1 milliard masker på 11 millioner licenserede, privatlivsbeskyttende billeder – hvilket gør det 400 gange større end nogen eksisterende dataset. SAM’s imponerende præstation skyldes dette omfattende og diverse dataset, hvilket sikrer bedre repræsentation på tværs af forskellige geografiske regioner i forhold til tidligere datasets.
Præsentation af SAM 2: Et spring fra billed til videosegmentering
Bygget på SAM’s grundlag er SAM 2 designet til realtid, promptbar objektsegmentering i både billeder og videoer. I modsætning til SAM, som fokuserer udelukkende på statiske billeder, behandler SAM 2 videoer ved at behandle hver frame som en del af en kontinuerlig sekvens. Dette giver SAM 2 mulighed for at håndtere dynamiske scener og ændringer i indhold mere effektivt. For billedsegmentering forbedrer SAM 2 ikke kun SAM’s funktioner, men fungerer også tre gange hurtigere i interaktive opgaver.
SAM 2 har den samme arkitektur som SAM, men introducerer en hukommelsesmekanisme til videobehandling. Denne funktion giver SAM 2 mulighed for at holde styr på information fra tidligere frames, hvilket sikrer konsistent objektsegmentering på trods af ændringer i bevægelse, belysning eller blokering. Ved at referere til tidligere frames kan SAM 2 finjustere sine maskerforudsigelser gennem videoen.
Modellen er trænet på et nyt udviklet dataset, SA-V datasettet, som indeholder over 600.000 masklet-annoteringer på 51.000 videoer fra 47 lande. Dette diverse dataset dækker både hele objekter og deres dele, hvilket forbedrer SAM 2’s nøjagtighed i realverdenens videosegmentering.
SAM 2 er tilgængelig som en open-source-model under Apache 2.0-licensen, hvilket gør det tilgængeligt for forskellige formål. Meta har også delt datasettet, der er brugt til SAM 2, under en CC BY 4.0-licens. Derudover findes der en webbaseret demo, der giver brugerne mulighed for at udforske modellen og se, hvordan den fungerer.
Potentiale anvendelsesområder
SAM 2’s funktioner i realtid, promptbar objektsegmentering for billeder og videoer har låst op for talrige innovative anvendelser på tværs af forskellige felter. For eksempel er nogle af disse anvendelser følgende:
- Sundhedspleje og diagnostik: SAM 2 kan betydeligt forbedre realtid kirurgisk assistance ved at segmentere anatomiske strukturer og identificere anomalier under live videooptagelser i operationsrummet. Det kan også forbedre medicinsk billedanalyse ved at give nøjagtig segmentering af organer eller tumorer i medicinske scanninger.
- Selvstændige køretøjer: SAM 2 kan forbedre selvstændige køretøjsystemer ved at forbedre objektgenkendelsesnøjagtighed gennem kontinuerlig segmentering og sporning af fodgængere, køretøjer og vejsskilt i videooptagelser. Dens evne til at håndtere dynamiske scener støtter også adaptiv navigation og kollisionundgåelsessystemer ved at genkende og reagere på miljømæssige ændringer i realtid.
- Interaktivt medie og underholdning: SAM 2 kan forbedre augmented reality (AR)-applikationer ved at segmentere objekter i realtid, hvilket gør det lettere for virtuelle elementer at blande sig med den virkelige verden. Det kan også forbedre videoediting ved at automatisere objektsegmentering i optagelser, hvilket simplificerer processer som baggrundsfjernelse og objektudskiftning.
- Miljøovervågning: SAM 2 kan hjælpe med dyreværnsarbejde ved at segmentere og overvåge dyr i videooptagelser, hvilket støtter artsforskning og habitatstudier. I katastrofehjælp kan det evaluere skader og guide indsatsen ved at segmentere og identificere berørte områder og objekter i videooptagelser.
- Detailhandel og e-handel: SAM 2 kan forbedre produktvisualisering i e-handel ved at aktivere interaktiv segmentering af produkter i billeder og videoer. Dette kan give kunderne mulighed for at se produkter fra forskellige vinkler og sammenhænge. For lagerstyring kan det hjælpe detailhandlere med at spore og segmentere produkter på hylder i realtid, hvilket strømliner lagerstyring og forbedrer den samlede lagerstyring.
Overvindelse af SAM 2’s begrænsninger: Praktiske løsninger og fremtidige forbedringer
Selvom SAM 2 fungerer godt med billeder og korte videoer, har den nogle begrænsninger, der skal tages i betragtning for praktisk brug. Den kan have svært ved at spore objekter gennem betydelige synsvinkelændringer, lange blokeringer eller i overfyldte scener, især i længere videoer. Manuelt korrektion med interaktive klik kan hjælpe med at løse disse problemer.
I overfyldte miljøer med lignende objekter kan SAM 2 af og til misidentificere mål, men yderligere prompts i senere frames kan løse dette. Selvom SAM 2 kan segmentere multiple objekter, reduceres dens effektivitet, da den behandler hvert objekt separat. Fremtidige opdateringer kunne drage fordel af at integrere fælles kontekstuel information for at forbedre præstationen.
SAM 2 kan også overse fine detaljer med hurtigt bevægelige objekter, og forudsigelser kan være ustabile på tværs af frames. Dog kan yderligere træning løse denne begrænsning. Selvom automatisk generering af annoteringer er forbedret, er menneskelige annotatorer stadig nødvendige for kvalitetskontrol og framevalg, og yderligere automatisering kunne forbedre effektiviteten.
Sammenfatning
SAM 2 repræsenterer et betydeligt spring fremad i realtid objektsegmentering for både billeder og videoer, bygget på det grundlag, der er lagt af dens forgænger. Ved at forbedre funktioner og udvide funktionalitet til dynamisk videoindhold lover SAM 2 at forvandle en række felter, fra sundhedspleje og selvstændige køretøjer til interaktivt medie og detailhandel. Selvom udfordringer består, især i håndtering af komplekse og overfyldte scener, opmuntrer den open-source-natur af SAM 2 til kontinuerlig forbedring og tilpasning. Med sin kraftfulde præstation og tilgængelighed er SAM 2 parat til at drive innovation og udvide mulighederne i computer vision og andet.












