AI-mallit ja alustat
Esittelyssä Segment Anything Model (SAM) 2: Meta:n uusi avoimen lähdekoodin perusmalli reaaliaikaiselle objekti-segmentoinnille videoissa ja kuvissa
Vielä viime vuosina tekoälymaailma on nähnyt merkittäviä edistysaskelia perusteellisessa tekoälyssä tekstin prosessoinnissa, jossa on tapahtunut edistysaskelia, jotka ovat muuttaneet aloja asiakaspalvelusta oikeudelliseen analyysiin. Kuitenkin, kun tulee kuva-analyysiin, olemme vasta hiertäen pinnan alla. Visuaalisen datan monimutkaisuus ja haasteet kouluttaa malleja tulkitsimaan ja analysoimaan kuvia oikein ovat esittäneet merkittäviä esteitä. Kun tutkijat jatkavat perusteellisen tekoälyn tutkimista kuvissa ja videoissa, kuvan prosessoinnin tulevaisuus tekoälyssä pitää sisällään innovaatioita terveydenhuollossa, autonomisissa ajoneuvoissa ja muualla.
Objekti-segmentointi, joka sisältää objektiin kuuluvien tarkkojen pikselien määrityksen kuvassa, on tärkeä tehtävä tietokoneen näkössä. Perinteisesti tämä on vaatinut erikoistuneiden tekoälymallien luomista, mikä vaatii laajaa infrastruktuuria ja suuria määriä annotoituja tietoja. Viime vuonna Meta esitteli Segment Anything Model (SAM), perusteellisen tekoälymallin, joka yksinkertaistaa tämän prosessin sallimalla käyttäjien segmentoida kuvia yksinkertaisella ohjeistuksella. Tämä innovaatio vähensi tarvetta erikoistuneelle asiantuntijuudelle ja laajoille laskentaresursseille, tehden kuvasegmentoinnista helpompaa.
Nyt Meta ottaa tämän askelen eteenpäin SAM 2:lla. Tämä uusi iterointi ei ainoastaan paranna SAM:n olemassa olevia kuvasegmentointikapasiteetteja, vaan laajentaa sen myös videoprosessointiin. SAM 2 voi segmentoida minkä tahansa objektin sekä kuvissa että videoissa, myös niitä, joita se ei ole aiemmin kohdannut. Tämä edistysaskel on askel eteenpäin tietokoneen näön ja kuvan prosessoinnin alalla, tarjoten monipuolisemman ja voimakkaamman työkalun visuaalisen sisällön analysointiin. Alla tutkimme SAM 2:n jännittäviä edistysaskelia ja sen mahdollisuuden määritellä uudelleen tietokoneen näön alaa.
Esittelyssä Segment Anything Model (SAM)
Perinteiset segmentointimenetelmät vaativat joko manuaalista hienosäätöä, tunnettuja interaktiivisia segmentointeja, tai laajoja annotoituja tietoja automaattiseen segmentointiin ennalta määrättyihin luokkiin. SAM on perusteellinen tekoälymalli, joka tukee interaktiivista segmentointia monipuolisilla ohjeistuksilla, kuten napsautuksilla, ruuduilla tai tekstisyötteillä. Se voidaan myös hienosäätää vähäisillä tiedoilla ja laskentaresursseilla automaattiseen segmentointiin. Koulutettu yli miljardin monipuolisen kuvan annotaation kanssa, SAM voi käsitellä uusia objekteja ja kuvia ilman tarvetta mukautettujen tietojen keräämiselle tai hienosäätöön.
SAM toimii kahden pääkomponentin kanssa: kuvan kooderin, joka prosessoi kuvaa, ja ohjeistuksen kooderin, joka käsittelee syötteitä kuten napsautuksia tai tekstiä. Nämä komponentit yhdistyvät kevyen dekooderin kanssa ennustamaan segmentointimaskit. Kun kuva on prosessoidu, SAM voi luoda segmentin vain 50 millisekunnissa verkkoselaimessa, tehden siitä voimakkaan työkalun reaaliajassa interaktiivisille tehtäville. Rakentamaan SAM:iin, tutkijat kehittivät kolmevaiheisen tietojen keräämismenetelmän: mallin avustuksella annotointi, automaattisen ja avustetun annotoinnin yhdistelmä ja täysin automaattinen maskin luominen. Tämä prosessi johti SA-1B-aineistoon, joka sisältää yli 1,1 miljardia maskia 11 miljoonalla lisensoidulla, yksityisyyttä suojelevalla kuvalla – tehden siitä 400 kertaa suuremman kuin mikään aiempi aineisto. SAM:n vaikuttava suorituskyky johtuu tästä laajasta ja monipuolisesta aineistosta, varmistaen paremman edustuksen eri maantieteellisillä alueilla verrattuna aiempiin aineistoihin.
Esittelyssä SAM 2: Askel kuvasta videosegmentointiin
Rakentamalla SAM:n perustalle, SAM 2 on suunniteltu reaaliajassa ohjattavalle objekti-segmentoinnille sekä kuvissa että videoissa. Toisin kuin SAM, joka keskittyy ainoastaan statiikksiin kuviiin, SAM 2 prosessoi videoita käsittelemällä jokaisen kehyksen jatkuvan sarjan osana. Tämä mahdollistaa SAM 2:lle käsitellä dynaamisia kohtauksia ja muuttuvaa sisältöä tehokkaammin. Kuvasegmentoinnissa SAM 2 parantaa SAM:n kapasiteetteja ja toimii kolme kertaa nopeammin interaktiivisissa tehtävissä.
SAM 2 säilyttää saman arkkitehtuurin kuin SAM, mutta esittelee muistimekanismin videoprosessoinnille. Tämä ominaisuus sallii SAM 2:lle seurata tietoja edellisistä kehyksistä, varmistaen johdonmukaisen objekti-segmentoinnin liikkeen, valaistuksen tai peittämisen muutosten huolimatta. Viitaten edellisiin kehyksiin, SAM 2 voi hienosäätää maski-ennusteitaan koko videon ajan.
Malli on koulutettu uudelle SA-V-aineistolle, joka sisältää yli 600 000 maski-annotaatiota 51 000 videolla 47 maasta. Tämä monipuolinen aineisto kattaa sekä kokonaisia objekteja että niiden osia, parantaen SAM 2:n tarkkuutta reaaliajassa videosegmentoinnissa.
SAM 2 on saatavilla avoimen lähdekoodin mallina Apache 2.0 -lisenssillä, mikä tekee siitä helposti saatavilla eri käyttötarkoituksiin. Meta on myös jakanut SAM 2:lle käytetyn aineiston CC BY 4.0 -lisenssillä. Lisäksi on verkkopohjainen demo, joka sallii käyttäjien tutkia mallia ja nähdä, miten se toimii.
Potential Use Cases
SAM 2:n kapasiteetit reaaliajassa ohjattavalle objekti-segmentoinnille sekä kuvissa että videoissa ovat avaaneet monia innovatiivisia sovelluksia eri aloilla. Esimerkiksi jotkut näistä sovelluksista ovat seuraavat:
- Terveydenhuollon diagnostiikka: SAM 2 voi parantaa merkittävästi reaaliaikaisen kirurgisen avun segmentoimalla anatomisia rakenteita ja tunnistamalla poikkeavuuksia suorassa videolähetyksessä leikkaussalissa. Se voi myös parantaa lääketieteellisen kuvan analyysiä tarjoamalla tarkan segmentoinnin elimistä tai kasvaimia lääketieteellisissä tutkimuksissa.
- Autonomiset ajoneuvot: SAM 2 voi parantaa autonomisten ajoneuvojen järjestelmiä parantamalla objekti-havaitsemisen tarkkuutta jatkuvalla segmentoinnilla ja seuraamisella jalankulkijoita, ajoneuvoja ja tienviittoja videokehyksissä. Sen kyky käsitellä dynaamisia kohtauksia myös tukee sopeutuvaa navigointia ja törmäysvaara-analyysiä tunnistamalla ja reagoimalla ympäristön muutoksiin reaaliajassa.
- Interaktiivinen media ja viihde: SAM 2 voi parantaa lisättyä todellisuutta (AR) sovelluksia segmentoimalla objekteja reaaliajassa, tehden siitä helpompaa virtuaalisten elementtien yhdistämistä todelliseen maailmaan. Se myös hyödyttää videon editointia automatisoimalla objekti-segmentoinnin kuvamateriaalissa, yksinkertaisten prosesseja kuten taustan poistoa ja objekti-correspondenttia.
- Ympäristön seuranta: SAM 2 voi auttaa eläinten seuraamisessa segmentoimalla ja seuraamalla eläimiä videomateriaalissa, tukeen lajien tutkimusta ja elinympäristön tutkimusta. Häiriötilanteissa se voi arvioida vahinkoa ja ohjata toimintaa segmentoimalla ja tunnistamalla vaikuttavat alueet ja objektit videolähetyksistä.
- Myymälät ja verkkokauppa: SAM 2 voi parantaa tuotteen visualisointia verkkokaupassa mahdollistamalla interaktiivisen segmentoinnin tuotteista kuvissa ja videoissa. Tämä antaa asiakkaille mahdollisuuden tarkastella tuotteita eri kulmista ja konteksteista. Varastoinnissa se auttaa myyjiä seuraamaan ja segmentoimaan tuotteita hyllyillä reaaliajassa, sujuvoittamalla varastointia ja parantamalla kokonaisvaltaista varastohallintaa.
Voittaminen SAM 2:n rajoitusten yli: Käytännön ratkaisut ja tulevat parannukset
Vaikka SAM 2 suoriutuu hyvin kuvista ja lyhyistä videoista, sillä on joitakin rajoituksia, jotka tulee ottaa huomioon käytännön käytössä. Se voi kärsiä seuraamasta objekteja merkittävien näkökulman muutosten, pitkien peittämisten tai väkijoukkokohtauksissa, erityisesti pitkissä videoissa. Manuaalinen korjaus interaktiivisilla napsautuksilla voi auttaa ratkaisemaan nämä ongelmat.
SAM 2 säilyttää saman arkkitehtuurin kuin SAM, mutta esittelee muistimekanismin videoprosessoinnille. Tämä ominaisuus sallii SAM 2:lle seurata tietoja edellisistä kehyksistä, varmistaen johdonmukaisen objekti-segmentoinnin liikkeen, valaistuksen tai peittämisen muutosten huolimatta. Viitaten edellisiin kehyksiin, SAM 2 voi hienosäätää maski-ennusteitaan koko videon ajan.
SAM 2 on saatavilla avoimen lähdekoodin mallina Apache 2.0 -lisenssillä, mikä tekee siitä helposti saatavilla eri käyttötarkoituksiin. Meta on myös jakanut SAM 2:lle käytetyn aineiston CC BY 4.0 -lisenssillä. Lisäksi on verkkopohjainen demo, joka sallii käyttäjien tutkia mallia ja nähdä, miten se toimii.
Pohjimmiltaan
SAM 2 edustaa merkittävää edistysaskelta reaaliajassa objekti-segmentoinnissa sekä kuvissa että videoissa, rakentamalla edellisen sukupolven perustalle. Parantamalla kapasiteetteja ja laajentamalla toiminnallisuutta dynaamisiin videoihin, SAM 2 luvaa muuttaa useita aloja, terveydenhuollosta autonomisiin ajoneuvoihin, interaktiivisesta mediasta vähittäiskauppaan. Vaikka haasteita on edelleen, erityisesti monimutkaisten ja väkijoukkokohtauksien käsittelyssä, SAM 2:n avoimen lähdekoodin luonne rohkaisee jatkuvaan parantamiseen ja sopeutumiseen. Voimakkaan suorituskyvynsä ja saatavuutensa ansiosta SAM 2 on valmis ajamaan innovaatioita ja laajentamaan mahdollisuuksia tietokoneen näön ja muun alalla.












