AI-mallit ja alustat

AnomalyGPT: Teollisuuden poikkeamien havaitseminen LVLM: n avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Viime aikoina suuret visuaaliset kielen mallit (LVLM), kuten LLava ja MiniGPT-4, ovat osoittaneet kykynsä ymmärtää kuvia ja saavuttaa korkean tarkin ja tehokkuuden useissa visuaalisissa tehtävissä. Vaikka LVLM:t menestyvät yleisten esineiden tunnistamisessa laajan koulutusaineiston ansiosta, niiltä puuttuu tiettyä alan tietämystä ja niiden ymmärrys kuvien paikallisten yksityiskohtien suhteen on rajoitettu. Tämä rajoittaa niiden tehokkuutta teollisuuden poikkeamien havaitsemisessa (IAD). Toisaalta olemassa olevat IAD-kehykset voivat vain tunnistaa poikkeamien lähteet ja vaativat manuaalista kynnyksen asettamista eroon normaaleista ja poikkeavista näytteistä, mikä rajoittaa niiden käytännön soveltamista.

Teollisuuden poikkeamien havaitsemisen kehyksen ensisijainen tarkoitus on havaita ja lokaloida poikkeamia teollisuuden tilanteissa ja tuotekuvissa. Kuitenkin todellisten kuvanäytteiden ennakolta arvaamattomuuden ja harvinaisuuden vuoksi malleja koulutetaan yleensä vain normaaleilla tiedoilla. Ne erottavat poikkeavat näytteet normaaleista näytteistä poiketen tyypillisistä näytteistä. Tällä hetkellä IAD-kehykset ja -mallit tarjoavat pääasiassa poikkeama-arvoja testinäytteille. Lisäksi normaaleja ja poikkeavia tapauksia kussakin luokassa on erottava manuaalisesti kynnyksen asettamalla, mikä tekee niistä soveltumattomia käytännön sovelluksiin.

Teollisuuden poikkeamien havaitsemisen haasteiden tutkimiseksi ja LVLM: n soveltamiseksi tähän ongelmaan, AnomalyGPT, uusi IAD-lähestymistapa LVLM: n pohjalta, esiteltiin. AnomalyGPT voi havaita ja lokaloida poikkeamia ilman manuaalista kynnyksen asettamista. Lisäksi AnomalyGPT voi tarjota myös asiaankuuluvaa tietoa kuvasta, jotta se voi vuorovaikuttaa käyttäjien kanssa ja sallia heidän esittää seuraavan kysymyksen poikkeaman tai heidän tarpeidensa perusteella.

Teollisuuden poikkeamien havaitseminen ja suuret visuaaliset kielen mallit

Olemassa olevat IAD-kehykset voidaan jakaa kahteen kategoriaan.

  1. Rekonstruktio-pohjainen IAD.
  2. Ominaisuus-upotus-pohjainen IAD.

Rekonstruktio-pohjaisessa IAD-kehyksessä ensisijainen tavoite on rekonstruoida poikkeama-näytteet niiden vastaaviin normaaleihin näytteisiin ja havaita poikkeamia rekonstruktiovirheen laskemalla. SCADN, RIAD, AnoDDPM ja InTra käyttävät erilaisia rekonstruktiokehyksiä, jotka vaihtelevat generatiivisista vastakkaisista verkoista ja autoenkoodereista difuusiomalliin ja transformatoreihin.

Toisaalta ominaisuus-upotus-pohjaisessa IAD-kehyksessä ensisijainen tavoite on keskittyä normaalin tiedon ominaisuus-upotukseen. Menetelmiä kuten PatchSSVD pyrkivät löytämään hypersfäärin, joka voi kattaa normaaleja näytteitä tiiviisti, kun taas kehykset kuten PyramidFlow ja Cfl projisoivat normaaleja näytteitä Gaussian-jakaumaan käyttäen normalisoivia virtoja. CFA- ja PatchCore-kehykset ovat perustaneet muistipankin normaaleista näytteistä paikka-upotuksista ja käyttävät etäisyyttä testinäytteen upotuksesta normaaliin upotukseen poikkeamien havaitsemiseen.

Molemmat menetelmät noudattavat ”yksi luokka, yksi malli” -oppimisparadigmia, joka edellyttää suuren määrän normaaleja näytteitä jokaisen olion luokan jakautumisen oppimiseksi. Suuren määrän normaaleiden näytteiden vaatimus tekee siitä epäkäytännöllisen uusille olion luokille ja rajoittaa soveltamista dynaamisissa tuoteympäristöissä. Toisaalta AnomalyGPT-kehyksen käyttämä kontekstissä oppimisen paradigma sallii objektien luokille vain muutaman normaalin näytteen.

Jatkamalla eteenpäin, meillä on suuret visuaaliset kielen mallit eli LVLM:t. Suuret kielen mallit (LLM) ovat menestyneet merkittävästi NLP-teollisuudessa, ja niitä tutkitaan nyt visuaalisten tehtävien sovelluksissa. BLIP-2-kehyksen avulla voidaan syöttää visuaalisia ominaisuuksia Vision Transformerista Flan-T5-malliin. Lisäksi MiniGPT-kehyksen avulla voidaan yhdistää BLIP-2-kehyksen kuvasegmentti ja Vicuna-malli lineaarisella kerroksella, ja suorittaa kaksivaiheinen hienosäätö prosessi käyttäen kuvatekstiaineistoa. Nämä lähestymistavat osoittavat, että LLM-kehykset voivat olla sovellettavissa visuaalisiin tehtäviin. Kuitenkin nämä mallit on koulutettu yleisille tiedoille, ja niiltä puuttuu vaadittu alan erityistietämys laajalle soveltamiselle.

Miten AnomalyGPT toimii?

AnomalyGPT on ydinosaamisellaan uusi keskustelupohjainen IAD-suuri visuaalinen kielen malli, joka on suunniteltu erityisesti teollisuuden poikkeamien havaitsemiseen ja niiden tarkkaan sijainnin määrittämiseen käyttäen kuvia. AnomalyGPT-kehyksen käyttämä LLM ja esikoulutettu kuvakooderi ovat kohdistettu kuvien ja niiden vastaavien tekstikuvauksien yhdistämiseen stimuloituilla poikkeama-tiedoilla. Malli esittelee dekooderi-moduulin ja prompt-oppimismoduulin parantamaan IAD-järjestelmien suorituskykyä ja saavuttamaan pikselitasoisen lokalisaatio tuloksen.

Mallin arkkitehtuuri

Yllä oleva kuva esittää AnomalyGPT-mallin arkkitehtuurin. Malli syöttää ensin kyselykuvan jäädytetyyn kuvakooderiin. Sitten malli poistaa paikka-tason ominaisuudet välimuistojen väliltä ja syöttää ne kuvadekooderiin laskemaan niiden samankaltaisuuden poikkeavien ja normaaleiden tekstin kanssa saadakseen lokalisaation tulokset. Prompt-oppimismoduuli muuttaa ne sitten prompt-upotuksiin, jotka ovat sovellettavissa LLM:ään käyttäjän tekstisyötteiden ohella. LLM-malli hyödyntää sitten prompt-upotuksia, kuvasyötteitä ja käyttäjän antamia tekstisyötteitä havaitakseen poikkeamia, määrittääkseen niiden sijainnin ja luodakseen loppuvastauksen käyttäjälle.

Dekooderi

Pikselitasoisen poikkeama-lokalisaation saavuttamiseksi AnomalyGPT-malli käyttää kevyttä ominaisuus-vastauspohjaista kuvadekooderia, joka tukee sekä vähän näytteiden IAD-kehyksiä että valvottuja IAD-kehyksiä. Dekooderin suunnittelu, jota AnomalyGPT käyttää, on saanut vaikutteita WinCLIP-, PatchCore- ja APRIL-GAN-kehyksistä. Malli jakaa kuvakooderin neljään vaiheeseen ja poistaa välimuistojen paikka-tason ominaisuudet jokaisessa vaiheessa.

Kuitenkin nämä välimuistot eivät ole käyneet läpi lopullista kuvateksti-yhdistämistä, joten niitä ei voida vertailla suoraan ominaisuuksien kanssa. Tätä ongelmaa ratkaisemaan AnomalyGPT-malli esittelee lisäkerroksia projisoimaan välimuistojen ominaisuuksia ja yhdistämään ne teksti-ominaisuuksien kanssa, jotka edustavat normaaleja ja poikkeavia semantiikkaa.

Prompt-oppiminen

AnomalyGPT-kehyksen käyttämä prompt-oppiminen pyrkii muuttamaan lokalisaatiotuloksen prompt-upotuksiin hyödyntääksesi hienojakoista semantiikkaa kuvista ja ylläpitääksesi semanttisen johdonmukaisuuden dekooderi- ja LLM-tulosten välillä. Lisäksi malli sisällyttää oppimiskykyisiä prompt-upotuksia, jotka eivät liity dekooderi-tuloksiin, prompt-oppimiseen tarjoamaan lisätietoa IAD-tehtävälle. Lopuksi malli syöttää upotukset ja alkuperäisen kuvatiedon LLM:ään.

Prompt-oppiminen koostuu oppimiskykyisistä perus-prompt-upotuksista ja konvoluutio-neuraaliverkosta. Verkko muuttaa lokalisaatiotuloksen prompt-upotuksiin ja muodostaa joukon prompt-upotuksia, jotka yhdistetään kuvauputuksiin LLM:ään.

Poikkeama-simulaatio

AnomalyGPT-malli ottaa käyttöön NSA-menetelmän simuloimaan poikkeama-tietoja. NSA-menetelmä käyttää leikkaa-liimaa-tekniikkaa, jossa käytetään Poisson-kuvanmuokkausmenetelmää vähentämään epäjatkuvuutta, jota liittyy kuvan osien liittämiseen.

Leikkaa-liimaa-menetelmässä leikataan satunnainen lohko kuvasta ja liimataan se toiseen kuvaan satunnaiselle paikalle, jolloin luodaan osa simuloitua poikkeamaa. Nämä simuloitujen poikkeama-näytteet voivat parantaa IAD-mallien suorituskykyä, mutta niillä on haitta, että ne voivat usein tuottaa havaittavissa olevia epäjatkuvuuksia. Poisson-muokkausmenetelmän tavoitteena on kloonata esine toisesta kuvasta toiseen ratkaisemalla Poisson-osittaisdifferentiaaliyhtälöitä.

Yllä oleva kuva esittää vertailun Poisson- ja leikkaa-liimaa-kuvanmuokkausmenetelmien välillä. Kuten voidaan nähdä, leikkaa-liimaa-menetelmässä on näkyvissä olevia epäjatkuvuuksia, kun taas Poisson-muokkausmenetelmän tulokset näyttävät luonnollisemmilta.

Kysymys- ja vastaus-sisältö

Suorittaakseen prompt-säätöä suuressa visuaalisessa kielen mallissa, AnomalyGPT-malli luo vastaavan tekstikysymyksen poikkeama-kuvan perusteella. Jokainen kysymys koostuu kahteen pääasialliseen osaan. Ensimmäinen osa kysymystä koostuu kuvauksesta syötteenä olevasta kuvasta, joka antaa tietoa siinä olevista esineistä ja niiden odotetuista ominaisuuksista. Kysymyksen toinen osa on havaita poikkeamia esineessä tai tarkistaa, onko poikkeamaa kuvassa.

LVLM-malli vastaa ensin kysymykseen onko poikkeamaa kuvassa? Jos malli havaitsee poikkeamia, se jatkaa määrittämään poikkeamien sijaintia ja lukumäärää. Malli jakaa kuvan 3×3-ruudukkoon erillisiin alueisiin, jotta LVLM voi ilmaista poikkeamien sijainnin sanallisesti, kuten kuvassa alla näkyy.

LVLM-malli saa perustiedon syötteenä olevasta kuvasta, joka auttaa mallin ymmärtämään kuvan komponentteja paremmin.

Aineistot ja arviointi-mittarit

Malli suorittaa kokeensa pääasiassa VisA- ja MVTec-AD-aineistojen avulla. MVTec-AD-aineisto koostuu 3629 kuvasta koulutustarkoituksiin ja 1725 kuvasta testaamiseen, jotka on jaettu 15 eri luokkaan, mikä tekee siitä yhden suosituimmista aineistoista IAD-kehyksille. Koulutuskuvat sisältävät vain normaaleja kuvia, kun taas testikuvat sisältävät sekä normaaleja että poikkeavia kuvia. Toisaalta VisA-aineisto koostuu 9621 normaalista kuvasta ja noin 1200 poikkeavasta kuvasta, jotka on jaettu 12 eri luokkaan.

Jatkaen eteenpäin, kuten olemassa olevat IAD-kehykset, AnomalyGPT-malli käyttää AUC:ta eli vastaanottajan operaatiokäyrän aluetta arviointi-mittarinaan, ja pikseli- ja kuva-tasoa käytetään arvioimaan poikkeamien lokalisaatiotehoa ja poikkeamien havaitsemista. Lisäksi malli käyttää kuva-tasoa tarkkaan arviointi-mittarina, koska se mahdollistaa poikkeamien havaitsemisen ilman manuaalista kynnyksen asettamista.

Tulokset

Määrälliset tulokset

Teollisuuden poikkeamien havaitseminen vähäisillä näytteillä

AnomalyGPT-malli vertaa tuloksiaan aiempiin vähäisten näytteiden IAD-kehyksiin, kuten PaDiM, SPADE, WinCLIP ja PatchCore, jotka toimivat vertailukohteina.

Yllä oleva kuva vertaa AnomalyGPT-mallin tuloksia vähäisten näytteiden IAD-kehyksiin. Molemmilla aineistoilla AnomalyGPT-mallin menetelmä ylittää aiempien mallien lähestymistavat kuva-tason AUC:ssa ja palauttaa hyvän tarkin.

Valvomaton teollisuuden poikkeamien havaitseminen

Valvomattomassa koulutusasettelussa suurella määrällä normaaleja näytteitä AnomalyGPT kouluttaa yhden mallin näytteistä, jotka on saatu kaikista luokista aineistosta. AnomalyGPT:n kehittäjät ovat valinneet UniAD-kehyksen, koska se on koulutettu samassa asettelussa, ja toimii vertailukohtena. Lisäksi malli vertaa JNLD- ja PaDim-kehyksiin samassa yhdistetyssä asettelussa.

Yllä oleva kuva vertaa AnomalyGPT-mallin suorituskykyä muihin kehyksiin.

Laadulliset tulokset

Yllä oleva kuva esittää AnomalyGPT-mallin suorituskyvyn valvomattomassa poikkeamien havaitsemisessa, kun taas alla oleva kuva osoittaa mallin suorituskyvyn 1-näytteen kontekstissä oppimisessa.

AnomalyGPT-malli pystyy osoittamaan poikkeamien läsnäolon, merkitsemään niiden sijainnin ja antamaan pikselitasoisen lokalisaation tuloksen. Kun malli on 1-näytteen kontekstissä oppimisessa, lokalisaation suorituskyky on hieman alempi verrattuna valvomattomaan oppimiseen koulutuksen puutteen vuoksi.

Johtopäätös

AnomalyGPT on uusi keskustelupohjainen IAD-visuaalinen kielen malli, joka hyödyntää suurten visuaalisten kielen mallien voimakkaita ominaisuuksia. Se voi havaita poikkeamia kuvassa ja määrittää niiden tarkan sijainnin. Lisäksi AnomalyGPT mahdollistaa monivaiheisen vuorovaikutuksen poikkeamien havaitsemisessa ja osoittaa erinomaisen suorituskyvyn vähäisissä näytteissä kontekstissä oppimisessa. AnomalyGPT tutkii suurten visuaalisten kielen mallien potentiaalisia sovelluksia poikkeamien havaitsemisessa ja esittää uusia ideoita ja mahdollisuuksia IAD-teollisuudelle.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.