Andersons vinkel

Att ge AI en känsla för lukter

mm
Lägg till Unite.AI bland dina föredragna källor på Google
An AI-generated image: a nasally-endowed robot smells a flower in NYC's central park. GPT-image-1 and Qwen Edit 5209.

En ny AI-databas lär maskiner att lukta genom att associera luktdatum med bilder, vilket gör att modellerna kan matcha lukter med objekt, scener och material.

 

Kanske på grund av att luktkontrollmaskiner har en så brokig historia, är luktsinnet ett ganska försummat sinne inom AI-forskningen. Om man inte planerar att producera en ny version i den långa serien (mer än ett århundrade hittills) smell-o-vision-sagan, har användningsfall alltid tyckts ganska “nischade” i jämförelse med den potentiella exploateringen av bild-, ljud- och videodatabaser och de AI-modeller som tränas från dem.

I själva verket skulle möjligheten att automatisera, industrialisera och popularisera det slags detektionsfaciliteter som erbjuds av bombhundar, likhundar, sjukdomsdoftande hundar och olika andra typer av hundar med luktsinne, skulle vara en betydande fördel inom kommunala och säkerhetstjänster. Trots den höga efterfrågan, är utbudet långt ifrån tillräckligt, och att träna och underhålla detektionshundar är en dyr verksamhet som inte alltid erbjuder bra värde för pengarna.

Hittills har de flesta forskningsinsatser som berör detta område varit begränsade till ett laboratorium, med kuraterade samlingar som vanligtvis består av exempel med handgjorda funktioner – en profil som är mer inriktad på specialtillverkade lösningar än industrialiserade tillämpningar.

Före språng

I denna ganska dammiga atmosfär kommer en intressant ny akademisk/industriell samverkan från USA, där ett team av forskare tillbringade flera månader med att katalogisera olika lukter i inomhus- och utomhusmiljöer i New York City – och för första gången samlade in bilder som är associerade med de inspelade lukterna:

Observera den centrala sensorn, 'nosen' på luktenheten. Tränad endast på lukter, gissar modellen om den luktar granit, plast eller läder – och identifierar även rummet den befinner sig i, utan att se en enda pixel. Källa: https://smell.cs.columbia.edu/

Observera den centrala sensorn, ‘nosen’ på luktenheten. Tränad endast på lukter, gissar modellen om den luktar granit, plast eller läder – och identifierar även rummet den befinner sig i, utan att se en enda pixel. Källa

Denna forskning har lett författarna till den nya studien att utveckla en variant av den mycket populära ramverket Contrastive Language-Image Pretraining (CLIP), som kopplar text och bilder, i form av Contrastive Olfaction-Image Pretraining (COIP) – som kopplar lukter och bilder.

Övre delen: synkroniserad video och luktsensordata som samlas in i naturliga miljöer med hjälp av en kamera-e-nos-rig. Nedre vänster (b): en gemensam inbäddning lär sig genom cross-modalt självövervakning. (c): systemet hämtar visuella matchningar baserat enbart på en luktförfrågan. (d): enskilda luktexempel används för att klassificera miljö, objekt och material. (e): mycket liknande lukter, som två typer av gräs, skiljs åt utan visuell inmatning. Källa: https://arxiv.org/pdf/2511.20544

Övre delen: synkroniserad video och luktsensordata som samlas in i naturliga miljöer med hjälp av en kamera-e-nos-rig. Nedre vänster (b): en gemensam inbäddning lär sig genom cross-modalt självövervakning. (c): systemet hämtar visuella matchningar baserat enbart på en luktförfrågan. (d): enskilda luktexempel används för att klassificera miljö, objekt och material. (e): mycket liknande lukter, som två typer av gräs, skiljs åt utan visuell inmatning. Källa

Den nya databasen, med titeln New York Smells, innehåller 7 000 luktbildpar med 3 500 olika objekt. När den tränades i tester, visade sig den nya datan vara bättre än de populära handgjorda funktionerna i de relativt få liknande tidigare databaserna.

Författarna hoppas att deras första företag ska bana väg för senare och efterföljande arbete mot luktdetektionssystem som är utformade för att fungera i vildmarken, på samma sätt som lukthundar gör*:

‘Vi ser på denna databas som ett steg mot luktdetektion i vildmarken, samt ett steg mot att koppla syn med lukter. Medan luktsinnet traditionellt har närmat sig i begränsade miljöer, som kvalitetskontroll, finns det många tillämpningar i naturliga miljöer.

‘Till exempel, som människor, använder vi ständigt vår luktsinne för att bedöma matens kvalitet, identifiera faror och upptäcka osynliga föremål.

‘Dessutom visar många djur, som hundar, björnar och möss, övermänsklig luktförmåga förmågor, vilket tyder på att den mänskliga luktförmågan är långt ifrån gränsen för maskinernas förmågor.’

Även om den nya artikeln, med titeln New York Smells: En stor multimodal databas för luktsinnet, lovar att data och kod kommer att släppas, är en 27 GB stor datafil redan tillgänglig via artikeln projektsida. Artikeln är skriven av nio forskare från Columbia University, Cornell University och Osmo Labs.

Metod

För att samla in material för den nya samlingen, använde forskarna Cyranose 320-elektroniska näsan, med en iPhone monterad ovanför insugningsöppningen för att fånga visuellt vad lukter som registrerades:

En handhållen sensorenhet samlar in parade video- och luktdatum genom att montera en iPhone-kamera på en Cyranose 320-e-nos. Nosen riktas mot föremål medan avgas- och rensningsinlopp hanterar luftflödet under provtagningen. En RGB-D-kamera fångar djup, medan Volatile Organic Compound (VOC)-koncentration, temperatur och fuktighet registreras genom integrerade sensorer, inklusive en Proportional-integral-derivative (PID)-modul och en miljösond.

En handhållen sensorenhet samlar in parade video- och luktdatum genom att montera en iPhone-kamera på en Cyranose 320-e-nos. Nosen riktas mot föremål medan avgas- och rensningsinlopp hanterar luftflödet under provtagningen. En RGB-D-kamera fångar djup, medan Volatile Organic Compound (VOC)-koncentration, temperatur och fuktighet registreras genom integrerade sensorer, inklusive en Proportional-integral-derivative (PID)-modul och en miljösond.

Cyranose-enheten kör på 2 Hz, och registrerar 32-dimensionella lukttidssteg. Volatile Organic Compound (VOC)-koncentrationer registrerades med en MiniPID2 PPM WR-sensor.

Den portabla enheten fungerade som en smidig sensor, som vidarebefordrade data till en mer beräkningskapabel mobil station för bearbetning.

För att placera mållukten i sammanhang, registrerades en “baslukts” först, innan det mer specifika föremålet riktades direkt med “nosen” på Cyranose. Den omgivande provtagningen togs sedan från en sidopassage i enheten, för att säkerställa att den var tillräckligt långt ifrån den primära luktkällan för att inte bli förorenad.

Två prover togs genom huvudintaget på sensorn, med varje tiosekundersinspelning som togs från en annan position runt föremålet, för att förbättra dataeffektiviteten. Proverna kombinerades sedan med den omgivande basen för att bilda en 28×32-matrix, som representerar den fullständiga luktmätningen:

Detta exempel visar signalen och motsvarande bild för en blomma. Den fullständiga luktsignalen består av en 28x32-matrix, som kombinerar en 14-ramars omgivande bas med två 10-sekundersprover som togs från olika vinklar runt målföremålet.

Detta exempel visar signalen och motsvarande bild för en blomma. Den fullständiga luktsignalen består av en 28×32-matrix, som kombinerar en 14-ramars omgivande bas med två 10-sekundersprover som togs från olika vinklar runt målföremålet.

Data och tester

Vision Language Models (VLM) användes för att automatiskt märka objekt och material som fångats av iPhone i Cyranose-riggen, med GPT-4o som användes för uppgiften; dock var scenkategorier manuellt märkta:

En liten del av en omfattande illustration i källartikeln som visar de varierade luktkällor och miljöer som fångats i projektet.

En liten del av en omfattande illustration i källartikeln som visar de varierade luktkällor och miljöer som fångats i projektet.

Databasen delades upp i tränings- och valideringsdelar delar, med båda prover från varje objekt tilldelade samma del för att undvika korskontamination. Den slutliga samlingen består av 7 000 luktbildpar som hämtats från 3 500 omarkerade objekt, tillsammans med 70 timmar video och 196 000 tidssteg av råa luktdatum från både bas- och provtagningsfaserna.

Data samlades in under 60 sessioner över en tvåmånadersperiod, som omfattade parker, universitetsbyggnader, kontor, gator, bibliotek, lägenheter och matsalar, med flera sessioner genomförda på varje plats. Den resulterande databasen innehåller 41% utomhus- och 59% inomhusmiljöer.

För att utveckla allmänna luktrepresentationer, tränade författarna en kontrastiv modell för att associera synkroniserade bild-luktpar från databasen. Denna metod, den ovannämnda COIP, använder en förlustfunktion anpassad från CLIP för att justera inbäddningarna av samtidiga visuella och luktsignaler.

Träningen använde både en visuell encoder och en luktenkodare, med målet att lära modellen att bringa matchande lukter och bilder närmare varandra i ett gemensamt representationsutrymme. De resulterande representationerna stöder en rad nedströmsuppgifter, inklusive luktbildhämtning, scenerkännning, objektklassificering och finmaskig luktdiskriminering.

Modellen tränades med två typer av luktinmatningar: den fullständiga råa sensorns signal och en reducerad handgjord sammanfattning som kallas luktsignaturer – ett vanligt förekommande funktion i luktforskning som komprimerar varje sensors svar till ett enda tal genom att jämföra toppmotståndet under provtagningen med det genomsnittliga motståndet under den omgivande basen.

Till skillnad från det råa ingångsvärdet, som består av en tidsserie från 32 kemiska sensorer inuti Cyranose-enheten, som fångar hur varje sensors elektriska motstånd förändras över tid när den reagerar på lukten.

För kurering av databasen, matades denna oprocessade signal direkt in i ett neuronnätverk, vilket möjliggjorde slut-till-slut-lärande med antingen en konvolutionsbaserad eller transformatorbaserad bakkant. Modeller tränades med både luktsignaturer och råa ingångsvärden som samlats in från olika miljöer i New York City, med båda ingångstyper utvärderade med kontrastivt lärande.

Cross-Modal Retrieval

Cross-modal retrieval utvärderades genom att inbädda varje luktexempel och dess associerade bild i ett gemensamt representationsutrymme, och testa om den korrekta bilden kunde hämtas baserat enbart på luktinmatningen.

Rankning bestämdes av avståndet mellan varje bildinbäddning och luktförfrågan inom detta utrymme, och prestandan mättes med medelrank, medianrank och återkallande vid flera trösklar:

Cross-modalt återhämtningstillförlitlighet för olika luktkodare, som visar hur väl varje modell identifierar den korrekta bilden från en luktförfrågan. Resultaten jämför arkitekturer tränade på råa luktsignaler med de som använder luktsignaturer.

Cross-modalt återhämtningstillförlitlighet för olika luktkodare, som visar hur väl varje modell identifierar den korrekta bilden från en luktförfrågan. Resultaten jämför arkitekturer tränade på råa luktsignaler med de som använder luktsignaturer.

Med avseende på dessa resultat, förklarar författarna:

‘Kontrastiv förträning med luktsignaturer fungerar bättre än slumpen i alla mått. Men träning av luktkodaren på den råa luktsignalen leder till betydande förbättring jämfört med luktsignaturkodaren, oavsett arkitektur.

‘Detta visar den rikare informationen i de råa luktdatum, som låser upp starkare cross-modala associationer mellan syn och lukt.’

En detalj från den sjunde illustrationen i källartikeln, som är för kondenserad för att återges meningsfullt här. Här visas cross-modalt återhämtningsexempel som visar hur modellen kopplar lukter till matchande bilder. Varje rad börjar med en luktförfrågan, följt av de högst rankade bildförutsägelserna i det gemensamma inbäddningsutrymmet. Den korrekta bilden för varje förfrågan är markerad med grön färg, vilket visar hur lukter från böcker, växter, sten och andra material drar modellen mot visuellt och semantiskt relaterade scener.

En detalj från den sjunde illustrationen i källartikeln, som är för kondenserad för att återges meningsfullt här. Här visas cross-modalt återhämtningsexempel som visar hur modellen kopplar lukter till matchande bilder. Varje rad börjar med en luktförfrågan, följt av de högst rankade bildförutsägelserna i det gemensamma inbäddningsutrymmet. Den korrekta bilden för varje förfrågan är markerad med grön färg, vilket visar hur lukter från böcker, växter, sten och andra material drar modellen mot visuellt och semantiskt relaterade scener.

Författarna noterar också att återhämtningresultaten visade tydliga semantiska mönster:

‘Återhämtningar från vår modell visar ofta semantiska grupperingar. Lukten av en bok hämtar bilder av andra böcker, lukten av blad hämtar bilder av löv.

‘Dessa resultat tyder på att den inlärda representationen fångar meningsfull cross-modalt struktur.’

Scen, Objekt och Materialigenkänning

Förmågan hos modellen att känna igen lukter utan visuell inmatning utvärderades genom att träna den för att identifiera scener, objekt och material baserat enbart på luktdatum; för detta ändamål användes en linjär sonda (en enkel klassificerare tränad på frusna representationer) för att bedöma hur mycket information som kodades i de inlärda luktinbäddningarna.

Etiketterna härleddes från de parade bilderna i träningsuppsättningen med hjälp av GPT-4o – men endast luktsignalen användes under klassificeringen.

Flera kodartyper testades: vissa initierades slumpmässigt, vissa tränades från scratch och andra tränades med kontrastivt lärande för att justera lukt och syn i ett gemensamt representationsutrymme, med rådata och luktsignaturer utvärderade:

Klassificeringsnoggrannhet för scener, material och objekt utvärderades med hjälp av luktsignaler ensamma. Råa sensordata överträffade luktsignaturer, med CNN:er tränade från scratch som gav de högsta resultaten, inklusive 99,5% för scener. SSL-förträning hjälpte i vissa fall, men överträffades i allmänhet av övervakat träning. Slumpmässiga vikter indikerar att modellkapacitet ensam är otillräcklig.

Klassificeringsnoggrannhet för scener, material och objekt utvärderades med hjälp av luktsignaler ensamma. Råa sensordata överträffade luktsignaturer, med CNN:er tränade från scratch som gav de högsta resultaten, inklusive 99,5% för scener. SSL-förträning hjälpte i vissa fall, men överträffades i allmänhet av övervakat träning. Slumpmässiga vikter indikerar att modellkapacitet ensam är otillräcklig.

Mycket högre noggrannhet uppnåddes när råa luktdatum användes, särskilt i modeller som tränades med cross-modalt övervakning. Författarna kommenterar**:

‘Modeller som tränats på råa sensoriska indata uppnår också högre noggrannhet än modeller tränade med handgjorda luktsignaturfunktioner. Dessa resultat visar att djupinlärning från råa luktsignaler är betydligt bättre än handgjorda funktioner.’

Finmaskig Diskriminering

För att utvärdera om finmaskiga luktdistinktioner kunde läras, byggdes en benchmark från två grässorter som samexisterar på samma campusgräs. Alternativa prover samlades in under sex 30-minuterssessioner, vilket resulterade i 256 exempel. En linjär klassificerare tränades på funktioner från luktsynskontrastivt lärande, och utvärderades på en uppsatt uppsättning av 42 prover:

Noggrannhet för grässortsklassificering från lukt ensam. Modeller utvärderades på deras förmåga att skilja mellan två visuellt liknande grässorter med hjälp av endast luktsignal. Prestanda jämfördes över luktsignaturer och råa sensordata, med modeller antingen slumpmässigt initierade, tränade från scratch eller tränade med självövervakat lärande (SSL) följt av en linjär sonda. Den högsta noggrannheten, 92,9%, uppnåddes med råa luktsignaler och SSL, vilket indikerar att finmaskiga luktdistinktioner bäst fångas genom råa indata och visionstyrd träning.

Noggrannhet för grässortsklassificering från lukt ensam. Modeller utvärderades på deras förmåga att skilja mellan två visuellt liknande grässorter med hjälp av endast luktsignal. Prestanda jämfördes över luktsignaturer och råa sensordata, med modeller antingen slumpmässigt initierade, tränade från scratch eller tränade med självövervakat lärande (SSL) följt av en linjär sonda. Den högsta noggrannheten, 92,9%, uppnåddes med råa luktsignaler och SSL, vilket indikerar att finmaskiga luktdistinktioner bäst fångas genom råa indata och visionstyrd träning.

Här förklarar forskarna:

‘Träning på den råa luktsensorns signal (i stället för handgjorda funktioner) ger den högsta noggrannheten – överträffar alla varianter baserade på luktsignaturer.

‘Dessa resultat tyder på att luktsynslärande bevarar mer finmaskig information än lärande med luktsignaturer, och att visuell övervakning tillhandahåller en signal för att utnyttja denna information.’

Slutsats

Även om luktsyntes förmodligen kommer att förbli ett olöst problem en bra bit in i framtiden, har ett effektivt och prisvärt luktdetektionssystem i vildmarken enorm potential, inte bara för polis-, säkerhets- och medicinska ändamål, utan också för kvalitets- och livskvalitetsövervakning.

För närvarande är den utrustning som är inblandad nischad och vanligtvis ganska dyr; därför verkar det som att verklig framgång inom ‘luktsinnet AI’ för detektion förmodligen kommer att kräva en visionär och prisvärd sensor i Raspberry PI-andan.

 

* Min omvandling av författarnas inline-citat till hyperlänkar.

** Vänligen notera att ytterligare illustrationer (figur 8) finns tillgängliga i källartikeln, men är bäst sedda i det sammanhanget.

Publicerad första gången fredag, den 28 november 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai