Anderson’un Açısı

AI Geliştirme için Koku Duyusunu Getirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
An AI-generated image: a nasally-endowed robot smells a flower in NYC's central park. GPT-image-1 and Qwen Edit 5209.

Yeni bir AI veri kümesi, makinelerin kokuyu öğrenmesini sağlar ve görüntülerle kokuları eşleştirir, böylece modeller kokuları nesnelerle, sahnelerle ve malzemelerle eşleştirebilir.

 

Belki de koku çıkaran makinelerin böyle bir geçmişi vardır, AI araştırma literatüründe koku duyusu assez ihmal edilmiştir. Eğer smell-o-vision serisinin bir başka girişimini üretmeyi planlamıyorsanız, görüntü, ses ve video veri kümeleri ve bu veri kümelerinden eğitilen AI modellerinin potansiyel kullanım alanlarına kıyasla kullanım alanları oldukça dar görünür.

Aslında, patlayıcı koklayan köpekler, ceset koklayan köpekler, hastalık koklayan köpekler ve çeşitli diğer türdeki köpeklerin burnunun yardımıyla sunulan tespit olanaklarının otomasyonunun, endüstrileşmesinin ve popülerleştirilmesinin municipal ve güvenlik hizmetlerinde önemli bir avantaj olacağı açıktır. Talep yüksek olmasına rağmen, tedarik fazla değildir, tespit köpeklerinin eğitimi ve bakımı pahalı bir iştir ve her zaman iyi bir değer sağlamaz.

Bugüne kadar, bu alanda yapılan araştırmaların çoğu, el ile oluşturulmuş özelliklere sahip örneklerden oluşan küratörlü koleksiyonlarla sınırlı kalmıştır – daha çok özel bir çözüm yerine endüstriyel uygulamalara yönelik bir profile sahip.

İleri Bir Adım

Bu oldukça eski iklimde, ABD’den gelen bir akademik ve endüstriyel işbirliği ortaya çıktı. Araştırmacılar, birkaç ay boyunca New York Şehirindeki çeşitli kokuları ve bunlarla ilişkili görüntüleri katalogladı – ve ilk kez, yakalanan kokularla ilişkili görüntüleri topladı:

Merkezi sensör, koku alma cihazının 'burnu'. Sadece kokuya göre eğitilen model, granit, plastik veya deri olduğunu tahmin eder ve görüntüde hiçbir piksel görmeden odanın içinde olduğunu belirler. Kaynak: https://smell.cs.columbia.edu/

Merkezi sensör, koku alma cihazının ‘burnu’. Sadece kokuya göre eğitilen model, granit, plastik veya deri olduğunu tahmin eder ve görüntüde hiçbir piksel görmeden odanın içinde olduğunu belirler. Kaynak

Bu araştırma, yazarların, popüler Contrastive Language-Image Pretraining (CLIP) çerçevesinin bir varyantını geliştirmelerine yol açtı. Bu varyant, Contrastive Olfaction-Image Pretraining (COIP) olarak adlandırıldı ve kokuları görüntülerle eşleştirdi.

Üst: senkronize video ve koku sensör verileri doğal ortamlarda kamera-e-burun rig ile kaydedilir. Alt sol (b): ortak bir gömme, çapraz-modál öz-denetim yoluyla öğrenilir. (c): sistem, yalnızca bir koku sorgusuna dayanarak görsel eşleşmeleri alır. (d): bireysel koku örnekleri, çevre, nesne ve malzeme kategorilerini sınıflandırmak için kullanılır. (e): yüksek derecede benzer kokular, görsel girdi olmadan ayırt edilir.

Üst: senkronize video ve koku sensör verileri doğal ortamlarda kamera-e-burun rig ile kaydedilir. Alt sol (b): ortak bir gömme, çapraz-modál öz-denetim yoluyla öğrenilir. (c): sistem, yalnızca bir koku sorgusuna dayanarak görsel eşleşmeleri alır. (d): bireysel koku örnekleri, çevre, nesne ve malzeme kategorilerini sınıflandırmak için kullanılır. (e): yüksek derecede benzer kokular, görsel girdi olmadan ayırt edilir. Kaynak

Yeni veri kümesi, New York Smells olarak adlandırıldı ve 7.000 koku-görüntü çiftini içerir. Testlerde, yeni veri kümesi, popüler el ile oluşturulmuş özelliklerin bulunduğu daha küçük benzer veri kümelerini aştı.

Yazarlar, bu ilk çalışmanın, vahşi ortamlarda çalışan koku tespit sistemlerine yönelik sonraki çalışmaların yolunu açacağını umuyor:

‘Bu veri kümesini, vahşi ortamlarda çok modlu koku algısına ve görme ile kokuyu bağlamaya doğru bir adım olarak görüyoruz. Koklama geleneksel olarak kısıtlanmış ortamlarda ele alındı, ancak doğal ortamlarda birçok uygulama var.

‘Örneğin, insanlar olarak, sürekli olarak koklama duyusunu kullanarak yiyeceklerin kalitesini değerlendirir, tehlikeleri tanımlar ve görünmeyen nesneleri tespit ederiz.

‘Ayrıca, köpekler, ayılar ve fareler gibi birçok hayvan, insan koklama algısından daha iyi yeteneklere sahiptir, bu da makine yeteneklerinin insan koklama algısının çok ötesine geçebileceğini göstermektedir.’

Yöntem

Yeni koleksiyon için materyal toplamak amacıyla, araştırmacılar Cyranose 320 elektronik burnu kullandı. iPhone, kokuların kaydedildiği forward intake’ın üzerine monte edildi:

Taşınabilir bir sensör rigi, iPhone kamerasını Cyranose 320 e-buruna monte ederek eşleştirilmiş video ve koku verisi toplar. Burnun nesnelere yönlendirilmesi ve hava akışının örnek alma sırasında yönetilmesi için egzoz ve purge girişi kullanılır. RGB‑D kamera derinliği kaydederken, Volatile organik bileşik (VOC) konsantrasyonu, sıcaklık ve nem entegre sensörler aracılığıyla kaydedilir.

Taşınabilir bir sensör rigi, iPhone kamerasını Cyranose 320 e-buruna monte ederek eşleştirilmiş video ve koku verisi toplar. Burnun nesnelere yönlendirilmesi ve hava akışının örnek alma sırasında yönetilmesi için egzoz ve purge girişi kullanılır. RGB‑D kamera derinliği kaydederken, Volatile organik bileşik (VOC) konsantrasyonu, sıcaklık ve nem entegre sensörler aracılığıyla kaydedilir.

Cyranose cihazı 2Hz’de çalışır ve 32 boyutlu koku zaman adımlarını kaydeder. Volatile Organik Bileşik (VOC) konsantrasyonları, MiniPID2 PPM WR sensörü ile kaydedildi.

Portatif ünite, verilerini daha güçlü bir mobil istasyona ileten bir sensör olarak işlev gördü.

Koku alma hedefini bağlamında yerleştirmek için, bir ‘temel koku’ kaydedildi, daha sonra belirli nesne doğrudan Cyranose’un ‘burnu’ ile hedeflendi. Ambient örnek, birimin yan portundan alındı, böylece koku kaynağından uzakta olmadığından emin olunurdu.

İki örnek, sensörün ana girişinden alındı, her biri nesnenin etrafındaki farklı bir konumdan 10 saniyelik kayıt olarak kaydedildi, böylece veri verimliliği iyileştirildi. Örnekler daha sonra ambient temel ile birleştirilerek 28×32 matrisi oluşturuldu, bu da tam koku ölçümünü temsil ediyordu:

Bu örnek, bir çiçeğin sinyalini ve karşılık gelen görüntüsünü gösterir. Tam koku sinyali, 14 çerçeve ambient temel ile iki 10 saniyelik örneğin birleştirilmesinden oluşan 28x32 matrisi içerir.

Bu örnek, bir çiçeğin sinyalini ve karşılık gelen görüntüsünü gösterir. Tam koku sinyali, 14 çerçeve ambient temel ile iki 10 saniyelik örneğin birleştirilmesinden oluşan 28×32 matrisi içerir.

Veri ve Testler

Görme Dili Modelleri (VLMs) kullanılarak, iPhone tarafından kaydedilen nesneler ve malzemeler otomatik olarak etiketlendi. GPT-4o, bu görev için kullanıldı; ancak sahne kategorileri manuel olarak etiketlendi:

Kaynak paperdaki geniş bir illüstrasyonun küçük bir örneği, burada projede yakalanan çeşitli koku kaynakları ve ortamları gösterir.

Kaynak paperdaki geniş bir illüstrasyonun küçük bir örneği, burada projede yakalanan çeşitli koku kaynakları ve ortamları gösterir.

Veri kümesi, eğitim ve doğrulama bölümlerine ayrıldı. Her nesnenin örnekleri aynı bölüme atanarak çapraz kirlenme önlenmiştir. Sonuçta oluşan koleksiyon, 3.500 etiketsiz nesneden 7.000 koku-görüntü çiftini içerir ve 70 saat video ve 196.000 zaman adımından oluşan ham koku verisi içerir.

Veri, 60 oturum boyunca iki aylık bir süre boyunca toplanmıştır. Sonuçta oluşan veri kümesi, %41 outdoor ve %59 indoor ortamları içerir.

Genel amaçlı koku temsilini geliştirmek için, yazarlar, veri kümesinden senkronize edilmiş görüntü-koku çiftlerini kullanarak bir çapraz model eğittiler. Bu yaklaşım, CLIP’ten uyarlanan bir kayıp fonksiyonu kullanarak görsel ve koku sinyallerinin gömmelerini hizalar.

Eğitim, hem görsel hem de koku kodlayıcılarını kullandı. Modelin, eşleşen kokuları ve görüntüleri paylaşılan bir temsil alanında bir araya getirmeyi öğrenmesi hedeflendi. Sonuçta oluşan temsil, koku-görüntü alma, sahne ve nesne tanımı, malzeme sınıflandırması ve ince ayrıntılı koku ayırt etme gibi çeşitli görevleri destekler.

Model, iki tür koku girişi kullanılarak eğitildi: ham koku sinyali ve smellprints olarak bilinen bir özet.

Ham girdi, Cyranose cihazındaki 32 kimyasal sensörden oluşan bir zaman serisi kaydetti.

Çapraz-Modál Alma

Çapraz-modál alma, her koku örneği ve eşleştirilmiş görüntüsünü paylaşılan bir temsil alanında gömmek ve yalnızca koku girdisine dayanarak doğru görüntüyü almanın mümkün olup olmadığını test ederek değerlendirildi.

Sıralama, her görüntü gömmesinin koku sorgusuna olan yakınlığına göre belirlendi ve performans, ortalama sıralama, median sıralama ve hatırlama gibi çeşitli eşiği kullanarak ölçüldü:

Farklı koku kodlayıcıları için çapraz-modál alma doğruluğu, her modelin koku sorgusundan doğru görüntüyü ne kadar iyi tanımladığını gösterir. Sonuçlar, ham koku sinyallerine göre eğitilen mimarilerle smellprints kullananları karşılaştırır.

Farklı koku kodlayıcıları için çapraz-modál alma doğruluğu, her modelin koku sorgusundan doğru görüntüyü ne kadar iyi tanımladığını gösterir. Sonuçlar, ham koku sinyallerine göre eğitilen mimarilerle smellprints kullananları karşılaştırır.

Araştırmacılar, bu sonuçlar hakkında şunları belirtirler:

‘Smellprint kullanarak karşıt ön eğitim, tüm metriklerde şansa göre daha iyi performans gösterir. Ancak, koku kodlayıcısını ham koku sinyaline göre eğitmek, mimari bağımsız olarak smellprint kodlayıcısına göre önemli bir iyileşme sağlar.

‘Bu, ham koku verisinde daha zengin bilgilerin olduğunu ve görme ile kokunun çapraz-modál bağıntılarını daha güçlü bir şekilde ortaya koyduğunu gösterir.’

Sahne, Nesne ve Malzeme Tanıma

Modelin, yalnızca koku verisi kullanarak sahne, nesne ve malzeme tanıma yeteneği, bir dondurulmuş temsil üzerinde eğitilen bir doğrusal sorgu kullanarak değerlendirildi.

Etiketler, eğitim kümesindeki eşleştirilmiş görüntülerden GPT-4o kullanılarak türetilmiştir, ancak yalnızca koku sinyali sınıflandırma sırasında kullanılmıştır.

Çeşitli kodlayıcı türleri test edilmiştir: bazıları rastgele başlatılmış, bazıları sıfırdan eğitilmiş, diğerleri ise çapraz-modál öğrenme kullanılarak görme ve koku arasında paylaşılan bir temsil alanında hizalanmıştır.

Sahneler, malzemeler ve nesneler için sınıflandırma doğruluğu, yalnızca koku sinyalleri kullanılarak değerlendirildi. Ham koku girişi, smellprints'e göre daha yüksek doğruluk sağladı, özellikle sıfırdan eğitilen CNN'ler en yüksek sonuçları verdi.

Sahneler, malzemeler ve nesneler için sınıflandırma doğruluğu, yalnızca koku sinyalleri kullanılarak değerlendirildi. Ham koku girişi, smellprints’e göre daha yüksek doğruluk sağladı, özellikle sıfırdan eğitilen CNN’ler en yüksek sonuçları verdi.

Araştırmacılar, şunları belirtirler:

‘Ham sensör girişini kullanan modeller, el ile oluşturulmuş smellprint özelliklerine göre daha yüksek doğruluk sağlar. Bu sonuçlar, derin öğrenmenin ham koku sinyallerinden daha iyi olduğunu gösterir.’

İnce Ayrıntılı Ayrım

İnce ayrıntılı koku ayrımlarının öğrenilebileceğini değerlendirmek için, aynı çim alanındaki iki tür çim için bir test verisi oluşturuldu. Alternatif örnekler, altı 30 dakikalık oturum boyunca toplandı ve 256 örnek elde edildi. Bir doğrusal sınıflandırıcı kullanılarak, koku-görüntü çapraz-modál öğrenmesinden elde edilen özellikler değerlendirildi:

Çim türlerinin koku ile sınıflandırma doğruluğu. Modeller, yalnızca koku girdisi kullanarak iki görsel olarak benzer çim türünü ayırt etme yetenekleri değerlendirildi.

Çim türlerinin koku ile sınıflandırma doğruluğu. Modeller, yalnızca koku girdisi kullanarak iki görsel olarak benzer çim türünü ayırt etme yetenekleri değerlendirildi.

Araştırmacılar, şunları belirtirler:

‘Ham koku sensör sinyalini (el ile oluşturulmuş özelliklerin yerine) kullanarak eğitim, tüm varyantlardan daha yüksek doğruluk sağlar. Bu, koku-görüntü öğrenmesinin, smellprints kullanmaktan daha ince ayrıntılı bilgiyi koruduğunu ve görsel denetimin bu bilginin kullanılmasına olanak sağladığını gösterir.’

Sonuç

Koku sentezleme problemi henüz çözülmemiş olsa da, etkili ve uygun bir vahşi ortam koku analiz sistemi, polis, güvenlik ve tıbbi amaçlar için büyük bir potansiyele sahiptir.

Şu anda, kullanılan ekipman genellikle niş ve pahalıdır; bu nedenle, ‘koku AI’ için gerçek ilerleme, Raspberry PI ruhunda vizyoner ve uygun bir sensöre bağlı görünüyor.

 

* Yazarların inline alıntılarını hyperlinklere dönüştürdüm.

** Kaynak paperdaki ilave illüstrasyonlar (şekil 8) mevcuttur, ancak bu bağlamda en iyi şekilde görüntülenebilir.

İlk olarak 28 Kasım 2025 Cuma günü yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]