Anderson’un Açısı

AI Geliştirme için Koku Duyusunu Getirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
An AI-generated image: a nasally-endowed robot smells a flower in NYC's central park. GPT-image-1 and Qwen Edit 5209.

makinelerin kokuyu öğrenmesini sağlar ve görüntülerle kokuları eşleştirir, böylece modeller kokuları nesnelerle, sahnelerle ve malzemelerle eşleştirebilir. Belki

 

Yeni bir AI veri kümesi, de koku çıkaranmakinelerin böyle bir geçmişi vardır, AI araştırma literatüründe koku duyusu assez ihmal edilmiştir. Eğer smell-o-vision serisinin bir başka girişimini üretmeyi planlamıyorsanız, görüntü, ses ve videoveri kümeleri ve bu veri kümelerinden eğitilen AI modellerinin potansiyel kullanım alanlarına kıyasla kullanım alanları oldukça dar görünür. Aslında, Bugüne kadar, bu alanda yapılan araştırmaların çoğu, el ile oluşturulmuş özelliklere sahip örneklerden oluşan küratörlü koleksiyonlarlasınırlı kalmıştır –daha çok özelbir çözüm yerine endüstriyel uygulamalara yönelik bir profile sahip. patlayıcı koklayan köpekler , ceset koklayan köpekler , hastalık koklayan köpeklerve çeşitli diğer türdeki köpeklerin burnunun yardımıyla sunulan tespit olanaklarının otomasyonunun, endüstrileşmesinin ve popülerleştirilmesinin municipal ve güvenlik hizmetlerinde önemli bir avantaj olacağı açıktır. Talep yüksek olmasına rağmen, tedarik fazla değildir , tespit köpeklerinin eğitimi ve bakımı pahalı bir iştir ve her zaman iyi bir değer sağlamaz.

İleri Bir Adım

Bu oldukça eski iklimde, ABD’den gelen bir akademik ve endüstriyel işbirliği ortaya çıktı. Araştırmacılar, birkaç ay boyunca New York Şehirindeki çeşitli kokuları ve bunlarla ilişkili görüntüleri katalogladı – ve ilk

Merkezi sensör, koku alma cihazının 'burnu'. Sadece kokuya göre eğitilen model, granit, plastik veya deri olduğunu tahmin eder ve görüntüde hiçbir piksel görmeden odanın içinde olduğunu belirler. Kaynak: https://smell.cs.columbia.edu/ kez, yakalanan kokularla ilişkili görüntüleri topladı: Merkezi sensör, koku alma cihazının ‘burnu’. Sadece kokuya göre eğitilen model, granit, plastik veya deri olduğunu tahmin eder ve

görüntüde hiçbir piksel görmeden odanın içinde olduğunu belirler. Kaynak Bu araştırma, yazarların, popüler ContrastiveLanguage-ImagePretraining ( CLIP ) çerçevesinin bir yol açtı. Bu varyantını geliştirmelerine varyant, (COIP)

Üst: senkronize video ve koku sensör verileri doğal ortamlarda kamera-e-burun rig ile kaydedilir. Alt sol (b): ortak bir gömme, çapraz-modál öz-denetim yoluyla öğrenilir. (c): sistem, yalnızca bir koku sorgusuna dayanarak görsel eşleşmeleri alır. (d): bireysel koku örnekleri, çevre, nesne ve malzeme kategorilerini sınıflandırmak için kullanılır. (e): yüksek derecede benzer kokular, görsel girdi olmadan ayırt edilir. olarak adlandırıldı ve kokuları görüntülerle eşleştirdi. Contrastive Olfaction-Image Pretraining Üst: senkronize video ve koku sensör verileri doğal ortamlarda kamera-e-burun rig ile kaydedilir. Alt sol (b): ortak bir gömme, çapraz-modál öz-denetim yoluyla öğrenilir. (c): sistem, yalnızca bir koku sorgusuna dayanarak görsel eşleşmeleri alır. (d): bireysel koku örnekleri,

çevre, nesne kümesi, popülerve malzeme kategorilerini sınıflandırmak için kullanılır. (e): yüksek derecede benzer kokular, görsel girdi olmadan ayırt edilir. Kaynak Yeni veri kümesi, Yazarlar, bu ilk çalışmanın, vahşi ortamlarda çalışan koku tespit sistemlerine yönelik sonraki çalışmaların yolunu açacağını umuyor: olarak adlandırıldı ve 7.000 koku-görüntü çiftini içerir. Testlerde, yeni veri

el ile oluşturulmuş özelliklerin bulunduğu daha küçük benzer veri kümelerini aştı. New York Smells ‘Bu veri kümesini, vahşi ortamlarda çok modlu koku algısına ve görme ile kokuyu bağlamaya

doğru bir adım olarak görüyoruz. Koklama geleneksel olarak kısıtlanmış ortamlarda ele alındı, ancak doğal

uygulama var. ‘Örneğin, insanlar olarak, sürekli olarak koklamaduyusunu kullanarak yiyeceklerin kalitesini değerlendirir, tehlikeleri tanımlar ve

ortamlarda birçok görünmeyen nesneleri algısından daha iyi yetenekler e sahiptir,tespit ederiz. ‘Ayrıca, köpekler, ayılar ve fareler gibi birçok hayvan, insan koklama buda makine yeteneklerinin insan koklama algısının çok ötesine geçebileceğini göstermektedir.’

Yöntem

Yeni koleksiyon için materyal toplamak amacıyla, araştırmacılar Cyranose 320 elektronik burnu kullandı. iPhone, kokuların kaydedildiği forward intake’ın üzerine monte edildi: Taşınabilir bir

Taşınabilir bir sensör rigi, iPhone kamerasını Cyranose 320 e-buruna monte ederek eşleştirilmiş video ve koku verisi toplar. Burnun nesnelere yönlendirilmesi ve hava akışının örnek alma sırasında yönetilmesi için egzoz ve purge girişi kullanılır. RGB‑D kamera derinliği kaydederken, Volatile organik bileşik (VOC) konsantrasyonu, sıcaklık ve nem entegre sensörler aracılığıyla kaydedilir. sensör rigi, iPhone kamerasını Cyranose 320 e-buruna monte ederek eşleştirilmiş video ve koku verisi toplar. Burnun nesnelere yönlendirilmesi ve hava akışının örnek alma sırasında yönetilmesi için egzoz ve purge girişi kullanılır. RGB‑D kamera derinliği kaydederken, Volatile organik bileşik (VOC) konsantrasyonu, sıcaklık ve nem entegre sensörler aracılığıyla kaydedilir. Cyranose cihazı

2Hz’de çalışır ve 32 boyutlu koku zaman adımlarını kaydeder. Volatile Organik Bileşik (VOC) konsantrasyonları, MiniPID2 PPM WR sensörü ile kaydedildi. Portatif ünite, verilerini daha güçlü bir mobil istasyona ileten bir sensör olarak işlev gördü. Koku alma hedefini bağlamında yerleştirmek için, bir ‘temel koku’ kaydedildi, daha sonra belirli nesne doğrudan Cyranose’un ‘burnu’ ile hedeflendi. Ambient örnek, birimin yan portundan alındı, böylece koku kaynağından uzakta olmadığından emin olunurdu. İki örnek, sensörün ana girişinden alındı, her biri nesnenin etrafındaki farklı bir konumdan 10 saniyelik kayıt olarak kaydedildi, böylece veri verimliliği iyileştirildi. Örnekler daha sonra ambient temel ile birleştirilerek 28×32 matrisi oluşturuldu, bu da tam koku ölçümünü temsil

Bu örnek, bir çiçeğin sinyalini ve karşılık gelen görüntüsünü gösterir. Tam koku sinyali, 14 çerçeve ambient temel ile iki 10 saniyelik örneğin birleştirilmesinden oluşan 28x32 matrisi içerir. ediyordu: Bu örnek, bir çiçeğin sinyalini ve karşılık gelen görüntüsünü gösterir. Tam koku sinyali, 14 çerçeve ambient temel ile iki 10 saniyelik örneğin birleştirilmesinden oluşan 28×32 matrisi içerir.

Veri ve Testler

Görme DiliModelleri ( VLMs ) kullanılarak, iPhone tarafından kaydedilen nesneler ve malzemeler otomatik olarak etiketlendi. GPT-4o,

Kaynak paperdaki geniş bir illüstrasyonun küçük bir örneği, burada projede yakalanan çeşitli koku kaynakları ve ortamları gösterir. bu görev için kullanıldı; ancak sahne kategorileri manuel olarak etiketlendi: Kaynak paperdaki

geniş bir illüstrasyonun küçük bir örneği, burada projede yakalanan çeşitli koku kaynakları ve ortamları gösterir. Veri kümesi, eğitim ve doğrulama bölümlerine ayrıldı. Her nesnenin örnekleri aynı bölüme atanarak çapraz kirlenme önlenmiştir. Sonuçta oluşan koleksiyon, 3.500 etiketsiz nesneden 7.000 koku-görüntü çiftini içerir ve 70 saat video ve 196.000 zaman adımından oluşan ham koku verisi içerir. Veri, 60 oturum boyunca iki aylık bir süre boyunca toplanmıştır. Sonuçta oluşan veri kümesi, %41 outdoor ve %59 indoor ortamları içerir. Genel amaçlı koku temsilini geliştirmek için, yazarlar, veri kümesinden senkronize edilmiş görüntü-koku çiftlerini kullanarak bir çapraz model eğittiler. Bu yaklaşım, CLIP’ten uyarlanan bir kayıp fonksiyonu kullanarak görsel ve koku sinyallerinin gömme lerini hizalar. Eğitim, hem görsel hem de koku kodlayıcılarını kullandı. Modelin, eşleşen kokuları ve görüntüleri paylaşılan bir temsil alanında bir araya getirmeyi öğrenmesi hedeflendi. Sonuçta oluşan temsil, koku-görüntü alma, sahne ve nesne tanımı, malzeme sınıflandırması ve ince ayrıntılı koku ayırt etme gibi çeşitli görevleri destekler. Model, iki tür koku girişi kullanılarak eğitildi: ham koku sinyali ve smellprints olarak bilinen bir özet. Ham girdi, Cyranose cihazındaki 32 kimyasal sensörden oluşan bir zaman serisi kaydetti.

Çapraz-Modál Alma

Çapraz-modál alma, her koku örneği ve eşleştirilmiş görüntüsünü paylaşılan bir temsil alanında gömmek ve yalnızca kokugirdisine dayanarak doğru görüntüyü almanın mümkün olup olmadığını test ederek değerlendirildi.Sıralama, her görüntü gömmesinin

Farklı koku kodlayıcıları için çapraz-modál alma doğruluğu, her modelin koku sorgusundan doğru görüntüyü ne kadar iyi tanımladığını gösterir. Sonuçlar, ham koku sinyallerine göre eğitilen mimarilerle smellprints kullananları karşılaştırır. koku sorgusuna olan yakınlığına göre belirlendi ve performans, ortalama sıralama , median sıralama ve hatırlama gibi

çeşitli eşiği kullanarak

ölçüldü: Farklı koku kodlayıcıları için çapraz-modál alma doğruluğu, her modelin koku sorgusundan doğru görüntüyü ne kadar

iyi tanımladığını gösterir. Sonuçlar, ham koku sinyallerine göre eğitilen

Sahneler, malzemeler ve nesneler için sınıflandırma doğruluğu, yalnızca koku sinyalleri kullanılarak değerlendirildi. Ham koku girişi, smellprints'e göre daha yüksek doğruluk sağladı, özellikle sıfırdan eğitilen CNN'ler en yüksek sonuçları verdi. mimarilerle smellprints kullananları karşılaştırır. Araştırmacılar, bu sonuçlar hakkında şunları belirtirler: ‘Smellprint kullanarak karşıt ön eğitim, tüm metriklerde şansa göre daha iyi performans gösterir. Ancak, koku kodlayıcısını ham koku sinyaline göre eğitmek, mimari bağımsız olarak smellprint kodlayıcısına göre önemli bir

iyileşme sağlar. ‘Bu, ham koku

verisinde daha zengin bilgilerin olduğunu ve görme ile kokunun çapraz-modál bağıntılarını daha

güçlü bir şekilde ortaya koyduğunu gösterir.’

Sahne, Nesne ve Malzeme Tanıma

Modelin, yalnızca koku verisi kullanarak sahne, nesne ve malzeme tanıma yeteneği, bir dondurulmuş temsil üzerinde eğitilen bir doğrusal sorgu kullanarak değerlendirildi. Etiketler, eğitim kümesindeki eşleştirilmiş görüntülerden GPT-4o kullanılarak türetilmiştir, ancak yalnızca koku sinyali sınıflandırma sırasında kullanılmıştır. Çeşitli kodlayıcı türleri test edilmiştir: bazıları rastgele başlatılmış, bazıları sıfırdan eğitilmiş, diğerleri ise çapraz-modál öğrenme kullanılarak görme ve koku arasında paylaşılan bir temsil

Yalnızca kokuya göre çim türlerinin sınıflandırılmasının doğruluğu. Modeller, yalnızca koku girdisi kullanarak görsel olarak benzer iki çim türünü ayırt etme yetenekleri açısından değerlendirildi. Performans, koku izleri ve ham sensör verileri arasında, rastgele başlatılan, sıfırdan eğitilen veya kendi kendini denetleyen öğrenme (SSL) ve ardından doğrusal bir araştırma kullanılarak eğitilen modellerle karşılaştırıldı. En yüksek doğruluk, %92,9, SSL ile ham koku sinyalleri kullanılarak elde edildi; bu, ince taneli koku farklılıklarının en iyi şekilde ham girdi ve görüş rehberli eğitim yoluyla yakalandığını gösterir. alanında hizalanmıştır. Sahneler, malzemeler ve nesneler için sınıflandırma doğruluğu, yalnızca koku sinyalleri kullanılarak değerlendirildi. Ham koku girişi, smellprints’e göre daha yüksek doğruluk sağladı, özellikle sıfırdan eğitilen CNN’ler en yüksek

sonuçları verdi. Araştırmacılar, şunları belirtirler: ‘Ham sensör girişini kullanan modeller, el ile

oluşturulmuş smellprint özelliklerine göre daha yüksek doğruluk sağlar. Bu sonuçlar, derin öğrenmenin ham koku sinyallerinden daha iyi olduğunu gösterir.’

İnce Ayrıntılı Ayrım

İnce ayrıntılı koku ayrımlarının öğrenilebileceğini değerlendirmek için, aynı çim alanındaki iki tür çim için bir test verisi oluşturuldu. Alternatif örnekler, altı 30 dakikalık oturum boyunca toplandı ve 256 örnek elde

Çim türlerinin koku ile sınıflandırma doğruluğu. Modeller, yalnızca koku girdisi kullanarak iki görsel olarak benzer çim türünü ayırt etme yetenekleri değerlendirildi. edildi. Bir doğrusal sınıflandırıcı kullanılarak, koku-görüntü çapraz-modál öğrenmesinden elde edilen özellikler değerlendirildi: Çim türlerinin koku ile sınıflandırma doğruluğu. Modeller, yalnızca koku girdisi kullanarak iki görsel olarak benzer çim türünü ayırt etme yetenekleri değerlendirildi. Araştırmacılar, şunları belirtirler: ‘Ham koku sensör sinyalini (el ile oluşturulmuş özelliklerin

yerine) kullanarak

eğitim, tüm varyantlardan daha yüksek doğruluk sağlar. Bu, koku-görüntü öğrenmesinin, smellprints kullanmaktan

daha ince ayrıntılı bilgiyi koruduğunu ve görsel denetimin bu bilginin kullanılmasına olanak sağladığını gösterir.’

Sonuç

Koku sentezleme problemi henüz çözülmemiş olsa da, etkili ve uygun bir vahşi ortam koku analiz sistemi, polis, güvenlik ve tıbbi amaçlar için büyük bir potansiyele sahiptir. Şu anda, kullanılan ekipman genellikle niş ve pahalıdır; bu nedenle, ‘koku AI’ için gerçek ilerleme, Raspberry PI ruhunda vizyoner ve uygun bir sensöre bağlı görünüyor. * Yazarların inline alıntılarını dönüştürdüm. ** Kaynak paperdaki ilave illüstrasyonlar

hyperlinklere (şekil 8) mevcuttur, ancak bu bağlamda en iyi şekilde görüntülenebilir. İlk olarak 28 Kasım

2025 Cuma günü yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai