Andersonの視点
AI開発に嗅覚をもたらす

新しいAIデータセットは、画像と関連付けることによって、機械に嗅覚を教えることができます。モデルは、においを物体、シーン、材料と一致させることができます。
おそらく、におい出力マシンは複雑な歴史を持っているため、嗅覚はAI研究文献で比較的無視されています。におい出力マシンの長い歴史(現在までに1世紀以上)に寄与することを計画していない限り、用途は比較的「ニッチ」であると考えられていました。これは、画像、音声、ビデオのデータセット、およびそれらからトレーニングされたAIモデルを利用する可能性と比較してです。
実際、爆発物探知犬、死体探知犬、疾患探知犬などの様々な犬種の嗅覚能力を自動化し、工業化し、普及させることは、市民サービスやセキュリティサービスにとって大きな利点となります。需要は高いですが、供給は不足しています。探知犬のトレーニングと維持は高額なものであり、常に価値があるわけではありません。
これまで、研究の大部分はラボで行われ、手作りの特徴を持つカスタマイズされたコレクションで構成されてきました。これは、工業化されたアプリケーションよりも、より手作りのコテージ産業ソリューションの方が適しています。
先んじる
このような状況の中で、米国から新しい学術産業コラボレーションが登場しました。研究者チームは、ニューヨーク市内の屋内外の環境で様々なにおいを数ヶ月かけてカタログ化し、初めてにおいと関連付ける画像を収集しました。

中央のセンサー、におい装置の「鼻」に注目してください。においだけをトレーニングしたモデルは、グラニット、プラスチック、または皮革のにおいを推測し、画像を1ピクセルも見ないで部屋を特定します。ソース:https://smell.cs.columbia.edu/
この研究により、著者は、 Contrastive Language-Image Pretraining (CLIP) フレームワークを基に、新しいデータセット「Contrastive Olfaction-Image Pretraining」(COIP)を開発しました。COIPは、においと画像を関連付けるものです。

上:自然な環境で同期化されたビデオとにおいセンサーデータが収集されます。下左(b):クロスモーダル自己教師あり学習を介してジョイント埋め込みが学習されます。(c):システムは、クエリにおいのみに基づいて視覚的な一致を取得します。(d):個々のにおいサンプルは、環境、物体、材料のカテゴリを分類するために使用されます。(e):高く似たにおい、たとえば2種類の草は、視覚的な入力なしで区別されます。ソース:https://arxiv.org/pdf/2511.20544
新しいデータセット「ニューヨークのにおい」には、3,500個の異なる物体を特徴とする7,000個のにおいと画像のペアが含まれています。テストでトレーニングされた場合、新しいデータは、以前のデータセットよりも優れています。
著者は、この初期の試みが、野外でのにおい検出システムを開発するための後続の研究の道を開くことを希望しています。
‘私たちは、このデータセットを、野外での多モーダルにおい認識と、視覚とにおいの関連付けのステップとして見ています。においは従来、制約された環境でアプローチされてきましたが、自然な環境での応用は多数あります。 ‘
‘たとえば、人間は、食物の質を評価するために、危険を特定するために、見えない物体を検出するために、不断においを利用しています。 ‘
‘さらに、犬、熊、ねずみなどの多くの動物は、人間を超えるにおい認識能力を示しています。これは、機械の能力の限界はまだ遠くにあることを示唆しています。 ‘
新しい論文「ニューヨークのにおい:におい認識のための大規模な多モーダルデータセット」は、データとコードが公開されることを約束していますが、27GBのデータファイルはすでに論文のプロジェクトサイトで利用可能です。論文は、コロンビア大学、コーネル大学、Osmo Labsの9人の研究者によって作成されました。
方法
新しいコレクションの材料を収集するために、研究者は、Cyranose 320電子鼻を使用しました。iPhoneは、においが検出されたときに視覚的に何が起こっているかをキャプチャするために、電子鼻の上に取り付けられました。

携帯型センサーリグは、iPhoneカメラをCyranose 320電子鼻に取り付け、ペアのビデオとにおいデータを収集します。鼻先は物体に向けられ、排気口とパージインレットはサンプリング中に空気の流れを管理します。RGB-Dカメラは深度をキャプチャし、VOC濃度、温度、湿度は、PIDモジュールや環境プローブを含む統合センサーを介して記録されます。
Cyranoseデバイスは2Hzで動作し、32次元のおい時間ステップを記録します。VOC濃度は、MiniPID2 PPM WRセンサーを使用して記録されました。
ポータブルユニットは、データをより計算能力の高いモバイルステーションに転送する、敏捷なセンサーとして機能しました。
ターゲットにおいをコンテキスト化するために、「ベースラインにおい」が登録され、次に物体が電子鼻の「鼻先」で直接ターゲットされました。アンビエントサンプルは、におい源から遠く離れたユニットの側面ポートから取得され、におい源に汚染されないようにしました。
センサーのメインインテークから2つのサンプルが取得され、各10秒間のレコーディングは物体の周りの異なる位置から取得され、データ効率を向上させるために組み合わせられました。サンプルはアンビエントベースラインと組み合わせて28×32行列を形成し、完全なにおい測定を表します。

この例では、花のシグナルと対応する画像が示されています。完全なにおいシグナルは、14フレームのアンビエントベースラインと、物体の周りの異なる角度から取得された2つの10秒間のサンプルを組み合わせた28×32行列です。
データとテスト
Vision Language Models (VLMs) を使用して、Cyranoseリグ内のiPhoneによってキャプチャされた物体と材料を自動的にラベル付けしました。 GPT-4o は、このタスクに使用されました。ただし、シーンのカテゴリは手動でラベル付けされました。

プロジェクトで収集された様々なにおい源と環境の詳細なイラストレーションの小さなサンプル。
データセットは、トレーニングと検証のスプリットに分割されました。各物体のサンプルは同じスプリットに割り当てられ、クロスコンテミネーションを回避しました。最終的なコレクションには、3,500個の未ラベル化された物体と70時間のビデオ、およびベースラインとサンプルフェーズの両方から196,000の生のおい時間ステップからなる7,000個のおいと視覚のペアが含まれています。
データは、2か月間にわたる60回のセッションで収集され、公園、大学の建物、事務所、通り、図書館、マンション、食堂など、様々な場所で収集されました。結果として得られたデータセットには、41%が屋外、59%が屋内環境です。
汎用のおい表現を開発するために、著者は、データセットからの同期化された画像とにおいのペアを関連付けることを目的とした、コントラストモデルをトレーニングしました。これは、損失関数をCLIPから適応させた、コントラストにおい-画像事前トレーニング (COIP) です。
トレーニングには、視覚エンコーダーとにおいエンコーダーが使用され、モデルが一致するにおいと画像を共有表現空間で近づけることを目的としました。結果として得られる表現は、においから画像の検索、シーンと物体の認識、材料の分類、および精密におい識別などのダウンストリームタスクをサポートします。
モデルは、2種類のおい入力でトレーニングされました。1つは生のおいシグナルで、もう1つはにおい印と呼ばれる、手作りの要約です。におい印は、おい研究で広く使用されている特徴で、各センサーの応答を1つの数字に圧縮するものです。
一方、生入力は、32個の化学センサーが含まれるCyranoseデバイスからの時系列で構成されており、においに対して各センサーの電気抵抗がどのように変化したかを記録します。
データセットのキュレーションのために、この未処理シグナルは、畳み込みまたはトランスフォーマーベースのバックボーンを備えたニューラルネットワークに直接入力され、エンドツーエンドの学習が可能になりました。モデルは、におい印とニューヨーク市の様々な環境で収集された生入力の両方でトレーニングされ、コントラスト学習を使用して評価されました。
クロスモーダル検索
クロスモーダル検索は、各においサンプルと対応する画像を共有表現空間に埋め込み、におい入力のみに基づいて正しい画像が検索できるかどうかをテストすることで評価されました。
ランキングは、クエリにおいと画像埋め込みの近さによって決定され、平均ランク、中央値ランク、およびリコールを使用してパフォーマンスが測定されました。

さまざまなにおいエンコーダーのクロスモーダル検索の精度。モデルは、においクエリから正しい画像を特定する能力を示しています。生のおいシグナルを使用するアーキテクチャとにおい印を使用するアーキテクチャの結果を比較しています。
著者は、次のように述べています。
‘コントラスト事前トレーニングを使用すると、におい印でトレーニングしたモデルは、すべてのメトリックでランダムなチャンスよりも優れています。ただし、生のおいシグナルを使用してにおいエンコーダーをトレーニングすることで、におい印エンコーダーよりも大幅な改善が見られます。 ‘
‘これは、生のおいデータに存在するより豊富な情報を示しています。これにより、視覚とにおいの間のクロスモーダル関連付けが強化されます。 ‘

ソース論文の7番目のイラストレーションの詳細。ここでは、モデルがにおいを画像と関連付けるクロスモーダル検索の例が示されています。各行は、においクエリから始まり、共有埋め込み空間内のトップランクの画像予測に続きます。各クエリの正しい画像は緑で囲まれています。ここでは、書籍、植物、石工、他の材料からのにおいが、視覚的に関連のあるシーンと意味的に関連のあるシーンにモデルを引き寄せていることが示されています。
著者はまた、検索結果に明確な意味的なパターンが見られたことを指摘しています。
‘私たちのモデルからの検索結果は、意味的なグループ化を示しています。書籍のにおいは他の書籍の画像を検索し、葉のにおいは葉の画像を検索します。 ‘
‘これらの結果は、学習された表現が意味的なクロスモーダル構造を捉えていることを示しています。 ‘
シーン、物体、材料の認識
モデルが視覚的な入力なしでにおいを認識できる能力は、シーン、物体、材料をにおいデータのみに基づいて識別するようにモデルをトレーニングすることで評価されました。学習されたにおい埋め込みに含まれる情報の量を評価するために、フリーズされた表現に基づいて、線形プローブ(シンプルなクラシファイア)を使用しました。
ラベルは、GPT-4oを使用してトレーニングセットのペア画像から導出されましたが、分類ではにおいシグナルのみが使用されました。
さまざまなエンコーダータイプがテストされました。ランダムに初期化されたもの、スクラッチからトレーニングされたもの、コントラスト学習を使用して視覚とにおいを共有表現空間で関連付けたものなどです。生データとにおい印の両方が評価されました。

においシグナルのみを使用したシーン、材料、物体の分類精度。生センシング入力はにおい印を上回り、スクラッチからトレーニングされたCNNは最高の結果をもたらし、シーンでは99.5%の精度を達成しました。SSL事前トレーニングは一部のケースで役立ちましたが、一般的に監督トレーニングによって上回られました。ランダムな重みのベースラインは、モデル容量のみが不十分であることを示しています。
生のおいデータを使用することで、特にクロスモーダル監督下でトレーニングされたモデルでは、はるかに高い精度が得られました。著者は次のように述べています。
‘生センシング入力でトレーニングされたモデルは、手作りのにおい印特徴を使用するモデルよりも高い精度を達成します。 ‘
精密におい識別
精密におい識別を学習できるかどうかを評価するために、同じキャンパスラウンドに存在する2種類の草のベンチマークが作成されました。交互にサンプルが収集され、6回の30分間のセッションで256の例が得られました。コントラストにおい-視覚学習から得られた特徴に基づいて、線形クラシファイアがトレーニングされ、42のサンプルのホールドアウトセットで評価されました。

においのみを使用した草の種の分類精度。モデルは、視覚的な入力なしで2種類の草を区別する能力を評価されました。パフォーマンスは、におい印と生センシング入力の両方で、ランダムに初期化されたモデル、スクラッチからトレーニングされたモデル、およびSSLを使用したモデルで評価されました。
研究者は、次のように述べています。
‘生のおいシグナルを使用することで(手作りの特徴ではなく)、最高の精度が得られます。 ‘
‘これらの結果は、におい-視覚学習がにおい印を使用するよりも精密なおい差異を保存することを示しています。また、視覚的な監督がこの情報を活用するためのシグナルを提供することも示しています。 ‘
結論
におい合成はまだ解決されていない問題であるかもしれませんが、野外でのにおい分析システムは、警察、セキュリティ、医療目的だけでなく、生活の質と都市の監視にも大きな潜在性があります。
現在、関与する機器はニッチで通常高価です。したがって、「においAI」検出の実質的な進歩は、Raspberry PIの精神に則ったビジョナリーで手頃なセンサーを必要とします。
* 著者によるインライン引用のハイパーリンクへの私の変換。
** ソース論文でさらにイラストレーション(図8)がありますが、最もよく見えるのはソース論文のコンテキストで見たときです。
初めて公開されたのは2025年11月28日、金曜日です。












