Anderson의 관점
AI 개발에 향기를 가져오다

새로운 AI 데이터셋은 기계가 냄새를 감지하도록 훈련시킵니다. 이미지와 관련된 냄새 데이터를 사용하여 모델이 냄새를 객체, 장면 및 재질과 일치시킬 수 있도록 합니다.
냄새 출력 기계가 그렇게 복잡한 역사를 가지고 있는 이유로, 후각은 AI 연구 문헌에서 상대적으로 방치된 감각입니다. 냄새 감지 기계를 사용하여 새로운 엔트리를 생산하려는 경우를 제외하고, 이미지, 오디오 및 비디오 데이터셋과 함께 훈련된 AI 모델의 잠재적인 활용에 비해 사용 사례는 비교적 협소했습니다.
実際, 폭탄 탐지犬, 시체 탐지犬, 질병 감지견 및 다양한 유형의 개 스니퍼 유닛과 같은 탐지 시설을 자동화, 산업화 및 대중화하는 가능성은 도시 및 보안 서비스에서 주목할만한 이점이 될 것입니다. 높은 수요에도 불구하고, 공급량이 부족하여 훈련 및 유지 보수 비용이 많이 드는 비싼 사업입니다.
현재까지 이 연구 분야에 대한 대부분의 연구는 실험실에서 진행되었으며, 수집된 데이터는 일반적으로 手作り된 특징을 갖는 예제로 구성되었습니다. 이러한 특징은 산업화된 응용 프로그램보다 더 많은 수작업 솔루션에 적합했습니다.
코 앞으로
이러한 상황에서 미국의 학술 및 산업 협력에서 interessant한 새로운 연구가 나타났습니다. 연구진은 뉴욕시에서 다양한 냄새를 수집하기 위해 몇 개월을 보냈으며, 처음으로 냄새와 관련된 이미지를 수집했습니다.

중앙 센서, 즉 냄새 장치의 ‘코’를 참조하십시오. 냄새만으로 훈련된 모델은 그라니트, 플라스틱, 가죽을 구분할 수 있으며,甚至 해당 방을 식별할 수 있습니다. 출처
이 연구는 Contrastive Language-Image Pretraining (CLIP) 프레임워크의 변형인 Contrastive Olfaction-Image Pretraining (COIP)을 개발하도록 연구진을 이끌었습니다. COIP는 냄새와 이미지를 연결합니다.

위: 동기화된 비디오와 냄새 센서 데이터는 자연 환경에서 카메라-코 노즈 리그를 사용하여 수집됩니다. 아래 왼쪽 (b): 크로스-모달 자체-감독을 통해 공동 임베딩이 학습됩니다. (c): 시스템은 질의 냄새만으로 시각적 일치를 검색합니다. (d): 개별 냄새 샘플은 환경, 객체 및 재질 범주를 분류하는 데 사용됩니다. (e): 두 가지 유형의 풀과 같은 매우 유사한 냄새는 시각적 입력 없이 구분됩니다. 출처
새 데이터셋은 New York Smells라고 불리며, 7,000개의 냄새-이미지 페어링과 3,500개의 다른 객체를 특징으로 합니다. 테스트에서 이 새로운 데이터는 이전 데이터셋에서 인기 있는 手作り된 특징을 능가했습니다.
연구진은 이 초기 연구가 후속 연구를 위한 길을 열어 후속 연구를 통해 야생에서 작동하는 냄새 감지 시스템을 개발할 수 있기를 바랍니다.
‘우리는 이 데이터셋을 야생에서 작동하는 멀티모달 냄새 감지의 한 걸음으로 간주합니다. 또한 시각과 냄새를 연결하는 한 걸음으로 간주합니다.
‘예를 들어, 인간은 끊임없이 냄새를 사용하여 음식의 품질을 평가하고, 위험을 식별하며, 보이지 않는 물체를 감지합니다.
‘또한 개, 곰, 생쥐와 같은 많은 동물은 초인적인 후각 능력을 보여줍니다. 이는 인간의 냄새 감지 능력이 기계 능력의 한계에 근접하지 않음을 시사합니다.’
새로운 논문은 데이터와 코드를 공개할 것이라고 약속했으며, 27GB의 데이터 파일은 이미 논문의 프로젝트 사이트를 통해 사용할 수 있습니다. 이 논문은 Columbia University, Cornell University 및 Osmo Labs의 9명의 연구자에 의해 작성되었습니다.
방법
새로운 컬렉션을 수집하기 위해 연구진은 Cyranose 320 전자 코를 사용했으며, 전방 흡입구 위에 아이폰을 장착하여 등록된 냄새를 시각적으로 캡처했습니다.

휴대용 센서 리그는 카메라-코 노즈 리그를 사용하여 페어링된 비디오와 냄새 데이터를 수집합니다. 코는 객체를 향하고, 배기 및 퍼지 인렛은 샘플링 중 공기 흐름을 관리합니다. RGB-D 카메라는 깊이를 캡처하고, VOC 농도, 온도 및 습도는 통합 센서를 통해 기록됩니다.
Cyranose 장치는 2Hz에서 작동하며, 32차원 냄새 시간 단계를 기록합니다. VOC 농도는 MiniPID2 PPM WR 센서로 기록되었습니다.
이 휴대용 단위는 데이터를 더 많은 컴퓨팅 능력을 갖춘 모바일 스테이션으로 전달하는 유연한 센서로 작동했습니다.
대상 냄새를 컨텍스트에 넣기 위해 ‘베이스ライン 냄새’를 등록했습니다. 그런 다음 대상 객체를 직접 Cyranose의 ‘코’로 목표로 했습니다. 주변 샘플은 유닛의 측면 포트에서 가져왔습니다. 이는 주 냄새 원천에서 멀리 떨어져 있지 않도록 하기 위해 필요한 단계입니다.
센서의 주요 흡입구를 통해 두 개의 샘플을 수집했습니다. 각 10초 녹음은 객체 주변의 다른 위치에서 캡처되었습니다. 이는 데이터 효율성을 개선하기 위한 것입니다. 샘플은 이후 28×32 매트릭스를 형성하기 위해 기준선과 결합되었습니다.

이 예는 꽃에 대한 신호와 해당 이미지를 보여줍니다. 전체 냄새 신호는 14프레임 기준선과 객체 주변의 두 개의 10초 샘플을 결합한 28×32 매트릭스입니다.
데이터 및 테스트
Vision Language Models (VLMs)은 iPhone에 의해 캡처된 객체와 재료를 자동으로 레이블링하기 위해 사용되었습니다. GPT-4o는 이 작업에 사용되었습니다. 그러나 장면 범주는 수동으로 레이블링되었습니다.

소스 페이퍼의 광범위한 일러스트레이션의 작은 샘플입니다. 이 프로젝트에서 캡처된 다양한 냄새 원천과 환경을 자세히 보여줍니다.
데이터셋은 훈련 및 검증 분할로 나누어졌습니다. 각 객체의 샘플은 동일한 분할에 할당되었습니다. 이는 교차 오염을 방지하기 위한 것입니다. 최종 컬렉션은 7,000개의 냄새-시각 페어링과 3,500개의 레이블이 없는 객체를 특징으로 합니다. 또한 70시간의 비디오와 196,000개의 원시 냄새 데이터가 포함되어 있습니다.
데이터는 60개의 세션에 걸쳐 2개월 동안 수집되었습니다. 이는 공원, 대학 건물, 사무실, 거리, 도서관, 아파트 및 식당을 포함하는 다양한 장소에서 수집되었습니다. 여러 세션이 각 위치에서 수행되었습니다. 결과 데이터셋에는 41%의 야외 환경과 59%의 실내 환경이 포함되어 있습니다.
일반적인 목적의 냄새 표현을 개발하기 위해 연구진은 데이터셋의 동기화된 이미지-냄새 페어링을 연결하는 대조 모델을 훈련시켰습니다. 이 접근 방식은 CLIP에서 적응된 손실 함수를 사용하여 공동 임베딩을 학습합니다.
훈련에는 시각적 인코더와 냄새 인코더가 사용되었습니다. 모델이 일치하는 냄새와 이미지를 공유된 표현 공간에서 더 가깝게 가져오도록 가르치는 것이 목표였습니다. 결과적인 표현은 냄새-이미지 검색, 장면 및 객체 인식, 재료 분류 및 세세한 냄새 구분을 포함한 다양한 다운스트림 작업을 지원합니다.
모델은 두 가지 유형의 냄새 입력을 사용하여 훈련되었습니다. 원시 센서 신호와 압축된 요약인 냄새 인쇄물이 사용되었습니다. 후자는 널리 사용되는 특징입니다.
원시 입력은 Cyranose 장치 내의 32개의 화학 센서에서 기록된 시간 시리즈입니다. 각 센서의 전기 저항이 냄새에 반응하여 시간이 지남에 따라 어떻게 변경되는지 캡처합니다.
데이터셋을 구축하기 위해 이 원시 신호는 직접 신경망에 피드되었습니다. 이는 종단 간 학습을 가능하게 합니다.
크로스-모달 검색
크로스-모달 검색은 각 냄새 샘플과 페어링된 이미지를 공유된 표현 공간에 임베딩하여 평가되었습니다. 올바른 이미지를 검색할 수 있는지 테스트했습니다.
순위는 이 공간 내에서 각 이미지 임베딩과 질의 냄새의 근접도에 의해 결정되었습니다. 성능은 평균 순위, 중앙값 순위 및 여러 임계값에서 회수를 사용하여 측정되었습니다.

다양한 냄새 인코더에 대한 크로스-모달 검색 정확도. 각 모델이 냄새 질의에서 올바른 이미지를 식별하는 정도를 보여줍니다. 결과는 원시 냄새 신호와 냄새 인쇄를 사용하여 훈련된 아키텍처를 비교합니다.
이 결과에 대해 연구진은 다음과 같이 말합니다.
‘대조적 전처리에서 냄새 인쇄를 사용하면 모든 메트릭에서 우연에 의한 성능보다 나은 성능을 보여줍니다. 그러나 원시 냄새 신호를 사용하여 냄새 인코더를 훈련시키면 아키텍처에 관계없이 냄새 인쇄 인코더보다 상당한 개선을 가져옵니다.
‘이것은 원시 냄새 데이터에 있는 더 풍부한 정보를 보여주며, 시각과 냄새 사이의 더 강한 연관성을 잠금 해제합니다.’

소스 페이퍼의 일러스트레이션의 세부 사항입니다. 여기서 냄새와 일치하는 이미지를 연결하는 모델의 예가 표시됩니다. 각 행은 냄새 질의로 시작하고, 공유된 임베딩 공간에서 상위 순위 이미지 예측을 표시합니다. 각 질의의 올바른 이미지는 녹색으로 표시되어, 책, 식물, 석조 및 기타 재료의 냄새가 시각적 및 의미적으로 관련된 장면으로 모델을 끌어당기는 것을 보여줍니다.
연구진은 또한 검색 결과가 명확한 의미적 패턴을 보인다고 주장합니다.
‘검색 결과는 종종 의미적 그룹화를 보여줍니다. 책의 냄새는 다른 책의 이미지를 검색하고, 잎의 냄새는 식물의 이미지를 검색합니다.
‘이 결과는 학습된 표현이 의미있는 크로스-모달 구조를 캡처한다는 것을 시사합니다.’
장면, 객체 및 재료 인식
모델이 시각적 입력 없이 냄새를 인식할 수 있는 능력을 평가하기 위해, 장면, 객체 및 재료를 식별하는 데 사용되었습니다. 이를 위해 선형 프로브(단순한 분류기)를 사용하여 냄새 임베딩에 포함된 정보를 평가했습니다.
레이블은 훈련 세트의 페어링된 이미지에서 GPT-4o를 사용하여 파생되었습니다. 그러나 분류 중에는 오직 냄새 신호만 사용되었습니다.
여러 가지 인코더 유형이 테스트되었습니다. 일부는 임의로 초기화되었으며, 일부는 처음부터 훈련되었으며, 일부는 크로스-모달 학습을 사용하여 시각과 냄새를 공유된 표현 공간에서 정렬했습니다. 원시 데이터와 냄새 인쇄가 평가되었습니다.

오직 냄새 신호만을 사용하여 장면, 재료 및 객체의 분류 정확도가 평가되었습니다. 원시 센서 입력은 냄새 인쇄보다 우수했습니다. 처음부터 훈련된 CNN은最高의 결과를 보여주었으며, 장면의 경우 99.5%의 정확도를 달성했습니다. SSL 전처리는 일부 경우에 도움이 되었지만, 일반적으로 지도 학습에 의해 능가되었습니다. 임의 가중치 기준선은 모델 용량만으로는 불충분하다는 것을 나타냅니다.
연구진은 다음과 같이 말합니다.
‘원시 센서 입력을 사용하여 훈련된 모델은 냄새 인쇄 특징을 사용하여 훈련된 모델보다 더 높은 정확도를 달성합니다. 이러한 결과는 원시 냄새 신호에서 깊은 학습이 手作り된 특징보다 훨씬 더 나은 것을 보여줍니다.’
세세한 구분
세세한 냄새 구분을 학습할 수 있는지 평가하기 위해, 동일한 잔디밭에 공존하는 두 가지 풀 종류를 사용하여 벤치마크를 구축했습니다. 6개의 30분 세션에서 교대로 샘플을 수집하여 256개의 예를 생성했습니다. OLFACTION-시각적 대조 학습의 특징에서 훈련된 선형 분류기를 사용하여 평가했습니다.

냄새만으로 풀 종류를 분류하는 정확도. 모델은 오직 냄새 입력만을 사용하여 두 가지 비슷한 풀 종류를 구분하는 능력을 평가했습니다. 성능은 냄새 인쇄와 원시 센서 데이터에서 평가되었습니다. 모델은 임의로 초기화되거나 처음부터 훈련되거나, SSL을 사용하여 훈련되었습니다. 최고의 정확도는 92.9%로, 원시 냄새 신호와 SSL을 사용하여 달성되었습니다.
연구진은 다음과 같이 말합니다.
‘원시 냄새 센서 신호를 사용하여 훈련하면(냄새 인쇄 특징을 사용하여 훈련하는 것보다)最高의 정확도를 달성합니다. 이는 원시 냄새 데이터에서 더 많은 정보를 캡처할 수 있으며, 시각적 감독이 이러한 정보를 활용하는 신호를 제공한다는 것을 시사합니다.’
결론
냄새 합성은 아직 해결되지 않은 문제로 남아 있을 것입니다. 그러나 효과적이고 경제적인 야생 냄새 분석 시스템은 경찰, 보안 및 의료 목적뿐만 아니라 품질 및 도시 모니터링을 위한巨大한 잠재력을 가지고 있습니다.
현재, 관련 장비는 일반적으로 비싼 비용을 요구합니다. 따라서 실제 прог레스는 라즈베리 파이 정신의 비전과 경제적인 센서가 필요할 것입니다.
* 저자의 인라인 인용을 하이퍼링크로 변환했습니다.
** 추가 일러스트레이션(그림 8)은 원본 논문에서 사용할 수 있지만, 그.context에서 가장 잘 보입니다.
최초로 2025년 11월 28일에 게시되었습니다.












