Взгляд Anderson

Присвоение искусственному интеллекту чувства обоняния

mm
Добавьте Unite.AI в избранные источники в Google
An AI-generated image: a nasally-endowed robot smells a flower in NYC's central park. GPT-image-1 and Qwen Edit 5209.

Новая база данных искусственного интеллекта учит машины чувствовать запах, ассоциируя данные запаха с изображениями, что позволяет моделям сопоставлять запахи с объектами, сценами и материалами.

 

Поскольку машины, выдающие запах, имеют такую сложную историю, обоняние является довольно забытым чувством в исследованиях искусственного интеллекта. Если только вы не планировали создать еще одну работу в длинной серии (более века) саги о запахо-видении, применения всегда казались довольно «нишевыми» по сравнению с потенциальной эксплуатацией наборов изображений, аудио и видео, и моделей искусственного интеллекта, обученных на них.

Фактически, возможность автоматизации, индустриализации и популяризации вида обнаружения, предлагаемого собаками, обнаруживающими бомбы, собаками, обнаруживающими трупы, собаками, обнаруживающими заболевания, и различными другими видами собачьих поисковых единиц, будет заметным преимуществом в муниципальных и службах безопасности. Несмотря на высокий спрос, далеко превосходит предложение, обучение и содержание собак-обнаруживателей – это дорогой бизнес, который не всегда предоставляет хорошую отдачу от инвестиций.

До сих пор большинство исследований, которые заходят в эту область, были ограничены лабораторией, с отобранными коллекциями, обычно состоящими из примеров с手-crafted функциями – профиль, более склонный к индивидуальным решениям, чем к индустриальным приложениям.

Впереди на нос

В эту довольно застойную атмосферу приходит интересное новое академическое/промышленное сотрудничество из США, в котором команда исследователей провела несколько месяцев, каталогизируя различные запахи в помещениях и на улицах Нью-Йорка – и, впервые, собирая изображения, связанные с захваченными запахами:

Обратите внимание на центральный датчик, «нос» прибора обоняния. Обученная только на запахе, модель угадывает, пахнет ли она граниту, пластмассе или кожей – и даже определяет комнату, в которой она находится, не видя ни одного пикселя. Источник: https://smell.cs.columbia.edu/

Обратите внимание на центральный датчик, «нос» прибора обоняния. Обученная только на запахе, модель угадывает, пахнет ли она граниту, пластмассе или кожей – и даже определяет комнату, в которой она находится, не видя ни одного пикселя. Источник

Это исследование привело авторов новой работы к созданию варианта на основе популярной рамки Contrastive Language-Image Pretraining (CLIP), которая связывает текст и изображения, в виде Contrastive Olfaction-Image Pretraining (COIP) – который связывает запахи и изображения.

Вверху: синхронизированное видео и данные датчика обоняния захватываются в естественных условиях с помощью камеры-электронного носа. Внизу слева (б): совместное вложение обучается через само-надзор. (с): система извлекает визуальные совпадения на основе только запроса запаха. (d): отдельные образцы запаха используются для классификации среды, объектов и материалов. (e): высоко похожие запахи, такие как два типа травы, различаются без визуального входа. Источник: https://arxiv.org/pdf/2511.20544

Вверху: синхронизированное видео и данные датчика обоняния захватываются в естественных условиях с помощью камеры-электронного носа. Внизу слева (б): совместное вложение обучается через само-надзор. (с): система извлекает визуальные совпадения на основе только запроса запаха. (d): отдельные образцы запаха используются для классификации среды, объектов и материалов. (e): высоко похожие запахи, такие как два типа травы, различаются без визуального входа. Источник

Новая база данных, озаглавленная New York Smells, содержит 7 000 пар запахов и изображений, в которых представлены 3 500 различных объектов. Когда она была обучена в тестах, новая база данных была найдена лучше, чем популярные手-crafted функции в относительно небольшом количестве подобных предыдущих баз данных.

Авторы надеются, что их первое выступление откроет путь для последующих работ в направлении систем обнаружения запахов, предназначенных для работы в дикой природе, так же, как и собаки-обнаруживатели*:

‘Мы рассматриваем эту базу данных как шаг к многомодальной перцепции обоняния в дикой природе, а также как шаг к связыванию зрения со запахом. Хотя обоняние традиционно подходит в ограниченных условиях, таких как контроль качества, есть много применений в естественных условиях.

‘Например, как люди, мы постоянно используем наше чувство обоняния, чтобы оценить качество пищи, выявить опасности и обнаружить незаметные объекты.

‘Более того, многие животные, такие как собаки, медведи и мыши, показывают сверхчеловеческие способности обоняния способности, что предполагает, что человеческое восприятие запаха далеко не предел возможностей машин.’

Хотя новая работа, озаглавленная New York Smells: A Large Multimodal Dataset for Olfaction, обещает, что данные и код будут выпущены, 27-гигабайтный файл данных уже доступен через сайт проекта. Работа была произведена девятью исследователями из Колумбийского университета, Корнеллского университета и Osmo Labs.

Метод

Для сбора материала для новой коллекции исследователи использовали электронный нос Cyranose 320, с установленным над ним iPhone, чтобы захватить визуально, какие запахи были зарегистрированы:

Портативная установка собирает парные видео- и запаховые данные, устанавливая камеру iPhone на электронный нос Cyranose. Нос направлен на объекты, а выхлоп и вход воздуха управляются во время выборки. Камера RGB-D захватывает глубину, а концентрация летучих органических соединений, температура и влажность записываются через встроенные датчики, включая модуль PID и экологический зонд.

Портативная установка собирает парные видео- и запаховые данные, устанавливая камеру iPhone на электронный нос Cyranose. Нос направлен на объекты, а выхлоп и вход воздуха управляются во время выборки. Камера RGB-D захватывает глубину, а концентрация летучих органических соединений, температура и влажность записываются через встроенные датчики, включая модуль PID и экологический зонд.

Устройство Cyranose работает на частоте 2 Гц, записывая 32-мерные временные шаги обоняния. Концентрации летучих органических соединений записывались с помощью датчика MiniPID2 PPM WR.

Портативная установка функционировала как гибкий датчик, передавая данные на более вычислительную мобильную станцию для обработки.

Для размещения целевого запаха в контексте был зарегистрирован «базовый запах», прежде чем более конкретный объект был нацелен напрямую с «носом» Cyranose. Затем был взят образец окружающей среды из бокового порта в установке, чтобы обеспечить, что он был достаточно远 от основного источника запаха, чтобы не быть загрязненным.

Два образца были взяты через основной вход датчика, с каждым 10-секундным записью, захваченной из разных положений вокруг объекта, чтобы улучшить эффективность данных. Затем образцы были объединены с базовым фоном, чтобы сформировать 28×32 матрицу, представляющую полное обонятельное измерение:

Этот пример показывает сигнал и соответствующее изображение для цветка. Полный обонятельный сигнал состоит из 28x32 матрицы, объединяющей 14-кадровый базовый фон с двумя 10-секундными образцами, взятыми из разных углов вокруг целевого объекта.

Этот пример показывает сигнал и соответствующее изображение для цветка. Полный обонятельный сигнал состоит из 28×32 матрицы, объединяющей 14-кадровый базовый фон с двумя 10-секундными образцами, взятыми из разных углов вокруг целевого объекта.

Данные и тесты

Модели языка и зрения (VLMs) были использованы для автоматического标ления объектов и материалов, захваченных iPhone в установке Cyranose, с GPT-4o, использованным для этой задачи; однако, категории сцен были помечены вручную:

Небольшой образец из обширной иллюстрации в исходной работе, детализирующей различные источники запахов и среды, захваченные в проекте.

Небольшой образец из обширной иллюстрации в исходной работе, детализирующей различные источники запахов и среды, захваченные в проекте.

База данных была разделена на обучающие и проверочные разделы, с образцами из каждого объекта, назначенными одному и тому же разделу, чтобы избежать перекрестного загрязнения. Окончательная коллекция состоит из 7 000 пар обоняния и зрения, полученных из 3 500 не помеченных объектов, а также 70 часов видео и 196 000 временных шагов сырых обонятельных данных из обоих фаз базового и выборочного измерения.

Данные были собраны в течение 60 сессий в течение двухмесячного периода, охватывающего парки, университетские здания, офисы, улицы, библиотеки, квартиры и столовые, с несколькими сессиями, проведенными в каждом месте. Результатная база данных содержит 41% наружных и 59% внутренних сред.

Для разработки общих обонятельных представлений авторы обучили контрастную модель, чтобы ассоциировать синхронизированные пары изображений и запахов из базы данных. Этот подход, вышеупомянутый COIP, использует функцию потерь, адаптированную из CLIP, чтобы выровнять вложения совпадающих визуальных и обонятельных сигналов.

Обучение использовало как визуальный, так и обонятельный кодировщик, с целью обучения модели приближать совпадающие запахи и изображения в общем пространстве представления. Результатные представления поддерживают ряд задач вниз по потоку, включая извлечение изображения по запаху, распознавание сцен и объектов, классификацию материалов и тонкую дискриминацию запахов.

Модель была обучена с использованием двух типов обонятельных входных данных: полного сырого сигнала датчика и уменьшенного резюме, известного как смеллпринт – широко используемые функции в исследованиях обоняния, которые сжимают реакцию каждого датчика в одно число, сравнивая пиковое сопротивление во время выборки с средним сопротивлением во время базового фона.

Напротив, сырой вход, записанный по всему Нью-Йорку, состоит из временного ряда из 32 химических датчиков внутри устройства Cyranose, захватывающего, как каждый датчик электрического сопротивления менялся со временем, реагируя на запах.

Для кураторства базы данных этот необработанный сигнал был подан напрямую в нейронную сеть, позволяя конечное обучение с использованием либо свёрточной, либо трансформерной основы. Модели были обучены с использованием как смеллпринтов, так и сырого входа, собранного из различных сред Нью-Йорка, с обоими типами входных данных, оцененными с помощью контрастного обучения.

Кросс-модальное извлечение

Кросс-модальное извлечение было оценено, вложив каждый образец запаха и его парное изображение в общее пространство представления и протестировав, может ли быть извлечено правильное изображение на основе только обонятельного входа.

Ранжирование определялось близостью каждого вложения изображения к запросу запаха в этом пространстве, а производительность измерялась с помощью среднего ранга, медианы ранга и отзывчивости на нескольких порогах:

Точность кросс-модального извлечения для разных кодировщиков запаха, показывающая, насколько хорошо каждая модель определяет правильное изображение из запроса запаха. Результаты сравнивают архитектуры, обученные на сырых обонятельных сигналах, с теми, которые используют смеллпринты.

Точность кросс-модального извлечения для разных кодировщиков запаха, показывающая, насколько хорошо каждая модель определяет правильное изображение из запроса запаха. Результаты сравнивают архитектуры, обученные на сырых обонятельных сигналах, с теми, которые используют смеллпринты.

Относительно этих результатов, авторы заявляют:

‘Контрастное предварительное обучение, использующее смеллпринт, работает лучше, чем случайно, во всех метриках. Однако обучение кодировщика запаха на сыром обонятельном сигнале приводит к значительному улучшению по сравнению с кодировщиком смеллпринта, независимо от архитектуры.

‘Это показывает более богатую информацию, присутствующую в сырых обонятельных данных, открывая более сильные кросс-модальные ассоциации между зрением и запахом.’

Деталь из седьмой иллюстрации в исходной работе, которая слишком плотная, чтобы воспроизвести ее здесь осмысленно. Здесь показаны примеры кросс-модального извлечения, демонстрирующие, как модель связывает запахи с соответствующими изображениями. Каждый ряд начинается с запроса запаха, за которым следуют лучшие прогнозы изображений в общем пространстве представления. Правильное изображение для каждого запроса обрамлено зеленым, показывая, как запахи книг, растений, каменной кладки и других материалов толкают модель к визуально и семантически связанным сценам.

Деталь из седьмой иллюстрации в исходной работе, которая слишком плотная, чтобы воспроизвести ее здесь осмысленно. Здесь показаны примеры кросс-модального извлечения, демонстрирующие, как модель связывает запахи с соответствующими изображениями. Каждый ряд начинается с запроса запаха, за которым следуют лучшие прогнозы изображений в общем пространстве представления. Правильное изображение для каждого запроса обрамлено зеленым, показывая, как запахи книг, растений, каменной кладки и других материалов толкают модель к визуально и семантически связанным сценам.

Авторы также отмечают, что результаты извлечения показали четкие семантические закономерности:

‘Извлечения из нашей модели часто показывают семантические группировки. Запах книги извлекает изображения других книг, запах листьев извлекает изображения листвы.

‘Эти результаты предполагают, что изученное представление захватывает осмысленную кросс-модальную структуру.’

Распознавание сцены, объекта и материала

Способность модели распознавать запахи без визуального входа была оценена, обучая ее определять сцены, объекты и материалы на основе только обонятельных данных; для этого была использована линейная зонда (простой классификатор, обученный на замороженных представлениях), чтобы оценить, сколько информации было закодировано в изученных обонятельных вложениях.

Метки были получены из парных изображений в обучающем наборе с помощью GPT-4o – но только обонятельный сигнал использовался во время классификации.

Были протестированы несколько типов кодировщиков: некоторые были инициализированы случайно, некоторые были обучены с нуля, и другие были обучены с помощью контрастного обучения, чтобы выровнять запах и зрение в общем пространстве представления, с сырыми данными и смеллпринтами, оцененными:

Точность классификации сцен, материалов и объектов была оценена с помощью только обонятельных сигналов. Сырые данные датчика превосходили смеллпринты, а свёрточные нейронные сети, обученные с нуля, давали наилучшие результаты, включая 99,5% для сцен. Само-надзорное предварительное обучение помогало в некоторых случаях, но в целом было превосходящим обучением с учителем. Случайные весовые базовые линии указывают на то, что емкость модели сама по себе оказывается недостаточной.

Точность классификации сцен, материалов и объектов была оценена с помощью только обонятельных сигналов. Сырые данные датчика превосходили смеллпринты, а свёрточные нейронные сети, обученные с нуля, давали наилучшие результаты, включая 99,5% для сцен. Само-надзорное предварительное обучение помогало в некоторых случаях, но в целом было превосходящим обучением с учителем. Случайные весовые базовые линии указывают на то, что емкость модели сама по себе оказывается недостаточной.

Значительно более высокая точность была получена, когда использовались сырые обонятельные данные, особенно в моделях, обученных с кросс-модальным надзором. Авторы комментируют**:

‘Модели, обученные на сырых сенсорных входных данных, также достигают более высокой точности, чем модели, обученные с помощью手-crafted функций смеллпринта. Эти результаты показывают, что глубокое обучение из сырых обонятельных сигналов значительно лучше, чем手-crafted функции.’

Тонкая дискриминация

Чтобы оценить, могут ли быть изучены тонкие различия в запахах, была построена база данных из двух видов трав, сосуществующих на одной университетской лужайке. Чередующиеся образцы были собраны в течение шести 30-минутных сессий, в результате чего получилось 256 примеров. Линейный классификатор был обучен на функциях из контрастного обучения обоняния и зрения и оценен на отдельном наборе из 42 примеров:

Точность классификации видов трав по запаху. Модели были оценены на их способность различать два визуально похожих вида трав, используя только обонятельный вход. Производительность была сравнена через смеллпринты и сырые данные датчика, с моделями, либо случайно инициализированными, либо обученными с нуля, либо обученными с помощью само-надзорного обучения (SSL), за которым следовал линейный зонд. Наивысшая точность, 92,9%, была достигнута с помощью сырых обонятельных сигналов и SSL, что указывает на то, что тонкие различия в запахах лучше всего захватываются через сырой вход и обучение, руководимое зрением.

Точность классификации видов трав по запаху. Модели были оценены на их способность различать два визуально похожих вида трав, используя только обонятельный вход. Производительность была сравнена через смеллпринты и сырые данные датчика, с моделями, либо случайно инициализированными, либо обученными с нуля, либо обученными с помощью само-надзорного обучения (SSL), за которым следовал линейный зонд. Наивысшая точность, 92,9%, была достигнута с помощью сырых обонятельных сигналов и SSL, что указывает на то, что тонкие различия в запахах лучше всего захватываются через сырой вход и обучение, руководимое зрением.

Здесь исследователи заявляют:

‘Обучение на сыром обонятельном сигнале датчика (вместо 手-crafted функций) дает наивысшую точность – превосходящую все варианты, основанные на смеллпринтах.

‘Эти результаты предполагают, что обучение обоняния и зрения сохраняет больше тонкой информации, чем обучение с помощью смеллпринтов, и что визуальное руководство обеспечивает сигнал для использования этой информации.’

Вывод

Хотя синтез запаха, вероятно, останется нерешенной проблемой в течение некоторого времени, эффективная и доступная система анализа запахов в дикой природе имеет огромный потенциал, не только для полицейских, служб безопасности и медицинских целей, но и для мониторинга качества жизни и городской среды.

В настоящее время оборудование, участвующее в этом процессе, является нишевым и обычно довольно дорогим; поэтому реальный прогресс в «обонятельном ИИ» для обнаружения, вероятно, потребует дальновидного и доступного датчика в духе Raspberry PI.

 

* Мое преобразование внутренних цитат авторов в гиперссылки.

** Пожалуйста, обратите внимание, что дальнейшие иллюстрации (фигура 8) доступны в исходной работе, но лучше всего они воспринимаются в том контексте.

Опубликовано впервые в пятницу, 28 ноября 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai