Лидеры мнений

Сопоставление названий продуктов для управления SKU с помощью NLP

mm
Добавьте Unite.AI в избранные источники в Google

Быстрый обзор того, как можно автоматизировать сопоставление данных о продуктах и управление SKU, используя только названия продуктов с помощью NLP.

Сопоставление названий продуктов – это процесс сопоставления подобных или идентичных продуктов из разных источников, основанный строго на названии и других атрибутах продукта. По мере роста вариативности данных и источников данных в организации становится все труднее поддерживать точность данных о продуктах и управлять новыми SKU. Возникают проблемы при использовании разных поставщиков и продавцов, а также при поддержании высококачественных данных о продуктах. Это может привести к проблемам при оценке данных о продажах и понимании маркетинговых усилий и показателей эффективности.

Хотя это часто делается вручную, это может стать чрезвычайно трудоемким и не масштабируемым. Старые системы, основанные на простых атрибутах продуктов, таких как SKU и коды UPC, не работают хорошо с современными неструктурированными данными. Эти старые системы требуют дополнительных процессов для извлечения атрибутов, удаления дубликатов и очистки стоп-слов из неструктурированных данных о продуктах. Даже с учетом всех данных очистки и извлечения ключевых слов эти системы все равно испытывают трудности с такими вещами, как:

GIGABYTE – 15,6″ FHD IPS 144Hz игровой ноутбук – i5-11400H – 16GB – NVIDIA GeForce RTX 3050 512 GB SSD

И

15,6″ Ноутбук – i5-11400H – 16GB – GeForce RTX 3050 512 GB Черный 6494784

Чтобы понять отношения между словами, такими как «ноутбук» и «notebook», и ключи части речи для сопоставления GeForce, нам необходимо использовать обработку естественного языка.

Что может предоставить сопоставление названий продуктов для вас

Сопоставление данных о продуктах на основе названия предоставляет розничным торговцам и брендам электронной коммерции множество преимуществ в мире данных о продажах и маркетинговой разведки.

  • Организуйте продукты и SKU по нескольким поставщикам и продавцам
  • Используйте данные конкурентов, чтобы понять рыночные тенденции и конкурентную цену
  • Понимайте жизненный цикл продукта
  • Обеспечьте отсутствие пробелов в ваших данных о продажах и маркетинговых кампаниях

Использование системы сопоставления названий продуктов позволяет вам всегда иметь точную информацию, необходимую для сопоставления данных. Другие системы, требующие множества точек данных или подробных описаний продуктов, могут испытывать трудности при масштабировании на более крупные объемы данных. Мы обнаружили, что использование глубокой модели обучения на основе NLP, которая фокусируется на названии продукта, позволяет получить аналогичные результаты без долгосрочных рисков масштабирования. Мы смогли использовать сопоставление названий продуктов в качестве базовой модели и построить другие модели вокруг нее, такие как сопоставление кодов UPC и сопоставление описаний продуктов, чтобы просто улучшить результаты, а не полагаться на них.

Сопоставление названий продуктов с помощью обработки естественного языка

Мы построили нашу систему сопоставления названий продуктов, используя популярные модели NLP, такие как GPT-3, BERT и SBERT, чтобы узнать отношения между различными атрибутами названия, такими как бренд, название продукта, тип и т. д. Эти модели глубокого обучения намного лучше, чем базовые методы сопоставления и другие правила, основанные на подходах, и доказали свою способность легко масштабироваться с новыми данными и шумом.

Сопоставление между: Garmin nuvi 2699LMTHD — GPS-навигатор — автомобиль 6.1 дюймаnuvi 2699LMTHD Автомобильный портативный GPS-навигатор

Этот результат программного обеспечения NLP показывает несколько важных вещей:

  • Стоп-слова и символы не влияют на нашу способность сопоставить два названия продуктов
  • Модель может определить слова в названии, которые имеют значение, независимо от порядка или наличия шумовых слов.
  • Названия брендов не требуются для нас, чтобы найти совпадения или отклонить совпадение.
  • Атрибуты продукта не требуются (размер, длина) в каждом продукте, который мы сравниваем, и не должны быть одинаковыми.

Модель названия продукта улавливает небольшие, но важные различия между размерами контейнеров, которые считаются разными SKU в базе данных продукта. Во втором примере мы видим, что есть много движущихся частей – разные количества бутылок и неструктурированные данные шума, но все равно легко найти совпадение.

Уточнение для производственного случая

Это программное обеспечение для сопоставления названий продуктов может быть уточнено для розничного магазина или бренда электронной коммерции на основе фактических данных о продуктах, чтобы повысить точность по сравнению с другими продуктами для вашего конкретного случая. Этот уровень настройки доступен благодаря архитектуре языковой модели, используемой для построения сопоставителя названий продуктов, вместо использования моделей сопоставления на основе правил или моделей извлечения сущностей. Способность уточнять архитектуру для конкретных данных компании позволяет лучше масштабироваться, а также становится намного проще адаптироваться к изменениям неструктурированных данных при добавлении новых продуктов или источников.

Относительность в сопоставлении продуктов

Как вы, возможно, заметили, идея сопоставления продуктов может быть несколько относительной, основанной на том, какой случай вы пытаетесь покрыть. Если вы пытаетесь различать продукты на основе SKU, вы хотите получить разные результаты, чем если бы вы пытались понять размер рынка и продукты конкурентов.

Например, если у вас есть эти два названия продуктов:

Chios Mastiha Pack 60gr (2,11 унции) Маленькие слезы жевательной резинки 100% натуральная мastic жевательная резинка от производителей Mastic Growers Fresh

Chios Mastiha Pack 25gr (0,88 унции) Средние слезы жевательной резинки 100% натуральная мastic жевательная резинка от производителей Mastic Growers Fresh

Вы можете считать их не совпадающими на основе идеи, что у них разные SKU внутри одного и того же магазина, но также можете считать их совпадающими на основе идеи, что они оба являются Mastic Gum. Если мы теперь включим это название продукта в смесь:

Horbaach Mastic Gum 1500mg 120 Капсул | Не содержит ГМО и глютена

Нам необходимо решить заранее, для чего мы сопоставляем. Это явно продукт конкурента и имеет другой код UPC, но это все равно Mastic Gum, и если мы просто ищем продукты под одной и той же «зонтиком», то это совпадение. Многое нужно подумать при проектировании систем сопоставления данных о продуктах.

Когда вы используете инструмент сопоставления названий продуктов на основе NLP, этот уровень гибкости становится легким. Мы просто уточняем нашу архитектуру для вашего случая, независимо от того, что вы считаете «совпадением», и оптимизируем ее для этого. Этот уровень гибкости является прорывом, когда вы хотите использовать одну и ту же архитектуру для многих разных случаев внутри организации и все равно достигать высокой точности.

Наша система сопоставления на основе SKU правильно считает это не совпадением.

Извлечение данных о продуктах

Как только мы уже сопоставили названия продуктов и имеем понимание либо внутренней вариативности данных о продажах, либо данных о продуктах конкурентов, мы можем использовать модели категоризации продуктов или инструменты извлечения атрибутов на основе NLP, чтобы заполнить любые пробелы в данных, которые у нас есть, такие как размер продукта, название производителя, атрибуты продукта автоматически. Эти конвейеры используют одну и ту же архитектуру, что и наше сопоставление названий продуктов, поэтому они могут быть легко интегрированы.

Улучшите свою таксономию продуктов

Пример генерации категорий и тегов продуктов из нашей модели GPT-3.

С помощью инструмента сопоставления названий продуктов вы можете улучшить ясность своей таксономии, объединив несколько атрибутов продуктов в одну категорию. Это сильно очищает и стандартизирует атрибуты, которые составляют вашу систему таксономии.

GIGABYTE – 15,6″ FHD IPS 144Hz игровой ноутбук – i5-11400H – 16GB – NVIDIA GeForce RTX 3050 512 GB SSD

И

15,6″ Ноутбук – i5-11400H – 16GB – GeForce RTX 3050 512 GB Черный 6494784

Понимание того, что это один и тот же продукт, позволяет вам заполнить любые пробелы, такие как помещение «Ноутбук» и «Лэптоп» в одну и ту же категорию, «NVIDIA (NVDA ) » в качестве производителя для обоих продуктов и т. д. Это позволяет вам найти неправильно категоризированные продукты и заполнить любые пробелы.

Понимание данных о продуктах является ключом

Думаете, что сопоставление названий продуктов может помочь вам понять данные о продуктах и очистить интеллект о продажах? Давайте запланируем демонстрацию сегодня на Width.ai.

Matt Payne является основателем и генеральным директором Width.ai. Width.ai - это консалтинговая фирма в области машинного обучения, специализирующаяся на создании приложений на основе глубокого обучения с клиентами из сфер SaaS, управления активами, человеческих ресурсов и маркетинговой автоматизации. Width.ai в настоящее время является лидером в создании и консультировании по производственным продуктам GPT-3 и написала ряд белых бумаг и технических обзоров об использовании этого передового ресурса.