思想领袖
产品标题匹配用于SKU管理,采用NLP

快速了解如何使用仅产品标题和NLP来自动化产品数据匹配和SKU管理。
产品标题匹配是指根据产品标题和其他标题属性严格匹配来自不同来源的类似或相同产品的过程。随着组织中的数据变异和数据源的增长,保持产品数据的准确性和管理新SKU可能会变得更加困难。当使用不同的供应商和供应商时,保持高质量的产品数据可能会变得更加困难。这可能会导致在评估销售数据和了解营销工作和成功率时出现问题。
虽然这种方法通常是手动完成的,但它可能会变得极其耗时,并且扩展性不佳。旧的系统仅使用基本的产品属性,如SKU和UPC代码,这些代码不能很好地处理现代非结构化数据。这些旧系统需要辅助过程来提取属性,删除重复项,并从非结构化产品数据中清除停止词。即使经过所有数据清理和关键字提取,这些系统仍然难以处理以下问题:
GIGABYTE – 15.6″ FHD IPS 144Hz 游戏笔记本 – i5-11400H – 16GB – NVIDIA GeForce RTX 3050 512 GB SSD
和
15.6″ 笔记本 – i5-11400H – 16GB – GeForce RTX 3050 512 GB 黑色 6494784
为了理解诸如“笔记本”和“游戏笔记本”之间的词汇关系,以及匹配GeForce所需的词性关键字,我们需要使用自然语言处理。
产品标题匹配可以为您提供什么
基于标题的产品数据匹配为零售商和电子商务品牌在销售数据和营销智能领域提供了许多好处。
- 在多个供应商和供应商中组织产品和SKU
- 使用竞争对手的数据来了解市场趋势和竞争性定价
- 了解产品生命周期
- 确保您的销售数据和营销活动中没有缺失的部分
使用基于产品标题的匹配系统可以确保您始终拥有执行数据匹配所需的确切信息。其他需要大量数据点或详细产品描述的系统可能会在扩展到更多产品时遇到困难。我们发现,使用专注于产品标题的深度学习NLP系统可以在不增加长期扩展风险的情况下获得类似的结果。我们已经使用产品标题匹配作为基准,并在此基础上构建其他模型,例如UPC匹配和产品描述匹配,以增强结果,而不是依赖它们。
使用自然语言处理的产品标题匹配
我们使用流行的NLP模型,如GPT-3、BERT和SBERT,构建了我们的产品标题匹配软件,以学习不同标题语言特征、标题属性(如品牌名称、产品名称、类型等)之间的关系。这些基于深度学习的模型远远优于模糊匹配和基于规则的方法,并且已被证明可以轻松扩展到具有新的数据变异和噪声的场景中。

匹配结果:Garmin nuvi 2699LMTHD — GPS导航 — 汽车 6.1 英寸nuvi 2699LMTHD 汽车便携式GPS导航
该结果来自NLP软件,展示了几个重要的方面:
- 停止词和字符不会影响我们匹配两个产品标题的能力
- 该模型可以识别标题中重要的词语,无论其顺序或噪声词如何
- 品牌名称不是必需的,我们可以在不需要品牌名称的情况下找到匹配或拒绝匹配
- 产品属性不是必需的(大小、长度),我们比较的每个产品中不需要相同的类型

产品标题模型可以识别容器大小之间的微小但重要的差异,这些差异在产品数据库中被认为是不同的SKU。在第二个示例中,我们看到有很多移动的部分 – 不同的瓶子数量和非结构化数据噪声,但仍然是一个容易匹配的结果。
为生产用例进行精细化
该产品标题匹配软件产品可以根据零售店或电子商务品牌的实际产品数据进行精细化,以便在特定用例中将准确率提高到其他产品之上。这种定制水平是由于用于构建产品标题匹配器的语言模型架构,而不是使用花哨的模糊匹配器或实体提取模型。能够根据公司的具体数据对架构进行精细化,可以更好地扩展,并且可以更轻松地适应非结构化数据的变化,当您添加更多产品或来源时。
产品匹配中的相对性
如您所见,产品匹配的概念可以根据您要覆盖的用例而有所不同。如果您要根据SKU区分产品,您将希望获得与您试图了解市场规模和竞争对手产品时不同的结果。
例如,如果您有以下两个产品标题:
Chios Mastiha Pack 60gr (2.11 oz) 小裂缝口香糖 100% 天然马斯틱口香糖来自马斯틱种植者新鲜
Chios Mastiha Pack 25gr (0.88oz) 中等裂缝口香糖 100% 天然马斯틱口香糖来自马斯틱种植者新鲜
您可以根据它们在同一商店中有两个不同的SKU这一理念将它们视为不匹配,但也可以根据它们都是马斯蒂克口香糖这一理念将它们视为匹配。如果我们现在将以下产品标题加入混合:
Horbaach 马斯蒂克口香糖 1500mg 120 胶囊 | 非转基因和无麸质
我们必须事先决定我们要匹配什么。这显然是竞争对手的产品,并且具有不同的UPC代码,但它仍然是马斯蒂克口香糖,如果我们只是寻找属于同一“伞”下的产品,那么这就是一个匹配。设计产品数据匹配系统时有很多事情需要考虑。
当您使用基于NLP的产品标题匹配工具时,这种灵活性变得轻而易举。我们只需根据您的用例对我们的架构进行精细化,无论您如何定义“匹配”,并优化它。这一灵活性在组织内部的多个用例中使用相同的架构时是一个游戏规则的改变者,并且仍然可以达到高精度。并且仍然可以达到高精度。

我们的基于SKU的管道正确地将其视为不匹配。
产品数据提取
一旦我们已经匹配了产品标题,并且了解了内部销售数据的变异或竞争对手的产品数据,我们就可以使用产品分类模型或基于NLP的属性提取工具来填补我们可能存在的任何数据缺口,例如产品大小、制造商名称和产品属性自动。这些管道使用与我们的产品匹配相同的架构,因此可以轻松集成。
改进您的产品分类

从我们的GPT-3模型生成产品类别和标签的示例。
使用产品标题匹配工具,您可以通过将多个匹配产品的属性组合成一个类别来提高您的分类的清晰度。这可以很好地清理和标准化构成您的分类系统的属性。
GIGABYTE – 15.6″ FHD IPS 144Hz 游戏笔记本 – i5-11400H – 16GB – NVIDIA GeForce RTX 3050 512 GB SSD
和
15.6″ 笔记本 – i5-11400H – 16GB – GeForce RTX 3050 512 GB 黑色 6494784
了解这两个产品是相同的产品,可以让您填补任何缺口,例如将“笔记本”和“游戏笔记本”放在同一类别中,将“NVIDIA (NVDA ) ”作为两个产品的制造商等。这可以让您找到错误分类的产品并填补任何缺口。
产品数据理解是关键
您认为产品标题匹配可以帮助您了解产品数据并清理销售智能吗?今天就预约Width.ai的演示。












