思想领袖
AI 个性化推荐持续失败,模型很少是原因

每个 AI 功能在演示中看起来都很出色。个性化问候很准确,推荐感觉很神奇,房间里的人都点头表示同意。麻烦开始于几周后,当同一个功能告诉真正的用户一些自信但错误的信息,他们再也不会相信它了。
2026 年,AI 个性化是每个产品团队计划的首要项目。然而,42% 的公司在生产之前放弃了他们的大多数 AI 计划,比前一年增加了 17%。大多数上市的产品都是晚期添加的,并以可以预见的方式破裂。以下是我们一直看到的四个错误,来源于构建一系列感知设备,但没有一个是关于传感器或硬件本身的。如果您正在任何东西上添加个性化层,这些错误都在等着您。
谈到空气质量感知,一个快速的例子可以使其具体化。放置在新家中的设备一开始对该家的基线、烹饪模式、通风怪癖或季节性花粉周期一无所知。前几周出现的每个模式都是一个投影,而不是一个肖像。投影和肖像之间的差距就是这四个错误所在。
错误 1:在数据存在问题时选择更大的模型
当个性化表现不佳时,直觉是升级模型,但这很少有帮助。个性化依赖于每个用户的数据,但这些数据很薄且充满了空白。新用户没有历史记录,每个团队都以艰难的方式重新发现冷启动问题。活跃的用户给您几天的读数,这些读数看起来不像稳定的模式。将其输入到一个有能力的模型中,您不会得到洞察力。您经常会得到自信的胡言乱语,因为模型悄悄地用其他人的平均值填补了空白,并将其呈现为您的自己的。
数据供应链是真正的约束。根据 2025 年对美国、英国、德国、奥地利和瑞士 200 名首席营销官的调查,只有 45% 的组织收集的数据实际上可用于 AI 驱动的决策。一项 RAND 分析发现,许多 AI 项目失败是因为组织缺乏训练有效 AI 模型所需的数据,以及组织和工作流程中的差距,而不是模型质量。MIT 的“GenAI 分裂”报告将企业生成性 AI 试点项目的生产失败率置于更高的位置。约 95% 的企业生成性 AI 试点项目未能带来可衡量的利润影响,脆弱的工作流程和不充分的上下文学习被列为主要罪魁祸首。
一项 Nature Medicine 研究发现了医疗 AI 中的相同模式。系统在处理完整、结构化的病例时表现良好,但在处理普通人以部分模糊的方式描述他们的情况时会失灵。事实是,您的用户默认处于部分模糊状态。解决方案不是更尖锐的模型,而是对您对该人了解的知识进行诚实的描述,并相应地采取行动。直到您学习(和获得)个人基线,正确的行动往往是个性化较少,而不是更多,并依赖于在人群中持久的东西,而不是从几个点中构建一个个人资料。
在空气质量感知中,基线问题是结构性的。建立有意义的个人空气质量配置文件需要对不同活动、通风状态和室外条件进行数周的连续读数。冬季安装的室内设备无法捕获夏季污染物配置文件。在厨房安装的设备无法捕获卧室的任何信息。季节漂移、居住变化,甚至家具重新布置都可以将家庭的基线向 AI 标记的异常移动得更远。然而,团队通常在 48 小时的数据后开始显示“个性化”见解——正是在这一刻,人口平均值是唯一可用的诚实信号。
错误 2:交付数据未获得的信心
模型不会标记它正在猜测,除非您强制它这样做。独自留下它,通常会为具有三年的历史记录的用户和具有三小时历史记录的用户返回相同的清晰答案。对于阅读它的人来说,这些答案看起来相同——直到其中一个是错误的。
这就是信任如何死亡。告诉某人他们睡得不好是因为 X 并带有虚假的确定性,一旦明显地错了一次,他们就会把整个产品归类为噱头。他们已经准备好了。信任赤字已经是结构性的:在 2026 年 Quantum Metric 基准调查中,81% 的消费者表示,他们不会在经历一次糟糕的 AI 驱动体验后返回该品牌。Rithum 调查发现,58% 的购物者在 AI 推荐出错时会责怪品牌,而不是 AI 工具,16% 的人会完全避免购买该产品。 只有 13% 的消费者表示他们完全信任 AI。
空气质量是一个明确的例子。PM2.5 浓度在一天内根据烹饪、清洁、交通、天气和许多其他因素的不同而变化一个数量级。告诉用户他们的暴露“对于您来说是升高的”在三天的读数后,将周二早晨与永久的个人模式混淆。模型并没有撒谎。它只是没有办法知道它不知道什么——除非团队内置了这种意识。显示置信度范围(“您的典型范围仍在建立中”)不是弱点信号。在与健康相关的感知产品中,这是唯一诚实的东西。
在健康背景下,风险倍增。JMIR mHealth 定性研究发现,用户是否愿意分享个人健康数据并根据 AI 推荐采取行动,取决于他们是否了解系统如何使用他们的数据以及推理是否被清晰地解释。相关的不确定性可视化研究发现,显示 AI 不确定性可以增加适当的信任,而不是简单地警告用户。
最便宜的可靠性功能是“还没有足够的数据”或“正在学习”的那一行。几乎没有人构建它,因为它感觉像是在承认弱点。然而,这是相反的。这行文字可以在用户在自信的猜测中失去信任的那一天保留用户。
错误 3:优化“哇”而不是有用性
很多个性化是为了在第一次会议中给人留下深刻印象而构建的,而不是为了在第 100 次会议中提供帮助。哇效应在演示中看起来很漂亮,但很快就会过时。更糟糕的是,同一个让某人感到神奇的技巧,一旦误读某人,就会瞬间变成令人毛骨悚然的——这会悄悄地毁掉一个品牌。
人们可以感觉到 AI 服务他们和 AI 服务仪表板之间的区别。Qualtrics 2026 年消费者体验趋势报告发现,几乎五分之一的使用 AI 进行客户服务的消费者根本没有看到任何好处。
放弃率很明显。71% 的消费者表示,如果 AI 驱动的体验与他们无关,他们就会放弃购买。在电子商务中,69% 的购物者会因为不相关的 AI 推荐而离开搜索。与此同时,80% 的商业领袖将他们的公司个性化评为优秀——但只有 8% 的客户同意。这一差距是一个产品问题,团队优化内部指标而不是用户相关的结果。
Gartner 研究发现,个性化的客户更有可能后悔购买(3.2 倍)并且不太可能再次从同一品牌购买(44%)。这是优先考虑转化而不是适合度的个性化的指控。哇效应变成了负担。
新颖性往往会随着每一年而消退得更快。第二年幸存下来的功能是为第 100 次会议而构建的,而不是为第一次会议而构建的。
错误 4:在黑盒中个性化
个性化通常需要一些亲密的数据,而模型越个人化,所负责的数据堆就越敏感。这在 2026 年不再是抽象的。在这一年初, 五家科技公司推出了面向消费者的专用 AI 健康工具,包括允许用户将医疗记录、实验室结果和可穿戴数据连接到单个配置文件的产品。无论您在什么上进行个性化,都是朝着这样的系统发展的。
有两个失败。第一个是不透明。用户无法打开、质疑或更正的推荐不是个性化,而是判决,人们会对自己的身体和习惯的判决感到怨恨。现在在健康应用中很常见的 AI 健康教练的生死存亡取决于用户是否可以看到建议背后的推理。JMIR mHealth 研究直接证实了这一点:用户是否愿意分享个人健康数据并根据 AI 推荐采取行动,取决于他们是否可以访问对其数据使用的清晰、主动的解释。
第二个失败是忽视。团队囤积每个信号“以防模型需要它”,从而造成了他们从未定价的责任。2026 年 Transcend 客户数据状态报告发现,93% 的组织在 AI 生命周期期间面临数据权限或治理问题,并且 85% 的企业缺乏至少四项基础 AI 数据治理能力。由于这些差距,30% 的个性化/客户体验 AI 计划已经停滞。进一步,61% 的消费者对品牌如何使用他们的数据持怀疑态度,而 54% 的人希望知道何时与 AI 交互。
收集更少的数据并使推理可读会更好。让人们与之争论。
失败的共同点
注意线索。这些错误都不是智力方面的失败。模型通常是堆栈中最强的部分。它们是诚实方面的失败:关于您拥有的数据、您实际上有多确定、您构建功能的目的以及您收集和为什么收集的数据。这种感觉很不舒服,因为诚实的演示效果不好。不幸的是,一个保留是没有一个自信的答案那么令人印象深刻的,小心翼翼的功能看起来很谦逊,放在一个宏伟的功能旁边。第二年获胜的团队是那些已经接受了这一点的团队。
什么才是有效的
这并不是反对 AI 个性化的论据。这是对克制的论据。缩小范围,直到您可以在其中做到正确。校准,然后解释,并将测量的内容与推理的内容分开。显示不确定性,而不是隐藏它。让每个推理都成为用户可以检查和质疑或反驳的东西。在花费它之前先获得下一个信任。所有这些都很不光彩,但这是一个功能的差异,人们会保留它,而不是在一周内关闭它。
回到演示。第一天给房间留下深刻印象的版本和用户一年后仍然信任的版本不是同一个产品,而它们之间的差距几乎从来都不是模型。它是团队是否对薄数据说了真话,是否习惯说“我不知道”,并展示了他们的工作。AI 个性化的难点从来都不是关于智慧。它是关于谦逊。大多数团队仍然跳过这一部分,他们的用户可以看出来。












