思想领袖

欧盟人工智能法案没有告诉创始人的关于训练数据的事

mm
将 Unite.AI 添加到您在 Google 上的首选来源

欧盟人工智能法案第50条要求人工智能系统披露用户正在与机器交谈的事实。但是,它没有说明在披露后会发生什么。

基于基础模型构建产品的创始人关注准确性和价格。用户数据在离开他们的产品并被第三方模型处理后会发生什么,这个问题很少在选择供应商时被提及。

该规定于2026年8月2日开始执行,不遵守的罚款最高可达1500万欧元或全球年度营业额的3%,以较高者为准。数据保留和训练完全不在其范围内。如果您的应用程序将用户对话发送到第三方模型,则该提供商的数据处理成为您的产品的一部分,无论您是否打算如此。

行业的默认设置是训练,而不是询问

斯坦福大学人机交互人工智能研究所的研究人员审查了六家主要美国人工智能开发商的隐私政策,包括亚马逊、Anthropic、谷歌、Meta、微软和OpenAI,发现他们都使用客户聊天数据来训练他们的模型,一些甚至无限期保留这些数据。首席研究员詹妮弗·金恩在被问及是否应该担心人工智能聊天系统的隐私时直言不讳,回答说“绝对是”。因此,除非提供商的文档另有说明,否则应将训练视为默认假设。然而,细节因提供商而异,值得在提交之前密切关注。

曾经因其注重隐私而受到赞扬的Anthropic更改了其消费者条款,使得与Claude的对话现在默认用于训练,用户可以选择退出。这说明了供应商的训练政策可能会迅速改变,即使最初的推销是注重隐私的。

在其他模型中,选择退出并不完全起作用。谷歌将Gemini对话由人工注释员审查长达三年,关闭Gemini应用程序活动设置并不能阻止人工审查。一旦对话被标记为人工审查,它将无论用户后续采取何种行动而保持在谷歌的系统中。

Character.AI默认训练用户对话,并且只为EEA和英国的用户提供选择退出,这使得其数据处理政策处于宽松的一端。另外,该公司面临着法律和声誉挑战。2026年1月,Character.AI和谷歌同意原则上和解一系列诉讼,这些诉讼声称该平台的聊天机器人与未成年人互动造成了伤害,这与其数据训练政策无关。谷歌因其与Character.AI创始人的联系而被列为共同被告,尽管没有承认任何责任,条款也没有公开披露,但该案例表明,人工智能供应商的法律责任可能会延伸到支持它的公司。

数据保留窗口、人工审查触发器和分包商访问权限很少出现在隐私政策的细则之外。经常将这些API集成的公司通常需要彻底调查才能了解用户数据在审查或被谁查看期间保留多久。几乎没有这些细节会传达给最终用户,这意味着一家公司可以继承供应商的数据处理政策并将相同的风险传递给另一方,而双方都没有意识到这一点。

这是创始人的问题,而不仅仅是政策辩论

如果您的产品通过启用默认训练的基础模型路由用户对话,您已经代表用户接受了数据政策,即使您没有打算这样做。第50条并不要求您披露这一决定,因为它只涵盖了用户正在与人工智能交谈的事实。

第三方访问进一步扩大了这一风险。模型提供商经常将数据注释和安全审查外包给分包商。2026年5月,德克萨斯州检察长肯·帕克斯顿对Meta的AI眼镜发起调查,原因是位于肯尼亚的分包商Sama的数据注释员据称能够访问用户私人时刻的视频,包括浴室访问。Meta辩称这并不反映其做法的全部,但调查仍在进行。虽然这个例子涉及可穿戴相机,但同样的问题也可能适用于对话式人工智能。一个公司不出售您的数据的承诺,并不表明谁可以在内部读取它,然后再进入训练管道。

选择供应商之前需要检查的事项

在将基础模型连接到真实用户数据之前,创始人应该回答几个问题。

数据处理协议是一个好的起点。该协议是管理用户数据的处理的文件,值得完整阅读。

合同本身也值得关注。供应商通常在企业或API合同中提供比消费者聊天产品更严格的无训练条款,因此请书面确认哪些条款适用于您的特定集成。许多公司经常错误地假设企业级别的隐私语言默认适用于他们。

选择退出条款也值得检查。谷歌的Gemini设置说明了为什么如此,因为在该模型中,禁用活动跟踪并不能阻止人工审查。供应商应该能够明确说明选择退出是否停止训练、人工审查或两者。

最后,需要绘制数据在供应商下游的流向。注释和安全审查通常被外包,因此供应商自己的隐私承诺并不自动扩展到该链中的每个分包商。

这些问题都不应该被视为一次性练习。供应商的条款可能会更改,有时会很快,去年您签约的供应商可能不再按照相同的规则运营。

市场可以设定监管尚未达到的标准

第50条不太可能是欧盟关于人工智能数据治理的最后一句话,创始人不应该等待下一轮监管来填补它留下的空白。公司现在可以通过在自己的用户数据上建立明确和可见的训练选择来领先于这一空白。改进模型和默默地利用用户信任之间存在一条明确的界线。许多人工智能服务仍然跨越了这一界线,使用对话来训练而不征求明确的知情同意。现在划出这一界线的创始人将来不会需要改装合规性。

这是一个有先例的举动。加密的即时通讯应用程序和密码管理器没有等待监管机构将强大的默认设置标准化,他们自己做出了选择并将其转化为市场地位。人工智能产品有相同的机会。那些在强制之前划出界线的创始人将被信任处理用户的下一次敏感对话。

安德鲁·弗罗斯特·莫罗兹阿罗哈浏览器的创始人,该浏览器是一款以隐私为首要的浏览器,拥有超过3.2亿次下载和1000万月活跃用户。莫罗兹曾开发移动应用,并在康泰纳仕出版公司工作,这使他深刻地认识到隐私是一项基本人权。他于2015年创立了阿罗哈浏览器,遵循着永远不收集、存储、出售或变现用户数据的原则。