访谈

伊丽莎白·纳姆尔,Teleskope 的 CEO 和创始人 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

伊丽莎白·纳姆尔,Teleskope 的 CEO 和创始人,是一位来自世界上最大的科技公司的安全工程师和创业者,她的职业生涯跨越了数据安全、软件工程和创新领域。在 Airbnb担任高级软件工程师,专注于数据安全时,她面临着理解和控制庞大、快速增长的数据资产的运营挑战,这些资产分布在数十个系统中。这段经历,加上她在亚马逊和博思艾伦汉密尔顿公司担任技术和战略职务的经历,塑造了她对现代组织如何在规模上管理敏感数据的看法,并最终导致她创建了一家公司来解决这一问题。

(AMZN ) (BAH )

Teleskope 是一个现代的数据安全平台,旨在帮助组织持续地了解其数据的位置、使用方式以及在环境变得更加复杂时创建的风险。该平台针对开发人员和安全团队进行了优化,强调精确的数据可见性、自动修复和基于策略的控制,适用于云、SaaS 和混合环境。通过超越静态审计和手动流程,Teleskope 旨在为组织提供管理数据扩散的实用基础,同时实现负责任的 AI 采用。

您在 Airbnb (ABNB ) 创建了数据安全工具来编目和分类大量数据。是什么时候让您意识到这需要成为一家公司,而不是一个内部项目?早期的经验如何塑造了您的产品理念?

当我在 Airbnb 完成了这个产品时,我有机会在 Airbnb 的博客上发表了一篇名为“大规模自动化数据保护”的文章。我从未预料到会有任何回应,但安全社区做出了积极的回应,我开始收到来自世界各地的从业者的联系。我清楚地意识到,很多人面临着我曾经面临的相同挑战,这个产品是市场真正需要的东西。我在早期非常依赖同行的反馈,甚至 Teleskope 的 1.0 版本比我最初在 Airbnb 创建的版本要好得多。今天,我们的产品比我当时想象的要大得多、影响更深远。

您的多模型分类管道结合了传统的机器学习、特定格式的模型和 GenAI 验证。您能否详细介绍决策逻辑以及如何在规模上减少假阳性和假阴性?

我强烈推荐阅读我们关于数据分类的博客文章,我与我们的数据科学负责人 Ivan 一起撰写了这篇文章。我首先说,这是一种艺术,既是科学。每次找到敏感数据实体时,背景都会是独一无二的。同时,数据的规模使得这个问题变得更加具有挑战性,因为扫描生产数据的 PB 级数据需要大量的计算和时间。基本上,这就是为什么这个问题长期以来被认为是未解决的问题的原因。

艺术之处在于如何平衡所有权衡——速度、延迟、准确性、成本和广度(在数据存储、文件格式、语言等方面)。我们一直相信答案必须是创造性的,必须是多模式的。这就是为什么我们采取了这种方法,结合了许多可用的分类方法,以实现动态和细致入微的方法,可以概括为使用最轻量级的方法,不会明显牺牲准确性。这种动态方法使我们能够比依赖单一大小适合所有 LLM 的工具快 10-20 倍,同时比传统的基于上下文的方法或 REGEX 方法提供更准确的结果。

您最近推出了 Prism,专注于业务级别的数据理解和 GenAI 驱动的修复。与元素级别的 PII 检测相比,这解锁了哪些新的用例?您如何防止在修复操作中出现幻觉?

当我最初着手解决数据分类和保护的挑战时,我的重点是减少实际的假阳性结果。例如,我们如何确保至少 95% 的时间,当我们将某些内容标记为社会安全号码时,它确实是一个社会安全号码。几年前,即使 80% 的准确率在不同数据元素类型中也将是一个改进。

但通过与客户密切合作,我们清楚地认识到团队被淹没的“噪音”不仅仅是由不准确的数据实体分类(传统的“假阳性”)引起的。噪音往往同样是关于被不相关的警报淹没。Prism 做的事情是,它解锁了我们考虑更多上下文的能力——不仅仅是“这段数据是什么”或“谁正在访问这份文件”,而且是“这份文件实际上是什么”。通过将此信息与我们可以收集到的公司实际关心的内容相结合,我们可以提供一个符合每家公司不同定义的“敏感”数据的产品。

捕获这种细致入微的上下文是一个真正的游戏规则改变者。例如,在个人驱动器中的 Google (GOOGL ) 文档中存储数百个社会安全号码可能是一个重大的风险和对数据管理政策的违反。但是,将员工的 W2 表格存储在安全的 HR 驱动器中的文件夹中是预期的行为。安全团队希望被告知前者,但为每个员工的 W2(正确存储)发出警报只是噪音。了解敏感数据的位置和上下文需要的不仅仅是一个实体分类模型。

我们与一家跨国化学公司 Chevron (CVX ) Phillips Chemicals 合作。这家公司永远不会购买隐私工具或标准 DSPM,因为他们不认为消费者数据风险是一个优先事项。然而,他们关心的是知识产权,以专有化学方程的形式存在。通过将文档的本质浓缩为一个集群标签列表,我们不仅可以检测出独特的敏感元素,还可以找到这些数据资产被放在“错误”位置的实例。通过将此上下文与我们的自动修复相结合,我们可以采取行动将这些文件归档、删除、编辑或移到正确的位置。数据安全市场中没有其他人正在做这项工作。

Teleskope 强调跨多云、内部部署和第三方系统(包括影子数据)的持续发现。什么是“完整地图”覆盖的样子,您可以多快地在绿地部署中发现未知存储?

“完整”在这里是一个棘手的词——实际上这是一个不断移动的基准,甚至每天都在变化。这就是管理数据扩散的难度。我们的目标一直是让 Teleskope 存在于客户的数据存在的地方。我们最终是一个基于集成的产品——我们已经构建了数十个专有的数据连接器,以便能够在广泛的 SaaS 工具、云数据存储和内部系统中爬取、扫描和分类数据。大多数客户从他们认为风险最高或可见性最低的几个连接器开始,因此实际上我们很少存在于公司数据存在的每个地方。然而,在每个数据源中,我们不断地爬取他们的环境,以实时发现新的账户、表格、新的 blob、文件、消息等。因此,无论我们在哪里,我们都在找到数据,新的和旧的,几乎是实时的。

对于 AI 安全和治理,您如何跟踪训练数据集、模型、提示和输出之间的关系,以实现可审计性?

我们真正支持 AI 安全和治理的三个核心方式。首先,是我们将分类和修复技术应用于数据传输的能力,通过我们的 API。当公司生成或准备数据集来训练自己的模型时,他们需要一种方法来确保这些数据不包含个人身份信息或其他敏感数据。因此,我们直接插入数据管道,并可以在数据被移动或复制到训练集中时清除数据集。这样可以确保这些模型永远不会有输出敏感数据的风险。

第二,我们认为我们的核心产品是 AI 采用的一个启用器。每家公司都在压力下,利用 AI 工具来高效运作并跟上市场的步伐。一个很好的例子是 M365 的 Copilot,它提供了智能搜索功能,使找到文件或数据变得更容易。然而,这些工具本质上使找到敏感数据变得更容易,因此我们有很多公司来找我们,说“我们需要实施这个 AI 工具,但我们害怕它会发现什么。”他们需要 Teleskope 来扫描他们的环境,并自动执行他们的数据管理和安全策略,这样他们就可以自信地采用 AI。

最后,我们正在为 AI 工具构建集成,这些工具将在提示被泄露到公共 AI 工具(如 ChatGPT)之前删除或隔离包含敏感数据的提示。很多公司只是禁止使用这些工具,但有办法安全地采用它们,以确保不会泄露任何敏感数据(根据每家公司的定义)。

红action 和“源头修复”是您方法的核心。您对自动修复和人工在循环中的哲学是什么?您在哪里划定安全边界?

我们意识到,数据发现和分类虽然很必要,但只提供了故事的一半。找到数据风险是第一步,但解决和修复风险才是最终目标。我们的客户通常从评估 Teleskope 的发现开始,然后在移动到完全自动化修复之前,使用人工在循环中进行修复。我们非常清楚,实际上总会有一些操作,团队永远不会完全舒适地自动化。例如,从生产数据库中删除数据可能会非常有问题。但在很多情况下,我们看到客户采用全自动化来执行诸如撤销权限、移动数据、执行存档或保留策略等操作。

许多 DSPM/DLP 工具在实时保护方面存在困难。为了使“实时”成为基本要求,需要在架构上做出什么改变?企业可以期待在生产环境中实现什么样的延迟和吞吐量?

为了解决实时问题,分解任务为其核心组件是非常重要的。不同的情况需要不同的延迟,但目标始终是尽可能快地提供最准确的洞察。这意味着需要一个灵活的架构,可以并行化我们的低延迟系统,以适应不同的吞吐量要求。当企业在其环境中运行 Teleskope 时,数据正在被分类和保护,减少了延迟和外部数据流。这使我们能够在高风险场景中提供亚秒级的修复时间。

隐私和合规性:您声称提供持续监控和自动映射到框架/法规。您如何保持映射的更新以适应法律的演变?控制如何根据不同地区或业务单位进行定制?

坦率地说,我们的重点已经从检查框架转移到了深入了解客户关心的内容。有时,他们希望 100% 地映射到最新的法规,我们不断监控这些变化并将其纳入我们的产品中。但是,大多数公司距离完全遵守这些法律如此遥远,以至于我们必须在他们当前的位置与他们见面,并确保我们可以将他们从 A 点带到 B 点,然后到 C 点,然后再到 Z 点。我们通过了解对公司来说什么是合规的含义(例如,制造公司可能不认为 GDPR 是一个主要问题),并确保我们可以围绕他们的特定风险配置文件和需求塑造产品来实现这一点。

GenAI 采用:客户如何使用 Teleskope 来创建“安全输入”和“安全输出”而不降低开发速度?您推荐什么模式?

客户将 Teleskope 的 Redact API 集成到其训练和推理管道中,以确保敏感数据永远不会流向生成式 AI 模型。红action 过程从开发人员中抽象出来,通过在推理之前进行红action 并在之后重新水合数据来保留开发速度。

展望未来,您提到了一个从端到端的“代理”数据安全平台,具有自主修复。什么里程碑将表明行业已经准备好接受完全自主的数据保护?

我们知道行业已经准备好了。其他领域的网络安全,如 SOC,已经展示了完全转向代理 AI 以扩大安全团队容量的转变。我们有一批客户正在要求成为我们这项工作的设计合作伙伴,因此我们知道很多公司都感受到仍然需要手动分类、调查、做出决定然后执行来解决单个票据的痛苦。我们坚信这是市场的发展方向,我们决心引领这次转变。我们有绝对的信心,这就是市场的发展方向,我们将引领这次转变。感谢这次精彩的采访,希望读者能够通过访问 Teleskope 来了解更多信息。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。