访谈

Barb Hyman,Sapia.ai 创始人兼首席执行官 – 访谈系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Barb Hyman,Sapia.ai 的创始人兼首席执行官,是一位经验丰富的商业领袖,职业生涯涵盖法律、管理咨询、市场营销、学习与发展、人力资源以及技术。她的职业起点是担任 Herbert Smith Freehills 的律师,随后加入 Boston Consulting Group 从事咨询,在那里晋升为项目负责人,随后以高级职务回归,负责大洋洲地区的学习与发展、人力资源和市场营销。Hyman 还曾担任悉尼当代艺术博物馆(Museum of Contemporary Art)的市场营销与赞助主管,以及 REA Group 的 People & Culture 执行总经理。她于 2018 年创立了 Sapia.ai,借助其在组织领导力和人才管理方面的经验,重新思考公司如何利用人工智能评估和招聘人才。

Sapia.ai 是一家以 AI 为动力的招聘技术公司,专注于结构化、对话式的候选人评估。其平台使用基于聊天的面试,在大规模上对候选人进行一致性评估,帮助雇主评估技能和适配度,同时减少对传统简历筛选及其他可能引入偏见的信号的依赖。Sapia.ai 表示,其技术已评估超过 1000 万名候选人,并将结构化评估科学与 AI 驱动的人才智能、个性化候选人反馈以及与现有申请人追踪系统和人力资源系统的集成相结合。公司还强调可解释性、公平性和企业合规性,其更广泛的平台涵盖 AI 面试、职位分析、面试排程、人才智能以及 AI 驱动的职业辅导。

在创立 Sapia.ai 之前,您构建了跨越 Boston Consulting Group 咨询、法律、市场营销、学习与发展,以及最终在 REA Group 担任 People & Culture 领导的职业生涯。哪些经历让您确信招聘需要从根本上重新思考,您最初想通过 Sapa.ai 解决的是什么问题?

当前我们评估人的方式已经失效——尤其是在招聘方面。

我们依赖简历,却看不到完整的个人。我们在最关键的决策——雇用谁、晋升谁——上凭直觉和代理指标。镜像招聘现象普遍:从何时起,某人就读的学校或大学成为智力的代理指标?事实并非如此,而是优势的代理。

其中一些与我的个人经历有关。我是一名移民,我知道自己属于幸运的移民类别:我是白人,名字也容易被人发音。我来自一个没有人上大学的家庭;我的父亲是店主。尽管如此,我仍获得了非凡的机会,经历了五段职业生涯,如今站在这里。当我想到全球约二十亿的劳动者时,我会想到其中有多少人具备我被认可的才华、驱动力和批判性思维,却因为我们被自身经验的棱镜所遮蔽而从未被看到。偏见是做出快速决策的便利捷径,这正是招聘持续奖励已具优势者的原因。它从未显得公平或理性。

故事的另一半来源于咨询。完成 MBA 后,我进入了一个任何进入会议室做出建议都必须基于真实调研的领域。然而,企业所面临的最高风险决策(谁加入、谁领导、谁塑造文化)仍然凭直觉,或依赖像大学名称这样薄弱的代理指标。人并不体现在资产负债表上,但在专业服务领域,尤其是,他们正是资产。这种脱节在我看来荒唐至极。

自从列奥纳多·达·芬奇发明简历格式以来,简历本身基本未发生改变。维基百科列出了超过 180 种已记录的人类偏见。北美约有三分之一的求职者在完成职位申请后,两个月仍未得到回复。这并非人才问题:人才分布均等,但机会并非如此。

我创立 Sapia 的初衷并非仅仅解决一个决策问题——而是源自求职的亲身经历。我的团队常为此取笑我,但我始终将招聘视为约会。这是一段关系。你在工作中与同事相处的时间往往超过与伴侣的相处时间。那么,为什么在如此重要的决策上,你会使用低于我们对其他关键决策所坚持的同等严谨——数据——的标准呢?

您曾指出,大多数组织将 AI 采用视为效率项目,而实际上应从信任项目开始。实践中,“信任”究竟是什么样子,企业应如何在衡量生产力、成本节约和采用率等传统指标的同时,对其进行衡量?

我在担任首席人力资源官(CHRO)时学到:如果对变革的原因缺乏透明度,信任将是首个受害者。我认为大多数公司对 AI 采用的认识是颠倒的。他们衡量生产力提升,例如节省的工时、每次招聘的成本,却从未停下来衡量真正决定其能否持久的因素:员工是否信任你使用 AI 的方式,以及背后的原因。

信任是你们文化的基石。它不是坐在真实指标旁边的软性指标——它才是构建真实指标的根本。把它想象成任何关系。高度的信任会给你更多的自由度。低信任会让一切变得更小、更缺乏活力、更不放松。而且当人们感受不到安全感时,没人能发挥出最佳工作状态。组织也不例外。

然而,在职场中对 AI 的许多实践实际上是把人们自己的数据武器化,例如抓取某人的社交媒体以推断其是否是合适的雇员、合适的风险或不良风险。我真的无法想象做出这种决定的会议场景,也无法想象有人会认为只要人们发现后就不会腐蚀文化。

因此,如果你真的想认真推进 AI 采纳,信任必须从第一天起就成为一个指标,和生产力、成本节约并列。直接询问员工:你是否理解我们为何使用它?你是否相信它的使用是公平的?如果这两个问题你都无法回答“是”,那么你所庆祝的效率提升只是以悄然消耗的文化为代价的借贷。

在招聘中使用 AI 最大的担忧之一是模型可能会从历史雇佣数据中学习,并可能强化组织试图消除的人类偏见。公司如何防止 AI 仅仅自动化现有的招聘偏见,以及应从一开始在这些系统中构建哪些防护措施?

这正是大多数关于 AI 招聘的对话所忽视的陷阱,也是我以这种方式构建 Sapia 的原因。如果你在历史招聘数据(谁被录用、谁被晋升、谁获得了第一次面试)上训练模型,你并没有消除偏见,而是在工业化它。你在教机器复制每一个镜像式的招聘决定、每一次“文化契合”的判断、每一个凭直觉的捷径——这些都塑造了你现在拥有的员工队伍。这不是创新,而是规模化的偏见,只是更快,并且披着客观的外衣,使其更难以挑战。

因此,防护措施必须在算法之前就开始。我们不在简历、照片、姓名、大学或任何传统的与特权而非潜力相关的代理变量上进行训练。如果输入本身带有偏见,无论下游模型多么巧妙,都无法解决。这是“垃圾进,垃圾出”的问题,只是这里的垃圾是披着简历外衣的数十年人类偏见。

第二点是你实际用来衡量模型的标准。仅仅说“AI 有效”是不够的,你必须持续对性别、种族、年龄、残障等每一个受保护特征进行不良影响测试,且要持续监测,而不是在上线前进行一次性审计。偏见不是一次性修复的 bug,而是需要像监控任何对人生命产生重大决定的系统一样,持续关注的对象。

第三点——也是人们常忽视的——是需要外部视角。对模型进行独立的第三方审计,公开方法论,真正透明地说明系统的功能与局限。如果你只愿意让构建该工具的、且在财务上有动机为其辩护的人来检查你的 AI 招聘工具,那么你并没有真正解决信任问题,只是把它转移了。

“是算法导致的”并不是借口,而是承认你根本没有在一开始就建立防护措施。请记住,AI 并不能免除人类在公平性方面的责任。

招聘是 AI 应用中风险异常高的领域,因为算法可以直接影响个人的职业生涯。组织应当在何处划定界限,将哪些决策可以自动化,哪些决策必须始终保持有意义的人类监督?

我划定的界限是:AI 完全可以帮助你更清晰地了解一个人,但它绝不应单独决定其命运。增强决策与外包决策之间有本质区别。招聘是为数不多的几个领域之一,若把这一区别弄错,实际上会改变某个人的生活。

那么自动化应当在哪里发挥作用?在呈现人类难以始终如一且公平地看到的信号时,例如在不疲劳、不受情绪波动影响、也不无意识地偏爱与自己二十五岁时相似的候选人的情况下,阅读成千上万的面试回答。这是 AI 能比第八轮面试已疲惫不堪的招聘经理做得更好的工作。筛选真正的软技能、结构化洞察,使每位候选人都在相同标准下评估,这正是机器能够真正增值的地方,因为我们天生无法保持如此一致性。

最终的决定——谁被录用、谁被拒绝、谁获得二次审视——必须交由能够承担责任的人来做。不是对模型输出的机械盖章,而是实质性、意义重大的监督:一个了解系统衡量内容、能够质疑看似错误结果并有权覆盖它的人。如果人类无法对 AI 的推荐提出有意义的挑战,这就不是监督,而是人类的借口。

我也会划定界限,拒绝任何不可逆或不透明的做法。如果候选人无法获得对其未通过的可理解解释,无论系统多么”准确”,它都已经失败。更何况如果模型做出的决定公司里没有人能够真正解释——包括构建它的人——那就不是招聘工具,而是装着某人职业生涯的黑箱。我给任何组织的测试很简单:你能坐在被拒绝的候选人对面,用通俗的语言解释原因吗?如果诚实的回答是”我真的不知道,是模型决定的”,那说明你把错误的环节自动化了。

Sapia.ai 区分用于开放式对话的生成式 AI 与用于对候选人评分的更确定性系统。当 AI 输出需要保持一致、可审计且可辩护时,这一区别为何重要?

人们听到”AI”就以为它只有一种形式,但在招聘中,这种混淆正是问题所在。我们有意将工作分为两部分,因为开放式对话和高风险评分的需求截然不同,而假装它们是同一技术会导致公司得到无法解释、辩护或信任的系统。

生成式 AI 在对话层面表现出色——能够与候选人进行自然、具有人情味的交流,提出恰当的追问,使体验更像对话而非表格。这正是你希望拥有灵活性、细微差别,甚至一点不可预测性的地方,因为真实的对话并非预先写好的脚本。

但一旦你从与候选人交谈转向对其进行评分,系统需求就完全颠倒。评分必须保持一致:相同的答案无论是第一个候选人还是第千个候选人,无论是周一上午还是周五下午,都应得到相同的评估。它必须可审计,这意味着你需要能够回溯并准确说明某位候选人为何得到该分数,而不是仅仅相信模型”自行算出了”。此外,它还必须可辩护,因为这分数关系到人的生计,而”生成模型觉得这是个好答案”这种说法在监管机构、记者或想了解为何未获职位的候选人面前根本站不住脚。

生成模型本质上是概率性的——同一个问题问两次可能会得到细微不同的输出。这在对话中是特性,却在评分时成为严重的隐患。在 Sapia,我们在实际决定候选人结果的环节使用确定性系统。我们构建的模型保证相同输入始终产生相同输出,能够追溯推理过程,并且能够证明两个相似的候选人得到等同对待。

这实际上是关注点的分离:让生成式 AI 擅长类人化的交互,让确定性、可审计的系统承担必须公平、可解释且经得起审查的决策重任。

可解释性常被视为负责任 AI 的必要条件,但许多先进模型仍然难以让用户理解。当 AI 影响招聘决策时,候选人或员工合理地应期待得到多少解释?

我认为候选人应得到的远超大多数公司目前提供的,老实说,也超出大多数公司自认能够提供的范围。所谓”算法决定了”,不过是把失败包装成高深的借口。

我的立场是:候选人应始终能够用通俗的语言了解自己被评估的内容以及大致为何得到当前的结果。不是底层数学,也不是模型权重的打印输出。他们想要、也应得到的,更像是优秀经理当面告知的内容:这些是我们在寻找的素质,这里是你的优势,这里这次你并非最佳匹配。这是完全合理的标准,任何达不到这一点的系统本就不该决定他人的生计。

因此对我们而言,可解释性必须从第一天起就嵌入架构,因为无法追溯的事物也无法解释。

我稍微会反驳的是,把可解释性等同于候选人需要具备模型工作原理的技术教育。这是一个错误的标准,常被当作借口,实质上是系统本身没有被设计成可解释的。优秀的医生不会向你讲解诊断的生化过程;他们会告诉你发现了什么以及对你意味着什么。招聘中的 AI 也应遵循同样的人可读、诚实的标准。

真正的考验与我对人工监督的要求相同:候选人能否询问”我为何未通过?”并得到具体、诚实且属于自己的答案。如果你的 AI 不能给出这样的回答,就说明你并未构建可解释的系统,而是打造了一个希望没人会质疑的系统。

公司常常关注员工和管理者是否在使用 AI 工具,而不是他们是否真正信任其输出。哪些警示信号表明组织已经实现了 AI 采用,却未获得对技术的真正信心?

采用率是最容易造假的指标,这正是为何许多公司误把它当作成功的标志。如果我告诉你公司里每个人都在“使用”AI工具,这几乎无法说明他们是否相信它——这可能只是因为它是强制性的,或者是最省事的做法,亦或是还没有人找到规避它的方法。

第一个警示信号是变通行为。如果人们在使用AI工具的同时,还悄悄地并行使用旧流程——手动双重检查输出、保留自己的独立笔记、以防万一运行影子系统——这相当于附带了保险政策的合规性。使用数据看起来很不错,事实是大家都认为该工具可能出错。

第二个警示信号是沉默。在真正信任的文化中,人们会在发现异常时质疑系统:提问、提出异议、标记感觉不对的结果。当采用是真实的而信任缺失时,情况恰恰相反。人们停止质疑,因为他们认为争论毫无意义。领导层往往误将这种沉默解读为满意,实际上这是一种放弃。

第三个警示信号是调查结果与员工之间的对话不一致。我会更担心一家公司的官方采用仪表盘显示全绿,但休息室里的真实对话是“是的,我们只是照它说的做,因为这样比争论更省事”——这表明文化尚未真正转变。

最深层的警示信号,也是我最在意的:人们完全不再把自己的判断带到桌面上。这是放弃。对工具的真正信任意味着人们仍然有权在自己的专业判断与工具结果不同时表达不同意见,并且感到安全。如果你的管理者保持沉默,只是盲目遵从AI的指示,那么你已经形成了依赖。

因此真正的考验不是“人们是否在使用”,而是“如果是可选的,人们是否愿意继续使用,并且在出现错误时是否会诚实地告诉你”。大多数公司从未真正提出这两个问题,这往往是关键所在。

AI招聘工具有可能在规模和一致性上评估候选人,超出人类招聘者的能力,但招聘也涉及情境和细微差别。您认为AI今天在哪些方面能够超越人类判断,而哪些方面仍然需要人类参与?

AI可以在评估大量候选人时表现出色,无论其背景和经历如何,同时为有特定需求的候选人提供量身定制的评估。人类招聘者可能更倾向于偏好来自顶尖大学或没有既往健康问题的候选人。AI能够以人类在面对数百份申请时难以实现的方式,对所有候选人进行公平、平等的评估。话虽如此,人类判断仍然是评估候选人是否适合公司文化或是否符合客户标准的关键。

随着AI在招聘、辅导、绩效管理以及其他劳动力决策中日益深入嵌入,当AI辅助的决策导致不公平或错误结果时,责任应如何划分?

当人类仍是最终决策者,而招聘工作流包含透明度、可解释性和严格的偏差测试时,AI的责任仍然存在。我们推出了FAIR™模型,以推动负责任的AI实践。它的建议包括:

  • 无偏见:测试偏差并使用正确的统计度量——如4/5规则、错误率平衡以及其他相关偏差测试——以确保结果公平。
  • 有效性:AI驱动的证据基于实际数据,并与其旨在预测的结果相连。
  • 可解释性:拥有清晰的文档和工具来解释结果,说明AI对候选人的识别以及这些识别如何影响其评分。
  • 包容性:这意味着确保候选人在整个流程中得到公平对待,从申请到决策。它是对招聘体验的端到端视角——包括人员、流程、技术以及协同工作的AI。

展望未来,您是否预期AI主要会成为HR系统内部的决策层,还是其更重要的角色是对话式的,帮助候选人和员工更好地了解机会、发展技能并规划职业道路?

即使是最先进的技术也需要人类的触感、判断和监督。AI的作用是支持整个流程,确保每位候选人都有公平、平等的机会被考虑。在Sapia,我们称之为“人机协同”方法,即将人类与机器智能相结合,打造预测性、负责任且个性化的智能聊天体验。为此,我们让客户参与进来,持续验证准确性和公平性,同时让我们的AI模型随时间演进。

我们的人工方法同样体现在我们为候选人提供的服务中。我们最近推出了 Phai,这是一款充当导师的职业教练,为求职者提供个性化指导、优势映射和面试准备,帮助他们自信地迎接下一次机会。这是一款积极的工具,能够让候选人在面试结果之外保持动力。

感谢这次精彩的采访,想了解更多的读者请访问 Sapia.ai。

安托万是一位富有远见的领导者,也是 Unite.AI 的创始合伙人。他怀着坚定的热情,致力于塑造和推动人工智能与机器人技术的未来。作为一名多次创业的企业家,他相信人工智能将像电力一样深刻地改变社会,并经常热情地谈论颠覆性技术和通用人工智能(AGI)的潜力。

作为一名未来学家,他致力于探索这些创新将如何塑造我们的世界。此外,他还是 Securities.io 的创始人。该平台专注于投资正在重新定义未来、重塑整个行业的前沿技术。