观点
最糟糕的第一个代理工作是最显眼的那个

公司通常会以相同的方式选择第一个代理工作。有人会问人工智能可以为我们做什么,然后整个房间都会集中在每个人都可以想象的工作上:写我们的博客文章,回答我们的客户,处理我们的收件箱。这是建筑物中最显眼的工作,因此它是大家想到的工作。
六个月后,试点项目被悄悄地搁置,结论是技术还不够成熟。技术是没问题的,问题出在工作选择上,显眼性使其成为一个糟糕的选择。
三个使工作变得困难的因素,显眼的工作都具备这三个因素
对于代理来说,工作容易时,有一个可检查的正确答案,输出不佳的成本较低,并且建筑物中已经有人在做这项工作,可以轻松判断好坏。
面向客户的写作无法通过第一个测试。
没有“这篇博客文章好不好”的正确答案,只有一个人持有的偏好,这个人可以瞬间认出错误版本,但在事先很难指定正确的版本。这种差距是大多数质量投诉的来源。
面向客户的任何工作都无法通过第二个测试。
内部摘要不佳的成本是四分钟,而对客户的回复不佳的成本可能是一段关系,甚至是一次合规对话。失败的成本决定了工作需要多少监督,而监督是运行代理的昂贵部分。
通常,显眼的工作在第三个测试中以一种没有人注意到的方式失败,直到很晚才意识到。
能够判断输出结果的那个人是一个高级人员,他们的注意力是公司中最稀缺的资源。给他们一个审查队列意味着要将工作转移到最昂贵的日历上。
成功的第一个工作是什么样的
它们很枯燥。这是一个模式,足够一致,可以据此进行规划。
当NTT DATA Group将代理工具扩展到整个组织时,是内部工程工作,而不是客户体验。OpenAI的部署描述了复杂事件分析的自动化,这项工作以前需要五名经验丰富的工程师,花费三天,现在可以在30分钟内完成。结果,写道,“迅速获得了高级领导的关注,并成为早期的证明点”。
看看工作的形状,而不是标题数字。事件分析有一个正确的答案,这个答案组织可以检查,因为工作已经存在,之前做这项工作的人仍然在那里。
它重复出现。它位于公司内部系统中,而不是面向客户。并且“完成”的标准是分析是否经得起证据的检查,这是一个有理有据的答案,而不是个人喜好问题。
将其与大多数公司首先提名的工作进行比较。博客文章没有正确的答案,没有内部裁判(时间很贵),并且面向客户。
顺序同样重要。NTT DATA首先在整个公司范围内推出了ChatGPT Enterprise,并且在内部调查中,超过96%的受访者表示对其感到满意,超过95%的受访者报告了生产力提高。
通过这种日常使用,写道,“员工们建立了使用人工智能进行研究、写作和内容创作的经验”——并且这些习惯“为组织做好了准备,以便委派明确定义的任务”。
发表的领导经验与案例研究一致:让人工智能成为日常工作的一部分,帮助人们建立与其合作的习惯。公司在将事件分析工作交给代理之前,已经在广泛的基础上熟悉了人工智能输出。
这种习惯形成阶段比看起来做的更多。当一般人工智能工具变得普通时,,我的理解是,这是好工作的候选者出现的地方——来自做这项工作的人,而不是来自规划会议。这也是怀疑论被解决的地方,,这并不是单个高风险项目可以解决的。
例外证明了规则,如果你读了整个案例
明显的异议是,面向客户的代理确实有效。它们确实有效。值得仔细阅读其中一个。
是代理工作中最显眼的工作之一——全天候多语言支持,通过语音和文本指导购物者从产品发现到购买决策。在山田电机在线商店的为期两周的公开活动中,大约有30,000人使用了它,92%的调查回复都是积极的。真实的结果,真实的客户,前厅。
值得明确一点:OpenAI的写作将其称为“其将这些经验直接带给客户的首次重大机会”。所以,这是Avatarin的第一个面向客户的代理工作,这听起来像是对上述所有内容的反驳。
看看“这些经验”指的是什么。Avatarin是一家人工智能客户服务公司,来自全日本空输株式会社,并且在山田电机项目之前已经与OpenAI合作,使用OpenAI API进行语音识别、查询分析和员工培训。
代理的答案由增强生成系统提供依据,这意味着响应是基于实际产品信息而不是模型的记忆。零售商的客户服务知识被故意编码到对话流程和提示中。防护措施有助于保持对话的购物体验。并且OpenAI与团队合作,结构化提示并降低运行全天候语音服务的成本。
所以,这是一个客户面向的第一份工作,来自一家整个业务都是人工智能客户服务的公司,之前已经与同一供应商的工具合作过,具有基础层,编码的领域专业知识,防护措施和供应商自己的人员帮助。这些才是显眼工作的真正成本,而几乎没有任何成本是可见的。
将两个账户一起阅读,它们是顺序的教训,而不是两个成功的故事。一个组织通过让人工智能成为日常工作的一部分,获得了委派明确定义的工作的权利。另一个作为专家,通过之前已经完成的组件工作,达到了面向客户的工作。两个组织都没有从规划会议想要开始的地方开始。
选择规则
在选择之前,先评估每个候选工作的四个问题。
1. 是否有一个可检查的正确答案?
不是一个好的答案,而是一个正确的答案。对账、分类、提取和分析等都合格。任何基于口味的判断都不合格,至少不是首先考虑的。
2. 一个糟糕的输出结果的成本是什么?
如果答案涉及客户、监管机构或文件中的数字,工作需要,您几乎可以肯定还没有建立这些。
3. 体积是否证明了设置的合理性?
每月做两次的工作永远不会收回迭代的几周时间。经济效益来自重复,而重复也教会了您哪里出了问题。
4. 谁已经在做这项工作,并且可以瞬间判断出坏的结果?
那个人就是您的审查者,他们需要有时间。如果唯一合格的裁判是创始人,请选择不同的工作。
满足所有四个条件的工作几乎从来不是会议上提出来的工作。通常是团队已经手动做了两年的事情,并且已经不再抱怨它,因为他们不再把它当作工作。
这将您带到哪里
本周诚实地评估您正在考虑的工作清单。获胜的候选者会让您感到失望。无论如何,请自动化它。
第一个代理工作的目的是不是它带来的价值。它是让您的组织了解这些系统的优缺点、哪里会出错以及实际监督成本,尤其是在错误可以接受的工作中。这种知识使第二个工作成为真正的决定,而不是猜测,第三个工作通常是赚钱的地方。
选择枯燥的工作。赢得显眼的工作。












