قادة الفكر

التكنولوجيا وحدها لا تكفي لضمان الاستخدام: دروس من بناء بوت داخلي للذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

مع تسارع استخدام الذكاء الاصطناعي في مختلف القطاعات، بدا استخدام بوت محادثات لدعم تطبيق داخلي جديد كان قرارًا منطقيًا. ومع ذلك، كان التطبيق نفسه يتحدي التوقعات التقليدية للمستخدمين. فقد قدم تدفقات عمل جديدة مبنية على تكنولوجيا ناشئة غير مألوفة لمعظم المستخدمين.

为了减少摩擦并改善采用率,聊天机器人被设计为回答有关应用程序和底层技术的问题。目标是帮助用户了解不仅要做什么,还要了解系统为什么会以这种方式运行。我们相信,提供上下文解释将加速学习并减少混淆。

从一开始,人工智能代理就被设计为一个有限范围的解决方案。它被严格设计为支持文档并提供用户帮助。从概念上讲,聊天机器人被设计为传统常见问题解答文档的动态替代品,提供一个对话式、可搜索和持续可用的界面,具有超越静态内容的扩展功能。

为了将代理集成到组织的内部聊天环境中,我们需要了解结构化消息如何呈现,会话历史如何存储以及系统如何在线程中识别参与者。这使我们能够确定开始处理用户问题所需的核心变量。

Grounding the Model: From Hallucination to Reliable Context

大型语言模型很强大,但如果没有上下文锚定,它们容易出现幻觉。为了解决这个问题,我们实施了一种 向量嵌入技术

用户指南、内部文档和产品愿景被转换为文本的数值向量表示。这些嵌入捕获了语义含义,允许系统匹配概念,而不是依赖于简单的关键字匹配。

当用户提出问题时,系统将查询转换为 向量表示,并将其与存储的嵌入进行比较。它检索最语义相关的文档,并将它们注入模型的提示中。然后,模型生成一个基于这些特定文档的响应,通常总结相关信息。

这种方法显著提高了响应的准确性。系统不再仅仅基于一般知识生成答案,而是使用我们组织自己的文档作为上下文来响应。

The Hidden Complexity of Context Management

将会话历史包含在提示中以便机器人解释后续问题并保持连续性是至关重要的。没有历史,交互变得零碎和重复。用户通常会逐渐完善他们的问题,而没有上下文,机器人就无法解释诸如“该选项”或“上一步”之类的引用。

然而,包含太多历史会产生另一个问题: 令牌限制。这些发生在语言模型截断超过其最大 上下文窗口 的输入时。如果问题或对话变得太长,重要信息可能会丢失。这不会产生明确的错误,而是降低响应质量或影响检索准确性。

为了减轻这一点,我们实施了控制提示大小、优先考虑相关内容和监控问题长度的策略。我们尝试了总结较旧的消息和仅选择对话中最相关部分的方法。上下文至关重要,但必须谨慎管理。

Expanding Capabilities and Creating Confusion

除了回答基于文档的问题外,我们还通过添加 后端函数 扩展了机器人的功能,这些函数可以直接从应用程序中提取某些公共信息。这使用户能够在不登录应用程序的情况下从聊天中检索数据。该想法是减少摩擦并强化聊天机器人作为一个有用的界面,而不仅仅是一个静态的知识层。

然而,这一扩展却让一些用户感到困惑。一旦机器人开始检索实时数据,用户就开始要求它执行需要在平台内直接交互的操作。他们假设聊天机器人可以替代操作步骤,包括需要在平台内进行身份验证或故意执行的步骤。

机器人从未被设计为执行这些操作,但信息支持和操作执行之间的区别并不总是明显。

将实时数据集成还引入了新的技术考虑因素。我们需要定义何时应通过基于嵌入的检索处理问题,何时应触发后端调用。该决策逻辑需要仔细设计。另外,我们需要调整响应以优雅地处理技术异常并避免将原始系统错误暴露给用户。

Multilingual Capability Is Not Automatic

在测试过程中,我们意识到机器人在英语中的性能始终优于Jalasoft内部使用的其他语言。主要原因是结构性的:用于生成嵌入的大多数文档都是用英语编写的,我们选择的嵌入模型针对英语语义相似性进行了优化。

它不支持跨语言检索或语义比较。因此,非英语查询通常会检索出不太相关的文档,从而导致较弱的响应。

这凸显了一个重要的洞察:多语言功能不是自动的。

When Expectations Expand Beyond Scope

为了控制使用成本,我们实施了每日限制,限制用户可以提出的问题数量。然而,我们没有明确限制这些问题的范围。用户可以自由地提出任何问题。

这种开放性导致了意外的使用模式。一些用户开始与机器人进行个人或探索性交互,这与应用程序无关。随着时间的推移,期望超过了机器人的预期作用,导致用户希望它能够做什么和它被设计为支持什么之间出现了差距。

这种误alignment逐渐降低了其感知到的有用性。使用量下降,聊天机器人最终被弃用,努力转向重新设计应用程序本身,使其更直观,易于使用。

The Real Lesson: Interaction Design.

从工程角度来看,系统运行得相当好。它检索文档,包含会话历史,通过嵌入减少了幻觉,处理了后端调用,并管理了提示大小。架构如预期运行。

但它缺乏故意的交互设计。

机器人没有清晰地塑造对话。它没有一致地强化其范围。它没有通过结构化示例指导用户了解它可以和不能做什么。它回答了问题,但它没有设定期望。

我们了解到,会话式人工智能系统需要的不仅仅是强大的模型和结构化数据。它们需要仔细设计的期望。用户需要对代理的角色、其边界和其优势有明确的了解。系统必须主动提供示例提示,阐明限制,并一致地重定向超出范围的问题。

没有这种故意的框架,即使技术上合理的实现也可能难以维持价值。用户可能会高估其功能或在未满足隐含期望时脱离。

核心见解很简单但很强大。

Building conversational AI is not only a technical challenge. It is also an interaction design challenge.

强大的上下文、准确的检索和强大的架构是必要的,但不充分。系统的有效性同样取决于它如何定义其角色、传达其边界和塑造用户期望。

技术本身并不能保证采用。清晰的交互设计可以。

أنجي نافيا هي مطور تطبيقات كامل في جالاسوفت مع خمس سنوات من الخبرة في بناء تطبيقات الإنتاج وتكامل قدرات الذكاء الاصطناعي في حلول البرمجيات. أكملت تخصص آي بي إم في الذكاء الاصطناعي التوليدي لمطوري البرمجيات وتطبق أدوات الذكاء الاصطناعي في تدفق عملها اليومي.