Anderson 视角

不礼貌的查询可能会增加企业ChatGPT的成本

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

ChatGPT的回答在您对它不礼貌时会消耗更多的令牌,从而增加您的企业账单;但是,说“请”可以减少您的成本。

 

人们常说,礼貌不花钱;但是,不礼貌的成本是多少呢?根据美国的一项新研究,企业ChatGPT的成本会因不礼貌的查询而增加。该研究发现, 即使对礼貌和不礼貌查询的回答相同,不礼貌的查询也会增加响应的成本。

作者指出:

‘输出令牌的价格为每100万输出令牌12美元。我们发现,不礼貌的提示会多产生超过14个额外的令牌,这相当于每个提示平均增加0.000168美元的成本。OpenAI的API每天的查询超过22亿次。’

‘与所有提示都很礼貌的情景相比,当提示不礼貌时,这会每天产生额外的369,000美元的收入,只是因为不礼貌的提示会在结果中产生更多的令牌。’

虽然这个结果本身很有趣,但作者强调,这种不寻常的行为可能表明人类和AI配置中存在各种未知的怪癖,其中一些可能具有财务影响。至于为什么粗鲁的语言会使客户多付令牌,作者没有进行猜测。

为了验证这种现象的真实性,研究人员重写了真实的ChatGPT提示,交替改变礼貌的值,同时保留含义。两种版本都被输入到GPT-4-Turbo中,测量响应中使用的输出令牌的数量,并将两者之间的差异视为语气影响(令牌)成本的衡量标准。

今年早些时候,Sam Altman抱怨说,对ChatGPT礼貌可能会使OpenAI损失数百万美元,因为处理礼貌相关的令牌(如“请”)会浪费电力。同期发表的研究也表明,礼貌在获得更好答案方面没有价值(尽管它没有评论更便宜的答案)。

如果这篇新论文的结论是正确的,那么任何遵循这种思维方式的企业ChatGPT用户在2025年将比那些在ChatGPT交互中表现出最低礼貌的用户花费更多的钱。

作者建议,一种可能的解决方案是对响应设置令牌上限,尽管这不是LLM系统可以轻松实现的方法。他们观察到,提示是一个弱的成本控制工具,因为LLM难以遵循显式的长度指令。在大多数情况下,这个“限制”指令不会被遵守;此外,响应可能会被截断,因为这种LLM基本上是在猜测句子/段落中的下一个可能的单词,并且不知道故事如何结束,直到处理完成。因此,它们有限地能够“结束”任何正在进行的机制。

由于没有确切的解决方案(尽管建议在这种情况下应强制实施更透明的定价方法),作者得出结论:

‘传统的智慧表明,提示礼貌在与LLM交互时是不必要的。’

‘相反,我们的工作表明,不礼貌的提示会增加输出令牌,从而为企业AI采用者带来额外的成本。’

这篇题为《企业AI采用成本透明度》的新论文来自爱荷华大学的三位研究人员。

方法

该系统的数据来自WildChat数据集,该数据集包含100万个用户与ChatGPT的对话,拥有超过250万次交互:

WildChat项目的支持网站,ChatGPT交互的可搜索示例。来源:https://wildvisualizer.com/

WildChat项目的支持网站,ChatGPT交互的可搜索示例。 来源

作者指出,WildChat包含比一些更精心策划的集合中更多的自然交互。

他们从集合的GPT-4交互中选择了20,000个英语提示,丢弃了每个提示的输出(因为他们的目的是再次输入这些提示以获得新响应)。即使在更长的交互中,也只选择了第一个交互,

所得集合被过滤为“礼貌”或“不礼貌”类别,所有提示都由GPT-4-Turbo进行分类。研究人员使用模型本身来决定一个提示是否礼貌,因为模型对礼貌性的感知对于实验至关重要。

被标记为“礼貌”的提示可能包括明确的提示,例如“请”,或以更间接的方式礼貌。任何未被识别为“礼貌”的内容都被归类为“不礼貌”,即使措辞是中立的,而不是对抗性的。

为了研究模型如何对礼貌性做出反应,无法使用标准方法(即将文本视为一组可测量的特征);因为礼貌性嵌入在措辞本身,所以将提示总结为一组特征将会丢失重要的上下文:

相反,每个提示都被重写以反转其语气,同时保留其他元素尽可能相似,使得可以比较仅在礼貌性方面不同的对:

礼貌和不礼貌提示如何转换为其反事实版本,同时保留语义含义。

礼貌和不礼貌提示如何转换为其反事实版本,同时保留语义含义。 来源

测试

每个原始提示都与一个仅在礼貌性方面不同的重写版本配对,并将两种版本提交给同一个GPT-4-Turbo模型,通过单独的API调用。每个版本的响应中产生的令牌数量被记录下来,两者之间的差异被视为语气影响(令牌)成本的衡量标准:

温度被保持恒定,以防止随机变化,并且仅当重写改变输入最多五个令牌时,才保留提示对。这样可以确保被研究的效果源于语气,而不是更广泛的措辞变化:

摘要统计显示,礼貌的提示平均比不礼貌的提示产生更少的输出令牌,尽管它们的输入令牌略多。

摘要统计显示,礼貌的提示平均比不礼貌的提示产生更少的输出令牌,尽管它们的输入令牌略多。

第一轮测试的主要结果表明,使用礼貌的提示会将输出令牌长度减少14.426个令牌:

估计结果,概述礼貌提示格式对生成的输出长度(令牌)的影响。

估计结果,概述礼貌提示格式对生成的输出长度(令牌)的影响。

分析在三个礼貌提示的子集上重复,以测试强度:使用明确标记的提示,例如“请”或“谢谢”;仅使用“请”的提示;以及具有隐含礼貌性的提示,例如“可以”或“可以吗”:

基于礼貌类型的估计结果。

基于礼貌类型的估计结果。

为了验证主要发现的强度,使用LIWC框架进行了提示礼貌性的二次分类,该框架为语言特征提供了一个确定性和可重复的评分。

与GPT的概率分类不同,LIWC可以为每个提示分配一个稳定的礼貌评分,从而可以评估一致性。在此测试部分,提示被标记为“礼貌”如果其LIWC礼貌评分大于零,否则被标记为“不礼貌”。

当LIWC和GPT分类之间的一致性被测量时,观察到81%的匹配率。虽然这不是准确性的衡量标准,但这种协议为系统之间的一致性提供了支持。

当仅分析具有匹配的GPT和LIWC礼貌标签的提示时,礼貌的提示仍然导致输出减少14个令牌;当礼貌性被测量为一个滑动刻度时,每增加一个礼貌性等级,输出就会平均减少五个令牌:

当使用LIWC重新分类时,礼貌性的令牌节省仍然存在,无论是作为二进制标签还是连续评分。

当使用LIWC重新分类时,礼貌性的令牌节省仍然存在,无论是作为二进制标签还是连续评分。

韧性

为了评估礼貌性的影响是否在不同类型的提示中有所不同,每个提示都被分配到几个预定义的任务类别中:信息查找;文本生成;编辑和重写;分类;摘要;和技术任务。

每个提示都被分配一个任务标签,方法是将其嵌入与预定义任务描述的嵌入进行比较,使用all-MiniLM-L6-v2 句子变换器模型。

余弦相似度得分被计算在每个提示和任务定义集之间,分配具有最高相似度的标签。

任务类型然后被用作回归中的控制变量,以测试礼貌性的影响是否因提示类别而异,并且引入了任务和处理之间的交互项,以检查是否存在差异效应。

在两种情况下,礼貌的提示一致地产生更短的输出,并且在任务类型中没有发现任何有意义的变化:

回归结果表明,礼貌的提示在所有任务类型中都减少了输出长度,并且没有发现任何显著的交互作用。

回归结果表明,礼貌的提示在所有任务类型中都减少了输出长度,并且没有发现任何显著的交互作用。


机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai