Anderson 视角

新 AI 根据您过去的对话预测您的下一句话

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT Image 2): street scene showing a woman in a beige coat looking at her smartwatch beside an orange notification reading 'You regretted your last rushed purchase', with blurred pedestrians and shopfronts in the background, enclosed within a distressed yellow-and-black border labeled 'AI FANTASY INSIDE' and 'REALITY OUTSIDE' with arrows and hazard markings.

MIT的研究人员开发了一种基于大语言模型的系统,能够从数周的真实对话中学习重复模式,以预测其可能的下一次对话行为。

 

如果 AI 能够 真正 访问你的生活,并且能够 真正 被允许在一个延长甚至持续的时间内了解你,它很可能会学习预测你的行为、决策——甚至是你可能说的下一句话;这一切都基于它从数千小时的交互分析中吸收的内容。

我们这些已经习惯使用大型语言模型(LLM)如 ChatGPT 和 Claude 的人,早已注意到这种“预判需求”的倾向,显然是基于我们的使用历史;并且,大概也对其表示欢迎,因为记忆保留和上下文现在已成为 与 AI 系统建立工作关系时的关键摩擦点

然而,向一家营利性公司运营的 AI 系统提供 临时的 甚至是 “实时流媒体”式的个人生活和通讯信息,合理地说是一种 潜在的隐私与安全风险;虽然该服务对用户会更有用,但公司出于商业动机分享你的数据的诱惑,加上尴尬的公开 在线泄露数据外泄 的风险,可能会使这种 AI 与人类的深度融合变得不明智。

如果我们能拥有美好事物……

好吧,我必须先把那句“公共服务警告”说完,才能继续讨论来自 MIT 的 一篇有趣的新论文——它似乎设想了一个更好的世界,在那里此类数据可以被封闭在安全且真正值得信赖的圈子中,从而让分析型 AI 的真正力量用于个人的真实利益。

该新工作提出了一个系统:在获得用户许可并由用户控制所获取的数据的前提下,佩戴的智能手表持续记录他们的对话,以挖掘行为模式:

From the new MIT paper, an illustration of the proposed behavioral prediction pipeline. Conversations collected over several weeks reveal a recurring behavioral pattern, which is then used to predict the user's likely next behavior and deliver a smartwatch reminder before the anticipated action occurs. Source - https://arxiv.org/pdf/2608.13454

From the new MIT paper, an illustration of the proposed behavioral prediction pipeline. Conversations collected over several weeks reveal a recurring behavioral pattern, which is then used to predict the user’s likely next behavior and deliver a smartwatch reminder before the anticipated action occurs. Source

该论文题为 Before You Say It: Anticipating Verbal Behavior from Longitudinal Everyday Conversations with LLMs,记录了一项实验:通过智能手表收集了 14 名参与者在数周内的 1,000 多小时自然(即机会性、真实世界)对话,随后进行转录、转换为结构化行为历史,并提供给 Gemini 2.5 Pro,配合行为特定的提示和提取的行为规则,以预测每位用户可能的下一次对话行为。

(现在可能已经明白为什么这篇新论文 需要一些关于隐私的背景说明)

这项新研究实际上是作者们先前 2026 年的 Mind Mapper* 发表的现场实验的延伸,通过将理论付诸实践,并检验所挖掘的行为模式是否真的能够实时预测用户的下一次对话行为,而不仅仅是描述重复倾向。

四位作者声明:

“我们的结果显示,从纵向对话中挖掘的情境特定行为模式能够显著提升对用户语言行为倾向的预测。我们方法的关键优势在于将这些模式表示为可供人类阅读的、带有明确例外条件的上下文条件行为模式,用户可以检查并进行微调。”

“参与者重视这种透明度,许多人欣赏能够阅读、纠正并为其推断的模式设定个人目标。”

“参与者还反思了自身改变行为的策略,暗示主动系统可以通过重新引导注意力、提供替代方案以及呈现与其目标相关的重新框架来提供帮助。”

“这指向一种与用户协同工作的预判 AI——将干预基于用户能够识别且已证实有效的模式。”

方法

前述的 Mind Mapper 是新系统的基础,提供了一套工作流,旨在从数周的智能手表记录的对话中学习重复的行为规则,而不是直接预测未来的言语或基于通用或已有数据集进行预测。在 Mind Mapper 工作流中,所有记录的对话均被转录、匿名化,并通过多阶段的 GPT-5 流水线** 进行处理。

(请注意,由于旧论文的保护措施,我们无法像往常一样提供其图片,因为公开的低分辨率版本难以辨认)

Illustration of the behavioral prediction pipeline. Conversations collected over several weeks are converted into context-dependent behavioral rules, which are refined with supporting and contradictory evidence before being applied to new conversations to predict the user's most likely next conversational response.

From the new paper, an illustration of the behavioral prediction pipeline. Conversations collected over several weeks are converted into context-dependent behavioral rules, which are refined with supporting and contradictory evidence, before being applied to new conversations to predict the user’s most likely next conversational response.

该流水线生成候选的 ‘if-then’ 行为规则(即将对话情境与可能的回应关联的规则);搜索支持和相矛盾的证据;合并重叠规则;剔除弱假设;并分配置信度和概率估计。

受试者

十四名说英语的成年人在正常日常生活中佩戴智能手表,持续七至十天。设备内置的语音活动检测器仅在检测到语音时记录受试者的对话,并将 2-3 分钟的音频片段发送至远程服务器进行处理。

参与者获得 100 美元报酬,并且必须告知周围的任何人正在录音,并在每次互动前获得他人的同意。

转录与审查

音频片段使用 Deepgram 的 Nova-3-meeting 模型进行处理,该模型转录对话并区分说话者。随后使用 SpeechBrain 作为说话人验证模型,将参与者的声音与 20 秒的注册样本进行匹配。

spaCy 命名实体识别(NER)模型将任何提及的姓名以及其他个人身份信息替换为匿名占位符。原始音频随后被删除,只有 AES-256-GCM 加密的转录文本保存在智能手表本地。

收集期结束后,参与者可以通过网页界面审阅自己的对话转录,删除任何不希望纳入研究的内容,并在必要时纠正说话者标签或对话上下文。

平均而言,仅有 0.16% 的转录被删除,2.48% 的片段被标记为 误分类,最终得到包含 15,066 条话语的数据集——其中 57% 属于佩戴者,43% 属于其他说话者。平均话语长度为 49 个词。

(然而,尽管论文未涉及此点,但可以假设参与者在佩戴手表时仍相对警惕,以免卷入过于私密的口头交流。)

随后对转录进行进一步清理,去除极短的交流以及常见的口头停顿词如 ‘err’‘um’;并将碎片化的句子合并为完整的话语。这样将最终数据集缩减至 9,901 条话语。

为了评估该方法,要求 Gemini 2.5 Pro 根据截至当时的对话内容预测每位参与者的下一句对话回应。随后将其表现与三种输入进行比较: 仅对话历史;压缩的对话摘要;以及新的 Mind Mapper 行为规则,以直接衡量学习到的模式的贡献。

GPT-5 被用作自动评判器对预测进行打分,另外的人工评估也确认了其评估的可靠性。

数据与测试

测试结果表明,作者的基于模式的方法显著优于基线方法,随着对话数据的累积,准确率持续提升:

Test results comparing three prediction approaches. Left, prediction accuracy improves steadily as more conversational data becomes available only when the system used learns behavioral patterns, while the baseline approaches change little. Right, the same approach achieves substantially higher scores on participant-identified intention-to-change conversations.

Test results comparing three prediction approaches. Left, prediction accuracy improves steadily as more conversational data becomes available only when the system used learns behavioral patterns, while the baseline approaches change little. Right, the same approach achieves substantially higher scores on participant-identified intention-to-change conversations.

作者认为该系统在预测参与者明确想要改变的行为方面尤其有效。

一项包含 40 位独立人工评审员的验证研究证实了自动评估的结果,在 43% 的测试情景中,基于模式的方法排名最高,而完整上下文为 24%,零样本为 18%,叙述性摘要为 15%。

人工评估在 交流意图具体性功能复杂度 三个维度上与模型评分高度一致,作者认为这验证了使用自动评判器评估对话行为的可行性。

两项后续研究测试了人们对其挖掘的模式的反应,以及这些预测是否真的能帮助改变习惯。参与者首先审阅自己的规则并标记想要戒除的行为,数月后再次回访,讨论他们尝试的策略以及哪些助理“提示”在日常生活中真正有帮助。

参与者标记了 114 项想要戒除的习惯,涉及 912 次对话情境。在这些交流上进行测试时,基于模式的方法轻松超出标准方法约 40%;作者认为该系统在预判人们主动想要改变的 根深蒂固 习惯时表现最佳。

作者总结:

“总体而言,我们的发现提供了证据表明,个人特定的语言行为可以从纵向对话数据中被预测。”

“这为未来可能出现的情境感知、预判、主动且个性化的 AI 系统打开了新可能性。”

结论

除非在高度政府监管的应用场景(主要是国家医疗保健和精神病学情境)中,并且不存在任何公开或暗示的强制参与(例如降低州保险费率),否则很难想象有哪种使用此方法的情形不会 危及 参与者的隐私与个人圣洁——尤其是当它与能够将记录的对话数据与个人的数字或其他类型数据关联的代理实体相结合时。

MIT 论文为该方法描绘了一个有趣且略带治疗色彩的情境(例如提供与饮食相关的情境感知提醒),但这种方案更可能吸引广告商、假释与监狱机构、保险公司以及大量其他企业或国家实体的强烈兴趣与投资,它们都想更深入了解我们的想法。

如果曾有一个令人信服的论点支持环绕、完全由用户拥有的 本地 AI,那就是像这样的系统,因为它们在泄露方面的影响极其严重。

话虽如此,近年来广告与监控技术的历史已 倾向于消费者的漠视——这种缺乏关注真的会延伸到如此侵入且无处不在的系统吗?

 

* 一篇更受严格保护的出版物,未公开高分辨率图像,尽管通过一些步骤仍可阅读文本。

** 并非要过度强调,但旧论文获取难度相当大,请务必坚持!

首次发布于 2026 年 8 月 20 日,星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai