思想领袖
当 AI 像人类一样思考:探索 LLM 和 Agent 的思维

今天,LLM 和 Agent 通过学习、分析和决策的方式模糊了它们的算法性“思考”和人类思维之间的界限。它们的构建方式已经模仿了我们的认知过程,它们的训练规模远远超过了人类的经验。这引发了一个问题:我们是否正在创造一种能够扩展我们能力的工具,还是我们正在创造一种新的思维方式,其后果仍然无法预测?
模型如何思考
区分 LLM 和 Agent 的概念是很重要的。可以用计算机来类比,LLM 可以被比作计算机的一个组件,例如处理器。然而,Agent 是整个系统,一个“主板”,连接着各种模块:内存、显卡和网络。同样,Agent 是一个复杂的系统,可以包含一个或多个 LLM,配备决策机制和与外部环境交互的工具。
如果我们考虑单个 LLM 的工作,它都归结为模式匹配。然而,当 Agent 将多个 LLM 链接在一起时,我们可以说它“思考”,尽管这个过程仍然建立在模式上。Agent 构建模型之间的逻辑交互:例如,一个 LLM 分析任务,基于此分析,Agent 确定另一个 LLM 应该执行什么操作。
人类的思考方式与此类似:我们依赖于积累的知识和模式,在合适的时刻选择它们,处理它们,并得出结论。这个过程被称为推理。
ChatGPT 像人类一样,有短期和长期记忆。不同的是,人类的记忆访问更复杂,不总是线性。
短期记忆是我们当前正在处理的信息。对于一个人来说,它可能是五分钟前说过的话:他们可能记得,也可能不记得。然而,GPT 总是考虑其“上下文窗口”内的所有信息:它不能跳过或忽略这些数据。
长期记忆在人类中由不总是活跃的记忆组成,可能只会在特定触发器下出现:童年记忆、创伤,或者例如与心理学家合作。GPT 有类似的逻辑:它不会在没有特定激活的情况下“回忆”信息。例如,“永远不要再问我这个问题”或“总是正式地称呼我”这样的指令可以存储在长期记忆中,并在每次会话中应用。
长期记忆的另一个例子是保存的文档。假设您将一份进行市场研究的指令上传到 GPT。模型可以将其存储在内存中,但这并不意味着它会在每个问题中引用该文档。如果您问:“你能用手电筒照亮月亮吗?”GPT 会忽略该指令。但是,如果请求包含与文档文本匹配的关键字,模型可以“回忆”它。
这种机制是通过 RAG(检索增强生成) 实现的,这是一种模型通过相关线索触发存储信息的方法,使用向量数据库。
因此,可以说模型确实具有记忆,但其逻辑与人类记忆不同。
为什么与 AI 交谈有时会感到治疗,有时会感到冷漠和机械
现代语言模型非常庞大:它们存储了大量的数据、知识和上下文。所有这些信息都组织成所谓的“集群”,主题和语义区域。模型是在多样化的来源上训练的,包括虚构作品、科学文章和 YouTube 评论。
当您与 AI 交互时,您的查询(提示)有效地将模型引导到某个集群。
例如,如果您写道:“你是一位在纽约拥有 20 年经验的房地产律师,帮助我购买一套公寓”,模型同时激活了多个集群:律师 → 纽约 → 房地产。因此,您会收到一个连贯、相关且真实的回应,就像您真的在咨询一位经验丰富的专业人士一样。
如果查询涉及更个人或哲学的主题,例如自我发展或情感,模型“转移到”其他集群,例如心理学、哲学或内心工作。在这种情况下,其答案可能看起来出乎意料地像人类,甚至具有治疗效果。
然而,过于一般或模糊的措辞会使模型在其集群结构中“迷失”,并给出默认的、正式的、缺乏情感色彩的回应。
AI 的回应风格和深度取决于您用提示将其引导到的集群。
模型训练和 RLHF 的哲学
人工智能有不同的学习方法。这不仅仅是一种哲学,而是一种策略。
经典的选择是有监督学习,模型被给予问题和正确答案。它通过观察什么是正确的,然后在未来复制类似的解决方案来学习。
但另一种方法是 RLHF(从人类反馈的强化学习)。这是一个不同的风格:模型尝试某事,收到成功行为的“奖励”,并调整其行为。逐渐地,它发展出了一种有效的策略。
RLHF 可以被比作将原材料转化为成品的过程。要制作一个方便使用的模型,需要大量的人类反馈工作。
想象一下,我向你展示一个没有直接命名的物体。你犹豫不决:“它是一个香烟盒?一个名片夹?”我只给出提示:“更接近”,“更远”,“60% 是”。
LLM 通过这种方式进行训练。人类、注释者和专业人士一般会评估:这个答案是好的,这个答案是坏的,并分配分数。专门从事高质量数据注释和验证的公司,如 Keymakr,在此过程中发挥着关键作用。反馈也来自普通用户:点赞、投诉和反应。模型解释这些信号,形成行为模式。
模型训练的实践
一个生动的例子是 OpenAI 使用强化学习训练 Agent 的实验,游戏是“躲猫猫”。
有两支队伍参加:寻找者(红色)和躲藏者(蓝色)。规则很简单:如果寻找者抓住躲藏者,他们就能得分;如果没有,他们就失去一分。最初,Agent 只有基本的物理能力,例如跑和跳,没有预定义的策略。
一开始,寻找者表现得很混乱,抓住对手只是偶然发生的。但是在数百万次迭代之后,他们的行为演变了。躲藏者开始使用周围的物体来阻挡门并建造屏障。这些技能是在没有直接编程的情况下出现的,仅仅是通过重复的尝试和成功的奖励。
作为回应,寻找者开始使用跳跃,这是一种从一开始就可用的能力,但之前被忽略了。在一系列失败之后,跳跃的随机使用揭示了其战术价值。然后躲藏者进一步加强了他们的防御,移除了寻找者的视线中的物体,并建造了更可靠的庇护所。
实验表明,通过数十亿次试验、错误、奖励和惩罚的循环,复杂的合作行为可以在没有开发人员干预的情况下形成。另外,Agent 开始协调行动,尽管通信机制没有被编程,但仅仅是因为团队合作被证明更有效。
这与大型语言模型相同。编写所有场景的脚本是不可能的:世界上有太多情况和太多的变异性。因此,我们不教模型固定的规则;我们教它如何学习。
这就是 RLHF 的价值所在。没有它,LLM 和 Agent 只是一个文本库。有了它,它就变成了一个能够适应、纠正自己并基本上进化的对话伙伴。
接下来是什么
很多人想知道 LLM 和 Agent 的发展是否会带来不良或甚至危险的后果。
重要的是要理解我们今天看到的并不是最终产品的 MVP,而只是一个原型。
真正的革命不会是帮助写一封漂亮的信或将其翻译成法语。这些都是小事。主要方向是自动化微任务和常规流程,让人类只处理真正创造性的、智力的任务或休息。
真正的创新围绕着 Agent 展开,Agent 是可以独立思考、行动和做出决定的系统,而不是人。正是这里,像 OpenAI、Google 、Meta 和其他公司今天都在专注于此。
大型语言模型只是基础。真正的未来在于能够在动态世界中生活、接受反馈和适应变化的 Agent。












