AGI 与未来 AI
GPT-4 是否是实现通用人工智能的飞跃?
微软最近发布了一篇研究论文,题为:通用人工智能的火花:GPT-4 的早期实验。正如微软所述:
本文介绍了我们对 GPT-4 早期版本的研究,当时它仍在由 OpenAI 进行活跃开发。我们认为(这个早期版本的)GPT-4 是一组新的大型语言模型(LLM)的代表(包括 ChatGPT 和 Google (GOOGL ) 的 PaLM),它们比以前的 AI 模型表现出更广泛的智能。
在这篇论文中,有确凿的证据表明 GPT-4 远远超出了简单的记忆,并且它对概念、技能和领域有着深刻而灵活的理解。事实上,它的泛化能力远远超过了今天任何人类的能力。
虽然我们之前讨论过 通用人工智能的益处,但我们应该快速总结一下通用人工智能系统的普遍共识。从本质上讲,通用人工智能是一种可以跨多个领域泛化并且不是狭隘的智能。狭隘智能的例子包括自动驾驶汽车、聊天机器人、国际象棋机器人或任何其他为单一目的而设计的 AI。
相比之下,通用人工智能可以灵活地在任何上述领域或其他领域之间切换。它是一种可以利用新兴算法(如 迁移学习 和进化学习)并利用传统算法(如 深度强化学习)的智能。
上述通用人工智能的描述与我个人使用 GPT-4 的经验以及微软发布的研究论文中的证据相符。
论文中提出的一个提示是要求 GPT-4 以诗歌的形式证明素数的无限性。

如果我们分析创建这样的诗歌的要求,我们会意识到它需要数学推理、诗歌表达和自然语言生成。这是一个挑战,超出了大多数人的平均能力。
该论文旨在了解 GPT-4 是否只是基于一般记忆而产生内容,还是能够理解上下文并进行推理。当要求它以莎士比亚的风格重写一首诗时,它能够做到。这需要一个多方面的理解水平,远远超过了普通人的能力,并包括心智理论和数学天才。
如何计算 GPT-4 的智能?
问题变成了如何衡量大型语言模型的智能?GPT-4 是否表现出真正的学习行为,还是只是简单的记忆?
目前测试 AI 系统的方法是评估系统在一组标准基准数据集上的性能,并确保它们与训练数据无关,并且涵盖了各种任务和领域。由于 GPT-4 的训练数据量几乎无限,这种测试几乎是不可能的。
论文讨论了生成新颖且具有挑战性的任务/问题,以令人信服地证明 GPT-4 远远超出了简单的记忆,并且它对概念、技能和领域有着深刻而灵活的理解。
在智能方面,GPT-4 可以生成短篇故事、剧本,并且可以计算最复杂的公式。
GPT-4 还可以在很高的水平上编写代码,既可以根据指令编写代码,也可以理解现有的代码。GPT-4 可以处理从编码挑战到现实世界应用的广泛编码任务,从低级汇编到高级框架,从简单的数据结构到复杂的程序,如游戏。GPT-4 还可以推理代码执行,模拟指令的效果,并以自然语言解释结果。GPT-4 甚至可以执行伪代码,
GPT-4 可以对几乎任何提示做出合理的响应。事实上,其智能几乎以其复杂性而不可战胜。
GPT-4 的局限性
论文接着描述了他们如何探测 GPT-4 的响应和行为,以验证其一致性、连贯性和正确性,并揭示其局限性和偏见。
最明显的局限性是它的 幻觉倾向。论文中给出了一个幻觉的例子,GPT-4 对其答案充满信心,但实际上是完全错误的。

似乎 GPT-4 本身也理解这种当前的局限性,因为当我问它什么是 GPT-4 幻觉时,它给出了以下回应:
GPT-4 幻觉是指像您当前正在交互的这种生成式预训练变换器(GPT)模型产生的响应不基于事实信息或与提供的上下文不一致。这些幻觉发生在模型生成看似合理但实际上不正确、误导性或无意义的文本时。
换句话说,当您在世界数据上训练一个大型语言模型时,如何避免系统学习错误数据?一个大型语言模型学习和重复虚假信息和阴谋论,实际上可能是人类面临的大型语言模型大规模采用所带来的最大威胁之一,这也是讨论通用人工智能的危险时常常被忽略的。
GPT-4 的智能证明
论文表明,无论向 GPT-4 提出什么复杂的提示,它都能超出预期。如论文所述:
其在自然语言方面的无与伦比的掌握。它不仅可以生成流畅、连贯的文本,还可以以各种方式理解和操纵文本,例如总结、翻译或回答极其广泛的问答。另外,所谓的翻译,我们指的是不仅仅是不同自然语言之间的翻译,还包括语气、风格和领域(如医学、法律、会计、计算机编程、音乐等)的翻译。
对 GPT-4 进行了模拟的技术审查,它轻松通过,这意味着如果这是一个人类在另一端,他们会立即被聘为软件工程师。GPT-4 在多州律师考试中的初步测试显示出超过 70% 的准确率。这意味着我们可以自动化目前分配给律师的许多任务。事实上,有一些 初创公司正在使用 GPT-4 创建机器人律师。
产生新知识
论文中的一个论点是,GPT-4 要证明真正的理解水平,唯一剩下的就是产生新知识,例如证明新的数学定理,这目前仍然是大型语言模型无法达到的。
然而,这是通用人工智能的圣杯。虽然在错误的控制下使用通用人工智能存在危险,但通用人工智能能够快速分析所有历史数据以发现新的定理、治愈方法和治疗方法,其益处几乎是无限的。
通用人工智能可以成为找到罕见遗传病的治愈方法的缺失环节,这些病症目前缺乏私营部门的资金支持,可以彻底治愈癌症,并最大限度地提高可再生能源的效率,以消除我们对不可持续能源的依赖。事实上,它可以解决任何输入到通用人工智能系统的问题。这是 Sam Altman 和 OpenAI 团队所理解的,通用人工智能确实是最后一个需要解决大多数问题和造福人类的发明。
当然,这并没有解决核按钮问题,即谁控制通用人工智能及其意图是什么。无论如何,这篇 论文 做了很好的工作,证明 GPT-4 是实现自 1956 年以来人工智能研究人员梦想的飞跃,1956 年,达特茅斯夏季研究项目人工智能夏季研讨会首次启动。
虽然可以争论 GPT-4 是否是通用人工智能,但可以轻松论证,它是人类历史上第一次拥有可以通过 图灵测试 的 AI 系统。












