AGI 与未来 AI

生成式人工智能的演变:混合专家、多模态和通用人工智能的探索

mm
将 Unite.AI 添加到您在 Google 上的首选来源

2023 年,人工智能(AI)领域经历了巨大的增长。生成式人工智能(Generative AI)是当前研究的重点,专注于创建真实的内容,如图像、音频、视频和文本。像 DALL-E 3、Stable Diffusion 和 ChatGPT 这样的模型展示了新的创造能力,但也引发了人们对伦理、偏见和滥用的担忧。

随着生成式人工智能的快速发展,混合专家(MoE)、多模态学习和通用人工智能(AGI)正成为下一波研究和应用的前沿。这篇文章将对当前的生成式人工智能进行全面调查,分析像 Google (GOOGL ) 的 Gemini 和 OpenAI 的 Q* 这样的创新如何改变了这个领域。它将检查这些创新在医疗保健、金融、教育和其他领域的实际影响,同时也会探讨研究质量和人工智能与人类价值观的对齐等挑战。

2022 年底 ChatGPT 的发布重新引发了人们对人工智能的兴奋和担忧,从其令人印象深刻的自然语言能力到其可能传播虚假信息的潜力。同时,Google 的新 Gemini 模型通过像 Spike-and-Slab 注意力这样的进步,展示了比其前身 LaMDA 更好的对话能力。像 OpenAI 的 Q* 这样的传闻项目暗示了将对话式人工智能与强化学习相结合的可能性。

这些创新表明了对多模态、多功能生成模型的优先性转变。像 Google、Meta、Anthropic 和 Cohere 这样的公司之间的竞争也在加剧,大家都在争夺负责任的 AI 开发的边界。

人工智能研究的演变

随着能力的增长,研究趋势和优先级也发生了变化,通常与技术里程碑相对应。深度学习的兴起重新引发了人们对神经网络的兴趣,而自然语言处理则随着 ChatGPT 级别的模型而蓬勃发展。同时,伦理问题仍然是快速进步中的一个持续的优先事项。

像 arXiv 这样的预印本仓库也见证了人工智能提交的指数级增长,使得研究成果更快地传播,但也减少了同行评审的机会,并增加了未经检查的错误或偏见的风险。研究与实际影响之间的相互作用仍然复杂,需要更协调的努力来引导进步。

混合专家和多模态系统 – 生成式人工智能的下一波

为了使人工智能在多样化的应用中更具多功能性和复杂性,混合专家(MoE)和多模态学习是两个正在获得关注的方法。

混合专家(MoE)架构将多个专门的神经网络“专家”组合起来,针对不同的任务或数据类型进行优化。Google 的 Gemini 使用 MoE 来掌握长对话交换和简洁的问答。MoE 允许处理更广泛的输入而不使模型大小膨胀。

像 Google 的 Gemini 这样的多模态系统正在通过处理多种模态(不仅仅是文本)来设定新的基准。然而,实现多模态人工智能的潜力需要克服关键的技术障碍和伦理挑战。

Gemini:多模态的基准

Gemini 是一个多模态对话式人工智能,旨在理解文本、图像、音频和视频之间的联系。其双编码器结构、跨模态注意力和多模态解码使其能够进行复杂的上下文理解。Gemini 被认为在将文本概念与视觉区域关联方面超过了单编码器系统。通过集成结构化知识和专用训练,Gemini 在以下方面超过了其前身 GPT-3 和 GPT-4:

  • 处理的模态广度,包括音频和视频
  • 在大规模多任务语言理解等基准上的性能
  • 跨编程语言的代码生成
  • 通过定制版本如 Gemini Ultra 和 Nano 实现的可扩展性
  • 通过输出理由实现的透明度

多模态系统的技术障碍

实现强大的多模态人工智能需要解决数据多样性、可扩展性、评估和可解释性等问题。数据集的不平衡和注释不一致会导致偏见。处理多个数据流会给计算资源带来压力,需要优化的模型架构。需要在注意力机制和算法方面取得进展,以整合相互矛盾的多模态输入。可扩展性问题仍然存在,主要是由于计算开销。完善评估指标通过综合基准是至关重要的。增强用户信任通过可解释的人工智能也是必不可少的。解决这些技术障碍将是解锁多模态人工智能能力的关键。

先进的学习技术,如自监督学习、元学习和微调,在人工智能研究的前沿,增强了人工智能模型的自主性、效率和多功能性。

自监督学习:模型训练中的自主性

自监督学习强调使用无标签数据进行模型训练,从而减少手动标注的努力和模型偏见。它结合了生成模型,如自动编码器和 GAN,用于数据分布学习和输入重构,并使用对比方法,如 SimCLR 和 MoCo,来区分正负样本对。自预测策略,受 NLP 和最近的 Vision Transformers 的启发,在自监督学习中发挥着重要作用,展示了其在推进人工智能的自主训练能力方面的潜力。

元学习

元学习,或“学习如何学习”,专注于使人工智能模型能够快速适应新任务,使用有限的数据样本。这种技术在数据可用性有限的情况下至关重要,确保模型可以快速适应并在多种任务中表现良好。它强调了少样本泛化,使人工智能能够处理广泛的任务,使用最少的数据,凸显了其在开发多功能和适应性强的人工智能系统方面的重要性。

微调:定制人工智能以满足特定需求

微调涉及将预训练模型适应特定的领域或用户偏好。其两种主要方法包括端到端微调,调整编码器和分类器的所有权重,以及特征提取微调,冻结编码器权重以进行下游分类。这种技术确保生成模型能够有效地适应特定的用户需求或领域要求,增强了其在各种情境中的适用性。

人工智能与人类价值观的对齐:使人工智能与伦理相协调

人工智能与人类价值观的对齐集中于使人工智能模型与人类的伦理和价值观相协调,确保其决策反映社会规范和伦理标准。这方面在人工智能与人类密切交互的场景中至关重要,例如在医疗保健和个人助理中,确保人工智能系统做出符合伦理和社会责任的决策。

通用人工智能的开发

通用人工智能(AGI)专注于开发具有整体理解和复杂推理能力的人工智能,接近人类的认知能力。这种长期的抱负不断推动人工智能研究和开发的边界。AGI 安全和约束解决方案解决了高级人工智能系统可能带来的风险,强调了对严格的安全协议和与人类价值观及社会规范的伦理对齐的需求。

创新混合专家

混合专家(MoE)模型架构代表了基于变压器的语言模型的一个重大进步,提供了无与伦比的可扩展性和效率。MoE 模型,如 Switch Transformer 和 Mixtral,正在快速重新定义模型规模和性能,在多种语言任务中表现出色。

核心概念

MoE 模型利用基于稀疏性的架构,包含多个专家网络和可训练的门控机制,优化计算资源,并适应任务复杂性。它们在预训练速度方面展示了显著的优势,但在微调和推理方面面临挑战,需要大量内存。

MoE 模型以其优异的预训练速度而闻名,像 DeepSpeed-MoE 这样的创新优化了推理以实现更好的延迟和成本效率。最近的进展有效地解决了全对全通信瓶颈,提高了训练和推理效率。

构建通用人工智能的基石

通用人工智能(AGI)代表了人工智能可能匹配或超过人类在任何领域的智能的假设可能性。虽然现代人工智能在狭窄任务中表现出色,但 AGI 仍然遥远且存在争议,考虑到其潜在风险。

然而,在知识转移、多任务训练、对话能力和抽象等领域的渐进式进步,正在一步步接近 AGI 宏伟的愿景。OpenAI 的推测性 Q* 项目旨在将强化学习整合到大型语言模型(LLM)中,作为向前迈出的一步。

操纵人工智能模型的伦理边界和风险

人工智能模型的“越狱”允许攻击者绕过在人工智能的微调过程中设定的伦理边界,导致生成有害内容,如虚假信息、仇恨言论、钓鱼邮件和恶意代码,对个人、组织和整个社会构成风险。例如,一个被“越狱”的模型可能会生成内容以支持有争议的叙事或支持网络犯罪活动。(了解更多)

虽然尚未报告使用“越狱”进行网络攻击的案例,但多个概念验证的“越狱”工具已经在网上和暗网上公开销售。这些工具提供了旨在操纵像 ChatGPT 这样的人工智能模型的提示,可能使黑客能够通过公司聊天机器人泄露敏感信息。这些工具在网络犯罪论坛上的传播凸显了解决这一威胁的紧迫性。(阅读更多)

减轻“越狱”风险

为了应对这些威胁,需要采取多方面的方法:

  1. 强健的微调:在微调过程中包含多样化的数据,可以提高模型抵御对抗性操纵的能力。
  2. 对抗性训练:使用对抗性示例进行训练,可以增强模型识别和抵御被操纵的输入的能力。
  3. 定期评估:持续监测输出结果,有助于检测偏离伦理准则的行为。
  4. 人工监督:让人工审查者参与,可以添加一层额外的安全保障。

人工智能驱动的威胁:幻觉利用

人工智能的“幻觉”是指模型生成不基于其训练数据的输出,可以被利用。例如,攻击者操纵 ChatGPT 推荐不存在的软件包,导致恶意软件的传播。这凸显了需要持续警惕和对此类利用行为的强有力的对策。(进一步探索)

尽管追求 AGI 的伦理问题仍然存在争议,但其理想的追求仍在影响生成式人工智能的研究方向,无论当前的模型是否是通往人类级别人工智能的垫脚石或绕道。

我已经沉浸在了令人着迷的机器学习和深度学习世界中五年了。我的热情和专业知识让我为超过50个不同的软件工程项目做出了贡献,特别关注AI/ML。我的持续的好奇心也让我对自然语言处理产生了兴趣,这是一个我渴望进一步探索的领域。