AGI 与未来 AI
生成式人工智能的演变:混合专家、多模态和通用人工智能的探索
2023 年,人工智能(AI)领域经历了巨大的增长。生成式人工智能(Generative AI)是当前研究的重点,专注于创建真实的内容,如图像、音频、视频和文本。像 DALL-E 3、Stable Diffusion 和 ChatGPT 这样的模型展示了新的创造能力,但也引发了人们对伦理、偏见和滥用的担忧。
随着生成式人工智能的快速发展,混合专家(MoE)、多模态学习和通用人工智能(AGI)正成为下一波研究和应用的前沿。这篇文章将对当前的生成式人工智能进行全面调查,分析像 Google (GOOGL ) 的 Gemini 和 OpenAI 的 Q* 这样的创新如何改变了这个领域。它将检查这些创新在医疗保健、金融、教育和其他领域的实际影响,同时也会探讨研究质量和人工智能与人类价值观的对齐等挑战。
2022 年底 ChatGPT 的发布重新引发了人们对人工智能的兴奋和担忧,从其令人印象深刻的自然语言能力到其可能传播虚假信息的潜力。同时,Google 的新 Gemini 模型通过像 Spike-and-Slab 注意力这样的进步,展示了比其前身 LaMDA 更好的对话能力。像 OpenAI 的 Q* 这样的传闻项目暗示了将对话式人工智能与强化学习相结合的可能性。
这些创新表明了对多模态、多功能生成模型的优先性转变。像 Google、Meta、Anthropic 和 Cohere 这样的公司之间的竞争也在加剧,大家都在争夺负责任的 AI 开发的边界。
人工智能研究的演变
随着能力的增长,研究趋势和优先级也发生了变化,通常与技术里程碑相对应。深度学习的兴起重新引发了人们对神经网络的兴趣,而自然语言处理则随着 ChatGPT 级别的模型而蓬勃发展。同时,伦理问题仍然是快速进步中的一个持续的优先事项。
像 arXiv 这样的预印本仓库也见证了人工智能提交的指数级增长,使得研究成果更快地传播,但也减少了同行评审的机会,并增加了未经检查的错误或偏见的风险。研究与实际影响之间的相互作用仍然复杂,需要更协调的努力来引导进步。
混合专家和多模态系统 – 生成式人工智能的下一波
为了使人工智能在多样化的应用中更具多功能性和复杂性,混合专家(MoE)和多模态学习是两个正在获得关注的方法。
混合专家(MoE)架构将多个专门的神经网络“专家”组合起来,针对不同的任务或数据类型进行优化。Google 的 Gemini 使用 MoE 来掌握长对话交换和简洁的问答。MoE 允许处理更广泛的输入而不使模型大小膨胀。
像 Google 的 Gemini 这样的多模态系统正在通过处理多种模态(不仅仅是文本)来设定新的基准。然而,实现多模态人工智能的潜力需要克服关键的技术障碍和伦理挑战。
Gemini:多模态的基准
Gemini 是一个多模态对话式人工智能,旨在理解文本、图像、音频和视频之间的联系。其双编码器结构、跨模态注意力和多模态解码使其能够进行复杂的上下文理解。Gemini 被认为在将文本概念与视觉区域关联方面超过了单编码器系统。通过集成结构化知识和专用训练,Gemini 在以下方面超过了其前身 GPT-3 和 GPT-4:
- 处理的模态广度,包括音频和视频
- 在大规模多任务语言理解等基准上的性能
- 跨编程语言的代码生成
- 通过定制版本如 Gemini Ultra 和 Nano 实现的可扩展性
- 通过输出理由实现的透明度
多模态系统的技术障碍
实现强大的多模态人工智能需要解决数据多样性、可扩展性、评估和可解释性等问题。数据集的不平衡和注释不一致会导致偏见。处理多个数据流会给计算资源带来压力,需要优化的模型架构。需要在注意力机制和算法方面取得进展,以整合相互矛盾的多模态输入。可扩展性问题仍然存在,主要是由于计算开销。完善评估指标通过综合基准是至关重要的。增强用户信任通过可解释的人工智能也是必不可少的。解决这些技术障碍将是解锁多模态人工智能能力的关键。
构建通用人工智能的基石
通用人工智能(AGI)代表了人工智能可能匹配或超过人类在任何领域的智能的假设可能性。虽然现代人工智能在狭窄任务中表现出色,但 AGI 仍然遥远且存在争议,考虑到其潜在风险。
然而,在知识转移、多任务训练、对话能力和抽象等领域的渐进式进步,正在一步步接近 AGI 宏伟的愿景。OpenAI 的推测性 Q* 项目旨在将强化学习整合到大型语言模型(LLM)中,作为向前迈出的一步。
操纵人工智能模型的伦理边界和风险
人工智能模型的“越狱”允许攻击者绕过在人工智能的微调过程中设定的伦理边界,导致生成有害内容,如虚假信息、仇恨言论、钓鱼邮件和恶意代码,对个人、组织和整个社会构成风险。例如,一个被“越狱”的模型可能会生成内容以支持有争议的叙事或支持网络犯罪活动。(了解更多)
虽然尚未报告使用“越狱”进行网络攻击的案例,但多个概念验证的“越狱”工具已经在网上和暗网上公开销售。这些工具提供了旨在操纵像 ChatGPT 这样的人工智能模型的提示,可能使黑客能够通过公司聊天机器人泄露敏感信息。这些工具在网络犯罪论坛上的传播凸显了解决这一威胁的紧迫性。(阅读更多)
减轻“越狱”风险
为了应对这些威胁,需要采取多方面的方法:
- 强健的微调:在微调过程中包含多样化的数据,可以提高模型抵御对抗性操纵的能力。
- 对抗性训练:使用对抗性示例进行训练,可以增强模型识别和抵御被操纵的输入的能力。
- 定期评估:持续监测输出结果,有助于检测偏离伦理准则的行为。
- 人工监督:让人工审查者参与,可以添加一层额外的安全保障。
人工智能驱动的威胁:幻觉利用
人工智能的“幻觉”是指模型生成不基于其训练数据的输出,可以被利用。例如,攻击者操纵 ChatGPT 推荐不存在的软件包,导致恶意软件的传播。这凸显了需要持续警惕和对此类利用行为的强有力的对策。(进一步探索)
尽管追求 AGI 的伦理问题仍然存在争议,但其理想的追求仍在影响生成式人工智能的研究方向,无论当前的模型是否是通往人类级别人工智能的垫脚石或绕道。












