AI 基础

什么是生成式人工智能?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

生成式人工智能 指的是通过学习数据中的模式并在接受指令或示例条件时生成新的文本、图像、音频、视频、代码或其他表示形式的模型。输出是从概率模型合成的;它并非直接从数据库完整检索,尽管检索工具可以提供外部证据。

不同的模型家族采用不同的生成方式。自回归变换器一次预测一个标记来生成序列,扩散模型通过迭代去噪样本进行生成,而生成对抗网络则通过生成器与判别器的竞争学习。

要点概览

  • 生成是从已学习的分布进行条件采样,而非保证事实回忆。
  • 变换器、扩散模型、GAN 和变分自编码器在不同方面做出权衡。
  • 检索和工具可以为系统提供依据,但它们的输出和权限仍需验证。
  • 风险管理涉及数据、模型、接口、部署、监控和内容来源。
What is Generative AI? diagram showing data, train model, condition, generate, evaluate, safeguard
模型生成候选项;周边系统决定依据、权限、审查和问责。

生成模型的学习方式

训练目标通过奖励模型预测或重建示例中的模式来进行。语言模型估计下一个标记;扩散模型学习逆转噪声过程;变分自编码器学习结构化的潜在分布及解码器。

这种训练产生统计上的泛化能力,但也可能复制偏见、记忆不常见序列或在数据分布之外失效。因此,在部署前数据集文档、去重、隐私控制和留出评估都至关重要。

主要架构家族

自回归变换器在文本领域占主导地位,并支持多模态序列。扩散模型被广泛用于高保真图像和音频生成。GAN 能生成清晰的样本并实现可控的图像系统,但训练难度较大。

变分自编码器提供潜变量建模和高效表示,有时在更大的生成流水线中使用。实际产品常将多种模型与检索、过滤器、工具和确定性代码相结合。

条件、采样与控制

提示、类别标签、图像、音频片段或结构化记录都可以作为生成的条件。采样参数会影响多样性和确定性。较低的温度可以集中标记概率,但并不能使错误答案变为正确。

当系统使用显式模式、受限解码、参考材料和验证时,控制能力会提升。提示工程改变上下文;微调改变参数;检索提供外部信息。每种方法针对不同的失效模式。

评估因应用而异

文本系统可能需要事实性、任务完成度、引用支持、毒性和校准测试。图像或音频系统可能需要保真度、语义对齐、多样性、身份安全和感知审查。应将自动化指标与具代表性的人类评估相结合。

构建包含常规、罕见、对抗性和政策相关案例的版本化评估集。跟踪延迟、成本和拒绝行为以及输出质量。由创建者挑选的演示并不能证明整体可靠性。

风险、保障措施与来源溯源

重要风险包括幻觉、提示注入、有害内容、冒充、工具使用不安全、隐私泄露、版权纠纷、自动化偏见以及不透明的供应链。NIST 的生成式 AI 概况在治理、内容溯源、部署前测试和事件披露等方面组织相应行动。

使用最小权限工具、输入/输出控制、对关键决策进行人工审查、日志记录、回滚和用户报告。水印或内容凭证可以提供信号,但没有单一检测器或标签能够确立真相。更广泛的合成媒体工作流必须保留上下文和问责。

模型家族与生成机制

生成式人工智能模型估计或学习一种能够产生新文本、图像、音频、视频、代码或结构化数据的过程。自回归模型预测下一个标记或元素;扩散模型学习逆转噪声过程;变分自编码器学习概率潜变量;GAN 在生成器与判别器之间进行训练。多模态系统在不同媒体之间连接表示。输出是从学习到的统计结构中采样,并受提示、上下文、工具或其他输入条件约束——并非作为保证事实检索得到的。

基础模型在大规模数据上进行预训练,并通过提示、检索、微调、偏好优化、控制网络或任务特定头部进行适配。分词器、编码器、解码器、潜在空间和采样设置决定结果。温度和候选过滤在确定性与多样性之间进行权衡。更长的提示提供上下文,但可能产生冲突、分散注意力或包含恶意指令。检索可以为不断变化的知识提供依据,而确定性代码应处理精确计算和规则。

评估、溯源与权利

按任务进行评估:答案的事实正确性和引用、代码的执行与安全性、媒体的保真度与多样性,以及创意辅助的人类结果。包括拒绝率、校准、延迟、成本、语言、可访问性和对抗性测试。流畅或逼真的输出仍可能错误。保留模型、提示、种子、来源证据、工具调用和后处理以实现可复现性。将检索质量与生成分离,防止精致答案掩盖缺失证据。

训练和输出会引发版权、许可证、同意、隐私、公开和保密等问题。为输入数据建立来源溯源和许可使用;防止用户泄露机密;测试记忆化;并提供报告和删除流程。合成媒体应在可行时携带持久的溯源或披露,尤其是当其可能被误认为证据时。不得以侵犯权利或欺骗的方式使用肖像、声音或风格。

部署控制

将模型输出视为不可信的输入。验证模式、清理代码和文件、隔离执行、对每个工具进行外部授权、限制成本和速率,并在关键操作上要求确认。监控故障、滥用、漂移和用户纠正,配合回滚和非生成式回退。记录预期和禁止的使用场景。生成式人工智能扩展了信息创建和转换的接口,但可靠性和问责来源于周边的数据、评估、安全、溯源以及人类决策过程。

案例演示:生成式产品描述助理

零售商允许编辑仅基于已批准的产品属性和品牌指南生成草稿描述。提示中包含结构化事实,检索提供当前政策。输出必须遵循模式,并与源值进行验证;不支持的维度、安全声明或认证将导致拒绝。评估涵盖事实准确性、风格、重复性、多语言质量、可访问性、延迟以及编辑纠正,并与模板和人工撰写进行比较。

编辑会批准每一次发布并可查看源字段。模型没有修改价格、库存或直接发布的能力。提示和产品数据受到注入保护,机密供应商备注被排除。监控跟踪不支持的声明、编辑、投诉、成本和供应商版本。生成的文本连同溯源一起存储。只有在纠正和审查未抹去收益且产品真实性仍由权威数据治理时,系统才会节省撰写时间。

实施证据与运营准备

生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每项关键失效的后果。调优前建立可复现的基线和版本化评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。将任务质量与校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性一起衡量。记录每一次转化和阈值,以便独立审阅者能够复现结果并将证据与诱人的原型区分开来。

上线前,指定发布、例外、变更、回滚和退役的授权人。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据源、用户、模型、供应商、政策、硬件或目标发生变化时都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除和保留流程,以及明确的停用或替换时点。

常见问题

生成式人工智能与大型语言模型是同一概念吗?

不是。大型语言模型是生成式模型的一类。生成式人工智能还包括使用多种架构构建的图像、音频、视频和结构化数据系统。

模型会复制其训练数据吗?

它通常从学习到的模式中进行合成,但也可能出现记忆化和近似复制的情况。必须评估隐私和溯源风险,而不能假设其不存在。

主要参考文献

Alex 负责 Unite.AI 的 AI 驱动新闻运营,结合新闻报道、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作有助于确保新兴的 AI 发展能够高效呈现,同时保持出版物的编辑标准。