Kunal Kejriwal 是一名专注于 Python、PostgreSQL、Redis 以及 GCP 和 AWS 上云基础设施的后端工程师。拥有三年构建和扩展生产系统的经验,他撰写关于 AI 基础设施、分布式系统以及部署机器学习工作负载背后架构的文章。
鉴于人工智能领域的快速发展,技术领导者经常面临的一个重大挑战是从“实验性”转变为“企业级”。虽然消费者聊天机器人和交互式平台有助于提高公众的想象力,但仅凭聊天界面,企业无法成功。在竞争日益激烈的时代,企业需要一个强大、可扩展和安全的生态系统,这就是谷歌试图通过 Vertex AI 提供的,谷歌云的统一人工智能和机器学习平台。Vertex AI 尝试巩固自己作为现代云基础设施中生成式人工智能集成的骨干,提供了一套全面功能,弥合了原始...
近年来,大型语言模型(LLM)取得了显著的进步,这也激发了多模态大型语言模型(MLLM)的发展。早期的MLLM努力,如LLaVA、MiniGPT-4和InstructBLIP,展示了显著的多模态理解能力。为了将LLM集成到多模态领域,这些研究探索了将预训练的模态特定编码器(如CLIP)的特征投影到LLM的输入空间中,从而实现多模态理解和推理在Transformer骨架中。尽管MLLM有各种设计选择,例如视觉编码器、特征对齐适配器和...
多模态大语言模型(MLLMs)准确解释复杂视觉信息的能力是一个关键的焦点。最近的工作表明,增强视觉感知可以显著减少幻觉并提高分辨率敏感任务(如光学字符识别和文档分析)的性能。几种最近的MLLMs通过利用编码器的混合来实现这一点。尽管它们取得了成功,但仍缺乏对关键方面(如专家选择和多个视觉专家的集成)的系统性比较和详细的消融研究。这篇文章对使用编码器混合的MLLMs的设计空间进行了广泛的探索,介绍了Eagle框架,该框架尝试使用编码...
大规模预训练加上特定任务的微调已经成为语言建模的标准做法。同样,计算机视觉方法也逐渐接受了大规模数据的预训练。随着LAION5B、Instagram-3.5B、JFT-300M、LVD142M、Visual Genome和YFCC100M等大型数据集的出现,人们可以探索传统基准之外的数据。这个领域的重要工作包括DINOv2、MAWS和AIM。DINOv2通过在LDV-142M数据集上扩展对比性iBot方法,实现了自监督特征生成的最...
当前的长上下文大型语言模型(LLM)可以处理最多100,000个令牌的输入,但它们在生成超过2,000字的输出时却苦苦挣扎。受控实验表明,模型的有效生成长度在很大程度上受到其在监督微调(SFT)期间看到的示例的限制。换句话说,这个输出限制是由于现有的SFT数据集中缺乏长输出示例所致。最近的长上下文LLM的进展导致了具有显著扩大内存容量的模型的发展,这些模型能够处理超过100,000个令牌的历史。然而,尽管它们能够处理广泛的输入,但...
大型语言模型(LLM)越来越多地被用于需要多次生成调用、先进的提示技术、控制流和结构化输入/输出的复杂任务。然而,用于编程和执行这些应用程序的高效系统仍然缺乏。SGLang是一种新引入的系统,旨在通过提供高效的语言模型程序执行来解决这个问题。SGLang由一个前端语言和一个运行时组成。前端通过提供生成和并行控制的原语来简化编程,而运行时通过像RadixAttention这样的新优化来加速执行,例如KV缓存重用和压缩的有限状态机用于...
训练大规模的多模态模型(LMMs)需要大规模的数据集,其中包含交错的图像和文本序列。虽然开放源码的LMMs已经迅速发展,但仍然缺乏大规模的多模态交错数据集,这些数据集是开放源码的。这些数据集的重要性不言而喻,因为它们是创建能够理解和生成不同模态内容的高级AI系统的基础。没有足够的综合性和交错的数据集,开发更复杂和更强大的LMMs的潜力将大大降低。这些数据集使得模型能够从多样化的输入中学习,使得它们在各种应用中更加多样化和有效。此外...
2018年,神经网络世界模型的强化学习概念首次被提出,不久,这一基本原理就被应用于世界模型。一些著名的实现强化学习的模型包括Dreamer框架,它从递归状态空间模型的潜在空间中引入了强化学习。DreamerV2证明了使用离散潜在变量可能会导致复合错误减少,而DreamerV3框架能够在不同领域的任务中实现人类般的性能,使用固定超参数。 此外,图像生成模型和世界模型之间可以画出平行线,表明生成式视觉模型的进展可以被复制以造福世界模型...
随着深度生成式AI模型的出现,AI在自然语言生成、3D生成、图像生成和语音合成方面的能力得到了显著的提升。3D生成模型已经改变了许多行业和应用,彻底改变了当前的3D生产格局。然而,许多当前的深度生成模型都面临着一个共同的挑战:复杂的电路和生成的网格具有照明纹理,通常与传统的渲染管道(如PBR(基于物理的渲染))不兼容。基于扩散的模型可以生成不具有照明纹理的3D资产,具有生成多样化3D资产的显著能力,从而增强了现有的3D框架,在诸如...
LLM水印是一种将不可见但可检测的信号集成到模型输出中,以识别由LLM生成的文本的技术,对于防止大型语言模型的滥用至关重要。这些水印技术主要分为两类:KGW家族和Christ家族。KGW家族通过修改LLM产生的logits来创建水印输出,根据前一个token将词汇表分为绿色列表和红色列表。在文本生成过程中,引入了对绿色列表token的偏差,偏爱这些token在生成的文本中。然后,从绿色单词的比例中计算出一个统计指标,并建立一个阈值...
由于其在与其他方法相比具有强大的性能和广泛的适用性,LoRA或低秩适应是PEFT或参数高效微调中最流行的方法之一,用于对大型语言模型进行微调。LoRA框架采用两种低秩矩阵来分解和近似FFT或全微调中的更新权重,并且LoRA框架通过调整矩阵的秩来修改这些可训练参数。实施此过程的主要好处是,它可以在微调后无需推理延迟地合并这些矩阵。另外,尽管最近的大型语言模型在上下文学习任务中表现出色,但某些场景仍需要微调,可以大致分为三种类型。第一...
虽然自动机器学习(AutoML)几年前就已经流行起来,但早期的AutoML工作可以追溯到90年代初,当时科学家们发表了关于超参数优化的第一篇论文。2014年,ICML组织了第一次AutoML工作坊,AutoML才获得了机器学习开发者的关注。多年来,AutoML的一个主要焦点是超参数搜索问题,即模型实现了一系列优化方法,以确定特定机器学习模型在大型超参数空间中的最佳性能超参数。AutoML模型常用的另一种方法是估计特定超参数是给定机...
近年来,大型语言模型在视觉语言推理、理解和交互方面取得了显著进步,主要得益于最近的视觉语言模型的发展。现代框架通过将视觉信号投影到大型语言模型中,使其能够视觉地解释世界,这是一系列依赖于视觉编码策略的场景。然而,现实世界的图像不仅包含广泛的场景,还在分辨率和长宽比方面存在显著差异,这对大型语言模型在不同领域和任务中构成了重大挑战。为了应对现实世界图像的显著差异,现代大型语言模型以低分辨率(例如224×224)和固定长宽比(例如1:...
近年来,多模态大语言模型(MLLMs)的架构和性能取得了显著进步,凸显了可扩展数据和模型的重要性以提高性能。虽然这种方法可以提高性能,但它需要大量计算资源,从而限制了此类方法的实用性和可用性。多年来,混合专家(MoE)模型已成为一种成功的替代方法,用于高效扩展图像-文本和大语言模型,因为混合专家模型具有显著较低的计算成本和强大的性能。然而,尽管混合模型具有优势,但它们并不是扩展大语言模型的理想方法,因为它们通常涉及较少的专家和有限...
在现代机器学习和人工智能框架中,Transformer是各个领域中最广泛使用的组件,包括自然语言处理中的GPT系列和BERT,以及计算机视觉任务中的Vision Transformers。虽然将Transformer包含在模型架构中可以显著提高模型性能,但Transformer中的注意力模块的计算复杂度随着序列长度的增加而呈二次增长,从而导致高计算挑战。多年来,各种模型都在探索不同的策略来解决计算挑战,包括核化、历史内存压缩、令牌...