我已经沉浸在了令人着迷的机器学习和深度学习世界中五年了。我的热情和专业知识让我为超过50个不同的软件工程项目做出了贡献,特别关注AI/ML。我的持续的好奇心也让我对自然语言处理产生了兴趣,这是一个我渴望进一步探索的领域。
开放模型推理平台允许开发人员使用 Llama、Mistral、Qwen、DeepSeek、扩散、嵌入、语音和其他模型家族,而无需构建完整的 GPU 服务栈。重要的区别在于模型覆盖、冷启动、吞吐量、专用容量、微调模型支持、区域、数据控制、可观察性以及应用程序可以轻松迁移到其他地方的能力。我们的团队独立评估了以下当前平台的 API 成熟度、服务灵活性、性能选项和生产开放模型工作量的适用性。即使服务托管模型权重,模型许可仍然适用,仅凭借...
Anthropic 的 模型上下文协议(MCP) 是一个开源协议,允许 AI 助手和数据源(如数据库、API 和企业工具)之间进行安全的双向通信。通过采用客户端-服务器架构,MCP 标准化了 AI 模型与外部数据的交互方式,消除了为每个新数据源编写自定义集成的需要。MCP 的关键组件: 主机:启动连接的 AI 应用程序(例如 Claude Desktop)。 客户端:维持与主机应用程序内服务器的一对一连接的系统。 服务器:为客户端...
作为AI工程师,编写干净、效率高、可维护的代码至关重要,尤其是在构建复杂系统时。设计模式是软件设计中常见问题的可重用解决方案。对于AI和大型语言模型(LLM)工程师,设计模式有助于构建强健、可扩展、可维护的系统,能够高效地处理复杂工作流程。本文深入探讨Python中的设计模式,重点介绍其在AI和LLM系统中的相关性。我将通过实践的AI用例和Python代码示例来解释每个模式。让我们探索一些在AI和机器学习背景下特别有用的关键设计模...
由基础模型(如大型语言模型(LLM))驱动的自主代理的增长,已经改变了我们解决复杂、多步骤问题的方式。这些代理执行从客户支持到软件工程的任务,导航复杂的工作流程,结合推理、工具使用和内存。然而,随着这些系统的能力和复杂性不断增长,观察性、可靠性和合规性方面的挑战出现了。这就是AgentOps的用途;一个概念,模仿DevOps和MLOps,但专为管理基于基础模型的代理的生命周期而设计。 为了提供对AgentOps的基础理解及其在为基...
LLM-as-a-Judge 框架是一种可扩展、自动化的替代方案,用于评估语言模型的输出,而传统的人工评估方法往往成本高、速度慢,并且受到评估响应数量的限制。通过使用一个 LLM 来评估另一个 LLM 的输出,团队可以高效地跟踪准确性、相关性、语气和遵守特定指南的一致性和可复制性。评估生成的文本会带来超出传统准确性指标的独特挑战。一个单一的 提示 可以产生多个正确的响应,这些响应在风格、语气或措辞上有所不同,使得使用简单的量化指标...
微软研究院于 2023 年 9 月推出了 AutoGen,这是一个开源的 Python 框架,用于构建能够进行复杂多智能体协作的 AI 代理。AutoGen 已经在研究人员、开发人员和组织中获得了关注,目前在 GitHub 上有超过 290 名贡献者,并且截至 2024 年 5 月,已有近 900,000 次下载。基于这一成功,微软推出了 AutoGen Studio,这是一个低代码界面,能够让开发人员快速原型和实验 AI 代理。...
2024 年 10 月 17 日,微软宣布了 BitNet.cpp,这是一种推理框架,旨在运行 1 位量化的大型语言模型(LLM)。BitNet.cpp 是通用人工智能领域的一个重大进步,它使得 1 位 LLM 可以在标准 CPU 上高效部署,而无需昂贵的 GPU。这一发展使得 LLM 更加普及,使其可以在广泛的设备上使用,并为设备上的人工智能应用带来了新的可能性。了解 1 位大型语言模型大型语言模型(LLM)传统上需要大量的计算...
企业LLM API的区别不仅在于模型基准。买家需要比较推理和多模态能力、工具使用、结构化输出、部署区域、数据控制、身份集成、吞吐量、可观察性、模型生命周期和评估变化的便捷性,然后才能在新模型版本面向用户之前进行评估。我们的团队独立评估了以下平台的生产API成熟度、企业控制、模型广度、开发者体验和架构灵活性。能力变化很快,因此团队应该尽可能固定模型版本、维护提供商独立的评估数据集,并设计fallback计划,而不是将关键工作流耦合到...
在不断演变的分子生物学领域中,设计能够有效地与特定目标(如病毒蛋白、癌症标志物或免疫系统成分)结合的蛋白质一直是最具挑战性的任务之一。这些蛋白质结合剂是药物发现、疾病治疗、诊断和生物技术领域的关键工具。传统的创建这些蛋白质结合剂的方法是劳动密集型、耗时的,并且经常需要多轮优化。然而,最近在人工智能(AI)方面的进步正在大大加速这一过程。2024年9月,Neuralink成功地将其脑芯片植入第二位人类参与者,这是其临床试验的一部分,...
随着大型语言模型(LLM)的需求不断增长,确保快速、效率高和可扩展的推理变得更加重要。NVIDIA的TensorRT-LLM通过提供一套专门为LLM推理设计的强大工具和优化来解决这一挑战。TensorRT-LLM提供了一系列令人印象深刻的性能改进,例如量化、内核融合、飞行批处理和多GPU支持。这些进步使得推理速度比传统的CPU-based方法快8倍,改变了我们在生产环境中部署LLM的方式。本综合指南将探讨TensorRT-LLM的...
反思 70B 是由 HyperWrite 开发的开源大型语言模型(LLM)。该模型引入了一种新的 AI 认知方法,这可能会改变我们与 AI 系统交互和依赖的方式,在从语言处理到高级问题解决的各个领域。利用 反思调优,一种开创性的技术,允许模型实时自我评估和纠正自己的错误,反思 70B 已经迅速崛起,超越了像 GPT-4 和 Claude 3.5 Sonnet 这样的专有模型,在包括 MMLU、MATH 和 HumanEval 在内...
div]:bg-bg-300 [&_pre]:-mr-4 md:[&_pre]:-mr-9″> 计算能力已经成为推动机器学习边界的关键因素。随着模型变得更加复杂,数据集呈指数级增长,传统的基于CPU的计算往往无法满足现代机器学习任务的需求。这就是CUDA(计算统一设备架构)的用途,CUDA是一种用于加速机器学习工作流的方法。 CUDA由NVIDIA 开发,是一个并行计算平台和编程模型,利用图形处理单元(GPU)的巨大计算能力。虽然...
作为开发人员和数据科学家,我们经常需要通过API与这些强大的模型进行交互。然而,当我们的应用程序变得更加复杂和庞大时,高效和高性能的API交互变得至关重要。这就是异步编程的用处,它允许我们最大化吞吐量和最小化延迟,当我们与LLM API合作时。在这份综合指南中,我们将探索Python中异步LLM API调用的世界。我们将涵盖从异步编程基础到处理复杂工作流的高级技术的一切。到本文结束时,您将对如何利用异步编程来增强您的LLM驱动应用...
扩散模型已经成为生成式 AI 中的一种强大方法,能够在图像、音频和视频生成方面产生最先进的结果。在这篇深入的技术文章中,我们将探讨扩散模型的工作原理、其关键创新以及为什么它们如此成功。我们将涵盖数学基础、训练过程、采样算法以及这项令人兴奋的新技术的尖端应用。扩散模型介绍扩散模型是一类生成模型,它们通过逆转扩散过程来学习逐渐去噪数据。核心思想是从纯噪声开始,迭代地将其细化为目标分布中的高质量样本。这种方法的灵感来自非平衡热力学,特别...
语言模型在近年来取得了快速的进展,Transformer 架构成为自然语言处理的主流。但是,随着模型的规模增加,处理长上下文、内存效率和吞吐量的挑战变得更加明显。AI21 Labs 推出了 Jamba,一种结合了 Transformer 和 Mamba 架构的混合语言模型。这种混合框架使得 Jamba 在处理长上下文和内存效率方面取得了显著的改进。本文详细介绍了 Jamba 的架构、性能和潜在应用。Jamba 概述Jamba 是由...