AI 模型与平台

OpenAI 表示,代理现在每位研究员工作日相当于 3.1 个工作日

mm
将 Unite.AI 添加到您在 Google 上的首选来源

OpenAI 的研究组织现在每工作日的人类劳动对应 3.1 个代理工作日,公司在 2026 年 9 月 8 日的文章 中指出,这篇文章阐述了其将前沿模型能力转化为收入的计划。该数字以 2026 年 8 月中旬的标准八小时工作日为基准,支撑了首席财务官 Sarah Friar 的更宏大的论点,即更强大的模型、超过十亿的每周活跃用户以及全栈计算策略相互强化。

这篇题为 “The Work Now Within Reach” 的文章是 Friar 在 OpenAI 业务与计算经济学系列中的最新作品。OpenAI 于 2024 年 6 月任命 Friar 为首席财务官;她此前曾担任 Nextdoor 的 CEO 和 Square 的 CFO。

使用和收入

OpenAI 表示,其产品覆盖超过十亿的每周活跃用户和 250 万家企业,并且每一次研究进展都会提升 ChatGPT、ChatGPT Work、Codex 以及基于其 API 构建的应用。公司称,靠广告支持的免费访问帮助人们发现 AI 的适用场景,而订阅和基于使用量的产品则让客户在获得更多价值的同时花费更多。

OpenAI 引用其对单个 ChatGPT 计划的研究称,注册六个月后的每日消息量约比首月高出 50%,且用户尝试的不同任务数量大约是原来的两倍。该分析基于 2025 年 10 月 15 日至 2026 年 5 月 1 日期间创建的账户的 0.1% 样本,活动追踪至 2026 年 5 月 31 日;它以每位用户的前 28 天为基准衡量消息量和任务广度,并将消息划分为 53 类能力类别。

文章还列举了五个客户部署案例。波士顿儿童医院报告称,通过 AI 辅助研究,在此前未解决的罕见疾病病例中实现了超过 40 项诊断。Cars24 表示,其代理每月处理超过一百万分钟的购车和售车对话。Circles 报告称,在支持的工作流中,65% 的客户服务交互实现了自主解决;Balyasny Asset Management 称,其央行演讲分析师将宏观情景分析的时间从两天缩短至约 30 分钟。Replit 提供免费模式,让用户在不消耗使用配额的情况下规划软件。上述数据均来源于 OpenAI 所展示的客户自身账户。

研究组织内部的代理

3.1 个代理工作日的数字来源于 OpenAI 于 2026 年 9 月 6 日发布的研究更新,该更新报告称,2026 年 6 月之前,研究组织整体的代理运行时间仍低于人类劳动总量。更新指出,至 8 月中旬,研究员的中位数每日推理费用已超过 600 美元(按 API 价格计),而第 90 百分位的用户每日使用的代币费用超过 7,000 美元。

同一更新指出,2026 年 1 月至 7 月期间,编码代理在多个任务难度层级上的成功率有所提升,同时强调更长的任务仍需人工引导:在过去六个月中,超过一半的成功任务(估计需要四至八小时的人力)至少经历了一次人工干预。文章中,OpenAI 表示,人们仍然设定研究优先级并评估结果,团队正在使用代理解决过去需要专业支持的基础设施问题。

模型能力与计算成本

Friar 的文章将 GPT-6 Astra 定位为当前的能力驱动因素,称其在计算使用、浏览、软件工程、网络安全、科学以及专业工作方面均处于业界领先水平。发布帖中,OpenAI 表示 Astra 在 FrontierMath Tier 4 上得分 98%,在 ARC-AGI-3 上得分 99.9%,在 ExploitBench 上得分 100%,并且在公司制定的 Preparedness Framework 中的网络安全方面达到了 Critical 阈值。这些都是 OpenAI 自己报告的结果。公司称 Astra 于 2026 年 9 月 3 日开始向有限的组织群体推出,随后在接下来的几天内在 ChatGPT 付费层级、API、Microsoft Azure 和 AWS Bedrock 上实现全面可用。

在服务经济学方面,文章重申了 OpenAI 于 2026 年 7 月 29 日关于 GPT-5.6: 的工程帖子中的两个数据:生产服务软件的改进将端到端服务成本降低了 20%,而推测式解码工作将代币生成效率提升了超过 15%。工程帖子指出,这两项提升均是通过在 Codex 中运行的 GPT-5.6 Sol 实现的,包括自主重写生产内核。

文章还回顾了 Jalapeño——OpenAI 定制的推理芯片——的首批结果,该结果首次于 2026 年 8 月 25 日公布。在 InferenceX 对 GPT-OSS 120B、DeepSeek R1 和 Kimi K2.5 的测试中,OpenAI 表示该芯片的峰值代币吞吐量(每瓦特)是测试的商业系统的 1.5 到 1.9 倍,比较时使用了芯片额定功率进行归一化,端到端延迟降低了 1.7 到 3.6 倍。OpenAI 称计划在今年年底前在其计算基础设施中部署 Jalapeño,并与 NVIDIA、AMD 以及其他合作伙伴的加速器一起使用,且第二代和第三代版本正在研发中。

Friar 写道,OpenAI 评估每项投资的标准是其能够满足的需求、实现生产力的速度以及回报是否足以证明所投入资本的合理性,并且,随着采纳率的提升而产生的收入用于资助进一步的研究和基础设施建设。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。