NVIDIA Blackwell GPU 驱动 OpenAI GPT-6 Astra Ultrafast:token 生成速度最高提升 8 倍
NVIDIA 官方博客披露,OpenAI 的 GPT-6 Astra Ultrafast 运行在 Blackwell GPU 上,已通过 API 及符合条件的 ChatGPT Work 和 Codex 开放。官方称其 token 生成速度最高可达 Astra 标准模式的 8 倍,面向代码生成、工具调用和交互应用。OpenAI 还用自家模型优化推理软件。价格与吞吐数据未公布。
2026年10月1日,NVIDIA在官方博客上发布文章《How NVIDIA GPUs Help Accelerate OpenAI's GPT-6 Astra Ultrafast》,作者为Dion Harris。文章披露:OpenAI的GPT-6 Astra Ultrafast运行在NVIDIA Blackwell GPU之上,现已通过OpenAI API上线,并向符合条件的ChatGPT Work和Codex用户开放。官方给出的核心数字是,Ultrafast模式的token生成速度最高可达Astra标准模式的8倍。 一、发布了什么 Ultrafast不是一个全新的模型,而是GPT-6 Astra的一种高速服务模式。它面向对时延敏感的场景:代码生成、工具调用和交互式应用。NVIDIA在文中强调,这一提速来自两方面:一是Blackwell架构本身的能力,二是OpenAI通过自家模型持续进行的推理优化。开发者现在即可通过API使用,访问方式、定价和实现细节写在OpenAI的Ultrafast指南中。需要说明的是,原文没有公布Ultrafast的具体价格,也没有给出单卡或单机架的吞吐数据,更没有披露用了多少块GPU。因此,8倍这个数字应理解为官方对「token生成速度」的最高值表述,而不是所有负载下的保证值。
二、为什么速度对智能体如此重要 文章用一句话点出了关键:快的响应,只有在整个工作流里被反复累积时才最有价值。以编程智能体为例,它先写代码,再调用工具,检查结果,然后决定下一步。每一轮都要等待模型生成一段文字,这些等待叠加起来,就构成了开发者感受到的「编辑、测试、调试」循环时长。当单次生成提速数倍,整个循环的墙钟时间就会明显缩短。对交互式应用来说,响应更快也意味着用户体验更流畅。换句话说,Ultrafast瞄准的不是单次问答的延迟,而是多步骤智能体任务的端到端效率。 三、技术机制:模型反过来优化自己的推理栈 这篇文章最有意思的部分,是两位OpenAI高管的表述。OpenAI推理负责人Philippe Tillet表示,NVIDIA在工具链和文档上的深入投入,使OpenAI的模型在为Blackwell和Rubin GPU编写程序方面表现得异常出色。他说,Astra可以把这些知识转化为高性能内核,让NVIDIA硬件在延迟、吞吐和成本的整条前沿曲线上都有竞争力。 OpenAI算力首席技术官Uday Ruddarraju则说,团队使用内部模型来优化NVIDIA GPU上的推理,而NVIDIA平台的可编程性帮助他们交付了Ultrafast背后的加速。文章还指出,OpenAI正在用自己的模型改进运行在NVIDIA GPU上的推理软件,利用平台的可编程性去测试并落地改进。这类工作可以让模型响应随时间越来越快,也让已部署的基础设施越来越高效。 这里的逻辑链条是:GPU内核决定了注意力计算、矩阵乘法、通信等环节的实际效率;内核编写又极度依赖对硬件细节的理解;NVIDIA提供了完整的文档和工具;足够强的模型读懂这些资料后,可以自己写出并调优内核。于是,「模型优化推理,推理让模型服务更快」形成了一个闭环。需要提醒的是,原文没有给出具体是哪些内核、哪些算法被模型优化过,也没有披露优化前后的对照数据,这部分仍是定性描述。 四、可编程性与资源复用 文章的另一个论点是平台的灵活性。可编程的NVIDIA平台让开发者和研究人员能够在训练、推理和强化学习之间复用同一套基础设施,随着模型演进而调整。这种灵活性使团队可以随需求变化重新分配算力,提高利用率,避免为每一种负载单独过度配置。对运营方而言,这直接关系到投资回报:同一批GPU在白天可以服务低延迟推理,在其他时段可以转去做训练或强化学习。这与NVIDIA同日发布的另一篇文章所谈的AI工厂「高效、耐用、可替换」思路相呼应。
五、对开发者与企业的实际影响 第一,对使用Codex或API构建编程智能体的团队,Ultrafast提供了一个明确的速度档位。当任务由许多小步骤组成时,生成速度的提升能更直接地转化为交付速度。第二,对产品团队而言,交互式应用可以在不更换模型能力的前提下获得更好的响应。第三,企业在选型时需要读Ultrafast指南,核对价格与限制,再决定哪些环节值得用高速模式,哪些仍用标准模式。速度与成本通常是取舍关系,原文并未给出价格,所以任何成本收益判断都应等到官方定价明确之后再做。 六、产业意义与趋势 从产业角度看,这则消息有三层含义。其一,NVIDIA与OpenAI的合作继续深化,并且以具体产品形态呈现:一个可用的、速度明显更高的服务档位。其二,推理延迟正在成为前沿模型竞争的独立维度。过去的竞争焦点集中在模型能力和训练规模,现在,同等能力下谁响应更快,同样能形成差异。其三,「AI辅助硬件优化」这一趋势值得关注:模型被用来写内核、调软件,使硬件生态的文档质量和可编程性成为竞争力的一部分。NVIDIA多年来在工具和文档上的积累,在这里被OpenAI直接点名为优势。 七、挑战与展望 仍有几个问题待观察。8倍的提速在不同负载、不同输出长度和不同并发下是否稳定,原文没有说明。Ultrafast的定价、配额和可用地区也需看官方指南。此外,对NVIDIA的深度依赖,意味着此类优化高度绑定于具体硬件架构。NVIDIA还宣布GTC Berlin将于10月20日至22日举行,相关的更多技术细节可能会在会上披露。同时,NVIDIA近期的MLPerf Inference v6.1成绩与CoreWeave合作等消息,共同勾勒出一条从训练到生产、面向智能体AI的基础设施叙事。对开发者而言,最务实的做法是:在自己的工作流中实测,用端到端耗时和成本而不是单一的token速度来衡量价值。