NVIDIA Blackwell GPU 驅動 OpenAI GPT-6 Astra Ultrafast:token 生成速度最高提升 8 倍
NVIDIA 官方部落格披露,OpenAI 的 GPT-6 Astra Ultrafast 執行在 Blackwell GPU 上,已透過 API 及符合條件的 ChatGPT Work 和 Codex 開放。官方稱其 token 生成速度最高可達 Astra 標準模式的 8 倍,面向程式碼生成、工具呼叫和互動應用。OpenAI 還用自家模型最佳化推理軟體。價格與吞吐資料未公佈。
2026年10月1日,NVIDIA在官方部落格上釋出文章《How NVIDIA GPUs Help Accelerate OpenAI's GPT-6 Astra Ultrafast》,作者為Dion Harris。文章披露:OpenAI的GPT-6 Astra Ultrafast執行在NVIDIA Blackwell GPU之上,現已透過OpenAI API上線,並向符合條件的ChatGPT Work和Codex使用者開放。官方給出的核心數字是,Ultrafast模式的token生成速度最高可達Astra標準模式的8倍。 一、釋出了什麼 Ultrafast不是一個全新的模型,而是GPT-6 Astra的一種高速服務模式。它面向對時延敏感的場景:程式碼生成、工具呼叫和互動式應用。NVIDIA在文中強調,這一提速來自兩方面:一是Blackwell架構本身的能力,二是OpenAI透過自家模型持續進行的推理最佳化。開發者現在即可透過API使用,訪問方式、定價和實現細節寫在OpenAI的Ultrafast指南中。需要說明的是,原文沒有公佈Ultrafast的具體價格,也沒有給出單卡或單機架的吞吐資料,更沒有披露用了多少塊GPU。因此,8倍這個數字應理解為官方對「token生成速度」的最高值表述,而不是所有負載下的保證值。
二、為什麼速度對智慧體如此重要 文章用一句話點出了關鍵:快的響應,只有在整個工作流裡被反覆累積時才最有價值。以程式設計智慧體為例,它先寫程式碼,再呼叫工具,檢查結果,然後決定下一步。每一輪都要等待模型生成一段文字,這些等待疊加起來,就構成了開發者感受到的「編輯、測試、除錯」迴圈時長。當單次生成提速數倍,整個迴圈的牆鍾時間就會明顯縮短。對互動式應用來說,響應更快也意味著使用者體驗更流暢。換句話說,Ultrafast瞄準的不是單次問答的延遲,而是多步驟智慧體任務的端到端效率。 三、技術機制:模型反過來最佳化自己的推理棧 這篇文章最有意思的部分,是兩位OpenAI高管的表述。OpenAI推理負責人Philippe Tillet表示,NVIDIA在工具鏈和文件上的深入投入,使OpenAI的模型在為Blackwell和Rubin GPU編寫程式方面表現得異常出色。他說,Astra可以把這些知識轉化為高效能核心,讓NVIDIA硬體在延遲、吞吐和成本的整條前沿曲線上都有競爭力。 OpenAI算力技術長Uday Ruddarraju則說,團隊使用內部模型來最佳化NVIDIA GPU上的推理,而NVIDIA平臺的可程式設計性幫助他們交付了Ultrafast背後的加速。文章還指出,OpenAI正在用自己的模型改進執行在NVIDIA GPU上的推理軟體,利用平臺的可程式設計性去測試並落地改進。這類工作可以讓模型響應隨時間越來越快,也讓已部署的基礎設施越來越高效。 這裡的邏輯鏈條是:GPU核心決定了注意力計算、矩陣乘法、通訊等環節的實際效率;核心編寫又極度依賴對硬體細節的理解;NVIDIA提供了完整的文件和工具;足夠強的模型讀懂這些資料後,可以自己寫出並調優核心。於是,「模型最佳化推理,推理讓模型服務更快」形成了一個閉環。需要提醒的是,原文沒有給出具體是哪些核心、哪些演算法被模型最佳化過,也沒有披露最佳化前後的對照資料,這部分仍是定性描述。
四、可程式設計性與資源複用 文章的另一個論點是平臺的靈活性。可程式設計的NVIDIA平臺讓開發者和研究人員能夠在訓練、推理和強化學習之間複用同一套基礎設施,隨著模型演進而調整。這種靈活性使團隊可以隨需求變化重新分配算力,提高利用率,避免為每一種負載單獨過度配置。對運營方而言,這直接關係到投資回報:同一批GPU在白天可以服務低延遲推理,在其他時段可以轉去做訓練或強化學習。這與NVIDIA同日釋出的另一篇文章所談的AI工廠「高效、耐用、可替換」思路相呼應。 五、對開發者與企業的實際影響 第一,對使用Codex或API構建程式設計智慧體的團隊,Ultrafast提供了一個明確的速度檔位。當任務由許多小步驟組成時,生成速度的提升能更直接地轉化為交付速度。第二,對產品團隊而言,互動式應用可以在不更換模型能力的前提下獲得更好的響應。第三,企業在選型時需要讀Ultrafast指南,核對價格與限制,再決定哪些環節值得用高速模式,哪些仍用標準模式。速度與成本通常是取捨關係,原文並未給出價格,所以任何成本收益判斷都應等到官方定價明確之後再做。
六、產業意義與趨勢 從產業角度看,這則訊息有三層含義。其一,NVIDIA與OpenAI的合作繼續深化,並且以具體產品形態呈現:一個可用的、速度明顯更高的服務檔位。其二,推理延遲正在成為前沿模型競爭的獨立維度。過去的競爭焦點集中在模型能力和訓練規模,現在,同等能力下誰響應更快,同樣能形成差異。其三,「AI輔助硬體最佳化」這一趨勢值得關注:模型被用來寫核心、調軟體,使硬體生態的文件質量和可程式設計性成為競爭力的一部分。NVIDIA多年來在工具和文件上的積累,在這裡被OpenAI直接點名為優勢。 七、挑戰與展望 仍有幾個問題待觀察。8倍的提速在不同負載、不同輸出長度和不同併發下是否穩定,原文沒有說明。Ultrafast的定價、配額和可用地區也需看官方指南。此外,對NVIDIA的深度依賴,意味著此類最佳化高度繫結於具體硬體架構。NVIDIA還宣佈GTC Berlin將於10月20日至22日舉行,相關的更多技術細節可能會在會上披露。同時,NVIDIA近期的MLPerf Inference v6.1成績與CoreWeave合作等訊息,共同勾勒出一條從訓練到生產、面向智慧體AI的基礎設施敘事。對開發者而言,最務實的做法是:在自己的工作流中實測,用端到端耗時和成本而不是單一的token速度來衡量價值。