NVIDIA/CoreWeave/官方:Vera Rubin NVL72 上線生產——Cognition 首客 SWE-2 吞吐量達四點八倍;推出 Forge 閉環代理開發

Key takeaway

NVIDIA 與 CoreWeave 於二零二六年九月三十日在 Fully Connected 大會宣布:Vera Rubin NVL72 已在 CoreWeave 雲上進入生產可用,代理編程實驗室 Cognition(Devin)成為首名跑生產負載的客戶,並在 SWE-2 推斷工作負載上相對 GB200 NVL72 測得最高約四點八倍總代幣吞吐量;同日推出 Forge 開發層,把訓練、觀測、評估與代理改進串成閉環。以下內容已核對 NVIDIA 官方博客與 CoreWeave 新聞稿。

NVIDIA/CoreWeave/官方:Vera Rubin NVL72 上線生產——Cognition 首客 SWE-2 吞吐量達四點八倍;推出 Forge 閉環代理開發

NVIDIA 與 CoreWeave 於二零二六年九月三十日在 Fully Connected 大會宣布:Vera Rubin NVL72 已在 CoreWeave 雲上進入生產可用,代理編程實驗室 Cognition(Devin)成為首名跑生產負載的客戶,並在 SWE-2 推斷工作負載上相對 GB200 NVL72 測得最高約四點八倍總代幣吞吐量;同日推出 Forge 開發層,把訓練、觀測、評估與代理改進串成閉環。以下內容已核對 NVIDIA 官方博客與 CoreWeave 新聞稿。

NVIDIA/CoreWeave/官方:Vera Rubin NVL72 上線生產——Cognition 首客 SWE-2 吞吐量達四點八倍;推出 Forge 閉環代理開發

NVIDIA 與專攻 AI 雲的 CoreWeave 在三藩市舉行的 Fully Connected 活動上,同步公布新一代機架級加速平台上線、面向代理工作負載的 CPU,以及把「生產訊號回流訓練」串起來的開發環境。本文已對照 NVIDIA 官方博客〈From Training to Production, NVIDIA and CoreWeave Close the Loop on Agentic AI〉與 CoreWeave 兩則新聞稿,來源真實性已驗證;數字以官方表述為準,不另行推算。

一、核心事件:Vera Rubin 進入生產,Cognition 交出首批實測

技術細節

CoreWeave 宣布在自家雲上提供 NVIDIA Vera Rubin NVL72,並搭配 Spectrum-X 一百零二點四 Tbps 乙太網路。公司強調,客戶可沿用與既有 GB200/GB300 NVL72 機隊相同的操作模型與工具鏈上線。活動號稱匯聚逾四千五百名客戶、合作夥伴與開發者。

Cognition(Devin AI 軟件工程代理背後的應用實驗室)被雙方點名為「首名在 Vera Rubin 上跑生產負載」的客戶。Cognition 在 CoreWeave 上於約九個月內把訓練與推斷擴至數千顆 GPU;九月初與 CoreWeave 拉起 Vera Rubin 叢集後,由 Cognition 工程師以真實軟件工程任務(抽樣 FrontierCode 子集、部署代理求解)對照 GB200 NVL72 基線做推斷基準測試。官方披露:在 SWE-2 推斷工作負載上,Vera Rubin NVL72 相對 GB200 NVL72 可達最高約四點八倍總代幣吞吐量;強化學習工作負載的輸出代幣吞吐量亦錄得約三點八倍提升。Cognition 創始團隊成員 Silas Alberti 指,代理編程需要長上下文、高並發與「每步都等上一步」的串行推理,吞吐量提升會直接疊加到 Devin 可完成的工作量。

二、技術原理:代理式負載如何壓測整棧

代理式 AI 同時從兩端擠壓基建:線上服務要低延遲、大規模並發推斷;離線改進(強化學習、工具調用評估)又要一次開出成千上萬個隔離執行環境。NVIDIA 與 CoreWeave 的敘事是:把加速計算、網路與軟件當成「單一系統」交付,而不是只賣更快的 GPU。

在 CPU 側,CoreWeave 將提供 NVIDIA Vera——官方稱為「首款為 AI 代理打造的 CPU」。NVIDIA 博客寫明:單機架可部署一百二十八顆 Vera CPU、合共一萬一千二百六十四核心,理論上可支撐逾一萬一千個「每環境一核心」的並發隔離環境;搭配 CoreWeave Sandboxes、Spectrum-X 交換與 BlueField-4 DPU,讓沙盒與訓練作業並存且維持低延遲通訊。測試數據包括:Vera CPU 上代理沙盒啟動時間加快逾三倍;Terminal-Bench 上通過任務整體表現約一點七倍。

在「閉環」側,CoreWeave 同日推出 Forge:把 Weights & Biases Models、OpenPipe 的後訓練能力,以及開源 marimo 筆記本專案,與 CoreWeave 自身服務(含 Registry、Notebooks、可觀測性)收進同一連接環境,強調跨模型、框架與其他雲仍可接駁,避免生產軌跡與下一輪訓練在工具交接時斷訊。Forge 公布的能力包括:一般可用的 ARIA(分析實驗與代理觀測數據、提出下一輪實驗)、Agent Lens(把海量生產代理軌跡轉成可行動洞察;CoreWeave 稱相對通用前沿模型基線可多偵測約兩成關鍵失敗)、一般可用的 Sandboxes,以及無須自管訓練叢集的 Serverless 監督微調/Serverless RL(NVIDIA 博客引述 Serverless RL 較自管設置快約一點四倍、成本低約四成)。Canva、MasterClass 等已被點名為早期使用者;NVIDIA 文中亦提到 Capital One。

四、日常應用場景

1. 開發者與技術團隊

代理編程、長上下文推理與高並發工具調用,正好對應「吞吐決定能出多少貨」的成本曲線。Cognition 的公開對照(SWE-2 推斷約四點八倍總代幣吞吐)提供一個可引用的機架代際差值,方便團隊評估是否值得從 GB200 級叢集遷到 Vera Rubin,或把沙盒/RL 評估搬到 Vera CPU 密度更高的執行層。

2. 企業與隱私敏感行業

NVIDIA 博客舉例:居家護理機構 Ennoble Care(服務美國約十五州、約五萬名高需求 Medicare 患者)選擇在 CoreWeave Kubernetes Service 上以預留的 NVIDIA RTX PRO 6000 容量跑臨床文件、決策支援與後台自動化代理。對受規管行業而言,重點不只是峰值吞吐,而是「生產軌跡能否安全回流改進」與隔離執行是否可稽核——Forge/Sandboxes/Agent Lens 的產品組合正朝這個方向包裝。

3. 一般用戶

終端使用者未必直接租 NVL72,但會感受到代理產品(編程助手、客服代理、內容工作流)的回應速度與穩定度。當雲端供應商能把新一代機架在數日內接入既有操作面,產品團隊把實驗變線上功能的週期會縮短。

4. 香港與亞洲市場視角

香港企業若在內部推代理式自動化,常見瓶頸是:公有 API 用量暴衝、上下文一長成本失控,以及評估/回歸環境難以與生產同構。不一定人人都要上 Vera Rubin;更務實的是先釐清「哪些步驟必須長上下文代理、哪些可改成私有模型或規則引擎」,再用可量測的吞吐與隔離沙盒控制單位成本。亞洲多地已有 GPU 雲與主權部署需求,機架代際與「生產—訓練閉環」工具鏈,會直接影响本地 ISV 能否在合理單價下交付穩定代理服務。

五、專業評價與潛在考量

優勢

  • 有具名生產客戶(Cognition)與可核對的相對基線(GB200 NVL72),不是純路線圖簡報。
  • 同時覆蓋推斷機架(Vera Rubin NVL72)、代理沙盒密度(Vera CPU)與開發閉環(Forge),對準代理式工作負載的完整壓力面。
  • 強調跨代 GPU 仍可在同一操作面混用,降低「只能全數汰換」的遷移阻力。

需要留意的地方

  • 四點八倍、三點八倍等數字來自 Cognition/CoreWeave 在特定 SWE-2 與 RL 工作負載上的早期測試,不能直接外推到所有模型或業務場景。
  • Vera Rubin 目前屬有限/早期可用敘事,產能、區域與配額仍取決於供應商排程。
  • Forge 整合多家工具,企業仍需自行評估資料駐留、實驗追蹤與生產軌跡的合規邊界;Agent Lens 等百分比為供應商基準測試表述,導入前應以自身流量覆核。

結語

九月三十日這組發布,把「新機架上線」與「代理如何持續變好」捆在同一天:Cognition 用 Vera Rubin 交出相對 GB200 的吞吐對照,Forge 則試圖把生產觀測接回訓練與評估。對正在評估代理式開發或企業自動化的團隊,值得盯的是可覆核的工作負載數字,以及閉環工具能否接上現有模型與雲,而不是單一規格表。

若香港企業希望在地部署私有模型與代理工作流、控制數據出境與單位代幣成本,可參考 YSK Limited 的企業私有 LLM 全託管方案(年費 HK$88,000 起,Dataset → QLoRA/LoRA → 私有 API):https://ysk.hk/services/ai-automation


參考來源

Related services & products