AI算力競賽的下一個關鍵,不再只是GPU跑得多快,而是每一瓦電力究竟能產生多少詞元。輝達(NVIDIA,NASDAQ:NVDA)今(22)日宣布,新一代Vera Rubin NVL72正加速量產,CoreWeave、Google Cloud、Microsoft Azure與Oracle Cloud Infrastructure均已開始運行相關機架。根據CoreWeave針對DeepSeek-R1進行的首批實機測試,Vera Rubin NVL72每百萬瓦、每秒產生的詞元數,較Grace Blackwell NVL72提升10倍;Google Cloud也宣稱,採用Vera Rubin的新一代A5X執行個體,每詞元推論成本最高可降至前代的十分之一。
隨著AI從聊天機器人走向能夠推理、規劃、使用工具及執行任務的代理型AI,詞元消耗量可能達傳統AI應用的15倍。在資料中心電力供給日益受限之下,如何以相同電力產生更多詞元,並降低每百萬詞元成本,已成為雲端服務商與AI開發業者能否擴大商業化的關鍵。
CoreWeave首度公布實機成績 每百萬瓦詞元產出增10倍
CoreWeave(NASDAQ:CRWV)經過數月共同開發,成為首家啟用並驗證Vera Rubin NVL72的AI雲端業者,並公布首批由實際硬體測得的效能數據。
CoreWeave在Vera Rubin NVL72上執行DeepSeek-R1基準測試,結果顯示,每百萬瓦、每秒產生的詞元數,較Grace Blackwell NVL72提升10倍。這項數據並非泛指Vera Rubin所有工作負載的效能均提升10倍,而是在特定模型與電力條件下,衡量系統能以多少電力預算產生多少詞元。
DeepSeek-R1採用混合專家(MoE)架構,每個詞元都必須在分散式專家子網路之間進行路由,GPU間的通訊能力因此直接影響運算效率。Vera Rubin NVL72透過總頻寬達260 TB/s的NVLink 6全互連架構,讓整座機架可近似單一大型加速器運作,降低資料傳輸成為瓶頸的機率。
對AI雲端業者而言,每百萬瓦能產生更多詞元,代表在相同電力容量下可以承接更多工作負載;若工作量不變,則有機會降低電力需求與服務成本。包括Jane Street在內的企業與AI實驗室,將透過CoreWeave雲端採用Vera Rubin平台。
七款晶片協同設計 輝達把整座AI工廠視為單一系統
Vera Rubin並非只靠Rubin GPU提升效能。輝達此次從晶片、機櫃托盤、網路到冷卻系統進行協同設計,整套平台涵蓋七款晶片與五種機櫃托盤,包括Vera Rubin NVL72、Vera CPU機架、Groq 3 LPX、Spectrum-6 SPX及Vera BlueField-4 STX。
輝達表示,這些元件從設計之初便以整套AI系統為目標,而非將個別市售零組件組合後再進行最佳化。這項策略也反映輝達的市場定位,正從GPU供應商進一步擴展為涵蓋CPU、GPU、網路、DPU、軟體與冷卻系統的AI基礎設施平台業者。
其中,Vera CPU是專為代理型工作負載打造的處理器。依輝達提供的數據,其客製化Olympus核心相較競爭對手的小晶片設計,單執行緒效能提升2倍、核心間頻寬提高3倍,記憶體延遲則降低40%。
AI雲端平台DeepInfra進一步測試發現,在維持相同服務品質的條件下,Vera CPU最高可支援1.6倍的並行AI代理,協調速度最高達其他CPU的2.2倍。DeepInfra目前每週處理近5兆個詞元,其中約30%來自代理型系統,測試結果凸顯CPU在模型呼叫、資料移動及工具使用等環節的重要性。
Google Cloud推出A5X 跨站最多擴展近百萬顆GPU
Vera Rubin也已進入Google Cloud。Google母公司Alphabet(NASDAQ:GOOGL)推出的A5X裸機執行個體,以Vera Rubin NVL72機架級系統為基礎,並結合ConnectX-9 SuperNIC與Google新一代Virgo網路。
依Google Cloud規畫,A5X叢集在單一站點可擴展至數萬顆Rubin GPU,多站點配置最多可接近100萬顆GPU,可用於訓練、調校及部署前沿模型、開放模型、代理型AI與物理AI模型。
倫敦新創公司Ineffable Intelligence已率先啟用A5X,開發能從環境互動與經驗中持續學習的「超級學習者」系統。與仰賴靜態資料集的大型語言模型不同,這套系統透過強化學習,在大量平行模擬環境中產生經驗,再將結果轉換為策略更新與評估,因而高度仰賴運算能力、記憶體頻寬及低延遲互連。
Ineffable Intelligence共同創辦人Lasse Espeholt表示:「下一代研究需要下個世代的硬體。」他指出,公司幾乎立即完成Vera Rubin系統啟用,目前已開始測試用於超級學習者的基礎設施。
微軟攜Mistral擴大歐洲部署 數千顆Rubin支撐主權AI
微軟(NASDAQ:MSFT)與法國AI新創Mistral也將以Vera Rubin為基礎,擴大在歐洲的AI基礎設施合作。根據雙方價值數十億美元的新協議,Mistral將採用數千顆Vera Rubin GPU,擴充模型訓練、推論與大規模部署所需的運算資源。
Mistral Medium 3.5與OCR 4已進入Microsoft Foundry,Mistral模型也整合至Microsoft Copilot Studio。透過Azure Local與Foundry Local,政府機關及受監管企業可在公有雲、與雲端連線的私有環境,或完全離線的環境中運行相同模型。
這項布局反映歐洲AI市場的特殊需求。金融、醫療與政府機關除了要求運算效能,也重視資料控制、在地部署、法規遵循及基礎設施韌性。Vera Rubin因此不只是微軟與Mistral擴充算力的工具,也成為雙方切入歐洲主權AI市場的基礎。
高溫液冷降低用水 AI工廠開始比能源效率
面對AI系統功耗與冷卻需求增加,Vera Rubin NVL72將液冷進水溫度提高至攝氏45度,可在不使用冷卻機的情況下,搭配乾式冷卻及閉迴路液冷系統運作。輝達估算,對新建AI工廠而言,每部署100萬瓩規模,每年可節省數百萬加侖用水。
經過三代機架級協同設計,Vera Rubin的運算托盤內也不再設置纜線、風扇或軟管,使托盤組裝時間從數小時縮短至約1分鐘。
從CoreWeave的實機測試、Google Cloud的近百萬顆GPU跨站規畫,到微軟與Mistral的歐洲部署,可以看出Vera Rubin的競爭焦點,已不只是單顆GPU效能。當AI產業開始受到電力、冷卻及推論成本制約,誰能以更少能源生產更多詞元,才可能決定下一階段AI基礎設施的經濟效益。