當AI工廠從數千顆GPU擴大至數十萬顆GPU,一條速度過慢或發生壅塞的連線,就可能讓大量加速器陷入等待,再高的GPU峰值效能也難以完全發揮。輝達(NVIDIA,NASDAQ:NVDA)今(22)日發表新一代Spectrum-6乙太網路交換器系統,每秒傳輸速率達102.4 Tb,容量為前代兩倍;輝達宣稱,Spectrum-X平台可在超過10萬顆GPU的部署環境中維持最高95%的網路效率,CoreWeave、微軟、Nebius、SpaceXAI與Tesla將成為首批導入業者。
Spectrum-6專為Vera Rubin平台及百萬瓩級、相當於1GW規模的AI工廠設計。隨著前沿模型、代理型AI與物理AI需要愈來愈多GPU協同運算,網路已從資料傳輸工具,轉變為決定GPU利用率、模型訓練時間與每詞元成本的核心基礎設施。
AI工廠邁向百萬瓩 GPU峰值效能不等於整體算力
傳統企業資料中心的乙太網路,主要處理使用者、伺服器及儲存系統間的南北向流量,但大型AI模型訓練及推論,需要數千乃至數十萬顆GPU持續交換資料,形成龐大的東西向流量。
尤其在集體通訊工作中,各個GPU必須同步交換運算結果。只要部分節點出現延遲、封包遺失或網路壅塞,就可能迫使其他GPU等待,導致昂貴的加速器無法維持滿載。
因此,單看GPU的理論峰值效能,已不足以衡量AI工廠的實際產出。交換器頻寬、網路路由、壅塞控制、故障復原及光學傳輸,均會影響整套系統能否有效擴展。
Spectrum-6速度達102.4 Tb/s 容量較前代增加一倍
Spectrum-6是新一代Spectrum-X乙太網路平台的核心,單一交換器系統每秒傳輸速率達102.4 Tb,容量較前代提高一倍,並與ConnectX-9 SuperNIC、網路軟體及Vera Rubin平台共同設計。
不同於通用型乙太網路,Spectrum-X導入自適應路由、進階壅塞控制及即時遙測,能根據網路狀況在多條可用路徑間平衡流量。當部分連線發生故障時,系統也可重新安排傳輸路徑,並針對未能抵達目的地的資料進行復原。
輝達表示,Spectrum-X的AI網路效能最高可達通用型乙太網路的1.6倍,即使部署環境超過10萬顆GPU,網路效率仍最高可維持95%。透過硬體加速的多平面網路拓樸,資料中心所需的交換器數量則可減少1.7倍。
不過,上述數字均為輝達依特定測試或設計條件提供的結果,實際表現仍取決於模型架構、叢集規模、網路拓樸、軟體設定及工作負載。
CoreWeave、微軟率先部署 Tesla也將導入
CoreWeave(NASDAQ:CRWV)、微軟(NASDAQ:MSFT)、Nebius(NASDAQ:NBIS)、SpaceXAI與Tesla(NASDAQ:TSLA)將成為首批導入Spectrum-6的企業。其中,CoreWeave、微軟與Nebius將部署搭載Spectrum-6的Vera Rubin基礎設施,提供開發者、新創公司及企業使用。














































