2026 年 AI 伺服器架構:GPU 叢集、NVLink 與高速互連

modern%20workspace%20with%20laptop%2C%20smartphone...
發表時間:2026 年 09 月 17 日 | 更新日期:2026 年 09 月 17 日 | 編輯:雅寶社區編輯團隊
2026 年 AI 伺服器架構:GPU 叢集、NVLink 與高速互連 - 雅寶社區 · 頂客論壇

1.3 三大瓶頸:記憶體牆、互連牆、功耗牆

要理解 2026 年的架構設計,必須同時看懂三道牆:

記憶體牆:HBM 的容量與頻寬成長速度,跟不上模型參數的膨脹。一顆 2026 年的旗艦 GPU 配備 288GB 的 HBM4,頻寬約 8TB/s,但一個兆級參數的模型光是權重就要吃掉數 TB 的記憶體。這迫使架構必須支援跨 GPU 的記憶體共享,而這正是 NVLink 存在的理由。

互連牆:前面提過,GPU 之間的頻寬成長遠慢於算力成長。這導致 GPU 利用率經常卡在 40% 到 60% 之間,其餘時間都在等資料。2026 年的解決方案是把互連拓樸從「胖樹」改成「全連接」,並導入光互連來突破銅線的物理極限。

功耗牆:一個 GB200 NVL72 機櫃的功耗約 120kW,到了 2026 年的 Rubin 世代,單一機櫃突破 200kW 已是常態。傳統的 12V 供電與氣冷散熱完全無法應付,這迫使整個產業轉向 48V/800V 直流供電與液冷架構。功耗不再只是電費問題,而是直接決定了機櫃能塞進多少顆 GPU。

二、GPU 叢集架構:從單機多卡到「機櫃即電腦」

理解了三大瓶頸之後,我們可以開始拆解 2026 年 AI 伺服器的實際架構。這一節會從最小的節點層級,一路講到機櫃與 Pod 層級。

2.1 節點內架構:8 GPU 基準與 NVLink 全連接

傳統的 AI 伺服器節點(如 DGX H100)採用 8 顆 GPU 的設計,這不是隨便選的數字,而是與 PCIe 通道數、電源供應與散熱能力妥協後的結果。在 8 GPU 的節點內,最理想的拓樸是「全連接」(Full Mesh),也就是每一顆 GPU 都與其他 7 顆直接相連,不需要經過任何交換器。

但全連接的連線數是 n × (n-1) / 2,當 GPU 數量增加,線路複雜度呈平方成長。8 顆 GPU 需要 28 條連結,還可以接受;但 16 顆就要 120 條,實務上幾乎不可能用銅線佈線。這就是為什麼超過 8 GPU 之後,架構必須轉向「交換式」(Switched)設計。

2026 年的節點內架構有幾個關鍵特徵:首先是 NVLink 第五代(或第六代)成為標配,每顆 GPU 的雙向頻寬達到 1.8TB/s 甚至 3.6TB/s;其次是 GPU 與 CPU 之間的連結也開始採用 NVLink-C2C,讓 Grace CPU 與 Blackwell GPU 之間的頻寬達到 900GB/s,遠超傳統 PCIe Gen5 的 128GB/s。

2.2 機櫃級架構:NVL72 與超級晶片設計

2024 年 NVIDIA 推出 GB200 NVL72,徹底改變了業界對「伺服器」的定義。它不是把 72 顆 GPU 塞進一個機櫃,而是把 72 顆 GPU 與 36 顆 Grace CPU 用 NVLink 背板串成一個「單一運算網域」,總 NVLink 頻寬達到 130TB/s。這意味著在這個機櫃內,所有 GPU 都可以直接存取彼此的 HBM,就像它們共享同一個記憶體池。

到了 2026 年,這個概念被進一步推展。Vera Rubin 世代的 NVL144 將單一 NVLink 網域擴展到 144 顆 GPU,總頻寬突破 260TB/s。更誇張的是,NVIDIA 已經預告 2027 年的 Rubin Ultra NVL576,要把 576 顆 GPU 串進同一個網域。這已經不是「伺服器」,而是「超級電腦機櫃」。

這種架構的關鍵在於「銅背板」(Copper Backplane)。在機櫃內,NVIDIA 採用高密度銅纜與 PCB 背板來連接所有 GPU 與 NVSwitch,而不是光纖。原因是銅線的延遲較低、成本較便宜,且不需要光電轉換。但銅線的傳輸距離有限(通常 2 公尺以內),這也是為什麼機櫃的物理尺寸被限制在一個標準 42U 機櫃的範圍內。

世代

代表產品

NVLink 網域規模

總互連頻寬

推出時間

Hopper

DGX H100

8 GPU

7.2 TB/s

2022

Blackwell

GB200 NVL72

72 GPU

130 TB/s

2024

Blackwell Ultra

GB300 NVL72

72 GPU

130 TB/s

2025

Vera Rubin

VR NVL144

144 GPU

260 TB/s

2026

Rubin Ultra

NVL576

576 GPU

1,100 TB/s

2027

2.3 多機櫃叢集與 Pod 級拓樸

單一機櫃再強,也裝不下十萬顆 GPU。當訓練規模超過單一 NVLink 網域,就必須進入 Scale-out 階段,把多個機櫃用高速網路串起來。2026 年的主流做法是組成「Pod」:每個 Pod 包含數個 NVL72 或 NVL144 機櫃,機櫃之間用 800G 或 1.6T 的 InfiniBand 或 Spectrum-X 乙太網路互連。

這裡的拓樸選擇非常關鍵。傳統資料中心常用的是三層胖樹(Fat-Tree),但在 AI 叢集中,業界越來越傾向採用「軌道最佳化」(Rail-Optimized)或「非阻塞多軌」(Multi-Rail)拓樸。原因是 AI 訓練的通訊模式非常規律:張量並行在機櫃內進行,資料並行則在機櫃之間進行,而資料並行的通訊通常發生在「同一軌道」的 GPU 之間。

如果網路拓樸能夠配合這種規律,讓同一軌道的 GPU 之間只需要一跳(One Hop)就能通訊,就能大幅降低延遲與交換器成本。這也是為什麼 2026 年的 AI 資料中心網路設計,已經從「通用型」轉向「AI 專用型」。

三、NVLink 與 NVSwitch:GPU 之間的高速公路

如果說 GPU 是 AI 伺服器的引擎,那 NVLink 就是傳動軸,NVSwitch 則是變速箱。這一節我們要深入拆解這兩項技術的運作原理與最新規格。

3.1 NVLink 技術演進與頻寬規格

NVLink 是 NVIDIA 在 2016 年隨 P100 推出的專有互連技術,目的很簡單:取代 PCIe 成為 GPU 之間的主要通道。PCIe Gen5 x16 的雙向頻寬只有 128GB/s,對於需要頻繁交換梯度的 AI 訓練來說,完全是杯水車薪。NVLink 的出現,讓 GPU 之間的頻寬提升了十倍以上。

以下是 NVLink 各世代的規格對照:

世代

每 GPU 雙向頻寬

搭配 GPU

推出年份

NVLink 1

160 GB/s

P100

2016

NVLink 2

300 GB/s

V100

2017

NVLink 3

600 GB/s

A100

2020

NVLink 4

900 GB/s

H100

2022

NVLink 5

1,800 GB/s

B200 / GB200

2024

NVLink 6

3,600 GB/s

Rubin

2026

可以看到,NVLink 的頻寬幾乎每兩年翻倍。到了 2026 年的 NVLink 6,每顆 GPU 的雙向頻寬達到 3.6TB/s,這已經超越許多資料中心骨幹網路的頻寬。這個數字之所以重要,是因為它直接決定了「單一 NVLink 網域」能支援多大的模型。

舉例來說,一個 1.8 兆參數的 MoE 模型,如果用 FP8 精度儲存,權重約需 1.8TB 記憶體。在 GB200 NVL72 架構下,72 顆 GPU 各配備 192GB HBM3e,總記憶體為 13.8TB,足以完整裝載模型。而 NVLink 5 的頻寬,則確保了專家之間的切換與激活值交換不會成為瓶頸。

3.2 NVSwitch 的無阻塞交換架構

有了 NVLink 這條高速公路,還需要一個交流道系統,這就是 NVSwitch。第一代 NVSwitch 在 2018 年隨 DGX-2 推出,當時是 16 顆 GPU 的全連接交換器,總頻寬 2.4TB/s。到了 2026 年,NVSwitch 已經進化到第五代,單顆晶片就能支援 72 個 NVLink 埠,總交換容量達到 14.4TB/s。

NVSwitch 的核心價值在於「無阻塞」(Non-Blocking)。這意味著在任何時刻,任意兩顆 GPU 之間的資料傳輸,都不會因為其他 GPU 的傳輸而等待。在傳統的胖樹網路中,當多顆 GPU 同時傳輸時,會產生「壅塞」(Congestion),導致某些 GPU 必須等待。但在 NVSwitch 的架構下,內部採用的是 Crossbar 交換結構,理論上可以同時支援所有埠的全速傳輸。

這對於張量並行特別重要。張量並行會將同一個矩陣乘法拆散到多顆 GPU 上,每一層運算都需要 All-Reduce 同步。如果同步過程中出現壅塞,GPU 就會閒置,直接拉低訓練效率。NVSwitch 的無阻塞設計,讓這種同步的延遲降到最低。

2026 年的 NVSwitch 還有一個新特點:它開始支援「記憶體語意」(Memory Semantics)。也就是說,GPU 之間的資料交換不再只是「訊息傳遞」,而是可以直接讀寫遠端 GPU 的 HBM。這個功能對於 KV Cache 的共享特別有用,因為推論時不同 GPU 可以共享同一份上下文快取,大幅降低記憶體佔用。

3.3 NVLink 與 PCIe 的角色分工

很多人會問:既然 NVLink 這麼快,為什麼不全部用 NVLink 取代 PCIe?答案是成本與通用性。NVLink 是專有技術,需要專用的交換器與背板,成本極高。而 PCIe 是業界標準,幾乎所有周邊裝置都支援。

2026 年的典型架構是「分工明確」:

  • NVLink:負責 GPU 與 GPU 之間、GPU 與 Grace CPU 之間的高頻寬資料交換。這是 AI 運算的核心通道。
  • PCIe Gen6:負責連接 SSD、網路卡、DPU 等周邊裝置。PCIe Gen6 的 x16 雙向頻寬約 256GB/s,足以應付儲存與一般網路需求。
  • NVLink-C2C:負責 CPU 與 GPU 之間的晶片級互連,頻寬達 900GB/s,主要用於 Grace Hopper 與 Grace Blackwell 超級晶片。
  • 值得注意的是,2026 年 PCIe Gen7 的規範已經底定,預計 2027 年開始商用。屆時 PCIe 的頻寬將達到 512GB/s,雖然仍不及 NVLink,但差距會逐漸縮小。這也讓部分業界人士開始思考:未來 NVLink 的優勢會不會被 PCIe 追上?目前看來,短期內不會,因為 NVLink 的優勢不只是頻寬,還有更低的延遲與更完整的記憶體一致性協定。

    四、高速互連技術全景:InfiniBand、RoCE 與新興標準

    看完了節點與機櫃內的架構,現在把視角拉到機櫃之間。這是 Scale-out 的戰場,也是 2026 年變化最劇烈的地方。過去 InfiniBand 幾乎壟斷了 AI 叢集的網路市場,但乙太網路陣營正急起直追,而 UALink 與 Ultra Ethernet 等新標準也在改寫遊戲規則。

    4.1 InfiniBand NDR 與 XDR 的技術優勢

    InfiniBand 長期以來是高效能運算(HPC)與 AI 訓練的首選網路。它的優勢在於原生支援 RDMA(Remote Direct Memory Access),可以讓 GPU 直接讀寫遠端節點的記憶體,完全繞過 CPU 與作業系統核心,達到微秒級的延遲。

    2026 年的主流規格是 NDR(400Gb/s)與 XDR(800Gb/s)。NVIDIA 在 2024 年推出 Quantum-X800 交換器,支援 XDR 與 SHARPv4(可擴展階層聚合與歸約協定)。SHARP 是一項殺手級功能,它把 All-Reduce 的加法運算直接下放到交換器裡執行,網路流量可以减少一半以上,對於動輒數萬顆 GPU 的訓練叢集來說,效果極為顯著。

    InfiniBand 的另一個優勢是「自適應路由」(Adaptive Routing)。在大型叢集中,網路壅塞是常態,InfiniBand 可以在封包層級動態調整路徑,避開壅塞的鏈路。這對於 AI 訓練這種突發性極強的通訊模式來說,是非常關鍵的能力。

    4.2 RoCEv2 與乙太網路的逆襲

    InfiniBand 雖然強大,但成本高昂且供應商單一(基本上就是 NVIDIA)。這讓許多超大規模資料中心業者(如 Meta、Microsoft、Google)開始轉向乙太網路。RoCEv2(RDMA over Converged Ethernet version 2)讓乙太網路也能支援 RDMA,而無需 InfiniBand 的特殊硬體。

    但早期的 RoCEv2 有個致命缺點:它假設網路是「無丟包」的環境。一旦發生壅塞導致丟包,RDMA 的效能就會崩潰。為了解決這個問題,業界發展出 PFC(Priority Flow Control)與 ECN(Explicit Congestion Notification)等機制,但仍然無法完全根治。

    2024 年之後,NVIDIA 推出 Spectrum-X 平台,這是一套專為 AI 設計的乙太網路解決方案。它在標準乙太網路的基礎上,加入了自適應路由、壅塞控制與流量隔離等機制,號稱可以達到與 InfiniBand 相近的效能,但成本更低、生態更開放。2026 年,Spectrum-X 已經成為 InfiniBand 之外的主流選擇,尤其在推論與中等規模訓練場景中。

    4.3 UALink、Ultra Ethernet 與開放陣營

    2024 年,AMD、Broadcom、Cisco、Google、Meta、Microsoft 等業者聯合成立了 UALink(Ultra Accelerator Link)聯盟,目標是打造一個開放標準的 GPU 互連協定,打破 NVIDIA NVLink 的壟斷。UALink 1.0 規範支援每通道 200Gb/s,最多 1,024 顆加速器串成單一網域。

    與此同時,Ultra Ethernet Consortium(UEC)也在推動新一代乙太網路標準,目標是讓乙太網路能夠支援 AI 與 HPC 所需的高頻寬與低延遲。UEC 1.0 規範在 2025 年釋出,2026 年開始有產品問世。

    這些新標準的意義在於「打破封閉生態」。長期以來,NVIDIA 靠著 NVLink 與 InfiniBand 的垂直整合,牢牢掌控 AI 基礎設施的利潤。但如果 UALink 與 UEC 能夠成功,未來企業將有更多選擇,成本也可能下降。不過,開放標準的挑戰在於「相容性」與「生態系成熟度」,這需要時間累積。

    技術

    頻寬

    延遲

    主要優勢

    主要限制

    InfiniBand XDR

    800 Gb/s

    極低

    成熟、SHARP 加速、自適應路由

    成本高、供應商單一

    RoCEv2

    400-800 Gb/s

    成本較低、生態開放

    壅塞控制複雜、調校門檻高

    Spectrum-X

    400-800 Gb/s

    AI 最佳化、與 NVIDIA 生態整合

    仍偏向 NVIDIA 生態

    UALink 1.0

    200 Gb/s per lane

    極低

    開放標準、支援多廠商加速器

    生態尚未成熟

    Ultra Ethernet

    800 Gb/s+

    開放、可擴展性強

    規範剛落地、產品有限

    五、2026 年的關鍵技術趨勢

    除了現有架構的演進,2026 年還有幾項技術正在重塑 AI 伺服器的樣貌。這些趨勢不僅影響效能,更直接決定了資料中心的設計與營運成本。

    5.1 光互連與共同封裝光學(CPO)

    銅線的物理極限是 AI 互連的下一個大關卡。當傳輸速率達到 1.6T 甚至 3.2T,銅線的訊號衰減與電磁干擾會變得難以控制,傳輸距離也被限制在 1 到 2 公尺以內。這對於需要跨機櫃連接的 Scale-out 架構來說,是致命的限制。

    解決方案是「光互連」。用光纖取代銅線,可以突破距離限制,同時降低功耗與訊號衰減。但傳統的光收發模組(如 QSFP-DD)體積大、功耗高,且需要插在交換器面板上,佔用大量空間。於是,業界開始發展「共同封裝光學」(Co-Packaged Optics,CPO),把光引擎直接封裝在交換器晶片旁邊,大幅縮短電氣路徑,降低功耗與延遲。

    NVIDIA 在 2025 年推出 Quantum-X Photonics 與 Spectrum-X Photonics 交換器,這是 CPO 技術首次大規模商用。2026 年,CPO 開始進入主流部署階段,特別是在需要超高速、低延遲的 AI 叢集骨幹網路中。根據業界估計,CPO 可以將交換器的功耗降低 30% 到 40%,這對於動輒數百 kW 的 AI 機櫃來說,是極具吸引力的數字。

    不過,CPO 的挑戰也很明顯:光引擎的封裝良率、散熱管理、以及可維護性。光纖一旦斷裂或光引擎故障,整個交換器可能都需要更換,這對資料中心的維運模式帶來新的考驗。

    5.2 液冷與供電架構革新

    2026 年的 AI 機櫃功耗已經突破 200kW,傳統的氣冷散熱完全無法應付。這迫使整個產業轉向液冷,而且是「直接液冷」(Direct-to-Chip)與「浸沒式液冷」(Immersion Cooling)並進。

    直接液冷是目前的主流,透過冷板(Cold Plate)直接貼合 GPU 與 CPU,將熱量傳導到液體中。它的優點是改裝相對容易,可以與現有機櫃整合。浸沒式液冷則是將整個伺服器浸入不導電的液體中,散熱效率更高,但需要全新的機櫃設計與維運流程。

    供電架構也在改變。傳統的 12V 供電在 200kW 的機櫃中會產生巨大的電流(超過 16,000 安培),導致銅損與發熱問題。2026 年的新架構開始轉向 48V 甚至 800V 直流供電,以降低電流與損耗。NVIDIA 在 2025 年發表的 800V DC 架構,預計在 2027 年的 Kyber 機櫃中正式採用。

    這些改變不只是技術問題,更是資料中心設計的典範轉移。未來的 AI 資料中心,將更像是「發電廠」與「冷卻廠」的結合,而不是傳統的機房。

    5.3 記憶體互連:CXL 與 HBM4

    除了 GPU 之間的互連,記憶體與 CPU、GPU 之間的互連也在進化。CXL(Compute Express Link)是一項開放標準,目的是讓 CPU、GPU、加速器與記憶體之間能夠共享一致的記憶體空間。2026 年的 CXL 3.x 已經支援記憶體池化(Memory Pooling),讓多個節點可以共享同一個記憶體資源。

    在 GPU 端,HBM4 開始量產。HBM4 的頻寬達到 2TB/s 以上,容量也提升到 288GB 甚至更高。更重要的是,HBM4 採用了更先進的堆疊技術,讓 GPU 能夠在更小的面積內容納更多記憶體。這對於兆級參數模型的推論特別重要,因為它減少了跨 GPU 交換權重的需求。

    CXL 與 HBM4 的結合,代表未來的 AI 伺服器將不再區分「本地記憶體」與「遠端記憶體」,而是形成一個統一的記憶體池。這將大幅簡化程式設計模型,也讓資源利用率更高。

    六、實務部署建議與選型指南

    看完這麼多技術細節,最後我們回到實務面。如果你正在評估 2026 年的 AI 伺服器採購或架構設計,以下幾個原則可以幫助你做出更明智的決策。

    6.1 依訓練與推論情境選擇架構

    訓練與推論的需求截然不同,架構選擇也應該不同:

  • 大規模預訓練:需要極高的 Scale-up 頻寬與 Scale-out 擴展性。建議採用 NVL72 或 NVL144 機櫃,搭配 InfiniBand XDR 或 Spectrum-X 網路。重點是網路拓樸要配合並行策略,避免通訊瓶頸。
  • 微調與中等規模訓練:可以考慮 8 GPU 節點搭配 RoCEv2 網路,成本較低,但需要仔細調校壅塞控制。如果預算允許,Spectrum-X 是更好的選擇。
  • 推論服務:重點是低延遲與高吞吐量。可以考慮使用較小規模的 NVLink 網域(如 8 或 16 GPU),搭配高頻寬的 KV Cache 共享機制。如果模型較小,甚至可以只用 PCIe Gen6 搭配高階 SSD。
  • 邊緣推論:不需要 NVLink,重點是功耗與體積。可以考慮 Jetson 系列或單卡推論伺服器。
  • 6.2 成本、功耗與 TCO 評估

    AI 伺服器的採購成本只是冰山一角,真正的支出在於營運成本。以下幾個面向必須納入 TCO 評估:

  • 電力成本:一個 NVL72 機櫃的功耗約 120kW,若以每度電 0.15 美元計算,一年電費超過 15 萬美元。到了 NVL144 世代,這個數字會再翻倍。選擇高效率的電源與液冷架構,可以顯著降低長期成本。
  • 網路成本:InfiniBand 的交換器與線材成本遠高於乙太網路。如果訓練規模不大,RoCEv2 或 Spectrum-X 可能是更經濟的選擇。但要注意,網路調校的人力成本也需要納入考量。
  • 空間成本:高密度機櫃需要更強的散熱與供電基礎設施。如果現有資料中心無法支援,可能需要額外的改建費用。
  • 折舊與殘值:AI 硬體的淘汰速度極快,三年後的殘值可能不到原價的兩成。在計算投資報酬率時,必須採用加速折舊的模型。
  • 6.3 常見誤區與避免方式

    最後,整理幾個實務上常見的誤區:

    誤區一:只看 GPU 數量,忽略互連頻寬。很多人以為 GPU 越多越好,但如果互連頻寬不足,多出來的 GPU 只會閒置。正確的做法是先確定互連架構,再決定 GPU 數量。

    誤區二:忽略軟體棧的相容性。NVLink 與 InfiniBand 雖然強大,但需要對應的驅動程式與通訊函式庫(如 NCCL)。如果軟體棧沒有最佳化,硬體效能也發揮不出來。

    誤區三:低估散熱與供電的挑戰。很多企業在採購時只關注伺服器本身,卻忽略了機房的散熱與供電能力。結果買了高階設備卻無法全速運轉,甚至導致跳電或過熱當機。

    誤區四:一次到位,缺乏擴展彈性。AI 技術變化太快,今天買的架構可能兩年後就過時。建議採用模組化設計,保留擴展空間,而不是一次把所有預算花完。

    七、結語:互連決定 AI 的未來

    回顧 2026 年的 AI 伺服器架構,我們可以看到一個清晰的趨勢:運算本身已經不是瓶頸,互連才是。從 NVLink 到 NVSwitch,從 InfiniBand 到 UALink,從銅線到光互連,所有的技術演進都指向同一個目標——讓更多的晶片能夠更緊密地協同運作。

    這也意味著,未來 AI 基礎設施的競爭,不再只是晶片效能的競爭,而是「系統整合能力」的競爭。誰能設計出更高頻寬、更低延遲、更節能的互連架構,誰就能在兆級參數模型的時代中取得領先。

    對於企業來說,了解這些技術原理不僅是為了採購決策,更是為了在 AI 轉型的浪潮中保持競爭力。因為當模型越來越大、算力需求越來越高,只有真正理解底層架構的人,才能做出正確的投資與部署選擇。

    2026 年只是這場革命的其中一個章節。隨著 Rubin Ultra、光互連、800V 供電等技術陸續到位,2027 年之後的 AI 伺服器架構將更加令人驚豔。而我們,正站在這場技術變革的最前線。

    ```

    🏠 返回首頁