實務手冊 · 2026 年 8 月 17 日版本 · 角度:INNO3D 系統銷售

NVIDIA 伺服器顯示卡:
RTX PRO 6000RTX PRO 4500 Blackwell Server Edition

供 INNO3D GPU 伺服器銷售人員使用的工作手冊。由基本概念出發,經平台架構與 AGS-6220V2 的正反論據,直至擁有成本的計算。每項論據均附上其適用界線:客戶方的工程師遲早會發現這些界線,由己方先行指出更為有利。

產品類別企業數據中心通用 PCIe 顯示卡
世代接替L40S → PRO 6000 · L4 → PRO 4500
核心章節第 06 層:正反論據與異議處理

NVIDIA NVIDIA 對自身產品的說明  ·  製造商 伺服器製造商對自身產品的說明  ·  雲端商 雲端服務商對自身服務的說明

第 00 層 · 基礎伺服器顯示卡與其他顯示卡的分別

為何不能直接把遊戲顯示卡裝進伺服器

這是與客戶溝通時首先要能夠解釋的一點,因為「為何不用 4090 或 5090,價格便宜得多」這個問題必定會被提出。分別共有六項,而每一項所涉及的都是運作層面,而非跑分成績。

分別 01 · NVIDIA

被動式散熱

NVIDIA 明確列出伺服器顯示卡採用被動式散熱,並將 6000 SE 描述為專為需要被動散熱的多卡伺服器而設。卡上並無風扇,氣流由機箱提供。一旦離開具備規劃氣流的伺服器,該卡根本無法運作。

分別 02 · NVIDIA

具錯誤更正的記憶體

6000 SE 的規格列明配備 96GB GDDR7 並具備 ECC 錯誤更正。在全天候負載之下,例如連續多日的推論或渲染工作,若無 ECC,一次單位元翻轉即會導致結果出錯,而系統不會發出任何錯誤訊息。

分別 03 · NVIDIA

輸出配置各異

6000 SE 設有四個 DisplayPort 2.1 接口,因此在數據中心亦可作繪圖卡使用。4500 SE 的規格中並無顯示輸出一項,屬於純粹的無顯示輸出加速卡。

分別 04 · NVIDIA

可切分:MIG 與 vGPU

顯示卡可切分為互相隔離的執行個體,各自擁有專屬記憶體、快取與運算核心,亦可透過 vGPU 分配予遠端使用者。6000 SE 最多四個執行個體,4500 SE 最多兩個、每個 16GB。

分別 05 · NVIDIA

整機系統認證

RTX PRO 伺服器具備 NVIDIA-Certified 認證資格,並於 AI Factory Validated Design 計劃之下與合作夥伴的工具一併通過驗證。此為與 AI Enterprise 軟件堆疊及 NVIDIA 網絡產品相容的保證。

分別 06 · NVIDIA

功耗可調

6000 SE 的功耗以 400 至 600W 的區間形式公佈。是顯示卡遷就機箱的散熱預算,而非相反。消費級顯示卡並無此項功能。

商務結論

向客戶陳述的重點並非效能,而是可預測性與可管理性。遊戲顯示卡購入時較平,持有成本卻更高:無法在多個使用者之間切分、沒有 ECC、無法按機箱限制功耗,亦不屬於由伺服器製造商與 NVIDIA 共同承擔責任的認證配置。

第 01 層 · 架構 NVIDIABlackwell 之中真正帶來提升的部分

四項值得付費的世代變化

Blackwell 接替了 Ada Lovelace 架構。就伺服器顯示卡的銷售而言,真正具意義的僅有以下四項特性,其餘均屬工程師層面的細節。

表 1 · Blackwell 的變化及其商務意義
技術NVIDIA 的說法客戶所得
第五代 Tensor Core 與 FP4效能較上一代最高提升 3 倍,並新增 FP4 精度支援。6000 SE 搭載第二代 Transformer Engine模型權重所佔記憶體僅為 FP16 的四分之一。大型語言模型推論上的倍數級提升源於此處,而非 CUDA 核心數量
GDDR7 記憶體頻寬與容量均大幅提升使單卡 96GB 成為可能,此一容量此前僅見於價格高昂的 SXM 平台
第四代 RT Core效能最高提升 2 倍;RTX Mega Geometry 技術可處理多達 100 倍的光線追蹤三角形渲染、數碼分身、模擬運算、Omniverse。此正是純運算取向的加速卡所欠缺者
NVENC 9 與 NVDEC 6H.264 與 HEVC 支援 4:2:2,AV1 品質改善,H.264 解碼吞吐量提升一倍影像分析、轉碼、串流、媒體製作 —— 在這些領域,無需提及人工智能亦可成交

理解整條產品線的關鍵在於:RTX PRO 既可執行人工智能運算,可處理圖形。此種通用性既是其核心競爭優勢,亦是銷售上最主要的論據。

第 02 層 · 產品 NVIDIA取自 NVIDIA 產品頁的規格

兩款卡並列比較

兩者均建基於 Blackwell 架構,均採被動散熱,均使用 PCIe Gen5 x16,亦均支援 MIG。相似之處到此為止:兩者所針對的散熱預算與工作性質截然不同。

表 2 · RTX PRO 6000 SE 與 RTX PRO 4500 SE 對照
項目RTX PRO 6000 Blackwell SERTX PRO 4500 Blackwell SE
CUDA 核心24,06410,496
RT Core(第四代)18882
顯示記憶體96GB GDDR7,具 ECC32GB GDDR7
記憶體頻寬1,597 GB/s800 GB/s
記憶體位寬512 位元256 位元
Tensor Core FP44 PFLOPS1.6 PFLOPS
Tensor Core FP82 PFLOPS811 TFLOPS
Tensor Core FP16 / BF161 PFLOPS406 TFLOPS
Tensor Core TF32234 TFLOPS203 TFLOPS
單精度 FP32120 TFLOPS51 TFLOPS
RT Core 峰值355 TFLOPS154 TFLOPS
功耗400–600W(可調)165W
外形規格氣冷:雙插槽,11.2 × 26.7 厘米 · 液冷:單插槽,FHXL單插槽,11.2 × 26.7 厘米
散熱方式被動式被動式
介面PCIe Gen 5 x16PCI Express 5.0 x16
MIG最多 4 個隔離執行個體最多 2 個,每個 16GB
影像引擎4 NVENC / 4 NVDEC3 NVENC / 3 NVDEC
顯示輸出4 × DisplayPort 2.1規格中未有列出
機密運算規格中未有列出支援
供電接頭規格中未有列出1 × PCIe CEM5 16-pin
所接替型號NVIDIA L40SNVIDIA L4

標示「規格中未有列出」的項目乃刻意保留:NVIDIA 為兩款卡公佈的參數組合略有出入,而以類推方式填補空白,正是錯誤數字流入評測文章的途徑。

注意:三款名稱極為相近的產品

此為規格書與報價單中最常見的錯誤。「RTX PRO 6000 Blackwell」是一個由三款卡組成的系列,而伺服器版的 4500 則獨立於此系列之外。

表 3 · RTX PRO 6000 Blackwell 各版本
項目Server EditionWorkstation EditionMax-Q Workstation
記憶體96GB GDDR7 ECC96GB GDDR7 ECC96GB GDDR7 ECC
功耗400–600W600W300W
散熱被動式雙向貫流主動式
尺寸11.2 × 26.7 厘米,雙插槽13.7 × 30.5 厘米,雙插槽11.2 × 26.7 厘米,雙插槽
顯示輸出4 × DisplayPort 2.14 × DisplayPort 2.14 × DisplayPort 2.1
匯流排PCIe Gen 5 x16PCIe Gen 5 x16PCIe Gen 5 x16
NVIDIA 列明用途採被動散熱的多卡伺服器:推論、模型微調、分散式渲染、高效能運算、虛擬工作站單卡工作站上的最高效能高密度工作站配置,最多四張卡

對於需要密度但沒有伺服器機櫃的客戶,Max-Q 是務實的折衷方案:記憶體容量相同而發熱減半,工作站內可安裝四張。另值得留意 NVIDIA 對伺服器版的措辭 —— 微調獲明文列出,即 fine-tuning 屬於既定用途,與由零開始訓練有別。

應用層面的判斷原則

兩款伺服器卡的「每瓦記憶體」比例相近,真正差距懸殊者為每插槽密度:單插槽 165W 對雙插槽 600W。兩者之間的取捨,實質上是「一個大型模型」與「多條並行流程」之間的取捨。就運算能力而言差距為二至二點五倍,就功耗而言則接近四倍。

第 03 層 · 定位 NVIDIA適用範圍的界線所在

在 NVIDIA 數據中心產品線中的定位

銷售此類顯示卡最有價值的能力,在於能夠指出何時並不適用。數據中心產品線分為兩大主幹:RTX PRO 系列的通用 PCIe 卡,以及為訓練而設的運算加速卡。

表 4 · 產品線分工
產品NVIDIA 所述角色圖形與 RT互連介面
RTX PRO 4500 SE中小型模型推論、數據處理與數據科學、影像分析、虛擬化。適用於數據中心、邊緣運算與雲端具備PCI Express 5.0 x16
RTX PRO 6000 SE推論、模型微調、分散式渲染、高效能運算、虛擬工作站。數據中心的通用顯示卡具備PCIe Gen 5 x16
H 系列與 B 系列NVIDIA 另設的產品線,針對需要透過 NVLink 建立卡間連結的應用場景有限NVLink / NVSwitch
必須預先說明的限制

兩款卡的規格中,互連介面僅列出 PCI Express 一項,並無 NVLink。卡與卡之間透過 PCIe 通訊,記憶體不會匯聚為共用資源池。八張 96GB 的卡並不等於「768GB 供單一模型使用」,而是八個在記憶體上互相獨立的加速卡。單卡容量大在並行推論中可作補償,但若模型無法載入 96GB 之內,則須採用張量並行並承受 PCIe 的損耗,或改用具備 NVLink 的平台。

世代更替的論據

  • 相對 L40S:NVIDIA 表示 RTX PRO 伺服器在模擬運算與合成數據生成方面最高較 L40S 系統快 4 倍,並將 6000 SE 描述為在多模態代理式與生成式應用上相對 L40S 的顯著跨越。
  • 相對 L4:就 4500 SE,NVIDIA 宣稱在中小型模型推論方面較上一代 L4 快逾 5 倍 —— 前提為採用 NVIDIA 最佳化框架與 NIM 微服務。
  • 相對純處理器系統:在人工智能影像理解方面,NVIDIA 宣稱效能最高可達純處理器系統的 100 倍,佔用空間與耗電量則減少逾 95%;向量資料庫方面最高可達 50 倍。對於仍在維持處理器伺服器機隊的客戶而言,此為最有力的論據。

上述最後兩項數字須附重要說明:50 倍與 100 倍的比較對象,為配備八張 4500 SE 的伺服器與處理器系統之間的對比(向量資料庫方面採用具 192 個虛擬核心的 AMD 9654,3,300 萬條向量於 Milvus 2.5.25 建立索引,處理器端用 HNSW 演算法,顯示卡端用 cuVS CAGRA;影像方面採用雙路 AMD 9654 與 Qwen3-VL-8B 模型)。此為平台層面的合理比較,但並非卡對卡的比較,而客戶方稱職的工程師必定會就此提問。

第 04 層 · 軟件堆疊 NVIDIA企業願意付費的功能

真正促成成交的功能

規格表面向工程師。商務決策者所看重的是以下各項 —— 正是它們把硬件轉化為可以轉售或在各部門之間分攤的服務。

表 5 · 企業級功能
技術運作原理對客戶的價值
MIG於硬件層面將顯示卡切分為互相隔離的執行個體,各自具備高頻寬記憶體、快取與運算核心,並提供有保證的服務品質。6000 SE 最多四個,4500 SE 最多兩個、每個 16GB為每一租戶提供有保證的服務品質。單一顯示卡可同時承載數項互不干擾的工作 —— 此為計費與多租戶架構的基礎
vGPU配合 NVIDIA RTX Virtual Workstation 與 Virtual PC 軟件,顯示卡可虛擬化予遠端使用者。支援疊加於 MIG 之上的分時機制,使人工智能與圖形工作得以同時執行。vGPU 20 另新增 AI Virtual Workstation Toolkit 與固定份額排程工程師與設計師在瘦客戶端上工作,而 CAD 授權與數據不會離開企業內部網絡。付款理由往往正是此一場景,而非人工智能
ECC顯示記憶體的錯誤更正,於 6000 SE 的 96GB GDDR7 中列明全天候生產負載的前提條件,亦為基建招標中的常規要求
機密運算4500 SE 的規格表中列明支援此項功能受監管行業的論據:於處理過程中保護數據與模型
NVIDIA AI Enterprise包含 NIM 與 NeMo 微服務在內的工具、程式庫與框架套件發票上的獨立項目,同時亦回應「日後由誰維護」這一疑慮
NVIDIA-CertifiedRTX PRO 伺服器具備此資格,並於 AI Factory Validated Design 之下與合作夥伴工具一併通過驗證與 NVIDIA 網絡產品、BlueField-3 及 AI Enterprise 堆疊相容的保證。同時為客戶與系統整合商消除整合風險
NVIDIA Run:ai工作負載與顯示卡的調度平台,可提升使用率與整體吞吐量將閒置顯示卡投入運作,是關於投資回收的直接論據
實用手法

談及 MIG 時應以金額而非 GB 為單位。一張 RTX PRO 6000 SE 切分為四個執行個體,即等同於在單一實體卡上設有四個人工智能開發者工作環境,或四項獨立的推論服務。反向規則同樣重要:不可為 4500 SE 規劃四名使用者,該卡最多只能切分為兩個執行個體。此一細節在擬定報價時經常被忽略。

第 05 層 · 平台 NVIDIA 製造商由顯示卡到整座機櫃

伺服器是一套系統,而非裝有顯示卡的箱子

「認識硬件」與「理解伺服器技術」的分界線就在此處。顯示卡在工程複雜度之中所佔比重較小,其餘為機箱、網絡、供電與散熱。參考配置由 NVIDIA 界定,具體機型則由其製造商說明。

NVIDIA 四種參考配置

NVIDIA 將 RTX PRO Server 界定為數據中心的通用平台,並提供四項建基於 MGX 模組化參考設計的示例。此為評估任何製造商方案時的基準。

表 6 · RTX PRO Server 參考配置
配置顯示卡網絡DPU
MGX 6U8 × RTX PRO 6000 SE,液冷ConnectX-8 SuperNIC,內建 PCIe Gen 6 交換機BlueField-3
MGX 4U8 × RTX PRO 6000 SEConnectX-8 SuperNIC,內建 PCIe Gen 6 交換機BlueField-3
MGX 2U2 × RTX PRO 6000 SEConnectX-7 或 BlueField-3 SuperNICBlueField-3
MGX 2U8 × RTX PRO 4500 SEConnectX-7 SuperNICBlueField-3

最後一行極易被忽略,實則不應:八張較小的卡可容納於兩個機架單位之內。即 2U 之內具備 256GB 記憶體與 12.8 PFLOPS 的 FP4 運算力,顯示卡功耗為 1.3kW,而八張較大的卡則需 4.8kW。就影像分析與小型模型推論而言,此為官方配置中密度最高者。

NVIDIA SuperNIC 內建交換機的作用

NVIDIA 如此描述近幾代最主要的架構變化:ConnectX-8 SuperNIC PCIe Switch 為一塊整合多組 SuperNIC 的板卡,每組 SuperNIC 均將高速網絡與 48 通道的 PCIe Gen 6 交換機結合。此設計取消了獨立的 PCIe 交換機,使卡間頻寬倍增,簡化板卡佈線,並提供最高 800Gb/s 的吞吐量。於各項配置中與之並列的 BlueField-3,按 NVIDIA 的說明,可自處理器接管網絡、數據存取與資訊保安的處理,並提供零信任模式的隔離。網絡子系統另由 Spectrum-X 補足:透過 RoCE 自適應路由與擁塞控制,將儲存效能提升接近五成。

交換式與直連式拓撲的分別

八卡 PCIe 伺服器有兩種拓撲,能夠說明其分別甚有用處。在交換式設計中,顯示卡連接至專用的 PCIe 交換晶片,再由該晶片向上連往處理器:任何一張卡均可以全寬度與另一張卡通訊,無須離開交換機,而可用通道數亦多於處理器本身所能提供者。在直連式設計中,每張卡直接接入處理器的根複合體:成本較低,且距離系統記憶體少一個跳躍,但顯示卡須分屬兩個插槽,兩邊之間的流量須經跨處理器匯流排。AGS-6220V2 採直連式,AGS-4UMGX-R1 採交換式。此一分別並非咬文嚼字,業界兩端均可印證:NVIDIA 開發 ConnectX-8 SuperNIC,正是為了在保留交換機優點的同時取消獨立交換機;而 AWS 亦特別指出,共用同一 PCIe 交換機的顯示卡之間點對點延遲極低。

製造商 三類機型

主流市場

2U,2 至 4 張卡

Cisco、Dell、HPE、Lenovo 與 Supermicro 的一般機架式伺服器 —— 五者均列於 NVIDIA 主要系統合作夥伴名單之內。可直接安裝於客戶現有機櫃。對於已設有自家數據中心的企業而言,此為踏入加速運算的入門選項。

AI 工廠

4U MGX,8 張卡

建基於 NVIDIA MGX 參考設計、配備 ConnectX-8 與 BlueField-3 的專用平台。此為叢集的組成單元,而非「一台裝有顯示卡的伺服器」。例子包括 INNO3D AGS-4UMGX-R1、Gigabyte XL44-SX2-AAS1、ZOTAC ZRS-MGX-R1、Supermicro SYS-522GA-NRT。

獨立節點

6U,8 張卡

如 INNO3D AGS-6220V2 之類的平台。同樣八張卡,但體積大出一半:以密度與高速網絡,換取氣流餘裕、維護便利與價格優勢。屬於自足的工作機器,而非叢集節點。

製造商 具體平台分析:INNO3D AGS-6220V2

將一台設計理念迥異的機器與 MGX 參考配置並列,甚具參考價值。此為可安裝八張 RTX PRO 6000 Blackwell Server Edition 的 6U 機箱,其中幾乎每一項設計決定均與 MGX 的邏輯相反。數據取自 INNO3D 就料號 AGS-6220V2P2-B00 所發佈的規格書。

表 7 · INNO3D AGS-6220V2(依製造商規格書)
子系統實際規格實務上的意義
供貨形式準系統。機箱、主機板、4 個電源、25Gb/s OCP 模組、VROC 金鑰、導軌與散熱器均已預先安裝。不含處理器、記憶體與儲存裝置此為平台而非製成伺服器。處理器、DDR5、NVMe 與八張顯示卡屬報價單上的獨立項目,交貨期亦各自不同
外形規格6U,900 × 438 × 264 毫米八張卡佔用 6U,而參考配置同樣八張僅佔 4U。900 毫米的深度須對照客戶機櫃深度,並預留理線空間
顯示卡插槽8 × PCIe 5.0 x16,全高雙寬。直接連接處理器,不設 PCIe 交換機每張卡均獲得完整的 x16。然而 8 × x16 即為兩個插槽需提供 128 條通道:顯示卡必然按 4+4 分屬兩邊,兩邊之間的交換須經跨處理器匯流排。就張量並行而言,此處即為瓶頸
處理器2 × Intel Xeon Scalable 第四及第五代,LGA 4677 插槽,C741 晶片組。每顆處理器限 350W TDP此上限排除了部分較高階型號 —— 落單前須核對所選型號
記憶體32 個 DDR5 RDIMM / RDIMM-3DS 插槽,每顆處理器 8 通道。RDIMM 單條最高 96GB,RDIMM-3DS 最高 256GB。第五代 Xeon 於 1DPC 為 5,600 MT/s,2DPC 為 4,400 MT/s整機上限約 8TB。插槽全數佔用會令頻率由 5,600 降至 4,400
網絡1 個 OCP 插槽,隨機附 25Gb/s 模組,另有 1GbE BMC 管理埠與參考配置最關鍵的分別。並無 ConnectX-8、BlueField-3 或 400Gb/s。此為獨立機器,而非叢集組成單元
儲存12 個 3.5/2.5 吋槽位(8 × SATA-3 + 4 × NVMe),機內 1 條 M.2 NVMe,Intel VROC RAID 0/1/10/5十二個槽位之中八個僅支援 SATA。供高速工作資料集使用者僅餘四個 NVMe 槽位
供電4 × 2,700W CRPS,3+1 配置,80 PLUS Platinum可用功率 8,100W。計算方式:8 × 600W 顯示卡加 2 × 350W 處理器,再加記憶體、硬碟與風扇,約為 6.5kW。供電須為 200–240V,接頭為 C19/C20
散熱16 把可熱插拔風扇:8 把位於機內,8 把位於後方6U 規格的主要優勢:氣流充裕,更換風扇無須停機
管理專用 IPMI 埠、VGA、2 × USB 3.2 Gen1。設有 SPI 介面的 TPM 針腳,但 TPM 2.0 模組本身屬選配若招標要求配備 TPM,該模組須另行訂購
作業系統Windows Server 2022/2019、RHEL 9.2–8.6、SLES 15 SP4、Ubuntu 22.04 LTS、VMware ESXi 8.0U1 / 7.0U3i、Citrix Hypervisor 8.2 LTSR CU1支援 ESXi 與 Citrix,顯示此平台的設計亦考慮了虛擬工作站用途
規格書內部唯一的矛盾之處

文件封面所列料號為 AGS-6220V2P2-B00(項目編號 0K219-B001),而規格頁頁首則寫作 AGS-6220V2P2-B10。此情況多半屬手民之誤或相鄰的配置版本,但落單時必須就料號取得書面確認:機箱內究竟預先安裝了甚麼,由該料號決定。同處另有關於記憶體的細微出入 —— 其中一行寫作 4,800/4,400 MHz,下一行則就第五代 Xeon 於 1DPC 寫作 5,600 MT/s。

製造商 同一製造商,不同理念:INNO3D AGS-4UMGX-R1

INNO3D 另有一款採用相同顯示卡的平台 —— 建基於 NVIDIA MGX 參考設計的 4U 機型,配備 ConnectX-8 SuperNIC 與 BlueField-3。比較同一製造商的兩台機器,較任何跨品牌對比都更具啟發性:可以清楚看出加價換來了甚麼,而無須考慮製造品質與售後服務上的差異。

表 8 · INNO3D 兩款採用相同顯示卡的平台
子系統AGS-4UMGX-R1 · MGXAGS-6220V2 · 6U
外形規格NVIDIA MGX 4U,858 × 440 × 175 毫米6U,900 × 438 × 264 毫米
顯示卡拓撲8 × PCIe Gen 5 x16 供八張 RTX PRO 6000 SE 使用,另設一個 Gen 5 x16 插槽供 BlueField-3 專用8 × PCIe 5.0 x16,直接連接處理器,不設交換機
網絡ConnectX-8 SuperNIC:8 個 400Gb/s QSFP 埠,另有 2 × 10GbE 與 1GbE BMC25Gb/s OCP 模組,另有 1GbE BMC
DPUBlueField-3,設有專屬插槽
處理器2 × Intel Xeon 6(Granite Rapids / Sierra Forest),6500 及 6700 系列,LGA 4710 插槽2 × Intel Xeon Scalable 第四及第五代,LGA 4677,限 350W
記憶體32 個 DDR5 RDIMM / MRDIMM 插槽,每顆處理器 8 通道。1DPC 為 6,400 MT/s,2DPC 為 5,200 MT/s。模組容量 32、64、96 及 128GB32 個 DDR5 RDIMM / RDIMM-3DS 插槽。1DPC 為 5,600 MT/s,2DPC 為 4,400 MT/s
儲存8 個 2.5 吋可熱插拔槽位,最多可裝八條 25 毫米 E1.S;機內另有 2 條 M.2 NVMe Gen 5 x412 個槽位(8 × SATA-3 + 4 × NVMe),機內 1 條 M.2 NVMe
供電4 × 3,200W CRPS,3+1 配置,80 PLUS Titanium4 × 2,700W CRPS,3+1 配置,80 PLUS Platinum
散熱10 把 80 毫米可熱插拔風扇,按區域劃分:顯示卡區 5 把,主機板區 5 把16 把風扇:機內 8 把,後方 8 把
TPMTPM 2.0 已焊接於板上,並配備 Microchip CEC1736 硬件信任根僅設 TPM 針腳,模組屬選配
運作環境0–35°C,濕度 8–90%10–35°C,濕度 8–80%
機箱由 Chenbro 製造未有列明
製造商列明用途NVIDIA Omniverse Enterprise、大型數碼分身、高效能運算、大型語言模型推論與微調遷移學習、模型微調、大型語言模型訓練與推論、AI 雲端、高效能運算
同一製造商內部比較所揭示者

兩台機器的分別不在顯示卡數量,而在連通性與周邊配置的級別。MGX 版本提供八個 400Gb/s 埠對一個 25Gb/s 埠、專屬的 BlueField-3、新一代的處理器、快一級的記憶體、效率等級與功率均更高的電源,以及已焊接而非選配的 TPM 模組。而且其體積更小:4U 對 6U,深度 858 毫米對 900 毫米。「以六個機架單位換取氣流」這一說法在此對照之下顯得薄弱:MGX 平台的風扇反而更少,十把對十六把,但劃分為顯示卡區與主機板區 —— 在體積減半且供電更強的前提下,此點反映的是更為周密的散熱設計,而非更為寬裕的配置。6U 機型在需要一台較低價獨立節點時仍屬合理選擇,惟其理據如今在於價格,而非工程優勢。

表 9 · 同一組八張顯示卡的三種設計理念
比較項目MGX 4U 參考配置 NVINNO3D 6U 製造商主流 2U 製造商
顯示卡數量882–4
機櫃密度
跨節點網絡ConnectX-8,最高 800Gb/s,BlueField-3OCP 25Gb/s視乎配置而定
PCIe 拓撲SuperNIC 內建 Gen 6 交換架構直接連接,顯示卡按 4+4 分屬兩個插槽直接連接
供貨形式通常為製成系統準系統製成系統,附原廠支援
定位叢集的組成單元自足節點:推論、渲染、虛擬工作站踏入加速運算的第一步
維護便利性佈局緊密模組化,空間充裕,風扇可熱插拔標準機架維護

可寫入報價的說法:客戶若打算擴展為叢集,則選擇依 MGX 參考配置的機型;客戶若只需在單一機器內具備大量運算力,則選擇 6U 平台,而平台的差價將轉為購買顯示卡。倘若兩年之內會出現第二台伺服器與分散式負載,欠缺高速網絡即成死胡同。

表 10 · 值得研究與比較的平台
製造商型號規格顯示卡製造商列明的特點
INNO3DAGS-4UMGX-R14U MGX8ConnectX-8 SuperNIC 配 8 個 400Gb/s 埠、設有專屬插槽的 BlueField-3、Xeon 6、4 × 3,200W Titanium、TPM 2.0 已焊接
INNO3DAGS-6220V26U8準系統、直接連接而不設交換機、OCP 25Gb/s、4 × 2,700W Platinum、16 把風扇
LenovoThinkSystem SR650a V42U4可將顯示卡功耗限制於 450W,以便在機箱內安裝四張
SupermicroSYS-522GA-NRT、SYS-422GL-NR4U / 5U8最早採用配 ConnectX-8 的 MGX PCIe Switch 板卡者之一
GigabyteXL44-SX2-AAS14U MGX8雙 Xeon 6700/6500、32 個 DDR5 插槽、3+1 配置的 3,200W Titanium 電源、BlueField-3 與 4 × ConnectX-8
ZOTACZRS-MGX-R14U MGX8第六代 Xeon、32 個 DIMM 插槽、ConnectX-8 上 8 個 400Gb/s 埠、3+1 配置的 3,200W 電源
ASUSESC8000A-E134U8建基於 AMD EPYC 平台
決定成交與否的實務細節

決定最終配置的是機箱的散熱預算,而非顯示卡的規格。Lenovo 的做法是最佳例證:可將顯示卡功耗限制於 450W,正是為了在機箱內安裝四張。NVIDIA 將功耗設為 400 至 600W 的可調區間,用意亦在於此。在向客戶承諾八張卡之前,須先計算機櫃的供電量與機房的排熱能力。

如何以文件確認相容性

NVIDIA 提供其自身的工具:Qualified System Catalog —— 已就特定顯示卡通過認證的系統目錄,可按型號篩選;NVIDIA-Certified Systems 認證計劃;以及作為配置基準的 AI Factory Validated Design。另有一項對採購而言重要的觀察:RTX PRO Server 頁面的系統合作夥伴名單,主要夥伴列出 Cisco、Dell、HPE、Lenovo 與 Supermicro,其餘包括 Advantech、ASRock Rack、ASUS、Compal、Eviden、Foxconn、GIGABYTE、Inventec、MiTAC、MSI、Pegatron、QCT、Wistron 與 Wiwynn。該名單之中並無 INNO3D —— 儘管該公司確有一款 NVIDIA MGX 外形規格、配備 ConnectX-8 與 BlueField-3 的平台,其組成與參考配置一致。未列於合作夥伴名單與擁有 MGX 產品兩者並不矛盾:該名單無須詳盡。惟結論不變 —— 確認須來自 NVIDIA 的目錄,而非產品頁面。請於 Qualified System Catalog 按相應顯示卡篩選,並向代理商索取狀態的書面證明。

第 06 層 · 銷售 製造商AGS-6220V2 的正反論據

AGS-6220V2:以何取勝,何處不必爭辯

本層為與客戶溝通而設。每項論據均附上其失效的界線:客戶方的工程師終究會發現這些界線,而由己方率先指出,可將會面由審查轉為共同選型。

八項支柱論據

論據 01 · 價格

取得八張卡最經濟的途徑

121,700 美元對 MGX 平台的 158,210 美元 —— 節省 36,510 美元,接近四分之一的預算。兩款平台均以準系統形式供貨,故價格可直接比較。這筆金額將投入處理器、記憶體與硬碟,而非機箱。
界線:若客戶需要 400Gb/s 網絡,此項節省即會消失 —— 外置網卡與交換機將吞噬全部差價。

論據 02 · 採購

準系統即是彈性

處理器、記憶體與 NVMe 由客戶依自身合約與自身價格採購。在 DDR5 供應短缺的當下,此為實質的操作空間:客戶可動用手上既有的記憶體庫存。
界線:此論據對「製成伺服器」成立,對 MGX 平台則不成立 —— 後者同樣以準系統形式供貨。切勿將此說成相對 AGS-4UMGX-R1 的優勢。

論據 03 · 處理器

兩代 Xeon 可供選擇

LGA 4677 插槽同時支援第四代與第五代 Xeon Scalable。客戶可沿用既有庫存,或選購價格較低的型號。採用 LGA 4710 的 MGX 平台並無此選項。
界線:每插槽 350W 的上限會排除部分較高階處理器。

論據 04 · 儲存

十二個槽位而非八個

8 × SATA 加 4 × NVMe。就媒體檔案庫、溫資料,以及無需 NVMe 讀取速度的資料集而言,SATA 每 TB 的成本低出數倍。
界線:供高速工作資料集使用者僅餘四個槽位。

論據 05 · 運維

維護便利且空間充裕

16 把可熱插拔風扇、模組化結構、機內易於接觸。對上門工程師的技術要求較低,更換部件時的停機時間亦較短。
界線:在按機架單位計費的代管環境中,6U 的費用較 4U 高出一半。

論據 06 · 拓撲

直接連接處理器

每張卡均獲得完整的 x16,距離系統記憶體少一個跳躍,韌體堆疊較為簡單,故障點亦較少。就八條互相獨立的推論流程而言,交換機並無任何增益。
界線:顯示卡按 4+4 分屬兩個插槽,兩邊之間的交換須經跨處理器匯流排。

論據 07 · 供電

接近四分之一的餘裕

3+1 配置之下可用功率為 8,100W,而推算負載約為 6.5kW。仍有空間升級處理器、增加硬碟以及安裝日後的顯示卡。
界線:須具備 200 至 240V 供電及 C19/C20 接頭 —— 在較舊的機櫃中,此為另一項議題。

論據 08 · 財務

半年回本

相對 AWS 的按需計費,在全天候負載之下本機於 6.2 個月回本;而使用率自 21.7% 起,購買即較租用划算。此為手上最有力的量化論據 —— 詳見第 08 層。
界線:若使用率低於約五分之一的時間,較誠實的建議是採用雲端。

可以放心推介的應用場景

表 11 · 適合的場景及其佐證
應用適合的理由可引用的依據
約 700 億參數以下的大型語言模型推論單卡 96GB 與 1,597 GB/s,原生支援 FP4AWS 與 Microsoft 各自獨立地將此門檻視為單卡的界線
多個獨立模型與多租戶架構MIG 可於每張卡切分出最多四個隔離執行個體全機最多 32 個具服務品質保證的隔離執行個體 —— 計費機制的基礎
代理式服務與 RAG足以應付長脈絡與 KV 快取的記憶體容量Microsoft 明確將 700 億參數以下模型的 RAG 列為此卡的目標場景
既有模型的微調記憶體充足,並支援 FP8/BF16NVIDIA 明確將 fine-tuning 列入伺服器版的用途 —— 此說並非牽強
虛擬工作站與 VDI疊加於 MIG 之上的 vGPU,可於人工智能與圖形工作之間分時規格書列明支援 VMware ESXi 8.0U1 與 Citrix Hypervisor 8.2 —— 此平台自設計之初即涵蓋此一場景
渲染、Omniverse、OpenUSD、數碼分身188 個第四代 RT Core,峰值 355 TFLOPS此正是純運算加速卡所欠缺者:採用 H 系列的競爭對手無法涵蓋此場景
影像分析、轉碼、串流每張卡四組 NVENC 與四組 NVDEC全機 32 組編碼引擎與 32 組解碼引擎;H.264 與 HEVC 支援 4:2:2
向量搜尋、分析、數據科學透過 cuVS 與 CUDA-X 堆疊加速NVIDIA 宣稱建立索引時較處理器系統最高快 50 倍
FP32 科學運算與模擬每張卡 120 TFLOPS FP32單一節點即可涵蓋昔日需要小型叢集方能完成的工作
受監管行業的本地人工智能數據與模型不會離開客戶的內部範圍第 08 層與雲端的比較顯示,在持續負載之下此方案亦更為便宜

不應以此機型推介的應用場景

下表較上表更具價值。系統若售予不合適的場景,退回時會連同信譽一併損失;而及時指出限制,則幾乎每次都能轉化為己方產品組合中的另一項產品。

表 12 · 不適合的場景、原因與轉介方向
應用不適合的原因建議改為推介
由零開始訓練大型模型顯示卡並無 NVLink,記憶體亦不會匯聚為共用資源池。訓練本身亦超出 NVIDIA 為兩款 RTX PRO 卡所列明的用途H 系列或 B 系列的 NVLink 平台,或於訓練期間租用運算資源
跨節點的分散式訓練與推論網絡僅有一個 25Gb/s 的 OCP 模組,就跨節點通訊而言相差一個數量級INNO3D AGS-4UMGX-R1:ConnectX-8 上八個 400Gb/s 埠,另加 BlueField-3
八張卡全面採用張量並行且 SLA 嚴格兩個插槽提供 128 條通道,意味顯示卡按 4+4 分屬兩邊,兩邊之間的交換須經跨處理器匯流排AGS-4UMGX-R1,其 SuperNIC 內建 PCIe Gen 6 交換架構
透過 GPUDirect Storage 與 RDMA 經網絡存取儲存並無 DPU:沒有可用以卸載網絡與數據存取的部件AGS-4UMGX-R1,其 BlueField-3 設有專屬插槽
按機架單位計費的高密度代管八張卡佔用 6U 而 MGX 僅佔 4U —— 同等運算力之下場地費用高出 50%AGS-4UMGX-R1,或採用八張 RTX PRO 4500 SE 的 MGX 2U 配置
強制要求 TPM 2.0 的招標板上僅設具 SPI 介面的針腳,模組本身屬選配加購該模組,或改為推介 AGS-4UMGX-R1,其 TPM 2.0 已焊接於板上並配備 Microchip CEC1736 信任根
大型資料集須置於高速硬碟的處理流程十二個槽位之中僅四個為 NVMe;機內 M.2 亦只有一條AGS-4UMGX-R1,具八個 E1.S 槽位;或改用外置儲存
機密運算的要求NVIDIA 於 RTX PRO 4500 SE 的規格中列明支援;6000 SE 並無此項採用 RTX PRO 4500 SE 的 MGX 2U 配置 —— 該處為官方明文所載
處理器端的重度資料前處理第四及第五代 Xeon,功耗上限 350W,記憶體 1DPC 為 5,600 MT/sAGS-4UMGX-R1,採用 Xeon 6 與 6,400 MT/s 記憶體
氣候條件不穩定的邊緣部署運作範圍 10 至 35°C,濕度上限 80% 且不得凝結專用的邊緣運算平台,或改善機房環境
深度不足 950 毫米的機櫃900 毫米機箱加上理線空間,在物理上無法容納AGS-4UMGX-R1,深度為 858 毫米
此表最重要的結論

在十一項不適合的場景之中,有七項可由己方產品組合中的另一台機器涵蓋。聽到「我們需要分散式負載」或「我們的代管按機架單位計費」時,正確的應對並非為 6220V2 辯護,而是轉介至 AGS-4UMGX-R1。訂單規模亦會因而擴大:MGX 平台的價格高出 30%。應當推銷的是整個產品組合,而非單一型號。

必然會遇到的異議與誠實的回應

表 13 · 異議處理
異議誠實的回應
「為何不用遊戲顯示卡,價格便宜得多」配合機箱氣流的被動散熱、ECC、MIG 與 vGPU、可按散熱預算於 400 至 600W 之間調整的功耗,以及整機系統認證。遊戲顯示卡購入時較平而持有成本更高:無法在使用者之間切分,亦不屬於受支援的配置
「對手以 4U 容納同樣八張卡,而貴方需要 6U」直接承認。我方在此的優勢為價格、維護便利,以及多出一倍的硬碟槽位。若客戶更重視密度與網絡,則推介 AGS-4UMGX-R1 —— 該機同屬我方產品
「NVIDIA 的系統合作夥伴名單中並無 INNO3D」承認。產品頁面上的名單並非詳盡,而我方確有一款 MGX 外形規格、配備 ConnectX-8 與 BlueField-3 的平台。建議於 NVIDIA Qualified System Catalog 查核,並經代理商索取狀態的書面證明 —— 以文件而非口頭方式了結此一問題
「這是準系統,我們需要製成伺服器」即時列出欠缺的項目:兩顆處理器、記憶體、儲存裝置。提供整合服務並說明交貨期。同時說明,在記憶體短缺期間,由客戶自行採購往往在價格與交期兩方面均較為有利
「太貴」將討論由價格轉向擁有成本。相對 AWS 按需計費,全天候負載之下 6.2 個月回本,而使用率達 21.7% 即已具優勢。應詢問顯示卡每日實際會運作多少小時 —— 此一問題對成交的作用大於折扣
「我們用雲端便可」就試點與應付尖峰負載而言表示同意 —— 此舉誠實且有助建立信任。其後展示門檻:使用率高於約四分之一時,購買較為便宜。最佳做法是購入以承擔基礎負載,尖峰部分則由雲端補足
「我們需要訓練自己的模型」先行釐清:由零開始訓練,抑或微調。微調獲 NVIDIA 明文列入伺服器版的用途,此處本機確屬合適。由零開始訓練並非我方場景,宜及早說明
應當避免的四項說法

以下每一項均可於一分鐘內查證,而一旦出錯即會損及整份建議書的可信度。不可稱「768GB 供單一模型使用」 —— 記憶體不會匯聚,此為八張在記憶體上互相獨立的卡。不可提及 NVLink —— 兩款卡的規格均僅列出 PCI Express。不可承諾 NVIDIA-Certified 資格,除非已就特定配置於目錄中查核。此外,不可將 50 倍與 100 倍的數字套用於本機:該等數字乃於配備八張 RTX PRO 4500 SE 的伺服器上與處理器系統對比所得,並非取自 6000 SE,亦非與另一款顯示卡比較。

第 07 層 · 實務由客戶需求到規格書

配置選型

選型時最常見的錯誤是計算 TFLOPS。就推論而言,首要者為顯示記憶體容量:模型權重若無法完整載入顯示記憶體,系統即會使用系統記憶體,效能隨之急劇下降。

表 14 · 需求 → 配置
客戶需求顯示卡平台須核對事項
約 700 億參數以下的大型語言模型推論6000 SE2U,兩張卡AWS 與 Microsoft 均將此門檻視為單卡的界線。須釐清脈絡長度與 KV 快取的容量
更大型模型的推論6000 SE4U 或 6U,八張卡張量並行;須留意因欠缺 NVLink 而產生的 PCIe 損耗
大量小型模型4500 SEMGX 2U,八張卡應以每插槽密度與並行流程數量計算,而非以 TFLOPS 總和計算
影像分析、轉碼4500 SEMGX 2U、邊緣機箱每張卡三組 NVENC 與三組 NVDEC 方為關鍵參數,而非 CUDA 核心數量
數據處理、向量搜尋4500 SEMGX 2U,八張卡NVIDIA 宣稱建立向量索引時較處理器最高快 50 倍
虛擬工作站兩者皆可2U 或 4UvGPU 授權與 MIG 執行個體數量:較高階的卡四個,較低階的卡兩個
渲染、Omniverse、模擬運算6000 SEMGX 4U 或 6URT Core 為必要條件;較高階的卡其 RT 峰值高出一倍
既有模型的微調6000 SE4U 或 6UNVIDIA 已將 fine-tuning 明文列入伺服器版的用途
無資本開支的試點6000 SEAWS G7e、Azure NCv6、Google Cloud G4詳見第 08 層
由零開始訓練大型模型超出兩款卡所列明的用途。互連介面僅列出 PCI Express,並無 NVLink 一項

擬定規格書前應釐清的問題

  1. 將運行哪些模型、採用何種精度?由此決定所需的顯示記憶體容量;FP8 之下約 700 億參數即為較高階單卡的界線。
  2. 脈絡長度為何、同時連線數為何?由此決定 KV 快取的容量,而此項往往才是真正的決定因素。
  3. 需要訓練抑或僅需推論?若微調僅佔少部分時間,則硬件應按推論選型,重度工作改為租用。
  4. 是否需要圖形與光線追蹤?若然,在此預算範圍內基本上並無 RTX PRO 以外的選擇。
  5. 獨立使用者有多少?6000 SE 為四個 MIG 執行個體,4500 SE 為兩個、每個 16GB。
  6. 機櫃供電為多少千瓦、如何排熱?此一限制削減配置的次數多於任何其他因素。
  7. 氣冷抑或液冷?就 6000 SE 而言,兩者屬不同的外形規格:雙插槽對單插槽 FHXL。
  8. 是否計劃增設第二台伺服器?若然,網絡須於此刻選定:25GbE 就單一機器而言足夠,就分散式負載而言則成死胡同。
  9. 製成系統抑或準系統?此點決定報價單上的項目數量與交貨期。
第 08 層 · 財務 雲端商使用模式與市場狀況

成本與市場

首先須作一項說明:NVIDIA 並不公佈此類產品的價格。評測文章中出現的任何金額均屬第三方估算,本手冊並未採用。價格須向合作夥伴或透過 NVIDIA Marketplace 取得。惟可比較的成本結構,則可依據雲端服務商的文件建立。

表 15 · 搭載 RTX PRO 6000 SE 的雲端方案
平台配置值得留意之處
AWS EC2 G7e最多 8 張卡,顯示記憶體合共最高 768GB,Intel Emerald Rapids 處理器,最多 192 個虛擬核心、2,048 GiB 系統記憶體、15.2TB 本機 NVMe,並透過 EFA 提供最高 1,600Gb/s 網絡推論效能較 G6e 最高提升 2.3 倍。支援卡間經 PCIe 的 GPUDirect P2P、經 EFA 的 GPUDirect RDMA,以及配合 FSx for Lustre 的 GPUDirect Storage。按 AWS 所述,單張卡可於 FP8 之下承載 700 億參數的模型
Azure NC RTX PRO 6000 BSE v6主機採用 Intel Granite Rapids,全核心頻率最高 4.2GHz;提供以 MIG 為基礎的部分及完整配置顯示卡經 SR-IOV 提供,故部分遙測數據的收集受限。支援 AKS。目標場景包括數碼分身與 Omniverse、700 億參數以下的推論與 RAG、渲染、以 RTX Virtual Workstation 建置的 VDI,以及 FP32 科學視覺化
Google Cloud G4提供部分顯示卡的虛擬機,vGPU 設定檔分別為 12、24、48 及 96GB按 NVIDIA 技術網誌所述,該等設定檔針對的用途由串流以至高精度 3D 渲染與機械人感測器模擬

客戶須在三種使用模式之間取捨

模式 01

購置伺服器

在全天候持續負載、數據存放地點有要求,以及使用年期可預測的情況下最為合理。可完全掌控數據,成本亦固定。

模式 02

租用專屬伺服器

折衷方案:無資本開支,惟配置已預先固定。MIG 設定檔使服務商得以出售顯示卡的一部分,客戶亦只需取用所需的記憶體容量。

模式 03

公有雲

三家超大規模雲端服務商均提供此卡。適用於應付尖峰、測試以及採購前的試點;在持續負載之下,通常較自置硬件昂貴。

論據

擁有成本應計算的項目

顯示卡價格、AI Enterprise 與 vGPU 授權、電費與散熱(八張較高階的卡單計顯示卡即達 4.8kW,八張較低階者為 1.3kW)、機櫃空間、原廠支援、停機損失。在 6000 SE 以峰值效能取勝的場合,4500 SE 往往憑每插槽密度於擁有成本上勝出。

製造商 雲端商 以具體數字計算

以下模型建基於實際的平台報價與可查核的費率。所有假設均列於表內 —— 更改假設,所得的即是貴方自己的答案,而非他人的答案。

表 16 · 兩款平台各自的出貨內容
項目AGS-6220V2 · 6UAGS-4UMGX-R1 · MGX
處理器無,列為配置選項
記憶體無,列為配置選項
儲存裝置無;機內與前面板者均列為選項
電源4 個預先安裝4 個預先安裝
風扇16 把10 把預先安裝
處理器散熱器與承載框2 個散熱器連扣具2 個散熱器與 4 個承載框
機櫃導軌具備具備,L 形
網絡模組25Gb/s OCP 預先安裝ConnectX-8 見於規格;出貨內容中並無獨立項目 —— 須確認
DPUBlueField-3 見於規格;出貨內容中並無獨立項目 —— 須確認
RAID 金鑰Intel VROC 預先安裝未有列明
電源線4 × C19–C20未有列明

此表可了結一項常見疑問:兩款平台均為準系統。記憶體與儲存裝置無論如何都須另行採購,故以 121,700 美元對 158,210 美元作比較是成立的 —— 兩個數字建基相同。細項則對 6U 較為有利:網絡模組、VROC 金鑰與電源線已包含在內。

表 17 · 輸入數據與假設
參數數值來源
6U 平台配 8 × RTX PRO 6000 SE,準系統121,700 美元商務報價。競爭對手的 6U 機型按同一價格計算
MGX 4U 平台配 8 張卡,準系統158,210 美元按 6U 價格加 30% 計算。同樣不含處理器、記憶體與儲存裝置 —— 詳見表 16
6U 補齊配置:2 × 第四或第五代 Xeon、1TB DDR5、NVMe約 20,000 美元估算。須向供應商確認
MGX 4U 補齊配置:2 × Xeon 6、1TB DDR5 或 MRDIMM、E1.S約 25,000 美元估算。價格較高有三項原因:LGA 4710 處理器、6,400 MT/s 記憶體,以及數據中心級的 E1.S 儲存裝置
若客戶需要大量冷數據容量差距將會擴大6U 具備八個 SATA 槽位 —— 每 TB 成本最低。MGX 僅支援 E1.S。當需求達數十 TB 時,補齊配置的差價極易增加一倍
系統功耗6.0 kW8 × 600W 顯示卡 + 2 × 350W 處理器 + 0.5kW(記憶體、硬碟與風扇)
電源效率94% / 96%6U 為 80 PLUS Platinum,MGX 4U 為 Titanium —— 依規格書所載
機房 PUE1.4假設值。現代數據中心有時可低於此數
電費0.20 美元 / kWh假設值。敏感度分析見下
AWS g7e.48xlarge,8 張卡,按需計費33.14 美元 / 小時us-east-1 區域。四個獨立的 AWS 價格追蹤網站數字一致;仍請以 AWS 計算機查核
AWS g7e.48xlarge,Spot由 12.78 美元 / 小時起最低價格,視可用區與中斷風險而定
計算年期3 年假設值
未計入項目NVIDIA AI Enterprise 與 vGPU 授權、延長原廠支援、機櫃空間或代管費用、伺服器以外的交換機與光纖、人力,以及流量。AWS 另行收取對外流量費用
表 18 · 三年擁有成本
項目6U(INNO3D 及同級)MGX 4UAWS 按需AWS Spot
資本開支141,700 美元183,210 美元
每年電費15,656 美元15,330 美元已包含已包含
全天候運作三年合計188,669 美元229,200 美元871,032 美元335,803 美元
使用率 100% 時每顯示卡小時成本0.90 美元1.09 美元4.14 美元1.60 美元
使用率 50% 時每顯示卡小時成本1.79 美元2.18 美元4.14 美元1.60 美元
全天候之下相對按需計費的回本期6.2 個月8.0 個月

關鍵的不對稱在於:自置硬件的成本幾乎全屬固定成本,雲端則幾乎全屬變動成本。因此雲端並非「一律較貴」,而是在高使用率之下較貴。使用率 50% 一行清楚呈現此點:自置機器的每小時成本增加一倍,雲端費率則維持不變。

表 19 · 購買較租用划算的門檻
情境6UMGX 4U
相對按需計費的使用率門檻21.7%26.3%
相對 Spot 的使用率門檻56.2%68.3%
三年內折算為小時(相對按需計費)26,280 之中的 5,69226,280 之中的 6,915
電費為 0.10 美元 / kWh 時門檻 19.0%
電費為 0.30 美元 / kWh 時門檻 24.4%

最後兩行顯示,電價對結果的影響明顯小於使用率:電價增至三倍,門檻僅移動五個百分點。因此向客戶提出的首個問題並非「貴方每度電多少錢」,而是「顯示卡每日實際會運作多少小時」。

可帶往談判桌的三項結論

其一。若顯示卡運作時間超過四分之一,購買即較按需租用便宜;而在全天候負載之下,機器約於半年回本。相對 Spot 價格,門檻明顯較高,約為 56%,惟 Spot 並無可用性保證,不適用於生產環境。其二。雲端於三種情況下勝出:採購前的試點、疊加於自有機隊之上的尖峰負載,以及短於一年的項目。合理的安排是購入以承擔基礎負載,尖峰部分由雲端補足。其三。6U 與 MGX 4U 之間的門檻差距不足五個百分點。客戶若本已達到使用率門檻,則兩個平台之間的取捨並非取決於金額,而在於是否需要可擴展為叢集的網絡。

30% 溢價拆解:其中包含甚麼、不包含甚麼

此為傾談時實用的一筆帳,惟須謹慎計算。八張卡按 NVIDIA Marketplace 價格計算為 106,000 美元。由此可推算:6U 機箱本身約為 15,700 美元,MGX 4U 約為 52,210 美元,溢價則為 36,510 美元

其中包含者。MGX 4U 規格的機箱、支援 LGA 4710 Xeon 6 並可搭配 6,400 MT/s 記憶體的主機板、3,200W Titanium 級電源(而非 2,700W Platinum)、ConnectX-8 上八個 400Gb/s 埠,以及專屬的 BlueField-3。折算至每個埠,約為每 400Gb/s 4,560 美元 —— 而此尚未計入客戶另需購置的交換機。

其中不包含者 —— 一項重要更正。Xeon 6 處理器本身並不在溢價之內:兩款出貨均不含處理器。溢價所涵蓋者為可安裝 Xeon 6 的主機板;處理器須另行採購,且於 MGX 上的價格會高於 6220V2 所用的第四或第五代 Xeon。此筆金額是加在差價之上,而非包含於其中。

必須取得書面確認之事。於 AGS-4UMGX-R1 的出貨內容之中,ConnectX-8 與 BlueField-3 均未列為獨立項目:兩者僅見於規格欄,並標註「Configured with」。此語讀來意為「已配置於系統之內」,惟涉及 36,510 美元的差額,必須由供應商以書面確認。應直接提問:ConnectX-8 SuperNIC 板卡與 BlueField-3 模組是否已包含於 AGS-4UMGX-R1 的價格之內,抑或另行計費?若屬另行計費,上述整筆帳即告瓦解,比較須重新建立。

溢價肯定無法回收者。能源效率:由 Platinum 轉為 Titanium 每年節省 326 美元,即三年約 980 美元,僅佔溢價的 2.7%。Titanium 應作為散熱餘裕與可靠性推介,而非作為電費上的節省。

本世代最有力的商務論據

按 NVIDIA 所述,Llama Nemotron Super 模型以 NVFP4 格式在單張 RTX PRO 6000 上運行,其性價比較 H100 上的 FP8 最高高出三倍。此點推翻了慣常的邏輯:在推論方面,價格較低的通用顯示卡反而較旗艦加速卡更為划算 —— 前提為模型能夠載入記憶體之內。市場亦間接印證此點:AWS 獨立測得 G7e 執行個體的推論效能,較上一代採用 L40S 的方案最高提升 2.3 倍。

附錄按來源分類的資料與詞彙表

延伸查閱方向

NVIDIA 所有顯示卡與技術數據的來源

製造商 所有伺服器數據的來源

雲端商 雲端數據的來源

延伸閱讀 並非數字的來源

以下材料適合初步認識此一題材,惟其中的數字應與上述第一手來源核對 —— 正是此類刊物之間的出入,促成本手冊的重新編寫。

詞彙表

表 20 · 術語
術語全稱意義
MIGMulti-Instance GPU於硬件層面將顯示卡切分為互相隔離、具服務品質保證的執行單元
vGPUVirtual GPU供 VDI 使用的顯示卡虛擬化;適用 vWS 與 vPC 授權
MGXNVIDIA MGX伺服器平台的模組化參考設計
SuperNICConnectX-8 SuperNIC內建 48 通道 PCIe Gen 6 交換機的網絡卡
DPUData Processing UnitBlueField-3:自處理器接管網絡、數據存取與保安的處理
GPUDirect P2PPeer to Peer顯示卡之間經 PCIe 直接交換數據,不經系統記憶體
SR-IOVSingle Root I/O Virtualization將裝置提供予虛擬機的方式;Azure NCv6 採用
FP4 / NVFP4四位元格式將權重壓縮至 FP16 四分之一體積的運算格式
NVENC / NVDEC編碼器 / 解碼器硬件影像編碼與解碼引擎
KV 快取Key-Value cache存放對話脈絡的記憶體;往往才是顯示記憶體消耗的真正主因
FHFL / FHXLFull Height Full Length / Extra Length全尺寸擴充卡,以及供液冷版本使用的加長型號
Barebone準系統不含處理器、記憶體與儲存裝置的平台
Headless無顯示輸出不接顯示器而運作