為何不能直接把遊戲顯示卡裝進伺服器
這是與客戶溝通時首先要能夠解釋的一點,因為「為何不用 4090 或 5090,價格便宜得多」這個問題必定會被提出。分別共有六項,而每一項所涉及的都是運作層面,而非跑分成績。
被動式散熱
NVIDIA 明確列出伺服器顯示卡採用被動式散熱,並將 6000 SE 描述為專為需要被動散熱的多卡伺服器而設。卡上並無風扇,氣流由機箱提供。一旦離開具備規劃氣流的伺服器,該卡根本無法運作。
具錯誤更正的記憶體
6000 SE 的規格列明配備 96GB GDDR7 並具備 ECC 錯誤更正。在全天候負載之下,例如連續多日的推論或渲染工作,若無 ECC,一次單位元翻轉即會導致結果出錯,而系統不會發出任何錯誤訊息。
輸出配置各異
6000 SE 設有四個 DisplayPort 2.1 接口,因此在數據中心亦可作繪圖卡使用。4500 SE 的規格中並無顯示輸出一項,屬於純粹的無顯示輸出加速卡。
可切分:MIG 與 vGPU
顯示卡可切分為互相隔離的執行個體,各自擁有專屬記憶體、快取與運算核心,亦可透過 vGPU 分配予遠端使用者。6000 SE 最多四個執行個體,4500 SE 最多兩個、每個 16GB。
整機系統認證
RTX PRO 伺服器具備 NVIDIA-Certified 認證資格,並於 AI Factory Validated Design 計劃之下與合作夥伴的工具一併通過驗證。此為與 AI Enterprise 軟件堆疊及 NVIDIA 網絡產品相容的保證。
功耗可調
6000 SE 的功耗以 400 至 600W 的區間形式公佈。是顯示卡遷就機箱的散熱預算,而非相反。消費級顯示卡並無此項功能。
向客戶陳述的重點並非效能,而是可預測性與可管理性。遊戲顯示卡購入時較平,持有成本卻更高:無法在多個使用者之間切分、沒有 ECC、無法按機箱限制功耗,亦不屬於由伺服器製造商與 NVIDIA 共同承擔責任的認證配置。
四項值得付費的世代變化
Blackwell 接替了 Ada Lovelace 架構。就伺服器顯示卡的銷售而言,真正具意義的僅有以下四項特性,其餘均屬工程師層面的細節。
| 技術 | NVIDIA 的說法 | 客戶所得 |
|---|---|---|
| 第五代 Tensor Core 與 FP4 | 效能較上一代最高提升 3 倍,並新增 FP4 精度支援。6000 SE 搭載第二代 Transformer Engine | 模型權重所佔記憶體僅為 FP16 的四分之一。大型語言模型推論上的倍數級提升源於此處,而非 CUDA 核心數量 |
| GDDR7 記憶體 | 頻寬與容量均大幅提升 | 使單卡 96GB 成為可能,此一容量此前僅見於價格高昂的 SXM 平台 |
| 第四代 RT Core | 效能最高提升 2 倍;RTX Mega Geometry 技術可處理多達 100 倍的光線追蹤三角形 | 渲染、數碼分身、模擬運算、Omniverse。此正是純運算取向的加速卡所欠缺者 |
| NVENC 9 與 NVDEC 6 | H.264 與 HEVC 支援 4:2:2,AV1 品質改善,H.264 解碼吞吐量提升一倍 | 影像分析、轉碼、串流、媒體製作 —— 在這些領域,無需提及人工智能亦可成交 |
理解整條產品線的關鍵在於:RTX PRO 既可執行人工智能運算,亦可處理圖形。此種通用性既是其核心競爭優勢,亦是銷售上最主要的論據。
兩款卡並列比較
兩者均建基於 Blackwell 架構,均採被動散熱,均使用 PCIe Gen5 x16,亦均支援 MIG。相似之處到此為止:兩者所針對的散熱預算與工作性質截然不同。
| 項目 | RTX PRO 6000 Blackwell SE | RTX PRO 4500 Blackwell SE |
|---|---|---|
| CUDA 核心 | 24,064 | 10,496 |
| RT Core(第四代) | 188 | 82 |
| 顯示記憶體 | 96GB GDDR7,具 ECC | 32GB GDDR7 |
| 記憶體頻寬 | 1,597 GB/s | 800 GB/s |
| 記憶體位寬 | 512 位元 | 256 位元 |
| Tensor Core FP4 | 4 PFLOPS | 1.6 PFLOPS |
| Tensor Core FP8 | 2 PFLOPS | 811 TFLOPS |
| Tensor Core FP16 / BF16 | 1 PFLOPS | 406 TFLOPS |
| Tensor Core TF32 | 234 TFLOPS | 203 TFLOPS |
| 單精度 FP32 | 120 TFLOPS | 51 TFLOPS |
| RT Core 峰值 | 355 TFLOPS | 154 TFLOPS |
| 功耗 | 400–600W(可調) | 165W |
| 外形規格 | 氣冷:雙插槽,11.2 × 26.7 厘米 · 液冷:單插槽,FHXL | 單插槽,11.2 × 26.7 厘米 |
| 散熱方式 | 被動式 | 被動式 |
| 介面 | PCIe Gen 5 x16 | PCI Express 5.0 x16 |
| MIG | 最多 4 個隔離執行個體 | 最多 2 個,每個 16GB |
| 影像引擎 | 4 NVENC / 4 NVDEC | 3 NVENC / 3 NVDEC |
| 顯示輸出 | 4 × DisplayPort 2.1 | 規格中未有列出 |
| 機密運算 | 規格中未有列出 | 支援 |
| 供電接頭 | 規格中未有列出 | 1 × PCIe CEM5 16-pin |
| 所接替型號 | NVIDIA L40S | NVIDIA L4 |
標示「規格中未有列出」的項目乃刻意保留:NVIDIA 為兩款卡公佈的參數組合略有出入,而以類推方式填補空白,正是錯誤數字流入評測文章的途徑。
注意:三款名稱極為相近的產品
此為規格書與報價單中最常見的錯誤。「RTX PRO 6000 Blackwell」是一個由三款卡組成的系列,而伺服器版的 4500 則獨立於此系列之外。
| 項目 | Server Edition | Workstation Edition | Max-Q Workstation |
|---|---|---|---|
| 記憶體 | 96GB GDDR7 ECC | 96GB GDDR7 ECC | 96GB GDDR7 ECC |
| 功耗 | 400–600W | 600W | 300W |
| 散熱 | 被動式 | 雙向貫流 | 主動式 |
| 尺寸 | 11.2 × 26.7 厘米,雙插槽 | 13.7 × 30.5 厘米,雙插槽 | 11.2 × 26.7 厘米,雙插槽 |
| 顯示輸出 | 4 × DisplayPort 2.1 | 4 × DisplayPort 2.1 | 4 × DisplayPort 2.1 |
| 匯流排 | PCIe Gen 5 x16 | PCIe Gen 5 x16 | PCIe Gen 5 x16 |
| NVIDIA 列明用途 | 採被動散熱的多卡伺服器:推論、模型微調、分散式渲染、高效能運算、虛擬工作站 | 單卡工作站上的最高效能 | 高密度工作站配置,最多四張卡 |
對於需要密度但沒有伺服器機櫃的客戶,Max-Q 是務實的折衷方案:記憶體容量相同而發熱減半,工作站內可安裝四張。另值得留意 NVIDIA 對伺服器版的措辭 —— 微調獲明文列出,即 fine-tuning 屬於既定用途,與由零開始訓練有別。
兩款伺服器卡的「每瓦記憶體」比例相近,真正差距懸殊者為每插槽密度:單插槽 165W 對雙插槽 600W。兩者之間的取捨,實質上是「一個大型模型」與「多條並行流程」之間的取捨。就運算能力而言差距為二至二點五倍,就功耗而言則接近四倍。
在 NVIDIA 數據中心產品線中的定位
銷售此類顯示卡最有價值的能力,在於能夠指出何時並不適用。數據中心產品線分為兩大主幹:RTX PRO 系列的通用 PCIe 卡,以及為訓練而設的運算加速卡。
| 產品 | NVIDIA 所述角色 | 圖形與 RT | 互連介面 |
|---|---|---|---|
| RTX PRO 4500 SE | 中小型模型推論、數據處理與數據科學、影像分析、虛擬化。適用於數據中心、邊緣運算與雲端 | 具備 | PCI Express 5.0 x16 |
| RTX PRO 6000 SE | 推論、模型微調、分散式渲染、高效能運算、虛擬工作站。數據中心的通用顯示卡 | 具備 | PCIe Gen 5 x16 |
| H 系列與 B 系列 | NVIDIA 另設的產品線,針對需要透過 NVLink 建立卡間連結的應用場景 | 有限 | NVLink / NVSwitch |
兩款卡的規格中,互連介面僅列出 PCI Express 一項,並無 NVLink。卡與卡之間透過 PCIe 通訊,記憶體不會匯聚為共用資源池。八張 96GB 的卡並不等於「768GB 供單一模型使用」,而是八個在記憶體上互相獨立的加速卡。單卡容量大在並行推論中可作補償,但若模型無法載入 96GB 之內,則須採用張量並行並承受 PCIe 的損耗,或改用具備 NVLink 的平台。
世代更替的論據
- 相對 L40S:NVIDIA 表示 RTX PRO 伺服器在模擬運算與合成數據生成方面最高較 L40S 系統快 4 倍,並將 6000 SE 描述為在多模態代理式與生成式應用上相對 L40S 的顯著跨越。
- 相對 L4:就 4500 SE,NVIDIA 宣稱在中小型模型推論方面較上一代 L4 快逾 5 倍 —— 前提為採用 NVIDIA 最佳化框架與 NIM 微服務。
- 相對純處理器系統:在人工智能影像理解方面,NVIDIA 宣稱效能最高可達純處理器系統的 100 倍,佔用空間與耗電量則減少逾 95%;向量資料庫方面最高可達 50 倍。對於仍在維持處理器伺服器機隊的客戶而言,此為最有力的論據。
上述最後兩項數字須附重要說明:50 倍與 100 倍的比較對象,為配備八張 4500 SE 的伺服器與處理器系統之間的對比(向量資料庫方面採用具 192 個虛擬核心的 AMD 9654,3,300 萬條向量於 Milvus 2.5.25 建立索引,處理器端用 HNSW 演算法,顯示卡端用 cuVS CAGRA;影像方面採用雙路 AMD 9654 與 Qwen3-VL-8B 模型)。此為平台層面的合理比較,但並非卡對卡的比較,而客戶方稱職的工程師必定會就此提問。
真正促成成交的功能
規格表面向工程師。商務決策者所看重的是以下各項 —— 正是它們把硬件轉化為可以轉售或在各部門之間分攤的服務。
| 技術 | 運作原理 | 對客戶的價值 |
|---|---|---|
| MIG | 於硬件層面將顯示卡切分為互相隔離的執行個體,各自具備高頻寬記憶體、快取與運算核心,並提供有保證的服務品質。6000 SE 最多四個,4500 SE 最多兩個、每個 16GB | 為每一租戶提供有保證的服務品質。單一顯示卡可同時承載數項互不干擾的工作 —— 此為計費與多租戶架構的基礎 |
| vGPU | 配合 NVIDIA RTX Virtual Workstation 與 Virtual PC 軟件,顯示卡可虛擬化予遠端使用者。支援疊加於 MIG 之上的分時機制,使人工智能與圖形工作得以同時執行。vGPU 20 另新增 AI Virtual Workstation Toolkit 與固定份額排程 | 工程師與設計師在瘦客戶端上工作,而 CAD 授權與數據不會離開企業內部網絡。付款理由往往正是此一場景,而非人工智能 |
| ECC | 顯示記憶體的錯誤更正,於 6000 SE 的 96GB GDDR7 中列明 | 全天候生產負載的前提條件,亦為基建招標中的常規要求 |
| 機密運算 | 4500 SE 的規格表中列明支援此項功能 | 受監管行業的論據:於處理過程中保護數據與模型 |
| NVIDIA AI Enterprise | 包含 NIM 與 NeMo 微服務在內的工具、程式庫與框架套件 | 發票上的獨立項目,同時亦回應「日後由誰維護」這一疑慮 |
| NVIDIA-Certified | RTX PRO 伺服器具備此資格,並於 AI Factory Validated Design 之下與合作夥伴工具一併通過驗證 | 與 NVIDIA 網絡產品、BlueField-3 及 AI Enterprise 堆疊相容的保證。同時為客戶與系統整合商消除整合風險 |
| NVIDIA Run:ai | 工作負載與顯示卡的調度平台,可提升使用率與整體吞吐量 | 將閒置顯示卡投入運作,是關於投資回收的直接論據 |
談及 MIG 時應以金額而非 GB 為單位。一張 RTX PRO 6000 SE 切分為四個執行個體,即等同於在單一實體卡上設有四個人工智能開發者工作環境,或四項獨立的推論服務。反向規則同樣重要:不可為 4500 SE 規劃四名使用者,該卡最多只能切分為兩個執行個體。此一細節在擬定報價時經常被忽略。
伺服器是一套系統,而非裝有顯示卡的箱子
「認識硬件」與「理解伺服器技術」的分界線就在此處。顯示卡在工程複雜度之中所佔比重較小,其餘為機箱、網絡、供電與散熱。參考配置由 NVIDIA 界定,具體機型則由其製造商說明。
NVIDIA 四種參考配置
NVIDIA 將 RTX PRO Server 界定為數據中心的通用平台,並提供四項建基於 MGX 模組化參考設計的示例。此為評估任何製造商方案時的基準。
| 配置 | 顯示卡 | 網絡 | DPU |
|---|---|---|---|
| MGX 6U | 8 × RTX PRO 6000 SE,液冷 | ConnectX-8 SuperNIC,內建 PCIe Gen 6 交換機 | BlueField-3 |
| MGX 4U | 8 × RTX PRO 6000 SE | ConnectX-8 SuperNIC,內建 PCIe Gen 6 交換機 | BlueField-3 |
| MGX 2U | 2 × RTX PRO 6000 SE | ConnectX-7 或 BlueField-3 SuperNIC | BlueField-3 |
| MGX 2U | 8 × RTX PRO 4500 SE | ConnectX-7 SuperNIC | BlueField-3 |
最後一行極易被忽略,實則不應:八張較小的卡可容納於兩個機架單位之內。即 2U 之內具備 256GB 記憶體與 12.8 PFLOPS 的 FP4 運算力,顯示卡功耗為 1.3kW,而八張較大的卡則需 4.8kW。就影像分析與小型模型推論而言,此為官方配置中密度最高者。
NVIDIA SuperNIC 內建交換機的作用
NVIDIA 如此描述近幾代最主要的架構變化:ConnectX-8 SuperNIC PCIe Switch 為一塊整合多組 SuperNIC 的板卡,每組 SuperNIC 均將高速網絡與 48 通道的 PCIe Gen 6 交換機結合。此設計取消了獨立的 PCIe 交換機,使卡間頻寬倍增,簡化板卡佈線,並提供最高 800Gb/s 的吞吐量。於各項配置中與之並列的 BlueField-3,按 NVIDIA 的說明,可自處理器接管網絡、數據存取與資訊保安的處理,並提供零信任模式的隔離。網絡子系統另由 Spectrum-X 補足:透過 RoCE 自適應路由與擁塞控制,將儲存效能提升接近五成。
八卡 PCIe 伺服器有兩種拓撲,能夠說明其分別甚有用處。在交換式設計中,顯示卡連接至專用的 PCIe 交換晶片,再由該晶片向上連往處理器:任何一張卡均可以全寬度與另一張卡通訊,無須離開交換機,而可用通道數亦多於處理器本身所能提供者。在直連式設計中,每張卡直接接入處理器的根複合體:成本較低,且距離系統記憶體少一個跳躍,但顯示卡須分屬兩個插槽,兩邊之間的流量須經跨處理器匯流排。AGS-6220V2 採直連式,AGS-4UMGX-R1 採交換式。此一分別並非咬文嚼字,業界兩端均可印證:NVIDIA 開發 ConnectX-8 SuperNIC,正是為了在保留交換機優點的同時取消獨立交換機;而 AWS 亦特別指出,共用同一 PCIe 交換機的顯示卡之間點對點延遲極低。
製造商 三類機型
2U,2 至 4 張卡
Cisco、Dell、HPE、Lenovo 與 Supermicro 的一般機架式伺服器 —— 五者均列於 NVIDIA 主要系統合作夥伴名單之內。可直接安裝於客戶現有機櫃。對於已設有自家數據中心的企業而言,此為踏入加速運算的入門選項。
4U MGX,8 張卡
建基於 NVIDIA MGX 參考設計、配備 ConnectX-8 與 BlueField-3 的專用平台。此為叢集的組成單元,而非「一台裝有顯示卡的伺服器」。例子包括 INNO3D AGS-4UMGX-R1、Gigabyte XL44-SX2-AAS1、ZOTAC ZRS-MGX-R1、Supermicro SYS-522GA-NRT。
6U,8 張卡
如 INNO3D AGS-6220V2 之類的平台。同樣八張卡,但體積大出一半:以密度與高速網絡,換取氣流餘裕、維護便利與價格優勢。屬於自足的工作機器,而非叢集節點。
製造商 具體平台分析:INNO3D AGS-6220V2
將一台設計理念迥異的機器與 MGX 參考配置並列,甚具參考價值。此為可安裝八張 RTX PRO 6000 Blackwell Server Edition 的 6U 機箱,其中幾乎每一項設計決定均與 MGX 的邏輯相反。數據取自 INNO3D 就料號 AGS-6220V2P2-B00 所發佈的規格書。
| 子系統 | 實際規格 | 實務上的意義 |
|---|---|---|
| 供貨形式 | 準系統。機箱、主機板、4 個電源、25Gb/s OCP 模組、VROC 金鑰、導軌與散熱器均已預先安裝。不含處理器、記憶體與儲存裝置 | 此為平台而非製成伺服器。處理器、DDR5、NVMe 與八張顯示卡屬報價單上的獨立項目,交貨期亦各自不同 |
| 外形規格 | 6U,900 × 438 × 264 毫米 | 八張卡佔用 6U,而參考配置同樣八張僅佔 4U。900 毫米的深度須對照客戶機櫃深度,並預留理線空間 |
| 顯示卡插槽 | 8 × PCIe 5.0 x16,全高雙寬。直接連接處理器,不設 PCIe 交換機 | 每張卡均獲得完整的 x16。然而 8 × x16 即為兩個插槽需提供 128 條通道:顯示卡必然按 4+4 分屬兩邊,兩邊之間的交換須經跨處理器匯流排。就張量並行而言,此處即為瓶頸 |
| 處理器 | 2 × Intel Xeon Scalable 第四及第五代,LGA 4677 插槽,C741 晶片組。每顆處理器限 350W TDP | 此上限排除了部分較高階型號 —— 落單前須核對所選型號 |
| 記憶體 | 32 個 DDR5 RDIMM / RDIMM-3DS 插槽,每顆處理器 8 通道。RDIMM 單條最高 96GB,RDIMM-3DS 最高 256GB。第五代 Xeon 於 1DPC 為 5,600 MT/s,2DPC 為 4,400 MT/s | 整機上限約 8TB。插槽全數佔用會令頻率由 5,600 降至 4,400 |
| 網絡 | 1 個 OCP 插槽,隨機附 25Gb/s 模組,另有 1GbE BMC 管理埠 | 與參考配置最關鍵的分別。並無 ConnectX-8、BlueField-3 或 400Gb/s。此為獨立機器,而非叢集組成單元 |
| 儲存 | 12 個 3.5/2.5 吋槽位(8 × SATA-3 + 4 × NVMe),機內 1 條 M.2 NVMe,Intel VROC RAID 0/1/10/5 | 十二個槽位之中八個僅支援 SATA。供高速工作資料集使用者僅餘四個 NVMe 槽位 |
| 供電 | 4 × 2,700W CRPS,3+1 配置,80 PLUS Platinum | 可用功率 8,100W。計算方式:8 × 600W 顯示卡加 2 × 350W 處理器,再加記憶體、硬碟與風扇,約為 6.5kW。供電須為 200–240V,接頭為 C19/C20 |
| 散熱 | 16 把可熱插拔風扇:8 把位於機內,8 把位於後方 | 6U 規格的主要優勢:氣流充裕,更換風扇無須停機 |
| 管理 | 專用 IPMI 埠、VGA、2 × USB 3.2 Gen1。設有 SPI 介面的 TPM 針腳,但 TPM 2.0 模組本身屬選配 | 若招標要求配備 TPM,該模組須另行訂購 |
| 作業系統 | Windows Server 2022/2019、RHEL 9.2–8.6、SLES 15 SP4、Ubuntu 22.04 LTS、VMware ESXi 8.0U1 / 7.0U3i、Citrix Hypervisor 8.2 LTSR CU1 | 支援 ESXi 與 Citrix,顯示此平台的設計亦考慮了虛擬工作站用途 |
文件封面所列料號為 AGS-6220V2P2-B00(項目編號 0K219-B001),而規格頁頁首則寫作 AGS-6220V2P2-B10。此情況多半屬手民之誤或相鄰的配置版本,但落單時必須就料號取得書面確認:機箱內究竟預先安裝了甚麼,由該料號決定。同處另有關於記憶體的細微出入 —— 其中一行寫作 4,800/4,400 MHz,下一行則就第五代 Xeon 於 1DPC 寫作 5,600 MT/s。
製造商 同一製造商,不同理念:INNO3D AGS-4UMGX-R1
INNO3D 另有一款採用相同顯示卡的平台 —— 建基於 NVIDIA MGX 參考設計的 4U 機型,配備 ConnectX-8 SuperNIC 與 BlueField-3。比較同一製造商的兩台機器,較任何跨品牌對比都更具啟發性:可以清楚看出加價換來了甚麼,而無須考慮製造品質與售後服務上的差異。
| 子系統 | AGS-4UMGX-R1 · MGX | AGS-6220V2 · 6U |
|---|---|---|
| 外形規格 | NVIDIA MGX 4U,858 × 440 × 175 毫米 | 6U,900 × 438 × 264 毫米 |
| 顯示卡拓撲 | 8 × PCIe Gen 5 x16 供八張 RTX PRO 6000 SE 使用,另設一個 Gen 5 x16 插槽供 BlueField-3 專用 | 8 × PCIe 5.0 x16,直接連接處理器,不設交換機 |
| 網絡 | ConnectX-8 SuperNIC:8 個 400Gb/s QSFP 埠,另有 2 × 10GbE 與 1GbE BMC | 25Gb/s OCP 模組,另有 1GbE BMC |
| DPU | BlueField-3,設有專屬插槽 | 無 |
| 處理器 | 2 × Intel Xeon 6(Granite Rapids / Sierra Forest),6500 及 6700 系列,LGA 4710 插槽 | 2 × Intel Xeon Scalable 第四及第五代,LGA 4677,限 350W |
| 記憶體 | 32 個 DDR5 RDIMM / MRDIMM 插槽,每顆處理器 8 通道。1DPC 為 6,400 MT/s,2DPC 為 5,200 MT/s。模組容量 32、64、96 及 128GB | 32 個 DDR5 RDIMM / RDIMM-3DS 插槽。1DPC 為 5,600 MT/s,2DPC 為 4,400 MT/s |
| 儲存 | 8 個 2.5 吋可熱插拔槽位,最多可裝八條 25 毫米 E1.S;機內另有 2 條 M.2 NVMe Gen 5 x4 | 12 個槽位(8 × SATA-3 + 4 × NVMe),機內 1 條 M.2 NVMe |
| 供電 | 4 × 3,200W CRPS,3+1 配置,80 PLUS Titanium | 4 × 2,700W CRPS,3+1 配置,80 PLUS Platinum |
| 散熱 | 10 把 80 毫米可熱插拔風扇,按區域劃分:顯示卡區 5 把,主機板區 5 把 | 16 把風扇:機內 8 把,後方 8 把 |
| TPM | TPM 2.0 已焊接於板上,並配備 Microchip CEC1736 硬件信任根 | 僅設 TPM 針腳,模組屬選配 |
| 運作環境 | 0–35°C,濕度 8–90% | 10–35°C,濕度 8–80% |
| 機箱 | 由 Chenbro 製造 | 未有列明 |
| 製造商列明用途 | NVIDIA Omniverse Enterprise、大型數碼分身、高效能運算、大型語言模型推論與微調 | 遷移學習、模型微調、大型語言模型訓練與推論、AI 雲端、高效能運算 |
兩台機器的分別不在顯示卡數量,而在連通性與周邊配置的級別。MGX 版本提供八個 400Gb/s 埠對一個 25Gb/s 埠、專屬的 BlueField-3、新一代的處理器、快一級的記憶體、效率等級與功率均更高的電源,以及已焊接而非選配的 TPM 模組。而且其體積更小:4U 對 6U,深度 858 毫米對 900 毫米。「以六個機架單位換取氣流」這一說法在此對照之下顯得薄弱:MGX 平台的風扇反而更少,十把對十六把,但劃分為顯示卡區與主機板區 —— 在體積減半且供電更強的前提下,此點反映的是更為周密的散熱設計,而非更為寬裕的配置。6U 機型在需要一台較低價獨立節點時仍屬合理選擇,惟其理據如今在於價格,而非工程優勢。
| 比較項目 | MGX 4U 參考配置 NV | INNO3D 6U 製造商 | 主流 2U 製造商 |
|---|---|---|---|
| 顯示卡數量 | 8 | 8 | 2–4 |
| 機櫃密度 | 高 | 低 | 中 |
| 跨節點網絡 | ConnectX-8,最高 800Gb/s,BlueField-3 | OCP 25Gb/s | 視乎配置而定 |
| PCIe 拓撲 | SuperNIC 內建 Gen 6 交換架構 | 直接連接,顯示卡按 4+4 分屬兩個插槽 | 直接連接 |
| 供貨形式 | 通常為製成系統 | 準系統 | 製成系統,附原廠支援 |
| 定位 | 叢集的組成單元 | 自足節點:推論、渲染、虛擬工作站 | 踏入加速運算的第一步 |
| 維護便利性 | 佈局緊密 | 模組化,空間充裕,風扇可熱插拔 | 標準機架維護 |
可寫入報價的說法:客戶若打算擴展為叢集,則選擇依 MGX 參考配置的機型;客戶若只需在單一機器內具備大量運算力,則選擇 6U 平台,而平台的差價將轉為購買顯示卡。倘若兩年之內會出現第二台伺服器與分散式負載,欠缺高速網絡即成死胡同。
| 製造商 | 型號 | 規格 | 顯示卡 | 製造商列明的特點 |
|---|---|---|---|---|
| INNO3D | AGS-4UMGX-R1 | 4U MGX | 8 | ConnectX-8 SuperNIC 配 8 個 400Gb/s 埠、設有專屬插槽的 BlueField-3、Xeon 6、4 × 3,200W Titanium、TPM 2.0 已焊接 |
| INNO3D | AGS-6220V2 | 6U | 8 | 準系統、直接連接而不設交換機、OCP 25Gb/s、4 × 2,700W Platinum、16 把風扇 |
| Lenovo | ThinkSystem SR650a V4 | 2U | 4 | 可將顯示卡功耗限制於 450W,以便在機箱內安裝四張 |
| Supermicro | SYS-522GA-NRT、SYS-422GL-NR | 4U / 5U | 8 | 最早採用配 ConnectX-8 的 MGX PCIe Switch 板卡者之一 |
| Gigabyte | XL44-SX2-AAS1 | 4U MGX | 8 | 雙 Xeon 6700/6500、32 個 DDR5 插槽、3+1 配置的 3,200W Titanium 電源、BlueField-3 與 4 × ConnectX-8 |
| ZOTAC | ZRS-MGX-R1 | 4U MGX | 8 | 第六代 Xeon、32 個 DIMM 插槽、ConnectX-8 上 8 個 400Gb/s 埠、3+1 配置的 3,200W 電源 |
| ASUS | ESC8000A-E13 | 4U | 8 | 建基於 AMD EPYC 平台 |
決定最終配置的是機箱的散熱預算,而非顯示卡的規格。Lenovo 的做法是最佳例證:可將顯示卡功耗限制於 450W,正是為了在機箱內安裝四張。NVIDIA 將功耗設為 400 至 600W 的可調區間,用意亦在於此。在向客戶承諾八張卡之前,須先計算機櫃的供電量與機房的排熱能力。
NVIDIA 提供其自身的工具:Qualified System Catalog —— 已就特定顯示卡通過認證的系統目錄,可按型號篩選;NVIDIA-Certified Systems 認證計劃;以及作為配置基準的 AI Factory Validated Design。另有一項對採購而言重要的觀察:RTX PRO Server 頁面的系統合作夥伴名單,主要夥伴列出 Cisco、Dell、HPE、Lenovo 與 Supermicro,其餘包括 Advantech、ASRock Rack、ASUS、Compal、Eviden、Foxconn、GIGABYTE、Inventec、MiTAC、MSI、Pegatron、QCT、Wistron 與 Wiwynn。該名單之中並無 INNO3D —— 儘管該公司確有一款 NVIDIA MGX 外形規格、配備 ConnectX-8 與 BlueField-3 的平台,其組成與參考配置一致。未列於合作夥伴名單與擁有 MGX 產品兩者並不矛盾:該名單無須詳盡。惟結論不變 —— 確認須來自 NVIDIA 的目錄,而非產品頁面。請於 Qualified System Catalog 按相應顯示卡篩選,並向代理商索取狀態的書面證明。
AGS-6220V2:以何取勝,何處不必爭辯
本層為與客戶溝通而設。每項論據均附上其失效的界線:客戶方的工程師終究會發現這些界線,而由己方率先指出,可將會面由審查轉為共同選型。
八項支柱論據
取得八張卡最經濟的途徑
121,700 美元對 MGX 平台的 158,210 美元 —— 節省 36,510 美元,接近四分之一的預算。兩款平台均以準系統形式供貨,故價格可直接比較。這筆金額將投入處理器、記憶體與硬碟,而非機箱。
界線:若客戶需要 400Gb/s 網絡,此項節省即會消失 —— 外置網卡與交換機將吞噬全部差價。
準系統即是彈性
處理器、記憶體與 NVMe 由客戶依自身合約與自身價格採購。在 DDR5 供應短缺的當下,此為實質的操作空間:客戶可動用手上既有的記憶體庫存。
界線:此論據對「製成伺服器」成立,對 MGX 平台則不成立 —— 後者同樣以準系統形式供貨。切勿將此說成相對 AGS-4UMGX-R1 的優勢。
兩代 Xeon 可供選擇
LGA 4677 插槽同時支援第四代與第五代 Xeon Scalable。客戶可沿用既有庫存,或選購價格較低的型號。採用 LGA 4710 的 MGX 平台並無此選項。
界線:每插槽 350W 的上限會排除部分較高階處理器。
十二個槽位而非八個
8 × SATA 加 4 × NVMe。就媒體檔案庫、溫資料,以及無需 NVMe 讀取速度的資料集而言,SATA 每 TB 的成本低出數倍。
界線:供高速工作資料集使用者僅餘四個槽位。
維護便利且空間充裕
16 把可熱插拔風扇、模組化結構、機內易於接觸。對上門工程師的技術要求較低,更換部件時的停機時間亦較短。
界線:在按機架單位計費的代管環境中,6U 的費用較 4U 高出一半。
直接連接處理器
每張卡均獲得完整的 x16,距離系統記憶體少一個跳躍,韌體堆疊較為簡單,故障點亦較少。就八條互相獨立的推論流程而言,交換機並無任何增益。
界線:顯示卡按 4+4 分屬兩個插槽,兩邊之間的交換須經跨處理器匯流排。
接近四分之一的餘裕
3+1 配置之下可用功率為 8,100W,而推算負載約為 6.5kW。仍有空間升級處理器、增加硬碟以及安裝日後的顯示卡。
界線:須具備 200 至 240V 供電及 C19/C20 接頭 —— 在較舊的機櫃中,此為另一項議題。
半年回本
相對 AWS 的按需計費,在全天候負載之下本機於 6.2 個月回本;而使用率自 21.7% 起,購買即較租用划算。此為手上最有力的量化論據 —— 詳見第 08 層。
界線:若使用率低於約五分之一的時間,較誠實的建議是採用雲端。
可以放心推介的應用場景
| 應用 | 適合的理由 | 可引用的依據 |
|---|---|---|
| 約 700 億參數以下的大型語言模型推論 | 單卡 96GB 與 1,597 GB/s,原生支援 FP4 | AWS 與 Microsoft 各自獨立地將此門檻視為單卡的界線 |
| 多個獨立模型與多租戶架構 | MIG 可於每張卡切分出最多四個隔離執行個體 | 全機最多 32 個具服務品質保證的隔離執行個體 —— 計費機制的基礎 |
| 代理式服務與 RAG | 足以應付長脈絡與 KV 快取的記憶體容量 | Microsoft 明確將 700 億參數以下模型的 RAG 列為此卡的目標場景 |
| 既有模型的微調 | 記憶體充足,並支援 FP8/BF16 | NVIDIA 明確將 fine-tuning 列入伺服器版的用途 —— 此說並非牽強 |
| 虛擬工作站與 VDI | 疊加於 MIG 之上的 vGPU,可於人工智能與圖形工作之間分時 | 規格書列明支援 VMware ESXi 8.0U1 與 Citrix Hypervisor 8.2 —— 此平台自設計之初即涵蓋此一場景 |
| 渲染、Omniverse、OpenUSD、數碼分身 | 188 個第四代 RT Core,峰值 355 TFLOPS | 此正是純運算加速卡所欠缺者:採用 H 系列的競爭對手無法涵蓋此場景 |
| 影像分析、轉碼、串流 | 每張卡四組 NVENC 與四組 NVDEC | 全機 32 組編碼引擎與 32 組解碼引擎;H.264 與 HEVC 支援 4:2:2 |
| 向量搜尋、分析、數據科學 | 透過 cuVS 與 CUDA-X 堆疊加速 | NVIDIA 宣稱建立索引時較處理器系統最高快 50 倍 |
| FP32 科學運算與模擬 | 每張卡 120 TFLOPS FP32 | 單一節點即可涵蓋昔日需要小型叢集方能完成的工作 |
| 受監管行業的本地人工智能 | 數據與模型不會離開客戶的內部範圍 | 第 08 層與雲端的比較顯示,在持續負載之下此方案亦更為便宜 |
不應以此機型推介的應用場景
下表較上表更具價值。系統若售予不合適的場景,退回時會連同信譽一併損失;而及時指出限制,則幾乎每次都能轉化為己方產品組合中的另一項產品。
| 應用 | 不適合的原因 | 建議改為推介 |
|---|---|---|
| 由零開始訓練大型模型 | 顯示卡並無 NVLink,記憶體亦不會匯聚為共用資源池。訓練本身亦超出 NVIDIA 為兩款 RTX PRO 卡所列明的用途 | H 系列或 B 系列的 NVLink 平台,或於訓練期間租用運算資源 |
| 跨節點的分散式訓練與推論 | 網絡僅有一個 25Gb/s 的 OCP 模組,就跨節點通訊而言相差一個數量級 | INNO3D AGS-4UMGX-R1:ConnectX-8 上八個 400Gb/s 埠,另加 BlueField-3 |
| 八張卡全面採用張量並行且 SLA 嚴格 | 兩個插槽提供 128 條通道,意味顯示卡按 4+4 分屬兩邊,兩邊之間的交換須經跨處理器匯流排 | AGS-4UMGX-R1,其 SuperNIC 內建 PCIe Gen 6 交換架構 |
| 透過 GPUDirect Storage 與 RDMA 經網絡存取儲存 | 並無 DPU:沒有可用以卸載網絡與數據存取的部件 | AGS-4UMGX-R1,其 BlueField-3 設有專屬插槽 |
| 按機架單位計費的高密度代管 | 八張卡佔用 6U 而 MGX 僅佔 4U —— 同等運算力之下場地費用高出 50% | AGS-4UMGX-R1,或採用八張 RTX PRO 4500 SE 的 MGX 2U 配置 |
| 強制要求 TPM 2.0 的招標 | 板上僅設具 SPI 介面的針腳,模組本身屬選配 | 加購該模組,或改為推介 AGS-4UMGX-R1,其 TPM 2.0 已焊接於板上並配備 Microchip CEC1736 信任根 |
| 大型資料集須置於高速硬碟的處理流程 | 十二個槽位之中僅四個為 NVMe;機內 M.2 亦只有一條 | AGS-4UMGX-R1,具八個 E1.S 槽位;或改用外置儲存 |
| 機密運算的要求 | NVIDIA 於 RTX PRO 4500 SE 的規格中列明支援;6000 SE 並無此項 | 採用 RTX PRO 4500 SE 的 MGX 2U 配置 —— 該處為官方明文所載 |
| 處理器端的重度資料前處理 | 第四及第五代 Xeon,功耗上限 350W,記憶體 1DPC 為 5,600 MT/s | AGS-4UMGX-R1,採用 Xeon 6 與 6,400 MT/s 記憶體 |
| 氣候條件不穩定的邊緣部署 | 運作範圍 10 至 35°C,濕度上限 80% 且不得凝結 | 專用的邊緣運算平台,或改善機房環境 |
| 深度不足 950 毫米的機櫃 | 900 毫米機箱加上理線空間,在物理上無法容納 | AGS-4UMGX-R1,深度為 858 毫米 |
在十一項不適合的場景之中,有七項可由己方產品組合中的另一台機器涵蓋。聽到「我們需要分散式負載」或「我們的代管按機架單位計費」時,正確的應對並非為 6220V2 辯護,而是轉介至 AGS-4UMGX-R1。訂單規模亦會因而擴大:MGX 平台的價格高出 30%。應當推銷的是整個產品組合,而非單一型號。
必然會遇到的異議與誠實的回應
| 異議 | 誠實的回應 |
|---|---|
| 「為何不用遊戲顯示卡,價格便宜得多」 | 配合機箱氣流的被動散熱、ECC、MIG 與 vGPU、可按散熱預算於 400 至 600W 之間調整的功耗,以及整機系統認證。遊戲顯示卡購入時較平而持有成本更高:無法在使用者之間切分,亦不屬於受支援的配置 |
| 「對手以 4U 容納同樣八張卡,而貴方需要 6U」 | 直接承認。我方在此的優勢為價格、維護便利,以及多出一倍的硬碟槽位。若客戶更重視密度與網絡,則推介 AGS-4UMGX-R1 —— 該機同屬我方產品 |
| 「NVIDIA 的系統合作夥伴名單中並無 INNO3D」 | 承認。產品頁面上的名單並非詳盡,而我方確有一款 MGX 外形規格、配備 ConnectX-8 與 BlueField-3 的平台。建議於 NVIDIA Qualified System Catalog 查核,並經代理商索取狀態的書面證明 —— 以文件而非口頭方式了結此一問題 |
| 「這是準系統,我們需要製成伺服器」 | 即時列出欠缺的項目:兩顆處理器、記憶體、儲存裝置。提供整合服務並說明交貨期。同時說明,在記憶體短缺期間,由客戶自行採購往往在價格與交期兩方面均較為有利 |
| 「太貴」 | 將討論由價格轉向擁有成本。相對 AWS 按需計費,全天候負載之下 6.2 個月回本,而使用率達 21.7% 即已具優勢。應詢問顯示卡每日實際會運作多少小時 —— 此一問題對成交的作用大於折扣 |
| 「我們用雲端便可」 | 就試點與應付尖峰負載而言表示同意 —— 此舉誠實且有助建立信任。其後展示門檻:使用率高於約四分之一時,購買較為便宜。最佳做法是購入以承擔基礎負載,尖峰部分則由雲端補足 |
| 「我們需要訓練自己的模型」 | 先行釐清:由零開始訓練,抑或微調。微調獲 NVIDIA 明文列入伺服器版的用途,此處本機確屬合適。由零開始訓練並非我方場景,宜及早說明 |
以下每一項均可於一分鐘內查證,而一旦出錯即會損及整份建議書的可信度。不可稱「768GB 供單一模型使用」 —— 記憶體不會匯聚,此為八張在記憶體上互相獨立的卡。不可提及 NVLink —— 兩款卡的規格均僅列出 PCI Express。不可承諾 NVIDIA-Certified 資格,除非已就特定配置於目錄中查核。此外,不可將 50 倍與 100 倍的數字套用於本機:該等數字乃於配備八張 RTX PRO 4500 SE 的伺服器上與處理器系統對比所得,並非取自 6000 SE,亦非與另一款顯示卡比較。
配置選型
選型時最常見的錯誤是計算 TFLOPS。就推論而言,首要者為顯示記憶體容量:模型權重若無法完整載入顯示記憶體,系統即會使用系統記憶體,效能隨之急劇下降。
| 客戶需求 | 顯示卡 | 平台 | 須核對事項 |
|---|---|---|---|
| 約 700 億參數以下的大型語言模型推論 | 6000 SE | 2U,兩張卡 | AWS 與 Microsoft 均將此門檻視為單卡的界線。須釐清脈絡長度與 KV 快取的容量 |
| 更大型模型的推論 | 6000 SE | 4U 或 6U,八張卡 | 張量並行;須留意因欠缺 NVLink 而產生的 PCIe 損耗 |
| 大量小型模型 | 4500 SE | MGX 2U,八張卡 | 應以每插槽密度與並行流程數量計算,而非以 TFLOPS 總和計算 |
| 影像分析、轉碼 | 4500 SE | MGX 2U、邊緣機箱 | 每張卡三組 NVENC 與三組 NVDEC 方為關鍵參數,而非 CUDA 核心數量 |
| 數據處理、向量搜尋 | 4500 SE | MGX 2U,八張卡 | NVIDIA 宣稱建立向量索引時較處理器最高快 50 倍 |
| 虛擬工作站 | 兩者皆可 | 2U 或 4U | vGPU 授權與 MIG 執行個體數量:較高階的卡四個,較低階的卡兩個 |
| 渲染、Omniverse、模擬運算 | 6000 SE | MGX 4U 或 6U | RT Core 為必要條件;較高階的卡其 RT 峰值高出一倍 |
| 既有模型的微調 | 6000 SE | 4U 或 6U | NVIDIA 已將 fine-tuning 明文列入伺服器版的用途 |
| 無資本開支的試點 | 6000 SE | AWS G7e、Azure NCv6、Google Cloud G4 | 詳見第 08 層 |
| 由零開始訓練大型模型 | 超出兩款卡所列明的用途。互連介面僅列出 PCI Express,並無 NVLink 一項 | ||
擬定規格書前應釐清的問題
- 將運行哪些模型、採用何種精度?由此決定所需的顯示記憶體容量;FP8 之下約 700 億參數即為較高階單卡的界線。
- 脈絡長度為何、同時連線數為何?由此決定 KV 快取的容量,而此項往往才是真正的決定因素。
- 需要訓練抑或僅需推論?若微調僅佔少部分時間,則硬件應按推論選型,重度工作改為租用。
- 是否需要圖形與光線追蹤?若然,在此預算範圍內基本上並無 RTX PRO 以外的選擇。
- 獨立使用者有多少?6000 SE 為四個 MIG 執行個體,4500 SE 為兩個、每個 16GB。
- 機櫃供電為多少千瓦、如何排熱?此一限制削減配置的次數多於任何其他因素。
- 氣冷抑或液冷?就 6000 SE 而言,兩者屬不同的外形規格:雙插槽對單插槽 FHXL。
- 是否計劃增設第二台伺服器?若然,網絡須於此刻選定:25GbE 就單一機器而言足夠,就分散式負載而言則成死胡同。
- 製成系統抑或準系統?此點決定報價單上的項目數量與交貨期。
成本與市場
首先須作一項說明:NVIDIA 並不公佈此類產品的價格。評測文章中出現的任何金額均屬第三方估算,本手冊並未採用。價格須向合作夥伴或透過 NVIDIA Marketplace 取得。惟可比較的成本結構,則可依據雲端服務商的文件建立。
| 平台 | 配置 | 值得留意之處 |
|---|---|---|
| AWS EC2 G7e | 最多 8 張卡,顯示記憶體合共最高 768GB,Intel Emerald Rapids 處理器,最多 192 個虛擬核心、2,048 GiB 系統記憶體、15.2TB 本機 NVMe,並透過 EFA 提供最高 1,600Gb/s 網絡 | 推論效能較 G6e 最高提升 2.3 倍。支援卡間經 PCIe 的 GPUDirect P2P、經 EFA 的 GPUDirect RDMA,以及配合 FSx for Lustre 的 GPUDirect Storage。按 AWS 所述,單張卡可於 FP8 之下承載 700 億參數的模型 |
| Azure NC RTX PRO 6000 BSE v6 | 主機採用 Intel Granite Rapids,全核心頻率最高 4.2GHz;提供以 MIG 為基礎的部分及完整配置 | 顯示卡經 SR-IOV 提供,故部分遙測數據的收集受限。支援 AKS。目標場景包括數碼分身與 Omniverse、700 億參數以下的推論與 RAG、渲染、以 RTX Virtual Workstation 建置的 VDI,以及 FP32 科學視覺化 |
| Google Cloud G4 | 提供部分顯示卡的虛擬機,vGPU 設定檔分別為 12、24、48 及 96GB | 按 NVIDIA 技術網誌所述,該等設定檔針對的用途由串流以至高精度 3D 渲染與機械人感測器模擬 |
客戶須在三種使用模式之間取捨
購置伺服器
在全天候持續負載、數據存放地點有要求,以及使用年期可預測的情況下最為合理。可完全掌控數據,成本亦固定。
租用專屬伺服器
折衷方案:無資本開支,惟配置已預先固定。MIG 設定檔使服務商得以出售顯示卡的一部分,客戶亦只需取用所需的記憶體容量。
公有雲
三家超大規模雲端服務商均提供此卡。適用於應付尖峰、測試以及採購前的試點;在持續負載之下,通常較自置硬件昂貴。
擁有成本應計算的項目
顯示卡價格、AI Enterprise 與 vGPU 授權、電費與散熱(八張較高階的卡單計顯示卡即達 4.8kW,八張較低階者為 1.3kW)、機櫃空間、原廠支援、停機損失。在 6000 SE 以峰值效能取勝的場合,4500 SE 往往憑每插槽密度於擁有成本上勝出。
製造商 雲端商 以具體數字計算
以下模型建基於實際的平台報價與可查核的費率。所有假設均列於表內 —— 更改假設,所得的即是貴方自己的答案,而非他人的答案。
| 項目 | AGS-6220V2 · 6U | AGS-4UMGX-R1 · MGX |
|---|---|---|
| 處理器 | 無 | 無,列為配置選項 |
| 記憶體 | 無 | 無,列為配置選項 |
| 儲存裝置 | 無 | 無;機內與前面板者均列為選項 |
| 電源 | 4 個預先安裝 | 4 個預先安裝 |
| 風扇 | 16 把 | 10 把預先安裝 |
| 處理器散熱器與承載框 | 2 個散熱器連扣具 | 2 個散熱器與 4 個承載框 |
| 機櫃導軌 | 具備 | 具備,L 形 |
| 網絡模組 | 25Gb/s OCP 預先安裝 | ConnectX-8 見於規格;出貨內容中並無獨立項目 —— 須確認 |
| DPU | 無 | BlueField-3 見於規格;出貨內容中並無獨立項目 —— 須確認 |
| RAID 金鑰 | Intel VROC 預先安裝 | 未有列明 |
| 電源線 | 4 × C19–C20 | 未有列明 |
此表可了結一項常見疑問:兩款平台均為準系統。記憶體與儲存裝置無論如何都須另行採購,故以 121,700 美元對 158,210 美元作比較是成立的 —— 兩個數字建基相同。細項則對 6U 較為有利:網絡模組、VROC 金鑰與電源線已包含在內。
| 參數 | 數值 | 來源 |
|---|---|---|
| 6U 平台配 8 × RTX PRO 6000 SE,準系統 | 121,700 美元 | 商務報價。競爭對手的 6U 機型按同一價格計算 |
| MGX 4U 平台配 8 張卡,準系統 | 158,210 美元 | 按 6U 價格加 30% 計算。同樣不含處理器、記憶體與儲存裝置 —— 詳見表 16 |
| 6U 補齊配置:2 × 第四或第五代 Xeon、1TB DDR5、NVMe | 約 20,000 美元 | 估算。須向供應商確認 |
| MGX 4U 補齊配置:2 × Xeon 6、1TB DDR5 或 MRDIMM、E1.S | 約 25,000 美元 | 估算。價格較高有三項原因:LGA 4710 處理器、6,400 MT/s 記憶體,以及數據中心級的 E1.S 儲存裝置 |
| 若客戶需要大量冷數據容量 | 差距將會擴大 | 6U 具備八個 SATA 槽位 —— 每 TB 成本最低。MGX 僅支援 E1.S。當需求達數十 TB 時,補齊配置的差價極易增加一倍 |
| 系統功耗 | 6.0 kW | 8 × 600W 顯示卡 + 2 × 350W 處理器 + 0.5kW(記憶體、硬碟與風扇) |
| 電源效率 | 94% / 96% | 6U 為 80 PLUS Platinum,MGX 4U 為 Titanium —— 依規格書所載 |
| 機房 PUE | 1.4 | 假設值。現代數據中心有時可低於此數 |
| 電費 | 0.20 美元 / kWh | 假設值。敏感度分析見下 |
| AWS g7e.48xlarge,8 張卡,按需計費 | 33.14 美元 / 小時 | us-east-1 區域。四個獨立的 AWS 價格追蹤網站數字一致;仍請以 AWS 計算機查核 |
| AWS g7e.48xlarge,Spot | 由 12.78 美元 / 小時起 | 最低價格,視可用區與中斷風險而定 |
| 計算年期 | 3 年 | 假設值 |
| 未計入項目 | NVIDIA AI Enterprise 與 vGPU 授權、延長原廠支援、機櫃空間或代管費用、伺服器以外的交換機與光纖、人力,以及流量。AWS 另行收取對外流量費用 | |
| 項目 | 6U(INNO3D 及同級) | MGX 4U | AWS 按需 | AWS Spot |
|---|---|---|---|---|
| 資本開支 | 141,700 美元 | 183,210 美元 | — | — |
| 每年電費 | 15,656 美元 | 15,330 美元 | 已包含 | 已包含 |
| 全天候運作三年合計 | 188,669 美元 | 229,200 美元 | 871,032 美元 | 335,803 美元 |
| 使用率 100% 時每顯示卡小時成本 | 0.90 美元 | 1.09 美元 | 4.14 美元 | 1.60 美元 |
| 使用率 50% 時每顯示卡小時成本 | 1.79 美元 | 2.18 美元 | 4.14 美元 | 1.60 美元 |
| 全天候之下相對按需計費的回本期 | 6.2 個月 | 8.0 個月 | — | — |
關鍵的不對稱在於:自置硬件的成本幾乎全屬固定成本,雲端則幾乎全屬變動成本。因此雲端並非「一律較貴」,而是在高使用率之下較貴。使用率 50% 一行清楚呈現此點:自置機器的每小時成本增加一倍,雲端費率則維持不變。
| 情境 | 6U | MGX 4U |
|---|---|---|
| 相對按需計費的使用率門檻 | 21.7% | 26.3% |
| 相對 Spot 的使用率門檻 | 56.2% | 68.3% |
| 三年內折算為小時(相對按需計費) | 26,280 之中的 5,692 | 26,280 之中的 6,915 |
| 電費為 0.10 美元 / kWh 時 | 門檻 19.0% | — |
| 電費為 0.30 美元 / kWh 時 | 門檻 24.4% | — |
最後兩行顯示,電價對結果的影響明顯小於使用率:電價增至三倍,門檻僅移動五個百分點。因此向客戶提出的首個問題並非「貴方每度電多少錢」,而是「顯示卡每日實際會運作多少小時」。
其一。若顯示卡運作時間超過四分之一,購買即較按需租用便宜;而在全天候負載之下,機器約於半年回本。相對 Spot 價格,門檻明顯較高,約為 56%,惟 Spot 並無可用性保證,不適用於生產環境。其二。雲端於三種情況下勝出:採購前的試點、疊加於自有機隊之上的尖峰負載,以及短於一年的項目。合理的安排是購入以承擔基礎負載,尖峰部分由雲端補足。其三。6U 與 MGX 4U 之間的門檻差距不足五個百分點。客戶若本已達到使用率門檻,則兩個平台之間的取捨並非取決於金額,而在於是否需要可擴展為叢集的網絡。
此為傾談時實用的一筆帳,惟須謹慎計算。八張卡按 NVIDIA Marketplace 價格計算為 106,000 美元。由此可推算:6U 機箱本身約為 15,700 美元,MGX 4U 約為 52,210 美元,溢價則為 36,510 美元。
其中包含者。MGX 4U 規格的機箱、支援 LGA 4710 Xeon 6 並可搭配 6,400 MT/s 記憶體的主機板、3,200W Titanium 級電源(而非 2,700W Platinum)、ConnectX-8 上八個 400Gb/s 埠,以及專屬的 BlueField-3。折算至每個埠,約為每 400Gb/s 4,560 美元 —— 而此尚未計入客戶另需購置的交換機。
其中不包含者 —— 一項重要更正。Xeon 6 處理器本身並不在溢價之內:兩款出貨均不含處理器。溢價所涵蓋者為可安裝 Xeon 6 的主機板;處理器須另行採購,且於 MGX 上的價格會高於 6220V2 所用的第四或第五代 Xeon。此筆金額是加在差價之上,而非包含於其中。
必須取得書面確認之事。於 AGS-4UMGX-R1 的出貨內容之中,ConnectX-8 與 BlueField-3 均未列為獨立項目:兩者僅見於規格欄,並標註「Configured with」。此語讀來意為「已配置於系統之內」,惟涉及 36,510 美元的差額,必須由供應商以書面確認。應直接提問:ConnectX-8 SuperNIC 板卡與 BlueField-3 模組是否已包含於 AGS-4UMGX-R1 的價格之內,抑或另行計費?若屬另行計費,上述整筆帳即告瓦解,比較須重新建立。
溢價肯定無法回收者。能源效率:由 Platinum 轉為 Titanium 每年節省 326 美元,即三年約 980 美元,僅佔溢價的 2.7%。Titanium 應作為散熱餘裕與可靠性推介,而非作為電費上的節省。
按 NVIDIA 所述,Llama Nemotron Super 模型以 NVFP4 格式在單張 RTX PRO 6000 上運行,其性價比較 H100 上的 FP8 最高高出三倍。此點推翻了慣常的邏輯:在推論方面,價格較低的通用顯示卡反而較旗艦加速卡更為划算 —— 前提為模型能夠載入記憶體之內。市場亦間接印證此點:AWS 獨立測得 G7e 執行個體的推論效能,較上一代採用 L40S 的方案最高提升 2.3 倍。
延伸查閱方向
NVIDIA 所有顯示卡與技術數據的來源
- RTX PRO 6000 Blackwell Server Edition · RTX PRO 4500 Blackwell Server Edition —— 規格與效能聲明。
- RTX PRO 6000 Blackwell 系列 —— 三個版本的對照表,表 3 的資料來源。
- RTX PRO Server —— 四種參考配置、網絡技術、系統合作夥伴名單。
- 規格書:6000 SE · 4500 SE · RTX PRO Server · Data Center GPU Line Card。
- MGX · Multi-Instance GPU · 顯示卡虛擬化 · ConnectX-8 SuperNIC · BlueField-3 · Spectrum-X。
- 關於 4500 SE 與 vGPU 20 的技術網誌 · RTX PRO 伺服器新聞稿。
- 查核工具:Qualified System Catalog · NVIDIA-Certified Systems · AI Factory Validated Design · NVIDIA Marketplace。
- MLPerf 測試成績 —— 可獨立查核的基準測試。
製造商 所有伺服器數據的來源
- INNO3D AGS-4UMGX-R1 及 PDF 規格書 —— MGX 4U 平台。
- INNO3D AGS-6220V2 及 PDF 規格書 —— 6U 平台。
- Lenovo Press:ThinkSystem 上的 6000 SE 及 4500 SE —— 相容性對照表與插槽功耗上限。一份此類文件抵得上十篇評測。
- Gigabyte:RTX PRO 解決方案 · ZOTAC ZRS-MGX-R1 · Supermicro:系統陣容。
雲端商 雲端數據的來源
延伸閱讀 並非數字的來源
以下材料適合初步認識此一題材,惟其中的數字應與上述第一手來源核對 —— 正是此類刊物之間的出入,促成本手冊的重新編寫。
- ENServeTheHome — PCIe GPU in Server Guide,此類平台的權威論述;其 YouTube 頻道為本題材最佳的影片素材。
- ENigor'sLAB 論 4500 SE —— 說明此卡何以存在:機櫃密度、瓦數與擁有成本,而非 TFLOPS。
- UKAlfa-Server 論 4500 SE,附建議的伺服器配置。
- RUCytrix — RTX PRO 6000 Server Edition,俄語資料之中最偏重伺服器角度者。
詞彙表
| 術語 | 全稱 | 意義 |
|---|---|---|
| MIG | Multi-Instance GPU | 於硬件層面將顯示卡切分為互相隔離、具服務品質保證的執行單元 |
| vGPU | Virtual GPU | 供 VDI 使用的顯示卡虛擬化;適用 vWS 與 vPC 授權 |
| MGX | NVIDIA MGX | 伺服器平台的模組化參考設計 |
| SuperNIC | ConnectX-8 SuperNIC | 內建 48 通道 PCIe Gen 6 交換機的網絡卡 |
| DPU | Data Processing Unit | BlueField-3:自處理器接管網絡、數據存取與保安的處理 |
| GPUDirect P2P | Peer to Peer | 顯示卡之間經 PCIe 直接交換數據,不經系統記憶體 |
| SR-IOV | Single Root I/O Virtualization | 將裝置提供予虛擬機的方式;Azure NCv6 採用 |
| FP4 / NVFP4 | 四位元格式 | 將權重壓縮至 FP16 四分之一體積的運算格式 |
| NVENC / NVDEC | 編碼器 / 解碼器 | 硬件影像編碼與解碼引擎 |
| KV 快取 | Key-Value cache | 存放對話脈絡的記憶體;往往才是顯示記憶體消耗的真正主因 |
| FHFL / FHXL | Full Height Full Length / Extra Length | 全尺寸擴充卡,以及供液冷版本使用的加長型號 |
| Barebone | 準系統 | 不含處理器、記憶體與儲存裝置的平台 |
| Headless | 無顯示輸出 | 不接顯示器而運作 |