Dlaczego zwykłej karty dla graczy nie da się po prostu wstawić do serwera
To pierwsza rzecz, którą trzeba umieć wytłumaczyć klientowi, bo pytanie „a dlaczego nie 4090 albo 5090, przecież są tańsze” pada za każdym razem. Różnic jest sześć i wszystkie dotyczą eksploatacji, a nie wyników w testach.
Chłodzenie pasywne
NVIDIA wprost podaje, że karty serwerowe mają chłodzenie pasywne, a model 6000 SE opisuje jako przeznaczony do serwerów wielokartowych wymagających właśnie takiego rozwiązania. Na płytce nie ma wentylatorów — powietrze tłoczy obudowa. Poza serwerem z zaprojektowanym przepływem powietrza karta po prostu nie zadziała.
Pamięć z korekcją błędów
W parametrach 6000 SE figuruje 96 GB GDDR7 z korekcją błędów ECC. Przy pracy ciągłej — wielodniowej inferencji albo renderingu — pojedyncze przekłamanie bitu bez ECC oznacza błędny wynik, o którym nikt się nie dowie, bo system nie zgłosi żadnego błędu.
Odmienny zestaw wyjść
Model 6000 SE ma cztery złącza DisplayPort 2.1, więc w centrum danych może pracować również jako karta graficzna. W parametrach 4500 SE wyjść obrazu nie ma w ogóle — to akcelerator czysto obliczeniowy, pracujący bez monitora.
Podział: MIG i vGPU
Kartę można podzielić na odizolowane instancje z własną pamięcią, pamięcią podręczną i rdzeniami albo udostępnić zdalnym użytkownikom przez vGPU. Model 6000 SE daje do czterech instancji, 4500 SE — do dwóch po 16 GB.
Certyfikacja całego systemu
Serwery RTX PRO mają status NVIDIA-Certified i przechodzą weryfikację z narzędziami partnerów w ramach programu AI Factory Validated Design. To gwarancja zgodności ze stosem AI Enterprise i z rozwiązaniami sieciowymi NVIDIA.
Regulowany pobór mocy
Pobór mocy 6000 SE podano jako zakres od 400 do 600 W. To karta dopasowuje się do budżetu cieplnego obudowy, a nie odwrotnie. Karty konsumenckie takiej możliwości nie mają.
Argumentem w rozmowie z klientem nie jest wydajność, lecz przewidywalność i możliwość zarządzania. Karta dla graczy jest tańsza przy zakupie i droższa w utrzymaniu: nie da się jej podzielić między użytkowników, nie ma ECC, nie można jej ograniczyć mocowo pod obudowę i nie wchodzi w skład certyfikowanej konfiguracji, za którą odpowiadają producent serwera oraz NVIDIA.
Cztery zmiany pokoleniowe, za które klient płaci
Blackwell zastąpił architekturę Ada Lovelace. Przy sprzedaży kart serwerowych liczą się dokładnie cztery jego cechy — reszta to szczegóły dla inżynierów.
| Technologia | Co mówi NVIDIA | Co zyskuje klient |
|---|---|---|
| Rdzenie Tensor 5. generacji i FP4 | Wydajność do 3 razy wyższa niż w poprzednim pokoleniu, dochodzi obsługa precyzji FP4. W 6000 SE pracuje Transformer Engine drugiej generacji | Wagi modelu zajmują czterokrotnie mniej pamięci niż w FP16. To stąd bierze się wielokrotny przyrost w inferencji modeli językowych, a nie z liczby rdzeni CUDA |
| Pamięć GDDR7 | Znacząco zwiększone przepustowość i pojemność | Pozwoliła zmieścić 96 GB na jednej karcie — pojemność wcześniej dostępną wyłącznie na kosztownych platformach SXM |
| Rdzenie RT 4. generacji | Wydajność do 2 razy wyższa; technika RTX Mega Geometry obsługuje do 100 razy więcej trójkątów z ray tracingiem | Rendering, bliźniaki cyfrowe, symulacje, Omniverse. Tego właśnie nie mają akceleratory czysto obliczeniowe |
| NVENC 9 i NVDEC 6 | Obsługa 4:2:2 w H.264 i HEVC, lepsza jakość AV1, dwukrotnie wyższa przepustowość dekodowania H.264 | Analiza wideo, transkodowanie, streaming, produkcja mediów — segmenty, w których karta sprzedaje się bez ani jednego zdania o sztucznej inteligencji |
Klucz do zrozumienia całej linii: RTX PRO to karty, które liczą sztuczną inteligencję i jednocześnie generują grafikę. Ta wszechstronność stanowi ich główną przewagę konkurencyjną i najmocniejszy argument w sprzedaży.
Obie karty obok siebie
Obie powstały na architekturze Blackwell, obie mają chłodzenie pasywne, obie korzystają z PCIe Gen5 x16 i obie obsługują MIG. Na tym podobieństwa się kończą — to karty pod inny budżet cieplny i inne zadania.
| Parametr | RTX PRO 6000 Blackwell SE | RTX PRO 4500 Blackwell SE |
|---|---|---|
| Rdzenie CUDA | 24 064 | 10 496 |
| Rdzenie RT (4. gen.) | 188 | 82 |
| Pamięć karty | 96 GB GDDR7 z ECC | 32 GB GDDR7 |
| Przepustowość pamięci | 1597 GB/s | 800 GB/s |
| Szyna pamięci | 512 bitów | 256 bitów |
| Tensor Core FP4 | 4 PFLOPS | 1,6 PFLOPS |
| Tensor Core FP8 | 2 PFLOPS | 811 TFLOPS |
| Tensor Core FP16 / BF16 | 1 PFLOPS | 406 TFLOPS |
| Tensor Core TF32 | 234 TFLOPS | 203 TFLOPS |
| Pojedyncza precyzja FP32 | 120 TFLOPS | 51 TFLOPS |
| Szczyt rdzeni RT | 355 TFLOPS | 154 TFLOPS |
| Pobór mocy | 400–600 W (regulowany) | 165 W |
| Format | Powietrze: 2 sloty, 11,2 × 26,7 cm · Ciecz: 1 slot, FHXL | 1 slot, 11,2 × 26,7 cm |
| Chłodzenie | Pasywne | Pasywne |
| Interfejs | PCIe Gen 5 x16 | PCI Express 5.0 x16 |
| MIG | Do 4 odizolowanych instancji | Do 2 instancji po 16 GB |
| Układy wideo | 4 NVENC / 4 NVDEC | 3 NVENC / 3 NVDEC |
| Wyjścia obrazu | 4 × DisplayPort 2.1 | Nie podano w parametrach |
| Obliczenia poufne | Nie podano w parametrach | Obsługiwane |
| Złącze zasilania | Nie podano w parametrach | 1 × PCIe CEM5 16-pin |
| Poprzednik | NVIDIA L40S | NVIDIA L4 |
Wiersze z adnotacją „nie podano” zostawiono celowo: NVIDIA publikuje dla obu kart nieco inne zestawy parametrów, a uzupełnianie luk przez analogię to dokładnie ta droga, którą błędne liczby trafiają do recenzji.
Uwaga: trzy różne produkty o niemal identycznej nazwie
To najczęstsza pomyłka w specyfikacjach i ofertach. „RTX PRO 6000 Blackwell” to rodzina trzech kart, a serwerowy model 4500 istnieje obok niej osobno.
| Parametr | Server Edition | Workstation Edition | Max-Q Workstation |
|---|---|---|---|
| Pamięć | 96 GB GDDR7 ECC | 96 GB GDDR7 ECC | 96 GB GDDR7 ECC |
| Pobór mocy | 400–600 W | 600 W | 300 W |
| Chłodzenie | Pasywne | Przelotowe z dwóch stron | Aktywne |
| Wymiary | 11,2 × 26,7 cm, 2 sloty | 13,7 × 30,5 cm, 2 sloty | 11,2 × 26,7 cm, 2 sloty |
| Wyjścia obrazu | 4 × DisplayPort 2.1 | 4 × DisplayPort 2.1 | 4 × DisplayPort 2.1 |
| Magistrala | PCIe Gen 5 x16 | PCIe Gen 5 x16 | PCIe Gen 5 x16 |
| Przeznaczenie wg NVIDIA | Serwery wielokartowe z chłodzeniem pasywnym: inferencja, dostrajanie modeli, rendering rozproszony, HPC, wirtualne stacje robocze | Maksymalna wydajność w jednokartowej stacji roboczej | Gęste konfiguracje stacji roboczych, do czterech kart |
Max-Q to praktyczny kompromis dla klienta, który potrzebuje gęstości, ale nie ma szafy serwerowej: o połowę mniej ciepła przy tej samej pojemności pamięci, do czterech kart w stacji. Warto też zwrócić uwagę na sformułowanie NVIDIA przy wersji serwerowej — dostrajanie modeli wymieniono wprost, czyli fine-tuning mieści się w deklarowanym zastosowaniu, w odróżnieniu od trenowania od zera.
Stosunek pamięci do watów jest w obu kartach serwerowych zbliżony, natomiast gęstość w przeliczeniu na slot różni się zasadniczo: 165 W w jednym slocie wobec 600 W w dwóch. Wybór między nimi sprowadza się do pytania, czy chodzi o „jeden duży model”, czy o „wiele równoległych strumieni”. Pod względem obliczeń różnica jest dwu- do dwuipółkrotnej, pod względem poboru mocy — niemal czterokrotna.
Miejsce w ofercie NVIDIA dla centrów danych
Najcenniejsza umiejętność przy sprzedaży tych kart to potrafić powiedzieć, kiedy się nie nadają. Oferta dla centrów danych dzieli się na dwa nurty: uniwersalne karty PCIe z serii RTX PRO oraz akceleratory obliczeniowe przeznaczone do trenowania.
| Rozwiązanie | Rola wg opisu NVIDIA | Grafika i RT | Łącze między kartami |
|---|---|---|---|
| RTX PRO 4500 SE | Inferencja małych i średnich modeli, przetwarzanie danych i data science, analiza wideo, wirtualizacja. Do centrum danych, na brzeg sieci i do chmury | Jest | PCI Express 5.0 x16 |
| RTX PRO 6000 SE | Inferencja, dostrajanie modeli, rendering rozproszony, HPC, wirtualne stacje robocze. Uniwersalna karta do centrum danych | Jest | PCIe Gen 5 x16 |
| Seria H i seria B | Odrębne linie produktowe NVIDIA do zastosowań wymagających łączności między kartami przez NVLink | Ograniczona | NVLink / NVSwitch |
W parametrach obu kart jako łącze wymieniono wyłącznie PCI Express — wiersza NVLink tam nie ma. Karty komunikują się przez PCIe, a ich pamięci nie łączą się we wspólną pulę. Osiem kart po 96 GB to nie „768 GB pod jeden model”, tylko osiem akceleratorów niezależnych pamięciowo. Duża pojemność pojedynczej karty rekompensuje to przy inferencji równoległej, ale model, który nie mieści się w 96 GB, wymaga albo równoległości tensorowej ze stratami na PCIe, albo platformy z NVLink.
Argumenty za zmianą pokolenia
- Wobec L40S: NVIDIA podaje, że serwery RTX PRO wykonują symulacje i generowanie danych syntetycznych do 4 razy szybciej niż systemy na L40S, a samą kartę 6000 SE opisuje jako wyraźny skok względem L40S w multimodalnych zastosowaniach agentowych i generatywnych.
- Wobec L4: dla 4500 SE NVIDIA deklaruje ponad pięciokrotny przyrost względem poprzedniej generacji L4 przy inferencji małych i średnich modeli — pod warunkiem korzystania ze zoptymalizowanych bibliotek NVIDIA i mikrousług NIM.
- Wobec systemów bez kart graficznych: przy rozumieniu treści wideo NVIDIA deklaruje przyrost sięgający 100 razy względem systemów opartych wyłącznie na procesorach oraz ograniczenie zajmowanego miejsca i zużycia energii o ponad 95 %. Dla baz wektorowych mowa o przyroście do 50 razy. To najmocniejszy argument w rozmowie z klientem, który utrzymuje park serwerów procesorowych.
Do dwóch ostatnich liczb potrzebne jest ważne zastrzeżenie: przyrosty 50- i 100-krotne porównują serwer z ośmioma kartami 4500 SE z systemem procesorowym (dla baz wektorowych: AMD 9654 ze 192 wątkami, 33 miliony wektorów w Milvus 2.5.25, algorytm HNSW wobec cuVS CAGRA; dla wideo: dwuprocesorowy AMD 9654 i model Qwen3-VL-8B). To poprawne porównanie platform, ale nie karty z kartą — i kompetentny inżynier po stronie klienta o to zapyta.
Funkcje, które naprawdę sprzedają kartę
Tabela parametrów przekonuje inżyniera. Decydenta po stronie biznesu przekonują poniższe rzeczy — to one zamieniają sprzęt w usługę, którą można odsprzedać albo rozdzielić między działy.
| Technologia | Jak działa | Wartość dla klienta |
|---|---|---|
| MIG | Sprzętowy podział karty na odizolowane instancje, z których każda ma własną pamięć o wysokiej przepustowości, pamięć podręczną i rdzenie obliczeniowe oraz gwarantowaną jakość obsługi. W 6000 SE do czterech, w 4500 SE do dwóch po 16 GB | Gwarantowana jakość obsługi dla każdego najemcy. Jedna karta obsługuje kilka niezależnych zadań, które sobie nawzajem nie przeszkadzają — to podstawa rozliczeń i wielodostępu |
| vGPU | W połączeniu z oprogramowaniem NVIDIA RTX Virtual Workstation i Virtual PC karta zostaje zwirtualizowana dla użytkowników zdalnych. Obsługiwany jest podział czasu nałożony na MIG, dzięki czemu zadania AI i graficzne mogą działać równolegle. W vGPU 20 dochodzą AI Virtual Workstation Toolkit oraz stały przydział udziałów | Inżynierowie i projektanci pracują na cienkich klientach, a licencje CAD i dane nie opuszczają firmowej sieci. Bardzo często to właśnie ten scenariusz, a nie sztuczna inteligencja, finansuje cały zakup |
| ECC | Korekcja błędów pamięci karty, zadeklarowana dla 96 GB GDDR7 w modelu 6000 SE | Warunek pracy produkcyjnej 24/7 i typowy wymóg w przetargach na infrastrukturę |
| Obliczenia poufne | Dla 4500 SE w tabeli parametrów wskazano obsługę tej funkcji | Argument w branżach regulowanych: ochrona danych i modeli w trakcie przetwarzania |
| NVIDIA AI Enterprise | Zestaw narzędzi, bibliotek i frameworków wraz z mikrousługami NIM oraz NeMo | Osobna pozycja na fakturze, a zarazem odpowiedź na obiekcję „a kto to będzie utrzymywał” |
| NVIDIA-Certified | Serwery RTX PRO mają ten status i przechodzą weryfikację z narzędziami partnerów w ramach AI Factory Validated Design | Gwarancja zgodności z siecią NVIDIA, układami BlueField-3 i stosem AI Enterprise. Zdejmuje ryzyko integracji zarówno z klienta, jak i z integratora |
| NVIDIA Run:ai | Platforma orkiestracji zadań i kart, podnosząca wykorzystanie sprzętu oraz łączną przepustowość | Dociążenie bezczynnych kart to bezpośredni argument za szybszym zwrotem z inwestycji |
MIG warto pokazywać w pieniądzach, a nie w gigabajtach. Jedna karta RTX PRO 6000 SE podzielona na cztery instancje to cztery stanowiska pracy dla programisty AI albo cztery niezależne usługi inferencji na jednej fizycznej karcie. Działa też reguła odwrotna: pod 4500 SE nie wolno planować czterech użytkowników, bo ta karta daje najwyżej dwie instancje. Ten szczegół regularnie umyka przy przygotowywaniu ofert.
Serwer to system, a nie pudełko z kartami
Tutaj przebiega granica między „znam sprzęt” a „rozumiem technologie serwerowe”. Karty stanowią mniejszą część złożoności inżynierskiej. Reszta to obudowa, sieć, zasilanie i chłodzenie. Konfiguracje referencyjne opisuje NVIDIA, a konkretne maszyny — ich producenci.
NVIDIA Cztery konfiguracje referencyjne
NVIDIA określa RTX PRO Server jako uniwersalną platformę do centrum danych i podaje cztery przykłady oparte na modułowych projektach referencyjnych MGX. To punkt odniesienia, względem którego ocenia się każdą propozycję producenta.
| Konfiguracja | Karty | Sieć | DPU |
|---|---|---|---|
| MGX 6U | 8 × RTX PRO 6000 SE, chłodzenie cieczą | ConnectX-8 SuperNIC z przełącznikiem PCIe Gen 6 | BlueField-3 |
| MGX 4U | 8 × RTX PRO 6000 SE | ConnectX-8 SuperNIC z przełącznikiem PCIe Gen 6 | BlueField-3 |
| MGX 2U | 2 × RTX PRO 6000 SE | ConnectX-7 albo BlueField-3 SuperNIC | BlueField-3 |
| MGX 2U | 8 × RTX PRO 4500 SE | ConnectX-7 SuperNIC | BlueField-3 |
Ostatni wiersz łatwo przeoczyć, a nie warto: osiem mniejszych kart mieści się w dwóch jednostkach wysokości. To 256 GB pamięci i 12,8 PFLOPS w FP4 w 2U przy 1,3 kW na kartach, wobec 4,8 kW dla ośmiu kart większych. Do analizy wideo i inferencji małych modeli jest to najgęstsza z oficjalnych konfiguracji.
NVIDIA Co daje przełącznik wbudowany w SuperNIC
Najważniejszą zmianę architektoniczną ostatnich generacji NVIDIA opisuje tak: ConnectX-8 SuperNIC PCIe Switch to płyta łącząca kilka układów SuperNIC, z których każdy zestawia bardzo szybką sieć z 48-liniowym przełącznikiem PCIe Gen 6. Rozwiązanie eliminuje osobne przełączniki PCIe, podwaja przepustowość między kartami, upraszcza projekt płyty i zapewnia do 800 Gb/s. Obok niego w konfiguracjach pracuje układ BlueField-3, który — zgodnie z opisem NVIDIA — przejmuje z procesora obsługę sieci, dostępu do danych i bezpieczeństwa oraz zapewnia izolację w modelu zerowego zaufania. Podsystem sieciowy uzupełnia Spectrum-X: dzięki adaptacyjnemu routingowi RoCE i kontroli przeciążeń przyspiesza pracę z pamięcią masową o blisko 50 %.
Serwery ośmiokartowe na PCIe występują w dwóch topologiach i warto umieć wyjaśnić różnicę. W układzie z przełącznikiem karty podłączone są do dedykowanych układów przełącznika PCIe, a ten dopiero prowadzi w górę do procesorów: każda karta sięga każdej innej na pełnej szerokości, nie wychodząc poza przełącznik, a linii jest więcej, niż udostępniają same procesory. W układzie bezpośrednim każda karta wpina się w kompleks główny procesora: taniej i o jeden przeskok bliżej pamięci systemowej, ale karty rozdzielają się między gniazda, a ruch między połówkami przechodzi przez magistralę międzyprocesorową. AGS-6220V2 zbudowano w układzie bezpośrednim, AGS-4UMGX-R1 — z przełącznikiem. Że nie jest to dzielenie włosa na czworo, widać po obu stronach branży: NVIDIA stworzyła ConnectX-8 SuperNIC właśnie po to, by pozbyć się osobnych przełączników przy zachowaniu ich zalet, a AWS osobno odnotowuje bardzo niskie opóźnienie wymiany między kartami znajdującymi się na tym samym przełączniku PCIe.
Producenci Trzy klasy maszyn
2U, 2–4 karty
Zwykłe serwery stelażowe firm Cisco, Dell, HPE, Lenovo i Supermicro — wszystkie figurują na liście czołowych partnerów systemowych NVIDIA. Wchodzą do istniejącej szafy klienta. To punkt wejścia w obliczenia akcelerowane dla firmy, która ma już własne centrum danych.
4U MGX, 8 kart
Wyspecjalizowana platforma na projekcie referencyjnym NVIDIA MGX z układami ConnectX-8 i BlueField-3. To element składowy klastra, a nie „serwer z kartami graficznymi”. Przykłady: INNO3D AGS-4UMGX-R1, Gigabyte XL44-SX2-AAS1, ZOTAC ZRS-MGX-R1, Supermicro SYS-522GA-NRT.
6U, 8 kart
Platformy pokroju INNO3D AGS-6220V2. Te same osiem kart, ale w półtora raza większej objętości: zapas powietrza, łatwość serwisowania i cena zamiast gęstości oraz szybkiej sieci. Samodzielna maszyna robocza, nie węzeł klastra.
Producent Analiza konkretnej platformy: INNO3D AGS-6220V2
Warto zestawić z konfiguracją referencyjną MGX maszynę o odmiennej filozofii. To obudowa 6U na osiem kart RTX PRO 6000 Blackwell Server Edition, w której niemal każda decyzja przebiega odwrotnie niż w logice MGX. Dane pochodzą z karty katalogowej INNO3D dla numeru AGS-6220V2P2-B00.
| Podzespół | Rozwiązanie | Co to oznacza w praktyce |
|---|---|---|
| Postać dostawy | Barebone. Obudowa, płyta główna, 4 zasilacze, moduł OCP 25 Gb/s, klucz VROC, szyny i radiatory są fabrycznie zamontowane. Bez procesorów, pamięci i nośników | To platforma, a nie gotowy serwer. Procesory, DDR5, dyski NVMe i osiem kart stanowią osobne pozycje oferty, z osobnymi terminami dostaw |
| Format | 6U, 900 × 438 × 264 mm | Osiem kart w 6U wobec ośmiu w 4U w konfiguracji referencyjnej. Głębokość 900 mm — trzeba sprawdzić głębokość szafy klienta z uwzględnieniem prowadzenia okablowania |
| Sloty na karty | 8 × PCIe 5.0 x16, pełna wysokość, podwójna szerokość. Podłączenie bezpośrednio do procesorów, bez przełącznika PCIe | Każda karta dostaje pełne x16. Ale 8 × x16 to 128 linii na dwa gniazda: karty dzielą się 4+4, a wymiana między połówkami idzie przez magistralę międzyprocesorową. Dla równoległości tensorowej jest to wąskie gardło |
| Procesory | 2 × Intel Xeon Scalable 4. i 5. generacji, gniazdo LGA 4677, chipset C741. Limit 350 W TDP na procesor | Ten pułap odcina część mocniejszych modeli — trzeba zweryfikować wybrany procesor przed złożeniem zamówienia |
| Pamięć | 32 gniazda DDR5 RDIMM / RDIMM-3DS, 8 kanałów na procesor. RDIMM do 96 GB, RDIMM-3DS do 256 GB na moduł. 5600 MT/s przy 1DPC i 4400 przy 2DPC, dla Xeonów 5. generacji | Pułap około 8 TB. Pełne obsadzenie gniazd obniża taktowanie z 5600 do 4400 |
| Sieć | 1 slot OCP, moduł 25 Gb/s w zestawie, plus port zarządzania BMC 1GbE | Główna różnica wobec konfiguracji referencyjnej. Ani ConnectX-8, ani BlueField-3, ani 400 Gb/s. To maszyna pojedyncza, nie element klastra |
| Pamięć masowa | 12 wnęk 3,5/2,5″ (8 × SATA-3 + 4 × NVMe), 1 × M.2 NVMe wewnątrz, RAID Intel VROC 0/1/10/5 | Osiem z dwunastu wnęk obsługuje wyłącznie SATA. Na szybki zbiór danych zostają cztery wnęki NVMe |
| Zasilanie | 4 × 2700 W CRPS, układ 3+1, 80 PLUS Platinum | 8100 W mocy użytecznej. Rachunek: 8 × 600 W na kartach plus 2 × 350 W na procesorach plus pamięć, dyski i wentylatory — około 6,5 kW. Zasilanie musi być 200–240 V, złącza C19/C20 |
| Chłodzenie | 16 wentylatorów wymienianych podczas pracy: 8 wewnętrznych i 8 z tyłu | Główna zaleta formatu 6U: powietrza jest dużo, a wentylatory wymienia się bez wyłączania maszyny |
| Zarządzanie | Dedykowany port IPMI, VGA, 2 × USB 3.2 Gen1. Złącze TPM z interfejsem SPI, sam moduł TPM 2.0 jest opcją | Gdy przetarg wymaga TPM, moduł zamawia się osobno |
| Systemy operacyjne | Windows Server 2022/2019, RHEL 9.2–8.6, SLES 15 SP4, Ubuntu 22.04 LTS, VMware ESXi 8.0U1 / 7.0U3i, Citrix Hypervisor 8.2 LTSR CU1 | Obsługa ESXi i Citriksa to sygnał, że platformę pomyślano również pod wirtualne stacje robocze |
Strona tytułowa wystawiona jest na numer AGS-6220V2P2-B00 (pozycja 0K219-B001), natomiast nagłówek strony z parametrami podaje AGS-6220V2P2-B10. Wygląda to na literówkę albo sąsiednią wersję zestawu, ale numer katalogowy trzeba przy zamówieniu potwierdzić pisemnie: od niego zależy, co faktycznie jest fabrycznie zamontowane w obudowie. W tym samym miejscu jest drobna nieścisłość co do pamięci — jeden wiersz podaje 4800/4400 MHz, a wiersz poniżej 5600 MT/s przy 1DPC dla Xeonów 5. generacji.
Producent Ten sam producent, odmienna filozofia: INNO3D AGS-4UMGX-R1
INNO3D ma również drugą platformę pod te same karty — model 4U na projekcie referencyjnym NVIDIA MGX, z układami ConnectX-8 SuperNIC i BlueField-3. Porównanie dwóch maszyn jednego producenta mówi więcej niż jakiekolwiek zestawienie między markami: widać dokładnie, za co się dopłaca, bez poprawki na różnice w jakości wykonania i obsłudze posprzedażnej.
| Podzespół | AGS-4UMGX-R1 · MGX | AGS-6220V2 · 6U |
|---|---|---|
| Format | NVIDIA MGX 4U, 858 × 440 × 175 mm | 6U, 900 × 438 × 264 mm |
| Topologia kart | 8 × PCIe Gen 5 x16 pod osiem RTX PRO 6000 SE plus osobny slot Gen 5 x16 pod BlueField-3 | 8 × PCIe 5.0 x16, podłączenie bezpośrednio do procesorów, bez przełącznika |
| Sieć | ConnectX-8 SuperNIC: 8 portów po 400 Gb/s QSFP, plus 2 × 10GbE i 1GbE BMC | Moduł OCP 25 Gb/s plus 1GbE BMC |
| DPU | BlueField-3 w dedykowanym slocie | Brak |
| Procesory | 2 × Intel Xeon 6 (Granite Rapids / Sierra Forest), serie 6500 i 6700, gniazdo LGA 4710 | 2 × Intel Xeon Scalable 4. i 5. generacji, LGA 4677, limit 350 W |
| Pamięć | 32 gniazda DDR5 RDIMM / MRDIMM, 8 kanałów na procesor. 6400 MT/s przy 1DPC, 5200 przy 2DPC. Moduły 32, 64, 96 i 128 GB | 32 gniazda DDR5 RDIMM / RDIMM-3DS. 5600 MT/s przy 1DPC, 4400 przy 2DPC |
| Pamięć masowa | 8 wnęk 2,5″ wymienianych podczas pracy, do ośmiu nośników E1.S o wysokości 25 mm; wewnątrz 2 × M.2 NVMe Gen 5 x4 | 12 wnęk (8 × SATA-3 + 4 × NVMe), wewnątrz 1 × M.2 NVMe |
| Zasilanie | 4 × 3200 W CRPS, układ 3+1, 80 PLUS Titanium | 4 × 2700 W CRPS, układ 3+1, 80 PLUS Platinum |
| Chłodzenie | 10 wentylatorów 80 mm wymienianych podczas pracy, rozdzielonych na strefy: 5 na strefę kart i 5 na strefę płyty | 16 wentylatorów: 8 wewnętrznych i 8 z tyłu |
| TPM | TPM 2.0 wlutowany, sprzętowy korzeń zaufania Microchip CEC1736 | Tylko złącze TPM, moduł jest opcją |
| Warunki pracy | 0–35 °C, wilgotność 8–90 % | 10–35 °C, wilgotność 8–80 % |
| Obudowa | Produkcji Chenbro | Nie podano |
| Przeznaczenie wg producenta | NVIDIA Omniverse Enterprise, duże bliźniaki cyfrowe, HPC, inferencja i dostrajanie modeli językowych | Uczenie transferowe, dostrajanie, trenowanie i inferencja modeli językowych, chmura AI, HPC |
Różnica między maszynami leży nie w liczbie kart, lecz w łączności i klasie całego otoczenia. Wersja MGX daje osiem portów po 400 Gb/s wobec jednego na 25, dedykowany układ BlueField-3, procesory o pokolenie nowsze, pamięć o stopień szybszą, zasilacze wyższej klasy sprawności i o większej mocy oraz wlutowany moduł TPM zamiast opcjonalnego. A przy tym jest mniejsza: 4U wobec 6U i 858 mm głębokości wobec 900. Teza „sześć jednostek dla lepszego przepływu powietrza” wygląda w tym świetle słabiej: platforma MGX ma mniej wentylatorów, dziesięć wobec szesnastu, ale rozdzielono je na strefę kart i strefę płyty — przy dwukrotnie mniejszej objętości i mocniejszym zasilaniu świadczy to o lepiej przemyślanym, a nie hojniejszym układzie chłodzenia. Maszyna 6U pozostaje sensownym wyborem tam, gdzie potrzebny jest tańszy węzeł samodzielny, ale uzasadniać ją trzeba teraz ceną, a nie przewagą inżynierską.
| Kryterium | Referencja MGX 4U NV | INNO3D 6U Producent | Masowe 2U Producent |
|---|---|---|---|
| Liczba kart | 8 | 8 | 2–4 |
| Gęstość w szafie | Wysoka | Niska | Średnia |
| Sieć między węzłami | ConnectX-8, do 800 Gb/s, BlueField-3 | OCP 25 Gb/s | Zależnie od konfiguracji |
| Topologia PCIe | Przełączana struktura Gen 6 wewnątrz SuperNIC | Podłączenie bezpośrednie, karty 4+4 między gniazdami | Podłączenie bezpośrednie |
| Postać dostawy | Zwykle system gotowy | Barebone | System gotowy ze wsparciem producenta |
| Przeznaczenie | Element składowy klastra | Samowystarczalny węzeł: inferencja, rendering, wirtualne stacje robocze | Pierwszy krok w obliczenia akcelerowane |
| Łatwość serwisowania | Ciasny montaż | Modułowa, zapas objętości, wentylatory wymieniane podczas pracy | Standardowa obsługa stelażowa |
Sformułowanie do oferty: konfigurację według referencji MGX kupuje się wtedy, gdy klient planuje rozrosnąć się do klastra. Platformę 6U kupuje się wtedy, gdy potrzeba dużo mocy obliczeniowej w jednej maszynie, a różnica w cenie platformy idzie na karty. Jeśli w perspektywie dwóch lat pojawi się drugi serwer i obciążenie rozproszone, brak szybkiej sieci okaże się ślepą uliczką.
| Producent | Model | Format | Karty | Cecha wyróżniająca wg producenta |
|---|---|---|---|---|
| INNO3D | AGS-4UMGX-R1 | 4U MGX | 8 | ConnectX-8 SuperNIC z 8 portami po 400 Gb/s, BlueField-3 w osobnym slocie, Xeon 6, 4 × 3200 W Titanium, wlutowany TPM 2.0 |
| INNO3D | AGS-6220V2 | 6U | 8 | Barebone, podłączenie bezpośrednie bez przełącznika, OCP 25 Gb/s, 4 × 2700 W Platinum, 16 wentylatorów |
| Lenovo | ThinkSystem SR650a V4 | 2U | 4 | Kartę można ograniczyć mocowo do 450 W, żeby zmieścić cztery sztuki w obudowie |
| Supermicro | SYS-522GA-NRT, SYS-422GL-NR | 4U / 5U | 8 | Jako jedni z pierwszych wdrożyli płytę MGX PCIe Switch z ConnectX-8 |
| Gigabyte | XL44-SX2-AAS1 | 4U MGX | 8 | Dwa Xeony 6700/6500, 32 gniazda DDR5, zasilacze 3+1 po 3200 W Titanium, BlueField-3 i 4 × ConnectX-8 |
| ZOTAC | ZRS-MGX-R1 | 4U MGX | 8 | Xeon 6. generacji, 32 gniazda DIMM, 8 portów po 400 Gb/s na ConnectX-8, zasilacze 3+1 po 3200 W |
| ASUS | ESC8000A-E13 | 4U | 8 | Na platformie AMD EPYC |
O ostatecznej konfiguracji decyduje budżet cieplny obudowy, a nie parametry karty. Dobrze widać to u Lenovo: kartę można ograniczyć mocowo do 450 W właśnie po to, by zmieścić w obudowie cztery sztuki. Dokładnie po to NVIDIA uczyniła pobór mocy regulowanym w zakresie 400–600 W. Zanim obiecacie klientowi osiem kart, policzcie moc doprowadzoną do szafy i zdolność serwerowni do odprowadzenia ciepła.
NVIDIA udostępnia własne narzędzia: Qualified System Catalog — katalog systemów, które przeszły kwalifikację z konkretną kartą, z filtrem po modelu; program NVIDIA-Certified Systems; oraz AI Factory Validated Design jako wzorzec konfiguracji. Osobna obserwacja istotna przy zakupie: na liście partnerów systemowych na stronie RTX PRO Server figurują Cisco, Dell, HPE, Lenovo i Supermicro jako czołowi, a obok Advantech, ASRock Rack, ASUS, Compal, Eviden, Foxconn, GIGABYTE, Inventec, MiTAC, MSI, Pegatron, QCT, Wistron i Wiwynn. INNO3D na tej liście nie ma — mimo że firma ma platformę w formacie NVIDIA MGX z układami ConnectX-8 i BlueField-3, czyli pokrywającą się składem z konfiguracją referencyjną. Nieobecność na liście partnerów i posiadanie produktu MGX to fakty, które da się pogodzić: lista nie musi być wyczerpująca. Wniosek jednak się nie zmienia — potwierdzenie ma pochodzić z katalogu NVIDIA, a nie ze strony produktowej. Sprawdzajcie w Qualified System Catalog z filtrem po właściwej karcie i proście dystrybutora o pisemne potwierdzenie statusu.
AGS-6220V2: czym przekonywać i o co nie warto się spierać
Ta warstwa powstała z myślą o rozmowie z klientem. Przy każdym argumencie podana jest granica, poza którą przestaje on działać: inżynier po stronie klienta i tak ją odnajdzie, a wskazanie jej jako pierwszy zamienia spotkanie z audytu we wspólny dobór rozwiązania.
Osiem filarowych argumentów
Najtańsza droga do ośmiu kart
121 700 USD wobec 158 210 USD za platformę MGX — oszczędność 36 510 USD, blisko jednej czwartej budżetu. Obie platformy są dostarczane jako barebone, więc ceny da się porównywać wprost. Te pieniądze trafią na procesory, pamięć i dyski, a nie na obudowę.
Granica: oszczędność znika, jeśli klient potrzebuje sieci 400 Gb/s — zewnętrzne karty sieciowe i przełącznik pochłoną całą różnicę.
Barebone jako swoboda
Procesory, pamięć i dyski NVMe klient kupuje na własnych umowach i we własnych cenach. Przy obecnym niedoborze DDR5 to realna dźwignia: może wykorzystać pamięć z posiadanych zapasów.
Granica: wobec serwerów gotowych argument działa, wobec platform MGX już nie — one także są barebone. Nie przedstawiajcie tego jako przewagi nad AGS-4UMGX-R1.
Dwa pokolenia Xeonów do wyboru
Gniazdo LGA 4677 przyjmuje zarówno 4., jak i 5. generację Xeon Scalable. Klient może sięgnąć po posiadany park albo po tańsze modele. Platformy MGX na LGA 4710 takiej możliwości nie dają.
Granica: limit 350 W na gniazdo odcina część mocniejszych procesorów.
Dwanaście wnęk zamiast ośmiu
8 × SATA plus 4 × NVMe. Do archiwów multimedialnych, danych ciepłych i zbiorów, które nie wymagają szybkości NVMe, dyski SATA są kilkakrotnie tańsze w przeliczeniu na terabajt.
Granica: na szybki zbiór roboczy zostają tylko cztery wnęki.
Łatwość serwisowania i zapas miejsca
16 wentylatorów wymienianych podczas pracy, budowa modułowa, swobodny dostęp do wnętrza. Niższe wymagania wobec kwalifikacji serwisanta i krótsze przestoje przy wymianie podzespołów.
Granica: w kolokacji rozliczanej za jednostkę wysokości 6U kosztuje o połowę więcej niż 4U.
Podłączenie wprost do procesorów
Każda karta dostaje pełne x16, o jeden przeskok bliżej pamięci systemowej, prostszy stos oprogramowania układowego i mniej punktów awarii. Przy ośmiu niezależnych strumieniach inferencji przełącznik nie wnosi nic.
Granica: karty dzielą się 4+4 między gniazda, a wymiana między połówkami idzie przez magistralę międzyprocesorową.
Blisko jednej czwartej zapasu
8100 W mocy użytecznej w układzie 3+1 przy wyliczonym poborze rzędu 6,5 kW. Jest miejsce na mocniejsze procesory, więcej dysków i przyszłe karty.
Granica: potrzebne jest zasilanie 200–240 V ze złączami C19/C20 — w starszych szafach to osobny temat.
Zwrot w pół roku
Wobec AWS w cenniku na żądanie i przy pracy ciągłej maszyna zwraca się w 6,2 miesiąca, a opłaca się bardziej od wynajmu już od 21,7 % wykorzystania. To najmocniejszy argument liczbowy, jakim dysponujecie — patrz warstwa 08.
Granica: poniżej mniej więcej jednej piątej czasu uczciwiej jest doradzić chmurę.
Zadania, do których maszynę można sprzedawać z przekonaniem
| Zadanie | Dlaczego pasuje | Na co się powołać |
|---|---|---|
| Inferencja modeli językowych mniej więcej do 70 miliardów parametrów | 96 GB i 1597 GB/s na kartę, natywny FP4 | AWS i Microsoft niezależnie od siebie wskazują ten próg jako granicę dla pojedynczej karty |
| Wiele niezależnych modeli i wielodostęp | MIG do czterech odizolowanych instancji na kartę | Do 32 odizolowanych instancji na system, z gwarantowaną jakością obsługi — podstawa rozliczeń |
| Usługi agentowe i RAG | Pojemność pamięci pod długi kontekst i pamięć podręczną KV | Microsoft wprost wymienia RAG na modelach do 70B jako docelowe zastosowanie tej karty |
| Dostrajanie istniejących modeli | Wystarczająca pamięć oraz FP8/BF16 | NVIDIA wprost wymienia fine-tuning wśród zastosowań wersji serwerowej — to nie jest naciągane |
| Wirtualne stacje robocze i VDI | vGPU nałożone na MIG, podział czasu między zadania AI a grafikę | Karta katalogowa wymienia VMware ESXi 8.0U1 i Citrix Hypervisor 8.2 — platformę zaprojektowano również pod ten scenariusz |
| Rendering, Omniverse, OpenUSD, bliźniaki cyfrowe | 188 rdzeni RT 4. generacji, szczyt 355 TFLOPS | Dokładnie to, czego nie mają akceleratory czysto obliczeniowe: konkurent na serii H tego zastosowania nie zamknie |
| Analiza wideo, transkodowanie, streaming | Cztery układy NVENC i cztery NVDEC na kartę | 32 układy kodujące i 32 dekodujące na system; obsługa 4:2:2 w H.264 i HEVC |
| Wyszukiwanie wektorowe, analityka, data science | Przyspieszenie przez cuVS i stos CUDA-X | NVIDIA deklaruje do 50 razy wyższą wydajność od systemu procesorowego przy budowie indeksów |
| Obliczenia naukowe i symulacje w FP32 | 120 TFLOPS FP32 na kartę | Jeden węzeł zamyka to, co wcześniej wymagało niewielkiego klastra |
| Lokalna sztuczna inteligencja w branżach regulowanych | Dane i modele nie opuszczają infrastruktury klienta | Porównanie z chmurą w warstwie 08 pokazuje, że przy stałym obciążeniu wychodzi to również taniej |
Zadania, do których tej maszyny sprzedawać nie należy
Poniższa lista jest cenniejsza od poprzedniej. System sprzedany do niewłaściwego zadania wraca razem z reputacją, a ograniczenie wskazane w porę niemal zawsze zamienia się w inną pozycję z waszego własnego portfolio.
| Zadanie | Dlaczego nie pasuje | Co zaproponować zamiast |
|---|---|---|
| Trenowanie dużych modeli od zera | Karty nie mają NVLink, a pamięć nie łączy się we wspólną pulę. Trenowanie wykracza poza zastosowania deklarowane przez NVIDIA dla obu kart RTX PRO | Platformy z NVLink na serii H lub B albo wynajem mocy na czas trenowania |
| Rozproszone trenowanie i inferencja na wielu węzłach | Sieć to jeden moduł OCP 25 Gb/s. Do wymiany między węzłami brakuje rzędu wielkości | INNO3D AGS-4UMGX-R1: osiem portów po 400 Gb/s na ConnectX-8 plus BlueField-3 |
| Równoległość tensorowa na wszystkich ośmiu kartach przy ostrym SLA | 128 linii na dwa gniazda oznacza podział kart 4+4, a wymiana między połówkami idzie przez magistralę międzyprocesorową | AGS-4UMGX-R1 z przełączaną strukturą PCIe Gen 6 wewnątrz SuperNIC |
| Dostęp do pamięci masowej przez GPUDirect Storage i RDMA po sieci | Brak DPU: nie ma czym odciążyć sieci i dostępu do danych | AGS-4UMGX-R1 z układem BlueField-3 w dedykowanym slocie |
| Gęste rozmieszczenie w kolokacji rozliczanej za jednostkę | 6U na osiem kart wobec 4U w MGX — o 50 % wyższa opłata za miejsce przy tej samej mocy obliczeniowej | AGS-4UMGX-R1 albo konfiguracja MGX 2U na ośmiu kartach RTX PRO 4500 SE |
| Przetarg z obowiązkowym TPM 2.0 | Na płycie jest wyłącznie złącze z interfejsem SPI, sam moduł stanowi opcję | Domówić moduł albo zaproponować AGS-4UMGX-R1, gdzie TPM 2.0 jest wlutowany wraz z korzeniem zaufania Microchip CEC1736 |
| Potoki przetwarzania z dużymi zbiorami na szybkich dyskach | Tylko cztery wnęki NVMe z dwunastu; wewnętrzny slot M.2 jest jeden | AGS-4UMGX-R1 z ośmioma nośnikami E1.S albo pamięć masowa zewnętrzna |
| Wymóg obliczeń poufnych | NVIDIA wskazuje obsługę w parametrach RTX PRO 4500 SE; dla 6000 SE takiego wiersza nie ma | Konfiguracja MGX 2U na kartach RTX PRO 4500 SE — tam jest to zadeklarowane oficjalnie |
| Ciężkie wstępne przetwarzanie danych na procesorach | Xeony 4. i 5. generacji z limitem 350 W, pamięć 5600 MT/s przy 1DPC | AGS-4UMGX-R1 na Xeonach 6 z pamięcią 6400 MT/s |
| Instalacja na brzegu sieci przy niestabilnym klimacie | Zakres pracy 10–35 °C, wilgotność do 80 % bez kondensacji | Wyspecjalizowane platformy brzegowe albo dostosowanie pomieszczenia |
| Szafa o głębokości poniżej 950 mm | Obudowa 900 mm wraz z prowadzeniem okablowania fizycznie się nie mieści | AGS-4UMGX-R1 o głębokości 858 mm |
Spośród jedenastu niepasujących zastosowań siedem zamyka inna maszyna z waszego własnego portfolio. Właściwa reakcja na „potrzebujemy obciążenia rozproszonego” albo „nasza kolokacja rozlicza się za jednostkę” to nie obrona modelu 6220V2, tylko przejście do AGS-4UMGX-R1. Transakcja przy okazji rośnie: platforma MGX jest droższa o 30 %. Sprzedawać należy portfolio, a nie pojedynczą pozycję.
Obiekcje, które padną, i uczciwe odpowiedzi
| Obiekcja | Uczciwa odpowiedź |
|---|---|
| „Dlaczego nie karty dla graczy, przecież są tańsze” | Chłodzenie pasywne dopasowane do przepływu powietrza w obudowie, ECC, MIG i vGPU, pobór mocy regulowany od 400 do 600 W pod budżet cieplny oraz certyfikacja całego systemu. Karta dla graczy jest tańsza przy zakupie i droższa w utrzymaniu: nie da się jej podzielić między użytkowników i nie wchodzi w skład wspieranej konfiguracji |
| „Konkurent mieści te same osiem kart w 4U, a wy potrzebujecie 6U” | Przyznać wprost. Nasze atuty to tutaj cena, łatwość serwisowania i dwa razy więcej wnęk na dyski. Jeśli dla klienta ważniejsze są gęstość i sieć, zaproponować AGS-4UMGX-R1 — to również nasza maszyna |
| „INNO3D nie ma na liście partnerów systemowych NVIDIA” | Przyznać. Lista na stronie produktowej nie jest wyczerpująca, a my mamy platformę w formacie MGX z układami ConnectX-8 i BlueField-3. Zaproponować sprawdzenie w NVIDIA Qualified System Catalog i poprosić dystrybutora o pisemne potwierdzenie statusu — to zamyka temat dokumentem, a nie słowem |
| „To barebone, a my potrzebujemy gotowego serwera” | Wymienić brakujące pozycje od razu: dwa procesory, pamięć, nośniki. Zaproponować integrację i podać terminy. Przy okazji wyjaśnić, że przy niedoborze pamięci samodzielny zakup często wygrywa i ceną, i terminem |
| „Za drogo” | Przenieść rozmowę z ceny na koszt posiadania. Wobec AWS w cenniku na żądanie zwrot następuje po 6,2 miesiąca przy pracy ciągłej, a przewaga zaczyna się już od 21,7 % wykorzystania. Zapytać, ile godzin na dobę karty będą realnie zajęte — to pytanie przesądza o transakcji mocniej niż rabat |
| „Weźmiemy w chmurze” | Zgodzić się co do pilotażu i szczytów obciążenia — to uczciwe i buduje zaufanie. Następnie pokazać próg: powyżej mniej więcej jednej czwartej wykorzystania zakup wychodzi taniej. Optymalny układ to kupić pod obciążenie bazowe, a szczyty dobierać z chmury |
| „Musimy trenować własne modele” | Doprecyzować: trenowanie od zera czy dostrajanie. Fine-tuning NVIDIA wymienia wprost wśród zastosowań wersji serwerowej i tu maszyna jest na miejscu. Trenowanie od zera to nie nasz scenariusz i lepiej powiedzieć to od razu |
Każde z nich da się sprawdzić w minutę i każde kosztuje wiarygodność całej pozostałej oferty. Nie mówcie „768 GB pod jeden model” — pamięć nie łączy się w pulę, to osiem kart niezależnych pamięciowo. Nie wspominajcie o NVLink — w parametrach obu kart figuruje wyłącznie PCI Express. Nie obiecujcie statusu NVIDIA-Certified przed sprawdzeniem konkretnej konfiguracji w katalogu. I nie przenoście przyrostów 50- i 100-krotnych na tę maszynę: uzyskano je na serwerze z ośmioma kartami RTX PRO 4500 SE w porównaniu z systemem procesorowym, a nie na 6000 SE i nie wobec innej karty graficznej.
Dobór konfiguracji
Najczęstszy błąd przy doborze to liczenie teraflopsów. Przy inferencji pierwsza jest pojemność pamięci karty: jeśli wagi modelu nie mieszczą się w niej w całości, system sięga do pamięci systemowej i wydajność załamuje się gwałtownie.
| Potrzeba klienta | Karta | Platforma | Co sprawdzić |
|---|---|---|---|
| Inferencja modeli językowych mniej więcej do 70 miliardów parametrów | 6000 SE | 2U na dwie karty | Zarówno AWS, jak i Microsoft wskazują ten próg jako granicę dla jednej karty. Doprecyzować długość kontekstu i rozmiar pamięci podręcznej KV |
| Inferencja modeli większych | 6000 SE | 4U albo 6U na osiem kart | Równoległość tensorowa; pamiętać o stratach na PCIe wynikających z braku NVLink |
| Wiele niewielkich modeli | 4500 SE | MGX 2U na osiem kart | Liczyć gęstością na slot i liczbą równoległych strumieni, a nie sumą TFLOPS |
| Analiza wideo, transkodowanie | 4500 SE | MGX 2U, obudowy brzegowe | Trzy układy NVENC i trzy NVDEC na kartę to parametr kluczowy, a nie liczba rdzeni CUDA |
| Przetwarzanie danych, wyszukiwanie wektorowe | 4500 SE | MGX 2U na osiem kart | NVIDIA deklaruje do 50 razy wyższą wydajność od procesorów przy budowie indeksów wektorowych |
| Wirtualne stacje robocze | Obie | 2U albo 4U | Licencje vGPU i liczba instancji MIG: cztery w karcie mocniejszej, dwie w słabszej |
| Rendering, Omniverse, symulacje | 6000 SE | MGX 4U albo 6U | Rdzenie RT są konieczne; szczyt RT w karcie mocniejszej jest dwukrotnie wyższy |
| Dostrajanie istniejących modeli | 6000 SE | 4U albo 6U | Fine-tuning wymieniony wprost przez NVIDIA wśród zastosowań wersji serwerowej |
| Pilotaż bez nakładów inwestycyjnych | 6000 SE | AWS G7e, Azure NCv6, Google Cloud G4 | Patrz warstwa 08 |
| Trenowanie dużych modeli od zera | Poza deklarowanymi zastosowaniami obu kart. Jako łącze wymieniono wyłącznie PCI Express, wiersza NVLink nie ma | ||
Lista pytań przed przygotowaniem specyfikacji
- Jakie modele i w jakiej precyzji będą uruchamiane? Stąd wynika wymagana pamięć karty; próg około 70 miliardów parametrów w FP8 to granica dla jednej mocniejszej karty.
- Jaka długość kontekstu i ile jednoczesnych sesji? Stąd wynika rozmiar pamięci podręcznej KV, która często przesądza o wyborze.
- Trenowanie czy wyłącznie inferencja? Jeśli dostrajanie zajmuje niewielką część czasu, sprzęt dobiera się pod inferencję, a ciężkie zadania wynajmuje.
- Czy potrzebna jest grafika i ray tracing? Jeśli tak, w tym budżecie praktycznie nie ma alternatywy dla RTX PRO.
- Ilu jest niezależnych odbiorców? Cztery instancje MIG w 6000 SE wobec dwóch po 16 GB w 4500 SE.
- Ile kilowatów doprowadzono do szafy i jak odprowadzane jest ciepło? To ograniczenie tnie konfigurację częściej niż cokolwiek innego.
- Powietrze czy ciecz? W 6000 SE to dwa różne formaty: dwa sloty wobec jednego slotu FHXL.
- Czy planowany jest drugi serwer? Wtedy sieć wybiera się od razu: 25GbE wystarczy maszynie pojedynczej, a przy obciążeniu rozproszonym staje się ślepą uliczką.
- System gotowy czy barebone? Od tego zależy liczba pozycji w ofercie i terminy dostaw.
Ekonomia i rynek
Zacząć trzeba od zastrzeżenia: NVIDIA nie publikuje cen tych produktów. Wszelkie kwoty pojawiające się w recenzjach to szacunki osób trzecich i w tym kompendium ich nie ma. Cenę uzyskuje się od partnera albo przez NVIDIA Marketplace. Porównywalną ekonomię można natomiast zbudować na dokumentacji dostawców chmurowych.
| Platforma | Konfiguracja | Cechy szczególne |
|---|---|---|
| AWS EC2 G7e | Do 8 kart, łącznie do 768 GB pamięci kart, procesory Intel Emerald Rapids, do 192 wątków wirtualnych, do 2048 GiB pamięci systemowej, do 15,2 TB lokalnego NVMe, do 1600 Gb/s sieci przez EFA | Do 2,3 razy wyższa wydajność inferencji niż w G6e. GPUDirect P2P między kartami przez PCIe, GPUDirect RDMA po EFA, GPUDirect Storage z FSx for Lustre. Według AWS jedna karta obsługuje model o 70 miliardach parametrów w FP8 |
| Azure NC RTX PRO 6000 BSE v6 | Host na Intel Granite Rapids z taktowaniem wszystkich rdzeni do 4,2 GHz; konfiguracje ułamkowe i pełne oparte na MIG | Karty udostępniane są przez SR-IOV, co ogranicza zbieranie części telemetrii. Obsługa AKS. Docelowe zastosowania: bliźniaki cyfrowe i Omniverse, inferencja oraz RAG do 70 miliardów parametrów, rendering, VDI na RTX Virtual Workstation, wizualizacja naukowa w FP32 |
| Google Cloud G4 | Maszyny wirtualne z ułamkiem karty, profile vGPU po 12, 24, 48 i 96 GB | Według bloga technicznego NVIDIA profile pomyślano pod zastosowania od streamingu po wierny rendering 3D i symulację czujników w robotyce |
Trzy modele korzystania, między którymi wybiera klient
Zakup serwera
Uzasadniony przy stałym obciążeniu 24/7, wymaganiach co do miejsca przechowywania danych i przewidywalnym okresie eksploatacji. Daje kontrolę nad danymi i stały koszt.
Wynajem serwera dedykowanego
Kompromis: brak nakładów inwestycyjnych, ale konfiguracja jest z góry ustalona. Profile MIG pozwalają dostawcy sprzedawać ułamki karty, a klientowi brać dokładnie tyle pamięci, ile potrzebuje.
Chmura publiczna
Kartę oferuje trzech dostawców hiperskalowych. Sprawdza się przy szczytach, testach i pilotażu przed zakupem; przy stałym obciążeniu wychodzi zwykle drożej niż własny sprzęt.
Co wchodzi do kosztu posiadania
Cena kart, licencje AI Enterprise i vGPU, energia elektryczna i chłodzenie (osiem mocniejszych kart to do 4,8 kW na samych kartach wobec 1,3 kW dla ośmiu słabszych), miejsce w szafie, wsparcie producenta, koszt przestoju. Gęstość na slot często przechyla rachunek na korzyść 4500 SE tam, gdzie 6000 SE wygrywa wydajnością szczytową.
Producent Dostawca Rachunek na konkretnych liczbach
Poniższy model opiera się na rzeczywistej cenie platformy i na weryfikowalnych stawkach. Wszystkie założenia wypisano w tabeli — zmieniając je, otrzymujecie własną odpowiedź, a nie cudzą.
| Pozycja | AGS-6220V2 · 6U | AGS-4UMGX-R1 · MGX |
|---|---|---|
| Procesory | Brak | Brak, figurują jako opcja konfiguracji |
| Pamięć | Brak | Brak, figuruje jako opcja konfiguracji |
| Nośniki | Brak | Brak; wewnętrzny i przednie figurują jako opcje |
| Zasilacze | 4 fabrycznie zamontowane | 4 fabrycznie zamontowane |
| Wentylatory | 16 | 10 fabrycznie zamontowanych |
| Radiatory i ramki procesorów | 2 radiatory z mocowaniem | 2 radiatory i 4 ramki |
| Szyny do szafy | Są | Są, w kształcie litery L |
| Moduł sieciowy | 25 Gb/s OCP fabrycznie zamontowany | ConnectX-8 figuruje w parametrach; w opisie zestawu brak osobnej pozycji — do potwierdzenia |
| DPU | Brak | BlueField-3 figuruje w parametrach; w opisie zestawu brak osobnej pozycji — do potwierdzenia |
| Klucz RAID | Intel VROC fabrycznie zamontowany | Nie podano |
| Kable zasilające | 4 × C19–C20 | Nie podano |
Rzecz, która zamyka częste pytanie: obie platformy są barebone. Pamięć i nośniki i tak trzeba dokupić w obu przypadkach, więc porównanie 121 700 USD z 158 210 USD jest uprawnione — obie kwoty stoją na tej samej podstawie. Drobne pozycje przemawiają przy tym za 6U: moduł sieciowy, klucz VROC i kable zasilające są już w pudełku.
| Parametr | Wartość | Pochodzenie |
|---|---|---|
| Platforma 6U z 8 × RTX PRO 6000 SE, barebone | 121 700 USD | Oferta handlowa. Konkurencyjne modele 6U przyjęto po tej samej cenie |
| Platforma MGX 4U z 8 kartami, barebone | 158 210 USD | Przyjęto +30 % wobec ceny 6U. Również bez procesorów, pamięci i nośników — patrz tabela 16 |
| Uzupełnienie 6U: 2 × Xeon 4. lub 5. gen., 1 TB DDR5, NVMe | ≈ 20 000 USD | Szacunek. Do potwierdzenia u dostawcy |
| Uzupełnienie MGX 4U: 2 × Xeon 6, 1 TB DDR5 lub MRDIMM, E1.S | ≈ 25 000 USD | Szacunek. Drożej z trzech powodów: procesory pod LGA 4710, pamięć 6400 MT/s i nośniki E1.S klasy centrum danych |
| Jeśli klient potrzebuje pojemności na dane chłodne | różnica rośnie | 6U ma osiem wnęk SATA — najtańsze terabajty. MGX przyjmuje wyłącznie E1.S. Przy wymaganiu rzędu dziesiątek terabajtów różnica w uzupełnieniu łatwo się podwaja |
| Pobór mocy systemu | 6,0 kW | 8 × 600 W na kartach + 2 × 350 W na procesorach + 0,5 kW na pamięć, dyski i wentylatory |
| Sprawność zasilaczy | 94 % / 96 % | 80 PLUS Platinum w 6U, Titanium w MGX 4U — według kart katalogowych |
| PUE serwerowni | 1,4 | Założenie. Nowoczesne centrum danych osiąga niekiedy mniej |
| Energia elektryczna | 0,20 USD / kWh | Założenie. Wrażliwość pokazano poniżej |
| AWS g7e.48xlarge, 8 kart, na żądanie | 33,14 USD / godz. | Region us-east-1. Zgodne u czterech niezależnych serwisów śledzących ceny AWS; sprawdzajcie w kalkulatorze AWS |
| AWS g7e.48xlarge, spot | od 12,78 USD / godz. | Cena minimalna, zależna od strefy dostępności i ryzyka przerwania |
| Horyzont rachunku | 3 lata | Założenie |
| Nie uwzględniono | Licencji NVIDIA AI Enterprise i vGPU, rozszerzonego wsparcia producenta, miejsca w szafie lub kolokacji, przełączników i optyki poza serwerem, pracy ludzi oraz transferu. AWS osobno nalicza opłatę za ruch wychodzący | |
| Pozycja | 6U (INNO3D i konkurenci) | MGX 4U | AWS na żądanie | AWS spot |
|---|---|---|---|---|
| Nakłady inwestycyjne | 141 700 USD | 183 210 USD | — | — |
| Energia elektryczna rocznie | 15 656 USD | 15 330 USD | w cenie | w cenie |
| Razem przez 3 lata przy obciążeniu 24/7 | 188 669 USD | 229 200 USD | 871 032 USD | 335 803 USD |
| Koszt godziny karty przy 100 % wykorzystania | 0,90 USD | 1,09 USD | 4,14 USD | 1,60 USD |
| Koszt godziny karty przy 50 % wykorzystania | 1,79 USD | 2,18 USD | 4,14 USD | 1,60 USD |
| Zwrot wobec ceny na żądanie przy obciążeniu 24/7 | 6,2 miesiąca | 8,0 miesięcy | — | — |
Kluczowa asymetria: przy własnym sprzęcie koszty są niemal w całości stałe, a w chmurze niemal w całości zmienne. Chmura nie jest więc droższa „w ogóle” — jest droższa przy wysokim wykorzystaniu. Wiersz z kosztem godziny przy 50 % dobrze to pokazuje: własnej maszynie stawka się podwaja, a chmurze nie drgnie.
| Wariant | 6U | MGX 4U |
|---|---|---|
| Próg wykorzystania wobec ceny na żądanie | 21,7 % | 26,3 % |
| Próg wykorzystania wobec ceny spot | 56,2 % | 68,3 % |
| W godzinach przez 3 lata, wobec ceny na żądanie | 5 692 z 26 280 | 6 915 z 26 280 |
| Przy energii 0,10 USD / kWh | próg 19,0 % | — |
| Przy energii 0,30 USD / kWh | próg 24,4 % | — |
Dwa ostatnie wiersze pokazują, że cena energii waży na wyniku wyraźnie mniej niż wykorzystanie: potrojenie stawki przesuwa próg zaledwie o pięć punktów procentowych. Pierwsze pytanie do klienta brzmi więc nie „ile płacicie za kilowatogodzinę”, tylko „ile godzin na dobę karty będą realnie zajęte”.
Po pierwsze. Jeśli karty pracują dłużej niż jedną czwartą czasu, zakup wychodzi taniej niż wynajem na żądanie, a przy pracy ciągłej maszyna zwraca się mniej więcej w pół roku. Wobec cen spot próg jest wyraźnie wyższy — około 56 % — ale spot nie daje gwarancji dostępności i nie nadaje się pod produkcję. Po drugie. Chmura wygrywa w trzech sytuacjach: pilotaż przed zakupem, szczyty obciążenia nakładane na własny park oraz projekty krótsze niż rok. Rozsądny układ to kupić pod obciążenie bazowe i dobierać szczyty z chmury. Po trzecie. Różnica progu między 6U a MGX 4U wynosi mniej niż pięć punktów procentowych. Jeśli klient i tak mieści się w progu wykorzystania, o wyborze platformy decydują nie pieniądze, lecz to, czy potrzebna mu jest sieć pozwalająca urosnąć do klastra.
Przydatny rachunek do rozmowy, ale trzeba go prowadzić uważnie. Osiem kart w cenie z marketplace'u NVIDIA to 106 000 USD. Wynika stąd, że na samą obudowę 6U przypada około 15 700 USD, a na MGX 4U około 52 210 USD. Premia wynosi 36 510 USD.
Co się w niej mieści. Obudowa w formacie MGX 4U, płyta główna pod Xeon 6 na gnieździe LGA 4710 z pamięcią do 6400 MT/s, zasilacze klasy Titanium o mocy 3200 W zamiast Platinum o mocy 2700 W, osiem portów po 400 Gb/s na ConnectX-8 oraz dedykowany BlueField-3. W przeliczeniu na port wychodzi około 4560 USD za każde 400 Gb/s — i to zanim klient kupi przełącznik.
Czego się w niej nie mieści — ważna korekta. Same procesory Xeon 6 nie są objęte premią: nie ma ich w żadnej z dwóch dostaw. Premia obejmuje płytę przyjmującą Xeon 6, a procesory kupuje się osobno i w wersji MGX wypadną drożej niż Xeony 4. lub 5. generacji w modelu 6220V2. To dochodzi do różnicy, a nie wchodzi w jej skład.
Co koniecznie potwierdzić pisemnie. W opisie zawartości AGS-4UMGX-R1 ani ConnectX-8, ani BlueField-3 nie są wymienione osobną pozycją: oba figurują wyłącznie w parametrach, z adnotacją „Configured with”. Czyta się to jako „wchodzi w skład skonfigurowanego systemu”, ale przy różnicy 36 510 USD trzeba to uzyskać od dostawcy na piśmie. Pytanie wprost: czy płyta ConnectX-8 SuperNIC oraz moduł BlueField-3 mieszczą się w cenie AGS-4UMGX-R1, czy są rozliczane osobno? Jeśli osobno, cały powyższy rachunek się rozsypuje i porównanie trzeba zbudować od nowa.
Czego premia na pewno nie zwraca. Sprawności energetycznej: przejście z Platinum na Titanium oszczędza 326 USD rocznie, czyli około 980 USD przez trzy lata — 2,7 % premii. Titanium należy sprzedawać jako zapas cieplny i niezawodność, a nie jako oszczędność na rachunkach.
Według NVIDIA model Llama Nemotron Super w formacie NVFP4 na jednej karcie RTX PRO 6000 daje do trzykrotnie lepszy stosunek ceny do wydajności niż FP8 na H100. To odwrócenie utartej logiki: tańsza karta uniwersalna okazuje się korzystniejsza od flagowego akceleratora przy inferencji — pod warunkiem że model mieści się w pamięci. Pośrednio potwierdza to również rynek: AWS niezależnie zmierzył do 2,3 razy wyższą wydajność inferencji na instancjach G7e niż w poprzedniej generacji opartej na L40S.
Dokąd sięgnąć dalej
NVIDIA Źródło wszystkich danych o kartach i technologiach
- RTX PRO 6000 Blackwell Server Edition · RTX PRO 4500 Blackwell Server Edition — parametry i deklaracje wydajności.
- Rodzina RTX PRO 6000 Blackwell — tabela porównawcza trzech wariantów, źródło danych do tabeli 3.
- RTX PRO Server — cztery konfiguracje referencyjne, technologie sieciowe, lista partnerów systemowych.
- Karty katalogowe: 6000 SE · 4500 SE · RTX PRO Server · Data Center GPU Line Card.
- MGX · Multi-Instance GPU · Wirtualizacja kart · ConnectX-8 SuperNIC · BlueField-3 · Spectrum-X.
- Blog techniczny o 4500 SE i vGPU 20 · Komunikat prasowy o serwerach RTX PRO.
- Narzędzia weryfikacji: Qualified System Catalog · NVIDIA-Certified Systems · AI Factory Validated Design · NVIDIA Marketplace.
- Wyniki MLPerf — testy weryfikowalne niezależnie.
Producenci Źródło wszystkich danych o serwerach
- INNO3D AGS-4UMGX-R1 i karta katalogowa w PDF — platforma MGX 4U.
- INNO3D AGS-6220V2 i karta katalogowa w PDF — platforma 6U.
- Lenovo Press: 6000 SE w ThinkSystem i 4500 SE — macierze zgodności i limity mocy slotu. Jeden taki dokument zastępuje dziesięć recenzji.
- Gigabyte: rozwiązania RTX PRO · ZOTAC ZRS-MGX-R1 · Supermicro: portfolio systemów.
Dostawcy Źródło danych o chmurze
- AWS EC2 G7e i zapowiedź na blogu AWS.
- Microsoft Learn: seria NC RTX PRO 6000 BSE v6 i przegląd serii.
Lektura uzupełniająca nie jest źródłem liczb
Poniższe materiały przydają się przy pierwszym zapoznaniu z tematem, ale liczby w nich należy weryfikować wobec źródeł pierwotnych wymienionych wyżej — to właśnie rozbieżności w takich publikacjach zmusiły do przebudowy tego kompendium.
- ENServeTheHome — PCIe GPU in Server Guide, wzorcowe omówienie tej klasy platform; ich kanał na YouTube to najlepszy materiał wideo na ten temat.
- ENigor'sLAB o 4500 SE — wyjaśnia, po co ta karta w ogóle powstała: gęstość w szafie, waty i koszt posiadania zamiast teraflopsów.
- UKAlfa-Server — omówienie 4500 SE wraz z zalecaną konfiguracją serwera.
- RUCytrix — RTX PRO 6000 Server Edition, najbardziej „serwerowe” z rosyjskojęzycznych omówień.
Słowniczek
| Pojęcie | Rozwinięcie | Znaczenie |
|---|---|---|
| MIG | Multi-Instance GPU | Sprzętowy podział karty na odizolowane układy z gwarantowaną jakością obsługi |
| vGPU | Virtual GPU | Wirtualizacja karty na potrzeby VDI; stosuje się licencje vWS i vPC |
| MGX | NVIDIA MGX | Modułowy projekt referencyjny platformy serwerowej |
| SuperNIC | ConnectX-8 SuperNIC | Karta sieciowa z 48-liniowym przełącznikiem PCIe Gen 6 |
| DPU | Data Processing Unit | BlueField-3: przejmuje z procesora obsługę sieci, dostępu do danych i ochrony |
| GPUDirect P2P | Peer to Peer | Bezpośrednia wymiana między kartami po PCIe, z pominięciem pamięci systemowej |
| SR-IOV | Single Root I/O Virtualization | Sposób udostępniania urządzenia maszynom wirtualnym; stosowany w Azure NCv6 |
| FP4 / NVFP4 | Format czterobitowy | Format obliczeń zagęszczający wagi czterokrotnie względem FP16 |
| NVENC / NVDEC | Encoder / Decoder | Sprzętowe układy kodowania i dekodowania wideo |
| Pamięć podręczna KV | Key-Value cache | Pamięć na kontekst rozmowy; często przesądza o rzeczywistym zużyciu pamięci karty |
| FHFL / FHXL | Full Height Full Length / Extra Length | Karta pełnowymiarowa i jej wydłużony wariant do wersji chłodzonej cieczą |
| Barebone | — | Platforma bez procesorów, pamięci i nośników |
| Headless | — | Praca bez podłączonego monitora |