Kompendium robocze · Wersja z 17 sierpnia 2026 · Ujęcie: sprzedaż systemów INNO3D

Serwerowe układy GPU NVIDIA:
RTX PRO 6000 i RTX PRO 4500 Blackwell Server Edition

Podręcznik dla handlowca sprzedającego serwery GPU INNO3D. Od podstaw, przez architekturę platformy i argumenty za oraz przeciw modelowi AGS-6220V2, aż po rachunek kosztu posiadania. Przy każdym argumencie podana jest granica, poza którą przestaje on działać — inżynier po stronie klienta i tak ją znajdzie, więc lepiej wskazać ją pierwszemu.

Klasa produktuUniwersalne karty PCIe do firmowych centrów danych
Następcy modeliL40S → PRO 6000 · L4 → PRO 4500
Kluczowy rozdziałWarstwa 06: argumenty za i przeciw, odpieranie obiekcji

NVIDIA dane NVIDIA o własnych produktach  ·  Producent dane producentów serwerów  ·  Dostawca dane dostawców chmurowych

Warstwa 00 · PodstawyCzym karta serwerowa różni się od każdej innej

Dlaczego zwykłej karty dla graczy nie da się po prostu wstawić do serwera

To pierwsza rzecz, którą trzeba umieć wytłumaczyć klientowi, bo pytanie „a dlaczego nie 4090 albo 5090, przecież są tańsze” pada za każdym razem. Różnic jest sześć i wszystkie dotyczą eksploatacji, a nie wyników w testach.

Różnica 01 · NVIDIA

Chłodzenie pasywne

NVIDIA wprost podaje, że karty serwerowe mają chłodzenie pasywne, a model 6000 SE opisuje jako przeznaczony do serwerów wielokartowych wymagających właśnie takiego rozwiązania. Na płytce nie ma wentylatorów — powietrze tłoczy obudowa. Poza serwerem z zaprojektowanym przepływem powietrza karta po prostu nie zadziała.

Różnica 02 · NVIDIA

Pamięć z korekcją błędów

W parametrach 6000 SE figuruje 96 GB GDDR7 z korekcją błędów ECC. Przy pracy ciągłej — wielodniowej inferencji albo renderingu — pojedyncze przekłamanie bitu bez ECC oznacza błędny wynik, o którym nikt się nie dowie, bo system nie zgłosi żadnego błędu.

Różnica 03 · NVIDIA

Odmienny zestaw wyjść

Model 6000 SE ma cztery złącza DisplayPort 2.1, więc w centrum danych może pracować również jako karta graficzna. W parametrach 4500 SE wyjść obrazu nie ma w ogóle — to akcelerator czysto obliczeniowy, pracujący bez monitora.

Różnica 04 · NVIDIA

Podział: MIG i vGPU

Kartę można podzielić na odizolowane instancje z własną pamięcią, pamięcią podręczną i rdzeniami albo udostępnić zdalnym użytkownikom przez vGPU. Model 6000 SE daje do czterech instancji, 4500 SE — do dwóch po 16 GB.

Różnica 05 · NVIDIA

Certyfikacja całego systemu

Serwery RTX PRO mają status NVIDIA-Certified i przechodzą weryfikację z narzędziami partnerów w ramach programu AI Factory Validated Design. To gwarancja zgodności ze stosem AI Enterprise i z rozwiązaniami sieciowymi NVIDIA.

Różnica 06 · NVIDIA

Regulowany pobór mocy

Pobór mocy 6000 SE podano jako zakres od 400 do 600 W. To karta dopasowuje się do budżetu cieplnego obudowy, a nie odwrotnie. Karty konsumenckie takiej możliwości nie mają.

Wniosek handlowy

Argumentem w rozmowie z klientem nie jest wydajność, lecz przewidywalność i możliwość zarządzania. Karta dla graczy jest tańsza przy zakupie i droższa w utrzymaniu: nie da się jej podzielić między użytkowników, nie ma ECC, nie można jej ograniczyć mocowo pod obudowę i nie wchodzi w skład certyfikowanej konfiguracji, za którą odpowiadają producent serwera oraz NVIDIA.

Warstwa 01 · Architektura NVIDIACo w Blackwellu naprawdę daje przyrost

Cztery zmiany pokoleniowe, za które klient płaci

Blackwell zastąpił architekturę Ada Lovelace. Przy sprzedaży kart serwerowych liczą się dokładnie cztery jego cechy — reszta to szczegóły dla inżynierów.

Tabela 1 · Zmiany w Blackwellu i ich znaczenie handlowe
TechnologiaCo mówi NVIDIACo zyskuje klient
Rdzenie Tensor 5. generacji i FP4Wydajność do 3 razy wyższa niż w poprzednim pokoleniu, dochodzi obsługa precyzji FP4. W 6000 SE pracuje Transformer Engine drugiej generacjiWagi modelu zajmują czterokrotnie mniej pamięci niż w FP16. To stąd bierze się wielokrotny przyrost w inferencji modeli językowych, a nie z liczby rdzeni CUDA
Pamięć GDDR7Znacząco zwiększone przepustowość i pojemnośćPozwoliła zmieścić 96 GB na jednej karcie — pojemność wcześniej dostępną wyłącznie na kosztownych platformach SXM
Rdzenie RT 4. generacjiWydajność do 2 razy wyższa; technika RTX Mega Geometry obsługuje do 100 razy więcej trójkątów z ray tracingiemRendering, bliźniaki cyfrowe, symulacje, Omniverse. Tego właśnie nie mają akceleratory czysto obliczeniowe
NVENC 9 i NVDEC 6Obsługa 4:2:2 w H.264 i HEVC, lepsza jakość AV1, dwukrotnie wyższa przepustowość dekodowania H.264Analiza wideo, transkodowanie, streaming, produkcja mediów — segmenty, w których karta sprzedaje się bez ani jednego zdania o sztucznej inteligencji

Klucz do zrozumienia całej linii: RTX PRO to karty, które liczą sztuczną inteligencję i jednocześnie generują grafikę. Ta wszechstronność stanowi ich główną przewagę konkurencyjną i najmocniejszy argument w sprzedaży.

Warstwa 02 · Produkt NVIDIAParametry ze stron produktowych NVIDIA

Obie karty obok siebie

Obie powstały na architekturze Blackwell, obie mają chłodzenie pasywne, obie korzystają z PCIe Gen5 x16 i obie obsługują MIG. Na tym podobieństwa się kończą — to karty pod inny budżet cieplny i inne zadania.

Tabela 2 · RTX PRO 6000 SE wobec RTX PRO 4500 SE
ParametrRTX PRO 6000 Blackwell SERTX PRO 4500 Blackwell SE
Rdzenie CUDA24 06410 496
Rdzenie RT (4. gen.)18882
Pamięć karty96 GB GDDR7 z ECC32 GB GDDR7
Przepustowość pamięci1597 GB/s800 GB/s
Szyna pamięci512 bitów256 bitów
Tensor Core FP44 PFLOPS1,6 PFLOPS
Tensor Core FP82 PFLOPS811 TFLOPS
Tensor Core FP16 / BF161 PFLOPS406 TFLOPS
Tensor Core TF32234 TFLOPS203 TFLOPS
Pojedyncza precyzja FP32120 TFLOPS51 TFLOPS
Szczyt rdzeni RT355 TFLOPS154 TFLOPS
Pobór mocy400–600 W (regulowany)165 W
FormatPowietrze: 2 sloty, 11,2 × 26,7 cm · Ciecz: 1 slot, FHXL1 slot, 11,2 × 26,7 cm
ChłodzeniePasywnePasywne
InterfejsPCIe Gen 5 x16PCI Express 5.0 x16
MIGDo 4 odizolowanych instancjiDo 2 instancji po 16 GB
Układy wideo4 NVENC / 4 NVDEC3 NVENC / 3 NVDEC
Wyjścia obrazu4 × DisplayPort 2.1Nie podano w parametrach
Obliczenia poufneNie podano w parametrachObsługiwane
Złącze zasilaniaNie podano w parametrach1 × PCIe CEM5 16-pin
PoprzednikNVIDIA L40SNVIDIA L4

Wiersze z adnotacją „nie podano” zostawiono celowo: NVIDIA publikuje dla obu kart nieco inne zestawy parametrów, a uzupełnianie luk przez analogię to dokładnie ta droga, którą błędne liczby trafiają do recenzji.

Uwaga: trzy różne produkty o niemal identycznej nazwie

To najczęstsza pomyłka w specyfikacjach i ofertach. „RTX PRO 6000 Blackwell” to rodzina trzech kart, a serwerowy model 4500 istnieje obok niej osobno.

Tabela 3 · Warianty RTX PRO 6000 Blackwell
ParametrServer EditionWorkstation EditionMax-Q Workstation
Pamięć96 GB GDDR7 ECC96 GB GDDR7 ECC96 GB GDDR7 ECC
Pobór mocy400–600 W600 W300 W
ChłodzeniePasywnePrzelotowe z dwóch stronAktywne
Wymiary11,2 × 26,7 cm, 2 sloty13,7 × 30,5 cm, 2 sloty11,2 × 26,7 cm, 2 sloty
Wyjścia obrazu4 × DisplayPort 2.14 × DisplayPort 2.14 × DisplayPort 2.1
MagistralaPCIe Gen 5 x16PCIe Gen 5 x16PCIe Gen 5 x16
Przeznaczenie wg NVIDIASerwery wielokartowe z chłodzeniem pasywnym: inferencja, dostrajanie modeli, rendering rozproszony, HPC, wirtualne stacje roboczeMaksymalna wydajność w jednokartowej stacji roboczejGęste konfiguracje stacji roboczych, do czterech kart

Max-Q to praktyczny kompromis dla klienta, który potrzebuje gęstości, ale nie ma szafy serwerowej: o połowę mniej ciepła przy tej samej pojemności pamięci, do czterech kart w stacji. Warto też zwrócić uwagę na sformułowanie NVIDIA przy wersji serwerowej — dostrajanie modeli wymieniono wprost, czyli fine-tuning mieści się w deklarowanym zastosowaniu, w odróżnieniu od trenowania od zera.

Reguła praktyczna

Stosunek pamięci do watów jest w obu kartach serwerowych zbliżony, natomiast gęstość w przeliczeniu na slot różni się zasadniczo: 165 W w jednym slocie wobec 600 W w dwóch. Wybór między nimi sprowadza się do pytania, czy chodzi o „jeden duży model”, czy o „wiele równoległych strumieni”. Pod względem obliczeń różnica jest dwu- do dwuipółkrotnej, pod względem poboru mocy — niemal czterokrotna.

Warstwa 03 · Pozycjonowanie NVIDIAGdzie przebiegają granice zastosowania

Miejsce w ofercie NVIDIA dla centrów danych

Najcenniejsza umiejętność przy sprzedaży tych kart to potrafić powiedzieć, kiedy się nie nadają. Oferta dla centrów danych dzieli się na dwa nurty: uniwersalne karty PCIe z serii RTX PRO oraz akceleratory obliczeniowe przeznaczone do trenowania.

Tabela 4 · Podział ról w ofercie
RozwiązanieRola wg opisu NVIDIAGrafika i RTŁącze między kartami
RTX PRO 4500 SEInferencja małych i średnich modeli, przetwarzanie danych i data science, analiza wideo, wirtualizacja. Do centrum danych, na brzeg sieci i do chmuryJestPCI Express 5.0 x16
RTX PRO 6000 SEInferencja, dostrajanie modeli, rendering rozproszony, HPC, wirtualne stacje robocze. Uniwersalna karta do centrum danychJestPCIe Gen 5 x16
Seria H i seria BOdrębne linie produktowe NVIDIA do zastosowań wymagających łączności między kartami przez NVLinkOgraniczonaNVLink / NVSwitch
Ograniczenie, o którym trzeba uprzedzić z góry

W parametrach obu kart jako łącze wymieniono wyłącznie PCI Express — wiersza NVLink tam nie ma. Karty komunikują się przez PCIe, a ich pamięci nie łączą się we wspólną pulę. Osiem kart po 96 GB to nie „768 GB pod jeden model”, tylko osiem akceleratorów niezależnych pamięciowo. Duża pojemność pojedynczej karty rekompensuje to przy inferencji równoległej, ale model, który nie mieści się w 96 GB, wymaga albo równoległości tensorowej ze stratami na PCIe, albo platformy z NVLink.

Argumenty za zmianą pokolenia

  • Wobec L40S: NVIDIA podaje, że serwery RTX PRO wykonują symulacje i generowanie danych syntetycznych do 4 razy szybciej niż systemy na L40S, a samą kartę 6000 SE opisuje jako wyraźny skok względem L40S w multimodalnych zastosowaniach agentowych i generatywnych.
  • Wobec L4: dla 4500 SE NVIDIA deklaruje ponad pięciokrotny przyrost względem poprzedniej generacji L4 przy inferencji małych i średnich modeli — pod warunkiem korzystania ze zoptymalizowanych bibliotek NVIDIA i mikrousług NIM.
  • Wobec systemów bez kart graficznych: przy rozumieniu treści wideo NVIDIA deklaruje przyrost sięgający 100 razy względem systemów opartych wyłącznie na procesorach oraz ograniczenie zajmowanego miejsca i zużycia energii o ponad 95 %. Dla baz wektorowych mowa o przyroście do 50 razy. To najmocniejszy argument w rozmowie z klientem, który utrzymuje park serwerów procesorowych.

Do dwóch ostatnich liczb potrzebne jest ważne zastrzeżenie: przyrosty 50- i 100-krotne porównują serwer z ośmioma kartami 4500 SE z systemem procesorowym (dla baz wektorowych: AMD 9654 ze 192 wątkami, 33 miliony wektorów w Milvus 2.5.25, algorytm HNSW wobec cuVS CAGRA; dla wideo: dwuprocesorowy AMD 9654 i model Qwen3-VL-8B). To poprawne porównanie platform, ale nie karty z kartą — i kompetentny inżynier po stronie klienta o to zapyta.

Warstwa 04 · Oprogramowanie NVIDIAFunkcje, za które płaci biznes

Funkcje, które naprawdę sprzedają kartę

Tabela parametrów przekonuje inżyniera. Decydenta po stronie biznesu przekonują poniższe rzeczy — to one zamieniają sprzęt w usługę, którą można odsprzedać albo rozdzielić między działy.

Tabela 5 · Funkcje klasy korporacyjnej
TechnologiaJak działaWartość dla klienta
MIGSprzętowy podział karty na odizolowane instancje, z których każda ma własną pamięć o wysokiej przepustowości, pamięć podręczną i rdzenie obliczeniowe oraz gwarantowaną jakość obsługi. W 6000 SE do czterech, w 4500 SE do dwóch po 16 GBGwarantowana jakość obsługi dla każdego najemcy. Jedna karta obsługuje kilka niezależnych zadań, które sobie nawzajem nie przeszkadzają — to podstawa rozliczeń i wielodostępu
vGPUW połączeniu z oprogramowaniem NVIDIA RTX Virtual Workstation i Virtual PC karta zostaje zwirtualizowana dla użytkowników zdalnych. Obsługiwany jest podział czasu nałożony na MIG, dzięki czemu zadania AI i graficzne mogą działać równolegle. W vGPU 20 dochodzą AI Virtual Workstation Toolkit oraz stały przydział udziałówInżynierowie i projektanci pracują na cienkich klientach, a licencje CAD i dane nie opuszczają firmowej sieci. Bardzo często to właśnie ten scenariusz, a nie sztuczna inteligencja, finansuje cały zakup
ECCKorekcja błędów pamięci karty, zadeklarowana dla 96 GB GDDR7 w modelu 6000 SEWarunek pracy produkcyjnej 24/7 i typowy wymóg w przetargach na infrastrukturę
Obliczenia poufneDla 4500 SE w tabeli parametrów wskazano obsługę tej funkcjiArgument w branżach regulowanych: ochrona danych i modeli w trakcie przetwarzania
NVIDIA AI EnterpriseZestaw narzędzi, bibliotek i frameworków wraz z mikrousługami NIM oraz NeMoOsobna pozycja na fakturze, a zarazem odpowiedź na obiekcję „a kto to będzie utrzymywał”
NVIDIA-CertifiedSerwery RTX PRO mają ten status i przechodzą weryfikację z narzędziami partnerów w ramach AI Factory Validated DesignGwarancja zgodności z siecią NVIDIA, układami BlueField-3 i stosem AI Enterprise. Zdejmuje ryzyko integracji zarówno z klienta, jak i z integratora
NVIDIA Run:aiPlatforma orkiestracji zadań i kart, podnosząca wykorzystanie sprzętu oraz łączną przepustowośćDociążenie bezczynnych kart to bezpośredni argument za szybszym zwrotem z inwestycji
Chwyt praktyczny

MIG warto pokazywać w pieniądzach, a nie w gigabajtach. Jedna karta RTX PRO 6000 SE podzielona na cztery instancje to cztery stanowiska pracy dla programisty AI albo cztery niezależne usługi inferencji na jednej fizycznej karcie. Działa też reguła odwrotna: pod 4500 SE nie wolno planować czterech użytkowników, bo ta karta daje najwyżej dwie instancje. Ten szczegół regularnie umyka przy przygotowywaniu ofert.

Warstwa 05 · Platforma NVIDIA ProducenciOd karty do szafy rack

Serwer to system, a nie pudełko z kartami

Tutaj przebiega granica między „znam sprzęt” a „rozumiem technologie serwerowe”. Karty stanowią mniejszą część złożoności inżynierskiej. Reszta to obudowa, sieć, zasilanie i chłodzenie. Konfiguracje referencyjne opisuje NVIDIA, a konkretne maszyny — ich producenci.

NVIDIA Cztery konfiguracje referencyjne

NVIDIA określa RTX PRO Server jako uniwersalną platformę do centrum danych i podaje cztery przykłady oparte na modułowych projektach referencyjnych MGX. To punkt odniesienia, względem którego ocenia się każdą propozycję producenta.

Tabela 6 · Konfiguracje referencyjne RTX PRO Server
KonfiguracjaKartySiećDPU
MGX 6U8 × RTX PRO 6000 SE, chłodzenie ciecząConnectX-8 SuperNIC z przełącznikiem PCIe Gen 6BlueField-3
MGX 4U8 × RTX PRO 6000 SEConnectX-8 SuperNIC z przełącznikiem PCIe Gen 6BlueField-3
MGX 2U2 × RTX PRO 6000 SEConnectX-7 albo BlueField-3 SuperNICBlueField-3
MGX 2U8 × RTX PRO 4500 SEConnectX-7 SuperNICBlueField-3

Ostatni wiersz łatwo przeoczyć, a nie warto: osiem mniejszych kart mieści się w dwóch jednostkach wysokości. To 256 GB pamięci i 12,8 PFLOPS w FP4 w 2U przy 1,3 kW na kartach, wobec 4,8 kW dla ośmiu kart większych. Do analizy wideo i inferencji małych modeli jest to najgęstsza z oficjalnych konfiguracji.

NVIDIA Co daje przełącznik wbudowany w SuperNIC

Najważniejszą zmianę architektoniczną ostatnich generacji NVIDIA opisuje tak: ConnectX-8 SuperNIC PCIe Switch to płyta łącząca kilka układów SuperNIC, z których każdy zestawia bardzo szybką sieć z 48-liniowym przełącznikiem PCIe Gen 6. Rozwiązanie eliminuje osobne przełączniki PCIe, podwaja przepustowość między kartami, upraszcza projekt płyty i zapewnia do 800 Gb/s. Obok niego w konfiguracjach pracuje układ BlueField-3, który — zgodnie z opisem NVIDIA — przejmuje z procesora obsługę sieci, dostępu do danych i bezpieczeństwa oraz zapewnia izolację w modelu zerowego zaufania. Podsystem sieciowy uzupełnia Spectrum-X: dzięki adaptacyjnemu routingowi RoCE i kontroli przeciążeń przyspiesza pracę z pamięcią masową o blisko 50 %.

Topologia z przełącznikiem a bezpośrednia: na czym polega różnica

Serwery ośmiokartowe na PCIe występują w dwóch topologiach i warto umieć wyjaśnić różnicę. W układzie z przełącznikiem karty podłączone są do dedykowanych układów przełącznika PCIe, a ten dopiero prowadzi w górę do procesorów: każda karta sięga każdej innej na pełnej szerokości, nie wychodząc poza przełącznik, a linii jest więcej, niż udostępniają same procesory. W układzie bezpośrednim każda karta wpina się w kompleks główny procesora: taniej i o jeden przeskok bliżej pamięci systemowej, ale karty rozdzielają się między gniazda, a ruch między połówkami przechodzi przez magistralę międzyprocesorową. AGS-6220V2 zbudowano w układzie bezpośrednim, AGS-4UMGX-R1 — z przełącznikiem. Że nie jest to dzielenie włosa na czworo, widać po obu stronach branży: NVIDIA stworzyła ConnectX-8 SuperNIC właśnie po to, by pozbyć się osobnych przełączników przy zachowaniu ich zalet, a AWS osobno odnotowuje bardzo niskie opóźnienie wymiany między kartami znajdującymi się na tym samym przełączniku PCIe.

Producenci Trzy klasy maszyn

Segment masowy

2U, 2–4 karty

Zwykłe serwery stelażowe firm Cisco, Dell, HPE, Lenovo i Supermicro — wszystkie figurują na liście czołowych partnerów systemowych NVIDIA. Wchodzą do istniejącej szafy klienta. To punkt wejścia w obliczenia akcelerowane dla firmy, która ma już własne centrum danych.

Fabryka AI

4U MGX, 8 kart

Wyspecjalizowana platforma na projekcie referencyjnym NVIDIA MGX z układami ConnectX-8 i BlueField-3. To element składowy klastra, a nie „serwer z kartami graficznymi”. Przykłady: INNO3D AGS-4UMGX-R1, Gigabyte XL44-SX2-AAS1, ZOTAC ZRS-MGX-R1, Supermicro SYS-522GA-NRT.

Węzeł samodzielny

6U, 8 kart

Platformy pokroju INNO3D AGS-6220V2. Te same osiem kart, ale w półtora raza większej objętości: zapas powietrza, łatwość serwisowania i cena zamiast gęstości oraz szybkiej sieci. Samodzielna maszyna robocza, nie węzeł klastra.

Producent Analiza konkretnej platformy: INNO3D AGS-6220V2

Warto zestawić z konfiguracją referencyjną MGX maszynę o odmiennej filozofii. To obudowa 6U na osiem kart RTX PRO 6000 Blackwell Server Edition, w której niemal każda decyzja przebiega odwrotnie niż w logice MGX. Dane pochodzą z karty katalogowej INNO3D dla numeru AGS-6220V2P2-B00.

Tabela 7 · INNO3D AGS-6220V2 według karty katalogowej producenta
PodzespółRozwiązanieCo to oznacza w praktyce
Postać dostawyBarebone. Obudowa, płyta główna, 4 zasilacze, moduł OCP 25 Gb/s, klucz VROC, szyny i radiatory są fabrycznie zamontowane. Bez procesorów, pamięci i nośnikówTo platforma, a nie gotowy serwer. Procesory, DDR5, dyski NVMe i osiem kart stanowią osobne pozycje oferty, z osobnymi terminami dostaw
Format6U, 900 × 438 × 264 mmOsiem kart w 6U wobec ośmiu w 4U w konfiguracji referencyjnej. Głębokość 900 mm — trzeba sprawdzić głębokość szafy klienta z uwzględnieniem prowadzenia okablowania
Sloty na karty8 × PCIe 5.0 x16, pełna wysokość, podwójna szerokość. Podłączenie bezpośrednio do procesorów, bez przełącznika PCIeKażda karta dostaje pełne x16. Ale 8 × x16 to 128 linii na dwa gniazda: karty dzielą się 4+4, a wymiana między połówkami idzie przez magistralę międzyprocesorową. Dla równoległości tensorowej jest to wąskie gardło
Procesory2 × Intel Xeon Scalable 4. i 5. generacji, gniazdo LGA 4677, chipset C741. Limit 350 W TDP na procesorTen pułap odcina część mocniejszych modeli — trzeba zweryfikować wybrany procesor przed złożeniem zamówienia
Pamięć32 gniazda DDR5 RDIMM / RDIMM-3DS, 8 kanałów na procesor. RDIMM do 96 GB, RDIMM-3DS do 256 GB na moduł. 5600 MT/s przy 1DPC i 4400 przy 2DPC, dla Xeonów 5. generacjiPułap około 8 TB. Pełne obsadzenie gniazd obniża taktowanie z 5600 do 4400
Sieć1 slot OCP, moduł 25 Gb/s w zestawie, plus port zarządzania BMC 1GbEGłówna różnica wobec konfiguracji referencyjnej. Ani ConnectX-8, ani BlueField-3, ani 400 Gb/s. To maszyna pojedyncza, nie element klastra
Pamięć masowa12 wnęk 3,5/2,5″ (8 × SATA-3 + 4 × NVMe), 1 × M.2 NVMe wewnątrz, RAID Intel VROC 0/1/10/5Osiem z dwunastu wnęk obsługuje wyłącznie SATA. Na szybki zbiór danych zostają cztery wnęki NVMe
Zasilanie4 × 2700 W CRPS, układ 3+1, 80 PLUS Platinum8100 W mocy użytecznej. Rachunek: 8 × 600 W na kartach plus 2 × 350 W na procesorach plus pamięć, dyski i wentylatory — około 6,5 kW. Zasilanie musi być 200–240 V, złącza C19/C20
Chłodzenie16 wentylatorów wymienianych podczas pracy: 8 wewnętrznych i 8 z tyłuGłówna zaleta formatu 6U: powietrza jest dużo, a wentylatory wymienia się bez wyłączania maszyny
ZarządzanieDedykowany port IPMI, VGA, 2 × USB 3.2 Gen1. Złącze TPM z interfejsem SPI, sam moduł TPM 2.0 jest opcjąGdy przetarg wymaga TPM, moduł zamawia się osobno
Systemy operacyjneWindows Server 2022/2019, RHEL 9.2–8.6, SLES 15 SP4, Ubuntu 22.04 LTS, VMware ESXi 8.0U1 / 7.0U3i, Citrix Hypervisor 8.2 LTSR CU1Obsługa ESXi i Citriksa to sygnał, że platformę pomyślano również pod wirtualne stacje robocze
Jedyna rozbieżność wewnątrz samej karty katalogowej

Strona tytułowa wystawiona jest na numer AGS-6220V2P2-B00 (pozycja 0K219-B001), natomiast nagłówek strony z parametrami podaje AGS-6220V2P2-B10. Wygląda to na literówkę albo sąsiednią wersję zestawu, ale numer katalogowy trzeba przy zamówieniu potwierdzić pisemnie: od niego zależy, co faktycznie jest fabrycznie zamontowane w obudowie. W tym samym miejscu jest drobna nieścisłość co do pamięci — jeden wiersz podaje 4800/4400 MHz, a wiersz poniżej 5600 MT/s przy 1DPC dla Xeonów 5. generacji.

Producent Ten sam producent, odmienna filozofia: INNO3D AGS-4UMGX-R1

INNO3D ma również drugą platformę pod te same karty — model 4U na projekcie referencyjnym NVIDIA MGX, z układami ConnectX-8 SuperNIC i BlueField-3. Porównanie dwóch maszyn jednego producenta mówi więcej niż jakiekolwiek zestawienie między markami: widać dokładnie, za co się dopłaca, bez poprawki na różnice w jakości wykonania i obsłudze posprzedażnej.

Tabela 8 · Dwie platformy INNO3D pod te same karty
PodzespółAGS-4UMGX-R1 · MGXAGS-6220V2 · 6U
FormatNVIDIA MGX 4U, 858 × 440 × 175 mm6U, 900 × 438 × 264 mm
Topologia kart8 × PCIe Gen 5 x16 pod osiem RTX PRO 6000 SE plus osobny slot Gen 5 x16 pod BlueField-38 × PCIe 5.0 x16, podłączenie bezpośrednio do procesorów, bez przełącznika
SiećConnectX-8 SuperNIC: 8 portów po 400 Gb/s QSFP, plus 2 × 10GbE i 1GbE BMCModuł OCP 25 Gb/s plus 1GbE BMC
DPUBlueField-3 w dedykowanym slocieBrak
Procesory2 × Intel Xeon 6 (Granite Rapids / Sierra Forest), serie 6500 i 6700, gniazdo LGA 47102 × Intel Xeon Scalable 4. i 5. generacji, LGA 4677, limit 350 W
Pamięć32 gniazda DDR5 RDIMM / MRDIMM, 8 kanałów na procesor. 6400 MT/s przy 1DPC, 5200 przy 2DPC. Moduły 32, 64, 96 i 128 GB32 gniazda DDR5 RDIMM / RDIMM-3DS. 5600 MT/s przy 1DPC, 4400 przy 2DPC
Pamięć masowa8 wnęk 2,5″ wymienianych podczas pracy, do ośmiu nośników E1.S o wysokości 25 mm; wewnątrz 2 × M.2 NVMe Gen 5 x412 wnęk (8 × SATA-3 + 4 × NVMe), wewnątrz 1 × M.2 NVMe
Zasilanie4 × 3200 W CRPS, układ 3+1, 80 PLUS Titanium4 × 2700 W CRPS, układ 3+1, 80 PLUS Platinum
Chłodzenie10 wentylatorów 80 mm wymienianych podczas pracy, rozdzielonych na strefy: 5 na strefę kart i 5 na strefę płyty16 wentylatorów: 8 wewnętrznych i 8 z tyłu
TPMTPM 2.0 wlutowany, sprzętowy korzeń zaufania Microchip CEC1736Tylko złącze TPM, moduł jest opcją
Warunki pracy0–35 °C, wilgotność 8–90 %10–35 °C, wilgotność 8–80 %
ObudowaProdukcji ChenbroNie podano
Przeznaczenie wg producentaNVIDIA Omniverse Enterprise, duże bliźniaki cyfrowe, HPC, inferencja i dostrajanie modeli językowychUczenie transferowe, dostrajanie, trenowanie i inferencja modeli językowych, chmura AI, HPC
Co pokazuje porównanie wewnątrz jednego producenta

Różnica między maszynami leży nie w liczbie kart, lecz w łączności i klasie całego otoczenia. Wersja MGX daje osiem portów po 400 Gb/s wobec jednego na 25, dedykowany układ BlueField-3, procesory o pokolenie nowsze, pamięć o stopień szybszą, zasilacze wyższej klasy sprawności i o większej mocy oraz wlutowany moduł TPM zamiast opcjonalnego. A przy tym jest mniejsza: 4U wobec 6U i 858 mm głębokości wobec 900. Teza „sześć jednostek dla lepszego przepływu powietrza” wygląda w tym świetle słabiej: platforma MGX ma mniej wentylatorów, dziesięć wobec szesnastu, ale rozdzielono je na strefę kart i strefę płyty — przy dwukrotnie mniejszej objętości i mocniejszym zasilaniu świadczy to o lepiej przemyślanym, a nie hojniejszym układzie chłodzenia. Maszyna 6U pozostaje sensownym wyborem tam, gdzie potrzebny jest tańszy węzeł samodzielny, ale uzasadniać ją trzeba teraz ceną, a nie przewagą inżynierską.

Tabela 9 · Trzy filozofie dla tego samego kompletu ośmiu kart
KryteriumReferencja MGX 4U NVINNO3D 6U ProducentMasowe 2U Producent
Liczba kart882–4
Gęstość w szafieWysokaNiskaŚrednia
Sieć między węzłamiConnectX-8, do 800 Gb/s, BlueField-3OCP 25 Gb/sZależnie od konfiguracji
Topologia PCIePrzełączana struktura Gen 6 wewnątrz SuperNICPodłączenie bezpośrednie, karty 4+4 między gniazdamiPodłączenie bezpośrednie
Postać dostawyZwykle system gotowyBareboneSystem gotowy ze wsparciem producenta
PrzeznaczenieElement składowy klastraSamowystarczalny węzeł: inferencja, rendering, wirtualne stacje roboczePierwszy krok w obliczenia akcelerowane
Łatwość serwisowaniaCiasny montażModułowa, zapas objętości, wentylatory wymieniane podczas pracyStandardowa obsługa stelażowa

Sformułowanie do oferty: konfigurację według referencji MGX kupuje się wtedy, gdy klient planuje rozrosnąć się do klastra. Platformę 6U kupuje się wtedy, gdy potrzeba dużo mocy obliczeniowej w jednej maszynie, a różnica w cenie platformy idzie na karty. Jeśli w perspektywie dwóch lat pojawi się drugi serwer i obciążenie rozproszone, brak szybkiej sieci okaże się ślepą uliczką.

Tabela 10 · Platformy warte poznania i porównania
ProducentModelFormatKartyCecha wyróżniająca wg producenta
INNO3DAGS-4UMGX-R14U MGX8ConnectX-8 SuperNIC z 8 portami po 400 Gb/s, BlueField-3 w osobnym slocie, Xeon 6, 4 × 3200 W Titanium, wlutowany TPM 2.0
INNO3DAGS-6220V26U8Barebone, podłączenie bezpośrednie bez przełącznika, OCP 25 Gb/s, 4 × 2700 W Platinum, 16 wentylatorów
LenovoThinkSystem SR650a V42U4Kartę można ograniczyć mocowo do 450 W, żeby zmieścić cztery sztuki w obudowie
SupermicroSYS-522GA-NRT, SYS-422GL-NR4U / 5U8Jako jedni z pierwszych wdrożyli płytę MGX PCIe Switch z ConnectX-8
GigabyteXL44-SX2-AAS14U MGX8Dwa Xeony 6700/6500, 32 gniazda DDR5, zasilacze 3+1 po 3200 W Titanium, BlueField-3 i 4 × ConnectX-8
ZOTACZRS-MGX-R14U MGX8Xeon 6. generacji, 32 gniazda DIMM, 8 portów po 400 Gb/s na ConnectX-8, zasilacze 3+1 po 3200 W
ASUSESC8000A-E134U8Na platformie AMD EPYC
Szczegół praktyczny, który przesądza o transakcji

O ostatecznej konfiguracji decyduje budżet cieplny obudowy, a nie parametry karty. Dobrze widać to u Lenovo: kartę można ograniczyć mocowo do 450 W właśnie po to, by zmieścić w obudowie cztery sztuki. Dokładnie po to NVIDIA uczyniła pobór mocy regulowanym w zakresie 400–600 W. Zanim obiecacie klientowi osiem kart, policzcie moc doprowadzoną do szafy i zdolność serwerowni do odprowadzenia ciepła.

Jak potwierdzić zgodność dokumentem

NVIDIA udostępnia własne narzędzia: Qualified System Catalog — katalog systemów, które przeszły kwalifikację z konkretną kartą, z filtrem po modelu; program NVIDIA-Certified Systems; oraz AI Factory Validated Design jako wzorzec konfiguracji. Osobna obserwacja istotna przy zakupie: na liście partnerów systemowych na stronie RTX PRO Server figurują Cisco, Dell, HPE, Lenovo i Supermicro jako czołowi, a obok Advantech, ASRock Rack, ASUS, Compal, Eviden, Foxconn, GIGABYTE, Inventec, MiTAC, MSI, Pegatron, QCT, Wistron i Wiwynn. INNO3D na tej liście nie ma — mimo że firma ma platformę w formacie NVIDIA MGX z układami ConnectX-8 i BlueField-3, czyli pokrywającą się składem z konfiguracją referencyjną. Nieobecność na liście partnerów i posiadanie produktu MGX to fakty, które da się pogodzić: lista nie musi być wyczerpująca. Wniosek jednak się nie zmienia — potwierdzenie ma pochodzić z katalogu NVIDIA, a nie ze strony produktowej. Sprawdzajcie w Qualified System Catalog z filtrem po właściwej karcie i proście dystrybutora o pisemne potwierdzenie statusu.

Warstwa 06 · Sprzedaż ProducentArgumenty za i przeciw modelowi AGS-6220V2

AGS-6220V2: czym przekonywać i o co nie warto się spierać

Ta warstwa powstała z myślą o rozmowie z klientem. Przy każdym argumencie podana jest granica, poza którą przestaje on działać: inżynier po stronie klienta i tak ją odnajdzie, a wskazanie jej jako pierwszy zamienia spotkanie z audytu we wspólny dobór rozwiązania.

Osiem filarowych argumentów

Argument 01 · Cena

Najtańsza droga do ośmiu kart

121 700 USD wobec 158 210 USD za platformę MGX — oszczędność 36 510 USD, blisko jednej czwartej budżetu. Obie platformy są dostarczane jako barebone, więc ceny da się porównywać wprost. Te pieniądze trafią na procesory, pamięć i dyski, a nie na obudowę.
Granica: oszczędność znika, jeśli klient potrzebuje sieci 400 Gb/s — zewnętrzne karty sieciowe i przełącznik pochłoną całą różnicę.

Argument 02 · Zakupy

Barebone jako swoboda

Procesory, pamięć i dyski NVMe klient kupuje na własnych umowach i we własnych cenach. Przy obecnym niedoborze DDR5 to realna dźwignia: może wykorzystać pamięć z posiadanych zapasów.
Granica: wobec serwerów gotowych argument działa, wobec platform MGX już nie — one także są barebone. Nie przedstawiajcie tego jako przewagi nad AGS-4UMGX-R1.

Argument 03 · Procesory

Dwa pokolenia Xeonów do wyboru

Gniazdo LGA 4677 przyjmuje zarówno 4., jak i 5. generację Xeon Scalable. Klient może sięgnąć po posiadany park albo po tańsze modele. Platformy MGX na LGA 4710 takiej możliwości nie dają.
Granica: limit 350 W na gniazdo odcina część mocniejszych procesorów.

Argument 04 · Dyski

Dwanaście wnęk zamiast ośmiu

8 × SATA plus 4 × NVMe. Do archiwów multimedialnych, danych ciepłych i zbiorów, które nie wymagają szybkości NVMe, dyski SATA są kilkakrotnie tańsze w przeliczeniu na terabajt.
Granica: na szybki zbiór roboczy zostają tylko cztery wnęki.

Argument 05 · Eksploatacja

Łatwość serwisowania i zapas miejsca

16 wentylatorów wymienianych podczas pracy, budowa modułowa, swobodny dostęp do wnętrza. Niższe wymagania wobec kwalifikacji serwisanta i krótsze przestoje przy wymianie podzespołów.
Granica: w kolokacji rozliczanej za jednostkę wysokości 6U kosztuje o połowę więcej niż 4U.

Argument 06 · Topologia

Podłączenie wprost do procesorów

Każda karta dostaje pełne x16, o jeden przeskok bliżej pamięci systemowej, prostszy stos oprogramowania układowego i mniej punktów awarii. Przy ośmiu niezależnych strumieniach inferencji przełącznik nie wnosi nic.
Granica: karty dzielą się 4+4 między gniazda, a wymiana między połówkami idzie przez magistralę międzyprocesorową.

Argument 07 · Zasilanie

Blisko jednej czwartej zapasu

8100 W mocy użytecznej w układzie 3+1 przy wyliczonym poborze rzędu 6,5 kW. Jest miejsce na mocniejsze procesory, więcej dysków i przyszłe karty.
Granica: potrzebne jest zasilanie 200–240 V ze złączami C19/C20 — w starszych szafach to osobny temat.

Argument 08 · Pieniądze

Zwrot w pół roku

Wobec AWS w cenniku na żądanie i przy pracy ciągłej maszyna zwraca się w 6,2 miesiąca, a opłaca się bardziej od wynajmu już od 21,7 % wykorzystania. To najmocniejszy argument liczbowy, jakim dysponujecie — patrz warstwa 08.
Granica: poniżej mniej więcej jednej piątej czasu uczciwiej jest doradzić chmurę.

Zadania, do których maszynę można sprzedawać z przekonaniem

Tabela 11 · Pasujące zastosowania i czym je poprzeć
ZadanieDlaczego pasujeNa co się powołać
Inferencja modeli językowych mniej więcej do 70 miliardów parametrów96 GB i 1597 GB/s na kartę, natywny FP4AWS i Microsoft niezależnie od siebie wskazują ten próg jako granicę dla pojedynczej karty
Wiele niezależnych modeli i wielodostępMIG do czterech odizolowanych instancji na kartęDo 32 odizolowanych instancji na system, z gwarantowaną jakością obsługi — podstawa rozliczeń
Usługi agentowe i RAGPojemność pamięci pod długi kontekst i pamięć podręczną KVMicrosoft wprost wymienia RAG na modelach do 70B jako docelowe zastosowanie tej karty
Dostrajanie istniejących modeliWystarczająca pamięć oraz FP8/BF16NVIDIA wprost wymienia fine-tuning wśród zastosowań wersji serwerowej — to nie jest naciągane
Wirtualne stacje robocze i VDIvGPU nałożone na MIG, podział czasu między zadania AI a grafikęKarta katalogowa wymienia VMware ESXi 8.0U1 i Citrix Hypervisor 8.2 — platformę zaprojektowano również pod ten scenariusz
Rendering, Omniverse, OpenUSD, bliźniaki cyfrowe188 rdzeni RT 4. generacji, szczyt 355 TFLOPSDokładnie to, czego nie mają akceleratory czysto obliczeniowe: konkurent na serii H tego zastosowania nie zamknie
Analiza wideo, transkodowanie, streamingCztery układy NVENC i cztery NVDEC na kartę32 układy kodujące i 32 dekodujące na system; obsługa 4:2:2 w H.264 i HEVC
Wyszukiwanie wektorowe, analityka, data sciencePrzyspieszenie przez cuVS i stos CUDA-XNVIDIA deklaruje do 50 razy wyższą wydajność od systemu procesorowego przy budowie indeksów
Obliczenia naukowe i symulacje w FP32120 TFLOPS FP32 na kartęJeden węzeł zamyka to, co wcześniej wymagało niewielkiego klastra
Lokalna sztuczna inteligencja w branżach regulowanychDane i modele nie opuszczają infrastruktury klientaPorównanie z chmurą w warstwie 08 pokazuje, że przy stałym obciążeniu wychodzi to również taniej

Zadania, do których tej maszyny sprzedawać nie należy

Poniższa lista jest cenniejsza od poprzedniej. System sprzedany do niewłaściwego zadania wraca razem z reputacją, a ograniczenie wskazane w porę niemal zawsze zamienia się w inną pozycję z waszego własnego portfolio.

Tabela 12 · Niepasujące zastosowania, przyczyny i dokąd przekierować
ZadanieDlaczego nie pasujeCo zaproponować zamiast
Trenowanie dużych modeli od zeraKarty nie mają NVLink, a pamięć nie łączy się we wspólną pulę. Trenowanie wykracza poza zastosowania deklarowane przez NVIDIA dla obu kart RTX PROPlatformy z NVLink na serii H lub B albo wynajem mocy na czas trenowania
Rozproszone trenowanie i inferencja na wielu węzłachSieć to jeden moduł OCP 25 Gb/s. Do wymiany między węzłami brakuje rzędu wielkościINNO3D AGS-4UMGX-R1: osiem portów po 400 Gb/s na ConnectX-8 plus BlueField-3
Równoległość tensorowa na wszystkich ośmiu kartach przy ostrym SLA128 linii na dwa gniazda oznacza podział kart 4+4, a wymiana między połówkami idzie przez magistralę międzyprocesorowąAGS-4UMGX-R1 z przełączaną strukturą PCIe Gen 6 wewnątrz SuperNIC
Dostęp do pamięci masowej przez GPUDirect Storage i RDMA po sieciBrak DPU: nie ma czym odciążyć sieci i dostępu do danychAGS-4UMGX-R1 z układem BlueField-3 w dedykowanym slocie
Gęste rozmieszczenie w kolokacji rozliczanej za jednostkę6U na osiem kart wobec 4U w MGX — o 50 % wyższa opłata za miejsce przy tej samej mocy obliczeniowejAGS-4UMGX-R1 albo konfiguracja MGX 2U na ośmiu kartach RTX PRO 4500 SE
Przetarg z obowiązkowym TPM 2.0Na płycie jest wyłącznie złącze z interfejsem SPI, sam moduł stanowi opcjęDomówić moduł albo zaproponować AGS-4UMGX-R1, gdzie TPM 2.0 jest wlutowany wraz z korzeniem zaufania Microchip CEC1736
Potoki przetwarzania z dużymi zbiorami na szybkich dyskachTylko cztery wnęki NVMe z dwunastu; wewnętrzny slot M.2 jest jedenAGS-4UMGX-R1 z ośmioma nośnikami E1.S albo pamięć masowa zewnętrzna
Wymóg obliczeń poufnychNVIDIA wskazuje obsługę w parametrach RTX PRO 4500 SE; dla 6000 SE takiego wiersza nie maKonfiguracja MGX 2U na kartach RTX PRO 4500 SE — tam jest to zadeklarowane oficjalnie
Ciężkie wstępne przetwarzanie danych na procesorachXeony 4. i 5. generacji z limitem 350 W, pamięć 5600 MT/s przy 1DPCAGS-4UMGX-R1 na Xeonach 6 z pamięcią 6400 MT/s
Instalacja na brzegu sieci przy niestabilnym klimacieZakres pracy 10–35 °C, wilgotność do 80 % bez kondensacjiWyspecjalizowane platformy brzegowe albo dostosowanie pomieszczenia
Szafa o głębokości poniżej 950 mmObudowa 900 mm wraz z prowadzeniem okablowania fizycznie się nie mieściAGS-4UMGX-R1 o głębokości 858 mm
Najważniejszy wniosek z tej tabeli

Spośród jedenastu niepasujących zastosowań siedem zamyka inna maszyna z waszego własnego portfolio. Właściwa reakcja na „potrzebujemy obciążenia rozproszonego” albo „nasza kolokacja rozlicza się za jednostkę” to nie obrona modelu 6220V2, tylko przejście do AGS-4UMGX-R1. Transakcja przy okazji rośnie: platforma MGX jest droższa o 30 %. Sprzedawać należy portfolio, a nie pojedynczą pozycję.

Obiekcje, które padną, i uczciwe odpowiedzi

Tabela 13 · Odpieranie obiekcji
ObiekcjaUczciwa odpowiedź
„Dlaczego nie karty dla graczy, przecież są tańsze”Chłodzenie pasywne dopasowane do przepływu powietrza w obudowie, ECC, MIG i vGPU, pobór mocy regulowany od 400 do 600 W pod budżet cieplny oraz certyfikacja całego systemu. Karta dla graczy jest tańsza przy zakupie i droższa w utrzymaniu: nie da się jej podzielić między użytkowników i nie wchodzi w skład wspieranej konfiguracji
„Konkurent mieści te same osiem kart w 4U, a wy potrzebujecie 6U”Przyznać wprost. Nasze atuty to tutaj cena, łatwość serwisowania i dwa razy więcej wnęk na dyski. Jeśli dla klienta ważniejsze są gęstość i sieć, zaproponować AGS-4UMGX-R1 — to również nasza maszyna
„INNO3D nie ma na liście partnerów systemowych NVIDIA”Przyznać. Lista na stronie produktowej nie jest wyczerpująca, a my mamy platformę w formacie MGX z układami ConnectX-8 i BlueField-3. Zaproponować sprawdzenie w NVIDIA Qualified System Catalog i poprosić dystrybutora o pisemne potwierdzenie statusu — to zamyka temat dokumentem, a nie słowem
„To barebone, a my potrzebujemy gotowego serwera”Wymienić brakujące pozycje od razu: dwa procesory, pamięć, nośniki. Zaproponować integrację i podać terminy. Przy okazji wyjaśnić, że przy niedoborze pamięci samodzielny zakup często wygrywa i ceną, i terminem
„Za drogo”Przenieść rozmowę z ceny na koszt posiadania. Wobec AWS w cenniku na żądanie zwrot następuje po 6,2 miesiąca przy pracy ciągłej, a przewaga zaczyna się już od 21,7 % wykorzystania. Zapytać, ile godzin na dobę karty będą realnie zajęte — to pytanie przesądza o transakcji mocniej niż rabat
„Weźmiemy w chmurze”Zgodzić się co do pilotażu i szczytów obciążenia — to uczciwe i buduje zaufanie. Następnie pokazać próg: powyżej mniej więcej jednej czwartej wykorzystania zakup wychodzi taniej. Optymalny układ to kupić pod obciążenie bazowe, a szczyty dobierać z chmury
„Musimy trenować własne modele”Doprecyzować: trenowanie od zera czy dostrajanie. Fine-tuning NVIDIA wymienia wprost wśród zastosowań wersji serwerowej i tu maszyna jest na miejscu. Trenowanie od zera to nie nasz scenariusz i lepiej powiedzieć to od razu
Cztery stwierdzenia, których należy unikać

Każde z nich da się sprawdzić w minutę i każde kosztuje wiarygodność całej pozostałej oferty. Nie mówcie „768 GB pod jeden model” — pamięć nie łączy się w pulę, to osiem kart niezależnych pamięciowo. Nie wspominajcie o NVLink — w parametrach obu kart figuruje wyłącznie PCI Express. Nie obiecujcie statusu NVIDIA-Certified przed sprawdzeniem konkretnej konfiguracji w katalogu. I nie przenoście przyrostów 50- i 100-krotnych na tę maszynę: uzyskano je na serwerze z ośmioma kartami RTX PRO 4500 SE w porównaniu z systemem procesorowym, a nie na 6000 SE i nie wobec innej karty graficznej.

Warstwa 07 · PraktykaOd potrzeby klienta do specyfikacji

Dobór konfiguracji

Najczęstszy błąd przy doborze to liczenie teraflopsów. Przy inferencji pierwsza jest pojemność pamięci karty: jeśli wagi modelu nie mieszczą się w niej w całości, system sięga do pamięci systemowej i wydajność załamuje się gwałtownie.

Tabela 14 · Zadanie → konfiguracja
Potrzeba klientaKartaPlatformaCo sprawdzić
Inferencja modeli językowych mniej więcej do 70 miliardów parametrów6000 SE2U na dwie kartyZarówno AWS, jak i Microsoft wskazują ten próg jako granicę dla jednej karty. Doprecyzować długość kontekstu i rozmiar pamięci podręcznej KV
Inferencja modeli większych6000 SE4U albo 6U na osiem kartRównoległość tensorowa; pamiętać o stratach na PCIe wynikających z braku NVLink
Wiele niewielkich modeli4500 SEMGX 2U na osiem kartLiczyć gęstością na slot i liczbą równoległych strumieni, a nie sumą TFLOPS
Analiza wideo, transkodowanie4500 SEMGX 2U, obudowy brzegoweTrzy układy NVENC i trzy NVDEC na kartę to parametr kluczowy, a nie liczba rdzeni CUDA
Przetwarzanie danych, wyszukiwanie wektorowe4500 SEMGX 2U na osiem kartNVIDIA deklaruje do 50 razy wyższą wydajność od procesorów przy budowie indeksów wektorowych
Wirtualne stacje roboczeObie2U albo 4ULicencje vGPU i liczba instancji MIG: cztery w karcie mocniejszej, dwie w słabszej
Rendering, Omniverse, symulacje6000 SEMGX 4U albo 6URdzenie RT są konieczne; szczyt RT w karcie mocniejszej jest dwukrotnie wyższy
Dostrajanie istniejących modeli6000 SE4U albo 6UFine-tuning wymieniony wprost przez NVIDIA wśród zastosowań wersji serwerowej
Pilotaż bez nakładów inwestycyjnych6000 SEAWS G7e, Azure NCv6, Google Cloud G4Patrz warstwa 08
Trenowanie dużych modeli od zeraPoza deklarowanymi zastosowaniami obu kart. Jako łącze wymieniono wyłącznie PCI Express, wiersza NVLink nie ma

Lista pytań przed przygotowaniem specyfikacji

  1. Jakie modele i w jakiej precyzji będą uruchamiane? Stąd wynika wymagana pamięć karty; próg około 70 miliardów parametrów w FP8 to granica dla jednej mocniejszej karty.
  2. Jaka długość kontekstu i ile jednoczesnych sesji? Stąd wynika rozmiar pamięci podręcznej KV, która często przesądza o wyborze.
  3. Trenowanie czy wyłącznie inferencja? Jeśli dostrajanie zajmuje niewielką część czasu, sprzęt dobiera się pod inferencję, a ciężkie zadania wynajmuje.
  4. Czy potrzebna jest grafika i ray tracing? Jeśli tak, w tym budżecie praktycznie nie ma alternatywy dla RTX PRO.
  5. Ilu jest niezależnych odbiorców? Cztery instancje MIG w 6000 SE wobec dwóch po 16 GB w 4500 SE.
  6. Ile kilowatów doprowadzono do szafy i jak odprowadzane jest ciepło? To ograniczenie tnie konfigurację częściej niż cokolwiek innego.
  7. Powietrze czy ciecz? W 6000 SE to dwa różne formaty: dwa sloty wobec jednego slotu FHXL.
  8. Czy planowany jest drugi serwer? Wtedy sieć wybiera się od razu: 25GbE wystarczy maszynie pojedynczej, a przy obciążeniu rozproszonym staje się ślepą uliczką.
  9. System gotowy czy barebone? Od tego zależy liczba pozycji w ofercie i terminy dostaw.
Warstwa 08 · Pieniądze DostawcyModele korzystania i sytuacja rynkowa

Ekonomia i rynek

Zacząć trzeba od zastrzeżenia: NVIDIA nie publikuje cen tych produktów. Wszelkie kwoty pojawiające się w recenzjach to szacunki osób trzecich i w tym kompendium ich nie ma. Cenę uzyskuje się od partnera albo przez NVIDIA Marketplace. Porównywalną ekonomię można natomiast zbudować na dokumentacji dostawców chmurowych.

Tabela 15 · Oferty chmurowe z kartą RTX PRO 6000 SE
PlatformaKonfiguracjaCechy szczególne
AWS EC2 G7eDo 8 kart, łącznie do 768 GB pamięci kart, procesory Intel Emerald Rapids, do 192 wątków wirtualnych, do 2048 GiB pamięci systemowej, do 15,2 TB lokalnego NVMe, do 1600 Gb/s sieci przez EFADo 2,3 razy wyższa wydajność inferencji niż w G6e. GPUDirect P2P między kartami przez PCIe, GPUDirect RDMA po EFA, GPUDirect Storage z FSx for Lustre. Według AWS jedna karta obsługuje model o 70 miliardach parametrów w FP8
Azure NC RTX PRO 6000 BSE v6Host na Intel Granite Rapids z taktowaniem wszystkich rdzeni do 4,2 GHz; konfiguracje ułamkowe i pełne oparte na MIGKarty udostępniane są przez SR-IOV, co ogranicza zbieranie części telemetrii. Obsługa AKS. Docelowe zastosowania: bliźniaki cyfrowe i Omniverse, inferencja oraz RAG do 70 miliardów parametrów, rendering, VDI na RTX Virtual Workstation, wizualizacja naukowa w FP32
Google Cloud G4Maszyny wirtualne z ułamkiem karty, profile vGPU po 12, 24, 48 i 96 GBWedług bloga technicznego NVIDIA profile pomyślano pod zastosowania od streamingu po wierny rendering 3D i symulację czujników w robotyce

Trzy modele korzystania, między którymi wybiera klient

Model 01

Zakup serwera

Uzasadniony przy stałym obciążeniu 24/7, wymaganiach co do miejsca przechowywania danych i przewidywalnym okresie eksploatacji. Daje kontrolę nad danymi i stały koszt.

Model 02

Wynajem serwera dedykowanego

Kompromis: brak nakładów inwestycyjnych, ale konfiguracja jest z góry ustalona. Profile MIG pozwalają dostawcy sprzedawać ułamki karty, a klientowi brać dokładnie tyle pamięci, ile potrzebuje.

Model 03

Chmura publiczna

Kartę oferuje trzech dostawców hiperskalowych. Sprawdza się przy szczytach, testach i pilotażu przed zakupem; przy stałym obciążeniu wychodzi zwykle drożej niż własny sprzęt.

Argument

Co wchodzi do kosztu posiadania

Cena kart, licencje AI Enterprise i vGPU, energia elektryczna i chłodzenie (osiem mocniejszych kart to do 4,8 kW na samych kartach wobec 1,3 kW dla ośmiu słabszych), miejsce w szafie, wsparcie producenta, koszt przestoju. Gęstość na slot często przechyla rachunek na korzyść 4500 SE tam, gdzie 6000 SE wygrywa wydajnością szczytową.

Producent Dostawca Rachunek na konkretnych liczbach

Poniższy model opiera się na rzeczywistej cenie platformy i na weryfikowalnych stawkach. Wszystkie założenia wypisano w tabeli — zmieniając je, otrzymujecie własną odpowiedź, a nie cudzą.

Tabela 16 · Co wchodzi w skład dostawy każdej platformy
PozycjaAGS-6220V2 · 6UAGS-4UMGX-R1 · MGX
ProcesoryBrakBrak, figurują jako opcja konfiguracji
PamięćBrakBrak, figuruje jako opcja konfiguracji
NośnikiBrakBrak; wewnętrzny i przednie figurują jako opcje
Zasilacze4 fabrycznie zamontowane4 fabrycznie zamontowane
Wentylatory1610 fabrycznie zamontowanych
Radiatory i ramki procesorów2 radiatory z mocowaniem2 radiatory i 4 ramki
Szyny do szafySą, w kształcie litery L
Moduł sieciowy25 Gb/s OCP fabrycznie zamontowanyConnectX-8 figuruje w parametrach; w opisie zestawu brak osobnej pozycji — do potwierdzenia
DPUBrakBlueField-3 figuruje w parametrach; w opisie zestawu brak osobnej pozycji — do potwierdzenia
Klucz RAIDIntel VROC fabrycznie zamontowanyNie podano
Kable zasilające4 × C19–C20Nie podano

Rzecz, która zamyka częste pytanie: obie platformy są barebone. Pamięć i nośniki i tak trzeba dokupić w obu przypadkach, więc porównanie 121 700 USD z 158 210 USD jest uprawnione — obie kwoty stoją na tej samej podstawie. Drobne pozycje przemawiają przy tym za 6U: moduł sieciowy, klucz VROC i kable zasilające są już w pudełku.

Tabela 17 · Dane wejściowe i założenia
ParametrWartośćPochodzenie
Platforma 6U z 8 × RTX PRO 6000 SE, barebone121 700 USDOferta handlowa. Konkurencyjne modele 6U przyjęto po tej samej cenie
Platforma MGX 4U z 8 kartami, barebone158 210 USDPrzyjęto +30 % wobec ceny 6U. Również bez procesorów, pamięci i nośników — patrz tabela 16
Uzupełnienie 6U: 2 × Xeon 4. lub 5. gen., 1 TB DDR5, NVMe≈ 20 000 USDSzacunek. Do potwierdzenia u dostawcy
Uzupełnienie MGX 4U: 2 × Xeon 6, 1 TB DDR5 lub MRDIMM, E1.S≈ 25 000 USDSzacunek. Drożej z trzech powodów: procesory pod LGA 4710, pamięć 6400 MT/s i nośniki E1.S klasy centrum danych
Jeśli klient potrzebuje pojemności na dane chłodneróżnica rośnie6U ma osiem wnęk SATA — najtańsze terabajty. MGX przyjmuje wyłącznie E1.S. Przy wymaganiu rzędu dziesiątek terabajtów różnica w uzupełnieniu łatwo się podwaja
Pobór mocy systemu6,0 kW8 × 600 W na kartach + 2 × 350 W na procesorach + 0,5 kW na pamięć, dyski i wentylatory
Sprawność zasilaczy94 % / 96 %80 PLUS Platinum w 6U, Titanium w MGX 4U — według kart katalogowych
PUE serwerowni1,4Założenie. Nowoczesne centrum danych osiąga niekiedy mniej
Energia elektryczna0,20 USD / kWhZałożenie. Wrażliwość pokazano poniżej
AWS g7e.48xlarge, 8 kart, na żądanie33,14 USD / godz.Region us-east-1. Zgodne u czterech niezależnych serwisów śledzących ceny AWS; sprawdzajcie w kalkulatorze AWS
AWS g7e.48xlarge, spotod 12,78 USD / godz.Cena minimalna, zależna od strefy dostępności i ryzyka przerwania
Horyzont rachunku3 lataZałożenie
Nie uwzględnionoLicencji NVIDIA AI Enterprise i vGPU, rozszerzonego wsparcia producenta, miejsca w szafie lub kolokacji, przełączników i optyki poza serwerem, pracy ludzi oraz transferu. AWS osobno nalicza opłatę za ruch wychodzący
Tabela 18 · Koszt posiadania przez trzy lata
Pozycja6U (INNO3D i konkurenci)MGX 4UAWS na żądanieAWS spot
Nakłady inwestycyjne141 700 USD183 210 USD
Energia elektryczna rocznie15 656 USD15 330 USDw ceniew cenie
Razem przez 3 lata przy obciążeniu 24/7188 669 USD229 200 USD871 032 USD335 803 USD
Koszt godziny karty przy 100 % wykorzystania0,90 USD1,09 USD4,14 USD1,60 USD
Koszt godziny karty przy 50 % wykorzystania1,79 USD2,18 USD4,14 USD1,60 USD
Zwrot wobec ceny na żądanie przy obciążeniu 24/76,2 miesiąca8,0 miesięcy

Kluczowa asymetria: przy własnym sprzęcie koszty są niemal w całości stałe, a w chmurze niemal w całości zmienne. Chmura nie jest więc droższa „w ogóle” — jest droższa przy wysokim wykorzystaniu. Wiersz z kosztem godziny przy 50 % dobrze to pokazuje: własnej maszynie stawka się podwaja, a chmurze nie drgnie.

Tabela 19 · Progi, powyżej których zakup bije wynajem
Wariant6UMGX 4U
Próg wykorzystania wobec ceny na żądanie21,7 %26,3 %
Próg wykorzystania wobec ceny spot56,2 %68,3 %
W godzinach przez 3 lata, wobec ceny na żądanie5 692 z 26 2806 915 z 26 280
Przy energii 0,10 USD / kWhpróg 19,0 %
Przy energii 0,30 USD / kWhpróg 24,4 %

Dwa ostatnie wiersze pokazują, że cena energii waży na wyniku wyraźnie mniej niż wykorzystanie: potrojenie stawki przesuwa próg zaledwie o pięć punktów procentowych. Pierwsze pytanie do klienta brzmi więc nie „ile płacicie za kilowatogodzinę”, tylko „ile godzin na dobę karty będą realnie zajęte”.

Trzy wnioski, które można zabrać na negocjacje

Po pierwsze. Jeśli karty pracują dłużej niż jedną czwartą czasu, zakup wychodzi taniej niż wynajem na żądanie, a przy pracy ciągłej maszyna zwraca się mniej więcej w pół roku. Wobec cen spot próg jest wyraźnie wyższy — około 56 % — ale spot nie daje gwarancji dostępności i nie nadaje się pod produkcję. Po drugie. Chmura wygrywa w trzech sytuacjach: pilotaż przed zakupem, szczyty obciążenia nakładane na własny park oraz projekty krótsze niż rok. Rozsądny układ to kupić pod obciążenie bazowe i dobierać szczyty z chmury. Po trzecie. Różnica progu między 6U a MGX 4U wynosi mniej niż pięć punktów procentowych. Jeśli klient i tak mieści się w progu wykorzystania, o wyborze platformy decydują nie pieniądze, lecz to, czy potrzebna mu jest sieć pozwalająca urosnąć do klastra.

Rozbiór premii 30 %: co się w niej mieści, a czego nie

Przydatny rachunek do rozmowy, ale trzeba go prowadzić uważnie. Osiem kart w cenie z marketplace'u NVIDIA to 106 000 USD. Wynika stąd, że na samą obudowę 6U przypada około 15 700 USD, a na MGX 4U około 52 210 USD. Premia wynosi 36 510 USD.

Co się w niej mieści. Obudowa w formacie MGX 4U, płyta główna pod Xeon 6 na gnieździe LGA 4710 z pamięcią do 6400 MT/s, zasilacze klasy Titanium o mocy 3200 W zamiast Platinum o mocy 2700 W, osiem portów po 400 Gb/s na ConnectX-8 oraz dedykowany BlueField-3. W przeliczeniu na port wychodzi około 4560 USD za każde 400 Gb/s — i to zanim klient kupi przełącznik.

Czego się w niej nie mieści — ważna korekta. Same procesory Xeon 6 nie są objęte premią: nie ma ich w żadnej z dwóch dostaw. Premia obejmuje płytę przyjmującą Xeon 6, a procesory kupuje się osobno i w wersji MGX wypadną drożej niż Xeony 4. lub 5. generacji w modelu 6220V2. To dochodzi do różnicy, a nie wchodzi w jej skład.

Co koniecznie potwierdzić pisemnie. W opisie zawartości AGS-4UMGX-R1 ani ConnectX-8, ani BlueField-3 nie są wymienione osobną pozycją: oba figurują wyłącznie w parametrach, z adnotacją „Configured with”. Czyta się to jako „wchodzi w skład skonfigurowanego systemu”, ale przy różnicy 36 510 USD trzeba to uzyskać od dostawcy na piśmie. Pytanie wprost: czy płyta ConnectX-8 SuperNIC oraz moduł BlueField-3 mieszczą się w cenie AGS-4UMGX-R1, czy są rozliczane osobno? Jeśli osobno, cały powyższy rachunek się rozsypuje i porównanie trzeba zbudować od nowa.

Czego premia na pewno nie zwraca. Sprawności energetycznej: przejście z Platinum na Titanium oszczędza 326 USD rocznie, czyli około 980 USD przez trzy lata — 2,7 % premii. Titanium należy sprzedawać jako zapas cieplny i niezawodność, a nie jako oszczędność na rachunkach.

Najmocniejszy argument handlowy tego pokolenia

Według NVIDIA model Llama Nemotron Super w formacie NVFP4 na jednej karcie RTX PRO 6000 daje do trzykrotnie lepszy stosunek ceny do wydajności niż FP8 na H100. To odwrócenie utartej logiki: tańsza karta uniwersalna okazuje się korzystniejsza od flagowego akceleratora przy inferencji — pod warunkiem że model mieści się w pamięci. Pośrednio potwierdza to również rynek: AWS niezależnie zmierzył do 2,3 razy wyższą wydajność inferencji na instancjach G7e niż w poprzedniej generacji opartej na L40S.

DodatekŹródła według pochodzenia i słowniczek

Dokąd sięgnąć dalej

NVIDIA Źródło wszystkich danych o kartach i technologiach

Producenci Źródło wszystkich danych o serwerach

Dostawcy Źródło danych o chmurze

Lektura uzupełniająca nie jest źródłem liczb

Poniższe materiały przydają się przy pierwszym zapoznaniu z tematem, ale liczby w nich należy weryfikować wobec źródeł pierwotnych wymienionych wyżej — to właśnie rozbieżności w takich publikacjach zmusiły do przebudowy tego kompendium.

Słowniczek

Tabela 20 · Pojęcia
PojęcieRozwinięcieZnaczenie
MIGMulti-Instance GPUSprzętowy podział karty na odizolowane układy z gwarantowaną jakością obsługi
vGPUVirtual GPUWirtualizacja karty na potrzeby VDI; stosuje się licencje vWS i vPC
MGXNVIDIA MGXModułowy projekt referencyjny platformy serwerowej
SuperNICConnectX-8 SuperNICKarta sieciowa z 48-liniowym przełącznikiem PCIe Gen 6
DPUData Processing UnitBlueField-3: przejmuje z procesora obsługę sieci, dostępu do danych i ochrony
GPUDirect P2PPeer to PeerBezpośrednia wymiana między kartami po PCIe, z pominięciem pamięci systemowej
SR-IOVSingle Root I/O VirtualizationSposób udostępniania urządzenia maszynom wirtualnym; stosowany w Azure NCv6
FP4 / NVFP4Format czterobitowyFormat obliczeń zagęszczający wagi czterokrotnie względem FP16
NVENC / NVDECEncoder / DecoderSprzętowe układy kodowania i dekodowania wideo
Pamięć podręczna KVKey-Value cachePamięć na kontekst rozmowy; często przesądza o rzeczywistym zużyciu pamięci karty
FHFL / FHXLFull Height Full Length / Extra LengthKarta pełnowymiarowa i jej wydłużony wariant do wersji chłodzonej cieczą
BarebonePlatforma bez procesorów, pamięci i nośników
HeadlessPraca bez podłączonego monitora