
Nu grote taalmodellen (LLM's) een fundamenteel onderdeel van moderne toepassingen worden, is de juiste server voor deployment belangrijker dan ooit. Dat geldt voor ondernemingen die inferentie opschalen, start-ups die kosten optimaliseren en onderzoekers die de grenzen van throughput verleggen. In dit artikel vergelijken we twee bekende serveropstellingen met twee minder voor de hand liggende configuraties die normaal niet als datacenterserver worden gebruikt. Elk systeem gebruikt andere GPU- of acceleratorhardware met vLLM.
We vergelijken:
- AMD MI300X
- NVIDIA H200
- Tenstorrent n300s
- AMD RX 7900 XTX
Hoewel het vergelijken van de RX 7900 XTX met GPU's uit datacenterklasse misschien oneerlijk lijkt, is het belangrijk om de veelzijdigheid ervan te erkennen. Als multifunctionele GPU voor zowel high-end gaming als AI-ontwikkeling biedt hij een praktisch voordeel: u kunt hetzelfde systeem gebruiken voor ontwikkeling en vrije tijd. Dat maakt hem aantrekkelijk voor individuele ontwikkelaars, kleine teams of datacenters die op basis van de vraag dynamisch willen schakelen tussen gaming en AI-workloads.
Dat gezegd hebbende, als we eerlijk zijn, nemen we de RX 7900 XTX vooral op omdat we deze al beschikbaar hebben en we benieuwd waren hoe deze zich verhoudt tot speciale datacenterhardware.
Het andere buitenbeentje is het Tenstorrent-systeem. Het toont veel potentieel en trok ongeveer drie jaar geleden al onze aandacht. We wilden het graag vergelijken met zijn veel grotere concurrenten en zo wat variatie brengen in een markt die momenteel door twee grote AI-spelers wordt gedomineerd (sorry, Intel).
GPU-specificaties (vanaf Q2 2025)
| Versneller | Architectuur | VRAM | Geheugentype | TDP | Geschatte prijs (USD) |
|---|---|---|---|---|---|
| AMD MI300X | CDNA3 | 192 GB | HBM3 | 750W | ~ $ 15.000 |
| NVIDIA H200 | Hopper | 141 GB | HBM3e | 700W | ~ $ 30.000 |
| AMD RX7900XTX | RDNA3 | 24 GB | GDDR6 | 355W | ~ $ 1.000 |
| Tenstorrent n300s | Aangepaste RISC-V | 24 GB | GDDR6 | 300W | ~$1.399 |
Opmerking: deze waarden zijn representatieve specificaties voor elke GPU of accelerator. De werkelijke prestaties kunnen variëren naargelang de systeemintegratie en de kenmerken van de workload, zoals CPU, moederbord en koeling. De GPU of accelerator is hier de belangrijkste onderscheidende factor.
Vermogensmeetmethode
Deze vergelijking was een uitdaging omdat de nauwkeurige kosten per GPU per miljoen tokens voor MI300X en H200 moeilijk te schatten zijn, omdat de prijzen van individuele GPU's niet openbaar beschikbaar zijn. Daarom hebben we de kosten per miljoen tokens berekend op basis van de volledige systeemprijs en het geschatte energieverbruik. Deze aanpak is logischer, omdat bij echte implementaties de kosten op systeemniveau (stroom, hardware, infrastructuur) bijdragen aan de operationele kosten die verder gaan dan alleen de GPU. Om rekening te houden met het volledige systeem, hebben we de gemeten tokendoorvoer en het energieverbruik van één GPU vermenigvuldigd met het aantal GPU's in de server en dat vervolgens opgeteld bij het totale energieverbruik van het systeem, waardoor de systeemkosten en het vermogen effectief over alle GPU's werden verdeeld onder de veronderstelling van volledig gebruik. Houd er rekening mee dat deze waarden alleen het inactieve of geschatte energieverbruik vertegenwoordigen en geen rekening houden met extra componenten of een groter verbruik bij volledig systeemgebruik.
Het energieverbruik van het H200-systeem in rust werd niet rechtstreeks gemeten. We gebruikten een schatting uit een artikel dat aangeeft dat het systeem in rust doorgaans ongeveer 2.200 W verbruikt. Meer details vindt u in het artikel van ServeTheHome.
Het energieverbruik bij inactiviteit van het RX 7900-systeem kon niet rechtstreeks worden gemeten en werd in plaats daarvan geschat op ongeveer 400 W.
De stroomverbruikwaarden voor andere systemen zijn gemeten met behulp van de ipmitool-tool.
Serverconfiguraties en prijzen
| Server | CPU | RAM | Opslag | Koeling | # GPU's | Inactief systeemvermogen (geschat) | Systeemprijs (USD) |
|---|---|---|---|---|---|---|---|
| A+ Server 8125GS-TNMR2 | 2x EPYC 9654 | 1536 GB | 4TB NVMe | Lucht | 8 | ~2400W | ~$260.564 |
| SuperServer 821GE-TNHR | 2x Intel Xeon Platina 8468H | 1536 GB | 4TB NVMe | Lucht | 8 | ~2200W | ~$307.336 |
| DIY AMD-werkstation | Ryzen9 7950X | 64 GB | 2TB NVMe | Lucht | 2 | ~400W | ~$3.500 |
| Tenstorrent Loudbox | 2x Intel® Xeon® Silver 4309Y | 512 GB | 4TB NVMe | Passief | 4 | ~700W | $ 12.000 |
Opmerking: configuraties zijn representatief. Real-world builds kunnen variëren, afhankelijk van componenten, leveranciers en integratiekosten. De prijzen hier vindt u via www.thinkmate.com
Benchmark-instellingen
Opmerking: alle benchmarks zijn uitgevoerd met een enkele GPU of acceleratorkaart per systeem om een eerlijke vergelijking tussen verschillende hardwareklassen te garanderen.
- Framework: vLLM (paged attention + continuous batching)
- Model: meta-llama/Meta-Llama-3-8B-Instruct
- Workload: Gelijktijdige prompts, batchgrootte 32, vaste outputlengte van 256 tokens
- Dataset: ShareGPT
- Statistieken: Tokens/sec (doorvoer) en kosten-prestaties
vLLM Benchmarkresultaten (alleen batchgrootte 32)
| Server | # GPU's | Tokens/sec per GPU | Systeemtokens/sec |
|---|---|---|---|
| AMD MI300X | 8 | 7003.10 | 56.024,8 |
| NVIDIA H200 | 8 | 8192.08 | 65.536,64 |
| AMD RX 7900XTX(*) | 2 | 1113,59 | 2227.18 |
| Tenstorrent Loudbox | 4 | 1314.0 | 5256.0 |
Opmerking: we hebben fouten met onvoldoende geheugen (OOM) aangetroffen toen de modelcontextlengte 131072 was met de AMD RX 7900 XTX. Deze is verlaagd naar 22048, wat een aanzienlijke verandering is.
Kosten per miljoen tokensOpmerking: Voor de eenvoud van de vergelijking gebruiken we een levensduur van 3 jaar (26280 uur). De stroomkosten worden berekend met een tarief van $ 0,10 per kWh.
Hieronder ziet u de berekening van de kosten per 1 miljoen tokens:
Uitgaande van een afschrijving van 3 jaar en volledig systeem- en GPU-gebruik
AMD MI300X-server:
Uitgaande van een inactief energieverbruik van 2400 W en 8 GPU's die volledig worden benut bij 750 W, zou het totaal 8,4 kW zijn
- Systeemtokens/sec: 7003,10 tokens/sec/GPU * 8 GPU's = 56.024,8 tokens/sec
- Tokens per uur: 56.024,8 tokens/sec * 3600 sec/uur = 201.689.280 tokens/uur
- Kosten per uur: $260.564 / 26280 uur + 8,4 kW * $0,10/kWh = $10,76
- Kosten per 1 miljoen tokens: $10,76 / (201.689.280 / 1.000.000) = $0,053 per 1 miljoen tokens
AMD MI300X Server + Paiton:
- Systeemtokens/sec: 7637,12 tokens/sec/GPU * 8 GPU's = 61.096,96 tokens/sec
- Tokens per uur: 61.096,96 tokens/sec * 3600 sec/uur = 219.949.056 tokens/uur
- Kosten per uur: $260.564 / 26280 uur + 8,4 kW * $0,10/kWh = $10,76
- Kosten per 1 miljoen tokens: $10,76 / (219.949.056 / 1.000.000) = $0,049 per 1 miljoen tokens
Nvidia H200-server:
- Systeemtokens/sec: 8192,08 tokens/sec/GPU * 8 GPU's = 65.536,64 tokens/sec
- Tokens per uur: 65.536,64 tokens/sec * 3600 sec/uur = 235.931.904 tokens/uur
- Kosten per uur: $307.336 / 26280 uur + 7,8 kW * $0,10/kWh = $12,48
- Kosten per 1 miljoen tokens: $12,48 / (235.931.904 / 1.000.000) = $0,053 per 1 miljoen tokens
AMD RX 7900 XTX-werkstation:
- Systeemtokens/sec: 1113,59 tokens/sec/GPU * 2 GPU's = 2227,18 tokens/sec
- Tokens per uur: 2227,18 tokens/sec * 3600 sec/uur = 8.018.153 tokens/uur
- Kosten per uur: $3.500 / 26280 uur + 1,054 kW * $0,10/kWh = $0,24
- Kosten per 1 miljoen tokens: $0,24 / (8.018.153 / 1.000.000) = $0,030 per 1 miljoen tokens met een contextlengte van 22048
Tenstorrent Loudbox:
- Systeemtokens/sec: 1314 tokens/sec/kaart * 4 kaarten = 5256 tokens/sec
- Tokens per uur: 5256 tokens/sec * 3600 sec/uur = 18.921.600 tokens/uur
- Kosten per uur: $12.000 / 26280 uur + 1,9 kW * $0,10/kWh = $0,65
- Kosten per 1 miljoen tokens: $ 0,65 / (18.921.600 / 1.000.000) = $ 0,034 per 1 miljoen tokens
| Server | Kosten per 1 miljoen tokens |
|---|---|
| AMD MI300X | $ 0,053 |
| AMD MI300X + Paiton | $ 0,049 |
| NVIDIA H200 | $ 0,053 |
| AMD RX7900XTX | $ 0,030 (lagere contextlengte) |
| Tenstorrent Loudbox | $ 0,034 |
Observaties
AMD MI300X: Competitieve throughput en een enorme hoeveelheid VRAM. Ideaal voor middelgrote tot grote batchgroottes en grotere modellen zoals Llama 3-70B en hoger. We gebruikten Llama3-8B uitsluitend omdat de andere kaarten geen grotere modellen op één GPU konden laden. Zonder GPU-partitionering is de MI300X voor zulke kleine use cases niet de meest logische keuze.
AMD MI300X + Paiton: Inclusief de observaties die we hierboven hebben besproken, behaalde Paiton 8,2% lagere kosten per miljoen tokens vergeleken met de standaard MI300X-configuratie, wat een verbeterde kostenefficiëntie door software-optimalisaties aantoont. Het Paiton Framework wordt voortdurend verbeterd en naarmate de ontwikkeling vordert, zullen deze kosten in de loop van de tijd blijven dalen.
NVIDIA H200: Toonaangevende snelheid, vergelijkbaar met de AMD MI300X, en een volwassen CUDA-softwarestack. Gebruiksgemak is zeker het geval bij Nvidia.
RX 7900 XTX: Een kosteneffectieve keuze voor individuele ontwikkelaars. Niet ideaal voor grotere workloads vanwege VRAM-beperkingen en de vervelende beperking van de contextlengte, maar geweldig voor lichte inferentie en ontwikkeling. Handig voor AI/ML-workloads en andere algemene GPU-gerelateerde workloads.
Tenstorrent n300s: Innovatieve RISC-V-architectuur op maat gemaakt voor ML-workloads. Opkomende steun in inferentiekaders zoals vLLM, maar het ecosysteem groeit nog steeds. De kosten per 1 miljoen tokens zijn concurrerend voor kleinere modellen, als het model wordt ondersteund.
Laatste gedachten
Het kiezen van de juiste server hangt af van uw gebruiksscenario:
- Start-ups en onderzoekers: een RX 7900 XTX-werkstation of Tenstorrent Loudbox voor betaalbare experimenten en inferentie. Controleer wel of Tenstorrent het gewenste model ondersteunt.
- Bedrijven: MI300X en H200 bieden een goede balans tussen prestaties en efficiëntie, maar de MI300X GPU biedt aanzienlijk groter VRAM tegen lagere kosten.
Gezien de verrassend concurrerende kostenefficiëntie van de RX 7900 XTX in deze analyse, zijn we verheugd om aan te kondigen dat RDNA-ondersteuning voor Paiton momenteel in ontwikkeling is om het potentieel van deze GPU's verder te ontsluiten.
In een snel evoluerend AI-hardwarelandschap zorgt het combineren van de juiste accelerator met geoptimaliseerde inferentieframeworks zoals vLLM ervoor dat u het beste uit uw infrastructuur haalt.
