Ga naar de hoofdinhoud

Stop met te veel betalen: Paiton MI300X MoE verslaat H200/B200 in kosten per 1 miljoen tokens

Door: ElioVP
26 september 2025
Alle
Stop met te veel betalen: Paiton MI300X MoE verslaat H200/B200 in kosten per 1 miljoen tokens

Korte samenvatting: We hebben Paiton gebenchmarkt met onze nieuwe MoE-ondersteuning op Qwen/Qwen3-30B-A3B-Instruct-2507 om de inferentieprestaties in verschillende opstellingen te vergelijken. Elke configuratie werd vijf keer per batchgrootte uitgevoerd en we rapporteren het gemiddelde over de runs.

Waarom deze benchmark

De meeste gepubliceerde cijfers zijn gebaseerd op synthetische prompts of eenvoudige testdatasets. Wij richten ons, zoals altijd, op realistische conversationele workloads om het werkelijke gedrag van latency en throughput zichtbaar te maken. Het geteste model is Qwen/Qwen3-30B-A3B-Instruct-2507, uitgevoerd met Paiton's aangepaste kernelruntime.

Ondertussen vloeien miljarden naar glimmende NVIDIA-racks, terwijl wij ze verslaan met de goedkopere AMD MI300X van de vorige generatie.

Als uw doel betere resultaten per dollar is, en niet een bepaald logo per rackunit, betaalt u letterlijk een meerprijs om trager te gaan.

Terwijl anderen zich haasten om de nieuwste GPU's te kopen, richten wij ons op het ontsluiten van het volledige potentieel van zowel de huidige als de vorige generaties. GPU-leveranciers pushen vaak nieuwe hardware voordat de vorige generatie volledig is geoptimaliseerd en wij zijn hier om dat te veranderen.

Methodologie

Om de geldigheid en toepasbaarheid van onze bevindingen te garanderen, hebben we ons aan een nauwgezette benchmarkingmethodologie gehouden:

  • Getest model: We selecteerden Qwen/Qwen3-30B-A3B-Instruct-2507, een representatief groot MoE-model, zodat de resultaten relevant zijn voor hedendaagse LLM-deployments.
  • Dataset: In plaats van synthetische gegevens hebben we realistische conversatiesporen uit de ShareGPT-dataset gebruikt. Deze keuze is van cruciaal belang voor het nauwkeurig beoordelen van de prestaties in scenario's die daadwerkelijke gebruikersinteracties nabootsen.
  • Uitvoerlengte: Om de consistentie te behouden en de typische conversatielengtes weer te geven, werd de uitvoerlengte beperkt tot 256 tokens voor alle inferentieruns.
  • Hardware- en softwareconfiguraties:
    • AMD MI300X (geoptimaliseerd voor Paiton):
      • ROCm-versies: Getest met zowel 6.4.1 als 7.0.0 om de impact van verschillende softwarestacks te evalueren.
      • VRAM: 192 GB HBM, biedt aanzienlijke geheugencapaciteit voor grote modellen.
      • Softwarestack: Paiton's aangepaste kernelruntime met MoE-ondersteuning, naast standaard vLLM v0.10.0 en stacks van concurrenten voor een volledige vergelijking.
    • NVIDIA H200 (referentieplatform):
      • CUDA-versie: CUDA 13, vertegenwoordigt de nieuwste NVIDIA-softwareomgeving.
      • VRAM: 141 GB HBM.
      • Softwarestack: vLLM 0.10.2 en stacks van concurrenten.
    • NVIDIA B200 (referentieplatform):
      • CUDA-versie: CUDA 13.
      • VRAM: 180 GB HBM.
      • Softwarestack: vLLM 0.10.2, gebouwd vanuit de broncode, en stacks van concurrenten.
  • Benchmarkprocedure: Voor elke batchgrootte in de set {1, 2, 4, 8, 16, 24, 32, 64, 128, 256} werden inferentietaken vijf keer end-to-end uitgevoerd. Doorvoer (tokens/sec) en latentie werden nauwgezet geregistreerd, waarbij het gemiddelde van de runs werd gerapporteerd om de statistische variantie te verminderen. Cruciaal was dat de tokenisatie- en generatie-instellingen in alle configuraties identiek bleven om een eerlijke vergelijking te garanderen.

Resultaten

Analyse van doorvoer en kostenefficiëntie

De volgende tabel toont de gemiddelde doorvoer (tokens/sec) die is waargenomen voor elke configuratie over verschillende batchgroottes:

BatchgroottePaiton (MI300X) ROCm 6.4.1 / vLLM 0.9.0MI300X ROCm 7.0 / vLLM 0.10.0NVIDIA H200 CUDA 13 / vLLM 0.10.2NVIDIA B200 CUDA 13 / vLLM 0.10.2
1189,37162,24189,51180,11
2347,77299,53331,47339,00
4580.07496,88551,72610,16
81.397,401.122,121.277,691.457,11
162.855,091.989,902.222,612.840,19
324.613,323.209,903.862,384.588,88
647.234,055.573,636.687,798.368,82
1289.554,878.717,8210.489,6513.884,28
25614.672,3512.587,2716.129,3521.980,31

Waarnemingen

Hoewel de ruwe throughputcijfers over de hele linie competitief zijn, brengt een grondigere kostenanalyse belangrijke verschillen aan het licht. Met MoE-ondersteuning levert Paiton een robuuste throughput die soepel schaalt en ook bij hogere batchgroottes een voorspelbare latency behoudt. Sommige concurrerende stacks vertonen daarentegen meer variatie en mogelijk een lagere piekefficiëntie.

Tokeneconomie

Kostenanalyse op aanvraag

Voor een betekenisvolle vergelijking analyseerden we de kosten per 1 miljoen tokens, een cruciale metric voor productiedeployments. We combineerden de goedkoopste geloofwaardige on-demandprijs per GPU-uur voor elke GPU-familie met onze gemeten throughput bij batchgrootte 32. We kozen batchgrootte 32 omdat dit voor veel conversationele MoE-deployments een gangbaar werkpunt is.

Transparante formule

De kosten per 1 miljoen tokens worden berekend met behulp van de volgende formule:

$ per 1 miljoen tokens = (1.000.000 × R) / (T × 3600)

Waar:

  • R = on-demand prijs van $/uur per GPU
  • T = tokens/sec (per GPU)

On-demandresultaten (goedkoopste geloofwaardige aanbiedingen)

GPUDoorvoer (tokens/sec)$/GPU/uurTokens per $$ per 1 miljoen tokens
Paiton MI300X4.613,32$ 1,5011.071.968$ 0,090
Standaard AMD MI300X3.209,90$ 1,507.703.760$ 0,130
NVIDIA H2003.862,38$ 2,595.368.559$ 0,186
NVIDIA B2004.588,88$ 3,754.405.325$ 0,227

Goedkoopste on-demand prijzen met batchgrootte 32 doorvoer → Paiton MI300X leidt op $/1 miljoen tokens.

Samenvatting voor beslissers: Paiton op MI300X komt uit op ongeveer $ 0,090 per 1 miljoen tokens, aanzienlijk minder dan NVIDIA H200 (circa $ 0,186) en B200 (circa $ 0,227). Dit kostenverschil levert een tastbaar investeringsrendement op en is geen marginale verbetering.

Waarom Paiton wint

De overtuigende prestaties en kostenefficiëntie van Paiton kunnen worden toegeschreven aan verschillende belangrijke architecturale en software-optimalisaties:

  • MoE-optimalisatie op kernelniveau: Paiton's aangepaste kernels maximaliseren de rekenintensiteit en geheugenlokaliteit. Door de overhead van generieke bibliotheken te omzeilen, bieden ze een efficiënter uitvoeringspad voor MoE-modellen, wat zich rechtstreeks vertaalt in betere prestaties.
  • Strategische HBM-inzet op MI300X: De royale 192 GB High Bandwidth Memory (HBM) van de AMD MI300X wordt strategisch gebruikt door Paiton. Deze ruime geheugencapaciteit zorgt ervoor dat expertweights en key-value (KV) caches “hot” blijven in het geheugen, waardoor de behoefte aan dure geheugenswaps drastisch wordt verminderd. Dit is een cruciale factor bij het bereiken van duurzame hoge prestaties en bijgevolg lagere operationele kosten.
  • Minder kernelaanroepen: Paiton combineert meerdere bewerkingen in grotere kernels die rekening houden met de experts. Daardoor zijn tijdens runtime veel minder kernellanceringen nodig. Dat verlaagt de latency, verbetert de GPU-bezetting en verhoogt de rekenintensiteit. Het resultaat is een hogere throughput en stabielere prestaties dan bij stacks die veel kleine kernels uitvoeren.
  • Onafhankelijkheid van ROCm-versies: Paiton's aangepaste kernels zijn ontworpen om grotendeels onafhankelijk te blijven van wijzigingen tussen specifieke ROCm-versies. Dat biedt meer stabiliteit en flexibiliteit bij deployments, omdat de prestaties ook bij updates van de onderliggende ROCm-softwarestack consistent blijven.

Reproduceerbaarheid en prijstransparantie

We streven naar transparantie en reproduceerbaarheid.

  • Doorvoer-/latentiegegevens: Alle onbewerkte gegevens zijn opgenomen in dit bericht.
  • Formules: De formules die worden gebruikt voor kostenberekeningen worden expliciet vermeld.
  • Prijzen: On-demand prijzen weerspiegelen de laagst geloofwaardige openbare vermeldingen die beschikbaar waren op het moment van deze benchmark.

Conclusie

De nieuwe basislijn voor kosten per token

Voor organisaties die grote Mixture-of-Experts-modellen in productie inzetten, vormt Paiton op AMD MI300X de nieuwe referentie voor kosten per token. De benchmarkresultaten bevestigen dat Paiton andere oplossingen achter zich laat wanneer modellen zoals Qwen3-30B-A3B-Instruct-2507 op schaal worden aangeboden. Dat voordeel geldt zowel voor on-demandclouddeployments als voor eigen on-premises infrastructuur. De combinatie van sterke prestaties en aanzienlijke kostenbesparingen maakt Paiton bijzonder waardevol voor een optimaal rendement op investeringen in LLM-inferentie.

Bovendien optimaliseren we onze oplossingen voortdurend en verwachten we in de nabije toekomst nog indrukwekkendere resultaten. Houd ons in de gaten voor aankomende updates, inclusief gedetailleerde FP8-resultaten, die we zeer binnenkort zullen posten.

Neem contact op om de mogelijkheden te bespreken :)

Referenties

  1. Supermicro GPU-systeem AS-8125GS-TNMR2
  2. AMD Instinct MI300X
  3. ROCm/vllm GitHub
  4. vllm-project/vllm GitHub
  5. Hugging Face Qwen3-30B-A3B-Instruct-2507