
Korte samenvatting: We hebben Paiton gebenchmarkt met onze nieuwe MoE-ondersteuning op Qwen/Qwen3-30B-A3B-Instruct-2507 om de inferentieprestaties in verschillende opstellingen te vergelijken. Elke configuratie werd vijf keer per batchgrootte uitgevoerd en we rapporteren het gemiddelde over de runs.
Waarom deze benchmark
De meeste gepubliceerde cijfers zijn gebaseerd op synthetische prompts of eenvoudige testdatasets. Wij richten ons, zoals altijd, op realistische conversationele workloads om het werkelijke gedrag van latency en throughput zichtbaar te maken. Het geteste model is Qwen/Qwen3-30B-A3B-Instruct-2507, uitgevoerd met Paiton's aangepaste kernelruntime.
Ondertussen vloeien miljarden naar glimmende NVIDIA-racks, terwijl wij ze verslaan met de goedkopere AMD MI300X van de vorige generatie.
Als uw doel betere resultaten per dollar is, en niet een bepaald logo per rackunit, betaalt u letterlijk een meerprijs om trager te gaan.
Terwijl anderen zich haasten om de nieuwste GPU's te kopen, richten wij ons op het ontsluiten van het volledige potentieel van zowel de huidige als de vorige generaties. GPU-leveranciers pushen vaak nieuwe hardware voordat de vorige generatie volledig is geoptimaliseerd en wij zijn hier om dat te veranderen.
Methodologie
Om de geldigheid en toepasbaarheid van onze bevindingen te garanderen, hebben we ons aan een nauwgezette benchmarkingmethodologie gehouden:
- Getest model: We selecteerden Qwen/Qwen3-30B-A3B-Instruct-2507, een representatief groot MoE-model, zodat de resultaten relevant zijn voor hedendaagse LLM-deployments.
- Dataset: In plaats van synthetische gegevens hebben we realistische conversatiesporen uit de ShareGPT-dataset gebruikt. Deze keuze is van cruciaal belang voor het nauwkeurig beoordelen van de prestaties in scenario's die daadwerkelijke gebruikersinteracties nabootsen.
- Uitvoerlengte: Om de consistentie te behouden en de typische conversatielengtes weer te geven, werd de uitvoerlengte beperkt tot 256 tokens voor alle inferentieruns.
- Hardware- en softwareconfiguraties:
- AMD MI300X (geoptimaliseerd voor Paiton):
- ROCm-versies: Getest met zowel 6.4.1 als 7.0.0 om de impact van verschillende softwarestacks te evalueren.
- VRAM: 192 GB HBM, biedt aanzienlijke geheugencapaciteit voor grote modellen.
- Softwarestack: Paiton's aangepaste kernelruntime met MoE-ondersteuning, naast standaard vLLM v0.10.0 en stacks van concurrenten voor een volledige vergelijking.
- NVIDIA H200 (referentieplatform):
- CUDA-versie: CUDA 13, vertegenwoordigt de nieuwste NVIDIA-softwareomgeving.
- VRAM: 141 GB HBM.
- Softwarestack: vLLM 0.10.2 en stacks van concurrenten.
- NVIDIA B200 (referentieplatform):
- CUDA-versie: CUDA 13.
- VRAM: 180 GB HBM.
- Softwarestack: vLLM 0.10.2, gebouwd vanuit de broncode, en stacks van concurrenten.
- AMD MI300X (geoptimaliseerd voor Paiton):
- Benchmarkprocedure: Voor elke batchgrootte in de set {1, 2, 4, 8, 16, 24, 32, 64, 128, 256} werden inferentietaken vijf keer end-to-end uitgevoerd. Doorvoer (tokens/sec) en latentie werden nauwgezet geregistreerd, waarbij het gemiddelde van de runs werd gerapporteerd om de statistische variantie te verminderen. Cruciaal was dat de tokenisatie- en generatie-instellingen in alle configuraties identiek bleven om een eerlijke vergelijking te garanderen.
Resultaten
Analyse van doorvoer en kostenefficiëntie
De volgende tabel toont de gemiddelde doorvoer (tokens/sec) die is waargenomen voor elke configuratie over verschillende batchgroottes:
| Batchgrootte | Paiton (MI300X) ROCm 6.4.1 / vLLM 0.9.0 | MI300X ROCm 7.0 / vLLM 0.10.0 | NVIDIA H200 CUDA 13 / vLLM 0.10.2 | NVIDIA B200 CUDA 13 / vLLM 0.10.2 |
|---|---|---|---|---|
| 1 | 189,37 | 162,24 | 189,51 | 180,11 |
| 2 | 347,77 | 299,53 | 331,47 | 339,00 |
| 4 | 580.07 | 496,88 | 551,72 | 610,16 |
| 8 | 1.397,40 | 1.122,12 | 1.277,69 | 1.457,11 |
| 16 | 2.855,09 | 1.989,90 | 2.222,61 | 2.840,19 |
| 32 | 4.613,32 | 3.209,90 | 3.862,38 | 4.588,88 |
| 64 | 7.234,05 | 5.573,63 | 6.687,79 | 8.368,82 |
| 128 | 9.554,87 | 8.717,82 | 10.489,65 | 13.884,28 |
| 256 | 14.672,35 | 12.587,27 | 16.129,35 | 21.980,31 |
Waarnemingen
Hoewel de ruwe throughputcijfers over de hele linie competitief zijn, brengt een grondigere kostenanalyse belangrijke verschillen aan het licht. Met MoE-ondersteuning levert Paiton een robuuste throughput die soepel schaalt en ook bij hogere batchgroottes een voorspelbare latency behoudt. Sommige concurrerende stacks vertonen daarentegen meer variatie en mogelijk een lagere piekefficiëntie.
Tokeneconomie
Kostenanalyse op aanvraag
Voor een betekenisvolle vergelijking analyseerden we de kosten per 1 miljoen tokens, een cruciale metric voor productiedeployments. We combineerden de goedkoopste geloofwaardige on-demandprijs per GPU-uur voor elke GPU-familie met onze gemeten throughput bij batchgrootte 32. We kozen batchgrootte 32 omdat dit voor veel conversationele MoE-deployments een gangbaar werkpunt is.
Transparante formule
De kosten per 1 miljoen tokens worden berekend met behulp van de volgende formule:
$ per 1 miljoen tokens = (1.000.000 × R) / (T × 3600)
Waar:
- R = on-demand prijs van $/uur per GPU
- T = tokens/sec (per GPU)
On-demandresultaten (goedkoopste geloofwaardige aanbiedingen)
| GPU | Doorvoer (tokens/sec) | $/GPU/uur | Tokens per $ | $ per 1 miljoen tokens |
|---|---|---|---|---|
| Paiton MI300X | 4.613,32 | $ 1,50 | 11.071.968 | $ 0,090 |
| Standaard AMD MI300X | 3.209,90 | $ 1,50 | 7.703.760 | $ 0,130 |
| NVIDIA H200 | 3.862,38 | $ 2,59 | 5.368.559 | $ 0,186 |
| NVIDIA B200 | 4.588,88 | $ 3,75 | 4.405.325 | $ 0,227 |
Goedkoopste on-demand prijzen met batchgrootte 32 doorvoer → Paiton MI300X leidt op $/1 miljoen tokens.
Samenvatting voor beslissers: Paiton op MI300X komt uit op ongeveer $ 0,090 per 1 miljoen tokens, aanzienlijk minder dan NVIDIA H200 (circa $ 0,186) en B200 (circa $ 0,227). Dit kostenverschil levert een tastbaar investeringsrendement op en is geen marginale verbetering.
Waarom Paiton wint
De overtuigende prestaties en kostenefficiëntie van Paiton kunnen worden toegeschreven aan verschillende belangrijke architecturale en software-optimalisaties:
- MoE-optimalisatie op kernelniveau: Paiton's aangepaste kernels maximaliseren de rekenintensiteit en geheugenlokaliteit. Door de overhead van generieke bibliotheken te omzeilen, bieden ze een efficiënter uitvoeringspad voor MoE-modellen, wat zich rechtstreeks vertaalt in betere prestaties.
- Strategische HBM-inzet op MI300X: De royale 192 GB High Bandwidth Memory (HBM) van de AMD MI300X wordt strategisch gebruikt door Paiton. Deze ruime geheugencapaciteit zorgt ervoor dat expertweights en key-value (KV) caches “hot” blijven in het geheugen, waardoor de behoefte aan dure geheugenswaps drastisch wordt verminderd. Dit is een cruciale factor bij het bereiken van duurzame hoge prestaties en bijgevolg lagere operationele kosten.
- Minder kernelaanroepen: Paiton combineert meerdere bewerkingen in grotere kernels die rekening houden met de experts. Daardoor zijn tijdens runtime veel minder kernellanceringen nodig. Dat verlaagt de latency, verbetert de GPU-bezetting en verhoogt de rekenintensiteit. Het resultaat is een hogere throughput en stabielere prestaties dan bij stacks die veel kleine kernels uitvoeren.
- Onafhankelijkheid van ROCm-versies: Paiton's aangepaste kernels zijn ontworpen om grotendeels onafhankelijk te blijven van wijzigingen tussen specifieke ROCm-versies. Dat biedt meer stabiliteit en flexibiliteit bij deployments, omdat de prestaties ook bij updates van de onderliggende ROCm-softwarestack consistent blijven.
Reproduceerbaarheid en prijstransparantie
We streven naar transparantie en reproduceerbaarheid.
- Doorvoer-/latentiegegevens: Alle onbewerkte gegevens zijn opgenomen in dit bericht.
- Formules: De formules die worden gebruikt voor kostenberekeningen worden expliciet vermeld.
- Prijzen: On-demand prijzen weerspiegelen de laagst geloofwaardige openbare vermeldingen die beschikbaar waren op het moment van deze benchmark.
Conclusie
De nieuwe basislijn voor kosten per token
Voor organisaties die grote Mixture-of-Experts-modellen in productie inzetten, vormt Paiton op AMD MI300X de nieuwe referentie voor kosten per token. De benchmarkresultaten bevestigen dat Paiton andere oplossingen achter zich laat wanneer modellen zoals Qwen3-30B-A3B-Instruct-2507 op schaal worden aangeboden. Dat voordeel geldt zowel voor on-demandclouddeployments als voor eigen on-premises infrastructuur. De combinatie van sterke prestaties en aanzienlijke kostenbesparingen maakt Paiton bijzonder waardevol voor een optimaal rendement op investeringen in LLM-inferentie.
Bovendien optimaliseren we onze oplossingen voortdurend en verwachten we in de nabije toekomst nog indrukwekkendere resultaten. Houd ons in de gaten voor aankomende updates, inclusief gedetailleerde FP8-resultaten, die we zeer binnenkort zullen posten.
Neem contact op om de mogelijkheden te bespreken :)
Referenties
