
AI evolueert razendsnel en efficiënte inferentie is essentieel om krachtige modellen in praktijksituaties in te zetten. Bij Eliovp verleggen we voortdurend de grenzen van AI-prestaties. In eerdere artikelen toonden we al aanzienlijke inferentieversnellingen met FP16 en BF16. Nu zetten we opnieuw een grote stap: Paiton behaalt met FP8 sterkere inferentieprestaties op AMD MI300X-GPU's dan NVIDIA's H200. Zowel AMD als NVIDIA ondersteunt FP8, maar onze zorgvuldig geoptimaliseerde kernels maken hier het verschil.
Het verhaal rond AI-hardware werd lang door één speler gedomineerd. AMD's MI300-serie verandert dat met bijzonder veel rekenkracht. De uitdaging blijft om die capaciteit volledig te benutten. Daar komt Paiton in beeld.
Onze kernmissie met Paiton is bestaande AI-modellen optimaliseren door de kernels voor inferentie nauwkeurig af te stemmen op AMD-architecturen. We analyseren de onderliggende bewerkingen, herschrijven en fuseren ze en stemmen ze af op de specifieke sterke punten van AMD-hardware. Het resultaat is een aanzienlijk hogere inferentiesnelheid en een efficiënter gebruik van resources.
Testopstelling en methodologie
Voor transparante en reproduceerbare resultaten documenteren we onze benchmarkopstelling:
Zoals altijd kozen we voor de best mogelijke configuratie om de vergelijking eerlijk te houden.
- Inferentiebibliotheek: vLLM v0.9.0 + amd/Llama-3.1-70B-Instruct-FP8-KV
- Hardware: AMD MI300X (192GB HBM3) versus NVIDIA H200 (141GB HBM3e)
- Softwarestack: ROCm 6.3.1 op Ubuntu 22.04 (een upgrade naar 6.4 kan nog betere resultaten opleveren); CUDA 12.x op Ubuntu 22.04
- Metingen: Gemiddelden over 10 inferentieruns, met zowel cold-start- als steady-state-Time to First Token (TTFT) en end-to-end-latency (van API-oproep tot laatste token)
- Batchgroottes: 1 tot 128, voor zowel interactieve AI-workloads (1 tot 64) als het uiterste voor batchverwerking (128)
Het voordeel van FP8: het tijdperk van efficiëntie
De introductie van FP8-precisie (8-bit floating point) was een belangrijke stap naar efficiëntere AI-inferentie. FP8 verkleint de geheugenvoetafdruk en verlaagt de rekenintensiteit. Daardoor kunnen grotere modellen worden ingezet of kunnen bestaande modellen met een veel hogere throughput draaien terwijl ze minder geheugen gebruiken. Moderne AI-hardware van zowel AMD als NVIDIA ondersteunt FP8, maar om het volledige potentieel te benutten is sterk geoptimaliseerde software nodig.
We hebben intensief gewerkt aan de integratie en optimalisatie van onze FP8-kernels voor AMD. Onze recente benchmarks laten een duidelijke overwinning zien voor de AMD MI300X met Paiton's geoptimaliseerde kernels.
Paiton op AMD MI300X: een nieuwe standaard zetten
Uit onze interne tests blijkt dat de AMD MI300X-GPU met Paiton's geoptimaliseerde kernels aantoonbaar betere resultaten behaalt dan de NVIDIA H200-GPU bij FP8-inferentie met het amd/Llama-3.1-70B-Instruct-FP8-KV-model.
Hier zijn de benchmarkresultaten waarin de prestaties van NVIDIA H200 en AMD MI300X worden vergeleken met de geoptimaliseerde kernels van Paiton:
| Batch | H200 (req/s) | MI300X + Paiton (req/s) | H200 (tok/s) | MI300X + Paiton (tok/s) | H200 E2E (ms) | MI300X E2E (ms) | H200 TTFT (ms) | MI300X TTFT (ms) | Winnaar |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 0,16 | 0,17 | 39,9 | 43,4 | 640,7 | 589,5 | 136,3 | 138,6 | Paiton |
| 2 | 0,31 | 0,34 | 78,5 | 87,0 | 518,5 | 477,7 | 133,6 | 122,4 | Paiton |
| 4 | 0,60 | 0,67 | 129,6 | 172,0 | 562,2 | 441,6 | 134,3 | 132,6 | Paiton |
| 8 | 1,18 | 1,31 | 225,0 | 252,1 | 587,6 | 493,3 | 269,9 | 280,9 | Paiton |
| 16 | 2.21 | 2,45 | 343,1 | 470,1 | 560,6 | 502,5 | 461,3 | 513,8 | Paiton |
| 32 | 3,93 | 4,07 | 591,8 | 814,5 | 659,1 | 640,6 | 1188,7 | 1187,5 | Paiton |
| 64 | 6,64 | 6,24 | 1297,4 | 1179,7 | 789,3 | 812,2 | 2362,3 | 1880,3 | Gelijkspel |
| 128 | 9,75 | 9.01 | 1821,9 | 1655,8 | 607,7 | 635,5 | 3633,3 | 3502.0 | H200 |
Opmerking: In voorlopige tests presteerden Paiton's FP8-kernels ook beter dan AMD's eigen Aiter-engine op MI300X.
De resultaten zijn duidelijk: met Paiton verwerkt de AMD MI300X Llama-3.1-70B-Instruct-FP8-KV-verzoeken bij kleine tot middelgrote batchgroottes met een hogere throughput en lagere latency dan de NVIDIA H200. Ook de Time to First Token (TTFT) is vaak beter. Dat toont rechtstreeks de kracht van gerichte kerneloptimalisatie. De NVIDIA H200 blijft sterk bij de hoogste batchgroottes, maar Paiton heeft een duidelijk voordeel in courante praktijkscenario's met kleinere, frequentere verzoeken, zoals bij interactieve AI-applicaties. Voor eindgebruikers betekent dat snellere antwoorden en een efficiënter gebruik van AMD-hardware.
Waarom dit voor u belangrijk is
- Benut het volledige potentieel van AMD: Wie in geavanceerde hardware zoals AMD MI300X-GPU's investeert, wil die capaciteit volledig benutten en geen prestaties verliezen door generieke software. Paiton haalt zoveel mogelijk uit elke rekencyclus. Onze nauwkeurig afgestemde kernels beperken inactieve tijd en maximaliseren de nuttige rekenkracht voor AI-inferentieworkloads.
- Kosteneffectieve AI-implementatie: Hogere inferentie-efficiëntie vertaalt zich direct in tastbare kostenbesparingen. Wanneer uw modellen sneller en efficiënter werken, kunt u meer aanvragen verwerken of bestaande workloads in minder tijd voltooien. Dit heeft een directe invloed op uw operationele kosten, of u nu een lokaal datacenter beheert of gebruikmaakt van cloudgebaseerde GPU-instances. Na verloop van tijd kunnen deze optimalisaties leiden tot substantiële verlagingen van uw totale eigendomskosten voor de AI-infrastructuur.
- Maak uw deployments toekomstbestendig: AI-modellen evolueren voortdurend naar grotere, complexere architecturen en precisieformaten zoals FP8. Naarmate hun rekenbehoeften groeien, worden sterk geoptimaliseerde inferentieoplossingen essentieel om prestaties en schaalbaarheid te behouden. De voortdurende ontwikkeling van Paiton helpt uw AI-deployments klaar te maken voor de volgende generatie modellen en precisievereisten.
- Bredere hardwarekeuze: Ons werk met Paiton stelt ontwikkelaars en organisaties in staat om met vertrouwen AMD te kiezen voor hun veeleisende behoeften op het gebied van AI-inferentie. Door superieure prestaties te demonstreren op AMD MI210, MI250X, MI300X, MI325X, MI355X, bevorderen we een competitiever en innovatiever hardware-ecosysteem, waardoor u meer flexibiliteit en opties krijgt bij het ontwerpen van uw AI-infrastructuur. Deze concurrentie stimuleert innovatie in de hele sector, waar uiteindelijk alle gebruikers van profiteren.
Het tijdperk van uniforme AI-optimalisatie loopt snel ten einde. Paiton loopt voorop met gespecialiseerde, krachtige oplossingen die zorgvuldig voor AMD-GPU's zijn ontworpen. Met onze nieuwste verbeteringen, waaronder de FP8-optimalisaties, optimaliseren we niet alleen bestaande prestaties, we verleggen de grens van wat mogelijk is voor AI-inferentie op AMD-hardware.
Blijf op de hoogte voor meer diepgaande technische uitsplitsingen en verdere benchmarkreleases terwijl we de grenzen van AI-prestaties blijven verleggen. Tijdens deze FP8-benchmarks hebben we aanvullende optimalisatietechnieken ontdekt die we zullen laten zien in komende diepgaande posts! We zullen binnenkort opwindende resultaten delen over Tensor Parallelism (TP), waarbij Paiton superieure prestaties en schaalbaarheid blijft demonstreren en zelfs AMD's eigen AITER-engine overtreft in onze interne tests. Als u AI-modellen op AMD-hardware gebruikt, is het tijd om het Paiton-verschil te ervaren en te zien hoe onze kerneloptimalisaties uw mogelijkheden voor AI-inferentie kunnen verbeteren.
Als u AI-modellen op AMD-hardware gebruikt, is het tijd om het Paiton-verschil te ervaren en te zien hoe onze kerneloptimalisaties uw mogelijkheden voor AI-inferentie kunnen verbeteren.
Neem contact op voor een demo en verbeter uw AI-inferentieprestaties.
Het Paiton-team
