
Toen we Paiton voor het eerst begonnen te bouwen, was een van onze eerste aandachtsgebieden het optimaliseren van diffusiemodellen. Stable Diffusion XL was een van de eerste grote modellen waarin we lieten zien dat gefuseerde operators, efficiënte uitvoering en hardwarebewuste kernels een echt verschil konden maken.
Nu keren we terug naar die oorsprong. Door de groeiende belangstelling voor tekst-naar-videogeneratie hebben we ondersteuning toegevoegd voor Wan-AI/Wan2.2-T2V-A14B, een groot tekst-naar-video-diffusiemodel. Dit is een belangrijke stap voor Paiton, want onze compiler- en runtimeaanpak is niet beperkt tot LLM-inferentie. Paiton optimaliseert echte AI-workloads in uiteenlopende modelfamilies, waaronder diffusie, videogeneratie en multimodale systemen.
Benchmarkopstelling
Voor deze vergelijking hebben we de Hugging Face Diffusers-bibliotheek gebruikt om het Wan2.2-T2V-A14B-model uit te voeren op twee geavanceerde versnellers:
- AMD MI355X
- NVIDIA B200
Het doel was eenvoudig: de generatietijd voor hetzelfde model vergelijken met dezelfde op Diffusers gebaseerde workflow. Op de AMD MI355X gebruikten we daarvoor onze Paiton-Diffusers-plug-in.
Resultaten
Op basis van de gemiddelde generatietijden voltooide de AMD MI355X de generatie in 17,6% minder tijd dan de NVIDIA B200.
| GPU | Gemiddelde generatietijd | Resultaat |
|---|---|---|
| NVIDIA B200 | 6,672s | Basislijn |
| AMD MI355X | 5,501s | 17,6% snellere generatietijd |
Dit is precies het type workload waarvoor Paiton is gebouwd: grote modellen, zware GPU-uitvoering en dure inferentiepaden waarbij elke optimalisatie ertoe doet.
Waarom diffusiemodellen er nog steeds toe doen
Grote taalmodellen kregen de afgelopen jaren de meeste aandacht, maar diffusiemodellen blijven een van de belangrijkste categorieën AI-workloads. Beeldgeneratie, videogeneratie, 3D-generatie en multimodale pipelines steunen allemaal op veel van dezelfde prestatiekritische patronen:
- grote matrixbewerkingen
- normalisatielagen
- attentionblokken
- geheugenzware tensortransformaties
- herhaalde denoisingstappen
- overhead door operatorplanning
Dit zijn precies de gebieden waar Paiton waarde kan bieden.
Ons werk aan Wan2.2-T2V-A14B bouwt voort op wat we met SDXL begonnen: complexe diffusiepipelines sneller uitvoeren met compilatie, kerneloptimalisatie en hardwarebewuste uitvoering.
We streven niet naar day-zero-ondersteuning
We willen duidelijk zijn over onze filosofie.
Paiton probeert geen day-zero-ondersteuning te bieden voor elk nieuw model zodra het online verschijnt. Zo werken wij niet.
Wij zijn Europees. Wij nemen graag de tijd.
Ons doel is niet om als eerste een fragiele implementatie uit te brengen. We publiceren ondersteuning wanneer het model stabiel is, de runtime is getest en de prestatieoptimalisatie degelijk is uitgevoerd. We besteden liever meer tijd aan het begrijpen van de modelarchitectuur, het profileren van de echte knelpunten en het optimaliseren van het uitvoeringspad dan overhaast een oppervlakkige integratie uit te brengen.
Voor ons betekent ondersteuning niet simpelweg “het draait.”
Ondersteuning betekent:
- het model werkt correct
- het model is goed geprofileerd
- de dure operaties worden begrepen
- de implementatie is geoptimaliseerd
- het resultaat is bruikbaar in productieomgevingen
Dat is de standaard die we voor Paiton willen.
Wat dit betekent voor Paiton
Ondersteuning voor Wan2.2-T2V-A14B is een volgende stap in de ontwikkeling van Paiton tot een breder optimalisatieplatform voor AI-inferentie.
We begonnen met diffusiemodellen en breidden daarna uit naar LLM's. Nu passen we die ervaring opnieuw toe op videogeneratie en moderne diffusieworkloads.
Het resultaat is een eenvoudige maar belangrijke boodschap:
Paiton kan AMD GPU's helpen om op het hoogste niveau te concurreren op echte AI-workloads.
In deze benchmark behaalde de AMD MI355X, met behulp van de Diffusers-bibliotheek, een betere generatietijd dan de NVIDIA B200 op Wan2.2-T2V-A14B.
Voor klanten die inferentieservices bouwen voor video- of beeldgeneratie of voor grote multimodale modellen, is dit relevant. Snellere generatie betekent lagere latency, een betere benutting en lagere kosten per resultaat.
Paiton is precies daarvoor gebouwd.
Bedankt aan AMD en Supermicro
We willen AMD en Supermicro ook bedanken voor hun voortdurende ondersteuning.
Het bouwen van een IR-grafiekcompiler en runtimesysteem zoals Paiton vereist directe toegang tot moderne hardware, een sterk software-ecosysteem en technische ondersteuning van mensen die het platform grondig kennen. Dankzij AMD's ondersteuning konden we Paiton testen, profileren en optimaliseren op de nieuwste AMD Instinct-GPU's, waaronder de MI355X.
Voor een Europees bedrijf dat high-performance AI-infrastructuur bouwt, is die ondersteuning belangrijk. Ze stelt ons in staat sneller te werken, onze technologie op echte hardware te valideren en te tonen dat AMD-GPU's sterk kunnen concurreren bij veeleisende AI-workloads zoals grootschalige videogeneratie.
Paiton is onafhankelijke technologie, maar door toegang te hebben tot de hardware en het ecosysteem van AMD kunnen we ons optimalisatiewerk verder brengen.
We waarderen de samenwerking en kijken ernaar uit om door te gaan met het bouwen van hoogwaardige AI-inferentieoplossingen op AMD GPU's.
