
Een vos komt tussen de bomen vandaan en stopt bij een beek. De camera volgt de scène, met vogelgeluiden en stromend water op de achtergrond. Dit is één doorlopende MiniMax H3-generatie, inclusief de oorspronkelijke stereosoundtrack, lokaal gemaakt op één Radeon AI PRO R9700.
Paiton levert het afspeelbare videobestand gemiddeld in 5 minuten en 33 seconden op. De referentie-implementatie zonder Paiton, hierna stock, doet er met dezelfde instellingen 6 minuten en 39 seconden over. Dat is ongeveer 67 seconden minder wachten per clip, met identieke MP4-hashes in de bewaarde vergelijking.
Dit is het volgende gratis Paiton RDNA-pakket voor de community: lokale video met geluid, een meegeleverde ComfyUI-workflow en een benchmark die het volledige traject van een nieuwe prompt tot een opgeslagen MP4 meet. Na de installatie is geen inferentiedienst in de cloud nodig.
Open de video van de vos (MP4, 5,5 MB). Druk op afspelen om de video met het oorspronkelijke geluid te bekijken.
Eén gegenereerde scène: 864 × 480, 362 frames met 24 fps, oftewel 15,0833 seconden video. Het model genereert ook het stereogeluid van 32 kHz. Geen frame-interpolatie, upscaling, vervangende soundtrack of samengevoegde clips. De 15 seconden zijn de duur van de video, niet de tijd die nodig is om die te genereren.
Dezelfde clip, ongeveer een minuut eerder klaar
Bij hetzelfde Turbo8-profiel met acht evaluaties van het denoisingmodel verlaagt Paiton de verwerkingstijd van de volledige aanvraag met 16,66%. Omgerekend naar dezelfde actieve rekentijd levert dat 19,99% meer clips per uur op.
| Volledige aanvraag, hetzelfde Turbo8-profiel | Stock | Paiton |
|---|---|---|
| Gemiddelde tijd tot een opgeslagen, afspeelbare MP4 | 399,40 s | 332,85 s |
| Afgeronde wachttijd | 6 min 39 s | 5 min 33 s |
| Berekend aantal clips van dezelfde lengte per uur | 9,01 | 10,82 |
De vergelijking gebruikt één prompt over een vos, seed 771, één opwarmronde en twee gemeten aanvragen per engine. Elke gemeten aanvraag omvat nieuwe conditionering, denoising, het decoderen van video en audio, H.264/AAC-encoding, muxing en het wegschrijven van de MP4. Modeldownloads, het opstarten van het proces en de eerste opwarmronde vallen buiten de meting.
Het hoofdresultaat meet dus niet alleen snellere denoising, maar de wachttijd tot een afspeelbaar bestand. Het aantal clips per uur is berekend als 3600 / gemiddelde aanvraagtijd in seconden, niet gemeten tijdens een productierun van een uur. Prompts schrijven, resultaten beoordelen en afgekeurde generaties kosten in de praktijk extra tijd.
Aan de slag in ComfyUI
Voer op een Linux-werkstation met een Radeon AI PRO R9700 van 32 GB, Docker, Compose en werkende toegang tot de Radeon-GPU het volgende uit:
git clone --depth 1 https://github.com/Eliovp-BV/paiton-vllm-plugin.git
cd paiton-vllm-plugin
./models/MiniMax-H3/launch.sh
Open ComfyUI op localhost. Bij het eerste bezoek opent de meegeleverde workflow. Pas de prompt aan, kies een seed en klik op Run. Met de enginekeuze schakelt u tussen stock en Paiton. Video's worden opgeslagen in ~/paiton-videos/.
Bij de eerste start worden de containerimage en met SHA-256 gecontroleerde checkpoints gedownload en vaste versies van de ComfyUI-componenten lokaal geïnstalleerd. Latere starts hergebruiken de modellen, containerimage en caches. Voor de eerste installatie is internet nodig. Daarna vereist genereren met de opgeslagen bestanden geen model-API, betaalde inferentiedienst of GPU in de cloud.
De modelhandleiding bevat installatie-instructies, terminalcommando's, ondersteunde instellingen en licentievoorwaarden. Bekijk vóór gebruik de licenties van het model en de encoder; de runtime vervangt die voorwaarden niet. Het bovenstaande commando volgt de huidige standaardbranch van de repository. Gebruik een vastgelegde release of commit om een specifieke benchmark te reproduceren.
Wat uw werkstation nodig heeft
Dit is een workload voor een GPU van 32 GB, niet het profiel met lager geheugengebruik uit onze FLUX.2 klein-release. Tijdens de lange clip werd 30,34 GiB GPU-geheugengebruik via de driver waargenomen. De componenten worden tussen de fasen met geheugenbeheer ingepland. We beweren niet dat de volledige pipeline tegelijk in het VRAM blijft.
| Onderdeel | Geteste configuratie of aanbeveling |
|---|---|
| GPU | Eén AMD Radeon AI PRO R9700, 32 GB |
| Testwerkstation | Intel i5-8400, 16 GB werkgeheugen en 4 GB swap |
| Aanbevolen werkgeheugen | 24 GB of meer voor de browser, langere aanvragen en andere toepassingen |
| Opslag | SSD met 60 GB vrije ruimte voor de gekozen installatie, caches en uitvoer |
| Geselecteerde checkpoints | Ongeveer 33,96 GB; beide adapters met hun gedeelde componenten samen 35,92 GB |
| Bestandssysteem | Zonder ondersteuning voor harde koppelingen kunnen dubbele cachebestanden nog eens 34 GB vragen |
Het testwerkstation met 16 GB werkgeheugen gebruikte swap. In de bewaarde meetgegevens bereikte de maximale RSS van het proces gedurende zijn looptijd 12,09 GiB. Het bemonsterde swapgebruik van het proces liep op tot 1,24 GiB. Dat bewijst niet dat elk systeem met 16 GB comfortabel zal draaien. Het GPU-geheugengebruik werd om de 0,5 seconden via de driver uitgelezen, waardoor korte pieken gemist kunnen zijn.
Met de modelgewichten al aanwezig duurden de eerste aanvragen voor een video van 15 seconden 423,6 seconden met stock en 381,0 seconden met Paiton, na het opstarten van het proces. Downloads, verificatie, het voorbereiden van de containerimage en lege caches kosten extra tijd. Het resultaat van 332,85 seconden is het gemiddelde van de twee gemeten Paiton-aanvragen na die opwarmronde, niet de duur van de eerste start.
Dezelfde instellingen, hetzelfde bewaarde resultaat
Beide engines gebruiken hetzelfde door de oorspronkelijke ontwikkelaars geprunede en gekwantiseerde W4A8-generatieprofiel, dezelfde Turbo-adapter, prompt, seed, hetzelfde aantal frames, dezelfde scheduler en guidance. Paiton optimaliseert de uitvoering van dat profiel. We presenteren het snoeien van het model, de kwantisatie of de Turbo-training van anderen niet als ons eigen werk.
Voor de bewaarde vossenclip van 15 seconden hebben alle zes geregistreerde MP4-bestanden dezelfde SHA-256-hash: één opwarmronde en twee gemeten aanvragen per engine. Het volledige resultatenbestand en de CSV met individuele metingen zijn hieronder beschikbaar. Dit toont exact gelijke uitvoer voor deze test, niet de garantie dat elk model, elke prompt of elke toekomstige runtime identieke bestanden oplevert.
Het oorspronkelijke 33B-model op volledige precisie is niet de kwaliteitsreferentie. Beide gemeten engines gebruiken al de compressie en adapters van de oorspronkelijke ontwikkelaars. Ook MiniMax' gehoste systeem voor contextverwerking en de 2K-regeneratiestap vallen buiten dit pakket. Dit is het lokale H3-basisgeneratiepad, niet een nabootsing van de volledige gehoste dienst.
De meegeleverde kwaliteitsbeoordeling beschrijft een consistent weergegeven vos, verschillende gedecodeerde frames en natuurlijk geluid. Dat maakt het een bruikbaar bewaard voorbeeld, maar nog geen uitgebreide evaluatie van videokwaliteit.
Vier stappen zijn een optie, geen verborgen benchmarktruc
Een eerdere reeks tests met korte clips omvatte dieren in de natuur, een sprekende barista en het uitschenken van water. Die video's bevatten 124 frames met 24 fps, oftewel ongeveer 5,17 seconden beeld, met door het model gegenereerd stereogeluid.
| Eerdere tests met korte clips | Stock | Paiton | Kortere verwerkingstijd |
|---|---|---|---|
| Turbo8, acht evaluaties | 95,83 s | 80,60 s | 15,89% |
| Turbo4, vier evaluaties | 64,15 s | 54,38 s | 15,24% |
Dit zijn afzonderlijke resultaten voor korte clips uit de releasebeschrijving, geen extra meetpunten in de benchmark voor 15 seconden video. Elke rij vergelijkt dezelfde adapter en hetzelfde aantal evaluaties tussen de engines.
De adapter met vier stappen laat u sneller varianten uitproberen, maar verandert de afweging tussen snelheid en kwaliteit. In de schenkproef verschenen twee flessen terwijl er één was gevraagd. Met acht stappen bleef het bij één fles, maar waren er nog steeds te veel schuim en onvolkomenheden in de plaatsing. Beide versies bevatten een kortstondige storing in het gegenereerde geluid.
Turbo8 blijft de standaardkeuze wanneer kwaliteit vooropstaat. We vergelijken Paiton met vier stappen niet met stock op acht stappen om minder rekenwerk als compilerwinst te presenteren.
Open de baristavideo (MP4, 0,7 MB). Gesproken tekst: “Here is your coffee”, oftewel “Hier is uw koffie”.
Turbo4-voorbeeld met dialoog, ongeveer 5,17 seconden. Volgens de meegeleverde beoordeling is de zin “Here is your coffee” verstaanbaar en is de lipsynchronisatie redelijk bij het byte-identieke stock-resultaat. Dit voorbeeld staat los van de getimede vergelijking met de vossenclip van 15 seconden. Herkomstgegevens van deze clip.
Meet de volledige aanvraag
De benchmark draaide met het bestaande AUTO/COMPUTE-profiel van het werkstation. We hebben de instellingen voor kloksnelheid, vermogen, spanning en koeling niet aangepast. De conditionering wordt voor elke aanvraag opnieuw berekend, niet hergebruikt van een eerdere prompt.
| Gemiddelde tijd per verwerkingsfase | Stock | Paiton |
|---|---|---|
| Conditionering | 21,72 s | 10,82 s |
| Denoising | 317,99 s | 262,30 s |
| Video decoderen | 42,52 s | 42,47 s |
| Audio decoderen | 3,35 s | 3,37 s |
| Encoding en muxing | 13,80 s | 13,87 s |
De fasemetingen verklaren vrijwel de volledige verwerkingstijd. Kleine administratieve handelingen vallen buiten die fasen. Daarom meten we tot het bestand is opgeslagen: snellere modeluitvoering neemt de tijd voor video- en audiodecodering of bestandsencoding niet weg.
Dit is een kleine vergelijking met een vaste seed op één werkstation. Ze onderbouwt het resultaat voor het gepubliceerde profiel, niet een snelheidsgarantie voor alle prompts of de claim dat dit sneller is dan elke andere H3-runtime.
De downloadbare individuele metingen en benchmarkresultaten bevatten de gemeten waarden, instellingen, uitvoerhashes en geheugensamenvattingen. De implementatie van de Paiton-compiler staat los van deze openbare benchmarkgegevens.
Lagere kosten per gegenereerde minuut
Bij videoworkloads horen kostenmaatstaven voor video. We berekenen de kosten per volledige clip en per gegenereerde minuut, niet per intern diffusietoken.
| Illustratieve kosten bij eigen hardware | Stock | Paiton |
|---|---|---|
| USD per clip van 15,08 seconden | $0,0373 | $0,0311 |
| USD per gegenereerde videominuut | $0,148 | $0,124 |
| EUR per gegenereerde videominuut | €0,205 | €0,171 |
Bij dezelfde aangenomen kosten per productief uur vertaalt de gemeten tijdwinst zich naar 16,66% lagere berekende kosten per gegenereerde minuut. Omgekeerd levert hetzelfde budget voor actieve rekentijd 19,99% meer gegenereerde video op.
De scenario's verdelen de aanschaf van een GPU van $1.299 bij $0,17/kWh stroomkosten, of een GPU van €1.749 bij €0,2558/kWh, over 5.000 productieve uren. Voor beide engines nemen we hetzelfde verbruik van 450 W voor het volledige systeem aan. Dit zijn rekenaannames, geen actuele winkelprijzen of gemeten verbruik aan het stopcontact.
De berekening sluit de aanschaf van de host, inactieve tijd, koeling, onderhoud, financiering, belastingen, restwaarde, handmatige beoordeling en afgekeurde generaties uit. Als maar de helft van de gegenereerde clips bruikbaar is, verdubbelen de kosten per geaccepteerde clip. Dit zijn generatiekosten, niet de prijs van een afgewerkte productieminuut.
De scenariogegevens en het rekenscript zijn beschikbaar, zodat u uw eigen hardwarekosten, benutting en stroomtarief kunt invullen.
Probeer het lokale pakket. Bespreek uw productieworkload met ons.
Deze release voegt video met door het model gegenereerd geluid toe aan Paitons gratis RDNA-pakketten voor de community, naast lokale taalmodellen en beeldgeneratie. Het directe resultaat is praktisch: dezelfde bewaarde clip, op dezelfde Radeon, ongeveer een minuut eerder opgeslagen.
Bekijk de MiniMax H3-installatie en benchmarks, of bekijk het runtimepakket op Hugging Face.
Draait u productie-inferentie op AMD Instinct of CDNA? Bespreek uw modellen, gewenste responstijden en kosten per bruikbaar resultaat met ons. Deze Radeon-benchmark is één geteste workload; grotere omgevingen vragen eigen metingen. Meer over Paiton.
Mogelijk gemaakt met MiniMax H3.
