[{"data":1,"prerenderedAt":1810},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700":3,"blog-posts-sidebar-nl":1332},{"id":4,"title":5,"body":6,"categories":1314,"date":1320,"description":1321,"extension":1322,"heading":1323,"image":1324,"meta":1325,"navigation":71,"originalUrl":1326,"path":1327,"seo":1328,"slug":1329,"stem":1330,"__hash__":1331},"blogNl\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700.md","57% meer Qwen3.8-doorvoer op één Radeon met Paiton",{"type":7,"value":8,"toc":1295},"minimark",[9,16,22,25,55,58,63,66,80,85,91,95,117,122,128,141,144,148,169,176,187,283,295,301,305,308,325,331,342,345,349,369,375,386,399,402,407,411,424,430,441,461,467,478,481,485,498,575,586,602,613,619,630,636,640,656,676,694,697,700,704,724,737,743,754,759,763,878,887,891,920,939,942,951,954,958,964,967,975,980,988,1009,1012],[10,11,12],"p",{},[13,14,15],"strong",{},"Eén Radeon AI PRO R9700. Hetzelfde Qwen3.8-27B MXFP4-checkpoint. Dezelfde 5 GiB voor de cache. Paiton levert 57% meer totale doorvoer dan onze vergelijkbare Radiance + DFlash2-referentie bij acht gelijktijdige verzoeken. De mediane tijd tot het eerste token daalt van 6,59 seconden naar 195 milliseconden.",[10,17,18],{},[19,20,21],"em",{},"De kerncijfers voor doorvoer en responstijd komen uit de volledige vergelijking met 188 verzoeken, bij acht gelijktijdige verzoeken. Beide versnelde engines gebruiken dezelfde snapshots van het doelmodel en het DFlash2-draftmodel. De GPU-afbeelding is illustratief.",[10,23,24],{},"Dit is een flinke stap vooruit voor het aanbieden van een 27B-model op één workstation-GPU. Het gaat niet alleen om snellere generatie voor één gebruiker: er kunnen meer verzoeken tegelijk vooruitgang boeken, de geschatte cachecapaciteit is bijna drie keer zo groot en de wachttijd onder belasting is veel korter.",[10,26,27,28,31,32,35,36,39,40,43],{},"Paiton haalt ",[13,29,30],{},"314,5 uitvoertokens per seconde in totaal",", tegenover ",[13,33,34],{},"200,3 tok\u002Fs"," voor de vergelijkbare versnelde referentie. De gewogen seriële decodesnelheid stijgt met ",[13,37,38],{},"22%"," en prefill is sneller bij elke geteste promptlengte. De uitvoering loopt via een plugin op de officiële vLLM 0.28 ROCm-runtime. ",[13,41,42],{},"De geïnstalleerde vLLM-bibliotheek blijft ongewijzigd.",[44,45,46],"sup",{},[47,48,54],"a",{"href":49,"ariaDescribedBy":50,"dataFootnoteRef":52,"id":53},"#user-content-fn-bench",[51],"footnote-label","","user-content-fnref-bench","1",[10,56,57],{},"Het waardevolle zit in die combinatie: duidelijk betere lokale prestaties, met behoud van de reguliere vLLM-deployment.",[59,60,62],"h2",{"id":61},"bekijk-het-in-actie","Bekijk het in actie",[10,64,65],{},"Bekijk hoe Qwen3.8 antwoorden genereert op één Radeon AI PRO R9700, met Paiton + DFlash2 via regulier vLLM. De opname toont de gestreamde uitvoer, live generatiecijfers en GPU-activiteit.",[10,67,68],{},[69,70],"video",{"controls":71,"playsInline":71,"preload":72,"width":73,"height":74,"ariaLabel":75,"ariaDescribedBy":76,"poster":78,"src":79},true,"none",1354,1080,"Schermopname van Qwen3.8 dat antwoorden genereert met Paiton op één Radeon AI PRO R9700",[77],"paiton-live-demo-caption","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Flive-demo-poster.webp","\u002Fasset\u002Fvideos\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fpaiton-qwen38-r9700-demo.mp4",[10,81,82],{"id":77},[19,83,84],{},"Schermopname van 70 seconden met telkens één actief verzoek. De live cijfers gelden voor de getoonde verzoeken, niet voor de totale doorvoer bij acht gelijktijdige verzoeken in de benchmark hieronder.",[10,86,87,90],{},[47,88,89],{"href":79},"Open de opname (MP4, 10,2 MB)",". Gebruik de knop voor volledig scherm om alles van dichtbij te bekijken.",[59,92,94],{"id":93},"een-sterke-referentie-een-beter-resultaat","Een sterke referentie. Een beter resultaat.",[10,96,97,98,104,105,108,109],{},"Het onderzoek begon met het indrukwekkende werk rond ",[47,99,103],{"href":100,"rel":101},"https:\u002F\u002Fgithub.com\u002Fmagiccodingman\u002Fvllm-radiance",[102],"nofollow","vLLM-Radiance",". De resultaten op AMD-hardware brachten ons op ideeën en moedigden ons aan onze eigen R9700-implementatie verder te optimaliseren. De publieke documentatie beschrijft ondersteuning voor hetzelfde AMD Quark MXFP4-model en DFlash2-versnelling. De gepubliceerde prestatiecijfers van dat project gebruiken ",[13,106,107],{},"twee R9700's",".",[44,110,111],{},[47,112,116],{"href":113,"ariaDescribedBy":114,"dataFootnoteRef":52,"id":115},"#user-content-fn-radiance",[51],"user-content-fnref-radiance","2",[10,118,119],{},[13,120,121],{},"Radiance inspireerde dit onderzoek. De native implementatie van Paiton is ons eigen werk.",[10,123,124,125],{},"Onze vraag was: ",[13,126,127],{},"hoeveel kunnen we met dit model uit één kaart halen, met behoud van de reguliere vLLM-deployment?",[10,129,130,131,134,135],{},"Daarom hebben we Radiance + DFlash2 en Paiton op vLLM + DFlash2 zelf op ",[13,132,133],{},"één R9700"," getest. Beide gebruikten hetzelfde checkpoint, dezelfde snapshots van doel- en draftmodel, een FP8-KV-cache, een cachetoewijzing van 5 GiB en een contextlimiet van 8.192 tokens. De twee versnelde profielen gebruikten zeven speculatieve tokens, greedy sampling en uitgeschakelde prefixcaching.",[44,136,137],{},[47,138,54],{"href":49,"ariaDescribedBy":139,"dataFootnoteRef":52,"id":140},[51],"user-content-fnref-bench-2",[10,142,143],{},"Onze winstpercentages vergelijken die gelijk opgezette tests op één GPU. We vergelijken dus geen resultaat op één kaart met een extern gepubliceerd resultaat op twee kaarten.",[59,145,147],{"id":146},"_57-meer-doorvoer-met-een-grotere-voorsprong-onder-belasting","57% meer doorvoer, met een grotere voorsprong onder belasting",[10,149,150,151,154,155,161],{},"Het hoofdresultaat komt uit de ",[13,152,153],{},"volledige BetterBench-preset met 188 verzoeken",", niet uit de kortere vergelijking met maximaal 128 uitvoertokens. We behielden de oorspronkelijke, ruimere uitvoerbudgetten van de preset, met tien gemeten herhalingen per taakcategorie, 24 verzoeken per getest gelijktijdigheidsniveau en herhaalde prefill-metingen. Beide engines voltooiden alle verzoeken.",[44,156,157],{},[47,158,54],{"href":49,"ariaDescribedBy":159,"dataFootnoteRef":52,"id":160},[51],"user-content-fnref-bench-3",[44,162,163],{},[47,164,168],{"href":165,"ariaDescribedBy":166,"dataFootnoteRef":52,"id":167},"#user-content-fn-betterbench",[51],"user-content-fnref-betterbench","3",[10,170,171],{},[172,173],"img",{"alt":174,"src":175},"Paiton haalt bij acht gelijktijdige verzoeken 314,5 uitvoertokens per seconde in totaal, tegenover 200,3 voor Radiance, en loopt voor bij elk getest gelijktijdigheidsniveau.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F01-full-throughput.webp",[10,177,178,181],{},[19,179,180],{},"Volledige workload met 188 verzoeken, runs 495 \u002F 494. De totale doorvoer omvat prefill en wachtrijtijd. Hoger is beter.",[44,182,183],{},[47,184,54],{"href":49,"ariaDescribedBy":185,"dataFootnoteRef":52,"id":186},[51],"user-content-fnref-bench-4",[188,189,190,210],"table",{},[191,192,193],"thead",{},[194,195,196,200,204,207],"tr",{},[197,198,199],"th",{},"Gelijktijdige verzoeken",[197,201,203],{"align":202},"right","Radiance + DFlash2",[197,205,206],{"align":202},"Paiton op vLLM + DFlash2",[197,208,209],{"align":202},"Winst met Paiton",[211,212,213,231,248,266],"tbody",{},[194,214,215,218,221,226],{},[216,217,54],"td",{},[216,219,220],{"align":202},"76,9 tok\u002Fs",[216,222,223],{"align":202},[13,224,225],{},"89,6 tok\u002Fs",[216,227,228],{"align":202},[13,229,230],{},"16,5%",[194,232,233,235,238,243],{},[216,234,116],{},[216,236,237],{"align":202},"142,7 tok\u002Fs",[216,239,240],{"align":202},[13,241,242],{},"165,7 tok\u002Fs",[216,244,245],{"align":202},[13,246,247],{},"16,1%",[194,249,250,253,256,261],{},[216,251,252],{},"4",[216,254,255],{"align":202},"187,1 tok\u002Fs",[216,257,258],{"align":202},[13,259,260],{},"254,8 tok\u002Fs",[216,262,263],{"align":202},[13,264,265],{},"36,2%",[194,267,268,271,273,278],{},[216,269,270],{},"8",[216,272,34],{"align":202},[216,274,275],{"align":202},[13,276,277],{},"314,5 tok\u002Fs",[216,279,280],{"align":202},[13,281,282],{},"57,0%",[10,284,285,288,289],{},[13,286,287],{},"Paiton loopt voor bij elk getest gelijktijdigheidsniveau."," Ook de resultaten per taakcategorie laten een voorsprong zien voor code, redeneren, proza, JSON, bestandsbewerking, samenvatten, wiskunde en chat. De winst houdt dus stand in de langere workload en hangt niet af van één gunstige prompt.",[44,290,291],{},[47,292,54],{"href":49,"ariaDescribedBy":293,"dataFootnoteRef":52,"id":294},[51],"user-content-fnref-bench-5",[10,296,297,298],{},"Dit zijn totale verwerkingssnelheden voor de actieve workload. ",[13,299,300],{},"314,5 tok\u002Fs betekent niet dat elk van de acht gebruikers 314,5 tok\u002Fs ontvangt.",[59,302,304],{"id":303},"van-659-seconden-wachten-naar-een-eerste-token-in-195-milliseconden","Van 6,59 seconden wachten naar een eerste token in 195 milliseconden",[10,306,307],{},"De winst in doorvoer is groot. De verbetering in responsiviteit onder belasting is nog groter.",[10,309,310,311,314,315,318,319],{},"Bij vier gelijktijdige verzoeken daalt de mediane tijd tot het eerste token van ",[13,312,313],{},"1.627 ms naar 180 ms",". Bij acht daalt die van ",[13,316,317],{},"6.586 ms naar 195 ms: 97% korter",". Deze tijden zijn inclusief wachtrijtijd en beschrijven dus hoe lang de client wacht voordat het antwoord begint.",[44,320,321],{},[47,322,54],{"href":49,"ariaDescribedBy":323,"dataFootnoteRef":52,"id":324},[51],"user-content-fnref-bench-6",[10,326,327],{},[172,328],{"alt":329,"src":330},"Bij acht gelijktijdige verzoeken daalt de mediane tijd tot het eerste token van 6.586 milliseconden met Radiance naar 195 milliseconden met Paiton.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F02-time-to-first-token.webp",[10,332,333,336],{},[19,334,335],{},"Volledige workload met 188 verzoeken. Lager is beter. Bij één en twee gelijktijdige verzoeken behoudt Radiance een TTFT-voordeel van 10 tot 11 ms. Paiton levert bij beide niveaus wel meer doorvoer.",[44,337,338],{},[47,339,54],{"href":49,"ariaDescribedBy":340,"dataFootnoteRef":52,"id":341},[51],"user-content-fnref-bench-7",[10,343,344],{},"Voor een gedeelde programmeerassistent of een lokaal endpoint voor agents is doorvoer alleen niet genoeg. Een endpoint dat meer tokens produceert maar verzoeken lang laat wachten voordat de generatie begint, kan nog steeds traag aanvoelen. Hier gaat de hogere doorvoer bij meer gelijktijdige verzoeken samen met een veel kortere wachttijd tot het eerste token.",[59,346,348],{"id":347},"dezelfde-5-gib-biedt-bijna-drie-keer-de-tokencapaciteit","Dezelfde 5 GiB biedt bijna drie keer de tokencapaciteit",[10,350,351,352,355,356,359,360,108,363],{},"Met ",[13,353,354],{},"precies 5 GiB gereserveerd per engine"," rapporteren de runtimes ",[13,357,358],{},"25.746 cachetokenslots voor Radiance en 74.430 voor Paiton",". Dat is ",[13,361,362],{},"2,89× de geschatte tokencapaciteit binnen dezelfde geheugentoewijzing",[44,364,365],{},[47,366,54],{"href":49,"ariaDescribedBy":367,"dataFootnoteRef":52,"id":368},[51],"user-content-fnref-bench-8",[10,370,371],{},[172,372],{"alt":373,"src":374},"Binnen een cachetoewijzing van 5 GiB rapporteert Radiance 25.746 tokenslots en Paiton 74.430: 2,89 keer de geschatte capaciteit.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F03-cache-capacity.webp",[10,376,377,380],{},[19,378,379],{},"Door de runtime gerapporteerde schattingen van de gedeelde cachecapaciteit, geen fysieke VRAM-capaciteit. De contextlimiet per verzoek blijft 8.192 tokens.",[44,381,382],{},[47,383,54],{"href":49,"ariaDescribedBy":384,"dataFootnoteRef":52,"id":385},[51],"user-content-fnref-bench-9",[10,387,388,389,392,393],{},"De logs van deze tests tonen maximaal ",[13,390,391],{},"drie actieve verzoeken voor Radiance en acht voor Paiton"," binnen de vergelijkbare configuratie. Dat zijn waarnemingen uit deze runs, geen algemene limieten voor het aantal gelijktijdige verzoeken van beide engines.",[44,394,395],{},[47,396,54],{"href":49,"ariaDescribedBy":397,"dataFootnoteRef":52,"id":398},[51],"user-content-fnref-bench-10",[10,400,401],{},"Die extra capaciteit helpt de betere ervaring bij gelijktijdig gebruik te verklaren: meer verzoeken kunnen binnen hetzelfde geheugenbudget vooruitgang boeken. De capaciteitscijfers en het waargenomen aantal actieve verzoeken passen bij de gemeten doorvoer en responstijd. Ze bewijzen niet dat alleen het cachebeheer de verbetering veroorzaakt.",[10,403,404],{},[13,405,406],{},"Meer bruikbare capaciteit voor verzoeken, niet meer VRAM of een groter contextvenster.",[59,408,410],{"id":409},"snellere-decode-en-prefill-over-de-hele-workload","Snellere decode en prefill, over de hele workload",[10,412,413,414,417,418],{},"De winst beperkt zich niet tot het tegelijk toelaten van meer verzoeken. In de volledige workload stijgt de gewogen seriële decodesnelheid van ",[13,415,416],{},"86,0 naar 104,9 uitvoertokens per seconde: 22% hoger",". Dit meet de generatie na het eerste token en staat los van de totale doorvoer voor de volledige workload hierboven.",[44,419,420],{},[47,421,54],{"href":49,"ariaDescribedBy":422,"dataFootnoteRef":52,"id":423},[51],"user-content-fnref-bench-11",[10,425,426],{},[172,427],{"alt":428,"src":429},"De gewogen seriële decodesnelheid voor de volledige workload stijgt van 86,0 naar 104,9 uitvoertokens per seconde, een toename van 22 procent.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F04-serial-decode.webp",[10,431,432,435],{},[19,433,434],{},"Gewogen seriële decodesnelheid voor de volledige workload. Dezelfde snapshots van doel- en draftmodel op dezelfde R9700.",[44,436,437],{},[47,438,54],{"href":49,"ariaDescribedBy":439,"dataFootnoteRef":52,"id":440},[51],"user-content-fnref-bench-12",[10,442,443,444,447,448,451,452,108,455],{},"Ook prefill verbetert bij elke geteste promptlengte. Bij ongeveer ",[13,445,446],{},"1.556 \u002F 3.024 \u002F 5.226 invoertokens"," haalt Radiance ",[13,449,450],{},"2.828 \u002F 3.003 \u002F 2.926 invoertokens per seconde",". Paiton haalt ",[13,453,454],{},"3.182 \u002F 3.521 \u002F 3.367 invoertokens per seconde",[44,456,457],{},[47,458,54],{"href":49,"ariaDescribedBy":459,"dataFootnoteRef":52,"id":460},[51],"user-content-fnref-bench-13",[10,462,463],{},[172,464],{"alt":465,"src":466},"Paiton verwerkt 3.182, 3.521 en 3.367 invoertokens per seconde bij drie promptlengtes en is bij elke lengte sneller dan Radiance.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F05-full-prefill.webp",[10,468,469,472],{},[19,470,471],{},"Prefill voor de volledige workload: 12,5%, 17,2% en 15,1% hoger, berekend op basis van de getoonde samenvattingswaarden. Dit is het werkelijke aantal prompttokens gedeeld door de HTTP-tijd tot het eerste token, geen geïsoleerde kerneldoorvoer.",[44,473,474],{},[47,475,54],{"href":49,"ariaDescribedBy":476,"dataFootnoteRef":52,"id":477},[51],"user-content-fnref-bench-14",[10,479,480],{},"Samen laten deze resultaten verbetering zien op meerdere momenten die een gebruiker merkt: de prompt verwerken, onder belasting aan het antwoord beginnen en de rest van het antwoord genereren.",[59,482,484],{"id":483},"het-verschil-met-standaard-vllm-is-groot","Het verschil met standaard-vLLM is groot",[10,486,487,488,491,492],{},"Daarnaast testten we een afzonderlijke ",[13,489,490],{},"matrix met 54 verzoeken en maximaal 128 uitvoertokens",". Daarin vergeleken we standaard-vLLM O2, Radiance + DFlash2 en Paiton op vLLM + DFlash2. Voor standaard-vLLM gebruikten we de beste O2-instellingen die we hadden getest.",[44,493,494],{},[47,495,54],{"href":49,"ariaDescribedBy":496,"dataFootnoteRef":52,"id":497},[51],"user-content-fnref-bench-15",[188,499,500,513],{},[191,501,502],{},[194,503,504,506,509,511],{},[197,505,199],{},[197,507,508],{"align":202},"Standaard-vLLM O2",[197,510,203],{"align":202},[197,512,206],{"align":202},[211,514,515,530,545,560],{},[194,516,517,519,522,525],{},[216,518,54],{},[216,520,521],{"align":202},"4,5 tok\u002Fs",[216,523,524],{"align":202},"78,0 tok\u002Fs",[216,526,527],{"align":202},[13,528,529],{},"90,0 tok\u002Fs",[194,531,532,534,537,540],{},[216,533,116],{},[216,535,536],{"align":202},"8,8 tok\u002Fs",[216,538,539],{"align":202},"151,2 tok\u002Fs",[216,541,542],{"align":202},[13,543,544],{},"160,5 tok\u002Fs",[194,546,547,549,552,555],{},[216,548,252],{},[216,550,551],{"align":202},"17,4 tok\u002Fs",[216,553,554],{"align":202},"189,2 tok\u002Fs",[216,556,557],{"align":202},[13,558,559],{},"231,5 tok\u002Fs",[194,561,562,564,567,570],{},[216,563,270],{},[216,565,566],{"align":202},"33,7 tok\u002Fs",[216,568,569],{"align":202},"175,6 tok\u002Fs",[216,571,572],{"align":202},[13,573,574],{},"328,5 tok\u002Fs",[10,576,577,580],{},[19,578,579],{},"Totale uitvoerdoorvoer in de afzonderlijke matrix met 54 verzoeken en een uitvoerlimiet van 128 tokens, runs 403 \u002F 493 \u002F 492. Waarden uit de gepubliceerde benchmarksamenvatting. Deze vergelijking is niet de bron van het hoofdresultaat van 57%.",[44,581,582],{},[47,583,54],{"href":49,"ariaDescribedBy":584,"dataFootnoteRef":52,"id":585},[51],"user-content-fnref-bench-16",[10,587,588,589,592,593,108,596],{},"Bij acht gelijktijdige verzoeken stijgt de totale doorvoer van ",[13,590,591],{},"33,7 tok\u002Fs met standaard-vLLM naar 328,5 tok\u002Fs met Paiton",", bijna een vertienvoudiging. De gewogen seriële decodesnelheid in deze kortere vergelijking stijgt van ",[13,594,595],{},"4,5 naar 113,5 tok\u002Fs",[44,597,598],{},[47,599,54],{"href":49,"ariaDescribedBy":600,"dataFootnoteRef":52,"id":601},[51],"user-content-fnref-bench-17",[10,603,604,605,608,609,612],{},"De reikwijdte van die vergelijking is belangrijk. Standaard-vLLM gebruikt ",[13,606,607],{},"W4A4-emulatie volgens het checkpoint",", terwijl de versnelde configuraties ",[13,610,611],{},"W4A8-uitvoering met DFlash2"," gebruiken. Dit zijn volledige engineconfiguraties met dezelfde gewichten, niet identieke berekeningen voor activaties. De cijfers betekenen ook niet dat het vervangen van één kernel de volledige winst oplevert, of dat dit resultaat geldt voor elk model of elke kwantisatie op standaard-vLLM.",[10,614,615],{},[172,616],{"alt":617,"src":618},"In de afzonderlijke prefill-vergelijking met 54 verzoeken is Paiton sneller dan standaard-vLLM O2 en Radiance bij alle drie de geteste promptlengtes.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F07-three-engine-prefill.webp",[10,620,621,624],{},[19,622,623],{},"Prefill in de afzonderlijke matrix met beperkte uitvoerlengte, op basis van de werkelijke getokeniseerde promptlengtes. Deze waarden horen niet bij de prefill-reeks voor de volledige workload hierboven.",[44,625,626],{},[47,627,54],{"href":49,"ariaDescribedBy":628,"dataFootnoteRef":52,"id":629},[51],"user-content-fnref-bench-18",[10,631,632,633],{},"Daarom baseren we het hoofdresultaat op de zwaardere vergelijking: ",[13,634,635],{},"Paiton tegenover een al versnelde Radiance + DFlash2-referentie, bevestigd in de langere workload.",[59,637,639],{"id":638},"regulier-vllm-de-geïnstalleerde-bibliotheek-blijft-intact","Regulier vLLM. De geïnstalleerde bibliotheek blijft intact.",[10,641,642,643,649],{},"Die deploymentvorm is een bewuste keuze. Paiton integreert via de uitbreidingsmechanismen van vLLM en levert native HIP-runtimebestanden voor de geoptimaliseerde uitvoering. Het pluginsysteem van vLLM is bedoeld om uitbreidingen mogelijk te maken zonder de codebase aan te passen.",[44,644,645],{},[47,646,54],{"href":49,"ariaDescribedBy":647,"dataFootnoteRef":52,"id":648},[51],"user-content-fnref-bench-19",[44,650,651],{},[47,652,252],{"href":653,"ariaDescribedBy":654,"dataFootnoteRef":52,"id":655},"#user-content-fn-plugins",[51],"user-content-fnref-plugins",[10,657,658,659,662,668],{},"De geoptimaliseerde uitvoering gebruikt Paitons native HIP-kernels en DFlash2-integratie. De release bundelt de benodigde runtimebestanden voor de geteste deployment, inclusief de DFlash2-integratie, zodat gebruikers geen apart DFlash-pakket hoeven te installeren. ",[13,660,661],{},"Onze Paiton-compiler blijft gesloten.",[44,663,664],{},[47,665,54],{"href":49,"ariaDescribedBy":666,"dataFootnoteRef":52,"id":667},[51],"user-content-fnref-bench-20",[44,669,670],{},[47,671,675],{"href":672,"ariaDescribedBy":673,"dataFootnoteRef":52,"id":674},"#user-content-fn-paiton",[51],"user-content-fnref-paiton","5",[10,677,678,679,683,684,687,688],{},"We controleerden ook de reguliere API-server via ",[680,681,682],"code",{},"vllm.entrypoints.openai.api_server",", los van de benchmarkomgeving. Die slaagde voor streamingchat, acht gelijktijdige verzoeken, een verzoek op de ingestelde contextgrens en een nieuw verzoek daarna. ",[13,685,686],{},"Alle 2.893 geïnstalleerde vLLM-bestanden kwamen overeen met de officiële basisimage."," Deze validatie geldt voor de vastgelegde geteste runtime en het ondersteunde profiel, niet voor elke vLLM-functie of toekomstige versie.",[44,689,690],{},[47,691,54],{"href":49,"ariaDescribedBy":692,"dataFootnoteRef":52,"id":693},[51],"user-content-fnref-bench-21",[10,695,696],{},"Standaard-vLLM behoudt zijn gebruikelijke frameworkafhankelijkheden. De native bibliotheken van Paiton laden onafhankelijk van die frameworks. Dat maakt niet de volledige serving-stack frameworkvrij.",[10,698,699],{},"Dat alle verzoeken worden voltooid en de API-controles slagen, is nuttig om de betrouwbaarheid te toetsen. Het is geen onafhankelijke evaluatie van de modelnauwkeurigheid of garantie op identieke gegenereerde tekst tussen uitvoeringsprofielen.",[59,701,703],{"id":702},"meer-uitvoer-uit-hetzelfde-actieve-uur","Meer uitvoer uit hetzelfde actieve uur",[10,705,706,707,709,710,713,714,716,717,720,721,108],{},"De doorvoercijfers bij acht gelijktijdige verzoeken uit de volledige workload maken de capaciteitswinst concreet. Een volgehouden snelheid van ",[13,708,34],{}," zou ongeveer ",[13,711,712],{},"721.000 uitvoertokens per actief uur"," opleveren. Bij ",[13,715,277],{}," is dat ongeveer ",[13,718,719],{},"1,13 miljoen",": zo'n ",[13,722,723],{},"411.000 extra uitvoertokens in hetzelfde uur",[10,725,726,727,31,730,733,734,108],{},"Anders uitgedrukt: één miljoen uitvoertokens kost bij de referentiesnelheid ",[13,728,729],{},"1,387 actieve uren",[13,731,732],{},"0,883 uur"," met Paiton. Dat is ",[13,735,736],{},"36,3% minder actieve tijd",[10,738,739],{},[172,740],{"alt":741,"src":742},"Bij volgehouden gemeten snelheden daalt de berekende actieve tijd per miljoen uitvoertokens van 1,387 naar 0,883 uur, een vermindering van 36,3 procent.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F08-active-time-per-million.webp",[10,744,745,748],{},[19,746,747],{},"Rekenvoorbeeld op basis van de doorvoer bij acht gelijktijdige verzoeken in de volledige workload. Het veronderstelt dat die snelheden worden volgehouden. Dit is geen meting van een uur, geen energiemeting en geen claim over financiële kosten.",[44,749,750],{},[47,751,54],{"href":49,"ariaDescribedBy":752,"dataFootnoteRef":52,"id":753},[51],"user-content-fnref-bench-22",[10,755,756],{},[13,757,758],{},"De hardware verandert niet. Hoeveel nuttig werk die hardware kan leveren wel.",[59,760,762],{"id":761},"geteste-configuratie","Geteste configuratie",[188,764,765,775],{},[191,766,767],{},[194,768,769,772],{},[197,770,771],{},"Onderdeel",[197,773,774],{},"Vergelijkbaar testprofiel",[211,776,777,788,798,806,814,822,830,838,846,854,862,870],{},[194,778,779,782],{},[216,780,781],{},"GPU",[216,783,784,785],{},"Eén Radeon AI PRO R9700, ",[680,786,787],{},"gfx1201",[194,789,790,793],{},[216,791,792],{},"Doelcheckpoint",[216,794,795],{},[680,796,797],{},"amd\u002FQwen3.8-27B-Quark-AWQ-MXFP4",[194,799,800,803],{},[216,801,802],{},"Versnelde profielen",[216,804,805],{},"Radiance + DFlash2; Paiton op officieel vLLM + DFlash2",[194,807,808,811],{},[216,809,810],{},"Serving-basis voor Paiton",[216,812,813],{},"Officiële vLLM 0.28 ROCm-runtime",[194,815,816,819],{},[216,817,818],{},"Cache",[216,820,821],{},"FP8-KV; precies 5 GiB gereserveerd per engine",[194,823,824,827],{},[216,825,826],{},"Contextlimiet",[216,828,829],{},"8.192 tokens per verzoek",[194,831,832,835],{},[216,833,834],{},"Geteste gelijktijdige verzoeken",[216,836,837],{},"1, 2, 4 en 8",[194,839,840,843],{},[216,841,842],{},"Speculatieve generatie",[216,844,845],{},"Dezelfde snapshots van doel- en draftmodel; zeven speculatieve tokens",[194,847,848,851],{},[216,849,850],{},"Sampling",[216,852,853],{},"Greedy",[194,855,856,859],{},[216,857,858],{},"Prefixcaching",[216,860,861],{},"Uitgeschakeld",[194,863,864,867],{},[216,865,866],{},"Workload voor hoofdresultaat",[216,868,869],{},"Volledige preset met 188 verzoeken en oorspronkelijke uitvoerbudgetten",[194,871,872,875],{},[216,873,874],{},"Aanvullende vergelijking met standaard-vLLM",[216,876,877],{},"Afzonderlijke matrix met 54 verzoeken en maximaal 128 uitvoertokens",[10,879,880,881],{},"Deze resultaten gelden voor het geteste model, de runtime en de workload. Ze bieden geen garantie voor andere GPU's, langere contexten, andere draftmodellen of niet-geteste aantallen gelijktijdige verzoeken.",[44,882,883],{},[47,884,54],{"href":49,"ariaDescribedBy":885,"dataFootnoteRef":52,"id":886},[51],"user-content-fnref-bench-23",[59,888,890],{"id":889},"aan-de-slag-op-je-r9700","Aan de slag op je R9700",[10,892,893,894,899,900,905,906,912],{},"De ",[47,895,898],{"href":896,"rel":897},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Ftree\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2",[102],"Paiton-modelhandleiding"," is het startpunt voor de deploymentinstructies en benchmarkonderbouwing. De ",[47,901,904],{"href":902,"rel":903},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-27B-Quark-AWQ-MXFP4-DFlash2-Paiton-RDNA4",[102],"bijbehorende Hugging Face-repository"," identificeert de modelrelease.",[44,907,908],{},[47,909,54],{"href":49,"ariaDescribedBy":910,"dataFootnoteRef":52,"id":911},[51],"user-content-fnref-bench-24",[44,913,914],{},[47,915,919],{"href":916,"ariaDescribedBy":917,"dataFootnoteRef":52,"id":918},"#user-content-fn-model",[51],"user-content-fnref-model","6",[10,921,922,925,926,108,931],{},[13,923,924],{},"Runtimepakket:"," ",[47,927,930],{"href":928,"rel":929},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Freleases\u002Ftag\u002Fqwen38-mxfp4-dflash2-rdna4-v1.0.0",[102],"Download het runtimepakket en bekijk de release notes",[44,932,933],{},[47,934,938],{"href":935,"ariaDescribedBy":936,"dataFootnoteRef":52,"id":937},"#user-content-fn-release",[51],"user-content-fnref-release","7",[10,940,941],{},"Containerimage voor deze release:",[943,944,949],"pre",{"className":945,"code":947,"language":948,"meta":52},[946],"language-text","ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin:qwen38-mxfp4-dflash2-rdna4-v1.0.0\n","text",[680,950,947],{"__ignoreMap":52},[10,952,953],{},"Gebruik de vastgelegde configuratie uit de modelhandleiding om het resultaat te reproduceren. De cachetoewijzing van 5 GiB, snapshots van doel- en draftmodel, speculatieve instellingen en contextlimiet maken deel uit van de vergelijking. Het zijn geen toevallige standaardwaarden.",[59,955,957],{"id":956},"dezelfde-hardware-duidelijk-meer-capaciteit","Dezelfde hardware. Duidelijk meer capaciteit.",[10,959,960,963],{},[13,961,962],{},"57% meer totale doorvoer. Een 97% kortere mediane tijd tot het eerste token bij acht gelijktijdige verzoeken. 2,89× de geschatte cachecapaciteit."," Daarnaast snellere seriële decode en prefill, allemaal op één Radeon AI PRO R9700 via regulier vLLM.",[10,965,966],{},"Voor lokale ontwikkelaars betekent dit een krachtiger gedeeld endpoint op één workstation-GPU. Voor teams die AMD-inference op grotere schaal draaien, laat het opnieuw zien waarom efficiënte uitvoering naast hardwarecapaciteit telt. De R9700-cijfers voorspellen geen winst op andere AMD-platforms.",[10,968,969,970,974],{},"Wil je meer uit je AMD-inferenceworkload halen? Bespreek met ons wat ",[47,971,973],{"href":972},"\u002Fnl\u002Fproducts\u002Fpaiton","Paiton"," kan betekenen. Neem het model, de workload en de huidige referentiemetingen mee.",[976,977,979],"h3",{"id":978},"dank-aan-de-betrokken-teams","Dank aan de betrokken teams",[10,981,982,983,987],{},"Dank aan het ",[47,984,986],{"href":100,"rel":985},[102],"Radiance-team"," voor het uitstekende werk aan AMD-inference, de inspiratie en een sterke vergelijkingsbasis.",[10,989,990,991,996,997,1002,1003,1008],{},"We bedanken ook ",[47,992,995],{"href":993,"rel":994},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[102],"vLLM",", ",[47,998,1001],{"href":999,"rel":1000},"https:\u002F\u002Fcodeberg.org\u002FStillDeadcode\u002Flibr4d",[102],"StillDeadcode\u002Flibr4d",", de Qwen- en DFlash2-teams, het Quark-checkpointteam van AMD en ",[47,1004,1007],{"href":1005,"rel":1006},"https:\u002F\u002Fgithub.com\u002FGGZ14\u002FBetterBench",[102],"BetterBench"," voor de bouwstenen, modellen en meetinstrumenten waarop dit werk steunt.",[1010,1011],"hr",{},[1013,1014,1017,1022],"section",{"className":1015,"dataFootnotes":52},[1016],"footnotes",[59,1018,1021],{"className":1019,"id":51},[1020],"sr-only","Footnotes",[1023,1024,1025,1220,1233,1245,1259,1270,1282],"ol",{},[1026,1027,1029,1030,1035,1036,925,1043,925,1050,925,1057,925,1064,925,1071,925,1078,925,1085,925,1092,925,1100,925,1108,925,1116,925,1124,925,1132,925,1140,925,1148,925,1156,925,1164,925,1172,925,1180,925,1188,925,1196,925,1204,925,1212],"li",{"id":1028},"user-content-fn-bench","De aangeleverde benchmarksamenvatting en grafieken van ElioVP, met de ",[47,1031,1034],{"href":1032,"rel":1033},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FBENCHMARKS.md",[102],"gepubliceerde Paiton-benchmarkonderbouwing",". De volledige workload gebruikt runs 495 \u002F 494; de vergelijking met beperkte uitvoerlengte gebruikt runs 403 \u002F 493 \u002F 492. De cijfers zijn afkomstig uit de aangeleverde samenvatting, niet uit een hier gepubliceerd onbewerkt verzoeklog. ",[47,1037,1042],{"href":1038,"ariaLabel":1039,"className":1040,"dataFootnoteBackref":52},"#user-content-fnref-bench","Back to reference 1",[1041],"data-footnote-backref","↩",[47,1044,1042,1048],{"href":1045,"ariaLabel":1046,"className":1047,"dataFootnoteBackref":52},"#user-content-fnref-bench-2","Back to reference 1-2",[1041],[44,1049,116],{},[47,1051,1042,1055],{"href":1052,"ariaLabel":1053,"className":1054,"dataFootnoteBackref":52},"#user-content-fnref-bench-3","Back to reference 1-3",[1041],[44,1056,168],{},[47,1058,1042,1062],{"href":1059,"ariaLabel":1060,"className":1061,"dataFootnoteBackref":52},"#user-content-fnref-bench-4","Back to reference 1-4",[1041],[44,1063,252],{},[47,1065,1042,1069],{"href":1066,"ariaLabel":1067,"className":1068,"dataFootnoteBackref":52},"#user-content-fnref-bench-5","Back to reference 1-5",[1041],[44,1070,675],{},[47,1072,1042,1076],{"href":1073,"ariaLabel":1074,"className":1075,"dataFootnoteBackref":52},"#user-content-fnref-bench-6","Back to reference 1-6",[1041],[44,1077,919],{},[47,1079,1042,1083],{"href":1080,"ariaLabel":1081,"className":1082,"dataFootnoteBackref":52},"#user-content-fnref-bench-7","Back to reference 1-7",[1041],[44,1084,938],{},[47,1086,1042,1090],{"href":1087,"ariaLabel":1088,"className":1089,"dataFootnoteBackref":52},"#user-content-fnref-bench-8","Back to reference 1-8",[1041],[44,1091,270],{},[47,1093,1042,1097],{"href":1094,"ariaLabel":1095,"className":1096,"dataFootnoteBackref":52},"#user-content-fnref-bench-9","Back to reference 1-9",[1041],[44,1098,1099],{},"9",[47,1101,1042,1105],{"href":1102,"ariaLabel":1103,"className":1104,"dataFootnoteBackref":52},"#user-content-fnref-bench-10","Back to reference 1-10",[1041],[44,1106,1107],{},"10",[47,1109,1042,1113],{"href":1110,"ariaLabel":1111,"className":1112,"dataFootnoteBackref":52},"#user-content-fnref-bench-11","Back to reference 1-11",[1041],[44,1114,1115],{},"11",[47,1117,1042,1121],{"href":1118,"ariaLabel":1119,"className":1120,"dataFootnoteBackref":52},"#user-content-fnref-bench-12","Back to reference 1-12",[1041],[44,1122,1123],{},"12",[47,1125,1042,1129],{"href":1126,"ariaLabel":1127,"className":1128,"dataFootnoteBackref":52},"#user-content-fnref-bench-13","Back to reference 1-13",[1041],[44,1130,1131],{},"13",[47,1133,1042,1137],{"href":1134,"ariaLabel":1135,"className":1136,"dataFootnoteBackref":52},"#user-content-fnref-bench-14","Back to reference 1-14",[1041],[44,1138,1139],{},"14",[47,1141,1042,1145],{"href":1142,"ariaLabel":1143,"className":1144,"dataFootnoteBackref":52},"#user-content-fnref-bench-15","Back to reference 1-15",[1041],[44,1146,1147],{},"15",[47,1149,1042,1153],{"href":1150,"ariaLabel":1151,"className":1152,"dataFootnoteBackref":52},"#user-content-fnref-bench-16","Back to reference 1-16",[1041],[44,1154,1155],{},"16",[47,1157,1042,1161],{"href":1158,"ariaLabel":1159,"className":1160,"dataFootnoteBackref":52},"#user-content-fnref-bench-17","Back to reference 1-17",[1041],[44,1162,1163],{},"17",[47,1165,1042,1169],{"href":1166,"ariaLabel":1167,"className":1168,"dataFootnoteBackref":52},"#user-content-fnref-bench-18","Back to reference 1-18",[1041],[44,1170,1171],{},"18",[47,1173,1042,1177],{"href":1174,"ariaLabel":1175,"className":1176,"dataFootnoteBackref":52},"#user-content-fnref-bench-19","Back to reference 1-19",[1041],[44,1178,1179],{},"19",[47,1181,1042,1185],{"href":1182,"ariaLabel":1183,"className":1184,"dataFootnoteBackref":52},"#user-content-fnref-bench-20","Back to reference 1-20",[1041],[44,1186,1187],{},"20",[47,1189,1042,1193],{"href":1190,"ariaLabel":1191,"className":1192,"dataFootnoteBackref":52},"#user-content-fnref-bench-21","Back to reference 1-21",[1041],[44,1194,1195],{},"21",[47,1197,1042,1201],{"href":1198,"ariaLabel":1199,"className":1200,"dataFootnoteBackref":52},"#user-content-fnref-bench-22","Back to reference 1-22",[1041],[44,1202,1203],{},"22",[47,1205,1042,1209],{"href":1206,"ariaLabel":1207,"className":1208,"dataFootnoteBackref":52},"#user-content-fnref-bench-23","Back to reference 1-23",[1041],[44,1210,1211],{},"23",[47,1213,1042,1217],{"href":1214,"ariaLabel":1215,"className":1216,"dataFootnoteBackref":52},"#user-content-fnref-bench-24","Back to reference 1-24",[1041],[44,1218,1219],{},"24",[1026,1221,1223,1227,1228],{"id":1222},"user-content-fn-radiance",[47,1224,1226],{"href":100,"rel":1225},[102],"Documentatie van vLLM-Radiance",", met hetzelfde AMD Quark MXFP4-doelmodel, het DFlash2-profiel en expliciet gepubliceerde metingen op twee R9700's. Die externe metingen bieden context, maar vormen niet de referentie voor onze procentuele winst. ",[47,1229,1042],{"href":1230,"ariaLabel":1231,"className":1232,"dataFootnoteBackref":52},"#user-content-fnref-radiance","Back to reference 2",[1041],[1026,1234,1236,1239,1240],{"id":1235},"user-content-fn-betterbench",[47,1237,1007],{"href":1005,"rel":1238},[102],". De aantallen verzoeken, geselecteerde workloadinstellingen en bovenstaande resultaten komen uit onze aangeleverde runsamenvatting. ",[47,1241,1042],{"href":1242,"ariaLabel":1243,"className":1244,"dataFootnoteBackref":52},"#user-content-fnref-betterbench","Back to reference 3",[1041],[1026,1246,1248,1253,1254],{"id":1247},"user-content-fn-plugins",[47,1249,1252],{"href":1250,"rel":1251},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fdesign\u002Fplugin_system\u002F",[102],"Officiële documentatie van het vLLM-pluginsysteem",". ",[47,1255,1042],{"href":1256,"ariaLabel":1257,"className":1258,"dataFootnoteBackref":52},"#user-content-fnref-plugins","Back to reference 4",[1041],[1026,1260,1262,1253,1265],{"id":1261},"user-content-fn-paiton",[47,1263,1264],{"href":972},"Productinformatie over Paiton",[47,1266,1042],{"href":1267,"ariaLabel":1268,"className":1269,"dataFootnoteBackref":52},"#user-content-fnref-paiton","Back to reference 5",[1041],[1026,1271,1273,1253,1277],{"id":1272},"user-content-fn-model",[47,1274,1276],{"href":902,"rel":1275},[102],"Bijbehorende Paiton-modelrelease op Hugging Face",[47,1278,1042],{"href":1279,"ariaLabel":1280,"className":1281,"dataFootnoteBackref":52},"#user-content-fnref-model","Back to reference 6",[1041],[1026,1283,1285,1289,1290],{"id":1284},"user-content-fn-release",[47,1286,1288],{"href":928,"rel":1287},[102],"Paiton Qwen3.8 MXFP4 + DFlash2-runtimerelease",", met het runtimepakket en de release notes. ",[47,1291,1042],{"href":1292,"ariaLabel":1293,"className":1294,"dataFootnoteBackref":52},"#user-content-fnref-release","Back to reference 7",[1041],{"title":52,"searchDepth":1296,"depth":1296,"links":1297},2,[1298,1299,1300,1301,1302,1303,1304,1305,1306,1307,1308,1309,1313],{"id":61,"depth":1296,"text":62},{"id":93,"depth":1296,"text":94},{"id":146,"depth":1296,"text":147},{"id":303,"depth":1296,"text":304},{"id":347,"depth":1296,"text":348},{"id":409,"depth":1296,"text":410},{"id":483,"depth":1296,"text":484},{"id":638,"depth":1296,"text":639},{"id":702,"depth":1296,"text":703},{"id":761,"depth":1296,"text":762},{"id":889,"depth":1296,"text":890},{"id":956,"depth":1296,"text":957,"children":1310},[1311],{"id":978,"depth":1312,"text":979},3,{"id":51,"depth":1296,"text":1021},[973,1315,1316,1317,1318,1319,995],"AMD Radeon","Lokale AI","AI-inferentie","Inferentie-optimalisatie","Grote taalmodellen","2026-09-16T07:30:00Z","Paiton levert 57% meer Qwen3.8-doorvoer, 97% kortere mediane TTFT bij acht gelijktijdige verzoeken en 2,89× de geschatte cachecapaciteit op één R9700.","md","57% meer Qwen3.8-doorvoer. Dezelfde Radeon. Gewoon vLLM.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002F00-hero.webp",{},"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",{"title":5,"description":1321},"paiton-qwen38-mxfp4-dflash2-r9700","blog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","M-q2sDssO69jGGc6Qph-ye0crx8TAF2MdPWcFOU4Ye0",[1333,1335,1345,1357,1368,1381,1390,1405,1436,1448,1470,1488,1507,1526,1544,1561,1573,1589,1604,1616,1625,1633,1648,1660,1671,1682,1692,1705,1715,1728,1739,1749,1760,1769,1781,1792,1801],{"path":1327,"title":5,"description":1321,"date":1320,"slug":1329,"image":1324,"originalUrl":1326,"categories":1334},[973,1315,1316,1317,1318,1319,995],{"path":1336,"title":1337,"description":1338,"date":1339,"slug":1340,"image":1341,"originalUrl":1342,"categories":1343},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[973,1315,1316,1344,995],"GGUF",{"path":1346,"title":1347,"description":1348,"date":1349,"slug":1350,"image":1351,"originalUrl":1352,"categories":1353},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[973,1315,1316,1354,1355,1356],"Videogeneratie","MiniMax H3","ComfyUI",{"path":1358,"title":1359,"description":1360,"date":1361,"slug":1362,"image":1363,"originalUrl":1364,"categories":1365},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[973,1315,1316,1366,1367,1356],"Beeldgeneratie","FLUX",{"path":1369,"title":1370,"description":1371,"date":1372,"slug":1373,"image":1374,"originalUrl":1375,"categories":1376},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[973,1377,1315,1317,1378,1379,1318,1319,995,1380],"Kunstmatige intelligentie","GPU-prestaties","Inferentielatentie","Kostenefficiëntie",{"path":1382,"title":1383,"description":1384,"date":1385,"slug":1386,"image":1387,"originalUrl":1388,"categories":1389},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[973,1377,1315,1317,1378,1379,1318,1319,995,1380],{"path":1391,"title":1392,"description":1393,"date":1394,"slug":1395,"image":1396,"originalUrl":1397,"categories":1398},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[1399,1400,1401,1402,1403,1404],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1406,"title":1407,"description":1408,"date":1409,"slug":1410,"image":1411,"originalUrl":1412,"categories":1413},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1399,1377,973,1414,1415,1416,1417,1418,1419,1420,1421,1422,781,1423,1424,1425,1426,1427,1428,1429,973,1430,1431,1432,1433,1434,1435],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1437,"title":1438,"description":1439,"date":1440,"slug":1441,"image":1442,"originalUrl":1443,"categories":1444},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1399,1377,1445,1446,1415,1447,1445,1427],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1449,"title":1450,"description":1451,"date":1452,"slug":1453,"image":1454,"originalUrl":1455,"categories":1456},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1399,1377,1457,1446,1458,1459,1460,1461,1462,1463,1464,1465,1421,1466,1422,1467,1468,1469],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1471,"title":1472,"description":1473,"date":1474,"slug":1475,"image":1476,"originalUrl":1477,"categories":1478},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1399,1479,1480,1481,1463,1482,1483,1484,1466,1485,1486,1487,1468],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1489,"title":1490,"description":1491,"date":1492,"slug":1493,"image":1494,"originalUrl":1495,"categories":1496},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1399,1377,1497,1457,1498,1499,1500,1501,1502,1503,1504,1505,1430,1506],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1508,"title":1509,"description":1510,"date":1511,"slug":1512,"image":1513,"originalUrl":1514,"categories":1515},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1399,1377,1457,1516,1517,1518,1519,1520,1521,1522,1523,1524,1525],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1527,"title":1528,"description":1529,"date":1530,"slug":1531,"image":1532,"originalUrl":1533,"categories":1534},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1399,1445,1446,1535,1400,1536,1537,1538,1539,1540,1541,1542,1543],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1545,"title":1546,"description":1547,"date":1548,"slug":1549,"image":1550,"originalUrl":1551,"categories":1552},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1399,1377,973,1446,1553,1377,1554,1555,1556,1557,1558,1559,973,1560],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning","ROCm",{"path":1562,"title":1563,"description":1564,"date":1565,"slug":1566,"image":1567,"originalUrl":1568,"categories":1569},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1399,1377,973,1317,1570,1553,1380,1571,1318,1559,973,1572,995],"AMD Instinct","Hoge throughput","SGLang",{"path":1574,"title":1575,"description":1576,"date":1577,"slug":1578,"image":1579,"originalUrl":1580,"categories":1581},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1399,1377,973,1582,1553,1583,1318,1584,1585,1586,1587,973,1588],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1590,"title":1591,"description":1592,"date":1593,"slug":1594,"image":1595,"originalUrl":1596,"categories":1597},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1399,1377,1497,1446,1498,1598,1599,1600,1601,1503,1505,1430,1602,1603],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1605,"title":1606,"description":1607,"date":1608,"slug":1609,"image":1610,"originalUrl":1611,"categories":1612},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1399,1377,973,1446,1613,1415,1416,1614,1615,1426,1427,973,995],"AI","H200","MI300X",{"path":1617,"title":1618,"description":1619,"date":1620,"slug":1621,"image":1622,"originalUrl":1623,"categories":1624},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1399,1377,1497,1498,1598,1599,1600,1601,1503,1505,1430,1602,1603],{"path":1626,"title":1627,"description":1628,"date":1629,"slug":1630,"image":52,"originalUrl":1631,"categories":1632},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1399,1377,973],{"path":1634,"title":1635,"description":1636,"date":1637,"slug":1638,"image":1639,"originalUrl":1640,"categories":1641},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1399,1377,973,1446,1317,1553,1642,1555,1643,1644,1645,973,1646,1647],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1649,"title":1650,"description":1651,"date":1652,"slug":1653,"image":1654,"originalUrl":1655,"categories":1656},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1399,1377,973,1446,1553,1657,1502,1422,1378,1379,1319,1644,1658,1659],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1661,"title":1662,"description":1663,"date":1664,"slug":1665,"image":1666,"originalUrl":1667,"categories":1668},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1399,1377,973,1497,1446,1415,1615,1427,1669,1670],"RX7900XTX","tenstorrent",{"path":1672,"title":1673,"description":1674,"date":1675,"slug":1676,"image":1677,"originalUrl":1678,"categories":1679},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1399,1377,1445,1497,1416,1614,1680,1427,1681],"MI325X","P&L-calculator",{"path":1683,"title":1684,"description":1685,"date":1686,"slug":1687,"image":1688,"originalUrl":1689,"categories":1690},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1399,1377,973,1613,1415,1614,1691,1427,973,995],"MI300",{"path":1693,"title":1694,"description":1695,"date":1696,"slug":1697,"image":1698,"originalUrl":1699,"categories":1700},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1399,1445,1701,1516,1537,1403,1538,1539,1702,1703,1542,1704],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1706,"title":1707,"description":1708,"date":1709,"slug":1710,"image":1711,"originalUrl":1712,"categories":1713},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1399,1377,1497,1446,1613,1415,1714],"Zorg",{"path":1716,"title":1717,"description":1718,"date":1719,"slug":1720,"image":1721,"originalUrl":1722,"categories":1723},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1399,1457,1613,1415,1724,1725,1726,1727],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":1729,"title":1730,"description":1731,"date":1732,"slug":1733,"image":1734,"originalUrl":1735,"categories":1736},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1399,1377,1497,1613,1737,1738],"AI-agenten","ERP",{"path":1740,"title":1741,"description":1742,"date":1743,"slug":1744,"image":1745,"originalUrl":1746,"categories":1747},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1399,1377,1457,1748,1415,781,1427],"AI-nieuws",{"path":1750,"title":1751,"description":1752,"date":1753,"slug":1754,"image":1755,"originalUrl":1756,"categories":1757},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1399,1377,973,1613,1415,1758,1759,1615,973],"benchmark","LLM",{"path":1761,"title":1762,"description":1763,"date":1764,"slug":1765,"image":1766,"originalUrl":1767,"categories":1768},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1399,1377,973],{"path":1770,"title":1771,"description":1772,"date":1773,"slug":1774,"image":1775,"originalUrl":1776,"categories":1777},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1399,1415,1778,1779,1780],"Jim Greene","Podcast","Tech Talk",{"path":1782,"title":1783,"description":1784,"date":1785,"slug":1786,"image":1787,"originalUrl":1788,"categories":1789},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1399,1377,973,1415,1790,1791,1614,1615,1680,973,995],"DeepSeek","H100",{"path":1793,"title":1794,"description":1795,"date":1796,"slug":1797,"image":1798,"originalUrl":1799,"categories":1800},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1399,1377,973,1415,1790,1791,1614,1615,1680,973,995],{"path":1802,"title":1803,"description":1804,"date":1805,"slug":1806,"image":1807,"originalUrl":1808,"categories":1809},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1399,1377,973,1415,1791,1614,1615,1680,973,995],1789564930416]