[{"data":1,"prerenderedAt":1223},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700":3,"blog-posts-sidebar-nl":792},{"id":4,"title":5,"body":6,"categories":768,"date":779,"description":780,"extension":781,"heading":782,"image":783,"meta":784,"navigation":785,"originalUrl":786,"path":787,"seo":788,"slug":789,"stem":790,"__hash__":791},"blogNl\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700.md","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700",{"type":7,"value":8,"toc":758},"minimark",[9,16,31,46,54,63,70,75,86,97,173,193,205,208,212,215,288,298,306,312,315,319,322,329,356,362,365,368,372,383,386,389,458,464,470,473,477,480,491,494,497,500,509,513,516,577,580,588,601,604,608,733,736,740,743,746,754],[10,11,12],"p",{},[13,14,15],"strong",{},"Eén workstation-GPU. Een antwoord van 256 tokens was na mediaan 5,12 seconden volledig gegenereerd. Zonder inferentie-API in de cloud.",[10,17,18,19,26,27,30],{},"Paiton draait het publiek beschikbare ",[20,21,25],"a",{"href":22,"rel":23},"https:\u002F\u002Fhuggingface.co\u002FCapicua25x\u002FOrnith-1.5-35B-A3B-MXFP4-Quark-RDNA4",[24],"nofollow","Ornith 1.5 35B A3B MXFP4-checkpoint"," met gemiddeld ",[13,28,29],{},"44,63 outputtokens per seconde"," op één AMD Radeon AI PRO R9700.",[10,32,33,34,37,38,41,42,45],{},"De snelste gekwalificeerde standaard-vLLM-configuratie op dezelfde machine behaalde ",[13,35,36],{},"35,13 outputtokens per seconde",". Paiton levert daarmee ",[13,39,40],{},"27,03% meer outputthroughput"," en verlaagt de gemodelleerde tijdsgebonden kosten per gegenereerde token met ",[13,43,44],{},"21,28%",".",[10,47,48,49,53],{},"Onze eerdere ",[20,50,52],{"href":51},"\u002Fnl\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Qwen3.8-benchmark"," testte drie verschillende promptprofielen. Deze release beantwoordt een andere vraag: passen een mixture-of-experts-model van ongeveer 35B, de speculatieve draft en een bruikbare servingruntime samen op één kaart van 32 GB, terwijl het systeem snel genoeg blijft voor lokaal gebruik?",[55,56,57],"blockquote",{},[10,58,59,62],{},[13,60,61],{},"Afbakening van de benchmark:"," 256 gevraagde inputtokens, 256 outputtokens, één actieve sequentie, temperatuur nul en thinking uitgeschakeld. Na toepassing van de chattemplate telden de prompts in werkelijkheid 268 tot 270 tokens. Het cijfer in de titel meet de generatie van outputtokens, niet de snelheid van promptverwerking, codering met een lange context, toolgebruik of gelijktijdige serving.",[10,64,65],{},[66,67],"img",{"alt":68,"src":69},"Paiton draait Ornith 1.5 met 44,63 outputtokens per seconde op één Radeon AI PRO R9700, 27,0% sneller dan het beste gekwalificeerde resultaat met standaard-vLLM.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F01-throughput-ornith15-eliovp.webp",[71,72,74],"h2",{"id":73},"een-35b-model-dat-echt-past","Een 35B-model dat echt past",[10,76,77,78,81,82,85],{},"Ornith 1.5 35B A3B is een mixture-of-experts-model. De aanduiding ",[13,79,80],{},"A3B"," betekent dat voor elke token ongeveer 3 miljard parameters worden geactiveerd. Dit betekent ",[13,83,84],{},"niet"," dat het volledige model evenveel geheugen inneemt als een 3B-model. De volledige verzameling experts moet nog steeds in het geheugen worden opgeslagen.",[10,87,88,89,92,93,96],{},"Het geteste MXFP4-target is ongeveer ",[13,90,91],{},"22,9 GB"," groot. De publieke DFlash-draft voegt daar ongeveer ",[13,94,95],{},"772 MB"," aan toe. Samen passen ze binnen de 32 GB VRAM van de R9700, inclusief de gekwalificeerde runtime en een gereserveerde KV-cache.",[98,99,100,113],"table",{},[101,102,103],"thead",{},[104,105,106,110],"tr",{},[107,108,109],"th",{},"Wat u nodig hebt",[107,111,112],{},"Gepubliceerd pakket",[114,115,116,125,133,141,149,157,165],"tbody",{},[104,117,118,122],{},[119,120,121],"td",{},"GPU",[119,123,124],{},"Eén Radeon AI PRO R9700, 32 GB",[104,126,127,130],{},[119,128,129],{},"Runtimeplatform",[119,131,132],{},"Linux, Docker en ROCm 7.14",[104,134,135,138],{},[119,136,137],{},"Download bij de eerste start",[119,139,140],{},"Target van 22,9 GB + draft van 772 MB",[104,142,143,146],{},[119,144,145],{},"Tijdelijk vrije schijfruimte",[119,147,148],{},"Ongeveer 48 GB tijdens de eerste voorbereiding",[104,150,151,154],{},[119,152,153],{},"Maximale context",[119,155,156],{},"8.192 tokens",[104,158,159,162],{},[119,160,161],{},"Toegang",[119,163,164],{},"Terminalchat + OpenAI-compatibele API",[104,166,167,170],{},[119,168,169],{},"Gekwalificeerd servingbereik",[119,171,172],{},"Alleen tekst, één actieve sequentie",[10,174,175,176,181,182,186,187,192],{},"De ",[20,177,180],{"href":178,"rel":179},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin",[24],"publieke runtimeplugin"," heeft een Apache 2.0-licentie. Het ",[20,183,185],{"href":22,"rel":184},[24],"targetcheckpoint"," heeft een MIT-licentie en de ",[20,188,191],{"href":189,"rel":190},"https:\u002F\u002Fhuggingface.co\u002Fz-lab\u002FQwen3.6-35B-A3B-DFlash",[24],"DFlash-draft"," heeft een Apache 2.0-licentie. De Paiton-compiler zelf wordt niet verspreid.",[10,194,195,196,201,202,204],{},"Het ",[20,197,200],{"href":198,"rel":199},"https:\u002F\u002Fhuggingface.co\u002Fornith-ai\u002FOrnith-1.5-35B-A3B",[24],"upstream Ornith-team"," richt zich op codeerwerk en agentic workflows. Het publiceert servingvoorbeelden met 262.144 tokens en toolgebruik. Dat maakt Ornith relevant voor lokaal gebruik en niet alleen voor een synthetische capaciteitstest. Die bredere mogelijkheden vallen echter ",[13,203,84],{}," binnen de kwalificatie van dit pakket. Het gepubliceerde Paiton-traject is beperkt tot 8.192 tokens en alleen tekst. Automatische toolselectie valt buiten het geteste bereik van deze release.",[10,206,207],{},"Die afbakening is belangrijk. Wie lokale AI evalueert, wil meer weten dan alleen of een checkpoint kan worden geladen: wat past er, wat start betrouwbaar, welke API is beschikbaar en waar houdt de kwalificatie op?",[71,209,211],{"id":210},"waar-de-winst-van-27-vandaan-komt","Waar de winst van 27% vandaan komt",[10,213,214],{},"Het grootste deel van de winst is al aanwezig voordat speculatieve decoding wordt ingeschakeld.",[98,216,217,234],{},[101,218,219],{},[104,220,221,224,228,231],{},[107,222,223],{},"Runtime",[107,225,227],{"align":226},"right","Outputtokens\u002Fs",[107,229,230],{"align":226},"Mediane TPOT",[107,232,233],{"align":226},"Verschil met standaard-vLLM",[114,235,236,250,266],{},[104,237,238,241,244,247],{},[119,239,240],{},"Snelste gekwalificeerde standaard-vLLM",[119,242,243],{"align":226},"35,132",[119,245,246],{"align":226},"27,457 ms",[119,248,249],{"align":226},"Referentie",[104,251,252,255,258,261],{},[119,253,254],{},"Paiton zonder DFlash",[119,256,257],{"align":226},"43,405",[119,259,260],{"align":226},"21,926 ms",[119,262,263],{"align":226},[13,264,265],{},"+23,55%",[104,267,268,273,278,283],{},[119,269,270],{},[13,271,272],{},"Paiton met DFlash, gemiddelde van twee runs",[119,274,275],{"align":226},[13,276,277],{},"44,628",[119,279,280],{"align":226},[13,281,282],{},"18,864 ms",[119,284,285],{"align":226},[13,286,287],{},"+27,03%",[10,289,290,291,294,295,45],{},"Zonder speculatieve decoding levert het Paiton-pad voor het targetmodel al ",[13,292,293],{},"23,55% meer throughput dan standaard-vLLM",". DFlash verhoogt het resultaat vervolgens van 43,405 naar 44,628 tokens per seconde, een extra winst van ",[13,296,297],{},"2,82% ten opzichte van Paiton zonder speculatie",[10,299,300,305],{},[20,301,304],{"href":302,"rel":303},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2602.06036",[24],"DFlash"," gebruikt een lichtgewicht block-diffusion-draftmodel om meerdere volgende tokens parallel voor te stellen. Ornith controleert die voorstellen, aanvaardt het geldige begin en behoudt de uiteindelijke controle over de gegenereerde output.",[10,307,308],{},[66,309],{"alt":310,"src":311},"DFlash stelt tokenblokken parallel voor en Ornith controleert ze. Paiton levert het grootste deel van de gemeten winst. DFlash voegt daar nog 2,8% aan toe ten opzichte van Paiton alleen.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F04-dflash-ornith15-eliovp.webp",[10,313,314],{},"DFlash zorgt voor de laatste versnelling, maar niet voor de volledige winst van 27%. Hier stopt de publieke technische toelichting. De gegenereerde kernels, fusiekeuzes, planningen en runtimemechanismen van Paiton blijven bedrijfseigen.",[71,316,318],{"id":317},"de-start-komt-20-ms-later-het-volledige-antwoord-266-seconden-eerder","De start komt 20 ms later, het volledige antwoord 2,66 seconden eerder",[10,320,321],{},"Generatiesnelheid is slechts één onderdeel van de gebruikerservaring. Een lokale gebruiker merkt ook hoe snel het model begint en hoelang het duurt voordat het volledige antwoord klaar is.",[10,323,324,325,328],{},"Voor deze workload nam de mediane tijd tot de eerste token toe van ongeveer ",[13,326,327],{},"290 ms tot 310 ms",". Zodra de generatie begon, maakte de snellere tokenstream die vertraging van 20 ms ruimschoots goed:",[330,331,332,343,349],"ul",{},[333,334,335,336,339,340,45],"li",{},"De mediane tijd per outputtoken daalde van ",[13,337,338],{},"27,46 ms tot 18,86 ms",", een vermindering van ",[13,341,342],{},"31,3%",[333,344,345,346,45],{},"De mediane end-to-endtijd daalde van ongeveer ",[13,347,348],{},"7,78 seconden tot 5,12 seconden",[333,350,351,352,355],{},"Het volledige antwoord van 256 tokens was ongeveer ",[13,353,354],{},"2,66 seconden eerder"," klaar.",[10,357,358],{},[66,359],{"alt":360,"src":361},"Paiton begint ongeveer 20 milliseconden later aan het Ornith 1.5-antwoord, maar voltooit het 2,66 seconden eerder.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F02-latency-ornith15-eliovp.webp",[10,363,364],{},"Dit is het volledige latencyverhaal: een iets tragere eerste token en een duidelijk sneller volledig antwoord. Bij speculatieve decoding meet TPOT het tempo van de tokenstream. Het is niet rechtstreeks het omgekeerde van de throughput van een volledig verzoek, omdat geaccepteerde tokens in blokken kunnen binnenkomen. De throughput van volledige verzoeken en de end-to-endtijd blijven hier de belangrijkste maatstaven.",[10,366,367],{},"Workloads die voornamelijk uit de verwerking van grote prompts bestaan, vereisen afzonderlijke metingen van de promptverwerking. Dit artikel leidt die niet af uit de decodethroughput.",[71,369,371],{"id":370},"meer-output-uit-hetzelfde-actieve-uur","Meer output uit hetzelfde actieve uur",[10,373,374,375,378,379,382],{},"Bij de gemeten snelheden heeft standaard-vLLM ongeveer ",[13,376,377],{},"7,91 actieve uren"," nodig om één miljoen outputtokens te genereren. Paiton met DFlash heeft ongeveer ",[13,380,381],{},"6,22 uur"," nodig.",[10,384,385],{},"Daarom leidt 27,03% meer throughput tot 21,28% lagere kosten: de kosten per token zijn omgekeerd evenredig met de throughput.",[10,387,388],{},"We gebruiken hetzelfde illustratieve eigendomsmodel als in het Qwen3.8-artikel, met 5.000 productieve inferentie-uren, hetzelfde systeemverbruik van 450 W, aankoopprijzen van $ 1.299 of € 1.749 en elektriciteitstarieven van $ 0,17 of € 0,2558 per kWh. Dat geeft het volgende resultaat:",[98,390,391,404],{},[101,392,393],{},[104,394,395,398,401],{},[107,396,397],{},"Economie van interactieve tokens",[107,399,400],{"align":226},"Gekwalificeerde standaard-vLLM",[107,402,403],{"align":226},"Paiton + DFlash",[114,405,406,419,432,445],{},[104,407,408,411,414],{},[119,409,410],{},"Uren per miljoen outputtokens",[119,412,413],{"align":226},"7,91",[119,415,416],{"align":226},[13,417,418],{},"6,22",[104,420,421,424,427],{},[119,422,423],{},"Gemodelleerde Amerikaanse kosten per miljoen",[119,425,426],{"align":226},"$ 2,66",[119,428,429],{"align":226},[13,430,431],{},"$ 2,09",[104,433,434,437,440],{},[119,435,436],{},"Gemodelleerde Europese kosten per miljoen",[119,438,439],{"align":226},"€ 3,68",[119,441,442],{"align":226},[13,443,444],{},"€ 2,89",[104,446,447,450,453],{},[119,448,449],{},"Output over 5.000 actieve uren",[119,451,452],{"align":226},"632,4 miljoen",[119,454,455],{"align":226},[13,456,457],{},"803,3 miljoen",[10,459,460,461,45],{},"Volgens dit model produceert dezelfde kaart over 5.000 productieve uren ongeveer ",[13,462,463],{},"171 miljoen extra outputtokens",[10,465,466],{},[66,467],{"alt":468,"src":469},"Bij 5.000 productieve inferentie-uren dalen de gemodelleerde Europese kosten met Paiton en DFlash van € 3,68 naar € 2,89 per miljoen outputtokens.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F03-economics-ornith15-eliovp.webp",[10,471,472],{},"Dit is een tijdsgebonden eigendomsmodel en geen claim over gemeten energie-efficiëntie aan het stopcontact. Het model gaat uit van hetzelfde systeemverbruik en houdt geen rekening met de hostcomputer, inactieve tijd, koeling, onderhoud, financiering, belastingen of restwaarde.",[71,474,476],{"id":475},"waarom-de-vergelijking-met-standaard-vllm-geloofwaardig-is","Waarom de vergelijking met standaard-vLLM geloofwaardig is",[10,478,479],{},"We vergeleken Paiton niet met een standaardinstallatie of een bewust zwakke configuratie. De geselecteerde standaardconfiguratie was het snelste stabiele resultaat dat we behaalden na tests met de beschikbare instellingen voor uitvoering, graphs, attention, recurrente verwerking en mixture-of-experts.",[10,481,482,483,487,488,45],{},"De configuratie gebruikte de vastgezette, ongewijzigde ROCm-versie van vLLM, O2-compilatie, graph capture met batchgrootte één, Triton-attention, Triton GDN-decode, de niet-gefuseerde Triton MoE-backend, uitgeschakelde DFlash en hetzelfde ondersteunde prestatieniveau ",[484,485,486],"code",{},"AUTO"," met het vermogensprofiel ",[484,489,490],{},"COMPUTE",[10,492,493],{},"Beide configuraties gebruikten dezelfde GPU, hetzelfde checkpoint, dezelfde tokenizer, vastgezette vLLM-revisie, verzoekgegevens, random seed, outputlengte, concurrency en hetzelfde GPU-profiel. Voor het headlinecijfer krijgt standaard-vLLM zijn snelste gekwalificeerde resultaat. Dat vergelijken we met het gemiddelde van twee Paiton-runs, telkens vanaf een nieuw gestarte server.",[10,495,496],{},"De standaardconfiguratie voltooide alle 12 gemeten verzoeken. De twee Paiton-runs voltooiden alle 24 verzoeken en leverden telkens het gevraagde aantal outputtokens. Een deterministisch verzoek in natuurlijke taal voor en na de Paiton-runs bleef leesbaar, stopte op een natuurlijke manier, leverde eindige logwaarschijnlijkheden op en was byte-identiek.",[10,498,499],{},"Die laatste stap is een praktische controle op correcte serving. Het is geen academische nauwkeurigheidsevaluatie, codeerbenchmark of bewijs dat de kwaliteit gelijk is aan die van het upstream model. Test het gekwantiseerde checkpoint voor implementatie met uw eigen prompts en acceptatiecriteria.",[10,501,502,503,508],{},"Het publieke ",[20,504,507],{"href":505,"rel":506},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fmain\u002Fmodels\u002FOrnith-1.5\u002FBENCHMARKS.md",[24],"Ornith-benchmarkrapport"," bevat de gepubliceerde workload, standaardinstellingen en het reproductiecommando.",[71,510,512],{"id":511},"ornith-15-lokaal-uitvoeren","Ornith 1.5 lokaal uitvoeren",[10,514,515],{},"Dit is een gecontroleerd traject voor Linux en Docker op één Radeon AI PRO R9700 met ROCm 7.14. Start de server en open de meegeleverde terminalchat met één commando:",[517,518,523],"pre",{"className":519,"code":520,"language":521,"meta":522,"style":522},"language-bash shiki shiki-themes github-light github-dark","git clone --depth 1 https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git \\\n  && cd paiton-vllm-plugin \\\n  && .\u002Fmodels\u002FOrnith-1.5\u002Fserve-docker.sh --chat\n","bash","",[484,524,525,551,566],{"__ignoreMap":522},[526,527,530,534,538,542,545,548],"span",{"class":528,"line":529},"line",1,[526,531,533],{"class":532},"sScJk","git",[526,535,537],{"class":536},"sZZnC"," clone",[526,539,541],{"class":540},"sj4cs"," --depth",[526,543,544],{"class":540}," 1",[526,546,547],{"class":536}," https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git",[526,549,550],{"class":540}," \\\n",[526,552,554,558,561,564],{"class":528,"line":553},2,[526,555,557],{"class":556},"sVt8B","  && ",[526,559,560],{"class":540},"cd",[526,562,563],{"class":536}," paiton-vllm-plugin",[526,565,550],{"class":540},[526,567,569,571,574],{"class":528,"line":568},3,[526,570,557],{"class":556},[526,572,573],{"class":532},".\u002Fmodels\u002FOrnith-1.5\u002Fserve-docker.sh",[526,575,576],{"class":540}," --chat\n",[10,578,579],{},"Bij de eerste start worden het vastgezette publieke target en de DFlash-draft gedownload. Daarna maakt het systeem een gebruiksklare kopie in een permanent Docker-volume. Dezelfde server biedt een OpenAI-compatibel endpoint op:",[517,581,586],{"className":582,"code":584,"language":585,"meta":522},[583],"language-text","http:\u002F\u002F127.0.0.1:8000\u002Fv1\u002Fchat\u002Fcompletions\n","text",[484,587,584],{"__ignoreMap":522},[10,589,590,591,594,595,600],{},"Gebruik de modelnaam ",[484,592,593],{},"ornith",". De publieke ",[20,596,599],{"href":597,"rel":598},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Ftree\u002Fmain\u002Fmodels\u002FOrnith-1.5",[24],"pakketdocumentatie"," bevat het rechtstreekse Docker-commando, de optie om DFlash uit te schakelen en de exacte gebruiksgrenzen.",[10,602,603],{},"De image bevat de runtimeplugin en het gecompileerde Paiton-artefact. Ze bevat geen modelgewichten en geen broncode van de Paiton-compiler.",[71,605,607],{"id":606},"geteste-configuratie","Geteste configuratie",[98,609,610,620],{},[101,611,612],{},[104,613,614,617],{},[107,615,616],{},"Onderdeel",[107,618,619],{},"Geteste waarde",[114,621,622,632,640,650,658,666,676,686,696,704,711,717,725],{},[104,623,624,626],{},[119,625,121],{},[119,627,628,629],{},"AMD Radeon AI PRO R9700, 32 GB, ",[484,630,631],{},"gfx1201",[104,633,634,637],{},[119,635,636],{},"Model",[119,638,639],{},"Ornith 1.5 35B A3B MXFP4 Quark RDNA4",[104,641,642,645],{},[119,643,644],{},"Modelrevisie",[119,646,647],{},[484,648,649],{},"9e488f46c0f7969f84c9923ee0256311cd50316e",[104,651,652,655],{},[119,653,654],{},"Grootte target \u002F draft",[119,656,657],{},"22,9 GB \u002F 772 MB",[104,659,660,663],{},[119,661,662],{},"ROCm",[119,664,665],{},"7.14",[104,667,668,671],{},[119,669,670],{},"vLLM-revisie",[119,672,673],{},[484,674,675],{},"39bd959b582c85e78e7e0326d49042ce7c3c07ed",[104,677,678,681],{},[119,679,680],{},"Paiton-image",[119,682,683],{},[484,684,685],{},"ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin:ornith15-mxfp4-rdna4-v1.0.0",[104,687,688,691],{},[119,689,690],{},"Geteste digest",[119,692,693],{},[484,694,695],{},"sha256:f8feb0ea85e36f681eaf4f6c1d534551e4e0d1d98bf479f1cb6b6236a5893de2",[104,697,698,701],{},[119,699,700],{},"Tensorparallelisme",[119,702,703],{},"1",[104,705,706,709],{},[119,707,708],{},"Maximaal aantal actieve sequenties",[119,710,703],{},[104,712,713,715],{},[119,714,153],{},[119,716,156],{},[104,718,719,722],{},[119,720,721],{},"Gereserveerde KV-cache",[119,723,724],{},"3 GiB",[104,726,727,730],{},[119,728,729],{},"Gekwalificeerd bereik",[119,731,732],{},"Alleen tekst, inferentie voor één gebruiker",[10,734,735],{},"Het pakket weigert te starten wanneer de GPU, het checkpoint of het servingcontract niet wordt ondersteund. Extra verzoeken worden in een wachtrij geplaatst in plaats van een niet-gekwalificeerd gelijktijdig traject te gebruiken.",[71,737,739],{"id":738},"van-een-workstationresultaat-naar-economische-impact-in-productie","Van een workstationresultaat naar economische impact in productie",[10,741,742],{},"De Qwen3.8-release liet zien dat Paiton drie verschillende promptprofielen op de R9700 versnelde. Ornith voegt een ander bewijs toe: een 35B MoE-target en een speculatieve draft passen op één kaart van 32 GB, werken via een vertrouwde API en genereren 44,63 outputtokens per seconde.",[10,744,745],{},"Voor lokale gebruikers betekent dit een sneller privé-modelendpoint zonder afhankelijkheid van een gehoste prijs per token. Voor operators met AMD Instinct CDNA-infrastructuur is de hefboom groter: elk procent winst telt door over accelerators, modellen en miljarden gegenereerde tokens.",[10,747,748,749,753],{},"Draait u een AMD-tokenfabriek? ",[20,750,752],{"href":751},"\u002Fnl\u002Fproducts\u002Fpaiton","Bezorg ons uw model, verkeersprofiel en huidige baseline",". Wij tonen waar throughput, latency en kosten per gegenereerde token kunnen verbeteren.",[755,756,757],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":522,"searchDepth":553,"depth":553,"links":759},[760,761,762,763,764,765,766,767],{"id":73,"depth":553,"text":74},{"id":210,"depth":553,"text":211},{"id":317,"depth":553,"text":318},{"id":370,"depth":553,"text":371},{"id":475,"depth":553,"text":476},{"id":511,"depth":553,"text":512},{"id":606,"depth":553,"text":607},{"id":738,"depth":553,"text":739},[769,770,771,772,773,774,775,776,777,778],"Paiton","Kunstmatige intelligentie","AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","vLLM","Kostenefficiëntie","2026-09-05T09:00:00","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","md","Een 35B MoE met 44,6 tok\u002Fs op één GPU van 32 GB","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp",{},true,"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",{"title":5,"description":780},"paiton-ornith15-radeon-ai-pro-r9700","blog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","IH3wDSqO-BOco8GeUbaBQ7bRLE-VqQxMEo8K7OQRS44",[793,795,804,819,850,862,884,902,921,940,958,974,986,1002,1017,1029,1038,1046,1061,1073,1084,1095,1105,1118,1128,1141,1152,1162,1173,1182,1194,1205,1214],{"path":787,"title":5,"description":780,"date":779,"slug":789,"image":783,"originalUrl":786,"categories":794},[769,770,771,772,773,774,775,776,777,778],{"path":796,"title":797,"description":798,"date":799,"slug":800,"image":801,"originalUrl":802,"categories":803},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[769,770,771,772,773,774,775,776,777,778],{"path":805,"title":806,"description":807,"date":808,"slug":809,"image":810,"originalUrl":811,"categories":812},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom vermelden offertes voor AI-datacenters verschillende GPU-capaciteiten? Ontdek hoe PUE, piekbelasting, opslag, netwerken en koeling bepalen hoeveel compute werkelijk inzetbaar is.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[813,814,815,816,817,818],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":820,"title":821,"description":822,"date":823,"slug":824,"image":825,"originalUrl":826,"categories":827},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Paiton keert terug naar zijn diffusiewortels: optimalisatie van Wan2.2-T2V-A14B op AMD MI355X","Toen we begonnen met het bouwen van Paiton, was een van onze eerste aandachtsgebieden het optimaliseren van diffusiemodellen. Stable Diffusion XL was een van de eerste grote modellen waarin we lieten zien dat gefuseerde operators, efficiënte uitvoering en hardwarebewuste kernels een echt verschil konden maken. Nu keren we terug naar die oorsprong. Met de groeiende belangstelling voor het genereren van tekst-naar-video, ...","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[813,770,769,828,829,830,831,832,833,834,835,836,121,837,838,839,840,841,842,843,769,844,845,846,847,848,849],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":851,"title":852,"description":853,"date":854,"slug":855,"image":856,"originalUrl":857,"categories":858},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","Van zolder tot voorpagina: ElioVP erkend als pionier op het gebied van chipoptimalisatie en datacenterinfrastructuur","Het waren bijzondere weken voor het team van Eliovp. Ons bedrijf haalde de voorpagina van De Tijd, de toonaangevende zakenkrant van België. Ons verhaal begon bij een oprichter die op zolder aan hardware sleutelde en groeide uit tot een onderneming met 215 miljoen euro omzet.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[813,770,859,860,829,861,859,841],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":863,"title":864,"description":865,"date":866,"slug":867,"image":868,"originalUrl":869,"categories":870},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","Privacy is geen IT-probleem meer, het is een strategische prioriteit","Privacyrisico's, psychologische valkuilen en de operationele realiteit van generatieve AI in de Benelux. Waarom bedrijven gevoelige gegevens, governance en lokale AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[813,770,871,860,872,873,874,875,876,877,878,879,835,880,836,881,882,883],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":885,"title":886,"description":887,"date":888,"slug":889,"image":890,"originalUrl":891,"categories":892},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Itsme? Bij ons is het “it's not me”, en dit is waarom.","Waarom Eliovp itsme niet gebruikt voor medewerkers en interne processen: een analyse van datasoevereiniteit, cloudjurisdictie, metadata, eigendomsstructuur en technische risico's.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[813,893,894,895,877,896,897,898,880,899,900,901,882],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":903,"title":904,"description":905,"date":906,"slug":907,"image":908,"originalUrl":909,"categories":910},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","De verwachtingen rond Agentic AI staan vaak ver af van de technische realiteit. Dit praktijkrapport beschrijft wat er nodig is om betrouwbare, lokale AI-agents voor bedrijfsworkflows te bouwen, van modulaire architectuur en observability tot modeltraining, VRAM en soevereine infrastructuur.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[813,770,911,871,912,913,914,915,916,917,918,919,844,920],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":922,"title":923,"description":924,"date":925,"slug":926,"image":927,"originalUrl":928,"categories":929},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Hoe AI-neocloudinfrastructuur circulaire kasstromen omzet in schijngroei. Tussen 2023 en 2025 stroomden miljarden aan durfkapitaal naar het neocloudecosysteem. Onze analyse onderzoekt hoe circulaire financiering, vaporware-infrastructuur en roofzuchtige contracten onderliggende activawaarden kunstmatig kunnen opbouwen.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[813,770,871,930,931,932,933,934,935,936,937,938,939],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":941,"title":942,"description":943,"date":944,"slug":945,"image":946,"originalUrl":947,"categories":948},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","De motor voor de AI-race bouwen: in vier maanden klaar voor NVIDIA GB300 NVL72","Bij AI-infrastructuur is snelheid een concurrentieel voordeel. Traditionele datacenterprojecten duren vaak 18 tot 24 maanden. Onze modulaire aanpak levert in vier maanden een operationele faciliteit die specifiek is ontworpen voor de NVIDIA GB300 NVL72.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[813,859,860,949,814,950,951,952,953,954,955,956,957],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":959,"title":960,"description":961,"date":962,"slug":963,"image":964,"originalUrl":965,"categories":966},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","Waarom de “CUDA”-vertaling het echte potentieel van AMD niet zal ontsluiten","Om de paar jaar verschijnt een oplossing met dezelfde belofte: behoud uw CUDA-code, wissel van toolchain en draai plots op verschillende GPU-platforms. Dat kan nuttig zijn voor compatibiliteit, maar ontsluit niet automatisch AMD's echte prestatiepotentieel. Daarvoor zijn AMD-first kernels, libraries en tuning nodig.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[813,770,769,860,967,770,968,969,970,971,972,973,769,662],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning",{"path":975,"title":976,"description":977,"date":978,"slug":979,"image":980,"originalUrl":981,"categories":982},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: de eenvoudigste manier om AI-inferentie een boost te geven","Laten we eerlijk zijn: marketing is niet onze sterkste kant. We namen nooit extern kapitaal aan, verbrandden geen budget aan advertentiecampagnes en bouwden geen verkoopleger. We bouwen gewoon technologie die werkt. Paiton versnelt uw bestaande inferentiestack zonder migratie, nieuwe API's of modelconversie.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[813,770,769,772,983,967,778,984,775,973,769,985,777],"AMD Instinct","Hoge throughput","SGLang",{"path":987,"title":988,"description":989,"date":990,"slug":991,"image":992,"originalUrl":993,"categories":994},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Stop met te veel betalen: Paiton MI300X MoE verslaat H200\u002FB200 in kosten per 1 miljoen tokens","We benchmarkten Paiton's nieuwe MoE-ondersteuning met Qwen\u002FQwen3-30B-A3B-Instruct-2507 en vergeleken de inferentieprestaties van verschillende opstellingen. Elke configuratie draaide vijf keer per batchgrootte. We rapporteren het gemiddelde van die runs op basis van realistische conversationele workloads.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[813,770,769,995,967,996,775,997,998,999,1000,769,1001],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1003,"title":1004,"description":1005,"date":1006,"slug":1007,"image":1008,"originalUrl":1009,"categories":1010},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Agentic AI, maar dan lokaal: van inbox naar inzicht en actie","We bouwen productieklare, local-first AI-agents die aansluiten op uw bestaande e-mailomgeving. Ze maken tickets aan, classificeren berichten, lezen documenten, herkennen facturen en offertes, analyseren beelden en sturen gestructureerde rapporten naar uw systemen, zonder verplichte afhankelijkheid van externe AI-API's.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[813,770,911,860,912,1011,1012,1013,1014,917,919,844,1015,1016],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1018,"title":1019,"description":1020,"date":1021,"slug":1022,"image":1023,"originalUrl":1024,"categories":1025},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8 data-parallelle benchmarks (8 tot 64 GPU's): H200 achter zich, B200 binnen bereik","We schalen Llama-3.1-8B-Instruct-FP8-KV met Paiton op een gepartitioneerde AMD MI300X-server van 8 fysieke GPU's naar 64 virtuele GPU's. De resultaten tonen sterke multi-tenant throughput, veel lagere latency en een bijna gelijkspel met NVIDIA's B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[813,770,769,860,1026,829,830,1027,1028,840,841,769,777],"AI","H200","MI300X",{"path":1030,"title":1031,"description":1032,"date":1033,"slug":1034,"image":1035,"originalUrl":1036,"categories":1037},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Bij Eliovp blijven we innoveren om praktische oplossingen te bouwen. Een van onze grootste sterktes is het vermogen om buiten de gebaande paden te denken. Daarom ontwikkelen we toepasbare AI-oplossingen die dagelijks bruikbaar zijn en precies aansluiten op de behoeften van onze klanten.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[813,770,911,912,1011,1012,1013,1014,917,919,844,1015,1016],{"path":1039,"title":1040,"description":1041,"date":1042,"slug":1043,"image":522,"originalUrl":1044,"categories":1045},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","AI verandert elke sector in hoog tempo, maar grote modellen efficiënt uitvoeren blijft een aanzienlijke technische en financiële uitdaging. ElioVP specialiseert zich in optimalisatie voor AMD-accelerators en helpt organisaties het volledige potentieel van hun hardware te benutten. Met onze gratis evaluatiemodellen kunt u de optimalisaties van Paiton vooraf op uw eigen workloads testen.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[813,770,769],{"path":1047,"title":1048,"description":1049,"date":1050,"slug":1051,"image":1052,"originalUrl":1053,"categories":1054},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B","Met Paiton streven we niet alleen naar maximale inferentiesnelheden. We verbeteren de volledige levenscyclus van de deployment van grote taalmodellen. Onze nieuwste test combineert AMD MI300X-GPU's met het omvangrijke Llama-3.1-405B-Instruct-FP8-KV-model en levert baanbrekende resultaten op voor zowel opstartsnelheid als runtimeprestaties.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[813,770,769,860,772,967,1055,969,1056,1057,1058,769,1059,1060],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1062,"title":1063,"description":1064,"date":1065,"slug":1066,"image":1067,"originalUrl":1068,"categories":1069},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","AI evolueert razendsnel en efficiënte inferentie is essentieel om krachtige modellen in praktijksituaties in te zetten. Paiton levert nu sterkere FP8-inferentieprestaties op AMD MI300X-GPU's dan NVIDIA's H200, dankzij zorgvuldig geoptimaliseerde kernels.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[813,770,769,860,967,1070,916,836,773,774,776,1057,1071,1072],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1074,"title":1075,"description":1076,"date":1077,"slug":1078,"image":1079,"originalUrl":1080,"categories":1081},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X versus H200 versus RX 7900 XTX versus Tenstorrent n300s met vLLM","Nu grote taalmodellen een fundamenteel onderdeel worden van moderne toepassingen, is de juiste server voor deployment belangrijker dan ooit. We vergelijken AMD MI300X, NVIDIA H200, AMD RX 7900 XTX en Tenstorrent n300s met vLLM op throughput en kosten.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[813,770,769,911,860,829,1028,841,1082,1083],"RX7900XTX","tenstorrent",{"path":1085,"title":1086,"description":1087,"date":1088,"slug":1089,"image":1090,"originalUrl":1091,"categories":1092},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële inzichten voor investeerders in GPU-clusters","Eliovp ontwerpt, bouwt en optimaliseert al jaren GPU-clusters in heel Europa. Omdat klanten ons telkens opnieuw vroegen om een P&L-model voor hun investering, bundelden we onze praktijkkennis in ClusterP&L: een toegankelijke, voortdurend bijgewerkte tool voor financiële prognoses van GPU-infrastructuur.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[813,770,859,911,830,1027,1093,841,1094],"MI325X","P&L-calculator",{"path":1096,"title":1097,"description":1098,"date":1099,"slug":1100,"image":1101,"originalUrl":1102,"categories":1103},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","Snellere tokens voor minder geld: AMD MI300X tegenover NVIDIA H200","We vergelijken Qwen3-32B op een AMD MI300X, geoptimaliseerd met Paiton, met de NVIDIA H200. De resultaten tonen hoe Paiton vergelijkbare of betere prestaties kan leveren tegen lagere hardwarekosten en met aantrekkelijke kosten per miljoen tokens.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[813,770,769,1026,829,1027,1104,841,769,777],"MI300",{"path":1106,"title":1107,"description":1108,"date":1109,"slug":1110,"image":1111,"originalUrl":1112,"categories":1113},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Waar vermogen en precisie samenkomen: modulair high-density datacenter voor NVIDIA NVL-deployments (1 tot 2 MW)","Eliovp ontwikkelt modulaire high-density infrastructuur voor AI-workloads van Blackwell-klasse. Het platform ondersteunt NVIDIA NVL-configuraties van NVL4 tot NVL72, van gedistribueerde edge-inferentie tot modeltraining op hyperscale, met 1 tot 2 MW IT-vermogen per module.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[813,859,1114,930,951,817,952,953,1115,1116,956,1117],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1119,"title":1120,"description":1121,"date":1122,"slug":1123,"image":1124,"originalUrl":1125,"categories":1126},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Eliovp ontwikkelde een medische AI-agent die rechtstreeks met DICOM-servers in ziekenhuizen communiceert. De assistent kan patiënten en onderzoeken opzoeken, relevante beelden ophalen en medische beeldanalyse ondersteunen binnen de lokale ziekenhuisinfrastructuur.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[813,770,911,860,1026,829,1127],"Zorg",{"path":1129,"title":1130,"description":1131,"date":1132,"slug":1133,"image":1134,"originalUrl":1135,"categories":1136},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Eliovp BV: uw partner voor een veerkrachtige supply chain bij nieuwe Amerikaanse invoerheffingen","Het internationale handelslandschap verandert snel. Nieuwe Amerikaanse invoerheffingen zorgen voor onzekerheid, vooral bij bedrijven die afhankelijk zijn van high-performance computing en AI-infrastructuur. Eliovp helpt klanten hun supply chain veerkrachtig, betrouwbaar en kostenefficiënt te houden.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[813,871,1026,829,1137,1138,1139,1140],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":1142,"title":1143,"description":1144,"date":1145,"slug":1146,"image":1147,"originalUrl":1148,"categories":1149},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","AI-agenten integreren met uw bestaande ERP-, CRM- en marketingplatforms. Ze vullen uw huidige systemen aan, nemen intelligentere beslissingen en schalen mee met uw organisatie. Zo verlaagt u kosten, beperkt u fouten en maakt u medewerkers vrij voor werk met meer toegevoegde waarde.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[813,770,911,1026,1150,1151],"AI-agenten","ERP",{"path":1153,"title":1154,"description":1155,"date":1156,"slug":1157,"image":1158,"originalUrl":1159,"categories":1160},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","In het snel evoluerende AI-landschap zijn opensourceoplossingen belangrijke aanjagers van innovatie en betere prestaties. Deze door de gemeenschap gedragen platforms maken geavanceerde technologie breder toegankelijk, stimuleren samenwerking en versnellen de optimalisatie van AI-modellen.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[813,770,871,1161,829,121,841],"AI-nieuws",{"path":1163,"title":1164,"description":1165,"date":1166,"slug":1167,"image":1168,"originalUrl":1169,"categories":1170},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Betrouwbare benchmarks zijn essentieel om AI-modellen en software te optimaliseren. Onze nieuwe tool integreert met dstack en maakt geautomatiseerde, reproduceerbare en schaalbare benchmarkworkflows mogelijk, zowel op lokale GPU's als in de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[813,770,769,1026,829,1171,1172,1028,769],"benchmark","LLM",{"path":1174,"title":1175,"description":1176,"date":1177,"slug":1178,"image":1179,"originalUrl":1180,"categories":1181},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","De meeste LLM-benchmarks richten zich op afgeleiden van Llama of DeepSeek. Met QwQ-32B verbreden we die vergelijking en testen we hoe Paiton de AMD MI300X optimaliseert tegenover NVIDIA's H200, van throughput en concurrency tot TTFT en end-to-end-latency.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[813,770,769],{"path":1183,"title":1184,"description":1185,"date":1186,"slug":1187,"image":1188,"originalUrl":1189,"categories":1190},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Eliovp was onlangs te gast in de AMD Tech Talk-podcast. Onze CEO Elio Van Puyvelde sprak met Jim Greene over het ontstaan van Eliovp, de passie en expertise achter het bedrijf en de geïntegreerde oplossingen die we vandaag aanbieden.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[813,829,1191,1192,1193],"Jim Greene","Podcast","Tech Talk",{"path":1195,"title":1196,"description":1197,"date":1198,"slug":1199,"image":1200,"originalUrl":1201,"categories":1202},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Paiton richt zich volledig op inferentieoptimalisatie voor AMD. Ons recentste werk levert voor DeepSeek R1 Distill Llama 8B een 10 tot 15% hogere throughput, een betere time-to-first-token en stabielere prestaties bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[813,770,769,829,1203,1204,1027,1028,1093,769,777],"DeepSeek","H100",{"path":1206,"title":1207,"description":1208,"date":1209,"slug":1210,"image":1211,"originalUrl":1212,"categories":1213},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Een eerste blik op Paiton in actie: DeepSeek R1 Distill Llama 3.1 8B","Een eerste blik op hoe Paiton DeepSeek R1 Distill Llama 3.1 8B optimaliseert voor de AMD MI300X. We vergelijken een met Paiton geoptimaliseerd model met de standaardversie en meten throughput, latency en end-to-end prestaties bij uiteenlopende batchgroottes.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[813,770,769,829,1203,1204,1027,1028,1093,769,777],{"path":1215,"title":1216,"description":1217,"date":1218,"slug":1219,"image":1220,"originalUrl":1221,"categories":1222},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","In de snel evoluerende wereld van artificiële intelligentie zijn efficiënte modellen en sterke prestaties cruciaal. Met Paiton biedt ElioVP doorgedreven optimalisatie voor AI-modellen. Door de modelarchitectuur te compileren en onze eigen kernels te gebruiken, maakt Paiton snellere inferentie en een lager resourcegebruik op AMD GPU's mogelijk.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[813,770,769,829,1204,1027,1028,1093,769,777],1788619292553]