[{"data":1,"prerenderedAt":1444},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200":3,"blog-posts-sidebar-nl":1018},{"id":4,"title":5,"body":6,"categories":1003,"date":1006,"description":1007,"extension":1008,"image":1009,"meta":1010,"navigation":1011,"originalUrl":1012,"path":1013,"seo":1014,"slug":1015,"stem":1016,"__hash__":1017},"blogNl\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200.md","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200",{"type":7,"value":8,"toc":989},"minimark",[9,17,21,26,48,58,64,69,83,88,124,127,133,139,144,166,171,174,179,187,193,196,202,205,211,218,364,370,498,503,630,632,638,644,651,658,660,666,671,676,681,686,691,696,698,704,709,714,725,727,733,737,742,749,751,757,763,774,779,783,788,795,797,803,811,816,821,826,833,835,841,852,857,861,866,877,879,889,891,897,917,920,922,928,954,956,962,965,976,979,981,984],[10,11,13],"h3",{"id":12},"_1-introductie",[14,15,16],"strong",{},"1. Introductie",[18,19,20],"p",{},"In de wereld van grote taalmodellen (LLM's) richten de meeste benchmarks zich op afgeleiden van Llama of DeepSeek. Daarom voegden we met ons Paiton-framework ook de Qwen2-architectuur toe. Dit model met 32 miljard parameters benut de GPU maximaal en vormt een sterke basis om NVIDIA's H200 te vergelijken met de AMD MI300X, waarop Paiton geavanceerde concurrency en aangepaste kernelcompilatie toepast.",[18,22,23],{},[14,24,25],{},"Waarom QwQ-32B?",[27,28,29,36,42],"ul",{},[30,31,32,35],"li",{},[14,33,34],{},"Veel parameters",": Met 32 miljard parameters kan het model complexe dialogen, domeinspecifieke kennis en geavanceerd redeneren aan.",[30,37,38,41],{},[14,39,40],{},"Minder gebruikelijk",": gaat verder dan de typische Llama\u002FDeepSeek-oplossingen, waardoor we de flexibiliteit van Paiton bij het optimaliseren van een breder scala aan LLM's kunnen benadrukken.",[30,43,44,47],{},[14,45,46],{},"Ongelooflijke resultaten",": vooral QwQ-32B laat geweldige resultaten zien vergeleken met Deepseek-R1, GPT-4o, Claude 3.7 en andere modellen die relatief groot zijn.",[18,49,50,51],{},"Deze resultaten zijn hier te vinden: ",[52,53,57],"a",{"href":54,"rel":55},"https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fqwq-32b",[56],"nofollow","Artificial Analysis AI",[10,59,61],{"id":60},"_2-paiton-en-vllm-versies",[14,62,63],{},"2. Paiton- en vLLM-versies",[18,65,66],{},[14,67,68],{},"Paiton op AMD MI300X",[27,70,71,77],{},[30,72,73,76],{},[14,74,75],{},"vLLM",": We gebruikten vLLM 0.7.3 voor Paiton. Hoewel er nieuwere versies (zoals 0.8.0) bestaan, is ons testsysteem geconfigureerd met 0.7.3, dat nog steeds profiteert van veel gelijktijdigheidsverbeteringen.",[30,78,79,82],{},[14,80,81],{},"Vlaggen",": standaardomgeving, op HIP gebaseerde gelijktijdigheid, geen verborgen schakelaars naast de kernelfusie van Paiton.",[18,84,85],{},[14,86,87],{},"Runs met standaard-vLLM",[27,89,90,104],{},[30,91,92,95,96],{},[14,93,94],{},"NVIDIA H200",": vLLM 0.8.0 uitvoeren met de best geteste opties:\n",[27,97,98,101],{},[30,99,100],{},"CUDA-grafiek vastleggen ingeschakeld (via standaard of expliciete vlaggen)",[30,102,103],{},"“V1” gelijktijdigheidsplanning (standaard in vLLM 0.8.0, indien use-case ondersteund)",[30,105,106,109,110],{},[14,107,108],{},"AMD MI300X (standaard)",": Voor een directe vergelijking tussen standaard-vLLM en Paiton testten we ook dezelfde vLLM-versie als Paiton, vLLM 0.7.3, met de beste beschikbare flags:\n",[27,111,112,118,121],{},[30,113,114],{},[115,116,117],"code",{},"--num_sched_steps=10",[30,119,120],{},"CUDA-grafiek vastleggen (waar relevant)",[30,122,123],{},"Bepaalde functies in- of uitschakelen voor optimale gelijktijdigheid",[18,125,126],{},"We wilden ervoor zorgen dat elke GPU de best mogelijke omgeving had.",[18,128,129,132],{},[14,130,131],{},"Opmerking",": bij de standaardruns op AMD passen we Paiton's aangepaste kernelcompilatie en concurrencylogica niet toe. Zo meten we de native prestaties van de MI300X.",[10,134,136],{"id":135},"_3-testopstelling-en-methodologie",[14,137,138],{},"3. Testopstelling en methodologie",[18,140,141],{},[14,142,143],{},"Hardware",[27,145,146,151],{},[30,147,148,150],{},[14,149,94],{}," (enkele GPU)",[30,152,153,156,157],{},[14,154,155],{},"AMD MI300X"," (enkele GPU), getest in twee modi:\n",[158,159,160,163],"ol",{},[30,161,162],{},"Paiton-geoptimaliseerd",[30,164,165],{},"Standaard-vLLM, dezelfde versie als Paiton (0.7.3), met de beste concurrencyflags.",[18,167,168],{},[14,169,170],{},"Model en commando",[18,172,173],{},"QwQ-32B geserveerd met:",[18,175,176],{},[115,177,178],{},"vllm serve Qwen\u002FQwQ-32B --num-scheduler-steps=10 --swap-space=16 ...",[27,180,181,184],{},[30,182,183],{},"Voor de H200 hebben we de standaard gelijktijdigheidsaanpak gebruikt (-tp 1 of vergelijkbaar) plus 'V1-planning'.",[30,185,186],{},"Geteste batchgroottes: van 1 tot 128.",[18,188,189,192],{},[14,190,191],{},"Metrics",": verzoeken\u002Fs, throughput van outputtokens, TTFT, TPOT, ITL en E2E-latency.",[194,195],"hr",{},[10,197,199],{"id":198},"_4-resultaten-standaard-vllm-versus-paiton",[14,200,201],{},"4. Resultaten: standaard-vLLM versus Paiton",[18,203,204],{},"We hebben de prestatiegegevens opgesplitst in twee hoofdtabellen, één voor doorvoerstatistieken en één voor latentiestatistieken. Daarna ziet u grafieken in de tekst, telkens met een toelichting op de vergelijkende prestaties van AMD MI300X en NVIDIA H200.",[10,206,208],{"id":207},"_41-doorvoertabellen",[14,209,210],{},"4.1 Doorvoertabellen",[212,213,215],"h4",{"id":214},"standaard-vllm-amd-mi300x",[14,216,217],{},"Standaard-vLLM: AMD MI300X",[219,220,221,248],"table",{},[222,223,224],"thead",{},[225,226,227,233,238,243],"tr",{},[228,229,230],"th",{},[14,231,232],{},"Batchgrootte",[228,234,235],{},[14,236,237],{},"Verzoekthroughput (req\u002Fs)",[228,239,240],{},[14,241,242],{},"Throughput van outputtokens (tok\u002Fs)",[228,244,245],{},[14,246,247],{},"Totale tokenthroughput (tok\u002Fs)",[249,250,251,266,280,294,308,322,336,350],"tbody",{},[225,252,253,257,260,263],{},[254,255,256],"td",{},"1",[254,258,259],{},"0,40",[254,261,262],{},"48,02",[254,264,265],{},"52,86",[225,267,268,271,274,277],{},[254,269,270],{},"2",[254,272,273],{},"0,11",[254,275,276],{},"49,51",[254,278,279],{},"51,52",[225,281,282,285,288,291],{},[254,283,284],{},"4",[254,286,287],{},"0,22",[254,289,290],{},"73,42",[254,292,293],{},"77,38",[225,295,296,299,302,305],{},[254,297,298],{},"8",[254,300,301],{},"0,44",[254,303,304],{},"120,28",[254,306,307],{},"183,72",[225,309,310,313,316,319],{},[254,311,312],{},"16",[254,314,315],{},"0,96",[254,317,318],{},"220,17",[254,320,321],{},"412,65",[225,323,324,327,330,333],{},[254,325,326],{},"32",[254,328,329],{},"1,79",[254,331,332],{},"403,23",[254,334,335],{},"829,22",[225,337,338,341,344,347],{},[254,339,340],{},"64",[254,342,343],{},"3,21",[254,345,346],{},"676,22",[254,348,349],{},"1467,65",[225,351,352,355,358,361],{},[254,353,354],{},"128",[254,356,357],{},"4,94",[254,359,360],{},"1079,45",[254,362,363],{},"2226,07",[212,365,367],{"id":366},"standaardmodel-nvidia-h200",[14,368,369],{},"Standaardmodel: NVIDIA H200",[219,371,372,392],{},[222,373,374],{},[225,375,376,380,384,388],{},[228,377,378],{},[14,379,232],{},[228,381,382],{},[14,383,237],{},[228,385,386],{},[14,387,242],{},[228,389,390],{},[14,391,247],{},[249,393,394,407,420,433,446,459,472,485],{},[225,395,396,398,401,404],{},[254,397,256],{},[254,399,400],{},"0,42",[254,402,403],{},"49,74",[254,405,406],{},"54,76",[225,408,409,411,414,417],{},[254,410,270],{},[254,412,413],{},"0,13",[254,415,416],{},"57,84",[254,418,419],{},"60,18",[225,421,422,424,427,430],{},[254,423,284],{},[254,425,426],{},"0,26",[254,428,429],{},"85,11",[254,431,432],{},"89,71",[225,434,435,437,440,443],{},[254,436,298],{},[254,438,439],{},"0,52",[254,441,442],{},"142,21",[254,444,445],{},"217,21",[225,447,448,450,453,456],{},[254,449,312],{},[254,451,452],{},"1,01",[254,454,455],{},"231,77",[254,457,458],{},"434,38",[225,460,461,463,466,469],{},[254,462,326],{},[254,464,465],{},"1,86",[254,467,468],{},"418,62",[254,470,471],{},"860,89",[225,473,474,476,479,482],{},[254,475,340],{},[254,477,478],{},"3,44",[254,480,481],{},"728,66",[254,483,484],{},"1574,56",[225,486,487,489,492,495],{},[254,488,354],{},[254,490,491],{},"6,00",[254,493,494],{},"1311,51",[254,496,497],{},"2704,78",[212,499,501],{"id":500},"paiton-op-amd-mi300x",[14,502,68],{},[219,504,505,525],{},[222,506,507],{},[225,508,509,513,517,521],{},[228,510,511],{},[14,512,232],{},[228,514,515],{},[14,516,237],{},[228,518,519],{},[14,520,242],{},[228,522,523],{},[14,524,247],{},[249,526,527,539,552,565,578,591,604,617],{},[225,528,529,531,533,536],{},[254,530,256],{},[254,532,301],{},[254,534,535],{},"52,03",[254,537,538],{},"57,27",[225,540,541,543,546,549],{},[254,542,270],{},[254,544,545],{},"0,14",[254,547,548],{},"60,27",[254,550,551],{},"62,71",[225,553,554,556,559,562],{},[254,555,284],{},[254,557,558],{},"0,27",[254,560,561],{},"87,92",[254,563,564],{},"92,67",[225,566,567,569,572,575],{},[254,568,298],{},[254,570,571],{},"0,53",[254,573,574],{},"144,27",[254,576,577],{},"220,35",[225,579,580,582,585,588],{},[254,581,312],{},[254,583,584],{},"1,02",[254,586,587],{},"234,10",[254,589,590],{},"438,76",[225,592,593,595,598,601],{},[254,594,326],{},[254,596,597],{},"1,90",[254,599,600],{},"427,54",[254,602,603],{},"879,22",[225,605,606,608,611,614],{},[254,607,340],{},[254,609,610],{},"3,40",[254,612,613],{},"715,60",[254,615,616],{},"1552,62",[225,618,619,621,624,627],{},[254,620,354],{},[254,622,623],{},"5,56",[254,625,626],{},"1211,53",[254,628,629],{},"2503,30",[194,631],{},[212,633,635],{"id":634},"grafiek-1-verzoekens-versus-batchgrootte",[14,636,637],{},"Grafiek 1: Verzoeken\u002Fs versus batchgrootte",[18,639,640],{},[641,642,643],"em",{},"(Hoger is beter.)",[18,645,646],{},[647,648],"img",{"alt":649,"src":650},"","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph1_requests_vs_batch.jpg",[18,652,653],{},[641,654,655,657],{},[14,656,131],{},": Merk op hoe bij kleine tot middelgrote batchgroottes (bijvoorbeeld 1 tot 32) Paiton op MI300X de verzoeken per seconde van de H200 evenaart of overtreft. Naarmate de batchgrootte groter wordt dan 64, heeft de H200 nog steeds een lichte voorsprong, maar Paiton verkleint de kloof vergeleken met de \"standaard\" AMD-runs. Dit onderstreept het vermogen van AMD MI300X om NVIDIA H200 te overtreffen of nauw te evenaren onder veel gelijktijdigheidsomstandigheden wanneer optimalisaties (Paiton) worden toegepast.",[194,659],{},[10,661,663],{"id":662},"_42-latentietabellen",[14,664,665],{},"4.2 Latentietabellen",[212,667,669],{"id":668},"standaard-vllm-amd-mi300x-1",[14,670,217],{},[18,672,673],{},[647,674],{"alt":649,"src":675},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fstockamdmi300xtable.jpg",[212,677,679],{"id":678},"standaardmodel-nvidia-h200-1",[14,680,369],{},[18,682,683],{},[647,684],{"alt":649,"src":685},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fh200table.jpg",[212,687,689],{"id":688},"paiton-op-amd-mi300x-1",[14,690,68],{},[18,692,693],{},[647,694],{"alt":649,"src":695},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitontable.jpg",[194,697],{},[212,699,701],{"id":700},"grafiek-2-tijd-tot-eerste-token-ttft-versus-batchgrootte",[14,702,703],{},"Grafiek 2: Tijd tot eerste token (TTFT) versus batchgrootte",[18,705,706],{},[641,707,708],{},"(Lager is beter)",[18,710,711],{},[647,712],{"alt":649,"src":713},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph2_ttft_vs_batch.jpg",[18,715,716],{},[641,717,718,720,721,724],{},[14,719,131],{},": TTFT is de vertraging voordat een enkel token wordt geproduceerd. Bij lage batchgroottes ligt H200 iets voor. Zodra we echter ",[14,722,723],{},"Paiton"," toepassen op de MI300X, wordt het verschil bij kleine gelijktijdigheid kleiner. Uit de gegevens blijkt ook dat AMD + Paiton de TTFT binnen een concurrerend bereik kan houden zodra de batchgrootte boven 8 of 16 uitkomt.",[194,726],{},[212,728,730],{"id":729},"grafiek-3-gemiddelde-end-to-end-latentie-e2e-versus-batchgrootte",[14,731,732],{},"Grafiek 3: gemiddelde end-to-end latentie (E2E) versus batchgrootte",[18,734,735],{},[641,736,708],{},[18,738,739],{},[647,740],{"alt":649,"src":741},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph3_mean_e2e_vs_batch.jpg",[18,743,744],{},[641,745,746,748],{},[14,747,131],{},": E2E-latency omvat het volledige verzoek, vanaf het indienen van de prompt tot het genereren van het laatste token. Met Paiton verlaagt de MI300X de E2E-latency consequent ten opzichte van de standaard AMD-resultaten en kan hij bij veel batchgroottes met de H200 wedijveren.",[194,750],{},[10,752,754],{"id":753},"_5-analyse-en-observaties",[14,755,756],{},"5. Analyse en observaties",[212,758,760],{"id":759},"vergelijking-bij-kleine-batches",[14,761,762],{},"Vergelijking bij kleine batches",[27,764,765,771],{},[30,766,767,770],{},[14,768,769],{},"Batch=1 of 2",": Paiton op MI300X en de H200 liggen qua doorvoer extreem dicht bij elkaar (~0,4–0,44 req\u002Fs).",[30,772,773],{},"TTFT voor Paiton op MI300X is iets hoger (61 ms versus 44 ms op H200 bij batch=1), maar de algehele E2EL blijft in hetzelfde bereik (~2,29–2,48 s).",[18,775,776],{},[14,777,778],{},"Grafiek 4: Verzoeken\u002Fs vs. E2E-latentie (kleine batches)",[18,780,781],{},[641,782,708],{},[18,784,785],{},[647,786],{"alt":649,"src":787},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph4_small_batches.jpg",[18,789,790],{},[641,791,792,794],{},[14,793,131],{},": als we verzoeken\u002Fs specifiek uitzetten tegen end-to-end latentie voor kleine batchgroottes (1-8), kan de MI300X met Paiton niet alleen de gelijktijdigheid van de H200 evenaren, maar in sommige runs zelfs overschrijden. Dit is een belangrijk voorbeeld van hoe gerichte optimalisaties de hardware van AMD verder kunnen brengen.",[194,796],{},[212,798,800],{"id":799},"middenbatches-1632",[14,801,802],{},"Middenbatches (16–32)",[27,804,805,808],{},[30,806,807],{},"AMD + Paiton heeft bij batch=32 bijvoorbeeld een lichte voorsprong in req\u002Fs ten opzichte van standaard AMD (1,9 tegenover 1,79) en nadert de concurrency van de H200.",[30,809,810],{},"TTFT ziet een sprong (bereik van 472-928 ms), wat typisch is voor grote LLM's, maar de gelijktijdigheidsaanpak van Paiton helpt het totale aantal tokens\u002Fs hoog te houden.",[18,812,813],{},[14,814,815],{},"Grafiek 5: totale doorvoer (tok\u002Fs) versus batchgrootte",[18,817,818],{},[641,819,820],{},"(Hoger is beter)",[18,822,823],{},[647,824],{"alt":649,"src":825},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph5_total_throughput_vs_batch.jpg",[18,827,828],{},[641,829,830,832],{},[14,831,131],{},": de totale tokendoorvoer (invoer- en uitvoertokens) schaalt aanzienlijk met gelijktijdigheid. Merk op hoe Paiton op MI300X daadwerkelijk beter presteert dan de H200 bij bepaalde batches uit het middensegment in termen van tokens die per seconde worden verwerkt, wat aantoont dat de MI300X-architectuur + Paiton's kernelfusie kan schitteren als deze zorgvuldig wordt afgestemd.",[194,834],{},[212,836,838],{"id":837},"hoge-batches-64128",[14,839,840],{},"Hoge batches (64–128)",[27,842,843,849],{},[30,844,845,848],{},[14,846,847],{},"De H200 leidt"," voorlopig bij batch=128 met 6,0 req\u002Fs tegenover 5,56 voor Paiton, maar Paiton presteert beter dan de standaard AMD MI300X met 4,94 req\u002Fs.",[30,850,851],{},"De end-to-end-latency kan bij deze grote batches nog steeds ongeveer 9 tot 12 seconden bedragen, wat past bij de zware tokengeneratie van een 32B-model.",[18,853,854],{},[14,855,856],{},"Grafiek 6: P99 end-to-end latentie versus batchgrootte",[18,858,859],{},[641,860,708],{},[18,862,863],{},[647,864],{"alt":649,"src":865},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fgraph6_p99_e2e_latency_vs_batch-1.jpg",[18,867,868],{},[641,869,870,872,873,876],{},[14,871,131],{},": de P99 E2E-latentie bij zeer hoge gelijktijdigheid is begrijpelijkerwijs groot. Hoewel de H200 de top bereikt met een iets hogere verzoekdoorvoer, verkleint MI300X met Paiton de prestatiekloof aanzienlijk. Dit wijst op het sterke potentieel van verdere verfijningen van gelijktijdigheid, waardoor uiteindelijk de prestaties van NVIDIA bij bepaalde workloads ",[14,874,875],{},"overtroffen"," worden.",[194,878],{},[18,880,881,884,885,888],{},[14,882,883],{},"Samenvatting",": Hoewel de H200 misschien een kleine voorsprong vertoont bij de hoogste gelijktijdigheid, verbetert ",[14,886,887],{},"Paiton de prestaties van de AMD MI300X aanzienlijk"," buiten de standaardbenadering, vooral bij kleine tot middelgrote batchgroottes. Dit suggereert dat echte AI-clusters een betere schaalbaarheid zouden kunnen zien met behulp van Paiton als gelijktijdigheid of batchplanning zorgvuldig wordt afgestemd.",[194,890],{},[10,892,894],{"id":893},"_6-amds-sterke-punten-en-verdere-verbeteringen",[14,895,896],{},"6. AMD's sterke punten en verdere verbeteringen",[27,898,899,905,911],{},[30,900,901,904],{},[14,902,903],{},"HBM-voordeel",": het grote HBM-geheugen van de MI300X zorgt voor stabiele prestaties over een breed tokenbereik; zelfs bij grotere batchgroottes blijft het systeem stabiel.",[30,906,907,910],{},[14,908,909],{},"Kernelcompilatie",": de aangepaste aanpak van Paiton levert betere gelijktijdigheid op, vooral voor kleinere batchbewerkingen, waardoor de typische overhead wordt overbrugd.",[30,912,913,916],{},[14,914,915],{},"Nog niet “er”",": in sommige gevallen met de hoogste batches behoudt de H200 een voorsprong, maar we zijn actief bezig met het verfijnen van Paiton's kernellancerings- en concurrency-strategieën om die kloof te dichten.",[18,918,919],{},"QwQ-32B werd minder vaak gebenchmarkt, dus de ondersteuning ervan binnen Paiton demonstreert het model-agnostische ontwerp van onze bibliotheek. Verwacht verdere winst als we de gelijktijdigheidsverbeteringen van vLLM 0.8.x op AMD overnemen of aanpassen.",[194,921],{},[10,923,925],{"id":924},"_7-volgende-stappen-en-toekomstig-werk",[14,926,927],{},"7. Volgende stappen en toekomstig werk",[158,929,930,936,942,948],{},[30,931,932,935],{},[14,933,934],{},"Tensor-parallellisme",": evaluatie van multi-GPU-schaling voor QwQ-32B, vooral als AI-clusters latenties van minder dan 2 seconden willen.",[30,937,938,941],{},[14,939,940],{},"Geavanceerde kwantisering",": 8- of 4-bitscompressie om de geheugenvoetafdruk te verkleinen en inferentie verder te versnellen.",[30,943,944,947],{},[14,945,946],{},"Verdere kerneloptimalisaties",": gebruik onze huidige en nieuwe optimalisatietechnieken om de hardware nog verder te pushen.",[30,949,950,953],{},[14,951,952],{},"RAG",": hoe Paiton Retrieval Augmented Generation verbetert.",[194,955],{},[10,957,959],{"id":958},"_8-conclusie",[14,960,961],{},"8. Conclusie",[18,963,964],{},"QwQ-32B biedt een nieuw perspectief op grootschalige inferentie buiten de gebruikelijke benchmarks op basis van Llama. Onze resultaten tonen dat:",[27,966,967,970,973],{},[30,968,969],{},"Paiton optimaliseert de AMD MI300X en presteert aanzienlijk beter dan standaard-vLLM op dezelfde hardware.",[30,971,972],{},"Bij kleine tot middelgrote batchgroottes zijn de prestaties concurrerend met of beter dan die van NVIDIA's H200.",[30,974,975],{},"Bij grotere batchgroottes is nog ruimte voor verbetering. Die willen we met verdere concurrencyoptimalisaties benutten.",[18,977,978],{},"Blijf op de hoogte voor meer updates over verdere integratie en optimalisaties, clusterconcurrency-tests en nieuwe optimalisatiedoorbraken voor op AMD gebaseerde oplossingen. Hebt u vragen of wilt u specifieke tests zien, neem dan contact met ons op. We blijven Paiton verfijnen voor een zo breed mogelijk scala aan modellen en hardware.",[194,980],{},[18,982,983],{},"Hier hebben we gedemonstreerd hoe cruciaal gelijktijdigheid en optimalisaties op kernelniveau zijn bij het dichten (en vaak overtreffen) van de prestatiekloof met de nieuwste hardware van NVIDIA. Met Paiton is de AMD MI3**-serie voorbestemd om een topkeuze te worden voor high-throughput, grootschalige inferentie.",[18,985,986],{},[14,987,988],{},"Bedankt voor het lezen! Het Paiton-team",{"title":649,"searchDepth":990,"depth":990,"links":991},2,[992,994,995,996,997,998,999,1000,1001,1002],{"id":12,"depth":993,"text":16},3,{"id":60,"depth":993,"text":63},{"id":135,"depth":993,"text":138},{"id":198,"depth":993,"text":201},{"id":207,"depth":993,"text":210},{"id":662,"depth":993,"text":665},{"id":753,"depth":993,"text":756},{"id":893,"depth":993,"text":896},{"id":924,"depth":993,"text":927},{"id":958,"depth":993,"text":961},[1004,1005,723],"Alle","Kunstmatige intelligentie","2025-03-19T21:41:44","De meeste LLM-benchmarks richten zich op afgeleiden van Llama of DeepSeek. Met QwQ-32B verbreden we die vergelijking en testen we hoe Paiton de AMD MI300X optimaliseert tegenover NVIDIA's H200, van throughput en concurrency tot TTFT en end-to-end-latency.","md","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg",{},true,"https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F","\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200",{"title":5,"description":1007},"optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","blog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","Ymlz_KEQ_xFwOMm6USKtaM1CC03BiUuMUbt59MJAL44",[1019,1035,1049,1080,1092,1114,1132,1151,1170,1188,1204,1216,1231,1246,1258,1267,1275,1289,1301,1312,1323,1333,1346,1356,1369,1380,1390,1401,1403,1415,1426,1435],{"path":1020,"title":1021,"description":1022,"date":1023,"slug":1024,"image":1025,"originalUrl":1026,"categories":1027},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[723,1005,1028,1029,1030,1031,1032,1033,75,1034],"AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","Kostenefficiëntie",{"path":1036,"title":1037,"description":1038,"date":1039,"slug":1040,"image":1041,"originalUrl":1042,"categories":1043},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom vermelden offertes voor AI-datacenters verschillende GPU-capaciteiten? Ontdek hoe PUE, piekbelasting, opslag, netwerken en koeling bepalen hoeveel compute werkelijk inzetbaar is.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[1004,1044,1045,1046,1047,1048],"AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1050,"title":1051,"description":1052,"date":1053,"slug":1054,"image":1055,"originalUrl":1056,"categories":1057},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Paiton keert terug naar zijn diffusiewortels: optimalisatie van Wan2.2-T2V-A14B op AMD MI355X","Toen we begonnen met het bouwen van Paiton, was een van onze eerste aandachtsgebieden het optimaliseren van diffusiemodellen. Stable Diffusion XL was een van de eerste grote modellen waarin we lieten zien dat gefuseerde operators, efficiënte uitvoering en hardwarebewuste kernels een echt verschil konden maken. Nu keren we terug naar die oorsprong. Met de groeiende belangstelling voor het genereren van tekst-naar-video, ...","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1004,1005,723,1058,1059,1060,1061,1062,1063,1064,1065,1066,1067,143,1068,1069,1070,1071,1072,1073,723,1074,1075,1076,1077,1078,1079],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","GPU","Inferentie","Instinct","MI355x","NVidia","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1081,"title":1082,"description":1083,"date":1084,"slug":1085,"image":1086,"originalUrl":1087,"categories":1088},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","Van zolder tot voorpagina: ElioVP erkend als pionier op het gebied van chipoptimalisatie en datacenterinfrastructuur","Het waren bijzondere weken voor het team van Eliovp. Ons bedrijf haalde de voorpagina van De Tijd, de toonaangevende zakenkrant van België. Ons verhaal begon bij een oprichter die op zolder aan hardware sleutelde en groeide uit tot een onderneming met 215 miljoen euro omzet.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1004,1005,1089,1090,1059,1091,1089,1071],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1093,"title":1094,"description":1095,"date":1096,"slug":1097,"image":1098,"originalUrl":1099,"categories":1100},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","Privacy is geen IT-probleem meer, het is een strategische prioriteit","Privacyrisico's, psychologische valkuilen en de operationele realiteit van generatieve AI in de Benelux. Waarom bedrijven gevoelige gegevens, governance en lokale AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1004,1005,1101,1090,1102,1103,1104,1105,1106,1107,1108,1109,1065,1110,1066,1111,1112,1113],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1115,"title":1116,"description":1117,"date":1118,"slug":1119,"image":1120,"originalUrl":1121,"categories":1122},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Itsme? Bij ons is het “it's not me”, en dit is waarom.","Waarom Eliovp itsme niet gebruikt voor medewerkers en interne processen: een analyse van datasoevereiniteit, cloudjurisdictie, metadata, eigendomsstructuur en technische risico's.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1004,1123,1124,1125,1107,1126,1127,1128,1110,1129,1130,1131,1112],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1133,"title":1134,"description":1135,"date":1136,"slug":1137,"image":1138,"originalUrl":1139,"categories":1140},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","De verwachtingen rond Agentic AI staan vaak ver af van de technische realiteit. Dit praktijkrapport beschrijft wat er nodig is om betrouwbare, lokale AI-agents voor bedrijfsworkflows te bouwen, van modulaire architectuur en observability tot modeltraining, VRAM en soevereine infrastructuur.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1004,1005,1141,1101,1142,1143,1144,1145,1146,1147,1148,1149,1074,1150],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1152,"title":1153,"description":1154,"date":1155,"slug":1156,"image":1157,"originalUrl":1158,"categories":1159},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Hoe AI-neocloudinfrastructuur circulaire kasstromen omzet in schijngroei. Tussen 2023 en 2025 stroomden miljarden aan durfkapitaal naar het neocloudecosysteem. Onze analyse onderzoekt hoe circulaire financiering, vaporware-infrastructuur en roofzuchtige contracten onderliggende activawaarden kunstmatig kunnen opbouwen.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1004,1005,1101,1160,1161,1162,1163,1164,1165,1166,1167,1168,1169],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1171,"title":1172,"description":1173,"date":1174,"slug":1175,"image":1176,"originalUrl":1177,"categories":1178},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","De motor voor de AI-race bouwen: in vier maanden klaar voor NVIDIA GB300 NVL72","Bij AI-infrastructuur is snelheid een concurrentieel voordeel. Traditionele datacenterprojecten duren vaak 18 tot 24 maanden. Onze modulaire aanpak levert in vier maanden een operationele faciliteit die specifiek is ontworpen voor de NVIDIA GB300 NVL72.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1004,1089,1090,1179,1044,1180,1181,1182,1183,1184,1185,1186,1187],"150 kW rek","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1189,"title":1190,"description":1191,"date":1192,"slug":1193,"image":1194,"originalUrl":1195,"categories":1196},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","Waarom de “CUDA”-vertaling het echte potentieel van AMD niet zal ontsluiten","Om de paar jaar verschijnt een oplossing met dezelfde belofte: behoud uw CUDA-code, wissel van toolchain en draai plots op verschillende GPU-platforms. Dat kan nuttig zijn voor compatibiliteit, maar ontsluit niet automatisch AMD's echte prestatiepotentieel. Daarvoor zijn AMD-first kernels, libraries en tuning nodig.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1004,1005,723,1090,155,1005,1197,1198,1199,1200,1201,1202,723,1203],"CUDA-vertaling","FP8","GPU-optimalisatie","Hoogwaardige computers","HIP","Kerneltuning","ROCm",{"path":1205,"title":1206,"description":1207,"date":1208,"slug":1209,"image":1210,"originalUrl":1211,"categories":1212},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: de eenvoudigste manier om AI-inferentie een boost te geven","Laten we eerlijk zijn: marketing is niet onze sterkste kant. We namen nooit extern kapitaal aan, verbrandden geen budget aan advertentiecampagnes en bouwden geen verkoopleger. We bouwen gewoon technologie die werkt. Paiton versnelt uw bestaande inferentiestack zonder migratie, nieuwe API's of modelconversie.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1004,1005,723,1029,1213,155,1034,1214,1032,1202,723,1215,75],"AMD Instinct","Hoge throughput","SGLang",{"path":1217,"title":1218,"description":1219,"date":1220,"slug":1221,"image":1222,"originalUrl":1223,"categories":1224},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Stop met te veel betalen: Paiton MI300X MoE verslaat H200\u002FB200 in kosten per 1 miljoen tokens","We benchmarkten Paiton's nieuwe MoE-ondersteuning met Qwen\u002FQwen3-30B-A3B-Instruct-2507 en vergeleken de inferentieprestaties van verschillende opstellingen. Elke configuratie draaide vijf keer per batchgrootte. We rapporteren het gemiddelde van die runs op basis van realistische conversationele workloads.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1004,1005,723,1225,155,1226,1032,1227,1228,1229,94,723,1230],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","Qwen3",{"path":1232,"title":1233,"description":1234,"date":1235,"slug":1236,"image":1237,"originalUrl":1238,"categories":1239},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Agentic AI, maar dan lokaal: van inbox naar inzicht en actie","We bouwen productieklare, local-first AI-agents die aansluiten op uw bestaande e-mailomgeving. Ze maken tickets aan, classificeren berichten, lezen documenten, herkennen facturen en offertes, analyseren beelden en sturen gestructureerde rapporten naar uw systemen, zonder verplichte afhankelijkheid van externe AI-API's.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1004,1005,1141,1090,1142,1240,1241,1242,1243,1147,1149,1074,1244,1245],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1247,"title":1248,"description":1249,"date":1250,"slug":1251,"image":1252,"originalUrl":1253,"categories":1254},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8 data-parallelle benchmarks (8 tot 64 GPU's): H200 achter zich, B200 binnen bereik","We schalen Llama-3.1-8B-Instruct-FP8-KV met Paiton op een gepartitioneerde AMD MI300X-server van 8 fysieke GPU's naar 64 virtuele GPU's. De resultaten tonen sterke multi-tenant throughput, veel lagere latency en een bijna gelijkspel met NVIDIA's B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1004,1005,723,1090,1255,1059,1060,1256,1257,1070,1071,723,75],"AI","H200","MI300X",{"path":1259,"title":1260,"description":1261,"date":1262,"slug":1263,"image":1264,"originalUrl":1265,"categories":1266},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Bij Eliovp blijven we innoveren om praktische oplossingen te bouwen. Een van onze grootste sterktes is het vermogen om buiten de gebaande paden te denken. Daarom ontwikkelen we toepasbare AI-oplossingen die dagelijks bruikbaar zijn en precies aansluiten op de behoeften van onze klanten.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1004,1005,1141,1142,1240,1241,1242,1243,1147,1149,1074,1244,1245],{"path":1268,"title":1269,"description":1270,"date":1271,"slug":1272,"image":649,"originalUrl":1273,"categories":1274},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","AI verandert elke sector in hoog tempo, maar grote modellen efficiënt uitvoeren blijft een aanzienlijke technische en financiële uitdaging. ElioVP specialiseert zich in optimalisatie voor AMD-accelerators en helpt organisaties het volledige potentieel van hun hardware te benutten. Met onze gratis evaluatiemodellen kunt u de optimalisaties van Paiton vooraf op uw eigen workloads testen.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1004,1005,723],{"path":1276,"title":1277,"description":1278,"date":1279,"slug":1280,"image":1281,"originalUrl":1282,"categories":1283},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B","Met Paiton streven we niet alleen naar maximale inferentiesnelheden. We verbeteren de volledige levenscyclus van de deployment van grote taalmodellen. Onze nieuwste test combineert AMD MI300X-GPU's met het omvangrijke Llama-3.1-405B-Instruct-FP8-KV-model en levert baanbrekende resultaten op voor zowel opstartsnelheid als runtimeprestaties.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1004,1005,723,1090,1029,155,1284,1198,1285,1286,1287,723,1288,934],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie",{"path":1290,"title":1291,"description":1292,"date":1293,"slug":1294,"image":1295,"originalUrl":1296,"categories":1297},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","AI evolueert razendsnel en efficiënte inferentie is essentieel om krachtige modellen in praktijksituaties in te zetten. Paiton levert nu sterkere FP8-inferentieprestaties op AMD MI300X-GPU's dan NVIDIA's H200, dankzij zorgvuldig geoptimaliseerde kernels.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1004,1005,723,1090,155,1298,1146,1066,1030,1031,1033,1286,1299,1300],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1302,"title":1303,"description":1304,"date":1305,"slug":1306,"image":1307,"originalUrl":1308,"categories":1309},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X versus H200 versus RX 7900 XTX versus Tenstorrent n300s met vLLM","Nu grote taalmodellen een fundamenteel onderdeel worden van moderne toepassingen, is de juiste server voor deployment belangrijker dan ooit. We vergelijken AMD MI300X, NVIDIA H200, AMD RX 7900 XTX en Tenstorrent n300s met vLLM op throughput en kosten.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1004,1005,723,1141,1090,1059,1257,1071,1310,1311],"RX7900XTX","tenstorrent",{"path":1313,"title":1314,"description":1315,"date":1316,"slug":1317,"image":1318,"originalUrl":1319,"categories":1320},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële inzichten voor investeerders in GPU-clusters","Eliovp ontwerpt, bouwt en optimaliseert al jaren GPU-clusters in heel Europa. Omdat klanten ons telkens opnieuw vroegen om een P&L-model voor hun investering, bundelden we onze praktijkkennis in ClusterP&L: een toegankelijke, voortdurend bijgewerkte tool voor financiële prognoses van GPU-infrastructuur.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1004,1005,1089,1141,1060,1256,1321,1071,1322],"MI325x","pnl-rekenmachine",{"path":1324,"title":1325,"description":1326,"date":1327,"slug":1328,"image":1329,"originalUrl":1330,"categories":1331},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","Snellere tokens voor minder geld: AMD MI300X tegenover NVIDIA H200","We vergelijken Qwen3-32B op een AMD MI300X, geoptimaliseerd met Paiton, met de NVIDIA H200. De resultaten tonen hoe Paiton vergelijkbare of betere prestaties kan leveren tegen lagere hardwarekosten en met aantrekkelijke kosten per miljoen tokens.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1004,1005,723,1255,1059,1256,1332,1071,723,75],"MI300",{"path":1334,"title":1335,"description":1336,"date":1337,"slug":1338,"image":1339,"originalUrl":1340,"categories":1341},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Waar vermogen en precisie samenkomen: modulair high-density datacenter voor NVIDIA NVL-deployments (1 tot 2 MW)","Eliovp ontwikkelt modulaire high-density infrastructuur voor AI-workloads van Blackwell-klasse. Het platform ondersteunt NVIDIA NVL-configuraties van NVL4 tot NVL72, van gedistribueerde edge-inferentie tot modeltraining op hyperscale, met 1 tot 2 MW IT-vermogen per module.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1004,1089,1342,1160,1181,1047,1182,1183,1343,1344,1186,1345],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1347,"title":1348,"description":1349,"date":1350,"slug":1351,"image":1352,"originalUrl":1353,"categories":1354},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Eliovp ontwikkelde een medische AI-agent die rechtstreeks met DICOM-servers in ziekenhuizen communiceert. De assistent kan patiënten en onderzoeken opzoeken, relevante beelden ophalen en medische beeldanalyse ondersteunen binnen de lokale ziekenhuisinfrastructuur.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1004,1005,1141,1090,1255,1059,1355],"Zorg",{"path":1357,"title":1358,"description":1359,"date":1360,"slug":1361,"image":1362,"originalUrl":1363,"categories":1364},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Eliovp BV: uw partner voor een veerkrachtige supply chain bij nieuwe Amerikaanse invoerheffingen","Het internationale handelslandschap verandert snel. Nieuwe Amerikaanse invoerheffingen zorgen voor onzekerheid, vooral bij bedrijven die afhankelijk zijn van high-performance computing en AI-infrastructuur. Eliovp helpt klanten hun supply chain veerkrachtig, betrouwbaar en kostenefficiënt te houden.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1004,1101,1255,1059,1365,1366,1367,1368],"importeren","Taiwan","Tarieven","Trump",{"path":1370,"title":1371,"description":1372,"date":1373,"slug":1374,"image":1375,"originalUrl":1376,"categories":1377},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","AI-agenten integreren met uw bestaande ERP-, CRM- en marketingplatforms. Ze vullen uw huidige systemen aan, nemen intelligentere beslissingen en schalen mee met uw organisatie. Zo verlaagt u kosten, beperkt u fouten en maakt u medewerkers vrij voor werk met meer toegevoegde waarde.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1004,1005,1141,1255,1378,1379],"AI-agenten","ERP",{"path":1381,"title":1382,"description":1383,"date":1384,"slug":1385,"image":1386,"originalUrl":1387,"categories":1388},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","In het snel evoluerende AI-landschap zijn opensourceoplossingen belangrijke aanjagers van innovatie en betere prestaties. Deze door de gemeenschap gedragen platforms maken geavanceerde technologie breder toegankelijk, stimuleren samenwerking en versnellen de optimalisatie van AI-modellen.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1004,1005,1101,1389,1059,1067,1071],"AI-nieuws",{"path":1391,"title":1392,"description":1393,"date":1394,"slug":1395,"image":1396,"originalUrl":1397,"categories":1398},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Betrouwbare benchmarks zijn essentieel om AI-modellen en software te optimaliseren. Onze nieuwe tool integreert met dstack en maakt geautomatiseerde, reproduceerbare en schaalbare benchmarkworkflows mogelijk, zowel op lokale GPU's als in de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1004,1005,723,1255,1059,1399,1400,1257,723],"benchmark","LLM",{"path":1013,"title":5,"description":1007,"date":1006,"slug":1015,"image":1009,"originalUrl":1012,"categories":1402},[1004,1005,723],{"path":1404,"title":1405,"description":1406,"date":1407,"slug":1408,"image":1409,"originalUrl":1410,"categories":1411},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Eliovp was onlangs te gast in de AMD Tech Talk-podcast. Onze CEO Elio Van Puyvelde sprak met Jim Greene over het ontstaan van Eliovp, de passie en expertise achter het bedrijf en de geïntegreerde oplossingen die we vandaag aanbieden.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1004,1059,1412,1413,1414],"Jim Greene","Podcast","Tech Talk",{"path":1416,"title":1417,"description":1418,"date":1419,"slug":1420,"image":1421,"originalUrl":1422,"categories":1423},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Paiton richt zich volledig op inferentieoptimalisatie voor AMD. Ons recentste werk levert voor DeepSeek R1 Distill Llama 8B een 10 tot 15% hogere throughput, een betere time-to-first-token en stabielere prestaties bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1004,1005,723,1059,1424,1425,1256,1257,1321,723,75],"Deepseek","H100",{"path":1427,"title":1428,"description":1429,"date":1430,"slug":1431,"image":1432,"originalUrl":1433,"categories":1434},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Een eerste blik op Paiton in actie: Deepseek R1 Distill Llama 3.1 8B","Een eerste blik op hoe Paiton Deepseek R1 Distill Llama 3.1 8B optimaliseert voor de AMD MI300X. We vergelijken een met Paiton geoptimaliseerd model met de standaardversie en meten throughput, latency en end-to-end prestaties bij uiteenlopende batchgroottes.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1004,1005,723,1059,1424,1425,1256,1257,1321,723,75],{"path":1436,"title":1437,"description":1438,"date":1439,"slug":1440,"image":1441,"originalUrl":1442,"categories":1443},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","In de snel evoluerende wereld van artificiële intelligentie zijn efficiënte modellen en sterke prestaties cruciaal. Met Paiton biedt ElioVP doorgedreven optimalisatie voor AI-modellen. Door de modelarchitectuur te compileren en onze eigen kernels te gebruiken, maakt Paiton snellere inferentie en een lager resourcegebruik op AMD GPU's mogelijk.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1004,1005,723,1059,1425,1256,1257,1321,723,75],1788530429901]