[{"data":1,"prerenderedAt":1945},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach":3,"blog-posts-sidebar-nl":1524},{"id":4,"title":5,"body":6,"categories":1502,"date":1512,"description":1513,"extension":1514,"image":1515,"meta":1516,"navigation":1517,"originalUrl":1518,"path":1519,"seo":1520,"slug":1521,"stem":1522,"__hash__":1523},"blogNl\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach.md","MI300X FP8 data-parallelle benchmarks (8 tot 64 GPU's): H200 achter zich, B200 binnen bereik",{"type":7,"value":8,"toc":1490},"minimark",[9,13,24,27,30,36,82,85,90,101,108,111,250,253,259,262,270,278,281,292,300,303,309,312,320,323,329,335,338,347,350,357,363,370,376,379,382,388,391,397,403,406,412,418,421,427,434,437,440,445,448,453,456,462,467,777,783,787,979,985,996,1001,1004,1007,1093,1106,1111,1147,1153,1156,1268,1273,1278,1300,1306,1309,1312,1315,1322,1339,1345,1371,1377,1380,1383,1386,1389,1395,1398,1407,1410,1418,1424],[10,11,12],"p",{},"Bij ElioVP willen we AI-inferentie tot het uiterste drijven en elke prestatie in een plug-and-play-runtime verpakken.",[10,14,15,16,23],{},"In ",[17,18,22],"a",{"href":19,"rel":20},"https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[21],"nofollow","ons vorige artikel"," toonde Paiton's FP8-pipeline op AMD's MI300X duidelijk betere resultaten dan NVIDIA's H200. Daarna gingen we opnieuw aan de slag.",[10,25,26],{},"Deze keer draaien we Llama-3.1-8B-Instruct-FP8-KV, een lichtere FP8-gekwantiseerde Llama-variant, niet op 8 GPU's maar op 64 virtuele GPU's die uit één MI300X-server zijn gepartitioneerd.",[10,28,29],{},"Met vLLM en Paiton's kerneloptimalisaties verwachtten we een bescheiden winst bij het opschalen van multi-tenancy. Het resultaat was veel sterker dan verwacht en kwam dicht bij een gelijkspel met NVIDIA's B200.",[10,31,32],{},[33,34,35],"strong",{},"Waarom hebben we dit gedaan?",[37,38,39,46,52,58,64,70,76],"ul",{},[40,41,42,45],"li",{},[33,43,44],{},"Maximale benutting",": Partitioneer de hardware zodat elke tenant alleen betaalt voor precies het VRAM en de rekenkracht die nodig zijn.",[40,47,48,51],{},[33,49,50],{},"Elastische multi-tenancy",": Start geïsoleerde vGPU's in enkele seconden en vermijd vertraging door noisy neighbours en concurrentie om resources.",[40,53,54,57],{},[33,55,56],{},"Granulaire SLA's",": Pas de QoS per slice aan, ultralage latentie voor chatbots, bulkdoorvoer voor batchtaken, zonder te jongleren met hardware.",[40,59,60,63],{},[33,61,62],{},"Kostenefficiënt schalen",": Stem uw computeomgeving en budget nauwkeurig af door kleinere GPU-partities te huren in plaats van de volledige GPU.",[40,65,66,69],{},[33,67,68],{},"Snelle CI\u002FCD-provisioning",": Integreer GPU-slices in uw pipeline voor directe A\u002FB-tests, blue-green deployments en regressiebenchmarks.",[40,71,72,75],{},[33,73,74],{},"Foutisolatie",": Beperk OOM-fouten en driverproblemen tot één slice, zodat één problematische taak niet de volledige server stillegt.",[40,77,78,81],{},[33,79,80],{},"Toekomstbestendige flexibiliteit",": Herpartitioneer wanneer nodig om nieuwe modelgroottes of kwantisatieformaten te ondersteunen, zonder ingrijpende hardware-upgrade.",[10,83,84],{},"Met die bouwstenen op hun plaats onderzochten we hoe ver Paiton inferentie op een gepartitioneerde MI300X kon opschalen. De resultaten spreken voor zich.",[10,86,87],{},[33,88,89],{},"Doelen",[37,91,92,95,98],{},[40,93,94],{},"Evalueer de schaalbaarheid van Paiton op MI300X bij gebruik van GPU-partitionering.",[40,96,97],{},"Meet de latentie en doorvoer van Llama 3.1 8B in FP8-formaat met behulp van vLLM.",[40,99,100],{},"Valideer de geheugenefficiëntie en kernelfusievoordelen van plug-and-play Paiton-modellen.",[102,103,105],"h3",{"id":104},"benchmarkopstelling-en-methodologie",[33,106,107],{},"Benchmarkopstelling en methodologie",[10,109,110],{},"Onze benchmarkingmethode volgt een duidelijke reeks regels en stappen. Dit zorgt ervoor dat onze tests open en reproduceerbaar zijn.",[37,112,113,130,169,180,196,212,218],{},[40,114,115,118,119],{},[33,116,117],{},"Hardwareconfiguratie",":\n",[37,120,121,124,127],{},[40,122,123],{},"8x AMD MI300x",[40,125,126],{},"8 x Nvidia H200",[40,128,129],{},"8 x Nvidia B200",[40,131,132,118,135],{},[33,133,134],{},"Inferentiebibliotheek",[37,136,137,145,152,161],{},[40,138,139,140],{},"AMD MI300x (Paiton): ",[17,141,144],{"href":142,"rel":143},"https:\u002F\u002Fgithub.com\u002FROCm\u002Fvllm",[21],"vLLM v0.9.0",[40,146,147,148],{},"AMD MI300x (AITER): ",[17,149,151],{"href":142,"rel":150},[21],"v0.9.2",[40,153,154,155,160],{},"NVIDIA H200: ",[17,156,159],{"href":157,"rel":158},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[21],"v0.10.0"," (V1-modus)",[40,162,163,164,168],{},"NVIDIA B200: ",[17,165,167],{"href":157,"rel":166},[21],"v0.10.1"," (V1-modus, vanuit de broncode gebouwd voor ondersteuning van de B200-architectuur)",[40,170,171,174,175],{},[33,172,173],{},"Taalmodel:"," ",[17,176,179],{"href":177,"rel":178},"https:\u002F\u002Fhuggingface.co\u002Famd\u002FLlama-3.1-8B-Instruct-FP8-KV",[21],"Llama-3.1-8B-Instruct-FP8-KV",[40,181,182,118,185],{},[33,183,184],{},"Driverstapel",[37,186,187,190,193],{},[40,188,189],{},"AMD MI300x: ROCm 6.4.2",[40,191,192],{},"NVIDIA H200: CUDA 12.8.1",[40,194,195],{},"NVIDIA B200: CUDA 12.8.1",[40,197,198,201],{},[33,199,200],{},"Framework:",[37,202,203,206,209],{},[40,204,205],{},"AMD MI300x: Torch 2.7.1+rocm6.3",[40,207,208],{},"NVIDIA H200: Torch 2.7.1+cu128",[40,210,211],{},"NVIDIA B200: Torch 2.9.0.dev+cu128",[40,213,214,217],{},[33,215,216],{},"Batchgrootte",": 1024",[40,219,220,223,224],{},[33,221,222],{},"Meetprotocol",": elke benchmark werd 10 keer uitgevoerd en de cijfers die we rapporteren zijn algemene gemiddelden. Dit helpt het effect van tijdelijke systeemwijzigingen te verminderen. Onze zorgvuldige meetstappen omvatten:\n",[37,225,226,232,238,244],{},[40,227,228,231],{},[33,229,230],{},"Opstarttijden",": belangrijk om te controleren hoe lang het duurt om het model te laden en het systeem gereed te maken.",[40,233,234,237],{},[33,235,236],{},"Cold-Start TTFT (Time to First Token)",": meet hoe lang het duurt vanaf een nieuw verzoek totdat het eerste gegenereerde token verschijnt. Dit is van cruciaal belang voor hoe snel interactieve toepassingen reageren.",[40,239,240,243],{},[33,241,242],{},"Steady-State TTFT",": Controleert de TTFT nadat het systeem stabiel heeft gedraaid, waarbij typische prestaties bij constant gebruik worden weergegeven.",[40,245,246,249],{},[33,247,248],{},"End-to-end-latencymetrics",": geven een volledig beeld van de tijd voor een compleet inferentieverzoek, vanaf het verzenden van de input tot de uiteindelijke output.",[10,251,252],{},"Deze gedetailleerde methode biedt een goede manier om de specifieke prestatiegegevens van Paiton te controleren in drukke, gepartitioneerde GPU-omgevingen.",[102,254,256],{"id":255},"gegevensparallellisme-zonder-partitionering",[33,257,258],{},"Gegevensparallellisme zonder partitionering",[10,260,261],{},"Eerst probeerden we vLLM's ingebouwde optie “–data-parallel-size” te gebruiken. Al snel bleek dat die niet meteen werkte en ingrijpende aanpassingen zou vereisen. Daarom kozen we een andere aanpak.",[10,263,264,265,269],{},"Om de benchmarks uit te voeren over 8 containers met behulp van vLLM, hebben we eerst de officiële NGINX-loadbalancing-gids gevolgd (",[17,266,267],{"href":267,"rel":268},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Fstable\u002Fdeployment\u002Fnginx.html",[21],")",[271,272,273],"ol",{},[40,274,275],{},[33,276,277],{},"NGINX-configuratie",[10,279,280],{},"Dit is de load-balancingconfiguratie die we gebruikten in \u002Fetc\u002Fnginx\u002Fnginx.conf:",[282,283,289],"pre",{"className":284,"code":286,"language":287,"meta":288},[285],"language-text","upstream backend {\n    least_conn;\n    server vllm0:8000 max_fails=3 fail_timeout=10000s;\n    server vllm1:8000 max_fails=3 fail_timeout=10000s;\n    server vllm2:8000 max_fails=3 fail_timeout=10000s;\n    server vllm3:8000 max_fails=3 fail_timeout=10000s;\n    server vllm4:8000 max_fails=3 fail_timeout=10000s;\n    server vllm5:8000 max_fails=3 fail_timeout=10000s;\n    server vllm6:8000 max_fails=3 fail_timeout=10000s;\n    server vllm7:8000 max_fails=3 fail_timeout=10000s;\n}\n\nserver {\n    listen 80;\n    location \u002F {\n        proxy_pass http:\u002F\u002Fbackend;\n        proxy_set_header Host $host;\n        proxy_set_header X-Real-IP $remote_addr;\n        proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for;\n        proxy_set_header X-Forwarded-Proto $scheme;\n    }\n}\n","text","",[290,291,286],"code",{"__ignoreMap":288},[271,293,295],{"start":294},2,[40,296,297],{},[33,298,299],{},"De Docker-containers lanceren",[10,301,302],{},"We hebben het volgende script gebruikt om 8 containers te starten met behulp van incrementele apparaat- en poortnummers:",[282,304,307],{"className":305,"code":306,"language":287,"meta":288},[285],"#!\u002Fbin\u002Fbash\n\necho \"Starting vLLM containers with incremental configuration…\"\n\nfor i in {0..7}; do\n    device_num=$((128 + (i * 8)))\n    device_path=\"\u002Fdev\u002Fdri\u002FrenderD${device_num}\"\n    port=$((8080 + i))\n    container_name=\"vllm${i}\"\n\n    echo \"Starting container ${container_name} on port ${port} with device ${device_path}…\"\n\n    docker run -itd \\\n        –ipc host \\\n        -v \u002Fdata:\u002Fdata \\\n        –network vllm_nginx \\\n        -e VLLM_ROCM_USE_AITER=True \\\n        -e HF_HOME=root\u002F.cache\u002Fhuggingface \\\n        -e HF_HUB_CACHE=\u002Froot\u002F.cache\u002Fhuggingface\u002Fhub \\\n        –device=\u002Fdev\u002Fkfd \\\n        –device=${device_path} \\\n        –group-add video \\\n        -p ${port}:8000 \\\n        –name ${container_name} \\\n        rocm\u002Fvllm:latest \\\n        vllm serve \\\n        amd\u002FLlama-3.1-8B-Instruct-FP8-KV \\\n        –num-scheduler-steps 10 \\\n        –kv-cache-dtype fp8 \\\n        –max-model-len 4096\n\n    if [ $? -eq 0 ]; then\n        echo \"✓ Container ${container_name} started successfully\"\n    else\n        echo \"✗ Failed to start container ${container_name}\"\n    fi\n\n    echo \"—\"\ndone\n\necho \"All containers started. Summary:\"\necho \"Containers: vllm0 through vllm7\"\necho \"Ports: 8081 through 8088\"\necho \"Devices: renderD128 through renderD184 (in steps of 8)\"\n",[290,308,306],{"__ignoreMap":288},[10,310,311],{},"De regel device_num=$((128 + (i * 8))) was nodig door achtergebleven renderdevicevermeldingen in \u002Fdev\u002Fdri\u002F na eerdere GPU-partitionering. Ook na het resetten van de partities keerden de device-ID's niet terug naar hun oorspronkelijke waarden. Daarom moesten we elk devicepad verschuiven om naar de beschikbare rendernodes te verwijzen.",[271,313,315],{"start":314},3,[40,316,317],{},[33,318,319],{},"Benchmarking",[10,321,322],{},"Ten slotte hebben we de volgende opdracht uitgevoerd om alle containers te benchmarken:",[282,324,327],{"className":325,"code":326,"language":287,"meta":288},[285],"for i in {1..10}; do\n    echo \"=== Running benchmark iteration $i\u002F10 ===\"\n    python3 ~\u002Fvllm\u002Fbenchmarks\u002Fbenchmark_serving.py \\\n      –backend vllm \\\n      –model amd\u002FLlama-3.1-8B-Instruct-FP8-KV \\\n      –dataset-name sharegpt \\\n      –dataset-path ~\u002Fvllm\u002FShareGPT_V3_unfiltered_cleaned_split.json \\\n      –num-prompts 1024 \\\n      –random-range-ratio 1.0 \\\n      –percentile-metrics ttft,tpot,itl,e2el \\\n      –sharegpt-output-len 256\n    echo \"=== Completed iteration $i\u002F10 ===\"\n    echo\ndone\n",[290,328,326],{"__ignoreMap":288},[102,330,332],{"id":331},"gegevensparallellisme-met-partitionering",[33,333,334],{},"Gegevensparallellisme met partitionering",[10,336,337],{},"De eerste cruciale stap was het partitioneren van onze GPU's.",[10,339,340,341,346],{},"Dit was heel eenvoudig en gemakkelijk te doen volgens ",[17,342,345],{"href":343,"rel":344},"https:\u002F\u002Finstinct.docs.amd.com\u002Fprojects\u002Famdgpu-docs\u002Fen\u002Flatest\u002Fgpu-partitioning\u002Findex.html",[21],"de officiële documentatie van AMD",".",[10,348,349],{},"Stappen:",[271,351,352],{},[40,353,354],{},[33,355,356],{},"Stel de rekenpartities in.",[282,358,361],{"className":359,"code":360,"language":287,"meta":288},[285],"sudo amd-smi set –gpu all –compute-partition CPX\n",[290,362,360],{"__ignoreMap":288},[271,364,365],{"start":294},[40,366,367],{},[33,368,369],{},"Stel de geheugenpartities in.",[282,371,374],{"className":372,"code":373,"language":287,"meta":288},[285],"sudo amd-smi set –memory-partition NPS4\n",[290,375,373],{"__ignoreMap":288},[10,377,378],{},"Wacht een paar seconden en klaar!",[10,380,381],{},"Resultaat:",[10,383,384],{},[385,386],"img",{"alt":288,"src":387},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Frocmoverview.webp",[10,389,390],{},"Klaar voor gebruik!",[10,392,393,394,269],{},"Zoals vermeld in de vorige sectie hebben we, om de benchmarks uit te voeren over meerdere containers met behulp van vLLM, eerst de officiële NGINX load-balancing-handleiding gevolgd (",[17,395,267],{"href":267,"rel":396},[21],[271,398,399],{},[40,400,401],{},[33,402,277],{},[10,404,405],{},"Hier is de taakverdelingsconfiguratie die we gebruikten in \u002Fetc\u002Fnginx\u002Fnginx.conf:",[282,407,410],{"className":408,"code":409,"language":287,"meta":288},[285],"upstream backend {\n    least_conn;\n    server vllm0:8000 max_fails=3 fail_timeout=10000s;\n    .\n    .\n    .\n    server vllm63:8000 max_fails=3 fail_timeout=10000s;\n}\n\nserver {\n    listen 80;\n    location \u002F {\n        proxy_pass http:\u002F\u002Fbackend;\n        proxy_set_header Host $host;\n        proxy_set_header X-Real-IP $remote_addr;\n        proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for;\n        proxy_set_header X-Forwarded-Proto $scheme;\n    }\n}\n",[290,411,409],{"__ignoreMap":288},[271,413,414],{"start":314},[40,415,416],{},[33,417,299],{},[10,419,420],{},"We hebben het volgende script gebruikt om 64 containers te starten met behulp van incrementele apparaat- en poortnummers:",[282,422,425],{"className":423,"code":424,"language":287,"meta":288},[285],"#!\u002Fbin\u002Fbash\n\n# Script to run vLLM containers with incremental device, port, and name changes\n# Runs 64 containers with device=\u002Fdev\u002Fdri\u002FrenderD128 increasing in steps of 64\n# Port starting at 8081 and increasing by 1 each time\n# Container name starting at vllm0 and increasing by 1 each time\n\necho \"Starting vLLM containers with incremental configuration…\"\n\nfor i in {0..63}; do\n    # Calculate device number (renderD128, renderD192, renderD256, etc.)\n    device_num=$((128 + i))\n    device_path=\"\u002Fdev\u002Fdri\u002FrenderD${device_num}\"\n\n    # Calculate port (8081, 8082, 8083, etc.)\n    port=$((8081 + i))\n\n    # Calculate container name (vllm0, vllm1, vllm2, etc.)\n    container_name=\"vllm${i}\"\n\n    echo \"Starting container ${container_name} on port ${port} with device ${device_path}…\"\n    docker run -itd \\\n        –ipc host \\\n        -v \u002Fdata:\u002Fdata \\\n        –network vllm_nginx \\\n        -e VLLM_ROCM_USE_AITER=True \\\n        -e HF_HOME=root\u002F.cache\u002Fhuggingface \\\n        -e HF_HUB_CACHE=\u002Froot\u002F.cache\u002Fhuggingface\u002Fhub \\\n        –device=\u002Fdev\u002Fkfd \\\n        –device=${device_path} \\\n        –group-add video \\\n        -p ${port}:8000 \\\n        –name ${container_name} \\\n        rocm\u002Fvllm:latest \\\n        vllm serve \\\n        \u002Fdata\u002F.cache\u002Fhuggingface\u002Fhub\u002Fmodels–amd–Llama-3.1-8B-Instruct-FP8-KV\u002Fsnapshots\u002Ffa42f9a9105c545755fea25cf69f49ac8c8b40e1\u002F \\\n        –num-scheduler-steps 10 \\\n        –kv-cache-dtype fp8 \\\n        –max-model-len 4096\n\n    # Check if container started successfully\n    if [ $? -eq 0 ]; then\n        echo \"✓ Container ${container_name} started successfully\"\n    else\n        echo \"✗ Failed to start container ${container_name}\"\n    fi\n\n    echo \"—\"\ndone\n\necho \"All containers started. Summary:\"\necho \"Containers: vllm0 through vllm63\"\necho \"Ports: 8081 through 8144\"\necho \"Devices: renderD128 through renderD4160 (in steps of 64)\"\necho \"\"\necho \"To check container status: docker ps\"\necho \"To view logs: docker logs &lt;container_name&gt;\"\n",[290,426,424],{"__ignoreMap":288},[271,428,430],{"start":429},4,[40,431,432],{},[33,433,319],{},[10,435,436],{},"Hetzelfde script als in de vorige sectie.",[10,438,439],{},"De opstelling in actie:",[10,441,442],{},[385,443],{"alt":288,"src":444},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Flh7-rt.googleusercontent.com-dc3c57fbfc36.gif",[10,446,447],{},"Paiton MI300X",[10,449,450],{},[385,451],{"alt":288,"src":452},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Flh7-rt.googleusercontent.com-d1bd449add79.gif",[10,454,455],{},"Standaard MI300X",[102,457,459],{"id":458},"benchmarkresultaten",[33,460,461],{},"Benchmarkresultaten",[463,464,466],"h4",{"id":465},"zonder-partities-8-gpus","Zonder partities, 8 GPU's",[468,469,470,517],"table",{},[471,472,473],"thead",{},[474,475,476,482,487,492,497,502,507,512],"tr",{},[477,478,479],"th",{},[33,480,481],{},"Metric",[477,483,484],{},[33,485,486],{},"Paiton ∆",[477,488,489],{},[33,490,491],{},"Standaard",[477,493,494],{},[33,495,496],{},"∆ versus standaard",[477,498,499],{},[33,500,501],{},"H200",[477,503,504],{},[33,505,506],{},"∆ versus H200",[477,508,509],{},[33,510,511],{},"B200",[477,513,514],{},[33,515,516],{},"∆ versus B200",[518,519,520,553,585,617,649,681,713,745],"tbody",{},[474,521,522,528,531,534,539,542,547,550],{},[523,524,525],"td",{},[33,526,527],{},"Benchmarkduur(en) ↓",[523,529,530],{},"4.812",[523,532,533],{},"11.029",[523,535,536],{},[33,537,538],{},"+129,20%",[523,540,541],{},"11.84",[523,543,544],{},[33,545,546],{},"+146,05%",[523,548,549],{},"4,59",[523,551,552],{},"-4,61%",[474,554,555,560,563,566,571,574,579,582],{},[523,556,557],{},[33,558,559],{},"Verzoekdoorvoer (req\u002Fs) ↑",[523,561,562],{},"213,55",[523,564,565],{},"94.308",[523,567,568],{},[33,569,570],{},"+126,44%",[523,572,573],{},"83,22",[523,575,576],{},[33,577,578],{},"+156,61%",[523,580,581],{},"225,99",[523,583,584],{},"–5,50%",[474,586,587,592,595,598,603,606,611,614],{},[523,588,589],{},[33,590,591],{},"Uitvoertokendoorvoer (tok\u002Fs) ↑",[523,593,594],{},"53851.639",[523,596,597],{},"23809.63",[523,599,600],{},[33,601,602],{},"+126,18%",[523,604,605],{},"20940.86",[523,607,608],{},[33,609,610],{},"+157,16%",[523,612,613],{},"56989.26",[523,615,616],{},"-5,52%",[474,618,619,624,627,630,635,638,643,646],{},[523,620,621],{},[33,622,623],{},"Totale tokendoorvoer (tok\u002Fs) ↑",[523,625,626],{},"101941.667",[523,628,629],{},"45047.076",[523,631,632],{},[33,633,634],{},"+126,30%",[523,636,637],{},"39674.51",[523,639,640],{},[33,641,642],{},"+156,94%",[523,644,645],{},"107827.34",[523,647,648],{},"-5,46%",[474,650,651,656,659,662,667,670,675,678],{},[523,652,653],{},[33,654,655],{},"Gemiddelde TTFT (ms) ↓",[523,657,658],{},"543.799",[523,660,661],{},"4252.513",[523,663,664],{},[33,665,666],{},"+682,47%",[523,668,669],{},"3027.49",[523,671,672],{},[33,673,674],{},"+456,96%",[523,676,677],{},"1245,55",[523,679,680],{},"+129,05%",[474,682,683,688,691,694,699,702,707,710],{},[523,684,685],{},[33,686,687],{},"Gemiddelde TPOT (ms) ↓",[523,689,690],{},"15.075",[523,692,693],{},"16.872",[523,695,696],{},[33,697,698],{},"+11,92%",[523,700,701],{},"26,70",[523,703,704],{},[33,705,706],{},"+77,02%",[523,708,709],{},"10.27",[523,711,712],{},"-31,87%",[474,714,715,720,723,726,731,734,739,742],{},[523,716,717],{},[33,718,719],{},"Gemiddelde ITL (ms) ↓",[523,721,722],{},"15.025",[523,724,725],{},"16.509",[523,727,728],{},[33,729,730],{},"+9,88%",[523,732,733],{},"71.11",[523,735,736],{},[33,737,738],{},"+373,37%",[523,740,741],{},"32,62",[523,743,744],{},"+117,10%",[474,746,747,752,755,758,763,766,771,774],{},[523,748,749],{},[33,750,751],{},"Gemiddelde E2EL (ms) ↓",[523,753,754],{},"4317.43",[523,756,757],{},"8403.948",[523,759,760],{},[33,761,762],{},"+94,65%",[523,764,765],{},"9705.94",[523,767,768],{},[33,769,770],{},"+124,79%",[523,772,773],{},"3818,69",[523,775,776],{},"-11,51%",[10,778,779],{},[385,780],{"alt":288,"src":781,"title":782},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Faverage-throughput-2-2.webp","Grafiek",[463,784,786],{"id":785},"met-partities-64-vgpus","Met partities, 64 vGPU's",[468,788,789,819],{},[471,790,791],{},[474,792,793,797,802,806,811,815],{},[477,794,795],{},[33,796,481],{},[477,798,799,801],{},[33,800,486],{},"*",[477,803,804],{},[33,805,491],{},[477,807,808],{},[33,809,810],{},"∆ versus standaard (ratio)",[477,812,813],{},[33,814,501],{},[477,816,817],{},[33,818,506],{},[518,820,821,841,861,881,900,920,940,959],{},[474,822,823,828,831,834,837,839],{},[523,824,825],{},[33,826,827],{},"Benchmarkduur(en)",[523,829,830],{},"7.875",[523,832,833],{},"17.294",[523,835,836],{},"2,20",[523,838],{},[523,840],{},[474,842,843,848,851,854,857,859],{},[523,844,845],{},[33,846,847],{},"Verzoekdoorvoer (req\u002Fs)",[523,849,850],{},"130.234",[523,852,853],{},"59.727",[523,855,856],{},"2.18",[523,858],{},[523,860],{},[474,862,863,868,871,874,877,879],{},[523,864,865],{},[33,866,867],{},"Uitvoertokendoorvoer (tok\u002Fs)",[523,869,870],{},"33339.931",[523,872,873],{},"15047.115",[523,875,876],{},"2,22",[523,878],{},[523,880],{},[474,882,883,888,891,894,896,898],{},[523,884,885],{},[33,886,887],{},"Totale tokendoorvoer (tok\u002Fs)",[523,889,890],{},"62667.914",[523,892,893],{},"28497,62",[523,895,836],{},[523,897],{},[523,899],{},[474,901,902,907,910,913,916,918],{},[523,903,904],{},[33,905,906],{},"Gemiddelde TTFT (ms)",[523,908,909],{},"1082.885",[523,911,912],{},"6255.879",[523,914,915],{},"5,78",[523,917],{},[523,919],{},[474,921,922,927,930,933,936,938],{},[523,923,924],{},[33,925,926],{},"Gemiddelde TPOT (ms)",[523,928,929],{},"20,99",[523,931,932],{},"31.289",[523,934,935],{},"1,49",[523,937],{},[523,939],{},[474,941,942,947,949,952,955,957],{},[523,943,944],{},[33,945,946],{},"Gemiddelde ITL (ms)",[523,948,929],{},[523,950,951],{},"31.13",[523,953,954],{},"1,48",[523,956],{},[523,958],{},[474,960,961,966,969,972,975,977],{},[523,962,963],{},[33,964,965],{},"Gemiddelde E2EL (ms)",[523,967,968],{},"6435.477",[523,970,971],{},"14067.724",[523,973,974],{},"2.19",[523,976],{},[523,978],{},[10,980,981],{},[982,983,984],"em",{},"*Opmerking: we werken eraan om deze cijfers verder te verbeteren.",[10,986,987],{},[982,988,989,990,995],{},"**Opmerking 2: dit is niet mogelijk met NVIDIA, of is op zijn minst erg moeilijk (",[17,991,994],{"href":992,"rel":993},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm\u002Fissues\u002F6551#issuecomment-2237624342",[21],"meer informatie",").",[10,997,998],{},[385,999],{"alt":288,"src":1000,"title":782},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Faverage-throughput-2-2-1.webp",[10,1002,1003],{},"Laten we dit nu eens bekijken vanuit een ROI-gedreven perspectief.",[10,1005,1006],{},"Als de resultaten tot nu toe nog geen indruk op u hebben gemaakt, zal deze vergelijking dat vermoedelijk wel doen. We gebruiken de MI300X-server als referentie om kosten en doorvoer te vergelijken met de H200 en B200.",[468,1008,1009,1033],{},[471,1010,1011],{},[474,1012,1013,1018,1023,1028],{},[477,1014,1015],{},[33,1016,1017],{},"Architectuur",[477,1019,1020],{},[33,1021,1022],{},"Kostenfactor versus Paiton",[477,1024,1025,801],{},[33,1026,1027],{},"Kostenefficiëntie throughput",[477,1029,1030],{},[33,1031,1032],{},"Kostenefficiëntie latency",[518,1034,1035,1049,1064,1079],{},[474,1036,1037,1042,1045,1047],{},[523,1038,1039],{},[33,1040,1041],{},"MI300X+Paiton",[523,1043,1044],{},"Referentie",[523,1046,1044],{},[523,1048,1044],{},[474,1050,1051,1055,1058,1061],{},[523,1052,1053],{},[33,1054,455],{},[523,1056,1057],{},"1x",[523,1059,1060],{},"+126,31%",[523,1062,1063],{},"+94,57%",[474,1065,1066,1070,1073,1076],{},[523,1067,1068],{},[33,1069,501],{},[523,1071,1072],{},"1.375x",[523,1074,1075],{},"+253,30%",[523,1077,1078],{},"+209,07%",[474,1080,1081,1085,1088,1091],{},[523,1082,1083],{},[33,1084,511],{},[523,1086,1087],{},"2x",[523,1089,1090],{},"+89,18%",[523,1092,706],{},[1094,1095,1096,1101],"blockquote",{},[10,1097,1098],{},[982,1099,1100],{},"*Kostenefficiëntie van throughput: het percentage extra totale tokenthroughput per dollar ten opzichte van elk platform.",[10,1102,1103],{},[982,1104,1105],{},"**Kostenefficiëntie van latency: het percentage betere end-to-end-latency per dollar ten opzichte van elk platform.",[10,1107,1108],{},[33,1109,1110],{},"Wat dit u vertelt",[37,1112,1113,1123,1137],{},[40,1114,1115,1118,1119,1122],{},[33,1116,1117],{},"Paiton levert 2,5× de throughput per dollar"," ten opzichte van een H200 en ",[33,1120,1121],{},"126% meer"," dan de standaardconfiguratie.",[40,1124,1125,1128,1129,1132,1133,1136],{},[33,1126,1127],{},"Latency per dollar"," is ",[33,1130,1131],{},"3,1× beter dan bij de H200"," en ",[33,1134,1135],{},"94% beter dan bij de standaardconfiguratie",". Elke bespaarde milliseconde draagt bij aan het rendement.",[40,1138,1139,1140,1142,1143,1146],{},"Het ",[33,1141,511],{},"-gat is reëel, maar onthoud dat het ",[33,1144,1145],{},"tweemaal"," zoveel kost. Paiton wint over de hele linie nog steeds op het gebied van kostenefficiëntie.",[102,1148,1150],{"id":1149},"kosten-per-miljoen-tokens",[33,1151,1152],{},"Kosten per miljoen tokens",[10,1154,1155],{},"Als we de beschikbare huurprijzen voor de verschillende systemen gebruiken, kunnen we de relatieve kosten per 1 miljoen tokens berekenen:",[468,1157,1158,1191],{},[471,1159,1160],{},[474,1161,1162,1166,1171,1176,1181,1186],{},[477,1163,1164],{},[33,1165,1017],{},[477,1167,1168],{},[33,1169,1170],{},"Doorvoer (tok\u002Fs)",[477,1172,1173],{},[33,1174,1175],{},"GPU-aantal",[477,1177,1178],{},[33,1179,1180],{},"Ong. uurkosten",[477,1182,1183],{},[33,1184,1185],{},"Inferentiekosten \u002F 1M-tokens",[477,1187,1188],{},[33,1189,1190],{},"Relatieve kosten",[518,1192,1193,1213,1231,1250],{},[474,1194,1195,1199,1201,1204,1207,1210],{},[523,1196,1197],{},[33,1198,1041],{},[523,1200,626],{},[523,1202,1203],{},"~8",[523,1205,1206],{},"$ 20,50",[523,1208,1209],{},"$ 0,06",[523,1211,1212],{},"REF",[474,1214,1215,1219,1221,1223,1225,1228],{},[523,1216,1217],{},[33,1218,455],{},[523,1220,629],{},[523,1222,1203],{},[523,1224,1206],{},[523,1226,1227],{},"$ 0,13",[523,1229,1230],{},"2,26× ↑",[474,1232,1233,1237,1239,1241,1244,1247],{},[523,1234,1235],{},[33,1236,501],{},[523,1238,637],{},[523,1240,1203],{},[523,1242,1243],{},"$ 28,20",[523,1245,1246],{},"$ 0,20",[523,1248,1249],{},"3,54× ↑",[474,1251,1252,1256,1258,1260,1263,1265],{},[523,1253,1254],{},[33,1255,511],{},[523,1257,645],{},[523,1259,1203],{},[523,1261,1262],{},"$ 48,60",[523,1264,1227],{},[523,1266,1267],{},"2,24× ↑",[10,1269,1270],{},[385,1271],{"alt":288,"src":1272},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.jpg",[10,1274,1275],{},[33,1276,1277],{},"Inzichten:",[37,1279,1280,1286,1291],{},[40,1281,1282,1285],{},[33,1283,1284],{},"Paiton"," levert 2,26× kostenbesparingen op vergeleken met de niet-geoptimaliseerde MI300X.",[40,1287,1288,1290],{},[33,1289,501],{}," kost 3,54× meer dan MI300X+Paiton per 1 miljoen tokens.",[40,1292,1293,1295,1296,1299],{},[33,1294,511],{}," is de duurste en kost meer dan ",[33,1297,1298],{},"2,24× meer"," dan de geoptimaliseerde MI300X-installatie.",[102,1301,1303],{"id":1302},"grote-overwinning-voor-amd",[33,1304,1305],{},"Grote overwinning voor AMD",[10,1307,1308],{},"Uitzoeken hoe MIG met vLLM op NVIDIA werkte, bleek bijzonder vermoeiend. Uiteindelijk liepen we vast op een NCCL-fout die onoplosbaar leek.",[10,1310,1311],{},"Hoewel MIG virtuele partities op ondersteunde NVIDIA GPU's toestaat, kwamen we, zoals eerder vermeld, aanzienlijke beperkingen tegen bij het proberen het te gebruiken in combinatie met vLLM voor data-parallelle workloads. Meer specifiek was vLLM niet in staat om MIG-plakken op de juiste manier te gebruiken voor gedistribueerde inferentie.",[10,1313,1314],{},"De AMD-architectuur maakte daarentegen een eenvoudige partitionering en gecontaineriseerde deployment van vLLM-instances mogelijk. Deze gestroomlijnde opstelling en ROCm-compatibiliteit maakten AMD direct veel geschikter voor echte multi-tenancy.",[10,1316,1317,1318,1321],{},"Dit vertegenwoordigt een ",[33,1319,1320],{},"grote overwinning voor AMD",", vooral voor bedrijven die geïsoleerde inferentieworkloads op gedeelde hardware willen implementeren zonder al te veel wrijving of compromissen.",[1094,1323,1324],{},[1094,1325,1326],{},[1094,1327,1328,1333,1336],{},[10,1329,1330],{},[33,1331,1332],{},"AMD heeft Intel methodisch voorbijgestreefd op het vlak van prestaties en is nu strategisch klaar om NVIDIA's leiderschap uit te dagen. We zijn er trots op die evolutie mee te ondersteunen.",[10,1334,1335],{},"***Kian Mohadjerin",[10,1337,1338],{},"Hoofd AI, Eliovp BV*",[102,1340,1342],{"id":1341},"belangrijkste-resultaten",[33,1343,1344],{},"Belangrijkste resultaten",[37,1346,1347,1353,1359,1365],{},[40,1348,1349,1352],{},[33,1350,1351],{},"De throughput"," schaalde vrijwel lineair tot 64 partities, dankzij Paiton's minimale geheugenoverhead en snelle kerneldispatch.",[40,1354,1355,1358],{},[33,1356,1357],{},"De latency"," bleef stabiel tijdens parallelle sessies. Dat toont de kracht van Paiton's planning per GPU en optimalisaties voor gedeeld geheugen.",[40,1360,1361,1364],{},[33,1362,1363],{},"Het geheugengebruik per partitie"," lag aanzienlijk lager dan bij standaard vLLM of andere runtimes, waardoor deployments met hoge dichtheid mogelijk werden.",[40,1366,1367,1370],{},[33,1368,1369],{},"De kosten per miljoen tokens"," zijn met meer dan 2× verlaagd vergeleken met geavanceerde systemen zoals de B200, wat het vermogen van Paiton aantoont om toonaangevende efficiëntie te leveren, zelfs op meer betaalbare AMD-hardware.",[102,1372,1374],{"id":1373},"conclusie",[33,1375,1376],{},"Conclusie",[10,1378,1379],{},"Dit experiment toont hoe Paiton met geavanceerde packaging- en optimalisatietechnieken het volledige potentieel van moderne hardware zoals de MI300X ontsluit. Llama 3.1 8B FP8 uitvoeren over 64 GPU-partities laat zien dat inferentieworkloads op grote schaal parallel kunnen draaien zonder veel prestaties of bruikbaarheid op te offeren.",[10,1381,1382],{},"Stel u het potentieel voor van Paiton in combinatie met AMD's aankomende MI355X. Met nog meer geheugenbandbreedte, rekenkracht en architecturale verbeteringen kan de combinatie van next-generation hardware en de Paiton-runtime high-performance AI-serving opnieuw definiëren.",[10,1384,1385],{},"Blijf op de hoogte van toekomstige updates terwijl we de mogelijkheden van Paiton uitbreiden.",[10,1387,1388],{},"Wilt u onze resultaten zelf verifiëren? Test Paiton en vraag een evaluatiemodel aan.",[102,1390,1392],{"id":1391},"prijzen",[33,1393,1394],{},"Prijzen",[10,1396,1397],{},"Bent u benieuwd naar de prijzen van Paiton, dan is onze formule vrij eenvoudig:",[468,1399,1400],{},[471,1401,1402],{},[474,1403,1404],{},[477,1405,1406],{},"50% van x% kosten bespaard per 1 miljoen tokens",[10,1408,1409],{},"We meten de kostenbesparing door de huidige throughput van de klant te vergelijken met de throughput na inschakeling van Paiton.",[10,1411,1412,1417],{},[17,1413,1416],{"href":1414,"rel":1415},"https:\u002F\u002Fai.eliovp.com\u002Fpaiton",[21],"Neem contact op en laten we praten"," :)",[102,1419,1421],{"id":1420},"referenties",[33,1422,1423],{},"Referenties",[271,1425,1426,1433,1440,1446,1452,1458,1464,1470,1476,1483],{},[40,1427,1428],{},[17,1429,1432],{"href":1430,"rel":1431},"https:\u002F\u002Fwww.supermicro.com\u002Fen\u002Fproducts\u002Fsystem\u002Fgpu\u002F8u\u002Fas%20-8125gs-tnmr2",[21],"Supermicro GPU-systeem AS-8125GS-TNMR2",[40,1434,1435],{},[17,1436,1439],{"href":1437,"rel":1438},"https:\u002F\u002Fwww.amd.com\u002Fen\u002Fproducts\u002Faccelerators\u002Finstinct\u002Fmi300\u002Fmi300x.html",[21],"AMD Instinct MI300X",[40,1441,1442],{},[17,1443,1445],{"href":19,"rel":1444},[21],"Paiton FP8 verslaat Nvidia's H200 op AMD's MI300X",[40,1447,1448],{},[17,1449,1451],{"href":142,"rel":1450},[21],"ROCm\u002Fvllm GitHub",[40,1453,1454],{},[17,1455,1457],{"href":157,"rel":1456},[21],"vllm-project\u002Fvllm GitHub",[40,1459,1460],{},[17,1461,1463],{"href":177,"rel":1462},[21],"Hugging Face AMD Llama-3.1-8B-Instruct-FP8-KV",[40,1465,1466],{},[17,1467,1469],{"href":267,"rel":1468},[21],"vLLM Nginx-implementatie",[40,1471,1472],{},[17,1473,1475],{"href":343,"rel":1474},[21],"AMD GPU-partitioneringsdocumentatie",[40,1477,1478],{},[17,1479,1482],{"href":1480,"rel":1481},"https:\u002F\u002Frocm.blogs.amd.com\u002Fsoftware-tools-optimization\u002Fcompute-memory-modes\u002FREADME.html",[21],"ROCm Compute Memory-modi",[40,1484,1485],{},[17,1486,1489],{"href":1487,"rel":1488},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm\u002Fissues\u002F6551",[21],"vLLM GitHub nummer 6551",{"title":288,"searchDepth":294,"depth":294,"links":1491},[1492,1493,1494,1495,1496,1497,1498,1499,1500,1501],{"id":104,"depth":314,"text":107},{"id":255,"depth":314,"text":258},{"id":331,"depth":314,"text":334},{"id":458,"depth":314,"text":461},{"id":1149,"depth":314,"text":1152},{"id":1302,"depth":314,"text":1305},{"id":1341,"depth":314,"text":1344},{"id":1373,"depth":314,"text":1376},{"id":1391,"depth":314,"text":1394},{"id":1420,"depth":314,"text":1423},[1503,1504,1284,1505,1506,1507,511,501,1508,1509,1510,1284,1511],"Alle","Kunstmatige intelligentie","Niet gecategoriseerd","AI","AMD","MI300X","MI355x","NVidia","vLLM","2025-07-31T13:32:57","We schalen Llama-3.1-8B-Instruct-FP8-KV met Paiton op een gepartitioneerde AMD MI300X-server van 8 fysieke GPU's naar 64 virtuele GPU's. De resultaten tonen sterke multi-tenant throughput, veel lagere latency en een bijna gelijkspel met NVIDIA's B200.","md","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp",{},true,"https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F","\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach",{"title":5,"description":1513},"mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","blog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","S7O6Frm-0106diZQtJ_B4Wa8Ml_SMkX4RQEGTdnfyc8",[1525,1541,1555,1583,1594,1616,1634,1653,1672,1690,1707,1719,1735,1750,1752,1761,1769,1784,1795,1806,1817,1827,1840,1850,1863,1874,1884,1895,1904,1916,1927,1936],{"path":1526,"title":1527,"description":1528,"date":1529,"slug":1530,"image":1531,"originalUrl":1532,"categories":1533},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[1284,1504,1534,1535,1536,1537,1538,1539,1511,1540],"AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","Kostenefficiëntie",{"path":1542,"title":1543,"description":1544,"date":1545,"slug":1546,"image":1547,"originalUrl":1548,"categories":1549},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom vermelden offertes voor AI-datacenters verschillende GPU-capaciteiten? Ontdek hoe PUE, piekbelasting, opslag, netwerken en koeling bepalen hoeveel compute werkelijk inzetbaar is.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[1503,1550,1551,1552,1553,1554],"AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1556,"title":1557,"description":1558,"date":1559,"slug":1560,"image":1561,"originalUrl":1562,"categories":1563},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Paiton keert terug naar zijn diffusiewortels: optimalisatie van Wan2.2-T2V-A14B op AMD MI355X","Toen we begonnen met het bouwen van Paiton, was een van onze eerste aandachtsgebieden het optimaliseren van diffusiemodellen. Stable Diffusion XL was een van de eerste grote modellen waarin we lieten zien dat gefuseerde operators, efficiënte uitvoering en hardwarebewuste kernels een echt verschil konden maken. Nu keren we terug naar die oorsprong. Met de groeiende belangstelling voor het genereren van tekst-naar-video, ...","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1503,1504,1284,1564,1507,511,1565,1566,1567,1568,1569,1570,1571,1572,1573,1574,1509,1510,1575,1576,1284,1577,1578,1579,1580,1581,1582],"14B","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","GPU","Hardware","Inferentie","Instinct","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1584,"title":1585,"description":1586,"date":1587,"slug":1588,"image":1589,"originalUrl":1590,"categories":1591},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","Van zolder tot voorpagina: ElioVP erkend als pionier op het gebied van chipoptimalisatie en datacenterinfrastructuur","Het waren bijzondere weken voor het team van Eliovp. Ons bedrijf haalde de voorpagina van De Tijd, de toonaangevende zakenkrant van België. Ons verhaal begon bij een oprichter die op zolder aan hardware sleutelde en groeide uit tot een onderneming met 215 miljoen euro omzet.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1503,1504,1592,1505,1507,1593,1592,1510],"Modulaire DC","De Tijd",{"path":1595,"title":1596,"description":1597,"date":1598,"slug":1599,"image":1600,"originalUrl":1601,"categories":1602},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","Privacy is geen IT-probleem meer, het is een strategische prioriteit","Privacyrisico's, psychologische valkuilen en de operationele realiteit van generatieve AI in de Benelux. Waarom bedrijven gevoelige gegevens, governance en lokale AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1503,1504,1603,1505,1604,1605,1606,1607,1608,1609,1610,1611,1569,1612,1570,1613,1614,1615],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1617,"title":1618,"description":1619,"date":1620,"slug":1621,"image":1622,"originalUrl":1623,"categories":1624},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Itsme? Bij ons is het “it's not me”, en dit is waarom.","Waarom Eliovp itsme niet gebruikt voor medewerkers en interne processen: een analyse van datasoevereiniteit, cloudjurisdictie, metadata, eigendomsstructuur en technische risico's.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1503,1625,1626,1627,1609,1628,1629,1630,1612,1631,1632,1633,1614],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1635,"title":1636,"description":1637,"date":1638,"slug":1639,"image":1640,"originalUrl":1641,"categories":1642},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","De verwachtingen rond Agentic AI staan vaak ver af van de technische realiteit. Dit praktijkrapport beschrijft wat er nodig is om betrouwbare, lokale AI-agents voor bedrijfsworkflows te bouwen, van modulaire architectuur en observability tot modeltraining, VRAM en soevereine infrastructuur.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1503,1504,1643,1603,1644,1645,1646,1647,1648,1649,1650,1651,1577,1652],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1654,"title":1655,"description":1656,"date":1657,"slug":1658,"image":1659,"originalUrl":1660,"categories":1661},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Hoe AI-neocloudinfrastructuur circulaire kasstromen omzet in schijngroei. Tussen 2023 en 2025 stroomden miljarden aan durfkapitaal naar het neocloudecosysteem. Onze analyse onderzoekt hoe circulaire financiering, vaporware-infrastructuur en roofzuchtige contracten onderliggende activawaarden kunstmatig kunnen opbouwen.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1503,1504,1603,1662,1663,1664,1665,1666,1667,1668,1669,1670,1671],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1673,"title":1674,"description":1675,"date":1676,"slug":1677,"image":1678,"originalUrl":1679,"categories":1680},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","De motor voor de AI-race bouwen: in vier maanden klaar voor NVIDIA GB300 NVL72","Bij AI-infrastructuur is snelheid een concurrentieel voordeel. Traditionele datacenterprojecten duren vaak 18 tot 24 maanden. Onze modulaire aanpak levert in vier maanden een operationele faciliteit die specifiek is ontworpen voor de NVIDIA GB300 NVL72.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1503,1592,1505,1681,1550,1682,1683,1684,1685,1686,1687,1688,1689],"150 kW rek","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1691,"title":1692,"description":1693,"date":1694,"slug":1695,"image":1696,"originalUrl":1697,"categories":1698},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","Waarom de “CUDA”-vertaling het echte potentieel van AMD niet zal ontsluiten","Om de paar jaar verschijnt een oplossing met dezelfde belofte: behoud uw CUDA-code, wissel van toolchain en draai plots op verschillende GPU-platforms. Dat kan nuttig zijn voor compatibiliteit, maar ontsluit niet automatisch AMD's echte prestatiepotentieel. Daarvoor zijn AMD-first kernels, libraries en tuning nodig.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1503,1504,1284,1505,1699,1504,1700,1701,1702,1703,1704,1705,1284,1706],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","Hoogwaardige computers","HIP","Kerneltuning","ROCm",{"path":1708,"title":1709,"description":1710,"date":1711,"slug":1712,"image":1713,"originalUrl":1714,"categories":1715},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: de eenvoudigste manier om AI-inferentie een boost te geven","Laten we eerlijk zijn: marketing is niet onze sterkste kant. We namen nooit extern kapitaal aan, verbrandden geen budget aan advertentiecampagnes en bouwden geen verkoopleger. We bouwen gewoon technologie die werkt. Paiton versnelt uw bestaande inferentiestack zonder migratie, nieuwe API's of modelconversie.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1503,1504,1284,1535,1716,1699,1540,1717,1538,1705,1284,1718,1511],"AMD Instinct","Hoge throughput","SGLang",{"path":1720,"title":1721,"description":1722,"date":1723,"slug":1724,"image":1725,"originalUrl":1726,"categories":1727},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Stop met te veel betalen: Paiton MI300X MoE verslaat H200\u002FB200 in kosten per 1 miljoen tokens","We benchmarkten Paiton's nieuwe MoE-ondersteuning met Qwen\u002FQwen3-30B-A3B-Instruct-2507 en vergeleken de inferentieprestaties van verschillende opstellingen. Elke configuratie draaide vijf keer per batchgrootte. We rapporteren het gemiddelde van die runs op basis van realistische conversationele workloads.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1503,1504,1284,1728,1699,1729,1538,1730,1731,1732,1733,1284,1734],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":1736,"title":1737,"description":1738,"date":1739,"slug":1740,"image":1741,"originalUrl":1742,"categories":1743},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Agentic AI, maar dan lokaal: van inbox naar inzicht en actie","We bouwen productieklare, local-first AI-agents die aansluiten op uw bestaande e-mailomgeving. Ze maken tickets aan, classificeren berichten, lezen documenten, herkennen facturen en offertes, analyseren beelden en sturen gestructureerde rapporten naar uw systemen, zonder verplichte afhankelijkheid van externe AI-API's.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1503,1504,1643,1505,1644,1744,1745,1746,1747,1649,1651,1577,1748,1749],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":1519,"title":5,"description":1513,"date":1512,"slug":1521,"image":1515,"originalUrl":1518,"categories":1751},[1503,1504,1284,1505,1506,1507,511,501,1508,1509,1510,1284,1511],{"path":1753,"title":1754,"description":1755,"date":1756,"slug":1757,"image":1758,"originalUrl":1759,"categories":1760},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Bij Eliovp blijven we innoveren om praktische oplossingen te bouwen. Een van onze grootste sterktes is het vermogen om buiten de gebaande paden te denken. Daarom ontwikkelen we toepasbare AI-oplossingen die dagelijks bruikbaar zijn en precies aansluiten op de behoeften van onze klanten.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1503,1504,1643,1644,1744,1745,1746,1747,1649,1651,1577,1748,1749],{"path":1762,"title":1763,"description":1764,"date":1765,"slug":1766,"image":288,"originalUrl":1767,"categories":1768},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","AI verandert elke sector in hoog tempo, maar grote modellen efficiënt uitvoeren blijft een aanzienlijke technische en financiële uitdaging. ElioVP specialiseert zich in optimalisatie voor AMD-accelerators en helpt organisaties het volledige potentieel van hun hardware te benutten. Met onze gratis evaluatiemodellen kunt u de optimalisaties van Paiton vooraf op uw eigen workloads testen.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1503,1504,1284],{"path":1770,"title":1771,"description":1772,"date":1773,"slug":1774,"image":1775,"originalUrl":1776,"categories":1777},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B","Met Paiton streven we niet alleen naar maximale inferentiesnelheden. We verbeteren de volledige levenscyclus van de deployment van grote taalmodellen. Onze nieuwste test combineert AMD MI300X-GPU's met het omvangrijke Llama-3.1-405B-Instruct-FP8-KV-model en levert baanbrekende resultaten op voor zowel opstartsnelheid als runtimeprestaties.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1503,1504,1284,1505,1535,1699,1778,1701,1779,1780,1781,1284,1782,1783],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":1785,"title":1786,"description":1787,"date":1788,"slug":1789,"image":1790,"originalUrl":19,"categories":1791},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","AI evolueert razendsnel en efficiënte inferentie is essentieel om krachtige modellen in praktijksituaties in te zetten. Paiton levert nu sterkere FP8-inferentieprestaties op AMD MI300X-GPU's dan NVIDIA's H200, dankzij zorgvuldig geoptimaliseerde kernels.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp",[1503,1504,1284,1505,1699,1792,1648,1570,1536,1537,1539,1780,1793,1794],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":1796,"title":1797,"description":1798,"date":1799,"slug":1800,"image":1801,"originalUrl":1802,"categories":1803},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X versus H200 versus RX 7900 XTX versus Tenstorrent n300s met vLLM","Nu grote taalmodellen een fundamenteel onderdeel worden van moderne toepassingen, is de juiste server voor deployment belangrijker dan ooit. We vergelijken AMD MI300X, NVIDIA H200, AMD RX 7900 XTX en Tenstorrent n300s met vLLM op throughput en kosten.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1503,1504,1284,1643,1505,1507,1508,1510,1804,1805],"RX7900XTX","tenstorrent",{"path":1807,"title":1808,"description":1809,"date":1810,"slug":1811,"image":1812,"originalUrl":1813,"categories":1814},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële inzichten voor investeerders in GPU-clusters","Eliovp ontwerpt, bouwt en optimaliseert al jaren GPU-clusters in heel Europa. Omdat klanten ons telkens opnieuw vroegen om een P&L-model voor hun investering, bundelden we onze praktijkkennis in ClusterP&L: een toegankelijke, voortdurend bijgewerkte tool voor financiële prognoses van GPU-infrastructuur.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1503,1504,1592,1643,511,501,1815,1510,1816],"MI325x","pnl-rekenmachine",{"path":1818,"title":1819,"description":1820,"date":1821,"slug":1822,"image":1823,"originalUrl":1824,"categories":1825},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","Snellere tokens voor minder geld: AMD MI300X tegenover NVIDIA H200","We vergelijken Qwen3-32B op een AMD MI300X, geoptimaliseerd met Paiton, met de NVIDIA H200. De resultaten tonen hoe Paiton vergelijkbare of betere prestaties kan leveren tegen lagere hardwarekosten en met aantrekkelijke kosten per miljoen tokens.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1503,1504,1284,1506,1507,501,1826,1510,1284,1511],"MI300",{"path":1828,"title":1829,"description":1830,"date":1831,"slug":1832,"image":1833,"originalUrl":1834,"categories":1835},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Waar vermogen en precisie samenkomen: modulair high-density datacenter voor NVIDIA NVL-deployments (1 tot 2 MW)","Eliovp ontwikkelt modulaire high-density infrastructuur voor AI-workloads van Blackwell-klasse. Het platform ondersteunt NVIDIA NVL-configuraties van NVL4 tot NVL72, van gedistribueerde edge-inferentie tot modeltraining op hyperscale, met 1 tot 2 MW IT-vermogen per module.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1503,1592,1836,1662,1683,1553,1684,1685,1837,1838,1688,1839],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":1841,"title":1842,"description":1843,"date":1844,"slug":1845,"image":1846,"originalUrl":1847,"categories":1848},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Eliovp ontwikkelde een medische AI-agent die rechtstreeks met DICOM-servers in ziekenhuizen communiceert. De assistent kan patiënten en onderzoeken opzoeken, relevante beelden ophalen en medische beeldanalyse ondersteunen binnen de lokale ziekenhuisinfrastructuur.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1503,1504,1643,1505,1506,1507,1849],"Zorg",{"path":1851,"title":1852,"description":1853,"date":1854,"slug":1855,"image":1856,"originalUrl":1857,"categories":1858},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Eliovp BV: uw partner voor een veerkrachtige supply chain bij nieuwe Amerikaanse invoerheffingen","Het internationale handelslandschap verandert snel. Nieuwe Amerikaanse invoerheffingen zorgen voor onzekerheid, vooral bij bedrijven die afhankelijk zijn van high-performance computing en AI-infrastructuur. Eliovp helpt klanten hun supply chain veerkrachtig, betrouwbaar en kostenefficiënt te houden.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1503,1603,1506,1507,1859,1860,1861,1862],"importeren","Taiwan","Tarieven","Trump",{"path":1864,"title":1865,"description":1866,"date":1867,"slug":1868,"image":1869,"originalUrl":1870,"categories":1871},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","AI-agenten integreren met uw bestaande ERP-, CRM- en marketingplatforms. Ze vullen uw huidige systemen aan, nemen intelligentere beslissingen en schalen mee met uw organisatie. Zo verlaagt u kosten, beperkt u fouten en maakt u medewerkers vrij voor werk met meer toegevoegde waarde.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1503,1504,1643,1506,1872,1873],"AI-agenten","ERP",{"path":1875,"title":1876,"description":1877,"date":1878,"slug":1879,"image":1880,"originalUrl":1881,"categories":1882},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","In het snel evoluerende AI-landschap zijn opensourceoplossingen belangrijke aanjagers van innovatie en betere prestaties. Deze door de gemeenschap gedragen platforms maken geavanceerde technologie breder toegankelijk, stimuleren samenwerking en versnellen de optimalisatie van AI-modellen.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1503,1504,1603,1883,1507,1571,1510],"AI-nieuws",{"path":1885,"title":1886,"description":1887,"date":1888,"slug":1889,"image":1890,"originalUrl":1891,"categories":1892},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Betrouwbare benchmarks zijn essentieel om AI-modellen en software te optimaliseren. Onze nieuwe tool integreert met dstack en maakt geautomatiseerde, reproduceerbare en schaalbare benchmarkworkflows mogelijk, zowel op lokale GPU's als in de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1503,1504,1284,1506,1507,1893,1894,1508,1284],"benchmark","LLM",{"path":1896,"title":1897,"description":1898,"date":1899,"slug":1900,"image":1901,"originalUrl":1902,"categories":1903},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","De meeste LLM-benchmarks richten zich op afgeleiden van Llama of DeepSeek. Met QwQ-32B verbreden we die vergelijking en testen we hoe Paiton de AMD MI300X optimaliseert tegenover NVIDIA's H200, van throughput en concurrency tot TTFT en end-to-end-latency.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1503,1504,1284],{"path":1905,"title":1906,"description":1907,"date":1908,"slug":1909,"image":1910,"originalUrl":1911,"categories":1912},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Eliovp was onlangs te gast in de AMD Tech Talk-podcast. Onze CEO Elio Van Puyvelde sprak met Jim Greene over het ontstaan van Eliovp, de passie en expertise achter het bedrijf en de geïntegreerde oplossingen die we vandaag aanbieden.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1503,1507,1913,1914,1915],"Jim Greene","Podcast","Tech Talk",{"path":1917,"title":1918,"description":1919,"date":1920,"slug":1921,"image":1922,"originalUrl":1923,"categories":1924},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Paiton richt zich volledig op inferentieoptimalisatie voor AMD. Ons recentste werk levert voor DeepSeek R1 Distill Llama 8B een 10 tot 15% hogere throughput, een betere time-to-first-token en stabielere prestaties bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1503,1504,1284,1507,1925,1926,501,1508,1815,1284,1511],"Deepseek","H100",{"path":1928,"title":1929,"description":1930,"date":1931,"slug":1932,"image":1933,"originalUrl":1934,"categories":1935},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Een eerste blik op Paiton in actie: Deepseek R1 Distill Llama 3.1 8B","Een eerste blik op hoe Paiton Deepseek R1 Distill Llama 3.1 8B optimaliseert voor de AMD MI300X. We vergelijken een met Paiton geoptimaliseerd model met de standaardversie en meten throughput, latency en end-to-end prestaties bij uiteenlopende batchgroottes.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1503,1504,1284,1507,1925,1926,501,1508,1815,1284,1511],{"path":1937,"title":1938,"description":1939,"date":1940,"slug":1941,"image":1942,"originalUrl":1943,"categories":1944},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","In de snel evoluerende wereld van artificiële intelligentie zijn efficiënte modellen en sterke prestaties cruciaal. Met Paiton biedt ElioVP doorgedreven optimalisatie voor AI-modellen. Door de modelarchitectuur te compileren en onze eigen kernels te gebruiken, maakt Paiton snellere inferentie en een lager resourcegebruik op AMD GPU's mogelijk.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1503,1504,1284,1507,1926,501,1508,1815,1284,1511],1788530429883]