[{"data":1,"prerenderedAt":2284},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b":3,"blog-posts-sidebar-nl":1864},{"id":4,"title":5,"body":6,"categories":1843,"date":1852,"description":1853,"extension":1854,"image":1855,"meta":1856,"navigation":1857,"originalUrl":1858,"path":1859,"seo":1860,"slug":1861,"stem":1862,"__hash__":1863},"blogNl\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b.md","Een eerste blik op Paiton in actie: Deepseek R1 Distill Llama 3.1 8B",{"type":7,"value":8,"toc":1807},"minimark",[9,14,22,34,37,52,55,78,92,98,102,118,122,133,144,150,222,225,231,235,238,270,273,781,785,848,853,857,865,872,878,910,916,919,939,943,949,1273,1277,1285,1289,1308,1312,1340,1345,1350,1372,1378,1382,1385,1389,1396,1399,1402,1416,1419,1427,1436,1440,1443,1482,1489,1493,1496,1507,1512,1516,1536,1540,1543,1563,1570,1576,1580,1601,1605,1633,1636,1661,1665,1679,1683,1691,1694,1700,1703,1723,1727,1758,1764,1766,1770,1793,1802],[10,11,13],"h2",{"id":12},"betere-prestaties-dan-standaardmodellen-op-de-amd-mi300x","Betere prestaties dan standaardmodellen op de AMD MI300X",[15,16,18],"h3",{"id":17},"_1-introductie",[19,20,21],"strong",{},"1. Introductie",[23,24,25,26,33],"p",{},"We konden niet wachten om te tonen waartoe Paiton echt in staat is. Nadat we onze AMD-gerichte aanpak en optimalisaties op architectuurniveau in onze ",[27,28,32],"a",{"href":29,"rel":30},"https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[31],"nofollow","vorige blogpost"," hadden toegelicht, besloten we Paiton te testen met een model dat veel aandacht krijgt: Deepseek R1 Distill Llama 3.1 8B. We compileren het model naar efficiënte bibliotheken en combineren bewerkingen in kernels op maat. Die kernelementen van Paiton vermijden veelvoorkomende overhead, zoals herhaalde warm-ups en het capturen van CUDA graphs, die de prestaties in de praktijk vaak beperken. Ons doel was eenvoudig: nagaan hoe een met Paiton geoptimaliseerde versie van Deepseek R1 presteert tegenover de standaardversie op AMD MI300X-hardware.",[23,35,36],{},"Voor onze recentste online serving-tests gebruikten we vLLM met eager mode uitgeschakeld en CUDA graphs actief. Zo meten we representatieve first-run-prestaties. Het gekozen model is Deepseek R1 Distill Llama 3.1 8B, een gespecialiseerde Llama-variant die ontworpen is om latency en rekenkosten te beperken. We vergelijken:",[38,39,40,47],"ol",{},[41,42,43,46],"li",{},[19,44,45],{},"Standaard"," Deepseek R1 Distill Llama 3.1 8B",[41,48,49,46],{},[19,50,51],{},"Met Paiton geoptimaliseerd",[23,53,54],{},"Voor het standaardmodel schakelden we alle relevante optimalisaties van vLLM en onze omgeving in: threadtuning, pinned GPU memory, concurrency-optimalisaties en de gebruikelijke performance flags. Zo kreeg de standaardversie alle kansen om optimaal te presteren. Toch komt Paiton als beste uit de vergelijking, vooral bij grotere batchgroottes.",[23,56,57,58,61,62,65,66,69,70,73,74,77],{},"We bekijken eerst de ",[19,59,60],{},"throughput"," (requests\u002Fs en tokens\u002Fs) en daarna de ",[19,63,64],{},"latency"," (TTFT, TPOT en ITL). Tot slot analyseren we de grafieken voor ",[19,67,68],{},"end-to-end latency",". De korte conclusie: ",[19,71,72],{},"Paiton"," levert in de praktijk consistent betere algemene prestaties. Bij ",[19,75,76],{},"grotere batchgroottes"," is het verschil met de standaardversie bijzonder duidelijk, zowel voor throughput als latency.",[23,79,80,83,84,87,88,91],{},[19,81,82],{},"Opmerking",": deze benchmarks zijn midden ",[19,85,86],{},"januari"," uitgevoerd. Het landschap van LLM-engines evolueert snel, maar ",[19,89,90],{},"de optimalisaties van Paiton op modelniveau"," versterken doorgaans ook latere verbeteringen aan de engine.",[15,93,95],{"id":94},"_2-modeloverzicht",[19,96,97],{},"2. Modeloverzicht",[15,99,101],{"id":100},"deepseek-r1-distill-llama-31-8b","Deepseek R1 Distill Llama 3.1 8B",[103,104,105,111],"ul",{},[41,106,107,108],{},"Een gedistilleerde Llama 3.1-variant die gericht is op ",[19,109,110],{},"lagere latency en een lagere GPU-belasting.",[41,112,113,114,117],{},"Geschikt voor ",[19,115,116],{},"online serving"," waarbij snelheid en geheugenefficiëntie essentieel zijn.",[15,119,121],{"id":120},"waarom-vllm-voor-online-serving","Waarom vLLM voor online serving?",[103,123,124,127,130],{},[41,125,126],{},"Actieve ontwikkeling van de scheduler- en samplermodules.",[41,128,129],{},"Benchmarking die aansluit bij realtime gebruikspatronen.",[41,131,132],{},"Ondersteuning voor uiteenlopende concurrency- en batchconfiguraties.",[23,134,135,136,139,140,143],{},"(We blijven ",[19,137,138],{},"SGLang"," onderzoeken, maar voorlopig is ",[19,141,142],{},"vLLM"," onze voorkeursengine voor deze online serving-tests.)",[15,145,147],{"id":146},"_3-benchmarkopstelling",[19,148,149],{},"3. Benchmarkopstelling",[103,151,152,162,172,178,184,190,196,202],{},[41,153,154,157,158,161],{},[19,155,156],{},"Hardware",": AMD MI300X-server (met meerdere MI300X GPU's), gelegen in ons hoofddatacenter (",[19,159,160],{},"Server A",").",[41,163,164,167,168,171],{},[19,165,166],{},"Client",": aanvragen worden vanaf ",[19,169,170],{},"Server B"," op een andere locatie verzonden om realistische netwerklatency na te bootsen.",[41,173,174,177],{},[19,175,176],{},"Engine",": vLLM 0.6.3",[41,179,180,183],{},[19,181,182],{},"Tensorparallelisme",": 1",[41,185,186,189],{},[19,187,188],{},"Batchgroottes",": variërend van 1 tot 4096.",[41,191,192,195],{},[19,193,194],{},"Invoer-\u002Fuitvoertokens",": standaardinstellingen",[41,197,198,201],{},[19,199,200],{},"Dataset",": we hebben de ShareGPT-dataset gebruikt om realistische gebruikersquery's te genereren.",[41,203,204,207,208],{},[19,205,206],{},"Metrics",":\n",[103,209,210,216],{},[41,211,212,215],{},[19,213,214],{},"Throughput",": requests\u002Fs, output tokens\u002Fs en totale tokens\u002Fs.",[41,217,218,221],{},[19,219,220],{},"Latency",": TTFT (Time to First Token), TPOT (Time Per Output Token) en ITL (Inter-Token Latency).",[23,223,224],{},"Deze metingen bootsen een productieomgeving na, waarin gebruikersaanvragen onregelmatig binnenkomen in plaats van in netjes vooraf geplande batches.",[15,226,228],{"id":227},"_4-throughput",[19,229,230],{},"4. Throughput",[15,232,234],{"id":233},"throughputvergelijking-standaardmodel-tegenover-paiton","Throughputvergelijking: standaardmodel tegenover Paiton",[23,236,237],{},"We maten de throughput aan de hand van verschillende metrics:",[103,239,240,246,252,258,264],{},[41,241,242,245],{},[19,243,244],{},"Succ. Req (Stock\u002FPaiton)",": het aantal aanvragen dat tijdens de benchmark met succes is verwerkt.",[41,247,248,251],{},[19,249,250],{},"Duur (Stock\u002FPaiton)",": Hoe lang elke test duurde, in seconden.",[41,253,254,257],{},[19,255,256],{},"Req\u002Fs (Stock\u002FPaiton)",": requests per seconde, een rechtstreekse maatstaf voor concurrency.",[41,259,260,263],{},[19,261,262],{},"Out Tok\u002Fs (Stock\u002FPaiton)",": hoeveel uitvoertokens er per seconde zijn gegenereerd, wat aangeeft hoe snel het model tekst produceert zodra het is gestart.",[41,265,266,269],{},[19,267,268],{},"Total Tok\u002Fs (Stock\u002FPaiton)",": de som van de input- en outputtokens die per seconde worden verwerkt, als algemene maatstaf voor tokenthroughput.",[23,271,272],{},"Hieronder vindt u de tabel met resultaten van batchgrootte 1 tot 4096:",[274,275,276,338],"table",{},[277,278,279],"thead",{},[280,281,282,288,293,298,303,308,313,318,323,328,333],"tr",{},[283,284,285],"th",{},[19,286,287],{},"Batchgrootte",[283,289,290],{},[19,291,292],{},"Succ. Req (Stock)",[283,294,295],{},[19,296,297],{},"Succ. Req (Paiton)",[283,299,300],{},[19,301,302],{},"Duur (s) (Stock)",[283,304,305],{},[19,306,307],{},"Duur (s) (Paiton)",[283,309,310],{},[19,311,312],{},"Req\u002Fs (Stock)",[283,314,315],{},[19,316,317],{},"Req\u002Fs (Paiton)",[283,319,320],{},[19,321,322],{},"Out Tok\u002Fs (Stock)",[283,324,325],{},[19,326,327],{},"Out Tok\u002Fs (Paiton)",[283,329,330],{},[19,331,332],{},"Total Tok\u002Fs (Stock)",[283,334,335],{},[19,336,337],{},"Total Tok\u002Fs (Paiton)",[339,340,341,375,408,440,472,506,540,574,608,642,677,711,746],"tbody",{},[280,342,343,347,349,351,354,357,360,363,366,369,372],{},[344,345,346],"td",{},"1",[344,348,346],{},[344,350,346],{},[344,352,353],{},"1,01",[344,355,356],{},"1,03",[344,358,359],{},"0,99",[344,361,362],{},"0,97",[344,364,365],{},"119,31",[344,367,368],{},"116,61",[344,370,371],{},"132,24",[344,373,374],{},"129,24",[280,376,377,380,382,384,387,390,393,396,399,402,405],{},[344,378,379],{},"2",[344,381,379],{},[344,383,379],{},[344,385,386],{},"6,54",[344,388,389],{},"6,65",[344,391,392],{},"0,31",[344,394,395],{},"0,30",[344,397,398],{},"135,31",[344,400,401],{},"132,92",[344,403,404],{},"141,12",[344,406,407],{},"138,63",[280,409,410,413,415,417,419,422,425,428,431,434,437],{},[344,411,412],{},"4",[344,414,412],{},[344,416,412],{},[344,418,386],{},[344,420,421],{},"6,69",[344,423,424],{},"0,61",[344,426,427],{},"0,60",[344,429,430],{},"200,52",[344,432,433],{},"196,82",[344,435,436],{},"211,98",[344,438,439],{},"208,03",[280,441,442,445,447,449,451,454,457,460,463,466,469],{},[344,443,444],{},"8",[344,446,444],{},[344,448,444],{},[344,450,389],{},[344,452,453],{},"6,82",[344,455,456],{},"1,20",[344,458,459],{},"1,17",[344,461,462],{},"328,76",[344,464,465],{},"308,84",[344,467,468],{},"503,14",[344,470,471],{},"478,87",[280,473,474,477,480,482,485,488,491,494,497,500,503],{},[344,475,476],{},"16",[344,478,479],{},"15",[344,481,479],{},[344,483,484],{},"7,12",[344,486,487],{},"7,07",[344,489,490],{},"2,11",[344,492,493],{},"2,12",[344,495,496],{},"478,27",[344,498,499],{},"481,56",[344,501,502],{},"840,52",[344,504,505],{},"846,20",[280,507,508,511,514,516,519,522,525,528,531,534,537],{},[344,509,510],{},"32",[344,512,513],{},"31",[344,515,513],{},[344,517,518],{},"7,69",[344,520,521],{},"7,48",[344,523,524],{},"4,03",[344,526,527],{},"4,14",[344,529,530],{},"844,94",[344,532,533],{},"867,74",[344,535,536],{},"1635,26",[344,538,539],{},"1679,88",[280,541,542,545,548,550,553,556,559,562,565,568,571],{},[344,543,544],{},"64",[344,546,547],{},"62",[344,549,547],{},[344,551,552],{},"8,23",[344,554,555],{},"8,46",[344,557,558],{},"7,54",[344,560,561],{},"7,33",[344,563,564],{},"1540,69",[344,566,567],{},"1497,98",[344,569,570],{},"3196,12",[344,572,573],{},"3108,53",[280,575,576,579,582,584,587,590,593,596,599,602,605],{},[344,577,578],{},"128",[344,580,581],{},"125",[344,583,581],{},[344,585,586],{},"9,90",[344,588,589],{},"10,84",[344,591,592],{},"12,63",[344,594,595],{},"11,53",[344,597,598],{},"2773,89",[344,600,601],{},"2532,12",[344,603,604],{},"5505,84",[344,606,607],{},"5026,42",[280,609,610,613,616,618,621,624,627,630,633,636,639],{},[344,611,612],{},"256",[344,614,615],{},"246",[344,617,615],{},[344,619,620],{},"13,43",[344,622,623],{},"15,27",[344,625,626],{},"18,32",[344,628,629],{},"16,11",[344,631,632],{},"4027,02",[344,634,635],{},"3539,33",[344,637,638],{},"7755,44",[344,640,641],{},"6816,71",[280,643,644,647,650,653,656,659,662,665,668,671,674],{},[344,645,646],{},"512",[344,648,649],{},"487",[344,651,652],{},"488",[344,654,655],{},"36,43",[344,657,658],{},"26,33",[344,660,661],{},"13,37",[344,663,664],{},"18,54",[344,666,667],{},"2981,57",[344,669,670],{},"4126,93",[344,672,673],{},"5507,35",[344,675,676],{},"7639,89",[280,678,679,682,685,687,690,693,696,699,702,705,708],{},[344,680,681],{},"1024",[344,683,684],{},"974",[344,686,684],{},[344,688,689],{},"62,91",[344,691,692],{},"47,37",[344,694,695],{},"15,48",[344,697,698],{},"20,56",[344,700,701],{},"3153,95",[344,703,704],{},"4188,55",[344,706,707],{},"6259,23",[344,709,710],{},"8316,16",[280,712,713,716,719,722,725,728,731,734,737,740,743],{},[344,714,715],{},"2048",[344,717,718],{},"1944",[344,720,721],{},"1942",[344,723,724],{},"151,01",[344,726,727],{},"99,34",[344,729,730],{},"12,87",[344,732,733],{},"19,55",[344,735,736],{},"2688,64",[344,738,739],{},"4079,61",[344,741,742],{},"5387,61",[344,744,745],{},"8178,29",[280,747,748,751,754,757,760,763,766,769,772,775,778],{},[344,749,750],{},"4096",[344,752,753],{},"3897",[344,755,756],{},"3889",[344,758,759],{},"244,52",[344,761,762],{},"190,22",[344,764,765],{},"15,94",[344,767,768],{},"20,45",[344,770,771],{},"3274,32",[344,773,774],{},"4197,43",[344,776,777],{},"6612,40",[344,779,780],{},"8471,24",[15,782,784],{"id":783},"gedetailleerde-observaties","Gedetailleerde observaties",[103,786,787,812,825,838],{},[41,788,789,792],{},[19,790,791],{},"Req\u002Fs (requests per seconde)",[103,793,794,800,806],{},[41,795,796,799],{},[19,797,798],{},"Kleine batches (1–8)",": Paiton ligt ongeveer 1 tot 4% achter voor ruwe Req\u002Fs. Kleinere batches benutten de fused kernels en concurrencyvoordelen van Paiton momenteel nog niet volledig.",[41,801,802,805],{},[19,803,804],{},"Middelgrote batches (16–128)",": beide versies komen dichter bij elkaar. Paiton neemt voor Req\u002Fs soms de leiding, wat wijst op een betere verwerking van gelijktijdige aanvragen.",[41,807,808,811],{},[19,809,810],{},"Grote batches (256–4096)",": Paiton schaalt aanzienlijk beter, bijvoorbeeld bij 512 (Stock ~13,37, Paiton ~18,54) en 4096 (Stock ~15,94, Paiton ~20,45).",[41,813,814,817],{},[19,815,816],{},"Out Tok\u002Fs (uitvoertokens\u002Fs)",[103,818,819,822],{},[41,820,821],{},"Geeft weer hoe snel het systeem reactietokens kan produceren zodra het genereren begint.",[41,823,824],{},"Bij batchgrootte 512 haalt Stock ~2981,57, tegenover ~4126,93 voor Paiton. Dat is 38% meer outputtokens per seconde. Bij lange tekstuitvoer, zoals samenvattingen of gesprekken, merken eindgebruikers dit als een duidelijk snellere respons.",[41,826,827,830],{},[19,828,829],{},"Totaal tok\u002Fs (invoer + uitvoer)",[103,831,832,835],{},[41,833,834],{},"Een algemene maatstaf voor het aantal verwerkte tokens.",[41,836,837],{},"Bij grotere batches evenaart of overtreft Paiton de standaardversie consequent. Bij batchgrootte 4096 stijgt het resultaat bijvoorbeeld van ~6612 naar ~8471, een totale verbetering van ongeveer 28%.",[41,839,840,843],{},[19,841,842],{},"Duur",[103,844,845],{},[41,846,847],{},"De duur van de testruns toont eveneens dat Paiton een vergelijkbare workload bij bepaalde batchgroottes sneller voltooit. Bij 512 duurt Stock bijvoorbeeld ~36,43 seconden, tegenover ~26,33 seconden voor Paiton.",[23,849,850,852],{},[19,851,82],{},": ook de volledige opstarttijd is aanzienlijk korter. Dat omvat het starten van vLLM, het laden en klaarmaken van het model en het initiëren van een aanvraag vanaf een tweede server.",[15,854,856],{"id":855},"voorbeelden-uit-de-praktijk","Voorbeelden uit de praktijk",[103,858,859,862],{},[41,860,861],{},"Chatbots met pieken in aanvragen: bij een plotse toestroom van gebruikers ontstaan vaak batches tussen 64 en 256. Het concurrencyvoordeel van Paiton zorgt bij deze groottes voor meer Req\u002Fs en snellere antwoorden.",[41,863,864],{},"Bulk-inferentietaken (batchgrootte 512+): bij het samenvatten van grote documenten of verwerken van veel aanvragen houdt Paiton de vertraging beperkt, terwijl de throughput van het standaardmodel begint af te vlakken of te dalen.",[23,866,867],{},[868,869],"img",{"alt":870,"src":871},"","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Freal-world-examples.png",[23,873,874,877],{},[19,875,876],{},"Interpretatie",":",[103,879,880,891,901],{},[41,881,882,885,886,890],{},[19,883,884],{},"Subplot 1",": Rechtstreekse concurrencymaatstaf (",[887,888,889],"code",{},"Req\u002Fs","). Naarmate de batchgrootte toeneemt, presteert Paiton doorgaans beter dan Stock. Dat weerspiegelt de betere scheduling en fused kernels.",[41,892,893,896,897,900],{},[19,894,895],{},"Subplot 2",": ",[19,898,899],{},"Uitvoertokens\u002Fs"," laat zien hoe snel grote hoeveelheden tekst worden gegenereerd.",[41,902,903,896,906,909],{},[19,904,905],{},"Subplot 3",[19,907,908],{},"Total tokens\u002Fs"," combineert de verwerking van input- en outputtokens. Dat helpt om de tokenthroughput over de volledige pipeline te analyseren.",[15,911,913],{"id":912},"_5-latentie",[19,914,915],{},"5. Latentie",[23,917,918],{},"Naast ruwe throughput is latency cruciaal voor elke realtime of interactieve toepassing. We hebben ons specifiek gericht op:",[103,920,921,927,933],{},[41,922,923,926],{},[19,924,925],{},"TTFT (Time-to-First-Token)",": hoe snel het allereerste token wordt geproduceerd na een inferentieverzoek.",[41,928,929,932],{},[19,930,931],{},"TPOT (Time-Per-Output-Token)",": hoe lang het duurt om elk volgend token te genereren.",[41,934,935,938],{},[19,936,937],{},"ITL (Inter-Token Latency)",": de tijd tussen opeenvolgende tokens, bijzonder relevant bij streaming output.",[15,940,942],{"id":941},"standaardmodel-tegenover-paiton-ttft-tpot-en-itl","Standaardmodel tegenover Paiton: TTFT, TPOT en ITL",[23,944,945,946,877],{},"Hieronder vindt u de latentiegegevens die we hebben verzameld bij batchgroottes variërend van ",[19,947,948],{},"1 tot 4096",[274,950,951,989],{},[277,952,953],{},[280,954,955,959,964,969,974,979,984],{},[283,956,957],{},[19,958,287],{},[283,960,961],{},[19,962,963],{},"TTFT (Stock)",[283,965,966],{},[19,967,968],{},"TTFT (Paiton)",[283,970,971],{},[19,972,973],{},"TPOT (Stock)",[283,975,976],{},[19,977,978],{},"TPOT (Paiton)",[283,980,981],{},[19,982,983],{},"ITL (Stock)",[283,985,986],{},[19,987,988],{},"ITL (Paiton)",[339,990,991,1010,1032,1054,1075,1097,1119,1141,1163,1185,1207,1229,1251],{},[280,992,993,995,998,1001,1004,1006,1008],{},[344,994,346],{},[344,996,997],{},"24,34",[344,999,1000],{},"20,89",[344,1002,1003],{},"8,24",[344,1005,555],{},[344,1007,1003],{},[344,1009,555],{},[280,1011,1012,1014,1017,1020,1023,1026,1029],{},[344,1013,379],{},[344,1015,1016],{},"147,11",[344,1018,1019],{},"27,90",[344,1021,1022],{},"8,34",[344,1024,1025],{},"8,64",[344,1027,1028],{},"8,31",[344,1030,1031],{},"8,61",[280,1033,1034,1036,1039,1042,1045,1048,1051],{},[344,1035,412],{},[344,1037,1038],{},"151,61",[344,1040,1041],{},"31,43",[344,1043,1044],{},"8,36",[344,1046,1047],{},"8,72",[344,1049,1050],{},"8,33",[344,1052,1053],{},"8,68",[280,1055,1056,1058,1061,1064,1067,1070,1072],{},[344,1057,444],{},[344,1059,1060],{},"183,36",[344,1062,1063],{},"80,19",[344,1065,1066],{},"8,59",[344,1068,1069],{},"8,95",[344,1071,555],{},[344,1073,1074],{},"8,82",[280,1076,1077,1079,1082,1085,1088,1091,1094],{},[344,1078,476],{},[344,1080,1081],{},"476,79",[344,1083,1084],{},"151,58",[344,1086,1087],{},"9,25",[344,1089,1090],{},"9,68",[344,1092,1093],{},"8,92",[344,1095,1096],{},"9,18",[280,1098,1099,1101,1104,1107,1110,1113,1116],{},[344,1100,510],{},[344,1102,1103],{},"346,01",[344,1105,1106],{},"271,58",[344,1108,1109],{},"13,58",[344,1111,1112],{},"10,29",[344,1114,1115],{},"11,18",[344,1117,1118],{},"9,85",[280,1120,1121,1123,1126,1129,1132,1135,1138],{},[344,1122,544],{},[344,1124,1125],{},"743,26",[344,1127,1128],{},"568,33",[344,1130,1131],{},"11,59",[344,1133,1134],{},"13,06",[344,1136,1137],{},"10,81",[344,1139,1140],{},"11,51",[280,1142,1143,1145,1148,1151,1154,1157,1160],{},[344,1144,578],{},[344,1146,1147],{},"951,62",[344,1149,1150],{},"924,81",[344,1152,1153],{},"23,91",[344,1155,1156],{},"27,37",[344,1158,1159],{},"14,35",[344,1161,1162],{},"16,67",[280,1164,1165,1167,1170,1173,1176,1179,1182],{},[344,1166,612],{},[344,1168,1169],{},"1776,32",[344,1171,1172],{},"1525,37",[344,1174,1175],{},"38,28",[344,1177,1178],{},"51,80",[344,1180,1181],{},"20,53",[344,1183,1184],{},"25,18",[280,1186,1187,1189,1192,1195,1198,1201,1204],{},[344,1188,646],{},[344,1190,1191],{},"6788,80",[344,1193,1194],{},"4440,15",[344,1196,1197],{},"87,42",[344,1199,1200],{},"57,89",[344,1202,1203],{},"64,75",[344,1205,1206],{},"40,16",[280,1208,1209,1211,1214,1217,1220,1223,1226],{},[344,1210,681],{},[344,1212,1213],{},"19560,22",[344,1215,1216],{},"14734,59",[344,1218,1219],{},"77,08",[344,1221,1222],{},"57,37",[344,1224,1225],{},"69,45",[344,1227,1228],{},"48,82",[280,1230,1231,1233,1236,1239,1242,1245,1248],{},[344,1232,715],{},[344,1234,1235],{},"65322,87",[344,1237,1238],{},"37294,28",[344,1240,1241],{},"95,91",[344,1243,1244],{},"58,61",[344,1246,1247],{},"86,34",[344,1249,1250],{},"53,68",[280,1252,1253,1255,1258,1261,1264,1267,1270],{},[344,1254,750],{},[344,1256,1257],{},"99924,78",[344,1259,1260],{},"84892,12",[344,1262,1263],{},"76,50",[344,1265,1266],{},"59,48",[344,1268,1269],{},"73,74",[344,1271,1272],{},"56,55",[15,1274,1276],{"id":1275},"tijd-tot-eerste-token-ttft","Tijd tot eerste token (TTFT)",[103,1278,1279,1282],{},[41,1280,1281],{},"De eerste indruk telt: bij interactieve toepassingen zoals chatbots ervaren gebruikers de snelheid vanaf het moment waarop het eerste token verschijnt.",[41,1283,1284],{},"Aanzienlijke winst: Paiton is bij vrijwel alle batchgroottes sneller, bij de grootste batches soms met tienduizenden milliseconden.",[15,1286,1288],{"id":1287},"tpot-itl","TPOT & ITL",[103,1290,1291,1297],{},[41,1292,1293,1296],{},[19,1294,1295],{},"Snelheid van tokengeneratie",": nadat het eerste token verschijnt, moet ook de rest van de output snel volgen. TPOT meet het aantal milliseconden per outputtoken en bepaalt zo in grote mate de totale throughput van een lang antwoord.",[41,1298,1299,1302,1303],{},[19,1300,1301],{},"Stabiliteit",": bij grotere batchgroottes (256+) blijft de TPOT van Paiton relatief stabiel, terwijl die van het standaardmodel sterker kan pieken.\n",[103,1304,1305],{},[41,1306,1307],{},"Bij batchgrootte 2048 bedraagt de TPOT bijvoorbeeld ~95,91 ms voor Stock en ~58,61 ms voor Paiton. Over 50 tokens loopt dat verschil op tot 1,9 seconden extra generatietijd.",[15,1309,1311],{"id":1310},"impact-in-de-praktijk","Impact in de praktijk",[103,1313,1314,1327],{},[41,1315,1316,207,1319],{},[19,1317,1318],{},"Kleine batches",[103,1320,1321,1324],{},[41,1322,1323],{},"Het verschil in TTFT bedraagt soms maar tientallen of honderden milliseconden, maar zelfs dat is belangrijk in toepassingen met lage latency, zoals type-ahead.",[41,1325,1326],{},"Een eerste token dat een halve seconde sneller verschijnt, kan voor eindgebruikers al veel responsiever aanvoelen.",[41,1328,1329,207,1332],{},[19,1330,1331],{},"Grote batches",[103,1333,1334,1337],{},[41,1335,1336],{},"Wanneer uw systeem veel aanvragen in de wachtrij plaatst of verkeerspieken verwerkt, voorkomt de stabielere TPOT en TTFT van Paiton dat de totale responstijd exponentieel oploopt.",[41,1338,1339],{},"Het resultaat is een lagere end-to-end latency (sectie 6) en meer capaciteit voor gelijktijdige aanvragen.",[23,1341,1342],{},[868,1343],{"alt":870,"src":1344},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Freal-world-impact.jpg",[23,1346,1347,877],{},[19,1348,1349],{},"De grafieken interpreteren",[103,1351,1352,1362],{},[41,1353,1354,207,1357],{},[19,1355,1356],{},"TTFT-plot",[103,1358,1359],{},[41,1360,1361],{},"De Stock-lijn stijgt snel bij grotere batchgroottes, terwijl die van Paiton relatief lager blijft. Dat is cruciaal voor de snelheid waarmee het eerste token verschijnt.",[41,1363,1364,207,1367],{},[19,1365,1366],{},"TPOT-plot",[103,1368,1369],{},[41,1370,1371],{},"De lijn van Paiton kan bij kleine batchgroottes iets hoger liggen en bij grote batchgroottes iets lager. Dat hangt af van de concurrencyoverhead tegenover de efficiëntie van de kernels. Over het geheel genomen is de trend stabieler dan bij het standaardmodel.",[15,1373,1375],{"id":1374},"_6-verdere-analyse-latency-tegenover-throughput",[19,1376,1377],{},"6. Verdere analyse: latency tegenover throughput",[15,1379,1381],{"id":1380},"waarom-latency-naast-throughput-telt","Waarom latency naast throughput telt",[23,1383,1384],{},"Eén throughputmetric, zoals requests per seconde, vertelt niet het volledige verhaal. Bij chatbots, vraag-antwoordsystemen en andere interactieve toepassingen hangt de gebruikerservaring sterk af van de latency: hoe snel het model begint te antwoorden (TTFT) en hoe snel de volgende tokens verschijnen (TPOT of ITL).",[15,1386,1388],{"id":1387},"e2e-latentie-nader-bekeken","E2E-latentie: nader bekeken",[23,1390,1391,1392,1395],{},"We benaderen de ",[19,1393,1394],{},"end-to-end latency (E2E)"," met de formule:",[23,1397,1398],{},"E2E Latency ≈ TTFT + (num_tokens×TPOT)",[23,1400,1401],{},"waarbij:",[103,1403,1404,1410],{},[41,1405,1406,1409],{},[19,1407,1408],{},"TTFT"," (Time-to-First-Token): de tijd voordat het eerste token wordt teruggegeven.",[41,1411,1412,1415],{},[19,1413,1414],{},"TPOT"," (Time-Per-Output-Token): de tijd die ieder volgend token na het eerste nodig heeft.",[23,1417,1418],{},"Dit betekent dat elke verbetering in TTFT, TPOT of beide de E2E-latentie aanzienlijk kan verlagen.",[23,1420,1421,1422,1426],{},"In het ideale geval wilt u zowel een hoge doorvoer als een lage latentie. In realtime contexten (chatbots, vraag- en antwoordsystemen) zijn tokens\u002Fsec\u002Fgebruiker ook van belang. Hieronder ziet u een vereenvoudigd diagram (conceptueel) dat laat zien hoe een optimale aanpak de latentie-doorvoercurve ",[1423,1424,1425],"em",{},"naar boven en naar links"," verplaatst.",[1428,1429,1434],"pre",{"className":1430,"code":1432,"language":1433},[1431],"language-text","(Throughput) ↑\n\n             |  ● Paiton model\n\n             |               ● Stock model\n\n             |`\n\n             +--------------------------------→ (E2E Latency)\n","text",[887,1435,1432],{"__ignoreMap":870},[15,1437,1439],{"id":1438},"de-cijfers-vertalen-naar-praktijkscenarios","De cijfers vertalen naar praktijkscenario's",[23,1441,1442],{},"Door te kijken naar zowel batchgrootte als TTFT in de bovenstaande tabellen:",[103,1444,1445,1465],{},[41,1446,1447,207,1450],{},[19,1448,1449],{},"Bij batchgrootte 512",[103,1451,1452,1462],{},[41,1453,1454,1457,1458,1461],{},[19,1455,1456],{},"Stock"," TTFT is ~6788 ms, terwijl Paiton TTFT ~4440 ms is, een ",[19,1459,1460],{},"2,3 seconde verschil",".",[41,1463,1464],{},"Zodra u rekening houdt met meerdere tokens, bijvoorbeeld 50 tot 100 voor een gemiddeld chatbotantwoord, neemt het verschil in E2E-latency verder toe.",[41,1466,1467,207,1470],{},[19,1468,1469],{},"Bij batchgrootte 2048",[103,1471,1472],{},[41,1473,1474,1475,1477,1478,1481],{},"De TTFT van ",[19,1476,1456],{}," stijgt naar ~65322 ms, terwijl Paiton op ~37294 ms blijft. Dat verkort de wachttijd tot het eerste token met ongeveer ",[19,1479,1480],{},"28 seconden",". Voor gebruikers die grote outputs aanvragen in een omgeving met hoge concurrency kan dat het verschil maken tussen een responsieve en een onbruikbare toepassing.",[23,1483,1484,1485,1488],{},"Tegelijk blijft de throughput bij dezelfde batchgroottes aanzienlijk hoger met Paiton. U kunt dus meer aanvragen gelijktijdig verwerken ",[1423,1486,1487],{},"en"," een snellere time-to-first-token bieden.",[15,1490,1492],{"id":1491},"de-curves-interpreteren","De curves interpreteren",[23,1494,1495],{},"Als we de doorvoer (Verzoeken\u002Fs) uitzetten tegen een geschatte E2E-latentie (TTFT + tokens × TPOT):",[38,1497,1498,1501],{},[41,1499,1500],{},"De Paiton-curve ligt doorgaans boven en links van de Stock-curve. Bij eenzelfde throughput is de E2E-latency dus lager. Omgekeerd kan Paiton bij een bepaalde latencyvereiste meer aanvragen per seconde verwerken.",[41,1502,1503,1506],{},[19,1504,1505],{},"Schaalgedrag",": naarmate de batchgrootte stijgt naar 256, 512, 1024, 2048 en 4096, loopt de TTFT van het Stock-model sterk op. Dat veroorzaakt een hoge E2E-latency. De TTFT van Paiton neemt eveneens toe, maar trager, waardoor het systeem onder belasting responsiever blijft.",[23,1508,1509],{},[868,1510],{"alt":870,"src":1511},"\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fe2e-latency-vs-throughput.png",[15,1513,1515],{"id":1514},"belangrijkste-aandachtspunten-voor-productie","Belangrijkste aandachtspunten voor productie",[103,1517,1518,1524,1530],{},[41,1519,1520,1523],{},[19,1521,1522],{},"Hogere gelijktijdigheid",": het model kan een grote wachtrij aan verzoeken afhandelen zonder de E2E-latentie tot ondraaglijke niveaus te laten stijgen.",[41,1525,1526,1529],{},[19,1527,1528],{},"Betere gebruikerservaring",": vooral de snelheid van het eerste token bepaalt hoe responsief een sessie aanvoelt. Zelfs als het laatste token maar iets vroeger aankomt, houdt die snelle eerste reactie eindgebruikers betrokken.",[41,1531,1532,1535],{},[19,1533,1534],{},"Schaalbaarheid",": als uw applicatie af en toe veel verkeer genereert (honderden of duizenden gelijktijdige verzoeken), zorgt de aanpak van Paiton ervoor dat u geen exponentiële stijging van de responstijd ziet.",[15,1537,1539],{"id":1538},"voorbeeld-als-u-100-tokens-per-verzoek-genereert","Voorbeeld: als u 100 tokens per verzoek genereert",[23,1541,1542],{},"Met behulp van de formule TTFT + 100 × TPOT:",[103,1544,1545],{},[41,1546,1547,207,1549],{},[19,1548,1449],{},[103,1550,1551,1557],{},[41,1552,1553,1554],{},"Standaard E2E ≈ 6788 + 100 × 87,42 = 6788 + 8742 = 15.530 ms ≈ ",[19,1555,1556],{},"15,5 s",[41,1558,1559,1560],{},"Paiton E2E ≈ 4440 + 100 × 57,89 = 4440 + 5789 = 10.229 ms ≈ ",[19,1561,1562],{},"10,2 s",[23,1564,1565,1566,1569],{},"In dit scenario levert Paiton voor een antwoord van dezelfde lengte een ",[19,1567,1568],{},"meer dan 5 seconden"," lagere end-to-end latency, zelfs zonder het throughputvoordeel mee te rekenen. Bij duizenden gelijktijdige aanvragen wordt de impact op de gebruikerstevredenheid en infrastructuurbelasting aanzienlijk.",[15,1571,1573],{"id":1572},"_7-belangrijkste-observaties",[19,1574,1575],{},"7. Belangrijkste observaties",[15,1577,1579],{"id":1578},"algemene-voorsprong","Algemene voorsprong",[103,1581,1582,1591],{},[41,1583,1584,207,1586],{},[19,1585,1318],{},[103,1587,1588],{},[41,1589,1590],{},"De throughput is vaak vergelijkbaar met Stock, of ligt iets lager, maar de TTFT is consequent beter. Dat is belangrijk voor gebruikersgerichte scenario's met weinig concurrency.",[41,1592,1593,207,1596],{},[19,1594,1595],{},"Middelgrote tot grote batches",[103,1597,1598],{},[41,1599,1600],{},"De winst in doorvoer en latentie wordt aanzienlijk; Paiton blinkt uit in het benutten van gelijktijdigheid en gefuseerde kernels voor AMD GPU's.",[15,1602,1604],{"id":1603},"sterke-prestaties-bij-grote-batches","Sterke prestaties bij grote batches",[103,1606,1607,1617,1627],{},[41,1608,1609,207,1612],{},[19,1610,1611],{},"512 Voorbeeld",[103,1613,1614],{},[41,1615,1616],{},"Stock ≈ 13,37 req\u002Fs tegenover Paiton ≈ 18,54, een stijging van ongeveer 38% in ruwe throughput.",[41,1618,1619,207,1622],{},[19,1620,1621],{},"4096 Voorbeeld",[103,1623,1624],{},[41,1625,1626],{},"Stock ≈ 15,94 req\u002Fs tegenover Paiton ≈ 20,45, een verbetering van ongeveer 28%.",[41,1628,1629,1632],{},[19,1630,1631],{},"Latentiewinst",": TTFT-verschillen bij hoge batches variëren soms van duizenden ms, waardoor de gebruikerservaring voor grootschalige taken dramatisch wordt verbeterd.",[15,1634,1311],{"id":1635},"impact-in-de-praktijk-1",[38,1637,1638,1648],{},[41,1639,1640,1643],{},[19,1641,1642],{},"Kleine batches (sporadische aanvragen)",[103,1644,1645],{},[41,1646,1647],{},"Een snellere Time-to-First-Token geeft eindgebruikers vrijwel onmiddellijk respons, essentieel voor chatbots en realtime prompts.",[41,1649,1650,1653],{},[19,1651,1652],{},"Grote batches (piekbelasting en lange wachtrijen)",[103,1654,1655,1658],{},[41,1656,1657],{},"De efficiëntere schaling van Paiton kan in bepaalde gevallen tot 50% meer verzoeken verwerken.",[41,1659,1660],{},"Ideaal voor bulk-inferentietaken zoals samenvatten en grootschalige embeddings genereren.",[15,1662,1664],{"id":1663},"gevolgen-voor-kosten-en-energieverbruik","Gevolgen voor kosten en energieverbruik",[103,1666,1667,1673],{},[41,1668,1669,1672],{},[19,1670,1671],{},"Betere doorvoer"," vertaalt zich vaak in lagere cloudkosten bij het huren van GPU-tijd, omdat u workloads sneller kunt voltooien of meer gebruikers op dezelfde hardware kunt bedienen.",[41,1674,1675,1678],{},[19,1676,1677],{},"Lagere latentie"," en minder inactieve cycli betekenen vaak energiebesparingen, vooral op grote HPC-clusters of datacenters met AMD MI300X GPU's.",[15,1680,1682],{"id":1681},"multi-gpu-en-hpc-schaling","Multi-GPU en HPC-schaling",[103,1684,1685,1688],{},[41,1686,1687],{},"Hoewel deze resultaten één systeem behandelen, worden de voordelen van concurrency en kernelfusie bij multi-GPU- en HPC-opstellingen doorgaans nog groter.",[41,1689,1690],{},"Toekomstige tests zullen aantonen hoe de architectuurgerichte compilatie van Paiton over meerdere AMD GPU's met veel VRAM schaalt en zo consistente prestatieverbeteringen biedt, ongeacht de clustergrootte.",[1692,1693],"hr",{},[15,1695,1697],{"id":1696},"_8-conclusie-en-volgende-stappen",[19,1698,1699],{},"8. Conclusie en volgende stappen",[23,1701,1702],{},"Hoewel we het standaardmodel Deepseek R1 Distill Llama 3.1 8B alle beschikbare voordelen binnen vLLM gaven, behoudt Paiton een duidelijke voorsprong in zowel throughput als latency:",[103,1704,1705,1711,1717],{},[41,1706,1707,1710],{},[19,1708,1709],{},"Betere TTFT"," voor onmiddellijke responsiviteit.",[41,1712,1713,1716],{},[19,1714,1715],{},"Gelijke of hogere"," doorvoer bij middelgrote batchgroottes.",[41,1718,1719,1722],{},[19,1720,1721],{},"Aanzienlijke"," doorvoerwinst bij grote batchgroottes, wat superieure schaling op AMD MI300X-hardware aantoont.",[15,1724,1726],{"id":1725},"vooruitkijken","Vooruitkijken",[103,1728,1729,1735,1741,1747,1753],{},[41,1730,1731,1734],{},[19,1732,1733],{},"SGLang-evaluaties",": we blijven onderzoeken hoe het concurrencymodel van SGLang samengaat met de AMD-optimalisaties van Paiton.",[41,1736,1737,1740],{},[19,1738,1739],{},"Tokens\u002Fsec\u002Fgebruiker",": toekomstige artikels behandelen metrics voor meerdere gebruikers, essentieel voor grootschalige chatbots.",[41,1742,1743,1746],{},[19,1744,1745],{},"FP8 en andere kwantisering",": het balanceren van nauwkeurigheid en snelheid is een prioriteit, en we zijn van plan om te delen hoe inferentie met ultra-lage precisie presteert op AMD.",[41,1748,1749,1752],{},[19,1750,1751],{},"Optimalisatie van lagere batchgroottes:"," Zoals blijkt uit deze blog blinkt Paiton duidelijk uit als het gaat om hogere batchgroottes, ideaal voor productieomgevingen, maar we zullen ons werk voortzetten om ook voor kleinere batchgroottes te optimaliseren.",[41,1754,1755,1757],{},[19,1756,182],{},": multi-GPU-inferentie en het optimaliseren met Paiton van grotere modellen, zoals Deepseek R1 met 671 miljard parameters.",[23,1759,1760,1763],{},[19,1761,1762],{},"Onthoud",": de LLM-ruimte evolueert snel. De bibliotheken van morgen kunnen die van vandaag overtreffen, maar de architecturale aanpak van Paiton zorgt ervoor dat u altijd kunt profiteren van toekomstige verbeteringen aan de engine.",[1692,1765],{},[15,1767,1769],{"id":1768},"bijlage","Bijlage",[103,1771,1772,1783],{},[41,1773,1774,1777,1778,1782],{},[19,1775,1776],{},"Vorige blog",": “",[27,1779,1781],{"href":29,"rel":1780},[31],"AI-modeloptimalisatie met Paiton","” voor meer informatie over fused kernels en AMD-gerichte compilatie.",[41,1784,1785,1788,1789,1792],{},[19,1786,1787],{},"Blijf op de hoogte:"," We zullen meer resultaten delen naarmate we ",[19,1790,1791],{},"elk"," aspect van de pijplijn blijven optimaliseren, zodat Paiton nog betere prestaties levert.",[23,1794,1795,1796,1801],{},"Bedankt voor het lezen! Voor vragen, samenwerkingsideeën of specifieke LLM-engineverzoeken kunt u ",[27,1797,1800],{"href":1798,"rel":1799},"https:\u002F\u002Fdocs.google.com\u002Fforms\u002Fd\u002F1TTGg_WpkR8KcNPvVhJZohS60X7LGtIK_q1IUlIuFBM0\u002Fedit",[31],"contact met ons opnemen",". Houd ons in de gaten voor verdere gedetailleerde vergelijkingen en omgevingsinstellingen waarmee u topprestaties op AMD GPU's kunt realiseren.",[23,1803,1804],{},[19,1805,1806],{},"Het Paiton-team",{"title":870,"searchDepth":1808,"depth":1808,"links":1809},2,[1810],{"id":12,"depth":1808,"text":13,"children":1811},[1812,1814,1815,1816,1817,1818,1819,1820,1821,1822,1823,1824,1825,1826,1827,1828,1829,1830,1831,1832,1833,1834,1835,1836,1837,1838,1839,1840,1841,1842],{"id":17,"depth":1813,"text":21},3,{"id":94,"depth":1813,"text":97},{"id":100,"depth":1813,"text":101},{"id":120,"depth":1813,"text":121},{"id":146,"depth":1813,"text":149},{"id":227,"depth":1813,"text":230},{"id":233,"depth":1813,"text":234},{"id":783,"depth":1813,"text":784},{"id":855,"depth":1813,"text":856},{"id":912,"depth":1813,"text":915},{"id":941,"depth":1813,"text":942},{"id":1275,"depth":1813,"text":1276},{"id":1287,"depth":1813,"text":1288},{"id":1310,"depth":1813,"text":1311},{"id":1374,"depth":1813,"text":1377},{"id":1380,"depth":1813,"text":1381},{"id":1387,"depth":1813,"text":1388},{"id":1438,"depth":1813,"text":1439},{"id":1491,"depth":1813,"text":1492},{"id":1514,"depth":1813,"text":1515},{"id":1538,"depth":1813,"text":1539},{"id":1572,"depth":1813,"text":1575},{"id":1578,"depth":1813,"text":1579},{"id":1603,"depth":1813,"text":1604},{"id":1635,"depth":1813,"text":1311},{"id":1663,"depth":1813,"text":1664},{"id":1681,"depth":1813,"text":1682},{"id":1696,"depth":1813,"text":1699},{"id":1725,"depth":1813,"text":1726},{"id":1768,"depth":1813,"text":1769},[1844,1845,72,1846,1847,1848,1849,1850,1851,72,142],"Alle","Kunstmatige intelligentie","AMD","Deepseek","H100","H200","MI300X","MI325x","2025-01-31T09:11:02","Een eerste blik op hoe Paiton Deepseek R1 Distill Llama 3.1 8B optimaliseert voor de AMD MI300X. We vergelijken een met Paiton geoptimaliseerd model met de standaardversie en meten throughput, latency en end-to-end prestaties bij uiteenlopende batchgroottes.","md","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp",{},true,"https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F","\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b",{"title":5,"description":1853},"a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","blog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","5D6EHOGhcINpvWj28FdxdBR_rFDJp8cJtK7QwHNwPbc",[1865,1881,1895,1925,1937,1959,1977,1996,2015,2033,2050,2061,2077,2092,2102,2111,2119,2134,2146,2157,2167,2177,2190,2200,2213,2224,2234,2245,2254,2266,2275,2277],{"path":1866,"title":1867,"description":1868,"date":1869,"slug":1870,"image":1871,"originalUrl":1872,"categories":1873},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[72,1845,1874,1875,1876,1877,1878,1879,142,1880],"AMD Radeon","AI-inferentie","GPU-prestaties","Inferentielatentie","Inferentie-optimalisatie","Grote taalmodellen","Kostenefficiëntie",{"path":1882,"title":1883,"description":1884,"date":1885,"slug":1886,"image":1887,"originalUrl":1888,"categories":1889},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom vermelden offertes voor AI-datacenters verschillende GPU-capaciteiten? Ontdek hoe PUE, piekbelasting, opslag, netwerken en koeling bepalen hoeveel compute werkelijk inzetbaar is.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",null,[1844,1890,1891,1892,1893,1894],"AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1896,"title":1897,"description":1898,"date":1899,"slug":1900,"image":1901,"originalUrl":1902,"categories":1903},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Paiton keert terug naar zijn diffusiewortels: optimalisatie van Wan2.2-T2V-A14B op AMD MI355X","Toen we begonnen met het bouwen van Paiton, was een van onze eerste aandachtsgebieden het optimaliseren van diffusiemodellen. Stable Diffusion XL was een van de eerste grote modellen waarin we lieten zien dat gefuseerde operators, efficiënte uitvoering en hardwarebewuste kernels een echt verschil konden maken. Nu keren we terug naar die oorsprong. Met de groeiende belangstelling voor het genereren van tekst-naar-video, ...","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1844,1845,72,1904,1846,1905,1906,1907,1908,1909,1910,1911,1912,156,1913,1914,1915,1916,1917,1918,72,1919,1920,1921,1922,1923,1924],"14B","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","GPU","Inferentie","Instinct","MI355x","NVidia","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1926,"title":1927,"description":1928,"date":1929,"slug":1930,"image":1931,"originalUrl":1932,"categories":1933},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","Van zolder tot voorpagina: ElioVP erkend als pionier op het gebied van chipoptimalisatie en datacenterinfrastructuur","Het waren bijzondere weken voor het team van Eliovp. Ons bedrijf haalde de voorpagina van De Tijd, de toonaangevende zakenkrant van België. Ons verhaal begon bij een oprichter die op zolder aan hardware sleutelde en groeide uit tot een onderneming met 215 miljoen euro omzet.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1844,1845,1934,1935,1846,1936,1934,1916],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1938,"title":1939,"description":1940,"date":1941,"slug":1942,"image":1943,"originalUrl":1944,"categories":1945},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","Privacy is geen IT-probleem meer, het is een strategische prioriteit","Privacyrisico's, psychologische valkuilen en de operationele realiteit van generatieve AI in de Benelux. Waarom bedrijven gevoelige gegevens, governance en lokale AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1844,1845,1946,1935,1947,1948,1949,1950,1951,1952,1953,1954,1910,1955,1911,1956,1957,1958],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1960,"title":1961,"description":1962,"date":1963,"slug":1964,"image":1965,"originalUrl":1966,"categories":1967},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Itsme? Bij ons is het “it's not me”, en dit is waarom.","Waarom Eliovp itsme niet gebruikt voor medewerkers en interne processen: een analyse van datasoevereiniteit, cloudjurisdictie, metadata, eigendomsstructuur en technische risico's.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1844,1968,1969,1970,1952,1971,1972,1973,1955,1974,1975,1976,1957],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1978,"title":1979,"description":1980,"date":1981,"slug":1982,"image":1983,"originalUrl":1984,"categories":1985},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","De verwachtingen rond Agentic AI staan vaak ver af van de technische realiteit. Dit praktijkrapport beschrijft wat er nodig is om betrouwbare, lokale AI-agents voor bedrijfsworkflows te bouwen, van modulaire architectuur en observability tot modeltraining, VRAM en soevereine infrastructuur.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1844,1845,1986,1946,1987,1988,1989,1990,1991,1992,1993,1994,1919,1995],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1997,"title":1998,"description":1999,"date":2000,"slug":2001,"image":2002,"originalUrl":2003,"categories":2004},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Hoe AI-neocloudinfrastructuur circulaire kasstromen omzet in schijngroei. Tussen 2023 en 2025 stroomden miljarden aan durfkapitaal naar het neocloudecosysteem. Onze analyse onderzoekt hoe circulaire financiering, vaporware-infrastructuur en roofzuchtige contracten onderliggende activawaarden kunstmatig kunnen opbouwen.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1844,1845,1946,2005,2006,2007,2008,2009,2010,2011,2012,2013,2014],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":2016,"title":2017,"description":2018,"date":2019,"slug":2020,"image":2021,"originalUrl":2022,"categories":2023},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","De motor voor de AI-race bouwen: in vier maanden klaar voor NVIDIA GB300 NVL72","Bij AI-infrastructuur is snelheid een concurrentieel voordeel. Traditionele datacenterprojecten duren vaak 18 tot 24 maanden. Onze modulaire aanpak levert in vier maanden een operationele faciliteit die specifiek is ontworpen voor de NVIDIA GB300 NVL72.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1844,1934,1935,2024,1890,2025,2026,2027,2028,2029,2030,2031,2032],"150 kW rek","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":2034,"title":2035,"description":2036,"date":2037,"slug":2038,"image":2039,"originalUrl":2040,"categories":2041},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","Waarom de “CUDA”-vertaling het echte potentieel van AMD niet zal ontsluiten","Om de paar jaar verschijnt een oplossing met dezelfde belofte: behoud uw CUDA-code, wissel van toolchain en draai plots op verschillende GPU-platforms. Dat kan nuttig zijn voor compatibiliteit, maar ontsluit niet automatisch AMD's echte prestatiepotentieel. Daarvoor zijn AMD-first kernels, libraries en tuning nodig.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1844,1845,72,1935,2042,1845,2043,2044,2045,2046,2047,2048,72,2049],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","Hoogwaardige computers","HIP","Kerneltuning","ROCm",{"path":2051,"title":2052,"description":2053,"date":2054,"slug":2055,"image":2056,"originalUrl":2057,"categories":2058},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: de eenvoudigste manier om AI-inferentie een boost te geven","Laten we eerlijk zijn: marketing is niet onze sterkste kant. We namen nooit extern kapitaal aan, verbrandden geen budget aan advertentiecampagnes en bouwden geen verkoopleger. We bouwen gewoon technologie die werkt. Paiton versnelt uw bestaande inferentiestack zonder migratie, nieuwe API's of modelconversie.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1844,1845,72,1875,2059,2042,1880,2060,1878,2048,72,138,142],"AMD Instinct","Hoge throughput",{"path":2062,"title":2063,"description":2064,"date":2065,"slug":2066,"image":2067,"originalUrl":2068,"categories":2069},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Stop met te veel betalen: Paiton MI300X MoE verslaat H200\u002FB200 in kosten per 1 miljoen tokens","We benchmarkten Paiton's nieuwe MoE-ondersteuning met Qwen\u002FQwen3-30B-A3B-Instruct-2507 en vergeleken de inferentieprestaties van verschillende opstellingen. Elke configuratie draaide vijf keer per batchgrootte. We rapporteren het gemiddelde van die runs op basis van realistische conversationele workloads.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1844,1845,72,2070,2042,2071,1878,2072,2073,2074,2075,72,2076],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":2078,"title":2079,"description":2080,"date":2081,"slug":2082,"image":2083,"originalUrl":2084,"categories":2085},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Agentic AI, maar dan lokaal: van inbox naar inzicht en actie","We bouwen productieklare, local-first AI-agents die aansluiten op uw bestaande e-mailomgeving. Ze maken tickets aan, classificeren berichten, lezen documenten, herkennen facturen en offertes, analyseren beelden en sturen gestructureerde rapporten naar uw systemen, zonder verplichte afhankelijkheid van externe AI-API's.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1844,1845,1986,1935,1987,2086,2087,2088,2089,1992,1994,1919,2090,2091],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":2093,"title":2094,"description":2095,"date":2096,"slug":2097,"image":2098,"originalUrl":2099,"categories":2100},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8 data-parallelle benchmarks (8 tot 64 GPU's): H200 achter zich, B200 binnen bereik","We schalen Llama-3.1-8B-Instruct-FP8-KV met Paiton op een gepartitioneerde AMD MI300X-server van 8 fysieke GPU's naar 64 virtuele GPU's. De resultaten tonen sterke multi-tenant throughput, veel lagere latency en een bijna gelijkspel met NVIDIA's B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1844,1845,72,1935,2101,1846,1905,1849,1850,1915,1916,72,142],"AI",{"path":2103,"title":2104,"description":2105,"date":2106,"slug":2107,"image":2108,"originalUrl":2109,"categories":2110},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Bij Eliovp blijven we innoveren om praktische oplossingen te bouwen. Een van onze grootste sterktes is het vermogen om buiten de gebaande paden te denken. Daarom ontwikkelen we toepasbare AI-oplossingen die dagelijks bruikbaar zijn en precies aansluiten op de behoeften van onze klanten.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1844,1845,1986,1987,2086,2087,2088,2089,1992,1994,1919,2090,2091],{"path":2112,"title":2113,"description":2114,"date":2115,"slug":2116,"image":870,"originalUrl":2117,"categories":2118},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","AI verandert elke sector in hoog tempo, maar grote modellen efficiënt uitvoeren blijft een aanzienlijke technische en financiële uitdaging. ElioVP specialiseert zich in optimalisatie voor AMD-accelerators en helpt organisaties het volledige potentieel van hun hardware te benutten. Met onze gratis evaluatiemodellen kunt u de optimalisaties van Paiton vooraf op uw eigen workloads testen.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1844,1845,72],{"path":2120,"title":2121,"description":2122,"date":2123,"slug":2124,"image":2125,"originalUrl":2126,"categories":2127},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B","Met Paiton streven we niet alleen naar maximale inferentiesnelheden. We verbeteren de volledige levenscyclus van de deployment van grote taalmodellen. Onze nieuwste test combineert AMD MI300X-GPU's met het omvangrijke Llama-3.1-405B-Instruct-FP8-KV-model en levert baanbrekende resultaten op voor zowel opstartsnelheid als runtimeprestaties.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1844,1845,72,1935,1875,2042,2128,2044,2129,2130,2131,72,2132,2133],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":2135,"title":2136,"description":2137,"date":2138,"slug":2139,"image":2140,"originalUrl":2141,"categories":2142},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","AI evolueert razendsnel en efficiënte inferentie is essentieel om krachtige modellen in praktijksituaties in te zetten. Paiton levert nu sterkere FP8-inferentieprestaties op AMD MI300X-GPU's dan NVIDIA's H200, dankzij zorgvuldig geoptimaliseerde kernels.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1844,1845,72,1935,2042,2143,1991,1911,1876,1877,1879,2130,2144,2145],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":2147,"title":2148,"description":2149,"date":2150,"slug":2151,"image":2152,"originalUrl":2153,"categories":2154},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X versus H200 versus RX 7900 XTX versus Tenstorrent n300s met vLLM","Nu grote taalmodellen een fundamenteel onderdeel worden van moderne toepassingen, is de juiste server voor deployment belangrijker dan ooit. We vergelijken AMD MI300X, NVIDIA H200, AMD RX 7900 XTX en Tenstorrent n300s met vLLM op throughput en kosten.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1844,1845,72,1986,1935,1846,1850,1916,2155,2156],"RX7900XTX","tenstorrent",{"path":2158,"title":2159,"description":2160,"date":2161,"slug":2162,"image":2163,"originalUrl":2164,"categories":2165},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële inzichten voor investeerders in GPU-clusters","Eliovp ontwerpt, bouwt en optimaliseert al jaren GPU-clusters in heel Europa. Omdat klanten ons telkens opnieuw vroegen om een P&L-model voor hun investering, bundelden we onze praktijkkennis in ClusterP&L: een toegankelijke, voortdurend bijgewerkte tool voor financiële prognoses van GPU-infrastructuur.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1844,1845,1934,1986,1905,1849,1851,1916,2166],"pnl-rekenmachine",{"path":2168,"title":2169,"description":2170,"date":2171,"slug":2172,"image":2173,"originalUrl":2174,"categories":2175},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","Snellere tokens voor minder geld: AMD MI300X tegenover NVIDIA H200","We vergelijken Qwen3-32B op een AMD MI300X, geoptimaliseerd met Paiton, met de NVIDIA H200. De resultaten tonen hoe Paiton vergelijkbare of betere prestaties kan leveren tegen lagere hardwarekosten en met aantrekkelijke kosten per miljoen tokens.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1844,1845,72,2101,1846,1849,2176,1916,72,142],"MI300",{"path":2178,"title":2179,"description":2180,"date":2181,"slug":2182,"image":2183,"originalUrl":2184,"categories":2185},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Waar vermogen en precisie samenkomen: modulair high-density datacenter voor NVIDIA NVL-deployments (1 tot 2 MW)","Eliovp ontwikkelt modulaire high-density infrastructuur voor AI-workloads van Blackwell-klasse. Het platform ondersteunt NVIDIA NVL-configuraties van NVL4 tot NVL72, van gedistribueerde edge-inferentie tot modeltraining op hyperscale, met 1 tot 2 MW IT-vermogen per module.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1844,1934,2186,2005,2026,1893,2027,2028,2187,2188,2031,2189],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":2191,"title":2192,"description":2193,"date":2194,"slug":2195,"image":2196,"originalUrl":2197,"categories":2198},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Eliovp ontwikkelde een medische AI-agent die rechtstreeks met DICOM-servers in ziekenhuizen communiceert. De assistent kan patiënten en onderzoeken opzoeken, relevante beelden ophalen en medische beeldanalyse ondersteunen binnen de lokale ziekenhuisinfrastructuur.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1844,1845,1986,1935,2101,1846,2199],"Zorg",{"path":2201,"title":2202,"description":2203,"date":2204,"slug":2205,"image":2206,"originalUrl":2207,"categories":2208},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Eliovp BV: uw partner voor een veerkrachtige supply chain bij nieuwe Amerikaanse invoerheffingen","Het internationale handelslandschap verandert snel. Nieuwe Amerikaanse invoerheffingen zorgen voor onzekerheid, vooral bij bedrijven die afhankelijk zijn van high-performance computing en AI-infrastructuur. Eliovp helpt klanten hun supply chain veerkrachtig, betrouwbaar en kostenefficiënt te houden.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1844,1946,2101,1846,2209,2210,2211,2212],"importeren","Taiwan","Tarieven","Trump",{"path":2214,"title":2215,"description":2216,"date":2217,"slug":2218,"image":2219,"originalUrl":2220,"categories":2221},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","AI-agenten integreren met uw bestaande ERP-, CRM- en marketingplatforms. Ze vullen uw huidige systemen aan, nemen intelligentere beslissingen en schalen mee met uw organisatie. Zo verlaagt u kosten, beperkt u fouten en maakt u medewerkers vrij voor werk met meer toegevoegde waarde.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1844,1845,1986,2101,2222,2223],"AI-agenten","ERP",{"path":2225,"title":2226,"description":2227,"date":2228,"slug":2229,"image":2230,"originalUrl":2231,"categories":2232},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","In het snel evoluerende AI-landschap zijn opensourceoplossingen belangrijke aanjagers van innovatie en betere prestaties. Deze door de gemeenschap gedragen platforms maken geavanceerde technologie breder toegankelijk, stimuleren samenwerking en versnellen de optimalisatie van AI-modellen.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1844,1845,1946,2233,1846,1912,1916],"AI-nieuws",{"path":2235,"title":2236,"description":2237,"date":2238,"slug":2239,"image":2240,"originalUrl":2241,"categories":2242},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Betrouwbare benchmarks zijn essentieel om AI-modellen en software te optimaliseren. Onze nieuwe tool integreert met dstack en maakt geautomatiseerde, reproduceerbare en schaalbare benchmarkworkflows mogelijk, zowel op lokale GPU's als in de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1844,1845,72,2101,1846,2243,2244,1850,72],"benchmark","LLM",{"path":2246,"title":2247,"description":2248,"date":2249,"slug":2250,"image":2251,"originalUrl":2252,"categories":2253},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","De meeste LLM-benchmarks richten zich op afgeleiden van Llama of DeepSeek. Met QwQ-32B verbreden we die vergelijking en testen we hoe Paiton de AMD MI300X optimaliseert tegenover NVIDIA's H200, van throughput en concurrency tot TTFT en end-to-end-latency.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1844,1845,72],{"path":2255,"title":2256,"description":2257,"date":2258,"slug":2259,"image":2260,"originalUrl":2261,"categories":2262},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Eliovp was onlangs te gast in de AMD Tech Talk-podcast. Onze CEO Elio Van Puyvelde sprak met Jim Greene over het ontstaan van Eliovp, de passie en expertise achter het bedrijf en de geïntegreerde oplossingen die we vandaag aanbieden.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1844,1846,2263,2264,2265],"Jim Greene","Podcast","Tech Talk",{"path":2267,"title":2268,"description":2269,"date":2270,"slug":2271,"image":2272,"originalUrl":2273,"categories":2274},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Paiton richt zich volledig op inferentieoptimalisatie voor AMD. Ons recentste werk levert voor DeepSeek R1 Distill Llama 8B een 10 tot 15% hogere throughput, een betere time-to-first-token en stabielere prestaties bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1844,1845,72,1846,1847,1848,1849,1850,1851,72,142],{"path":1859,"title":5,"description":1853,"date":1852,"slug":1861,"image":1855,"originalUrl":1858,"categories":2276},[1844,1845,72,1846,1847,1848,1849,1850,1851,72,142],{"path":2278,"title":1781,"description":2279,"date":2280,"slug":2281,"image":2282,"originalUrl":29,"categories":2283},"\u002Fblog\u002Fai-model-optimization-with-paiton","In de snel evoluerende wereld van artificiële intelligentie zijn efficiënte modellen en sterke prestaties cruciaal. Met Paiton biedt ElioVP doorgedreven optimalisatie voor AI-modellen. Door de modelarchitectuur te compileren en onze eigen kernels te gebruiken, maakt Paiton snellere inferentie en een lager resourcegebruik op AMD GPU's mogelijk.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp",[1844,1845,72,1846,1848,1849,1850,1851,72,142],1788530428930]