[{"data":1,"prerenderedAt":2254},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700":3,"blog-posts-sidebar-nl":1754},{"id":4,"title":5,"body":6,"categories":1735,"date":1740,"description":1741,"extension":1742,"heading":1743,"image":1744,"meta":1745,"navigation":1149,"originalUrl":1746,"path":1747,"seo":1748,"slug":1749,"socialImage":1750,"stem":1751,"updated":1752,"__hash__":1753},"blogNl\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700.md","Qwen3.8 27B op 1 × Radeon AI PRO R9700: 3-bit gewichten, 20% snellere decode",{"type":7,"value":8,"toc":1714},"minimark",[9,18,45,59,64,67,82,94,98,102,114,305,308,313,316,321,394,397,401,404,409,514,532,616,620,623,628,676,689,696,699,704,765,778,782,786,798,801,805,808,827,831,838,847,851,858,873,877,880,887,891,894,899,983,996,1003,1032,1036,1046,1069,1078,1081,1085,1100,1400,1407,1415,1422,1440,1451,1487,1504,1508,1515,1519,1541,1544,1561,1710],[10,11,12,13,17],"p",{},"Een lokale assistent is nuttiger als hij sneller schrijft, lange documenten sneller verwerkt en ruimte heeft voor meerdere gebruikers tegelijk. Onze nieuwe Paiton-release brengt die verbeteringen naar ",[14,15,16],"strong",{},"Qwen3.8 27B op 1 × Radeon AI PRO R9700 (32 GB)",", zonder een tweede GPU toe te voegen.",[10,19,20,21,24,25,28,29,32,33],{},"Tegenover onze vorige MXFP4-release van 24 september stijgt de gewogen generatiesnelheid van ",[14,22,23],{},"153,8 naar 184,4 tokens per seconde: 19,9% snellere decode",". Acht gelijktijdige verzoeken leveren samen ",[14,26,27],{},"492,1 tokens per seconde",", tegenover 425,3. Kleinere modelgewichten maken in het 65K-serverprofiel ook ruimte voor ",[14,30,31],{},"43,5% meer gerapporteerde cachecapaciteit in tokens",".",[34,35,36],"sup",{},[37,38,44],"a",{"href":39,"ariaDescribedBy":40,"dataFootnoteRef":42,"id":43},"#user-content-fn-model",[41],"footnote-label","","user-content-fnref-model","1",[10,46,47,48,51,52,55,56,32],{},"De verandering bestaat uit onze eigen geroteerde ",[14,49,50],{},"3-bit gewichten voor de grote decoderprojecties",", met ",[14,53,54],{},"4-bit activatierekenwerk in geselecteerde lagen tijdens de promptverwerking",". Andere tensors behouden hun bestaande formaat. Daar staat een echte afweging tegenover: de MMLU-Pro-subset voor algemene kennis daalt met ongeveer drie procentpunten. De verschillen voor rekenen en code zijn in deze tests niet te onderscheiden van meetruis, en alle 80 afgebakende lang-contextopzoektests slagen. Als kennisnauwkeurigheid vooropstaat, blijft ",[14,57,58],{},"MXFP4 via één opstartoptie beschikbaar",[60,61,63],"h2",{"id":62},"wat-verandert-in-dagelijks-gebruik","Wat verandert in dagelijks gebruik",[10,65,66],{},"De vorige release combineerde al MXFP4-gewichten, een FP8-cache, DFlash2-speculatieve decode en Paitons native AMD-uitvoering binnen vLLM. Deze update behoudt die basis en vermindert de hoeveelheid modeldata die de GPU moet lezen. Dat levert snellere uitvoer, snellere promptverwerking en meer cacheruimte op dezelfde kaart op.",[10,68,69,70,73,74,77,78,81],{},"Die voordelen zijn verschillende metingen. ",[14,71,72],{},"Decode"," is de generatie na het eerste token. ",[14,75,76],{},"Totale doorvoer"," is de uitvoer van meerdere gelijktijdige verzoeken samen. ",[14,79,80],{},"Prefill"," is het verwerken van de prompt voordat de generatie begint. Een hogere tokensnelheid in één fase betekent niet automatisch een even grote daling van de volledige verzoektijd.",[10,83,84,85,88,89,93],{},"De 19,9% uit de titel vergelijkt deze release met de ",[14,86,87],{},"MXFP4-image van 24 september",", niet met de oudere Radiance-vergelijking in ons ",[37,90,92],{"href":91},"\u002Fnl\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","eerdere Qwen3.8-artikel",". Het oorspronkelijke resultaat van 57% in dat artikel blijft een afzonderlijke benchmark met een eigen configuratie.",[60,95,97],{"id":96},"snellere-generatie-in-uiteenlopende-taken","Snellere generatie in uiteenlopende taken",[99,100],"w3a4-figure",{"kind":101},"decode",[10,103,104],{},[105,106,107,108,32],"em",{},"BetterBench 0.6.0, quick-profiel. Generatie na het eerste token, in tokens\u002Fs; hoger is beter. De waarden zijn gemiddelden van twee volledige runs. Het gewogen resultaat stijgt met 19,9% tegenover de vorige release. De winst verschilt per taak en belooft dus niet dat elke prompt 20% sneller genereert. ",[37,109,113],{"href":110,"rel":111},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fa44044105287da3d040652ea8bcd3927a94a1bf2\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-26-w3a4\u002FREADME.md",[112],"nofollow","Gepubliceerd benchmarkrapport",[115,116,117,140],"table",{},[118,119,120],"thead",{},[121,122,123,127,131,134,137],"tr",{},[124,125,126],"th",{},"Taak",[124,128,130],{"align":129},"right","Vorige MXFP4-release",[124,132,133],{"align":129},"Deze ronde, MXFP4",[124,135,136],{"align":129},"W3A4-release",[124,138,139],{"align":129},"Verschil tegenover vorige",[141,142,143,161,178,193,210,227,244,261,278],"tbody",{},[121,144,145,149,152,155,158],{},[146,147,148],"td",{},"Chat",[146,150,151],{"align":129},"121,2 tok\u002Fs",[146,153,154],{"align":129},"122,9 tok\u002Fs",[146,156,157],{"align":129},"135,8 tok\u002Fs",[146,159,160],{"align":129},"+12,0%",[121,162,163,166,169,172,175],{},[146,164,165],{},"Code",[146,167,168],{"align":129},"179,9 tok\u002Fs",[146,170,171],{"align":129},"182,7 tok\u002Fs",[146,173,174],{"align":129},"226,0 tok\u002Fs",[146,176,177],{"align":129},"+25,6%",[121,179,180,183,185,187,190],{},[146,181,182],{},"Bestandsbewerking",[146,184,168],{"align":129},[146,186,171],{"align":129},[146,188,189],{"align":129},"195,0 tok\u002Fs",[146,191,192],{"align":129},"+8,5%",[121,194,195,198,201,204,207],{},[146,196,197],{},"JSON",[146,199,200],{"align":129},"217,5 tok\u002Fs",[146,202,203],{"align":129},"220,8 tok\u002Fs",[146,205,206],{"align":129},"269,0 tok\u002Fs",[146,208,209],{"align":129},"+23,7%",[121,211,212,215,218,221,224],{},[146,213,214],{},"Rekenen",[146,216,217],{"align":129},"183,8 tok\u002Fs",[146,219,220],{"align":129},"186,5 tok\u002Fs",[146,222,223],{"align":129},"228,9 tok\u002Fs",[146,225,226],{"align":129},"+24,5%",[121,228,229,232,235,238,241],{},[146,230,231],{},"Proza",[146,233,234],{"align":129},"78,5 tok\u002Fs",[146,236,237],{"align":129},"79,6 tok\u002Fs",[146,239,240],{"align":129},"94,7 tok\u002Fs",[146,242,243],{"align":129},"+20,7%",[121,245,246,249,252,255,258],{},[146,247,248],{},"Redeneren",[146,250,251],{"align":129},"117,8 tok\u002Fs",[146,253,254],{"align":129},"119,4 tok\u002Fs",[146,256,257],{"align":129},"133,5 tok\u002Fs",[146,259,260],{"align":129},"+13,3%",[121,262,263,266,269,272,275],{},[146,264,265],{},"Samenvatten",[146,267,268],{"align":129},"138,4 tok\u002Fs",[146,270,271],{"align":129},"140,5 tok\u002Fs",[146,273,274],{"align":129},"158,4 tok\u002Fs",[146,276,277],{"align":129},"+14,4%",[121,279,280,285,290,295,300],{},[146,281,282],{},[14,283,284],{},"Gewogen",[146,286,287],{"align":129},[14,288,289],{},"153,8 tok\u002Fs",[146,291,292],{"align":129},[14,293,294],{},"156,1 tok\u002Fs",[146,296,297],{"align":129},[14,298,299],{},"184,4 tok\u002Fs",[146,301,302],{"align":129},[14,303,304],{},"+19,9%",[10,306,307],{},"De middelste kolom scheidt de kleinere runtimeverbeteringen met MXFP4 van de grotere winst door het nieuwe gewichtformaat. De gewogen decode van het MXFP4-pad van deze ronde ligt ongeveer 1,5% boven de vorige release.",[309,310,312],"h3",{"id":311},"meer-uitvoer-bij-overlappende-verzoeken","Meer uitvoer bij overlappende verzoeken",[99,314],{"kind":315},"concurrency",[10,317,318],{},[105,319,320],{},"Totale gegenereerde tokens\u002Fs, met 48 verzoeken per gelijktijdigheidsniveau; hoger is beter. Dit zijn gezamenlijke serversnelheden, niet de snelheid die elke gebruiker afzonderlijk krijgt. Eén R9700, 65.536 tokens ingestelde context, maximaal acht ingeplande reeksen.",[115,322,323,337],{},[118,324,325],{},[121,326,327,330,332,334],{},[124,328,329],{},"Gelijktijdige verzoeken",[124,331,130],{"align":129},[124,333,136],{"align":129},[124,335,336],{"align":129},"Verschil",[141,338,339,352,366,380],{},[121,340,341,343,346,349],{},[146,342,44],{},[146,344,345],{"align":129},"122,0 tok\u002Fs",[146,347,348],{"align":129},"148,8 tok\u002Fs",[146,350,351],{"align":129},"+22,0%",[121,353,354,357,360,363],{},[146,355,356],{},"2",[146,358,359],{"align":129},"204,2 tok\u002Fs",[146,361,362],{"align":129},"249,3 tok\u002Fs",[146,364,365],{"align":129},"+22,1%",[121,367,368,371,374,377],{},[146,369,370],{},"4",[146,372,373],{"align":129},"308,2 tok\u002Fs",[146,375,376],{"align":129},"368,3 tok\u002Fs",[146,378,379],{"align":129},"+19,5%",[121,381,382,385,388,391],{},[146,383,384],{},"8",[146,386,387],{"align":129},"425,3 tok\u002Fs",[146,389,390],{"align":129},"492,1 tok\u002Fs",[146,392,393],{"align":129},"+15,7%",[10,395,396],{},"Voor een gedeelde lokale assistent kan de GPU zo meer uitvoer leveren terwijl verzoeken overlappen. De precieze winst hangt af van de promptlengtes, uitvoerlengtes en beschikbare cache.",[309,398,400],{"id":399},"ook-de-promptverwerking-wordt-sneller","Ook de promptverwerking wordt sneller",[99,402],{"kind":403},"prefill",[10,405,406],{},[105,407,408],{},"Verwerkte invoertokens per seconde; hoger is beter. De dieptelabels zijn nominale BetterBench-instellingen, geen exacte promptlengtes. De grootste nominale 64K-werklast heeft mediaan 47.016,5 werkelijke prompttokens. De gemeten wachttijd tot het eerste token staat apart hieronder.",[115,410,411,427],{},[118,412,413],{},[121,414,415,418,421,423,425],{},[124,416,417],{},"Nominale diepte",[124,419,420],{"align":129},"Mediaan werkelijke prompttokens",[124,422,130],{"align":129},[124,424,136],{"align":129},[124,426,336],{"align":129},[141,428,429,446,463,480,497],{},[121,430,431,434,437,440,443],{},[146,432,433],{},"2K",[146,435,436],{"align":129},"1.516,5",[146,438,439],{"align":129},"3.689 tok\u002Fs",[146,441,442],{"align":129},"4.156 tok\u002Fs",[146,444,445],{"align":129},"+12,7%",[121,447,448,451,454,457,460],{},[146,449,450],{},"8K",[146,452,453],{"align":129},"5.894,5",[146,455,456],{"align":129},"3.834 tok\u002Fs",[146,458,459],{"align":129},"4.165 tok\u002Fs",[146,461,462],{"align":129},"+8,6%",[121,464,465,468,471,474,477],{},[146,466,467],{},"16K",[146,469,470],{"align":129},"11.802",[146,472,473],{"align":129},"3.871 tok\u002Fs",[146,475,476],{"align":129},"4.103 tok\u002Fs",[146,478,479],{"align":129},"+6,0%",[121,481,482,485,488,491,494],{},[146,483,484],{},"32K",[146,486,487],{"align":129},"23.549,5",[146,489,490],{"align":129},"3.751 tok\u002Fs",[146,492,493],{"align":129},"3.958 tok\u002Fs",[146,495,496],{"align":129},"+5,5%",[121,498,499,502,505,508,511],{},[146,500,501],{},"64K",[146,503,504],{"align":129},"47.016,5",[146,506,507],{"align":129},"3.455 tok\u002Fs",[146,509,510],{"align":129},"3.629 tok\u002Fs",[146,512,513],{"align":129},"+5,0%",[10,515,516,517,520,521,524,525],{},"De geteste prefill-snelheden verbeteren met ",[14,518,519],{},"5,0–12,7%",". De clientwachttijd tot het eerste token daalt met ",[14,522,523],{},"4,8–10,8%",", op basis van het gemiddelde van de mediane TTFT van beide runs. Een hogere doorvoer en een lagere wachttijd zijn verschillende percentages. Ook planning en andere overhead kunnen de wachttijd beïnvloeden.",[34,526,527],{},[37,528,356],{"href":529,"ariaDescribedBy":530,"dataFootnoteRef":42,"id":531},"#user-content-fn-bench",[41],"user-content-fnref-bench",[115,533,534,549],{},[118,535,536],{},[121,537,538,540,543,546],{},[124,539,417],{},[124,541,542],{"align":129},"Vorige TTFT, gemiddelde van runmedianen",[124,544,545],{"align":129},"W3A4 TTFT, gemiddelde van runmedianen",[124,547,548],{"align":129},"Minder wachten",[141,550,551,564,577,590,603],{},[121,552,553,555,558,561],{},[146,554,433],{},[146,556,557],{"align":129},"407,453 ms",[146,559,560],{"align":129},"363,395 ms",[146,562,563],{"align":129},"10,8%",[121,565,566,568,571,574],{},[146,567,450],{},[146,569,570],{"align":129},"1.548,047 ms",[146,572,573],{"align":129},"1.416,748 ms",[146,575,576],{"align":129},"8,5%",[121,578,579,581,584,587],{},[146,580,467],{},[146,582,583],{"align":129},"3.054,554 ms",[146,585,586],{"align":129},"2.877,005 ms",[146,588,589],{"align":129},"5,8%",[121,591,592,594,597,600],{},[146,593,484],{},[146,595,596],{"align":129},"6.270,297 ms",[146,598,599],{"align":129},"5.943,109 ms",[146,601,602],{"align":129},"5,2%",[121,604,605,607,610,613],{},[146,606,501],{},[146,608,609],{"align":129},"13.617,798 ms",[146,611,612],{"align":129},"12.962,238 ms",[146,614,615],{"align":129},"4,8%",[60,617,619],{"id":618},"meer-ruimte-voor-lange-gesprekken","Meer ruimte voor lange gesprekken",[99,621],{"kind":622},"memory",[10,624,625],{},[105,626,627],{},"Het modelgeheugen daalt van 19,18 naar 15,89 GiB. De launcher gebruikt het vrijgekomen geheugen voor de gesprekscache: van 174.634 naar 250.578 gerapporteerde tokenplaatsen. Cachecapaciteit is een schatting uit de serverconfiguratie, geen aantal volledig gemeten gesprekken.",[115,629,630,641],{},[118,631,632],{},[121,633,634,637,639],{},[124,635,636],{},"Geheugenonderdeel",[124,638,130],{"align":129},[124,640,136],{"align":129},[141,642,643,654,665],{},[121,644,645,648,651],{},[146,646,647],{},"Modelgeheugen",[146,649,650],{"align":129},"19,18 GiB",[146,652,653],{"align":129},"15,89 GiB",[121,655,656,659,662],{},[146,657,658],{},"Gerapporteerde cachecapaciteit in tokens",[146,660,661],{"align":129},"174.634",[146,663,664],{"align":129},"250.578",[121,666,667,670,673],{},[146,668,669],{},"Omgerekende capaciteit bij 65.536 tokens per reeks",[146,671,672],{"align":129},"Ongeveer 2,7",[146,674,675],{"align":129},"Ongeveer 3,8",[10,677,678,679,682,683],{},"De laatste rij is een ",[14,680,681],{},"omgerekende capaciteitsschatting",", geen bewering dat 3,8 verzoeken kunnen draaien. Prompttekst, chat- en toolopmaak en gegenereerde uitvoer tellen allemaal mee in de context. Acht ingeplande reeksen betekenen evenmin dat acht volledige 65K-gesprekken tegelijk passen.",[34,684,685],{},[37,686,44],{"href":39,"ariaDescribedBy":687,"dataFootnoteRef":42,"id":688},[41],"user-content-fnref-model-2",[10,690,691,692,695],{},"We testten het praktische effect apart met ",[14,693,694],{},"vier prompts van ongeveer 61.400 tokens",", elk met 512 aangevraagde uitvoertokens. De werkelijke promptlengtes lopen van 61.390 tot 61.426 tokens. Met het oorspronkelijke cachebudget passen slechts twee van deze verzoeken tegelijk. Als W3A4 het vrijgekomen geheugen als cache gebruikt, kunnen ze alle vier tegelijk decoderen:",[99,697],{"kind":698},"long-context",[10,700,701],{},[105,702,703],{},"Vier lange verzoeken op één R9700. Voor de volledige batchtijd is lager beter. De controle gebruikt de MXFP4-build van 26 september, niet de image van 24 september. W3A4 met uitgebreide cache verandert het geheugenbudget en gebruikt de uitgebrachte kalibratie. De W3A4-controle met dezelfde cache gebruikte een eerdere kalibratie.",[115,705,706,722],{},[118,707,708],{},[121,709,710,713,716,719],{},[124,711,712],{},"Lang-contextmeting",[124,714,715],{"align":129},"MXFP4",[124,717,718],{"align":129},"W3A4, hetzelfde cachebudget",[124,720,721],{"align":129},"W3A4, uitgebreide cache",[141,723,724,738,751],{},[121,725,726,729,732,735],{},[146,727,728],{},"Decode terwijl alle actieve verzoeken draaien",[146,730,731],{"align":129},"69 tok\u002Fs, 2 actief",[146,733,734],{"align":129},"117 tok\u002Fs, 2 actief",[146,736,737],{"align":129},"199 tok\u002Fs, 4 actief",[121,739,740,743,746,748],{},[146,741,742],{},"Alle vier tegelijk decoderen",[146,744,745],{"align":129},"Nee, twee tegelijk",[146,747,745],{"align":129},[146,749,750],{"align":129},"Ja",[121,752,753,756,759,762],{},[146,754,755],{},"Batchtijd, 4 × 61K-prompts + elk 512 tokens",[146,757,758],{"align":129},"105,6 s",[146,760,761],{"align":129},"92,9 s",[146,763,764],{"align":129},"86,2 s",[10,766,767,768,771,772],{},"De nieuwe gewichten versnellen de decode met twee verzoeken ook zonder extra cache. Het herverdelen van geheugen verkort daarna de wachttijd voor de volledige batch van vier verzoeken. De 199 tok\u002Fs is de gezamenlijke decode ",[14,769,770],{},"terwijl alle vier actief zijn",", niet de doorvoer over de volledige batch. Het piekgebruik van de volledige GPU blijft vrijwel gelijk: 31,39 GiB met de standaardcache van W3A4 tegenover 31,37 GiB voor de MXFP4-controle. Er blijft dus weinig vrije marge op deze kaart. Dit is één lang-contextwerklast, geen algemene garantie voor elk aantal gelijktijdige gebruikers.",[34,773,774],{},[37,775,356],{"href":529,"ariaDescribedBy":776,"dataFootnoteRef":42,"id":777},[41],"user-content-fnref-bench-2",[60,779,781],{"id":780},"wat-we-veranderden-en-waarom","Wat we veranderden en waarom",[309,783,785],{"id":784},"eerst-de-bestaande-runtime-voorspelbaar-maken","Eerst de bestaande runtime voorspelbaar maken",[10,787,788,789,793,794,797],{},"Voordat we de gewichten veranderden, onderzochten we serverstarts die ondanks dezelfde configuratie afwisselden tussen ongeveer 28 en 36 ms per speculatieve stap. Door de runtime met ",[790,791,792],"code",{},"GPU_MAX_HW_QUEUES=1"," aan één hardware-computewachtrij te koppelen, bleven die starts in de snellere modus. De image bevat die instelling. ",[14,795,796],{},"Alle vergelijkingsarmen gebruikten die al",", zodat de winst door deze instelling niet in het hoofdcijfer zit.",[10,799,800],{},"We voegden ook de GatedDeltaNet-bewerking voor speculatieve verificatie samen in één native kernel. Die afzonderlijke bewerking werd 23–28% sneller; de gecombineerde runtimeverbeteringen verhogen de volledige gewogen MXFP4-decode met ongeveer 1,5%. Winst in één kernel is niet hetzelfde als winst in de volledige generatie.",[309,802,804],{"id":803},"minder-bytes-lezen-tijdens-generatie","Minder bytes lezen tijdens generatie",[10,806,807],{},"Decode op deze kaart wordt vooral begrensd door de geheugenbandbreedte. De vorige kernels zaten al dicht bij de beschikbare bandbreedte. Minder gewichtdata lezen bood daarom meer ruimte dan alleen de planning aanpassen.",[10,809,810,811,814,815,821],{},"De grote lineaire projecties gaan van ongeveer ",[14,812,813],{},"4,25 bits per gewicht met MXFP4 naar 3,125 bits met gegroepeerde INT3",". Dit betreft 24,3 miljard decoderprojectiegewichten, niet elke tensor in het 27B-model, en is ruwweg een kwart minder data voor die gewichten. Native Paiton-kernels verwerken de verpakte waarden rechtstreeks. Decode houdt 8-bit FP8-activaties; in de serververgelijking daalt de mediane forwardtijd met één stroom van ongeveer 28,3–28,4 ms naar 22,4–22,5 ms.",[34,816,817],{},[37,818,44],{"href":39,"ariaDescribedBy":819,"dataFootnoteRef":42,"id":820},[41],"user-content-fnref-model-3",[34,822,823],{},[37,824,356],{"href":529,"ariaDescribedBy":825,"dataFootnoteRef":42,"id":826},[41],"user-content-fnref-bench-3",[309,828,830],{"id":829},"andere-precisie-gebruiken-voor-promptverwerking","Andere precisie gebruiken voor promptverwerking",[10,832,833,834,837],{},"Promptverwerking heeft een ander knelpunt. Alleen 3-bit gewichten combineren met het oude pad voor 8-bit activaties maakte die fase in onze controles trager. De release gebruikt daarom ",[14,835,836],{},"4-bit activatierekenwerk alleen in geselecteerde prefill-projecties",". Tijdens generatie blijven de activaties 8-bit.",[10,839,840,841],{},"Een bloksgewijze Hadamard-rotatie verdeelt grote activatieuitschieters over kleine groepen, zodat promptverwerking met lagere precisie bruikbaar wordt. De gewichten worden in die geroteerde basis gekalibreerd; de runtime past de overeenkomstige activatietransformatie toe. Schalen per groep behoudt meer lokale precisie dan één schaal voor een volledig token. Dit is de openbare methode achter de naam W3A4, geen nieuwe modelarchitectuur.",[34,842,843],{},[37,844,44],{"href":39,"ariaDescribedBy":845,"dataFootnoteRef":42,"id":846},[41],"user-content-fnref-model-4",[309,848,850],{"id":849},"onze-eigen-gewichten-kalibreren-en-datalicenties-controleren","Onze eigen gewichten kalibreren en datalicenties controleren",[10,852,853,854,857],{},"Dit zijn onze eigen met GPTQ gekalibreerde gewichten; een 3-bit model van een derde partij is niet vereist. De kalibratie gebruikt ",[14,855,856],{},"292.864 tokens"," uit rekenen, code, wetenschap, webtekst, meertalig materiaal, agenttraces en lange documenten. Het laag-voor-laagproces duurt ongeveer 13 minuten op één AMD Instinct MI355X.",[10,859,860,861,866,867,872],{},"Voor de release vervingen we kalibratiebronnen met niet-commerciële of share-alikevoorwaarden door bronnen met permissieve licenties. De uitgebrachte gewichten gebruiken die definitieve kalibratie. Het ",[37,862,865],{"href":863,"rel":864},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-27B-W3Rot-INT3-Paiton-RDNA4\u002Fblob\u002F002684a90ea9a879c2e071217f460f24b3ecf6ec\u002FCALIBRATION.md",[112],"kalibratierapport"," vermeldt de datasetrevisies en licenties. De ",[37,868,871],{"href":869,"rel":870},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-27B-W3Rot-INT3-Paiton-RDNA4\u002Fblob\u002F002684a90ea9a879c2e071217f460f24b3ecf6ec\u002FTHIRD_PARTY_NOTICES.md",[112],"vermeldingen voor derden"," behouden de verplichte bronvermeldingen.",[309,874,876],{"id":875},"opstarten-en-integriteitscontroles-duidelijk-houden","Opstarten en integriteitscontroles duidelijk houden",[10,878,879],{},"De runtime laadt de geroteerde vervangingsgewichten naast het vastgelegde basischeckpoint en controleert hun bestanden via SHA-256. Een apart 3-bit model van derden is niet nodig. We verholpen ook een opwarmprobleem waarbij niet-geïnitialiseerde dummyinvoer vóór het eerste echte verzoek een vlag voor niet-eindige waarden kon activeren. Die vlag wordt na de opwarming gewist, terwijl de strikte controles voor echte verzoeken actief blijven.",[10,881,882,883,886],{},"Opstarten duurt ongeveer ",[14,884,885],{},"230 seconden",", tegenover ongeveer 210 seconden eerder. De winst tijdens opgewarmde uitvoering neemt die eerste laadtijd niet weg.",[60,888,890],{"id":889},"kwaliteit-de-winst-vraagt-een-keuze","Kwaliteit: de winst vraagt een keuze",[99,892],{"kind":893},"accuracy",[10,895,896],{},[105,897,898],{},"Nauwkeurigheid in het draaiende model, met greedy decode, uitgeschakeld denken en identieke vragen. De gepaarde 95%-betrouwbaarheidsintervallen bevatten nul voor GSM8K en HumanEval, maar niet voor de MMLU-Pro-subset. De 80 needle-tests controleren gericht informatie ophalen, niet de volledige kwaliteit bij lange contexten.",[115,900,901,916],{},[118,902,903],{},[121,904,905,908,910,913],{},[124,906,907],{},"Benchmark",[124,909,715],{"align":129},[124,911,912],{"align":129},"W3A4",[124,914,915],{},"Verschil en gepaard 95%-betrouwbaarheidsinterval",[141,917,918,936,953,970],{},[121,919,920,923,926,929],{},[146,921,922],{},"GSM8K, 5-shot, 1.319 vragen",[146,924,925],{"align":129},"95,68%",[146,927,928],{"align":129},"95,30%",[146,930,931,932],{},"−0,38 punten ",[933,934,935],"span",{},"−1,44, +0,68",[121,937,938,941,944,947],{},[146,939,940],{},"HumanEval pass@1, 164 taken",[146,942,943],{"align":129},"95,12%",[146,945,946],{"align":129},"93,90%",[146,948,949,950],{},"−1,22 punten ",[933,951,952],{},"−4,99, +2,56",[121,954,955,958,961,964],{},[146,956,957],{},"MMLU-Pro-subset, 0-shot, 14 × 100 vragen",[146,959,960],{"align":129},"62,57%",[146,962,963],{"align":129},"59,71%",[146,965,966,967],{},"−2,86 punten ",[933,968,969],{},"−4,81, −0,90",[121,971,972,975,978,980],{},[146,973,974],{},"Needle-opzoektest op 61.440 tokens, 80 controles",[146,976,977],{"align":129},"100%",[146,979,977],{"align":129},[146,981,982],{},"Geen waargenomen verschil",[10,984,985,986,989,990],{},"Rekenen en code blijven dicht bij elkaar in de geteste sets; de intervallen ",[14,987,988],{},"bewijzen geen identieke kwaliteit",". Meerkeuzevragen met veel algemene kennis tonen wel een meetbare daling van ongeveer drie punten. Ook de acceptatie van DFlash2 blijft dichtbij, met veranderingen per taak van −0,4% tot +2,8%.",[34,991,992],{},[37,993,44],{"href":39,"ariaDescribedBy":994,"dataFootnoteRef":42,"id":995},[41],"user-content-fnref-model-5",[10,997,998,999,1002],{},"Kies voor kennisintensief werk ",[790,1000,1001],{},"--weights mxfp4",". Dat gebruikt het gewichtpad met hogere precisie en krijgt nog steeds de MXFP4-runtimeverbeteringen van deze ronde. W3A4 is nuttig als snellere generatie en meer gesprekscache de gemeten kwaliteitsafweging waard zijn. De uitvoer kan verschillen; we beloven geen identieke antwoorden.",[10,1004,1005,1006,1009,1010,1013,1014,1017,1018,1024],{},"Meertalige kwaliteit, tool-calling en kwaliteit bij langere contexten zijn ",[14,1007,1008],{},"niet gemeten"," in deze evaluatie. De uitgebrachte W3A4-bundel is ",[14,1011,1012],{},"alleen voor tekst en specifiek voor de R9700",". Deze prestaties en kwaliteitsresultaten gelden voor het ",[14,1015,1016],{},"65K-profiel",". Andere launcherprofielcombinaties zijn niet gemeten; de aparte 200K-image blijft MXFP4 gebruiken. Deze vervangingsgewichten vereisen de Paiton-runtime: standaard-vLLM, Transformers en llama.cpp kunnen ze niet zelfstandig laden.",[34,1019,1020],{},[37,1021,44],{"href":39,"ariaDescribedBy":1022,"dataFootnoteRef":42,"id":1023},[41],"user-content-fnref-model-6",[34,1025,1026],{},[37,1027,1031],{"href":1028,"ariaDescribedBy":1029,"dataFootnoteRef":42,"id":1030},"#user-content-fn-release",[41],"user-content-fnref-release","3",[60,1033,1035],{"id":1034},"zo-leest-u-deze-resultaten","Zo leest u deze resultaten",[10,1037,1038,1039,1042,1043,32],{},"De prestatievergelijking gebruikt ",[14,1040,1041],{},"één R9700 met een vermogenslimiet van 300 W",", vLLM 0.29, ROCm 10, een context van 65.536 tokens, maximaal acht reeksen, DFlash2 en uitgeschakeld denken. Automatische prefixcaching en n-gram co-drafting staan uit. Elke image draaide in twee nieuwe serverprocessen, afwisselend uitgevoerd, en de tabellen tonen het gemiddelde van die twee runs. BetterBench gebruikte versie 0.6.0 en het quick-profiel. De referentie-image is ",[790,1044,1045],{},"qwen38-rocm10-vllm029-65k-20260924-r3",[10,1047,1048,1049,1052,1053,1056,1057,1063],{},"De openbare prestatieruns gebruikten de ",[14,1050,1051],{},"eerdere v3-kalibratie",". De nauwkeurigheidscijfers en de run met vier verzoeken en uitgebreide cache gebruiken de ",[14,1054,1055],{},"definitieve, permissief gekalibreerde gewichten die worden uitgebracht",". Het tensorformaat en de runtime zijn identiek, maar niet alle tests gebruiken precies dezelfde gewichtsbytes. Gegenereerde tekst en speculatieve acceptatie kunnen verschillen: W3A4 veranderde zeven van twaalf greedy controleresultaten tegenover MXFP4. Dit zijn metingen van serverdoorvoer, geen tijden voor identieke uitvoer. Procentuele verschillen zijn berekend uit niet-afgeronde metingen; narekenen vanuit de afgeronde tabellen kan daarom licht afwijken.",[34,1058,1059],{},[37,1060,44],{"href":39,"ariaDescribedBy":1061,"dataFootnoteRef":42,"id":1062},[41],"user-content-fnref-model-7",[34,1064,1065],{},[37,1066,356],{"href":529,"ariaDescribedBy":1067,"dataFootnoteRef":42,"id":1068},[41],"user-content-fnref-bench-4",[10,1070,1071,1072,1077],{},"De gewogen decode van BetterBench geeft code 30%, redeneren 20%, proza en JSON elk 15%, en bestandsbewerking en samenvatten elk 10%. Chat en rekenen worden apart getoond en tellen niet mee in het hoofdcijfer. Elke run meet na vaste opwarmverzoeken vijf verzoeken per decodecategorie, 48 per gelijktijdigheidsniveau en acht per nominale prefill-diepte. Bestandsbewerking varieert het meest tussen de twee W3A4-runs: 179,0 en 211,1 tok\u002Fs. Het ",[37,1073,1076],{"href":1074,"rel":1075},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Ftree\u002Fa44044105287da3d040652ea8bcd3927a94a1bf2\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002Fbenchmarks\u002F2026-09-26-w3a4",[112],"volledige rapport en de brondata"," bewaren die meetdetails.",[10,1079,1080],{},"De 300 W is de ingestelde vermogenslimiet van de GPU. We hebben geen energieverbruik van het volledige systeem of kosten per token gemeten. Snellere generatie is op zichzelf geen meting van elektriciteitsbesparing.",[60,1082,1084],{"id":1083},"probeer-het-op-uw-r9700","Probeer het op uw R9700",[10,1086,1087,1088,1093,1094],{},"Gebruik Linux x86-64, Python 3, Docker, de Hugging Face CLI en AMD GPU-toegang. De commando's hieronder leggen de openbare releasecheckout en de revisies van target, drafter en geroteerde gewichten samen vast. Hebt u de pluginrepository al, gebruik dan een aparte checkout in plaats van lokaal werk te vervangen. De ",[37,1089,1092],{"href":1090,"rel":1091},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fa44044105287da3d040652ea8bcd3927a94a1bf2\u002Fmodels\u002FQwen3.8-MXFP4-DFlash2\u002FREADME.md",[112],"releasehandleiding"," beschrijft bestaande downloads en andere profielen.",[34,1095,1096],{},[37,1097,1031],{"href":1028,"ariaDescribedBy":1098,"dataFootnoteRef":42,"id":1099},[41],"user-content-fnref-release-2",[1101,1102,1106],"pre",{"className":1103,"code":1104,"language":1105,"meta":42,"style":42},"language-bash shiki shiki-themes github-light github-dark","git clone https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\ncd paiton-vllm-plugin\ngit checkout a44044105287da3d040652ea8bcd3927a94a1bf2\n\nexport PAITON_TARGET_DIR=\"$PWD\u002Fmodel-cache\u002Fqwen38-nvfp4\"\nexport PAITON_DRAFT_DIR=\"$PWD\u002Fmodel-cache\u002Fqwen38-dflash2\"\nexport PAITON_W3ROT_DIR=\"$PWD\u002Fmodel-cache\u002Fqwen38-w3rot-int3\"\nexport PAITON_CACHE_DIR=\"$PWD\u002Fruntime-cache\u002Fqwen38-rocm10-65k-w3a4\"\nmkdir -p \"$PAITON_TARGET_DIR\" \"$PAITON_DRAFT_DIR\" \"$PAITON_W3ROT_DIR\" \"$PAITON_CACHE_DIR\"\n\nhf download unsloth\u002FQwen3.8-27B-NVFP4 \\\n  --revision f0b7c9e722f5565102fff8481c99e4d86ae099c7 --local-dir \"$PAITON_TARGET_DIR\"\nhf download tcclaviger\u002FQwen3.8-27B-DFlash2-FP8 \\\n  --revision ee0cb26a8279b7910cc28d82a8a3e15e4728d56f --local-dir \"$PAITON_DRAFT_DIR\"\nhf download EliovpAI\u002FQwen3.8-27B-W3Rot-INT3-Paiton-RDNA4 \\\n  --revision 278486debe64e21e5e9d45ac8d02798d72fbdf83 --local-dir \"$PAITON_W3ROT_DIR\"\n(cd \"$PAITON_W3ROT_DIR\" && sha256sum -c SHA256SUMS)\n\nbash models\u002FQwen3.8-MXFP4-DFlash2\u002Frun-rocm10-65k.sh\n","bash",[790,1107,1108,1123,1133,1144,1151,1174,1191,1208,1225,1264,1269,1284,1302,1314,1330,1342,1358,1387,1392],{"__ignoreMap":42},[933,1109,1112,1116,1120],{"class":1110,"line":1111},"line",1,[933,1113,1115],{"class":1114},"sScJk","git",[933,1117,1119],{"class":1118},"sZZnC"," clone",[933,1121,1122],{"class":1118}," https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\n",[933,1124,1126,1130],{"class":1110,"line":1125},2,[933,1127,1129],{"class":1128},"sj4cs","cd",[933,1131,1132],{"class":1118}," paiton-vllm-plugin\n",[933,1134,1136,1138,1141],{"class":1110,"line":1135},3,[933,1137,1115],{"class":1114},[933,1139,1140],{"class":1118}," checkout",[933,1142,1143],{"class":1118}," a44044105287da3d040652ea8bcd3927a94a1bf2\n",[933,1145,1147],{"class":1110,"line":1146},4,[933,1148,1150],{"emptyLinePlaceholder":1149},true,"\n",[933,1152,1154,1158,1162,1165,1168,1171],{"class":1110,"line":1153},5,[933,1155,1157],{"class":1156},"szBVR","export",[933,1159,1161],{"class":1160},"sVt8B"," PAITON_TARGET_DIR",[933,1163,1164],{"class":1156},"=",[933,1166,1167],{"class":1118},"\"",[933,1169,1170],{"class":1160},"$PWD",[933,1172,1173],{"class":1118},"\u002Fmodel-cache\u002Fqwen38-nvfp4\"\n",[933,1175,1177,1179,1182,1184,1186,1188],{"class":1110,"line":1176},6,[933,1178,1157],{"class":1156},[933,1180,1181],{"class":1160}," PAITON_DRAFT_DIR",[933,1183,1164],{"class":1156},[933,1185,1167],{"class":1118},[933,1187,1170],{"class":1160},[933,1189,1190],{"class":1118},"\u002Fmodel-cache\u002Fqwen38-dflash2\"\n",[933,1192,1194,1196,1199,1201,1203,1205],{"class":1110,"line":1193},7,[933,1195,1157],{"class":1156},[933,1197,1198],{"class":1160}," PAITON_W3ROT_DIR",[933,1200,1164],{"class":1156},[933,1202,1167],{"class":1118},[933,1204,1170],{"class":1160},[933,1206,1207],{"class":1118},"\u002Fmodel-cache\u002Fqwen38-w3rot-int3\"\n",[933,1209,1211,1213,1216,1218,1220,1222],{"class":1110,"line":1210},8,[933,1212,1157],{"class":1156},[933,1214,1215],{"class":1160}," PAITON_CACHE_DIR",[933,1217,1164],{"class":1156},[933,1219,1167],{"class":1118},[933,1221,1170],{"class":1160},[933,1223,1224],{"class":1118},"\u002Fruntime-cache\u002Fqwen38-rocm10-65k-w3a4\"\n",[933,1226,1228,1231,1234,1237,1240,1242,1244,1247,1249,1251,1254,1256,1258,1261],{"class":1110,"line":1227},9,[933,1229,1230],{"class":1114},"mkdir",[933,1232,1233],{"class":1128}," -p",[933,1235,1236],{"class":1118}," \"",[933,1238,1239],{"class":1160},"$PAITON_TARGET_DIR",[933,1241,1167],{"class":1118},[933,1243,1236],{"class":1118},[933,1245,1246],{"class":1160},"$PAITON_DRAFT_DIR",[933,1248,1167],{"class":1118},[933,1250,1236],{"class":1118},[933,1252,1253],{"class":1160},"$PAITON_W3ROT_DIR",[933,1255,1167],{"class":1118},[933,1257,1236],{"class":1118},[933,1259,1260],{"class":1160},"$PAITON_CACHE_DIR",[933,1262,1263],{"class":1118},"\"\n",[933,1265,1267],{"class":1110,"line":1266},10,[933,1268,1150],{"emptyLinePlaceholder":1149},[933,1270,1272,1275,1278,1281],{"class":1110,"line":1271},11,[933,1273,1274],{"class":1114},"hf",[933,1276,1277],{"class":1118}," download",[933,1279,1280],{"class":1118}," unsloth\u002FQwen3.8-27B-NVFP4",[933,1282,1283],{"class":1128}," \\\n",[933,1285,1287,1290,1293,1296,1298,1300],{"class":1110,"line":1286},12,[933,1288,1289],{"class":1128},"  --revision",[933,1291,1292],{"class":1118}," f0b7c9e722f5565102fff8481c99e4d86ae099c7",[933,1294,1295],{"class":1128}," --local-dir",[933,1297,1236],{"class":1118},[933,1299,1239],{"class":1160},[933,1301,1263],{"class":1118},[933,1303,1305,1307,1309,1312],{"class":1110,"line":1304},13,[933,1306,1274],{"class":1114},[933,1308,1277],{"class":1118},[933,1310,1311],{"class":1118}," tcclaviger\u002FQwen3.8-27B-DFlash2-FP8",[933,1313,1283],{"class":1128},[933,1315,1317,1319,1322,1324,1326,1328],{"class":1110,"line":1316},14,[933,1318,1289],{"class":1128},[933,1320,1321],{"class":1118}," ee0cb26a8279b7910cc28d82a8a3e15e4728d56f",[933,1323,1295],{"class":1128},[933,1325,1236],{"class":1118},[933,1327,1246],{"class":1160},[933,1329,1263],{"class":1118},[933,1331,1333,1335,1337,1340],{"class":1110,"line":1332},15,[933,1334,1274],{"class":1114},[933,1336,1277],{"class":1118},[933,1338,1339],{"class":1118}," EliovpAI\u002FQwen3.8-27B-W3Rot-INT3-Paiton-RDNA4",[933,1341,1283],{"class":1128},[933,1343,1345,1347,1350,1352,1354,1356],{"class":1110,"line":1344},16,[933,1346,1289],{"class":1128},[933,1348,1349],{"class":1118}," 278486debe64e21e5e9d45ac8d02798d72fbdf83",[933,1351,1295],{"class":1128},[933,1353,1236],{"class":1118},[933,1355,1253],{"class":1160},[933,1357,1263],{"class":1118},[933,1359,1361,1364,1366,1368,1370,1372,1375,1378,1381,1384],{"class":1110,"line":1360},17,[933,1362,1363],{"class":1160},"(",[933,1365,1129],{"class":1128},[933,1367,1236],{"class":1118},[933,1369,1253],{"class":1160},[933,1371,1167],{"class":1118},[933,1373,1374],{"class":1160}," && ",[933,1376,1377],{"class":1114},"sha256sum",[933,1379,1380],{"class":1128}," -c",[933,1382,1383],{"class":1118}," SHA256SUMS",[933,1385,1386],{"class":1160},")\n",[933,1388,1390],{"class":1110,"line":1389},18,[933,1391,1150],{"emptyLinePlaceholder":1149},[933,1393,1395,1397],{"class":1110,"line":1394},19,[933,1396,1105],{"class":1114},[933,1398,1399],{"class":1118}," models\u002FQwen3.8-MXFP4-DFlash2\u002Frun-rocm10-65k.sh\n",[10,1401,1402,1403,1406],{},"De uitgebrachte W3A4-image is ",[790,1404,1405],{},"ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin:qwen38-rocm10-vllm029-65k-20260926-w3a4-r1",". De onveranderlijke digest is:",[1101,1408,1413],{"className":1409,"code":1411,"language":1412,"meta":42},[1410],"language-text","sha256:c4134aba665f6dd3b89354a43be2b5b814f7078db456351647a3f1b106a0da49\n","text",[790,1414,1411],{"__ignoreMap":42},[10,1416,1417,1418,1421],{},"Als ",[790,1419,1420],{},"PAITON_W3ROT_DIR"," is ingesteld, selecteert de modelspecifieke launcher de geroteerde 3-bit gewichten. Stop die server eerst en selecteer daarna MXFP4 met:",[1101,1423,1425],{"className":1103,"code":1424,"language":1105,"meta":42,"style":42},"bash models\u002FQwen3.8-MXFP4-DFlash2\u002Frun-rocm10-65k.sh --weights mxfp4\n",[790,1426,1427],{"__ignoreMap":42},[933,1428,1429,1431,1434,1437],{"class":1110,"line":1111},[933,1430,1105],{"class":1114},[933,1432,1433],{"class":1118}," models\u002FQwen3.8-MXFP4-DFlash2\u002Frun-rocm10-65k.sh",[933,1435,1436],{"class":1128}," --weights",[933,1438,1439],{"class":1118}," mxfp4\n",[10,1441,1442,1443,1446,1447,1450],{},"Zodra de server klaar is, biedt hij de OpenAI-compatibele API op ",[790,1444,1445],{},"http:\u002F\u002F127.0.0.1:18982\u002Fv1"," aan met de modelnaam ",[790,1448,1449],{},"Qwen3.8",". Stuur in een tweede terminal een streamingverzoek:",[1101,1452,1454],{"className":1103,"code":1453,"language":1105,"meta":42,"style":42},"curl --fail http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\"model\":\"Qwen3.8\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a short Python function that removes duplicates while keeping their original order.\"}],\"temperature\":0,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":false}}'\n",[790,1455,1456,1469,1479],{"__ignoreMap":42},[933,1457,1458,1461,1464,1467],{"class":1110,"line":1111},[933,1459,1460],{"class":1114},"curl",[933,1462,1463],{"class":1128}," --fail",[933,1465,1466],{"class":1118}," http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions",[933,1468,1283],{"class":1128},[933,1470,1471,1474,1477],{"class":1110,"line":1125},[933,1472,1473],{"class":1128},"  -H",[933,1475,1476],{"class":1118}," 'Content-Type: application\u002Fjson'",[933,1478,1283],{"class":1128},[933,1480,1481,1484],{"class":1110,"line":1135},[933,1482,1483],{"class":1128},"  -d",[933,1485,1486],{"class":1118}," '{\"model\":\"Qwen3.8\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a short Python function that removes duplicates while keeping their original order.\"}],\"temperature\":0,\"max_tokens\":256,\"stream\":true,\"chat_template_kwargs\":{\"enable_thinking\":false}}'\n",[10,1488,1489,1490,1493,1494,1497,1498],{},"Deze commando's starten het ",[14,1491,1492],{},"modelspecifieke W3A4-Dockerprofiel met DFlash2",". De kortere native preset ",[790,1495,1496],{},"paiton serve qwen38-nvfp4"," is een andere configuratie zonder speculatieve decode en laadt deze 3-bit gewichten niet.",[34,1499,1500],{},[37,1501,1031],{"href":1028,"ariaDescribedBy":1502,"dataFootnoteRef":42,"id":1503},[41],"user-content-fnref-release-3",[60,1505,1507],{"id":1506},"wat-volgt-en-wat-niet-is-uitgebracht","Wat volgt en wat niet is uitgebracht",[10,1509,1510,1511,1514],{},"Een 4-bit gesprekscache slaagde voor onze afgebakende kwaliteitscontrole, maar vermindert momenteel alleen het leeswerk van attention zonder extra bruikbare cachecapaciteit. De technische winst bedroeg ongeveer 4–5% met twee 61K-verzoeken. Dubbele capaciteit in hetzelfde geheugen is nog in ontwikkeling, ",[14,1512,1513],{},"geen voordeel van deze release",". Een langer speculatief blok is een andere onderzoekspiste, geen gepubliceerde instelling in dit artikel.",[60,1516,1518],{"id":1517},"credits-en-licenties","Credits en licenties",[10,1520,1521,1522,1525,1526,32,1529,1535],{},"Qwen3.8 27B is van het Qwen-team. Het vastgelegde targetcheckpoint komt van Unsloth en de DFlash2-drafter van tcclaviger, voortbouwend op het DFlash2-werk van z-lab. De uitgebrachte geroteerde gewichten zijn een gekwantiseerde afgeleide onder Apache-2.0. De modelkaart vermeldt ook Apache-2.0 voor die upstreamcheckpoints. De openbare methode bouwt voort op ",[14,1523,1524],{},"GPTQ en GSQ",". vLLM biedt de serverbasis en BetterBench de generatietaken. De openbare runtimehandleiding vermeldt ",[14,1527,1528],{},"Radiance en StillDeadcode\u002Flibr4d voor aangepaste kerneltechnieken",[34,1530,1531],{},[37,1532,44],{"href":39,"ariaDescribedBy":1533,"dataFootnoteRef":42,"id":1534},[41],"user-content-fnref-model-8",[34,1536,1537],{},[37,1538,1031],{"href":1028,"ariaDescribedBy":1539,"dataFootnoteRef":42,"id":1540},[41],"user-content-fnref-release-4",[10,1542,1543],{},"Voor de openbare adapter, modelgewichten en verpakte native runtime gelden afzonderlijke voorwaarden. De Apache-2.0-licentie van de gewichten is geen algemene licentie voor propriëtaire compiler- of implementatiecode. Kalibratiedatasets behouden ook hun bronvermeldingsvereisten en, waar van toepassing, de Common Crawl-voorwaarden. Bekijk de gepubliceerde vermeldingen vóór inzet.",[10,1545,1546,1547,1551,1552,1555,1556,1560],{},"Ontdek ",[37,1548,1550],{"href":1549},"\u002Fnl\u002Fproducts\u002Fpaiton","Paiton",", lees de ",[37,1553,1554],{"href":91},"vorige Qwen3.8-releasestory"," of ",[37,1557,1559],{"href":1558},"\u002Fnl\u002Fcontact","neem contact op"," om een lokale AMD AI-werklast te bespreken.",[1562,1563,1566,1571],"section",{"className":1564,"dataFootnotes":42},[1565],"footnotes",[60,1567,1570],{"className":1568,"id":41},[1569],"sr-only","Footnotes",[1572,1573,1574,1644,1677],"ol",{},[1575,1576,1578,1583,1584,1591,1592,1591,1599,1591,1606,1591,1613,1591,1621,1591,1629,1591,1637],"li",{"id":1577},"user-content-fn-model",[37,1579,1582],{"href":1580,"rel":1581},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-27B-W3Rot-INT3-Paiton-RDNA4\u002Fblob\u002F002684a90ea9a879c2e071217f460f24b3ecf6ec\u002FREADME.md",[112],"Openbare W3Rot INT3-modelkaart, nagekeken revisie",". ",[37,1585,1590],{"href":1586,"ariaLabel":1587,"className":1588,"dataFootnoteBackref":42},"#user-content-fnref-model","Back to reference 1",[1589],"data-footnote-backref","↩"," ",[37,1593,1590,1597],{"href":1594,"ariaLabel":1595,"className":1596,"dataFootnoteBackref":42},"#user-content-fnref-model-2","Back to reference 1-2",[1589],[34,1598,356],{},[37,1600,1590,1604],{"href":1601,"ariaLabel":1602,"className":1603,"dataFootnoteBackref":42},"#user-content-fnref-model-3","Back to reference 1-3",[1589],[34,1605,1031],{},[37,1607,1590,1611],{"href":1608,"ariaLabel":1609,"className":1610,"dataFootnoteBackref":42},"#user-content-fnref-model-4","Back to reference 1-4",[1589],[34,1612,370],{},[37,1614,1590,1618],{"href":1615,"ariaLabel":1616,"className":1617,"dataFootnoteBackref":42},"#user-content-fnref-model-5","Back to reference 1-5",[1589],[34,1619,1620],{},"5",[37,1622,1590,1626],{"href":1623,"ariaLabel":1624,"className":1625,"dataFootnoteBackref":42},"#user-content-fnref-model-6","Back to reference 1-6",[1589],[34,1627,1628],{},"6",[37,1630,1590,1634],{"href":1631,"ariaLabel":1632,"className":1633,"dataFootnoteBackref":42},"#user-content-fnref-model-7","Back to reference 1-7",[1589],[34,1635,1636],{},"7",[37,1638,1590,1642],{"href":1639,"ariaLabel":1640,"className":1641,"dataFootnoteBackref":42},"#user-content-fnref-model-8","Back to reference 1-8",[1589],[34,1643,384],{},[1575,1645,1647,1583,1651,1591,1656,1591,1663,1591,1670],{"id":1646},"user-content-fn-bench",[37,1648,1650],{"href":1074,"rel":1649},[112],"W3A4-benchmarkrapport van 26 september en machineleesbare resultaten",[37,1652,1590],{"href":1653,"ariaLabel":1654,"className":1655,"dataFootnoteBackref":42},"#user-content-fnref-bench","Back to reference 2",[1589],[37,1657,1590,1661],{"href":1658,"ariaLabel":1659,"className":1660,"dataFootnoteBackref":42},"#user-content-fnref-bench-2","Back to reference 2-2",[1589],[34,1662,356],{},[37,1664,1590,1668],{"href":1665,"ariaLabel":1666,"className":1667,"dataFootnoteBackref":42},"#user-content-fnref-bench-3","Back to reference 2-3",[1589],[34,1669,1031],{},[37,1671,1590,1675],{"href":1672,"ariaLabel":1673,"className":1674,"dataFootnoteBackref":42},"#user-content-fnref-bench-4","Back to reference 2-4",[1589],[34,1676,370],{},[1575,1678,1680,1583,1684,1591,1689,1591,1696,1591,1703],{"id":1679},"user-content-fn-release",[37,1681,1683],{"href":1090,"rel":1682},[112],"Openbare modelspecifieke release- en installatiehandleiding, vastgelegde checkout",[37,1685,1590],{"href":1686,"ariaLabel":1687,"className":1688,"dataFootnoteBackref":42},"#user-content-fnref-release","Back to reference 3",[1589],[37,1690,1590,1694],{"href":1691,"ariaLabel":1692,"className":1693,"dataFootnoteBackref":42},"#user-content-fnref-release-2","Back to reference 3-2",[1589],[34,1695,356],{},[37,1697,1590,1701],{"href":1698,"ariaLabel":1699,"className":1700,"dataFootnoteBackref":42},"#user-content-fnref-release-3","Back to reference 3-3",[1589],[34,1702,1031],{},[37,1704,1590,1708],{"href":1705,"ariaLabel":1706,"className":1707,"dataFootnoteBackref":42},"#user-content-fnref-release-4","Back to reference 3-4",[1589],[34,1709,370],{},[1711,1712,1713],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .szBVR, html code.shiki .szBVR{--shiki-default:#D73A49;--shiki-dark:#F97583}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}",{"title":42,"searchDepth":1125,"depth":1125,"links":1715},[1716,1717,1721,1722,1729,1730,1731,1732,1733,1734],{"id":62,"depth":1125,"text":63},{"id":96,"depth":1125,"text":97,"children":1718},[1719,1720],{"id":311,"depth":1135,"text":312},{"id":399,"depth":1135,"text":400},{"id":618,"depth":1125,"text":619},{"id":780,"depth":1125,"text":781,"children":1723},[1724,1725,1726,1727,1728],{"id":784,"depth":1135,"text":785},{"id":803,"depth":1135,"text":804},{"id":829,"depth":1135,"text":830},{"id":849,"depth":1135,"text":850},{"id":875,"depth":1135,"text":876},{"id":889,"depth":1125,"text":890},{"id":1034,"depth":1125,"text":1035},{"id":1083,"depth":1125,"text":1084},{"id":1506,"depth":1125,"text":1507},{"id":1517,"depth":1125,"text":1518},{"id":41,"depth":1125,"text":1570},[1550,1736,1737,1738,1739],"AMD Radeon","Lokale AI","Qwen","Kwantisatie","2026-09-27T09:00:00Z","Paiton draait Qwen3.8 27B lokaal met 19,9% snellere gewogen decode en meer gesprekscache op één R9700. Bekijk de metingen, kwaliteitsafweging en installatie.","md","3-bit gewichten. 20% snellere decode. 1 × Radeon AI PRO R9700.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-w3a4\u002Fhero-nl.webp",{},"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700","\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700",{"title":5,"description":1741},"paiton-qwen38-w3a4-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-w3a4\u002Fsocial-nl.webp","blog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700",null,"pHwp8OTuo1PMAsP8SGh2TvB1Ip6nWanCf0lUos5_Qtk",[1755,1757,1767,1780,1790,1802,1812,1825,1834,1848,1880,1892,1914,1932,1951,1970,1988,2005,2017,2033,2048,2060,2069,2077,2092,2104,2115,2126,2136,2149,2159,2172,2183,2193,2204,2213,2225,2236,2245],{"path":1747,"title":5,"description":1741,"date":1740,"slug":1749,"image":1744,"originalUrl":1746,"categories":1756},[1550,1736,1737,1738,1739],{"path":1758,"title":1759,"description":1760,"date":1761,"slug":1762,"image":1763,"originalUrl":1764,"categories":1765},"\u002Fblog\u002Fpaiton-qwen-image-21-radeon-ai-pro-r9700","Qwen-Image 2.1 op 1 × Radeon AI PRO R9700: 2048×2048-beelden in 103 seconden","Genereer lokaal Qwen-Image 2.1-beelden van 2048×2048 pixels met 1 × Radeon AI PRO R9700. De Paiton v1.0.2-container mat 103,29 seconden per opgewarmd verzoek, inclusief de PNG-respons.","2026-09-23T09:00:00Z","paiton-qwen-image-21-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen-image-21\u002Fhero-nl.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen-image-21-radeon-ai-pro-r9700",[1550,1736,1737,1766,1738],"Beeldgeneratie",{"path":1768,"title":1769,"description":1770,"date":1771,"slug":1772,"image":1773,"originalUrl":1774,"categories":1775},"\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","2026-09-16T07:30:00Z","paiton-qwen38-mxfp4-dflash2-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",[1550,1736,1737,1776,1777,1778,1779],"AI-inferentie","Inferentie-optimalisatie","Grote taalmodellen","vLLM",{"path":1781,"title":1782,"description":1783,"date":1784,"slug":1785,"image":1786,"originalUrl":1787,"categories":1788},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[1550,1736,1737,1789,1779],"GGUF",{"path":1791,"title":1792,"description":1793,"date":1794,"slug":1795,"image":1796,"originalUrl":1797,"categories":1798},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[1550,1736,1737,1799,1800,1801],"Videogeneratie","MiniMax H3","ComfyUI",{"path":1803,"title":1804,"description":1805,"date":1806,"slug":1807,"image":1808,"originalUrl":1809,"categories":1810},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[1550,1736,1737,1766,1811,1801],"FLUX",{"path":1813,"title":1814,"description":1815,"date":1816,"slug":1817,"image":1818,"originalUrl":1819,"categories":1820},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[1550,1821,1736,1776,1822,1823,1777,1778,1779,1824],"Kunstmatige intelligentie","GPU-prestaties","Inferentielatentie","Kostenefficiëntie",{"path":1826,"title":1827,"description":1828,"date":1829,"slug":1830,"image":1831,"originalUrl":1832,"categories":1833},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[1550,1821,1736,1776,1822,1823,1777,1778,1779,1824],{"path":1835,"title":1836,"description":1837,"date":1838,"slug":1839,"image":1840,"originalUrl":1752,"categories":1841},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",[1842,1843,1844,1845,1846,1847],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":1849,"title":1850,"description":1851,"date":1852,"slug":1853,"image":1854,"originalUrl":1855,"categories":1856},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[1842,1821,1550,1857,1858,1859,1860,1861,1862,1863,1864,1865,1866,1867,1868,1869,1870,1871,1872,1873,1550,1874,1875,1876,1877,1878,1879],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","GPU","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":1881,"title":1882,"description":1883,"date":1884,"slug":1885,"image":1886,"originalUrl":1887,"categories":1888},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[1842,1821,1889,1890,1858,1891,1889,1871],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":1893,"title":1894,"description":1895,"date":1896,"slug":1897,"image":1898,"originalUrl":1899,"categories":1900},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[1842,1821,1901,1890,1902,1903,1904,1905,1906,1907,1908,1909,1864,1910,1865,1911,1912,1913],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":1915,"title":1916,"description":1917,"date":1918,"slug":1919,"image":1920,"originalUrl":1921,"categories":1922},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[1842,1923,1924,1925,1907,1926,1927,1928,1910,1929,1930,1931,1912],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":1933,"title":1934,"description":1935,"date":1936,"slug":1937,"image":1938,"originalUrl":1939,"categories":1940},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[1842,1821,1941,1901,1942,1943,1944,1945,1946,1947,1948,1949,1874,1950],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":1952,"title":1953,"description":1954,"date":1955,"slug":1956,"image":1957,"originalUrl":1958,"categories":1959},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[1842,1821,1901,1960,1961,1962,1963,1964,1965,1966,1967,1968,1969],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":1971,"title":1972,"description":1973,"date":1974,"slug":1975,"image":1976,"originalUrl":1977,"categories":1978},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[1842,1889,1890,1979,1843,1980,1981,1982,1983,1984,1985,1986,1987],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":1989,"title":1990,"description":1991,"date":1992,"slug":1993,"image":1994,"originalUrl":1995,"categories":1996},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[1842,1821,1550,1890,1997,1821,1998,1999,2000,2001,2002,2003,1550,2004],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning","ROCm",{"path":2006,"title":2007,"description":2008,"date":2009,"slug":2010,"image":2011,"originalUrl":2012,"categories":2013},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[1842,1821,1550,1776,2014,1997,1824,2015,1777,2003,1550,2016,1779],"AMD Instinct","Hoge throughput","SGLang",{"path":2018,"title":2019,"description":2020,"date":2021,"slug":2022,"image":2023,"originalUrl":2024,"categories":2025},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[1842,1821,1550,2026,1997,2027,1777,2028,2029,2030,2031,1550,2032],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":2034,"title":2035,"description":2036,"date":2037,"slug":2038,"image":2039,"originalUrl":2040,"categories":2041},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[1842,1821,1941,1890,1942,2042,2043,2044,2045,1947,1949,1874,2046,2047],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":2049,"title":2050,"description":2051,"date":2052,"slug":2053,"image":2054,"originalUrl":2055,"categories":2056},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[1842,1821,1550,1890,2057,1858,1859,2058,2059,1870,1871,1550,1779],"AI","H200","MI300X",{"path":2061,"title":2062,"description":2063,"date":2064,"slug":2065,"image":2066,"originalUrl":2067,"categories":2068},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[1842,1821,1941,1942,2042,2043,2044,2045,1947,1949,1874,2046,2047],{"path":2070,"title":2071,"description":2072,"date":2073,"slug":2074,"image":42,"originalUrl":2075,"categories":2076},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[1842,1821,1550],{"path":2078,"title":2079,"description":2080,"date":2081,"slug":2082,"image":2083,"originalUrl":2084,"categories":2085},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[1842,1821,1550,1890,1776,1997,2086,1999,2087,2088,2089,1550,2090,2091],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":2093,"title":2094,"description":2095,"date":2096,"slug":2097,"image":2098,"originalUrl":2099,"categories":2100},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[1842,1821,1550,1890,1997,2101,1946,1865,1822,1823,1778,2088,2102,2103],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":2105,"title":2106,"description":2107,"date":2108,"slug":2109,"image":2110,"originalUrl":2111,"categories":2112},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[1842,1821,1550,1941,1890,1858,2059,1871,2113,2114],"RX7900XTX","tenstorrent",{"path":2116,"title":2117,"description":2118,"date":2119,"slug":2120,"image":2121,"originalUrl":2122,"categories":2123},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[1842,1821,1889,1941,1859,2058,2124,1871,2125],"MI325X","P&L-calculator",{"path":2127,"title":2128,"description":2129,"date":2130,"slug":2131,"image":2132,"originalUrl":2133,"categories":2134},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[1842,1821,1550,2057,1858,2058,2135,1871,1550,1779],"MI300",{"path":2137,"title":2138,"description":2139,"date":2140,"slug":2141,"image":2142,"originalUrl":2143,"categories":2144},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[1842,1889,2145,1960,1981,1846,1982,1983,2146,2147,1986,2148],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":2150,"title":2151,"description":2152,"date":2153,"slug":2154,"image":2155,"originalUrl":2156,"categories":2157},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[1842,1821,1941,1890,2057,1858,2158],"Zorg",{"path":2160,"title":2161,"description":2162,"date":2163,"slug":2164,"image":2165,"originalUrl":2166,"categories":2167},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[1842,1901,2057,1858,2168,2169,2170,2171],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":2173,"title":2174,"description":2175,"date":2176,"slug":2177,"image":2178,"originalUrl":2179,"categories":2180},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[1842,1821,1941,2057,2181,2182],"AI-agenten","ERP",{"path":2184,"title":2185,"description":2186,"date":2187,"slug":2188,"image":2189,"originalUrl":2190,"categories":2191},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[1842,1821,1901,2192,1858,1866,1871],"AI-nieuws",{"path":2194,"title":2195,"description":2196,"date":2197,"slug":2198,"image":2199,"originalUrl":2200,"categories":2201},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[1842,1821,1550,2057,1858,2202,2203,2059,1550],"benchmark","LLM",{"path":2205,"title":2206,"description":2207,"date":2208,"slug":2209,"image":2210,"originalUrl":2211,"categories":2212},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[1842,1821,1550],{"path":2214,"title":2215,"description":2216,"date":2217,"slug":2218,"image":2219,"originalUrl":2220,"categories":2221},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[1842,1858,2222,2223,2224],"Jim Greene","Podcast","Tech Talk",{"path":2226,"title":2227,"description":2228,"date":2229,"slug":2230,"image":2231,"originalUrl":2232,"categories":2233},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[1842,1821,1550,1858,2234,2235,2058,2059,2124,1550,1779],"DeepSeek","H100",{"path":2237,"title":2238,"description":2239,"date":2240,"slug":2241,"image":2242,"originalUrl":2243,"categories":2244},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[1842,1821,1550,1858,2234,2235,2058,2059,2124,1550,1779],{"path":2246,"title":2247,"description":2248,"date":2249,"slug":2250,"image":2251,"originalUrl":2252,"categories":2253},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[1842,1821,1550,1858,2235,2058,2059,2124,1550,1779],1790515512945]