[{"data":1,"prerenderedAt":2534},["ShallowReactive",2],{"blog-post-nl-\u002Fblog\u002Fpaiton-qwen38-flash-next-radeon-ai-pro-r9700":3,"blog-posts-sidebar-nl":2025},{"id":4,"title":5,"body":6,"categories":2006,"date":2011,"description":2012,"extension":2013,"heading":2014,"image":2015,"meta":2016,"navigation":1273,"originalUrl":2017,"path":2018,"seo":2019,"slug":2020,"socialImage":2021,"stem":2022,"updated":2023,"__hash__":2024},"blogNl\u002Fblog\u002Fpaiton-qwen38-flash-next-radeon-ai-pro-r9700.md","Qwen3.8 Flash Next op 2 × Radeon AI PRO R9700: 216 tokens\u002Fs, 200K-context",{"type":7,"value":8,"toc":1983},"minimark",[9,42,69,76,81,97,101,107,204,221,226,229,234,278,291,295,310,313,318,380,400,404,448,466,479,483,495,498,503,540,556,560,563,584,603,620,624,641,672,676,693,696,701,748,780,784,804,880,885,902,938,951,957,961,979,983,1001,1026,1082,1086,1111,1126,1153,1163,1167,1192,1215,1397,1416,1510,1538,1541,1577,1590,1594,1606,1609,1613,1616,1629,1648,1979],[10,11,12,13,17,18,21,22,25,26,29,30],"p",{},"Een lokale assistent moet vlot kunnen schrijven, lange documenten kunnen verwerken en meer dan één gebruiker kunnen bedienen. Onze nieuwste Paiton-release brengt ",[14,15,16],"strong",{},"Qwen3.8 Flash Next naar twee Radeon AI PRO R9700-kaarten",", met ",[14,19,20],{},"216,3 tokens per seconde als gerapporteerde gewogen decodescore",", ",[14,23,24],{},"565,1 tokens per seconde voor acht gelijktijdige verzoeken samen"," en een aparte ",[14,27,28],{},"contextmodus van 200.000 tokens",".",[31,32,33],"sup",{},[34,35,41],"a",{"href":36,"ariaDescribedBy":37,"dataFootnoteRef":39,"id":40},"#user-content-fn-bench",[38],"footnote-label","","user-content-fnref-bench","1",[10,43,44,45,48,49,52,53,61],{},"De hardware bestaat uit twee kaarten met ",[14,46,47],{},"elk 32 GB VRAM",". De grote gerouteerde experts gebruiken 3-bit gewichten; gevoeligere onderdelen behouden een hogere precisie. Het model draait via ",[14,50,51],{},"reguliere vLLM 0.29, de Paiton-plugin en native AMD-kernels",", niet via een afzonderlijke serving-engine.",[31,54,55],{},[34,56,60],{"href":57,"ariaDescribedBy":58,"dataFootnoteRef":39,"id":59},"#user-content-fn-release",[38],"user-content-fnref-release","2",[31,62,63],{},[34,64,68],{"href":65,"ariaDescribedBy":66,"dataFootnoteRef":39,"id":67},"#user-content-fn-model",[38],"user-content-fnref-model","3",[10,70,71,72,75],{},"Daar horen belangrijke kanttekeningen bij. De 200K-modus genereert ongeveer 100 tokens\u002Fs in plaats van de circa 200 van de standaardmodus, omdat speculatieve decode uitstaat. Een grote n-gram-embeddingtabel blijft in het systeemgeheugen. De kwaliteitscontrole meet overeenkomst met het BF16-model en afgebakende lang-contextopzoektests, ",[14,73,74],{},"geen brede benchmarks voor rekenen, code, kennis, meertaligheid of toolgebruik",". Hieronder staat wat we hebben gemeten, wat de cijfers betekenen en hoe je het zelf probeert.",[77,78,80],"h2",{"id":79},"vlotte-generatie-op-twee-workstationkaarten","Vlotte generatie op twee workstationkaarten",[10,82,83,86,87,90,91],{},[14,84,85],{},"Decode"," meet de generatie na het eerste token. In de validatierun van de release-image op 10 oktober gaf het standaardprofiel van BetterBench 0.6.0 een gewogen score van ",[14,88,89],{},"216,3 tokens\u002Fs",". De afzonderlijke taken varieerden van 183,3 voor proza tot 259,2 voor JSON.",[31,92,93],{},[34,94,41],{"href":36,"ariaDescribedBy":95,"dataFootnoteRef":39,"id":96},[38],"user-content-fnref-bench-2",[98,99],"flash-next-figure",{"kind":100},"decode",[10,102,103],{},[104,105,106],"em",{},"Validatie van de release-image, twee R9700-kaarten, 98.304 tokens ingestelde context en speculatieve decode aan. Gegenereerde tokens\u002Fs; hoger is beter. De gewogen score is geen gemiddelde met gelijke gewichten voor de acht rijen; de taakgewichten staan verderop. Dit zijn metingen van dit model en deze configuratie, geen vergelijking met onze eerdere 27B-releases.",[108,109,110,124],"table",{},[111,112,113],"thead",{},[114,115,116,120],"tr",{},[117,118,119],"th",{},"Taak",[117,121,123],{"align":122},"right","Gegenereerde tokens\u002Fs",[125,126,127,136,144,152,160,168,176,184,192],"tbody",{},[114,128,129,133],{},[130,131,132],"td",{},"Chat",[130,134,135],{"align":122},"202,1",[114,137,138,141],{},[130,139,140],{},"Code",[130,142,143],{"align":122},"214,3",[114,145,146,149],{},[130,147,148],{},"Bestandsbewerking",[130,150,151],{"align":122},"236,0",[114,153,154,157],{},[130,155,156],{},"JSON",[130,158,159],{"align":122},"259,2",[114,161,162,165],{},[130,163,164],{},"Rekenen",[130,166,167],{"align":122},"255,5",[114,169,170,173],{},[130,171,172],{},"Proza",[130,174,175],{"align":122},"183,3",[114,177,178,181],{},[130,179,180],{},"Redeneren",[130,182,183],{"align":122},"190,1",[114,185,186,189],{},[130,187,188],{},"Samenvatten",[130,190,191],{"align":122},"239,8",[114,193,194,199],{},[130,195,196],{},[14,197,198],{},"Gerapporteerde gewogen score",[130,200,201],{"align":122},[14,202,203],{},"216,3",[10,205,206,207,210,211,214,215],{},"De mediane ",[14,208,209],{},"wachttijd tot het eerste token was 117 ms"," voor korte prompts. De p99 van streamupdates was ",[14,212,213],{},"13,9 ms",", maar dat is de tijd tussen updates, niet de vertraging per token: speculatieve decode kan meerdere geaccepteerde tokens in één update afleveren.",[31,216,217],{},[34,218,41],{"href":36,"ariaDescribedBy":219,"dataFootnoteRef":39,"id":220},[38],"user-content-fnref-bench-3",[222,223,225],"h3",{"id":224},"meer-uitvoer-wanneer-verzoeken-overlappen","Meer uitvoer wanneer verzoeken overlappen",[98,227],{"kind":228},"concurrency",[10,230,231],{},[104,232,233],{},"Totale generatiedoorvoer voor gelijktijdige verzoeken; hoger is beter. BetterBench voerde 48 verzoeken uit per gelijktijdigheidsniveau. Dit zijn gezamenlijke serversnelheden, niet de snelheid die elke gebruiker afzonderlijk krijgt. De meting met één verzoek gebruikt een andere taak dan de gewogen decodescore hierboven.",[108,235,236,246],{},[111,237,238],{},[114,239,240,243],{},[117,241,242],{},"Gelijktijdige verzoeken",[117,244,245],{"align":122},"Totale tokens\u002Fs",[125,247,248,255,262,270],{},[114,249,250,252],{},[130,251,41],{},[130,253,254],{"align":122},"204,6",[114,256,257,259],{},[130,258,60],{},[130,260,261],{"align":122},"315,1",[114,263,264,267],{},[130,265,266],{},"4",[130,268,269],{"align":122},"449,2",[114,271,272,275],{},[130,273,274],{},"8",[130,276,277],{"align":122},"565,1",[10,279,280,281,284,285],{},"Bij acht gelijktijdige verzoeken voltooiden ",[14,282,283],{},"alle 48 van de 48 verzoeken",". Dat is nuttig voor een gedeelde lokale assistent, maar acht overlappende benchmarkverzoeken betekenen niet dat acht volledige gesprekken van 98K tegelijk passen. Prompts, gegenereerde uitvoer en de toestand per verzoek gebruiken allemaal het beschikbare geheugen.",[31,286,287],{},[34,288,41],{"href":36,"ariaDescribedBy":289,"dataFootnoteRef":39,"id":290},[38],"user-content-fnref-bench-4",[77,292,294],{"id":293},"lange-prompts-zonder-sterke-daling-van-de-doorvoer","Lange prompts zonder sterke daling van de doorvoer",[10,296,297,300,301,29,304],{},[14,298,299],{},"Prefill"," is het verwerken van de invoer vóór de generatie begint. De aparte lang-contextmodus, met speculatieve decode uit, verwerkte de geteste promptdieptes met ongeveer ",[14,302,303],{},"7.900 tot 8.300 tokens\u002Fs",[31,305,306],{},[34,307,41],{"href":36,"ariaDescribedBy":308,"dataFootnoteRef":39,"id":309},[38],"user-content-fnref-bench-5",[98,311],{"kind":312},"prefill",[10,314,315],{},[104,316,317],{},"Verwerkte invoertokens per seconde; hoger is beter. BetterBench-standaardprofiel met een uitgebreide 128K-meting, twee R9700-kaarten, 200.000 tokens ingestelde context, speculatieve decode uit en prefillblokken van 2.048 tokens. De dieptelabels zijn nominale instellingen, geen exacte promptlengtes. Deze resultaten komen uit de lange modus, niet uit de speculatieve decodeconfiguratie.",[108,319,320,330],{},[111,321,322],{},[114,323,324,327],{},[117,325,326],{},"BetterBench-instelling voor promptdiepte",[117,328,329],{"align":122},"Invoertokens\u002Fs",[125,331,332,340,348,356,364,372],{},[114,333,334,337],{},[130,335,336],{},"2K",[130,338,339],{"align":122},"7.925",[114,341,342,345],{},[130,343,344],{},"8K",[130,346,347],{"align":122},"8.321",[114,349,350,353],{},[130,351,352],{},"16K",[130,354,355],{"align":122},"8.311",[114,357,358,361],{},[130,359,360],{},"32K",[130,362,363],{"align":122},"8.232",[114,365,366,369],{},[130,367,368],{},"64K",[130,370,371],{"align":122},"8.161",[114,373,374,377],{},[130,375,376],{},"128K",[130,378,379],{"align":122},"7.928",[10,381,382,383,386,387,390,391,29,394],{},"Het 128K-resultaat blijft dicht bij dat van 8K. Een aparte proef met koude cache en ",[14,384,385],{},"precies 64.000 prompttokens"," mat ",[14,388,389],{},"8.212 tokens\u002Fs"," over de volledige prompt, of 8.204 in stabiele toestand na het eerste blok. Promptdoorvoer is niet hetzelfde als de volledige wachttijd op een antwoord: bij een nieuwe ",[14,392,393],{},"190K-prompt duurde het 24,8 seconden tot het eerste token",[31,395,396],{},[34,397,41],{"href":36,"ariaDescribedBy":398,"dataFootnoteRef":39,"id":399},[38],"user-content-fnref-bench-6",[222,401,403],{"id":402},"kies-de-modus-die-bij-de-taak-past","Kies de modus die bij de taak past",[108,405,406,419],{},[111,407,408],{},[114,409,410,413,416],{},[117,411,412],{},"Modus",[117,414,415],{"align":122},"Ingesteld contextvenster",[117,417,418],{},"Speculatieve decode",[125,420,421,435],{},[114,422,423,429,432],{},[130,424,425,428],{},[426,427,100],"code",{},", standaard",[130,430,431],{"align":122},"98.304 tokens",[130,433,434],{},"Aan, diepte 3",[114,436,437,442,445],{},[130,438,439],{},[426,440,441],{},"prefill-long",[130,443,444],{"align":122},"200.000 tokens",[130,446,447],{},"Uit",[10,449,450,451,29,454,460],{},"Dit zijn totale contextvensters: de prompt, chatopmaak en het gegenereerde antwoord moeten samen passen. Het native checkpointvenster is 262.144 tokens, maar ",[14,452,453],{},"deze release bevestigt dat volledige venster niet op deze twee kaarten",[31,455,456],{},[34,457,68],{"href":65,"ariaDescribedBy":458,"dataFootnoteRef":39,"id":459},[38],"user-content-fnref-model-2",[31,461,462],{},[34,463,60],{"href":57,"ariaDescribedBy":464,"dataFootnoteRef":39,"id":465},[38],"user-content-fnref-release-2",[10,467,468,469,472,473],{},"De 200K-modus heeft het geheugen nodig dat anders de toestand van de speculatieve drafter per verzoek bevat. Zonder speculatieve decode leverde generatie met één verzoek na prompts van 32K, 100K en 190K respectievelijk ",[14,470,471],{},"105,3, 100,6 en 99,9 tokens\u002Fs",", met voortzettingen van 256 tokens. Lange context blijft daarmee bruikbaar, met een andere snelheidsafweging dan de standaardmodus.",[31,474,475],{},[34,476,41],{"href":36,"ariaDescribedBy":477,"dataFootnoteRef":39,"id":478},[38],"user-content-fnref-bench-7",[77,480,482],{"id":481},"hergebruik-een-lange-prompt-met-optionele-prefixcaching","Hergebruik een lange prompt met optionele prefixcaching",[10,484,485,486,29,489],{},"Als je herhaaldelijk vragen stelt over hetzelfde document, kan het opnieuw verwerken van de ongewijzigde prefix het grootste deel van de wachttijd innemen. De optionele prefixcache bewaart checkpoints van de attention-cache en recurrente toestand op uitgelijnde ",[14,487,488],{},"grenzen van 2.048 tokens",[31,490,491],{},[34,492,60],{"href":57,"ariaDescribedBy":493,"dataFootnoteRef":39,"id":494},[38],"user-content-fnref-release-3",[98,496],{"kind":497},"prefix-cache",[10,499,500],{},[104,501,502],{},"Aparte controles met herhaalde prompts in de lang-contextmodus. Wachttijd tot het eerste token in seconden; lager is beter. Een cachehit hergebruikt een ongewijzigde prefix die nog in de cache staat. Dit zijn niet de BetterBench-metingen met koude cache hierboven.",[108,504,505,518],{},[111,506,507],{},[114,508,509,512,515],{},[117,510,511],{},"Herhaalde prompt",[117,513,514],{"align":122},"Eerste token met koude cache",[117,516,517],{"align":122},"Prefixcachehit",[125,519,520,530],{},[114,521,522,524,527],{},[130,523,368],{},[130,525,526],{"align":122},"9,6 s",[130,528,529],{"align":122},"0,35 s",[114,531,532,534,537],{},[130,533,376],{},[130,535,536],{"align":122},"20 s",[130,538,539],{"align":122},"0,41 s",[10,541,542,543,546,547,29,550],{},"In deze controles was de uitvoer na een hit ",[14,544,545],{},"byte-identiek aan die van de run zonder cache",". Dat is een resultaat voor de geteste verzoeken met en zonder cache, geen belofte van identieke uitvoer bij elke samplinginstelling. Prefixcaching is optioneel en ",[14,548,549],{},"de belangrijkste doorvoerbenchmarks zijn zonder prefixcaching gemeten",[31,551,552],{},[34,553,41],{"href":36,"ariaDescribedBy":554,"dataFootnoteRef":39,"id":555},[38],"user-content-fnref-bench-8",[77,557,559],{"id":558},"wat-3-bit-hier-betekent","Wat 3-bit hier betekent",[10,561,562],{},"Dit is een model met gemengde precisie, niet de claim dat elke tensor drie bits gebruikt.",[10,564,565,566,569,570,573,574,577,578],{},"De ",[14,567,568],{},"gerouteerde experts",", samen goed voor 120,8 miljard gewichten, gebruiken ",[14,571,572],{},"3,125 bits per gewicht inclusief groepsschalen",". Die experts nemen samen ongeveer ",[14,575,576],{},"47,2 GB"," in. Een geroteerde invoerbasis helpt de representatie met lage precisie. De native kernels lezen de verpakte gewichten rechtstreeks, zonder eerst het volledige model naar een groter formaat uit te pakken. W3A8 verwijst naar de 3-bit expertgewichten en 8-bit expertactivaties.",[31,579,580],{},[34,581,68],{"href":65,"ariaDescribedBy":582,"dataFootnoteRef":39,"id":583},[38],"user-content-fnref-model-3",[10,585,586,587,590,591,597],{},"De belangrijkste projecties buiten de experts gebruiken 8-bit gewichten. De speculatieve MTP-laag heeft 4-bit expertgewichten en een 2-bit draftkop; andere tensors behouden hogere precisie. Routers, normalisatie en de behouden vision-tower hebben eveneens eigen precisiekeuzes. De openbare modelkaart vermeldt de tensorformaten. ",[14,588,589],{},"De gevalideerde servermodi zijn alleen voor tekst",", ook al bevat de repository de vision-tower.",[31,592,593],{},[34,594,68],{"href":65,"ariaDescribedBy":595,"dataFootnoteRef":39,"id":596},[38],"user-content-fnref-model-4",[31,598,599],{},[34,600,60],{"href":57,"ariaDescribedBy":601,"dataFootnoteRef":39,"id":602},[38],"user-content-fnref-release-4",[10,604,605,606,609,610,613,614],{},"De gewichten komen uit onze eigen sequentiële GPTQ-kalibratie op ",[14,607,608],{},"twee miljoen tokens"," proza, code en assistentgesprekken. We testten twee kalibratiereplicaten en scheidden selectie- en bevestigingsdata. Hun KL-resultaten op de bevestigingsdata, ",[14,611,612],{},"0,0630 en 0,0686",", verschilden genoeg om kleine verschillen tussen kandidaatformaten niet te zwaar te interpreteren.",[31,615,616],{},[34,617,68],{"href":65,"ariaDescribedBy":618,"dataFootnoteRef":39,"id":619},[38],"user-content-fnref-model-5",[222,621,623],{"id":622},"waar-het-geheugen-naartoe-gaat","Waar het geheugen naartoe gaat",[10,625,626,627,630,631,634,635],{},"De grote decoder- en expertgewichten blijven op de GPU's, verdeeld over twee tensorparallelle ranks. Elke kaart bevat ",[14,628,629],{},"24,9 GiB tekstgewichten plus 0,7 GiB voor de MTP-laag",". Beide benchmarkconfiguraties piekten op ",[14,632,633],{},"30,5 tot 31,5 GiB per kaart",", inclusief cache, recurrente toestand en uitvoeringsgrafen.",[31,636,637],{},[34,638,68],{"href":65,"ariaDescribedBy":639,"dataFootnoteRef":39,"id":640},[38],"user-content-fnref-model-6",[10,642,643,644,647,648,651,652,655,656,659,660,666],{},"Er is ",[14,645,646],{},"geen expert-offload",", maar dit is geen configuratie die uitsluitend GPU-geheugen gebruikt. De ",[14,649,650],{},"n-gram-tabel van 48,9 GiB blijft vastgezet in het systeemgeheugen",", verdeeld over de ranks. De runtime leest er 16 rijen per token uit. De testhost had ",[14,653,654],{},"251 GiB systeemgeheugen",". De checkpointrepository neemt ",[14,657,658],{},"108 GiB op schijf"," in, zonder extra ruimte voor de container en runtimecache.",[31,661,662],{},[34,663,68],{"href":65,"ariaDescribedBy":664,"dataFootnoteRef":39,"id":665},[38],"user-content-fnref-model-7",[31,667,668],{},[34,669,60],{"href":57,"ariaDescribedBy":670,"dataFootnoteRef":39,"id":671},[38],"user-content-fnref-release-5",[77,673,675],{"id":674},"kwaliteit-vergelijkbare-verdelingen-zijn-geen-taakbenchmarkscores","Kwaliteit: vergelijkbare verdelingen zijn geen taakbenchmarkscores",[10,677,678,679,682,683,686,687],{},"We onderzochten hoeveel de voorspelde verdeling voor het volgende token over de volledige woordenschat afwijkt van BF16. ",[14,680,681],{},"Bij KL-divergentie is lager beter","; nul zou identieke verdelingen betekenen. ",[14,684,685],{},"Top-1-overeenkomst"," meet hoe vaak beide versies hetzelfde volgende token verkiezen. Het is niet het percentage opgeloste rekenvragen of programmeertaken.",[31,688,689],{},[34,690,68],{"href":65,"ariaDescribedBy":691,"dataFootnoteRef":39,"id":692},[38],"user-content-fnref-model-8",[98,694],{"kind":695},"quality",[10,697,698],{},[104,699,700],{},"Tekst- en assistentposities in hetzelfde evaluatiecorpus. Vrije routing laat elk model zijn eigen experts kiezen; vastgezette routing dwingt de BF16-expertkeuze af en scheidt zo rekenfouten van routingwijzigingen. KL en top-1-overeenkomst meten verschillende zaken met verschillende eenheden. De BF16-controle toont variatie tussen twee correcte implementaties.",[108,702,703,718],{},[111,704,705],{},[114,706,707,710,713,716],{},[117,708,709],{},"Evaluatie",[117,711,712],{"align":122},"KL tegenover BF16, vrije routing",[117,714,715],{"align":122},"KL, BF16-routing afgedwongen",[117,717,685],{"align":122},[125,719,720,734],{},[114,721,722,725,728,731],{},[130,723,724],{},"BF16 tegenover BF16, implementatieondergrens",[130,726,727],{"align":122},"0,0077",[130,729,730],{"align":122},"Niet van toepassing",[130,732,733],{"align":122},"96,77%",[114,735,736,739,742,745],{},[130,737,738],{},"Dit 3-bit model",[130,740,741],{"align":122},"0,0604",[130,743,744],{"align":122},"0,0413",[130,746,747],{"align":122},"90,74%",[10,749,750,751,754,755,758,759,762,763,766,767,773],{},"Het corpus bevat ",[14,752,753],{},"294.912 posities",", waaronder ",[14,756,757],{},"170.884 tekst- en assistentposities"," voor de hoofdmetingen. Afzonderlijk slaagde de releasecontainer voor zijn served-KL-controle met ",[14,760,761],{},"0,0616",", tegenover een opgegeven budget van 0,0600 plus 0,002. Die controle gebruikt top-64-bucket-KL op de bevestigingshelft en is dus ",[14,764,765],{},"niet dezelfde meting over de volledige woordenschat als de tabel hierboven",". Ze valideert de draaiende server, niet alleen een emulatie.",[31,768,769],{},[34,770,68],{"href":65,"ariaDescribedBy":771,"dataFootnoteRef":39,"id":772},[38],"user-content-fnref-model-9",[31,774,775],{},[34,776,266],{"href":777,"ariaDescribedBy":778,"dataFootnoteRef":39,"id":779},"#user-content-fn-quality",[38],"user-content-fnref-quality",[222,781,783],{"id":782},"lange-documenten-en-afgebakende-opzoektests","Lange documenten en afgebakende opzoektests",[10,785,786,787,790,791,794,795,29,798],{},"Een apart gehouden set van ",[14,788,789],{},"44 documenten van 8K tot 32K tokens",", samen 524.288 posities, geeft een afzonderlijk beeld van fouten naarmate het document vordert. Het documentresultaat voor tekst- en assistentposities is ",[14,792,793],{},"0,0561 KL met vrije routing",", 0,0408 met vastgezette routing en ",[14,796,797],{},"90,39% top-1-overeenkomst",[31,799,800],{},[34,801,68],{"href":65,"ariaDescribedBy":802,"dataFootnoteRef":39,"id":803},[38],"user-content-fnref-model-10",[108,805,806,822],{},[111,807,808],{},[114,809,810,813,816,819],{},[117,811,812],{},"Positie in het document",[117,814,815],{"align":122},"KL, vrije routing",[117,817,818],{"align":122},"KL, routing vastgezet",[117,820,821],{"align":122},"Top-1-overeenkomst voor tekst\u002Fassistent",[125,823,824,838,852,866],{},[114,825,826,829,832,835],{},[130,827,828],{},"Onder 2K",[130,830,831],{"align":122},"0,1554",[130,833,834],{"align":122},"0,1043",[130,836,837],{"align":122},"89,46%",[114,839,840,843,846,849],{},[130,841,842],{},"2K–4K",[130,844,845],{"align":122},"0,6300",[130,847,848],{"align":122},"0,2931",[130,850,851],{"align":122},"89,66%",[114,853,854,857,860,863],{},[130,855,856],{},"4K–8K",[130,858,859],{"align":122},"0,6408",[130,861,862],{"align":122},"0,2984",[130,864,865],{"align":122},"90,06%",[114,867,868,871,874,877],{},[130,869,870],{},"8K en verder",[130,872,873],{"align":122},"0,4333",[130,875,876],{"align":122},"0,2150",[130,878,879],{"align":122},"91,65%",[10,881,882],{},[104,883,884],{},"De KL-waarden per segment hierboven omvatten alle posities; hun top-1-waarden omvatten tekst- en assistentposities. Vergelijk ze daarom niet rechtstreeks met de hoofd-KL voor tekst en assistent. Het laatste segment bevat 12 documenten, de andere segmenten 44.",[10,886,887,888,891,892,895,896],{},"Op tekst- en assistentposities bedroeg de negatieve log-likelihood op documentniveau ",[14,889,890],{},"1,7574 nats\u002Ftoken voor BF16 en 1,7671 voor dit model",", een gepaard verschil van ",[14,893,894],{},"+0,0097",". Dat is een klein gemeten verlies op deze aparte set, geen bewijs van identieke taakkwaliteit.",[31,897,898],{},[34,899,68],{"href":65,"ariaDescribedBy":900,"dataFootnoteRef":39,"id":901},[38],"user-content-fnref-model-11",[108,903,904,917],{},[111,905,906],{},[114,907,908,911,914],{},[117,909,910],{},"Opzoekcontrole op de draaiende server",[117,912,913],{"align":122},"Dit model",[117,915,916],{"align":122},"BF16-controle",[125,918,919,929],{},[114,920,921,924,927],{},[130,922,923],{},"Needle-opzoektest bij 131.072 tokens",[130,925,926],{"align":122},"40 \u002F 40",[130,928,926],{"align":122},[114,930,931,934,936],{},[130,932,933],{},"Needle-opzoektest bij 200.000 tokens",[130,935,926],{"align":122},[130,937,926],{"align":122},[10,939,940,941,944,945],{},"Beide versies gaven in deze tests dezelfde antwoorden. Ook de drafter bleef dichtbij in een teacher-forced greedy-controle op diepte 3: ",[14,942,943],{},"1,768 verwachte geaccepteerde drafts per stap",", tegenover 1,789 voor de BF16-MTP-laag op het BF16-model. Noch de opzoektests, noch de draftacceptatie bevestigen algemene redeneerkwaliteit.",[31,946,947],{},[34,948,68],{"href":65,"ariaDescribedBy":949,"dataFootnoteRef":39,"id":950},[38],"user-content-fnref-model-12",[10,952,953,956],{},[14,954,955],{},"Rekenen, code, algemene kennis, meertaligheid en toolgebruik kregen voor deze release geen taakbenchmarks. Beeldinvoer is niet gevalideerd."," Test de taken waarvoor je het model wilt inzetten; overeenkomst tussen tokenverdelingen vervangt die evaluatie niet.",[77,958,960],{"id":959},"de-runtime-zonder-eigen-serving-engine","De runtime, zonder eigen serving-engine",[10,962,963,964,29,967,973],{},"vLLM levert het serverframework en de OpenAI-compatibele API. Paitons native kernels verwerken de verpakte experts, tensorparallelle uitvoering en modelspecifieke bewerkingen. Speculatieve decode stelt drie tokens voor en controleert ze samen. De runtime verwerkt ook de toestand van recurrente lagen wanneer een draft wordt afgewezen. De releaserun accepteerde mediaan ",[14,965,966],{},"2,85 tokens per streamupdate",[31,968,969],{},[34,970,60],{"href":57,"ariaDescribedBy":971,"dataFootnoteRef":39,"id":972},[38],"user-content-fnref-release-6",[31,974,975],{},[34,976,68],{"href":65,"ariaDescribedBy":977,"dataFootnoteRef":39,"id":978},[38],"user-content-fnref-model-13",[222,980,982],{"id":981},"een-sneller-prefillpad-of-reproduceerbaar-rekenwerk","Een sneller prefillpad, of reproduceerbaar rekenwerk",[10,984,985,986,29,989,995],{},"Het standaard snelle prefillpad gebruikt 8-bit gewichten en 8-bit activaties in de trunk tijdens de promptverwerking. Dat verandert de rekenprecisie voor promptrijen. Het slaagde voor het KL-budget op de server en de opzoektests hierboven, maar de controle met lange documenten vond het ",[14,987,988],{},"niet bit-reproduceerbaar tussen runs",[31,990,991],{},[34,992,60],{"href":57,"ariaDescribedBy":993,"dataFootnoteRef":39,"id":994},[38],"user-content-fnref-release-7",[31,996,997],{},[34,998,41],{"href":36,"ariaDescribedBy":999,"dataFootnoteRef":39,"id":1000},[38],"user-content-fnref-bench-9",[10,1002,1003,1004,1007,1008,1011,1012,1015,1016,1019,1020],{},"Het openbaar als ",[14,1005,1006],{},"exact aangeduide Gated DeltaNet-prefillpad"," blijft beschikbaar. Het behoudt de andere kwantisatiekeuzes en zet dus niet al het promptrekenwerk om naar BF16. Een meting op de ",[14,1009,1010],{},"ontwikkelstack"," gaf ",[14,1013,1014],{},"7.607 tokens\u002Fs bij 64K",", tegenover 8.161 voor het snelle pad van de release-image. Het exacte pad was bit-reproduceerbaar in de controles. ",[14,1017,1018],{},"Het is niet opnieuw gemeten op de release-image",", dus dit is geen benchmarkvergelijking binnen dezelfde image. De keuze verandert het rekenwerk tijdens decode niet.",[31,1021,1022],{},[34,1023,41],{"href":36,"ariaDescribedBy":1024,"dataFootnoteRef":39,"id":1025},[38],"user-content-fnref-bench-10",[108,1027,1028,1038],{},[111,1029,1030],{},[114,1031,1032,1035],{},[117,1033,1034],{},"Instelling voor promptdiepte",[117,1036,1037],{"align":122},"Exacte GDN-prefill, ontwikkelstack",[125,1039,1040,1047,1054,1061,1068,1075],{},[114,1041,1042,1044],{},[130,1043,336],{},[130,1045,1046],{"align":122},"7.575 tokens\u002Fs",[114,1048,1049,1051],{},[130,1050,344],{},[130,1052,1053],{"align":122},"7.785 tokens\u002Fs",[114,1055,1056,1058],{},[130,1057,352],{},[130,1059,1060],{"align":122},"7.762 tokens\u002Fs",[114,1062,1063,1065],{},[130,1064,360],{},[130,1066,1067],{"align":122},"7.711 tokens\u002Fs",[114,1069,1070,1072],{},[130,1071,368],{},[130,1073,1074],{"align":122},"7.607 tokens\u002Fs",[114,1076,1077,1079],{},[130,1078,376],{},[130,1080,1081],{"align":122},"7.422 tokens\u002Fs",[77,1083,1085],{"id":1084},"hoe-we-hebben-gemeten","Hoe we hebben gemeten",[10,1087,1088,1089,1092,1093,1096,1097,1100,1101,1104,1105],{},"De belangrijkste tabellen gebruiken ",[14,1090,1091],{},"BetterBench 0.6.0, standaardprofiel",", tegen de release-image via zijn eigen launcher en OpenAI-compatibele endpoint. De samplinginstellingen waren temperature 0,7, top-p 0,95 en top-k 20. Elke decodecategorie had ",[14,1094,1095],{},"20 gemeten runs na drie opwarmruns","; de gelijktijdigheidstest gebruikte ",[14,1098,1099],{},"48 verzoeken bij 1, 2, 4 en 8 streams","; prefill gebruikte ",[14,1102,1103],{},"acht runs per diepte"," en blokken van 2.048 tokens.",[31,1106,1107],{},[34,1108,41],{"href":36,"ariaDescribedBy":1109,"dataFootnoteRef":39,"id":1110},[38],"user-content-fnref-bench-11",[10,1112,1113,1114,1117,1118],{},"De gewogen decodescore kent ",[14,1115,1116],{},"30% toe aan code, 20% aan redeneren, telkens 15% aan proza en JSON, en telkens 10% aan bestandsbewerking en samenvatten",". Chat en rekenen worden apart gemeten en hebben geen gewicht in die score.",[31,1119,1120],{},[34,1121,1125],{"href":1122,"ariaDescribedBy":1123,"dataFootnoteRef":39,"id":1124},"#user-content-fn-betterbench",[38],"user-content-fnref-betterbench","5",[10,1127,1128,1129,1132,1133,1136,1137,1140,1141,1147],{},"Elk benchmarkverzoek bevatte een unieke nonce, zodat de prefixcache koud bleef. Decode, korte-promptlatentie en gelijktijdigheid gebruiken de ",[14,1130,1131],{},"speculatieve modus met 98.304 tokens",". Prefill gebruikt de ",[14,1134,1135],{},"modus met 200.000 tokens zonder speculatieve decode",". De twee GPU's wisselden ongecomprimeerde BF16-activaties uit. De host was rustig, zonder builds of uploads, en opstarten duurde ongeveer ",[14,1138,1139],{},"drie tot vijf minuten",", vooral voor het laden van gewichten. Compilecaches zitten in de image.",[31,1142,1143],{},[34,1144,41],{"href":36,"ariaDescribedBy":1145,"dataFootnoteRef":39,"id":1146},[38],"user-content-fnref-bench-12",[31,1148,1149],{},[34,1150,60],{"href":57,"ariaDescribedBy":1151,"dataFootnoteRef":39,"id":1152},[38],"user-content-fnref-release-8",[10,1154,1155,1156,1162],{},"Deze metingen beschrijven onze host, prompts en releaseconfiguratie. Ze meten geen energieverbruik van het volledige systeem, kosten per token of snelheidswinst tegenover een ander model. Het ",[34,1157,1161],{"href":1158,"rel":1159},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fbe0f1a53bd60ab1bf77131121f9cacdcf46d2863\u002Fmodels\u002FQwen3.8-Flash-Next\u002FBENCHMARKS.md",[1160],"nofollow","openbare benchmarkrapport"," bewaart de configuratie en gedetailleerde resultaten.",[77,1164,1166],{"id":1165},"probeer-het-op-twee-r9700-kaarten","Probeer het op twee R9700-kaarten",[10,1168,1169,1170,1173,1174,1177,1178,1181,1182,1185,1186],{},"Gebruik een Linux-host met ",[14,1171,1172],{},"twee Radeon AI PRO R9700-kaarten",", een ",[14,1175,1176],{},"ROCm 10-hostdriver",", Python 3, de Hugging Face CLI en Docker met toegang tot ",[426,1179,1180],{},"\u002Fdev\u002Fkfd"," en ",[426,1183,1184],{},"\u002Fdev\u002Fdri",". Voorzie ruim systeemgeheugen bovenop de n-gram-tabel van 48,9 GiB en schijfruimte bovenop het checkpoint van 108 GiB. De 251 GiB van onze testhost is een gemeten configuratie, geen opgegeven minimumeis.",[31,1187,1188],{},[34,1189,60],{"href":57,"ariaDescribedBy":1190,"dataFootnoteRef":39,"id":1191},[38],"user-content-fnref-release-9",[10,1193,1194,1195,1198,1199,1202,1203,1209],{},"De commando's hieronder leggen de openbare launcher vast en ",[14,1196,1197],{},"downloaden expliciet de volledige modelrevisie, inclusief de runtimedrafter",". Dat is belangrijk: de automatische download van deze vastgelegde launcher verwijst nog naar een oudere modelrevisie. Download eerst de revisie hieronder en geef de map mee met ",[426,1200,1201],{},"--weights",", in plaats van op de automatische download te vertrouwen. Heb je de pluginrepository al, gebruik dan een afzonderlijke checkout zonder lokaal werk te vervangen.",[31,1204,1205],{},[34,1206,60],{"href":57,"ariaDescribedBy":1207,"dataFootnoteRef":39,"id":1208},[38],"user-content-fnref-release-10",[31,1210,1211],{},[34,1212,68],{"href":65,"ariaDescribedBy":1213,"dataFootnoteRef":39,"id":1214},[38],"user-content-fnref-model-14",[1216,1217,1221],"pre",{"className":1218,"code":1219,"language":1220,"meta":39,"style":39},"language-bash shiki shiki-themes github-light github-dark","git clone https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\ncd paiton-vllm-plugin\ngit checkout be0f1a53bd60ab1bf77131121f9cacdcf46d2863\ncd models\u002FQwen3.8-Flash-Next\n\nexport PAITON_FLASHNEXT_DIR=\"$PWD\u002Fmodel-cache\u002Fqwen38-flash-next-w3a8\"\nhf download EliovpAI\u002FQwen3.8-Flash-Next-W3A8-Paiton-RDNA4 \\\n  --revision 829b089bf6636af9ffed1f333b103e4e383f7b48 \\\n  --local-dir \"$PAITON_FLASHNEXT_DIR\"\n(cd \"$PAITON_FLASHNEXT_DIR\" && sha256sum -c SHA256SUMS)\n\npython3 launch-flashnext.py --weights \"$PAITON_FLASHNEXT_DIR\" --mode decode\n","bash",[426,1222,1223,1239,1249,1260,1268,1275,1298,1313,1324,1339,1368,1373],{"__ignoreMap":39},[1224,1225,1228,1232,1236],"span",{"class":1226,"line":1227},"line",1,[1224,1229,1231],{"class":1230},"sScJk","git",[1224,1233,1235],{"class":1234},"sZZnC"," clone",[1224,1237,1238],{"class":1234}," https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin.git\n",[1224,1240,1242,1246],{"class":1226,"line":1241},2,[1224,1243,1245],{"class":1244},"sj4cs","cd",[1224,1247,1248],{"class":1234}," paiton-vllm-plugin\n",[1224,1250,1252,1254,1257],{"class":1226,"line":1251},3,[1224,1253,1231],{"class":1230},[1224,1255,1256],{"class":1234}," checkout",[1224,1258,1259],{"class":1234}," be0f1a53bd60ab1bf77131121f9cacdcf46d2863\n",[1224,1261,1263,1265],{"class":1226,"line":1262},4,[1224,1264,1245],{"class":1244},[1224,1266,1267],{"class":1234}," models\u002FQwen3.8-Flash-Next\n",[1224,1269,1271],{"class":1226,"line":1270},5,[1224,1272,1274],{"emptyLinePlaceholder":1273},true,"\n",[1224,1276,1278,1282,1286,1289,1292,1295],{"class":1226,"line":1277},6,[1224,1279,1281],{"class":1280},"szBVR","export",[1224,1283,1285],{"class":1284},"sVt8B"," PAITON_FLASHNEXT_DIR",[1224,1287,1288],{"class":1280},"=",[1224,1290,1291],{"class":1234},"\"",[1224,1293,1294],{"class":1284},"$PWD",[1224,1296,1297],{"class":1234},"\u002Fmodel-cache\u002Fqwen38-flash-next-w3a8\"\n",[1224,1299,1301,1304,1307,1310],{"class":1226,"line":1300},7,[1224,1302,1303],{"class":1230},"hf",[1224,1305,1306],{"class":1234}," download",[1224,1308,1309],{"class":1234}," EliovpAI\u002FQwen3.8-Flash-Next-W3A8-Paiton-RDNA4",[1224,1311,1312],{"class":1244}," \\\n",[1224,1314,1316,1319,1322],{"class":1226,"line":1315},8,[1224,1317,1318],{"class":1244},"  --revision",[1224,1320,1321],{"class":1234}," 829b089bf6636af9ffed1f333b103e4e383f7b48",[1224,1323,1312],{"class":1244},[1224,1325,1327,1330,1333,1336],{"class":1226,"line":1326},9,[1224,1328,1329],{"class":1244},"  --local-dir",[1224,1331,1332],{"class":1234}," \"",[1224,1334,1335],{"class":1284},"$PAITON_FLASHNEXT_DIR",[1224,1337,1338],{"class":1234},"\"\n",[1224,1340,1342,1345,1347,1349,1351,1353,1356,1359,1362,1365],{"class":1226,"line":1341},10,[1224,1343,1344],{"class":1284},"(",[1224,1346,1245],{"class":1244},[1224,1348,1332],{"class":1234},[1224,1350,1335],{"class":1284},[1224,1352,1291],{"class":1234},[1224,1354,1355],{"class":1284}," && ",[1224,1357,1358],{"class":1230},"sha256sum",[1224,1360,1361],{"class":1244}," -c",[1224,1363,1364],{"class":1234}," SHA256SUMS",[1224,1366,1367],{"class":1284},")\n",[1224,1369,1371],{"class":1226,"line":1370},11,[1224,1372,1274],{"emptyLinePlaceholder":1273},[1224,1374,1376,1379,1382,1385,1387,1389,1391,1394],{"class":1226,"line":1375},12,[1224,1377,1378],{"class":1230},"python3",[1224,1380,1381],{"class":1234}," launch-flashnext.py",[1224,1383,1384],{"class":1244}," --weights",[1224,1386,1332],{"class":1234},[1224,1388,1335],{"class":1284},[1224,1390,1291],{"class":1234},[1224,1392,1393],{"class":1244}," --mode",[1224,1395,1396],{"class":1234}," decode\n",[10,1398,1399,1400,1403,1404,1409,1410,1415],{},"De launcher kiest ",[426,1401,1402],{},"ghcr.io\u002Feliovp\u002Fpaiton-vllm-plugin:qwen38-flashnext-rocm10-vllm029-20261010-r1",", vastgelegd via een digest in het ",[34,1405,1408],{"href":1406,"rel":1407},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fbe0f1a53bd60ab1bf77131121f9cacdcf46d2863\u002Fmodels\u002FQwen3.8-Flash-Next\u002Fruntime.lock.json",[1160],"runtimelockbestand",". De ",[34,1411,1414],{"href":1412,"rel":1413},"https:\u002F\u002Fgithub.com\u002FEliovp-BV\u002Fpaiton-vllm-plugin\u002Fblob\u002Fbe0f1a53bd60ab1bf77131121f9cacdcf46d2863\u002Fmodels\u002FQwen3.8-Flash-Next\u002FREADME.md",[1160],"modelspecifieke installatiehandleiding"," beschrijft de modi van de Python-launcher. Stop de draaiende server vóór je een andere modus kiest:",[1216,1417,1419],{"className":1218,"code":1418,"language":1220,"meta":39,"style":39},"# 200K-context, speculatieve decode uit\npython3 launch-flashnext.py --weights \"$PAITON_FLASHNEXT_DIR\" --mode prefill-long\n\n# Exacte Gated DeltaNet-prefill, standaardcontext\npython3 launch-flashnext.py --weights \"$PAITON_FLASHNEXT_DIR\" --mode decode-nopf\n\n# 200K-modus met optionele prefixcaching\npython3 launch-flashnext.py --weights \"$PAITON_FLASHNEXT_DIR\" \\\n  --mode prefill-long --prefix-caching\n",[426,1420,1421,1427,1446,1450,1455,1474,1478,1483,1499],{"__ignoreMap":39},[1224,1422,1423],{"class":1226,"line":1227},[1224,1424,1426],{"class":1425},"sJ8bj","# 200K-context, speculatieve decode uit\n",[1224,1428,1429,1431,1433,1435,1437,1439,1441,1443],{"class":1226,"line":1241},[1224,1430,1378],{"class":1230},[1224,1432,1381],{"class":1234},[1224,1434,1384],{"class":1244},[1224,1436,1332],{"class":1234},[1224,1438,1335],{"class":1284},[1224,1440,1291],{"class":1234},[1224,1442,1393],{"class":1244},[1224,1444,1445],{"class":1234}," prefill-long\n",[1224,1447,1448],{"class":1226,"line":1251},[1224,1449,1274],{"emptyLinePlaceholder":1273},[1224,1451,1452],{"class":1226,"line":1262},[1224,1453,1454],{"class":1425},"# Exacte Gated DeltaNet-prefill, standaardcontext\n",[1224,1456,1457,1459,1461,1463,1465,1467,1469,1471],{"class":1226,"line":1270},[1224,1458,1378],{"class":1230},[1224,1460,1381],{"class":1234},[1224,1462,1384],{"class":1244},[1224,1464,1332],{"class":1234},[1224,1466,1335],{"class":1284},[1224,1468,1291],{"class":1234},[1224,1470,1393],{"class":1244},[1224,1472,1473],{"class":1234}," decode-nopf\n",[1224,1475,1476],{"class":1226,"line":1277},[1224,1477,1274],{"emptyLinePlaceholder":1273},[1224,1479,1480],{"class":1226,"line":1300},[1224,1481,1482],{"class":1425},"# 200K-modus met optionele prefixcaching\n",[1224,1484,1485,1487,1489,1491,1493,1495,1497],{"class":1226,"line":1315},[1224,1486,1378],{"class":1230},[1224,1488,1381],{"class":1234},[1224,1490,1384],{"class":1244},[1224,1492,1332],{"class":1234},[1224,1494,1335],{"class":1284},[1224,1496,1291],{"class":1234},[1224,1498,1312],{"class":1244},[1224,1500,1501,1504,1507],{"class":1226,"line":1326},[1224,1502,1503],{"class":1244},"  --mode",[1224,1505,1506],{"class":1234}," prefill-long",[1224,1508,1509],{"class":1244}," --prefix-caching\n",[10,1511,1512,1513,1516,1517,1520,1521,1524,1525,1528,1529,29,1532],{},"Start ",[14,1514,1515],{},"één modus tegelijk",". ",[426,1518,1519],{},"prefill-long-nopf"," kiest het exacte Gated DeltaNet-prefillpad bij 200K; ",[426,1522,1523],{},"--dry-run"," toont het Dockercommando zonder de server te starten. Beide uitgebrachte basismodi gebruiken een BF16-attention-cache. Zodra de server klaar is, staat de endpoint op ",[426,1526,1527],{},"http:\u002F\u002F127.0.0.1:18982\u002Fv1",", met modelnaam ",[426,1530,1531],{},"Qwen3.8-Flash-Next",[31,1533,1534],{},[34,1535,60],{"href":57,"ariaDescribedBy":1536,"dataFootnoteRef":39,"id":1537},[38],"user-content-fnref-release-11",[10,1539,1540],{},"Stuur in een andere terminal een streamingverzoek:",[1216,1542,1544],{"className":1218,"code":1543,"language":1220,"meta":39,"style":39},"curl --fail http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\"model\":\"Qwen3.8-Flash-Next\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a short Python function that removes duplicates while preserving order.\"}],\"temperature\":0.7,\"max_tokens\":256,\"stream\":true}'\n",[426,1545,1546,1559,1569],{"__ignoreMap":39},[1224,1547,1548,1551,1554,1557],{"class":1226,"line":1227},[1224,1549,1550],{"class":1230},"curl",[1224,1552,1553],{"class":1244}," --fail",[1224,1555,1556],{"class":1234}," http:\u002F\u002F127.0.0.1:18982\u002Fv1\u002Fchat\u002Fcompletions",[1224,1558,1312],{"class":1244},[1224,1560,1561,1564,1567],{"class":1226,"line":1241},[1224,1562,1563],{"class":1244},"  -H",[1224,1565,1566],{"class":1234}," 'Content-Type: application\u002Fjson'",[1224,1568,1312],{"class":1244},[1224,1570,1571,1574],{"class":1226,"line":1251},[1224,1572,1573],{"class":1244},"  -d",[1224,1575,1576],{"class":1234}," '{\"model\":\"Qwen3.8-Flash-Next\",\"messages\":[{\"role\":\"user\",\"content\":\"Write a short Python function that removes duplicates while preserving order.\"}],\"temperature\":0.7,\"max_tokens\":256,\"stream\":true}'\n",[10,1578,1579,1580,1585,1586,1589],{},"Gebruik voor dezelfde prestatietaken ",[34,1581,1584],{"href":1582,"rel":1583},"https:\u002F\u002Fgithub.com\u002FGGZ14\u002FBetterBench",[1160],"BetterBench"," ",[14,1587,1588],{},"0.6.0 met het standaardprofiel"," tegen die endpoint, met de uitgebreide prefillmeting uit het releaserapport. Houd de resultaten voor decode- en prefillmodi gescheiden, zoals in de tabellen hierboven.",[77,1591,1593],{"id":1592},"wat-volgt","Wat volgt",[10,1595,1596,1597,29,1600],{},"De openbare roadmap omvat cachelagen in RAM en op SSD en een 4-bit build met hogere precisie. Ook beeldinvoer heeft eigen validatie nodig. Dit zijn ",[14,1598,1599],{},"volgende stappen, geen functies die de twee gevalideerde tekstmodi beloven",[31,1601,1602],{},[34,1603,60],{"href":57,"ariaDescribedBy":1604,"dataFootnoteRef":39,"id":1605},[38],"user-content-fnref-release-12",[10,1607,1608],{},"Voor nu is het resultaat een groter lokaal model met bruikbare generatiesnelheid, een gemeten 200K-optie en duidelijke kwaliteitsgrenzen, op twee workstation-GPU's. Reguliere vLLM, onze plugin, onze kernels.",[77,1610,1612],{"id":1611},"credits-en-licenties","Credits en licenties",[10,1614,1615],{},"Qwen3.8 Flash Next is van het Qwen-team. vLLM levert het serverframework, BetterBench de prestatietaken en Paiton de gekwantiseerde gewichten en native uitvoering in deze release.",[10,1617,1618,1619,1622,1623,1628],{},"Het upstreamcheckpoint gebruikt ",[14,1620,1621],{},"Qwen Community License 1.0, niet Apache-2.0",". Daar horen voorwaarden voor commercieel gebruik bij. Bekijk de ",[34,1624,1627],{"href":1625,"rel":1626},"https:\u002F\u002Fhuggingface.co\u002FQwen\u002FQwen3.8-Flash-Next\u002Fblob\u002Fde4b8e4d43b917e7706784d8bb445c9af86a3540\u002FLICENSE",[1160],"upstreamlicentie op de checkpointrevisie"," vóór inzet. De openbare pluginadapter, modelgewichten, verpakte runtime en propriëtaire compiler zijn afzonderlijke onderdelen met eigen voorwaarden. Dit artikel houdt geen onbeperkt commercieel hergebruik in.",[10,1630,1631,1632,1636,1637,1642,1643,1647],{},"Ontdek ",[34,1633,1635],{"href":1634},"\u002Fnl\u002Fproducts\u002Fpaiton","Paiton",", lees de ",[34,1638,1641],{"href":1639,"rel":1640},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-Flash-Next-W3A8-Paiton-RDNA4\u002Fblob\u002F829b089bf6636af9ffed1f333b103e4e383f7b48\u002FREADME.md",[1160],"modelkaart en evaluatiedetails"," of ",[34,1644,1646],{"href":1645},"\u002Fnl\u002Fcontact","neem contact op"," om een lokale AMD AI-werklast te bespreken.",[1649,1650,1653,1658],"section",{"className":1651,"dataFootnotes":39},[1652],"footnotes",[77,1654,1657],{"className":1655,"id":38},[1656],"sr-only","Footnotes",[1659,1660,1661,1759,1848,1953,1966],"ol",{},[1662,1663,1665,1516,1669,1585,1676,1585,1683,1585,1690,1585,1697,1585,1704,1585,1712,1585,1720,1585,1727,1585,1735,1585,1743,1585,1751],"li",{"id":1664},"user-content-fn-bench",[34,1666,1668],{"href":1158,"rel":1667},[1160],"Release-imagebenchmarks van 10 oktober, vastgelegde checkout",[34,1670,1675],{"href":1671,"ariaLabel":1672,"className":1673,"dataFootnoteBackref":39},"#user-content-fnref-bench","Back to reference 1",[1674],"data-footnote-backref","↩",[34,1677,1675,1681],{"href":1678,"ariaLabel":1679,"className":1680,"dataFootnoteBackref":39},"#user-content-fnref-bench-2","Back to reference 1-2",[1674],[31,1682,60],{},[34,1684,1675,1688],{"href":1685,"ariaLabel":1686,"className":1687,"dataFootnoteBackref":39},"#user-content-fnref-bench-3","Back to reference 1-3",[1674],[31,1689,68],{},[34,1691,1675,1695],{"href":1692,"ariaLabel":1693,"className":1694,"dataFootnoteBackref":39},"#user-content-fnref-bench-4","Back to reference 1-4",[1674],[31,1696,266],{},[34,1698,1675,1702],{"href":1699,"ariaLabel":1700,"className":1701,"dataFootnoteBackref":39},"#user-content-fnref-bench-5","Back to reference 1-5",[1674],[31,1703,1125],{},[34,1705,1675,1709],{"href":1706,"ariaLabel":1707,"className":1708,"dataFootnoteBackref":39},"#user-content-fnref-bench-6","Back to reference 1-6",[1674],[31,1710,1711],{},"6",[34,1713,1675,1717],{"href":1714,"ariaLabel":1715,"className":1716,"dataFootnoteBackref":39},"#user-content-fnref-bench-7","Back to reference 1-7",[1674],[31,1718,1719],{},"7",[34,1721,1675,1725],{"href":1722,"ariaLabel":1723,"className":1724,"dataFootnoteBackref":39},"#user-content-fnref-bench-8","Back to reference 1-8",[1674],[31,1726,274],{},[34,1728,1675,1732],{"href":1729,"ariaLabel":1730,"className":1731,"dataFootnoteBackref":39},"#user-content-fnref-bench-9","Back to reference 1-9",[1674],[31,1733,1734],{},"9",[34,1736,1675,1740],{"href":1737,"ariaLabel":1738,"className":1739,"dataFootnoteBackref":39},"#user-content-fnref-bench-10","Back to reference 1-10",[1674],[31,1741,1742],{},"10",[34,1744,1675,1748],{"href":1745,"ariaLabel":1746,"className":1747,"dataFootnoteBackref":39},"#user-content-fnref-bench-11","Back to reference 1-11",[1674],[31,1749,1750],{},"11",[34,1752,1675,1756],{"href":1753,"ariaLabel":1754,"className":1755,"dataFootnoteBackref":39},"#user-content-fnref-bench-12","Back to reference 1-12",[1674],[31,1757,1758],{},"12",[1662,1760,1762,1516,1766,1585,1771,1585,1778,1585,1785,1585,1792,1585,1799,1585,1806,1585,1813,1585,1820,1585,1827,1585,1834,1585,1841],{"id":1761},"user-content-fn-release",[34,1763,1765],{"href":1412,"rel":1764},[1160],"Modelspecifieke release- en installatiehandleiding, vastgelegde checkout",[34,1767,1675],{"href":1768,"ariaLabel":1769,"className":1770,"dataFootnoteBackref":39},"#user-content-fnref-release","Back to reference 2",[1674],[34,1772,1675,1776],{"href":1773,"ariaLabel":1774,"className":1775,"dataFootnoteBackref":39},"#user-content-fnref-release-2","Back to reference 2-2",[1674],[31,1777,60],{},[34,1779,1675,1783],{"href":1780,"ariaLabel":1781,"className":1782,"dataFootnoteBackref":39},"#user-content-fnref-release-3","Back to reference 2-3",[1674],[31,1784,68],{},[34,1786,1675,1790],{"href":1787,"ariaLabel":1788,"className":1789,"dataFootnoteBackref":39},"#user-content-fnref-release-4","Back to reference 2-4",[1674],[31,1791,266],{},[34,1793,1675,1797],{"href":1794,"ariaLabel":1795,"className":1796,"dataFootnoteBackref":39},"#user-content-fnref-release-5","Back to reference 2-5",[1674],[31,1798,1125],{},[34,1800,1675,1804],{"href":1801,"ariaLabel":1802,"className":1803,"dataFootnoteBackref":39},"#user-content-fnref-release-6","Back to reference 2-6",[1674],[31,1805,1711],{},[34,1807,1675,1811],{"href":1808,"ariaLabel":1809,"className":1810,"dataFootnoteBackref":39},"#user-content-fnref-release-7","Back to reference 2-7",[1674],[31,1812,1719],{},[34,1814,1675,1818],{"href":1815,"ariaLabel":1816,"className":1817,"dataFootnoteBackref":39},"#user-content-fnref-release-8","Back to reference 2-8",[1674],[31,1819,274],{},[34,1821,1675,1825],{"href":1822,"ariaLabel":1823,"className":1824,"dataFootnoteBackref":39},"#user-content-fnref-release-9","Back to reference 2-9",[1674],[31,1826,1734],{},[34,1828,1675,1832],{"href":1829,"ariaLabel":1830,"className":1831,"dataFootnoteBackref":39},"#user-content-fnref-release-10","Back to reference 2-10",[1674],[31,1833,1742],{},[34,1835,1675,1839],{"href":1836,"ariaLabel":1837,"className":1838,"dataFootnoteBackref":39},"#user-content-fnref-release-11","Back to reference 2-11",[1674],[31,1840,1750],{},[34,1842,1675,1846],{"href":1843,"ariaLabel":1844,"className":1845,"dataFootnoteBackref":39},"#user-content-fnref-release-12","Back to reference 2-12",[1674],[31,1847,1758],{},[1662,1849,1851,1516,1855,1585,1860,1585,1867,1585,1874,1585,1881,1585,1888,1585,1895,1585,1902,1585,1909,1585,1916,1585,1923,1585,1930,1585,1937,1585,1945],{"id":1850},"user-content-fn-model",[34,1852,1854],{"href":1639,"rel":1853},[1160],"Qwen3.8 Flash Next W3A8-modelkaart, vastgelegde revisie",[34,1856,1675],{"href":1857,"ariaLabel":1858,"className":1859,"dataFootnoteBackref":39},"#user-content-fnref-model","Back to reference 3",[1674],[34,1861,1675,1865],{"href":1862,"ariaLabel":1863,"className":1864,"dataFootnoteBackref":39},"#user-content-fnref-model-2","Back to reference 3-2",[1674],[31,1866,60],{},[34,1868,1675,1872],{"href":1869,"ariaLabel":1870,"className":1871,"dataFootnoteBackref":39},"#user-content-fnref-model-3","Back to reference 3-3",[1674],[31,1873,68],{},[34,1875,1675,1879],{"href":1876,"ariaLabel":1877,"className":1878,"dataFootnoteBackref":39},"#user-content-fnref-model-4","Back to reference 3-4",[1674],[31,1880,266],{},[34,1882,1675,1886],{"href":1883,"ariaLabel":1884,"className":1885,"dataFootnoteBackref":39},"#user-content-fnref-model-5","Back to reference 3-5",[1674],[31,1887,1125],{},[34,1889,1675,1893],{"href":1890,"ariaLabel":1891,"className":1892,"dataFootnoteBackref":39},"#user-content-fnref-model-6","Back to reference 3-6",[1674],[31,1894,1711],{},[34,1896,1675,1900],{"href":1897,"ariaLabel":1898,"className":1899,"dataFootnoteBackref":39},"#user-content-fnref-model-7","Back to reference 3-7",[1674],[31,1901,1719],{},[34,1903,1675,1907],{"href":1904,"ariaLabel":1905,"className":1906,"dataFootnoteBackref":39},"#user-content-fnref-model-8","Back to reference 3-8",[1674],[31,1908,274],{},[34,1910,1675,1914],{"href":1911,"ariaLabel":1912,"className":1913,"dataFootnoteBackref":39},"#user-content-fnref-model-9","Back to reference 3-9",[1674],[31,1915,1734],{},[34,1917,1675,1921],{"href":1918,"ariaLabel":1919,"className":1920,"dataFootnoteBackref":39},"#user-content-fnref-model-10","Back to reference 3-10",[1674],[31,1922,1742],{},[34,1924,1675,1928],{"href":1925,"ariaLabel":1926,"className":1927,"dataFootnoteBackref":39},"#user-content-fnref-model-11","Back to reference 3-11",[1674],[31,1929,1750],{},[34,1931,1675,1935],{"href":1932,"ariaLabel":1933,"className":1934,"dataFootnoteBackref":39},"#user-content-fnref-model-12","Back to reference 3-12",[1674],[31,1936,1758],{},[34,1938,1675,1942],{"href":1939,"ariaLabel":1940,"className":1941,"dataFootnoteBackref":39},"#user-content-fnref-model-13","Back to reference 3-13",[1674],[31,1943,1944],{},"13",[34,1946,1675,1950],{"href":1947,"ariaLabel":1948,"className":1949,"dataFootnoteBackref":39},"#user-content-fnref-model-14","Back to reference 3-14",[1674],[31,1951,1952],{},"14",[1662,1954,1956,1516,1961],{"id":1955},"user-content-fn-quality",[34,1957,1960],{"href":1958,"rel":1959},"https:\u002F\u002Fhuggingface.co\u002FEliovpAI\u002FQwen3.8-Flash-Next-W3A8-Paiton-RDNA4\u002Fblob\u002F829b089bf6636af9ffed1f333b103e4e383f7b48\u002FQUALITY.md",[1160],"Openbaar kwaliteitsrapport, vastgelegde modelrevisie",[34,1962,1675],{"href":1963,"ariaLabel":1964,"className":1965,"dataFootnoteBackref":39},"#user-content-fnref-quality","Back to reference 4",[1674],[1662,1967,1969,1516,1974],{"id":1968},"user-content-fn-betterbench",[34,1970,1973],{"href":1971,"rel":1972},"https:\u002F\u002Fgithub.com\u002FGGZ14\u002FBetterBench\u002Fblob\u002Fd00ad5ec8098c06584a88ec3468bacd37d5ed098\u002Fconfig\u002Fdefault.json",[1160],"BetterBench 0.6.0-taakgewichten, vastgelegde standaardinstellingen",[34,1975,1675],{"href":1976,"ariaLabel":1977,"className":1978,"dataFootnoteBackref":39},"#user-content-fnref-betterbench","Back to reference 5",[1674],[1980,1981,1982],"style",{},"html pre.shiki code .sScJk, html code.shiki .sScJk{--shiki-default:#6F42C1;--shiki-dark:#B392F0}html pre.shiki code .sZZnC, html code.shiki .sZZnC{--shiki-default:#032F62;--shiki-dark:#9ECBFF}html pre.shiki code .sj4cs, html code.shiki .sj4cs{--shiki-default:#005CC5;--shiki-dark:#79B8FF}html pre.shiki code .szBVR, html code.shiki .szBVR{--shiki-default:#D73A49;--shiki-dark:#F97583}html pre.shiki code .sVt8B, html code.shiki .sVt8B{--shiki-default:#24292E;--shiki-dark:#E1E4E8}html .default .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .shiki span {color: var(--shiki-default);background: var(--shiki-default-bg);font-style: var(--shiki-default-font-style);font-weight: var(--shiki-default-font-weight);text-decoration: var(--shiki-default-text-decoration);}html .dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html.dark .shiki span {color: var(--shiki-dark);background: var(--shiki-dark-bg);font-style: var(--shiki-dark-font-style);font-weight: var(--shiki-dark-font-weight);text-decoration: var(--shiki-dark-text-decoration);}html pre.shiki code .sJ8bj, html code.shiki .sJ8bj{--shiki-default:#6A737D;--shiki-dark:#6A737D}",{"title":39,"searchDepth":1241,"depth":1241,"links":1984},[1985,1988,1991,1992,1995,1998,2001,2002,2003,2004,2005],{"id":79,"depth":1241,"text":80,"children":1986},[1987],{"id":224,"depth":1251,"text":225},{"id":293,"depth":1241,"text":294,"children":1989},[1990],{"id":402,"depth":1251,"text":403},{"id":481,"depth":1241,"text":482},{"id":558,"depth":1241,"text":559,"children":1993},[1994],{"id":622,"depth":1251,"text":623},{"id":674,"depth":1241,"text":675,"children":1996},[1997],{"id":782,"depth":1251,"text":783},{"id":959,"depth":1241,"text":960,"children":1999},[2000],{"id":981,"depth":1251,"text":982},{"id":1084,"depth":1241,"text":1085},{"id":1165,"depth":1241,"text":1166},{"id":1592,"depth":1241,"text":1593},{"id":1611,"depth":1241,"text":1612},{"id":38,"depth":1241,"text":1657},[1635,2007,2008,2009,2010],"AMD Radeon","Lokale AI","Qwen","Kwantisatie","2026-10-10T10:30:00Z","Paiton draait Qwen3.8 Flash Next met 3-bit experts op twee R9700-kaarten: 216,3 tokens\u002Fs, 565,1 tokens\u002Fs samen en een aparte 200K-modus. Metingen, kwaliteit en installatie.","md","Een groter model. Twee kaarten. 216 tokens per seconde.","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-flash-next\u002Fhero-nl.webp",{},"https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-flash-next-radeon-ai-pro-r9700","\u002Fblog\u002Fpaiton-qwen38-flash-next-radeon-ai-pro-r9700",{"title":5,"description":2012},"paiton-qwen38-flash-next-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-flash-next\u002Fsocial-nl.webp","blog\u002Fpaiton-qwen38-flash-next-radeon-ai-pro-r9700",null,"N-YTCkqlNwiPli2a0S0T9SFb28ZC-S7lXkSBQpCY6RY",[2026,2028,2037,2047,2060,2070,2082,2092,2105,2114,2128,2160,2172,2194,2212,2231,2250,2268,2285,2297,2313,2328,2340,2349,2357,2372,2384,2395,2406,2416,2429,2439,2452,2463,2473,2484,2493,2505,2516,2525],{"path":2018,"title":5,"description":2012,"date":2011,"slug":2020,"image":2015,"originalUrl":2017,"categories":2027},[1635,2007,2008,2009,2010],{"path":2029,"title":2030,"description":2031,"date":2032,"slug":2033,"image":2034,"originalUrl":2035,"categories":2036},"\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700","Qwen3.8 27B op 1 × Radeon AI PRO R9700: 3-bit gewichten, 20% snellere decode","Qwen3.8 27B op één R9700: 19,9% snellere gewogen decode, een nieuwe 4-bit cache, 200K-context en optionele beeldinvoer. Metingen en Paiton-installatie.","2026-09-27T09:00:00Z","paiton-qwen38-w3a4-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-w3a4\u002Fhero-nl.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-w3a4-radeon-ai-pro-r9700",[1635,2007,2008,2009,2010],{"path":2038,"title":2039,"description":2040,"date":2041,"slug":2042,"image":2043,"originalUrl":2044,"categories":2045},"\u002Fblog\u002Fpaiton-qwen-image-21-radeon-ai-pro-r9700","Qwen-Image 2.1 op 1 × Radeon AI PRO R9700: 2048×2048-beelden in 103 seconden","Genereer lokaal Qwen-Image 2.1-beelden van 2048×2048 pixels met 1 × Radeon AI PRO R9700. De Paiton v1.0.2-container mat 103,29 seconden per opgewarmd verzoek, inclusief de PNG-respons.","2026-09-23T09:00:00Z","paiton-qwen-image-21-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen-image-21\u002Fhero-nl.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen-image-21-radeon-ai-pro-r9700",[1635,2007,2008,2046,2009],"Beeldgeneratie",{"path":2048,"title":2049,"description":2050,"date":2051,"slug":2052,"image":2053,"originalUrl":2054,"categories":2055},"\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700","Qwen3.8: 400,7 tok\u002Fs op één R9700 | Paiton","Qwen3.8 op één R9700: 400,7 tok\u002Fs met ROCm 10 en vLLM 0.29, plus publieke 200K\u002F220K-chatprofielen. Benchmarks, beperkingen en startopdrachten.","2026-09-16T07:30:00Z","paiton-qwen38-mxfp4-dflash2-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-qwen38-mxfp4\u002Fupdate-2026-09-19\u002Fhero.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-mxfp4-dflash2-r9700",[1635,2007,2008,2056,2057,2058,2059],"AI-inferentie","Inferentie-optimalisatie","Grote taalmodellen","vLLM",{"path":2061,"title":2062,"description":2063,"date":2064,"slug":2065,"image":2066,"originalUrl":2067,"categories":2068},"\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700","Qwen3.8 GGUF in vLLM: sneller antwoord op één Radeon","Draai de originele NEO CODER MAX GGUF met Paiton in vLLM op een R9700. Bekijk de gemeten responstijden, beeldinvoer en lokale installatie.","2026-09-14T07:30:00Z","paiton-qwen38-neo-gguf-vllm-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-neo-gguf\u002F00-hero-neo-gguf-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-neo-gguf-vllm-r9700",[1635,2007,2008,2069,2059],"GGUF",{"path":2071,"title":2072,"description":2073,"date":2074,"slug":2075,"image":2076,"originalUrl":2077,"categories":2078},"\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700","MiniMax H3 op Radeon: 15 seconden video met stereogeluid","Paiton genereert lokaal 15 seconden MiniMax H3-video met stereogeluid op één Radeon AI PRO R9700 in 5 min 33 s, met 16,7% minder wachttijd dan stock.","2026-09-09T07:30:00Z","paiton-minimax-h3-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-minimax-h3\u002F00-featured-minimax-h3-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-minimax-h3-radeon-ai-pro-r9700",[1635,2007,2008,2079,2080,2081],"Videogeneratie","MiniMax H3","ComfyUI",{"path":2083,"title":2084,"description":2085,"date":2086,"slug":2087,"image":2088,"originalUrl":2089,"categories":2090},"\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700","Lokale FLUX.2 klein op Radeon AI PRO R9700: sneller beelden genereren met minder VRAM","Paiton genereert FLUX.2 klein-beelden van 1024 × 1024 in 1,054 seconden op een R9700, met 16,2% minder generatietijd en 33,4% minder piekallocatie in Torch.","2026-09-07T09:00:00","paiton-flux2-klein-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-flux2-klein\u002Ffox-paiton.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-flux2-klein-radeon-ai-pro-r9700",[1635,2007,2008,2046,2091,2081],"FLUX",{"path":2093,"title":2094,"description":2095,"date":2096,"slug":2097,"image":2098,"originalUrl":2099,"categories":2100},"\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700","Ornith 1.5 haalt 44,6 tok\u002Fs op één Radeon AI PRO R9700","Paiton draait Ornith 1.5 35B A3B op één Radeon AI PRO R9700 met 44,63 outputtokens per seconde, 27% sneller en met 21,3% lagere gemodelleerde kosten.","2026-09-05T09:00:00","paiton-ornith15-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-ornith15\u002F00-featured-ornith15-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-ornith15-radeon-ai-pro-r9700",[1635,2101,2007,2056,2102,2103,2057,2058,2059,2104],"Kunstmatige intelligentie","GPU-prestaties","Inferentielatentie","Kostenefficiëntie",{"path":2106,"title":2107,"description":2108,"date":2109,"slug":2110,"image":2111,"originalUrl":2112,"categories":2113},"\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700","Paiton: 21% meer Qwen3.8-doorvoer op Radeon AI PRO R9700","Paiton draait AMD's Qwen3.8 27B op één Radeon AI PRO R9700 met 39,77 outputtokens per seconde. Dat levert 21% meer throughput en 17,4% lagere gemodelleerde kosten op.","2026-09-04T09:00:00","paiton-qwen38-radeon-ai-pro-r9700","\u002Fasset\u002Fimages\u002Fblog\u002Fpaiton-r9700\u002F00-featured-paiton-r9700.webp","https:\u002F\u002Feliovp.com\u002Fblog\u002Fpaiton-qwen38-radeon-ai-pro-r9700",[1635,2101,2007,2056,2102,2103,2057,2058,2059,2104],{"path":2115,"title":2116,"description":2117,"date":2118,"slug":2119,"image":2120,"originalUrl":2023,"categories":2121},"\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt","Stroomvereisten voor AI-datacenters: de GPU-per-MW-illusie","Waarom verschillen GPU-aantallen per megawatt? Lees hoe PUE, piekbelasting, opslag, netwerken en koeling de inzetbare AI-capaciteit bepalen.","2026-07-27T23:52:00","ai-data-center-power-requirements-gpu-per-megawatt","\u002Fasset\u002Fimages\u002Fblog\u002Fai-data-center-power-requirements-gpu-per-megawatt\u002Fgpu-per-megawatt-illusion.webp",[2122,2123,2124,2125,2126,2127],"Alle","AI-infrastructuur","Datacenters","ModFlex","HPC","AMD Helios",{"path":2129,"title":2130,"description":2131,"date":2132,"slug":2133,"image":2134,"originalUrl":2135,"categories":2136},"\u002Fblog\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","Wan2.2-videogeneratie: Paiton op AMD MI355X","Vergelijk Wan2.2-videogeneratie op AMD MI355X met Paiton en NVIDIA B200 via Diffusers. Lees hoe we diffusiemodellen optimaliseren.","2026-06-10T14:04:04","paiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonwan2.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-returns-to-its-diffusion-roots-optimizing-wan2-2-t2v-a14b-on-amd-mi355x\u002F",[2122,2101,1635,2137,2138,2139,2140,2141,2142,2143,2144,2145,2146,2147,2148,2149,2150,2151,2152,2153,1635,2154,2155,2156,2157,2158,2159],"14B","AMD","B200","Benchmarks","Blackwell","Compute","Diffusie","Eliovp","Generatieve AI","GPU","Hardware","Inferentie","Instinct","MI355x","NVIDIA","On-premises","Optimalisatie","Soevereine AI","T2V","Tekst-naar-video","Tuning","Video-generatie","Wan2.2",{"path":2161,"title":2162,"description":2163,"date":2164,"slug":2165,"image":2166,"originalUrl":2167,"categories":2168},"\u002Fblog\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","ElioVP in De Tijd: chipoptimalisatie en datacenters","Lees hoe De Tijd ElioVP belicht, van de oorsprong in chipoptimalisatie tot het werk aan modulaire datacenters en koeling voor hoge vermogensdichtheid.","2026-02-10T20:48:12","from-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fphysicalnewspaper.webp","https:\u002F\u002Feliovp.com\u002Ffrom-the-attic-to-the-front-page-eliovp-recognized-as-a-pioneer-in-chip-optimization-data-center-infrastructure\u002F",[2122,2101,2169,2170,2138,2171,2169,2151],"Modulaire DC","Niet gecategoriseerd","De Tijd",{"path":2173,"title":2174,"description":2175,"date":2176,"slug":2177,"image":2178,"originalUrl":2179,"categories":2180},"\u002Fblog\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","AI en privacy: een strategische prioriteit in de Benelux","Privacyrisico's van generatieve AI, vertrouwen, dataopslag en governance. Waarom bedrijven in de Benelux veilige AI strategisch moeten benaderen.","2026-01-29T13:51:11","privacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fheaderimage.webp","https:\u002F\u002Feliovp.com\u002Fprivacy-is-geen-it-probleem-meer-het-is-een-strategische-prioriteit\u002F",[2122,2101,2181,2170,2182,2183,2184,2185,2186,2187,2188,2189,2144,2190,2145,2191,2192,2193],"Trending","AI Act","Antropomorfisme","AVG","Benelux","ChatGPT","Cyberbeveiliging","Databeheer","Gegevensbeveiliging","GDPR","Microsoft Copilot","Privacy","Shadow AI",{"path":2195,"title":2196,"description":2197,"date":2198,"slug":2199,"image":2200,"originalUrl":2201,"categories":2202},"\u002Fblog\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","Waarom wij itsme niet gebruiken: privacy en soevereiniteit","Waarom ElioVP itsme niet gebruikt: onze afwegingen rond identiteitsmetadata, cloudafhankelijkheid, privacy en datasoevereiniteit.","2025-11-27T09:32:14","itsme-bij-ons-is-het-its-not-me-en-dit-is-waarom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontimage.webp","https:\u002F\u002Feliovp.com\u002Fitsme-bij-ons-is-het-its-not-me-en-dit-is-waarom\u002F",[2122,2203,2204,2205,2187,2206,2207,2208,2190,2209,2210,2211,2192],"AWS","Belgian Mobile ID","CLOUD Act","Datasoevereiniteit","Digitale identiteit","eIDAS","itsme","Liberty Global","MyGov.be",{"path":2213,"title":2214,"description":2215,"date":2216,"slug":2217,"image":2218,"originalUrl":2219,"categories":2220},"\u002Fblog\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025","Praktijkrapport: de realiteit van Agentic AI bouwen in 2025","Praktijklessen over lokale AI-agents in 2025 gaan in op workflowontwerp, observability, modeltraining, hallucinaties en GPU-geheugenlimieten.","2025-11-25T14:03:39","field-report-the-reality-of-building-agentic-ai-in-2025","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffieldreport.webp","https:\u002F\u002Feliovp.com\u002Ffield-report-the-reality-of-building-agentic-ai-in-2025\u002F",[2122,2101,2221,2181,2222,2223,2224,2225,2226,2227,2228,2229,2154,2230],"Oplossingen","Agentic AI","AI-techniek","AI-strategie","Autonome agenten","Bedrijfs-AI","Lokale LLM","Modelverfijning","AI op locatie","VRAM-optimalisatie",{"path":2232,"title":2233,"description":2234,"date":2235,"slug":2236,"image":2237,"originalUrl":2238,"categories":2239},"\u002Fblog\u002Fthe-synthetic-unicorn-bubble","De synthetische unicornzeepbel","Een analyse van investeringsrisico’s bij AI-neoclouds: circulaire financiering, infrastructuurclaims, contractvoorwaarden en due diligence.","2025-11-24T19:22:28","the-synthetic-unicorn-bubble","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsyntheticunicorn.webp","https:\u002F\u002Feliovp.com\u002Fthe-synthetic-unicorn-bubble\u002F",[2122,2101,2181,2240,2241,2242,2243,2244,2245,2246,2247,2248,2249],"AI Infrastructure","AI Neocloud","Circulaire financiering","GPU Cloud","Beleggingsrisico's","Opstartwaardering","Synthetische bubbel","Technische analyse","Vaporware","Durfkapitaal",{"path":2251,"title":2252,"description":2253,"date":2254,"slug":2255,"image":2256,"originalUrl":2257,"categories":2258},"\u002Fblog\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","NVIDIA GB300 NVL72: modulair datacenter in vier maanden","Ontdek een modulair datacenterontwerp voor NVIDIA GB300 NVL72, met redundante voeding, hybride koeling en een bouwplanning van vier maanden.","2025-11-20T14:10:19","building-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fsuperpodmodflexfrontimage.webp","https:\u002F\u002Feliovp.com\u002Fbuilding-the-engine-for-the-ai-race-the-4-month-path-to-nvidia-gb300-nvl72-power\u002F",[2122,2169,2170,2259,2123,2260,2261,2262,2263,2264,2265,2266,2267],"150 kW-rack","DLC","Hoge dichtheid","Vloeistofkoeling","Modulair datacenter","NVIDIA Blackwell Ultra","NVIDIA GB300","NVL72","Snelle implementatie",{"path":2269,"title":2270,"description":2271,"date":2272,"slug":2273,"image":2274,"originalUrl":2275,"categories":2276},"\u002Fblog\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential","CUDA-vertaling versus AMD-gerichte optimalisatie","Waarom CUDA-compatibiliteit niet hetzelfde is als AMD-prestaties: over ROCm, HIP, kerneloptimalisatie en hardwaregerichte afstemming.","2025-11-12T14:48:37","why-cuda-translation-wont-unlock-amds-real-potential","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fchatgpt-image-nov-11-2025-09_16_10-pm-1.webp","https:\u002F\u002Feliovp.com\u002Fwhy-cuda-translation-wont-unlock-amds-real-potential\u002F",[2122,2101,1635,2170,2277,2101,2278,2279,2280,2281,2282,2283,1635,2284],"AMD MI300X","CUDA-vertaling","FP8","GPU-optimalisatie","High-performance computing","HIP","Kerneltuning","ROCm",{"path":2286,"title":2287,"description":2288,"date":2289,"slug":2290,"image":2291,"originalUrl":2292,"categories":2293},"\u002Fblog\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference","Paiton: snellere AI-inferentie in uw bestaande stack","Lees hoe Paiton aansluit op bestaande inferentiestacks, met AMD MI300X-benchmarks en vergelijkingen van prestaties per dollar.","2025-11-11T10:31:22","paiton-the-simplest-way-to-supercharge-ai-inference","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton-powaaah.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-the-simplest-way-to-supercharge-ai-inference\u002F",[2122,2101,1635,2056,2294,2277,2104,2295,2057,2283,1635,2296,2059],"AMD Instinct","Hoge throughput","SGLang",{"path":2298,"title":2299,"description":2300,"date":2301,"slug":2302,"image":2303,"originalUrl":2304,"categories":2305},"\u002Fblog\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","Paiton MoE-benchmarks: MI300X versus H200 en B200","Vergelijk Qwen3-30B-A3B MoE-benchmarks van MI300X met Paiton, H200 en B200: throughput en kosten per miljoen tokens.","2025-09-26T13:36:18","stop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhulkvshulkpaitonwins.webp","https:\u002F\u002Feliovp.com\u002Fstop-overpaying-paiton-mi300x-moe-beats-h200-b200-on-1m-tokens\u002F",[2122,2101,1635,2306,2277,2307,2057,2308,2309,2310,2311,1635,2312],"AI-benchmarks","Kosten per token","Mixture of Experts","MoE","NVIDIA B200","NVIDIA H200","Qwen3",{"path":2314,"title":2315,"description":2316,"date":2317,"slug":2318,"image":2319,"originalUrl":2320,"categories":2321},"\u002Fblog\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","Lokale Agentic AI: van inbox naar actie","Lokale AI-agents zetten e-mails, documenten en beelden om in tickets, rapporten en acties, met modellen op maat van uw gegevens en systemen.","2025-09-16T13:09:00","agentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ffrontfotoblog.webp","https:\u002F\u002Feliovp.com\u002Fagentic-ai-but-make-it-local-from-inbox-to-insight-to-action-en\u002F",[2122,2101,2221,2170,2222,2322,2323,2324,2325,2227,2229,2154,2326,2327],"Schadedetectie","Documentverwerking","E-mailautomatisering","Factuurextractie","Ticketautomatisering","Workflowautomatisering",{"path":2329,"title":2330,"description":2331,"date":2332,"slug":2333,"image":2334,"originalUrl":2335,"categories":2336},"\u002Fblog\u002Fmi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","MI300X FP8-benchmarks: GPU-partitionering met Paiton","Bekijk hoe Paiton presteert met Llama 3.1 8B FP8 op gepartitioneerde MI300X-GPU's, vergeleken met NVIDIA H200 en B200.","2025-07-31T13:32:57","mi300x-fp8-data-parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fimage-2-1.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-fp8-data%e2%80%91parallel-benchmarks-8-64-gpus-h200-left-behind-b200-within-reach\u002F",[2122,2101,1635,2170,2337,2138,2139,2338,2339,2150,2151,1635,2059],"AI","H200","MI300X",{"path":2341,"title":2342,"description":2343,"date":2344,"slug":2345,"image":2346,"originalUrl":2347,"categories":2348},"\u002Fblog\u002Fapplicable-ai-for-businesses","Toepasbare AI voor bedrijven","Ontdek hoe ElioVP lokale AI voor bedrijfsprocessen bouwt, met modeltraining op maat en automatische schadedetectie voor de logistiek.","2025-07-09T21:35:30","applicable-ai-for-businesses","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fscherm_afbeelding-2025-07-09-om-23.30.17.webp","https:\u002F\u002Feliovp.com\u002Fapplicable-ai-for-businesses\u002F",[2122,2101,2221,2222,2322,2323,2324,2325,2227,2229,2154,2326,2327],{"path":2350,"title":2351,"description":2352,"date":2353,"slug":2354,"image":39,"originalUrl":2355,"categories":2356},"\u002Fblog\u002Fintroducing-paitons-free-evaluation-models","Maak kennis met de gratis evaluatiemodellen van Paiton","Test Paiton met gratis evaluatiemodellen voor AMD-GPU's. Vergelijk de prestaties voor tekst, beeldanalyse en beeldgeneratie met uw eigen workloads.","2025-07-07T11:26:13","introducing-paitons-free-evaluation-models","https:\u002F\u002Feliovp.com\u002Fintroducing-paitons-free-evaluation-models\u002F",[2122,2101,1635],{"path":2358,"title":2359,"description":2360,"date":2361,"slug":2362,"image":2363,"originalUrl":2364,"categories":2365},"\u002Fblog\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","Llama 3.1 405B: sneller starten met Paiton op MI300X","Bekijk Paiton-benchmarks voor Llama 3.1 405B op acht AMD MI300X-GPU's, met opstarttijd, tensorparallelisme, throughput en latency.","2025-06-12T20:15:23","paiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fservingscreenshot.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-dramatically-faster-startup-and-performance-for-llama-3-1-405b\u002F",[2122,2101,1635,2170,2056,2277,2366,2279,2367,2368,2369,1635,2370,2371],"Koude start","Grafiekcompilatie","Llama 3.1 405B","LLM-optimalisatie","Opstartlatentie","Tensor-parallellisme",{"path":2373,"title":2374,"description":2375,"date":2376,"slug":2377,"image":2378,"originalUrl":2379,"categories":2380},"\u002Fblog\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x","Paiton FP8 verslaat NVIDIA's H200 op AMD's MI300X","Vergelijk Paiton op AMD MI300X met NVIDIA H200 voor Llama 3.1 70B FP8: throughput, wachttijd tot het eerste token en latency bij diverse batchgroottes.","2025-06-08T19:12:40","paiton-fp8-beats-nvidias-h200-on-amds-mi300x","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fblognewfp8.webp","https:\u002F\u002Feliovp.com\u002Fpaiton-fp8-beats-nvidias-h200-on-amds-mi300x\u002F",[2122,2101,1635,2170,2277,2381,2226,2145,2102,2103,2058,2368,2382,2383],"Koude startoptimalisatie","Model serving","vLLM-optimalisatie",{"path":2385,"title":2386,"description":2387,"date":2388,"slug":2389,"image":2390,"originalUrl":2391,"categories":2392},"\u002Fblog\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","MI300X, H200, RX 7900 XTX en n300s: vLLM-benchmarks","Vergelijk MI300X, H200, RX 7900 XTX en Tenstorrent n300s met vLLM: throughput, gemodelleerde tokenkosten en hardwarebeperkingen voor Llama 3 8B.","2025-05-09T14:03:58","mi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisontenstor.webp","https:\u002F\u002Feliovp.com\u002Fmi300x-vs-h200-vs-rx-7900-xtx-vs-tenstorrent-n300s-with-vllm\u002F",[2122,2101,1635,2221,2170,2138,2339,2151,2393,2394],"RX7900XTX","tenstorrent",{"path":2396,"title":2397,"description":2398,"date":2399,"slug":2400,"image":2401,"originalUrl":2402,"categories":2403},"\u002Fblog\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","ClusterP&L: financiële modellen voor GPU-clusters","Ontdek hoe ClusterP&L kosten, rendement en investeringsscenario's voor GPU-clusters modelleert, met risicoanalyses en exporteerbare rapporten.","2025-05-03T10:52:22","clusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fcomparisonscenarios.webp","https:\u002F\u002Feliovp.com\u002Fclusterpl-empowering-gpu-cluster-investors-with-real-world-financial-insights\u002F",[2122,2101,2169,2221,2139,2338,2404,2151,2405],"MI325X","P&L-calculator",{"path":2407,"title":2408,"description":2409,"date":2410,"slug":2411,"image":2412,"originalUrl":2413,"categories":2414},"\u002Fblog\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","AMD MI300X versus NVIDIA H200: Qwen3-32B met Paiton","Vergelijk Qwen3-32B-benchmarks op AMD MI300X met Paiton en NVIDIA H200, met resultaten voor throughput, latency en hardwarekosten.","2025-05-02T21:10:30","cranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002F3ac59a73-2466-4422-b7e5-ef2e4a8ca58e.webp","https:\u002F\u002Feliovp.com\u002Fcranking-out-faster-tokens-for-fewer-dollars-amd-mi300x-vs-nvidia-h200\u002F",[2122,2101,1635,2337,2138,2338,2415,2151,1635,2059],"MI300",{"path":2417,"title":2418,"description":2419,"date":2420,"slug":2421,"image":2422,"originalUrl":2423,"categories":2424},"\u002Fblog\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","Modulaire datacenters voor NVIDIA NVL: 1 tot 2 MW","Ontdek modulaire datacenterontwerpen voor NVIDIA NVL-systemen, met aandacht voor vermogen, vloeistofkoeling, redundantie en uitrolplanning.","2025-05-02T14:09:59","power-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Feliovp_critical-1mw-pod_rev-2_transparent.webp","https:\u002F\u002Feliovp.com\u002Fpower-meets-precision-high-density-modular-data-center-for-nvidia-nvl-deployments-1-2-mw\u002F",[2122,2169,2425,2240,2261,2126,2262,2263,2426,2427,2266,2428],"1-2MW datacenter","NVIDIA Blackwell","NVIDIA NVL","Precisiekoeling",{"path":2430,"title":2431,"description":2432,"date":2433,"slug":2434,"image":2435,"originalUrl":2436,"categories":2437},"\u002Fblog\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","AI-agents in de medische wereld: AI die DICOM spreekt","Ontdek een lokale AI-agent die DICOM-gegevens opzoekt en bekijk tests van beeldmodellen met geanonimiseerde medische beelden.","2025-04-11T14:45:48","examining-ai-agents-in-the-medical-field-ai-that-speaks-dicom","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fhealthcareblog-1.webp","https:\u002F\u002Feliovp.com\u002Fexamining-ai-agents-in-the-medical-field-ai-that-speaks-dicom\u002F",[2122,2101,2221,2170,2337,2138,2438],"Zorg",{"path":2440,"title":2441,"description":2442,"date":2443,"slug":2444,"image":2445,"originalUrl":2446,"categories":2447},"\u002Fblog\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","Amerikaanse invoerheffingen en AI-leveringszekerheid in 2025","Lees ElioVP's visie uit april 2025 op Amerikaanse invoerheffingen en leveringszekerheid voor AI-servers, HPC-systemen en modulaire datacenters.","2025-04-04T10:01:27","eliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftariffsshipping.webp","https:\u002F\u002Feliovp.com\u002Feliovp-bv-your-trusted-partner-for-supply-chain-resilience-amidst-new-u-s-tariffs\u002F",[2122,2181,2337,2138,2448,2449,2450,2451],"Invoer","Taiwan","Invoerheffingen","Trump",{"path":2453,"title":2454,"description":2455,"date":2456,"slug":2457,"image":2458,"originalUrl":2459,"categories":2460},"\u002Fblog\u002Fwhy-ai-agents-are-the-future","Waarom AI-agenten de toekomst zijn","Ontdek AI-agents voor ERP, CRM, financiën en klantondersteuning, met praktijkvoorbeelden en een traject van procesanalyse tot pilot en uitrol.","2025-03-23T22:06:59","why-ai-agents-are-the-future","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ferp2.jpeg","https:\u002F\u002Feliovp.com\u002Fwhy-ai-agents-are-the-future\u002F",[2122,2101,2221,2337,2461,2462],"AI-agenten","ERP",{"path":2464,"title":2465,"description":2466,"date":2467,"slug":2468,"image":2469,"originalUrl":2470,"categories":2471},"\u002Fblog\u002Fthe-rise-of-open-source-ai-model-optimization","De opkomst van open-source AI-modeloptimalisatie","Verken trends in opensource-AI-optimalisatie: kwantisatie, mixture-of-experts-modellen, hardwaregerichte afstemming, RAG en edge-AI.","2025-03-22T20:59:23","the-rise-of-open-source-ai-model-optimization","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Friseofopensource.jpeg","https:\u002F\u002Feliovp.com\u002Fthe-rise-of-open-source-ai-model-optimization\u002F",[2122,2101,2181,2472,2138,2146,2151],"AI-nieuws",{"path":2474,"title":2475,"description":2476,"date":2477,"slug":2478,"image":2479,"originalUrl":2480,"categories":2481},"\u002Fblog\u002Fintroducing-our-benchmarking-tool-powered-by-dstack","Maak kennis met onze benchmarktool, gebouwd op dstack","Ontdek onze benchmarktool met dstack: herhaalbare vLLM-tests, automatische parameterreeksen en prestatierapporten voor lokale GPU's en de cloud.","2025-03-20T14:21:59","introducing-our-benchmarking-tool-powered-by-dstack","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fbenchmarktool.jpeg","https:\u002F\u002Feliovp.com\u002Fintroducing-our-benchmarking-tool-powered-by-dstack\u002F",[2122,2101,1635,2337,2138,2482,2483,2339,1635],"benchmark","LLM",{"path":2485,"title":2486,"description":2487,"date":2488,"slug":2489,"image":2490,"originalUrl":2491,"categories":2492},"\u002Fblog\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","QwQ-32B optimaliseren (door Qwen): AMD MI300X versus NVIDIA H200","Vergelijk throughput en latency van QwQ-32B op AMD MI300X met Paiton en NVIDIA H200, bij kleine batches en meer gelijktijdige aanvragen.","2025-03-19T21:41:44","optimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaiton4.jpeg","https:\u002F\u002Feliovp.com\u002Foptimizing-qwq-32b-by-qwen-amd-mi300x-vs-nvidia-h200\u002F",[2122,2101,1635],{"path":2494,"title":2495,"description":2496,"date":2497,"slug":2498,"image":2499,"originalUrl":2500,"categories":2501},"\u002Fblog\u002Feliovp-featured-on-amd-tech-talk-podcast","Eliovp te gast in de AMD Tech Talk-podcast","Beluister Elio Van Puyvelde en Jim Greene in de AMD Tech Talk-podcast over het ontstaan van ElioVP en de hardware- en softwarediensten voor AI.","2025-03-19T07:53:39","eliovp-featured-on-amd-tech-talk-podcast","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Ftechtalkjimgreene.jpeg","https:\u002F\u002Feliovp.com\u002Feliovp-featured-on-amd-tech-talk-podcast\u002F",[2122,2138,2502,2503,2504],"Jim Greene","Podcast","Tech Talk",{"path":2506,"title":2507,"description":2508,"date":2509,"slug":2510,"image":2511,"originalUrl":2512,"categories":2513},"\u002Fblog\u002Ffurther-optimizing-amd-powered-inference-with-paiton","AMD-inferentie verder optimaliseren met Paiton","Bekijk Paiton-benchmarks voor DeepSeek R1 Distill Llama 8B op AMD MI300X, gericht op throughput en latency bij kleinere batchgroottes.","2025-03-13T06:18:30","further-optimizing-amd-powered-inference-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost3.webp","https:\u002F\u002Feliovp.com\u002Ffurther-optimizing-amd-powered-inference-with-paiton\u002F",[2122,2101,1635,2138,2514,2515,2338,2339,2404,1635,2059],"DeepSeek","H100",{"path":2517,"title":2518,"description":2519,"date":2520,"slug":2521,"image":2522,"originalUrl":2523,"categories":2524},"\u002Fblog\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","Paiton-benchmarks: DeepSeek R1 Distill Llama 3.1 8B","Vergelijk standaard- en Paiton-versies van DeepSeek R1 Distill Llama 3.1 8B op AMD MI300X, met benchmarks voor throughput en latency.","2025-01-31T09:11:02","a-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost2.webp","https:\u002F\u002Feliovp.com\u002Fa-first-look-at-paiton-in-action-deepseek-r1-distill-llama-3-1-8b\u002F",[2122,2101,1635,2138,2514,2515,2338,2339,2404,1635,2059],{"path":2526,"title":2527,"description":2528,"date":2529,"slug":2530,"image":2531,"originalUrl":2532,"categories":2533},"\u002Fblog\u002Fai-model-optimization-with-paiton","AI-modeloptimalisatie met Paiton","Lees hoe Paiton modelcompilatie, aangepaste kernels en kernelfusie inzet om AI-inferentie op AMD GPU's te optimaliseren.","2025-01-30T19:53:25","ai-model-optimization-with-paiton","\u002Fasset\u002Fimages\u002Fblog\u002Fimported\u002Fpaitonpost1.webp","https:\u002F\u002Feliovp.com\u002Fai-model-optimization-with-paiton\u002F",[2122,2101,1635,2138,2515,2338,2339,2404,1635,2059],1791631593037]