Ga naar de hoofdinhoud

Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B

Door: ElioVP
12 juni 2025
Alle
Paiton: veel sneller opstarten en betere prestaties voor Llama-3.1-405B

Met Paiton streven we niet alleen naar maximale inferentiesnelheden. We verbeteren de volledige levenscyclus van de deployment van grote taalmodellen (LLM's). Onze nieuwste test combineert AMD's geavanceerde MI300X-GPU's met het omvangrijke Llama-3.1-405B-Instruct-FP8-KV-model en levert baanbrekende resultaten op:

  1. Direct opstarten: aanzienlijk kortere cold-starttijden voor grootschalige LLM-deployments.
  2. Geavanceerd tensorparallellisme (TP): een veel hogere inferentiedoorvoer en lagere latency dankzij gerichte TP-optimalisaties.

Visuele demonstratie van de opstartsnelheid

In de demonstratie hieronder ziet u hoe Paiton een doorgaans traag opstartproces veel sneller en responsiever maakt. Na het opstarten tonen we ook de eerste inferentierun, zodat u het volledige traject ziet, van de start tot het eerste verzoek.

Paiton op Llama 405B versus Aiter

Benchmarkopstelling en methodologie

Voor transparante en reproduceerbare resultaten documenteren we de volledige benchmarkopstelling:

  • Inferentiebibliotheek: vLLM v0.9.0 met amd/Llama-3.1-405B-Instruct-FP8-KV
  • Hardware: 8 × AMD MI300X GPU's (192 GB totaal HBM3-geheugen)
  • Softwarestack: ROCm 6.3.1 op Ubuntu 22.04 (nog steeds met een oudere driverstack)
  • Batchgrootte: 32, representatief voor realistische, interactieve AI-workloads
  • Metingen: gemiddelden over 10 runs, inclusief opstarttijd, cold-start- en steady-state-TTFT en end-to-end-latency

Belangrijkste resultaat: Paiton levert consistent stabiele en betrouwbare prestaties en voorkomt de schommelingen die bij andere inferentieoplossingen vaak voorkomen.

Het opstarten van een LLM: een cruciaal knelpunt

De deployment van grootschalige LLM's zoals Llama-3.1-405B-Instruct-FP8-KV is een aanzienlijke technische uitdaging. Opstartvertragingen ontstaan vaak door:

  • Modelgewichten laden: enorme hoeveelheden parameters van opslag naar het GPU-geheugen overbrengen.
  • Grafiekcompilatie: modeldefinities op hoog niveau transformeren in geoptimaliseerde uitvoeringsplannen.
  • Eerste warm-up: voorbereidende inferentieruns uitvoeren om de maximale operationele efficiëntie te bereiken.

Deze vertragingen hebben een directe impact op de schaalbaarheid, de productiviteit van ontwikkelaars, de operationele kostenefficiëntie en de eindgebruikerservaring.

Direct starten: het strategische voordeel van Paiton

Paiton maakt op unieke wijze gebruik van AMD's GPU-architectuur in combinatie met eigen optimalisaties om de opstarttijden aanzienlijk te verkorten:

  • Sterk geoptimaliseerd laden van modelgewichten: AMD's ultrasnelle HBM3-geheugen benutten met parallelle gegevensoverdracht.
  • Versnelde grafiekcompilatie: aangepaste routines die wachttijden bij het compileren volledig elimineren.
  • Intelligente warm-up: geavanceerde voorbereidingsstrategieën die onmiddellijk en blijvend snelle responstijden opleveren.

Opstartvergelijking: Llama-3.1-405B-Instruct-FP8-KV

FaseStandaard vLLM (sec)AMD + Paiton (sec)Verbetering
Modelgewichten laden71,2464,289,7% sneller
Geheugenprofilering69,9738,6344,8% sneller
Grafiekcompilatie270,00100% sneller
Eerste warm-up98,3740,5958,7% sneller
Totale opstart266,58143,5046,2% sneller

Impact in de praktijk: een volledig operationeel LLM met 405 miljard parameters is in minder dan 2,4 minuten beschikbaar, aanzienlijk sneller dan met traditionele deploymentmethoden.

Tensorparallellisme in detail: het voordeel van Paiton

Tensorparallellisme is essentieel om multi-GPU-configuraties optimaal te benutten. Voor Paiton hebben we veel geïnvesteerd in sterk geoptimaliseerde kernels en een verbeterde communicatielaag die specifiek is afgestemd op AMD MI300X-GPU's. Onze bedrijfseigen TP-aanpak levert uitzonderlijke prestaties:

  • Sterk geoptimaliseerde kernels: nauwkeurig afgestemd om de rekenefficiëntie van de GPU te maximaliseren en latency binnen een node te verlagen.
  • Geavanceerde communicatielaag: aanzienlijk gestroomlijnde communicatie tussen GPU's, waardoor de overhead drastisch wordt verminderd.
  • Schaalbare architectuur: consistente, voorspelbare schaling, zelfs bij complexe implementaties met meerdere GPU's.

Aanhoudende prestatieverbeteringen met Paiton's TP

MetricGemiddelde PaitonVerbetering ten opzichte van Aiter
Verzoekdoorvoer (req/s)2,35+20,5% sneller
Doorvoer van outputtokens (tok/s)462,52+13,4% sneller
Totale tokendoorvoer (tok/s)1009,91+17,3% sneller
Gemiddelde TTFT (ms)2581,9442,8% sneller
Gemiddelde E2EL (ms)11051.5324,3% sneller
Gemiddelde ITL (ms)43,2810,6% sneller

De combinatie van een snelle deployment en sterke runtimeprestaties maakt Paiton bijzonder geschikt voor enterprise-AI op AMD-infrastructuur.

De toekomst van LLM-implementatie vormgeven

Onze doorbraken met Llama-3.1-405B-Instruct-FP8-KV zorgen voor meer flexibiliteit, efficiëntie en schaalbaarheid bij de deployment van grootschalige AI-workloads.

Transparantie: onze toewijding aan authenticiteit

Bij Paiton zijn we trots op echte, meetbare resultaten. Onze reis is uniek:

  • Lean en onafhankelijk: slechts 3 ingenieurs, geheel zelf gefinancierd, zonder externe investeringen of ondersteuning.
  • Zelfredzaamheid: geen financiële, technische of promotionele hulp van AMD of andere externe entiteiten; volledig zelfgefinancierde investering in onze MI300X-hardware.
  • Bewezen expertise: we leverden eerder meer dan 250.000 GPU's, duizenden AMD EPYC-CPU's en talloze AI-servers en brachten wereldwijd grootschalige AI-clusters in bedrijf.
  • Originele innovatie: In tegenstelling tot veel startups die gebruik maken van open-sourcesoftware of oppervlakkige wrappers, bouwen wij alles, inclusief diepgaande kerneloptimalisaties, vanaf nul.
  • Rechtstreekse boodschap aan AMD: hoewel AMD's Aiter-bibliotheek veel waardering verdient, behaalt ons compacte team consistent betere prestaties. Daarmee tonen we een efficiëntie en innovatiekracht die zelfs grotere, gefinancierde teams niet evenaren.
  • Resultaten boven hype: we schreeuwen nooit voordat we leveren. In tegenstelling tot anderen die miljoenen aan financiering veiligstellen met beperkte tastbare resultaten, bereiken wij eerst baanbrekende resultaten en laten we die resultaten voor zichzelf spreken.

Laten we samen opnieuw definiëren wat haalbaar is met de allernieuwste AI-technologie en AMD-hardware.