
Bij AI-infrastructuur is snelheid een essentieel concurrentieel voordeel. Van de trainingssnelheid van modellen tot inferentielatency: elke milliseconde telt. Maar nog vóór de eerste workload draait, bepaalt één cruciale factor vaak het succes of falen: time-to-market.
Traditionele bouwprojecten nemen doorgaans 18 tot 24 maanden in beslag. In de huidige AI-cyclus is dat simpelweg te traag. We hebben onze modulaire aanpak zo verfijnd dat we binnen vier maanden operationeel kunnen zijn, met een gebruiksklare faciliteit die specifiek is ontworpen voor de NVIDIA GB300 NVL72.
De uitdaging: uitzonderlijk krachtige hardware huisvesten
De NVIDIA GB300 NVL72 integreert 72 NVIDIA Blackwell Ultra GPU's en 36 Arm-gebaseerde NVIDIA Grace CPU's in een volledig vloeistofgekoelde, rack-scale architectuur.
Dat verandert de eisen aan datacenterinfrastructuur fundamenteel. We voeden niet zomaar servers, maar een uiterst dense cluster waarin elk rack bij normale belasting ongeveer 120 kW verbruikt en tijdens intensieve workloads mogelijk een piek van 150 kW bereikt.
Architectuuroverzicht: precisie op schaal
Om die densiteit aan te kunnen, gebruikt onze faciliteit een lay-out die is geoptimaliseerd voor de specifieke footprint van de GB300.
Onze faciliteit biedt plaats aan:
- 16 GB300 NVL72-racks van 600 mm voor de primaire compute-infrastructuur
- 12 extra racks van 800 mm, verdeeld als:
- 5 racks voor netwerkinfrastructuur
- 5 racks voor beheer- en opslagsystemen
- 2 racks voor toekomstige uitbreiding
Stroomdistributie: de 4-makes-3-architectuur
De extreme vermogensdichtheid van GB300 NVL72-systemen, 150 kW piek per rack, vereist een energiedistributiestrategie op bedrijfsniveau.
We implementeerden de 4-makes-3-busbarconfiguratie uit het NVIDIA-referentieontwerp. Vier onafhankelijke busbars van 1 MW leveren stroom volgens een redundant $N=3+1$-model.
Deze architectuur levert:
- Volledig gelijktijdig onderhoud: elke busbar kan voor onderhoud offline worden gehaald zonder de dienstverlening te onderbreken.
- Echte redundantie: drie busbars kunnen samen de volledige operationele belasting dragen.
- Totaal vermogensbereik: Ongeveer 2,8 MW (variabel op basis van opslagconfiguratievereisten).
Daarnaast beschikt de GB300 NVL72 over geavanceerde voedingseenheden met energieopslag. Die kunnen de piekvraag op het elektriciteitsnet met maximaal 30% verlagen door vermogenspieken van AI-workloads af te vlakken.
Geavanceerd thermisch beheer: hybride koeling
Direct Liquid Cooling kan tot 80% van de warmte van een SU afvoeren. Voor de resterende warmte zijn andere afvoermethoden nodig. Daarom ontwikkelden we een hybride thermisch systeem dat geoptimaliseerd is voor rekenefficiëntie en modulariteit.
Primaire koelingstrategie
- GB300 NVL72-computerracks:
- 80% thermische belasting beheerd via Direct Liquid Cooling (DLC).
- 20% restwarmte opgevangen via achterdeurwarmtewisselaars (RDHx) of CRAH-units.
- DLC voert warmte rechtstreeks af via cold plates op de warmteproducerende componenten, aangesloten op leidingen met koelvloeistof.
- Hulpinfrastructuur (netwerk/beheer/opslag):
- 100% RDHx-koelingsbasislijn.
- Een vlot migratiepad naar DLC wanneer de thermische vereisten toenemen.
De kritieke lussen
- Secundaire lus (CDU's): in-rack coolant distribution units bewaken continu debiet, temperatuur en drukverschillen en bieden uitgebreide lekdetectie.
- Primaire lus (warmteafvoer): het primaire thermische systeem bestaat uit drie chillers/dry coolers van 1.125 kW in een $N=2+1$-configuratie. Zo vermijden we het waterverbruik van traditionele koelmethoden.
Structureel en milieuontwerp
De kern-IT-omgeving maakt gebruik van open stalen frameconstructiesystemen, waardoor een veilige en gecontroleerde omgeving wordt gecreëerd met:
- Brandbestrijding: systemen op basis van argon, een schoon, niet-geleidend blusmiddel dat zuurstof verdringt.
- Luchtzuivering: HEPA-filtratie met behoud van ISO Klasse 8 cleanroom-normen.
- Toegangscontrole: Biometrische authenticatie en mantrap-configuraties.
Schaalbaarheid: ontworpen voor groei
Een van de meest cruciale voordelen van onze modulaire aanpak is naadloze schaalbaarheid die precies aansluit bij de referentiearchitectuur van NVIDIA. Onze modulaire datacenters kunnen worden ingezet om deze gestandaardiseerde schaalvergrotingen te ondersteunen:
Deploymentconfiguraties:
- 1 SU (16 racks, 1.152 GPU's): basisdeployment van één schaalbare unit
- 2 SU (32 racks, 2.304 GPU's): eerste productieschaal
- 4 SU (64 racks, 4.608 GPU's): cluster op ondernemingsschaal
- 7 SU (112 racks, 8.064 GPU's): grootschalige trainingsfaciliteit
- 8 SU (128 racks, 9.216 GPU's): AI-fabriek met hoge densiteit
- 9 SU (144 racks, 10.368 GPU's): AI-fabriek met hoge densiteit
- 18 SU (288 racks, 20.736 GPU's): grootschalige deployment
- 36 SU (576 racks, 41.472 GPU's): supercomputercluster op frontier-schaal
Conclusie: Engineering voor morgen
De GB300 NVL72 is een rack-scale unit van ongeveer 140 kW en levert 1,1 exaFLOPS aan FP4-rekenkracht. Die compute-densiteit verandert de eisen aan datacenters fundamenteel.
Onze deploymentcyclus van vier maanden brengt geavanceerde thermische engineering, redundante stroomarchitecturen en een doelgericht structureel ontwerp samen. De toekomst van AI-infrastructuur is modulair, redundant en geoptimaliseerd voor extreme densiteit, en kan bovendien binnen zestien weken operationeel zijn.
