Private AI Cluster
Plusieurs noeuds GPU, stockage partage et une fabric haut debit. Prix par noeud - prevoir trois noeuds ou plus.
Environ ~160 Md de paramètres en fp16, ~320 Md en 8-bit, ou ~590 Md en quantization 4-bit.
- GPU8× NVIDIA RTX 6000 Adamemory: 48 GB GDDR6 ECC · bandwidth: 960 GB/s · interface: PCIe 4.0 x16$54,400Voir le prix ↗
- CPUAMD EPYC 9354cores: 32 · threads: 64 · clock: 3.8 GHz boost$3,200Voir le prix ↗
- Carte mèreSupermicro H13SSL-N (SP5, EPYC 9004)chipset: SoC · memory: 12 x DDR5 RDIMM ECC, up to 3 TB · pcie: 8 x PCIe 5.0 x16 (slots + MCIO fan-out)$850Voir le prix ↗
- RAMSamsung 512 GB (8x64) DDR5-4800 ECC RDIMMcapacity: 512 GB (8 x 64) · type: DDR5-4800 RDIMM · ecc: ECC$2,550Voir le prix ↗
- StockageKioxia CD8-R 3.84 TB U.2 NVMecapacity: 3.84 TB · bus: PCIe 4.0 U.2 · read: 7000 MB/s$620Voir le prix ↗Sabrent Rocket 4 Plus 8 TB NVMecapacity: 8 TB · bus: PCIe 4.0 NVMe · read: 7100 MB/s$700Voir le prix ↗
- AlimentationFSP CRPS 2+2 redundant, 4000 W usablecapacity: 4000 W usable (2+2 hot-swap) · rating: 80+ Platinum · standard: CRPS redundant$1,400Voir le prix ↗
- RefroidissementGeneric 4U high-static-pressure fan wall + shroudstype: rack forced-air · dissipation: chassis-wide · noise: loud (data-center)$220Voir le prix ↗
- RéseauNVIDIA ConnectX-6 Dx 100GbEspeed: 100 GbE · ports: 2 (QSFP56) · bus: PCIe 4.0 x16$650Voir le prix ↗MikroTik CRS309 8x 10GbE SFP+ switchports: 8 x SFP+ 10 GbE + 1 GbE · throughput: non-blocking · form factor: desktop / 1U$280Voir le prix ↗
- OnduleurEaton 9PX 3000 RT (online double-conversion, 2U)capacity: 3000 VA / 2700 W · topology: online double-conversion · runtime: ~7 min at full load$1,600Voir le prix ↗
- ChassisSupermicro 4U 8-GPU server chassis (CRPS, fan wall)form factor: 4U rack · gpu slots: 8 dual-slot passive · power: 2+2 CRPS redundant$3,200Voir le prix ↗
Les prix composants sont sourcés à la main et datés (vérifiés le 2026-09-16), pas scrapés. Confirme sur le site du vendeur avant d'acheter.
- · Un noeud = 8 RTX 6000 Ada, 384 Go de VRAM. Les chiffres affiches ici sont pour un seul noeud ; un cluster, c'est trois ou plus.
- · La fabric 100 GbE (RoCEv2) porte le trafic tensor- et pipeline-parallel entre noeuds et le NVMe-over-fabric vers le stockage partage - la partie qui en fait un cluster et non une salle de serveurs.
- · Le stockage partage vit sur un noeud separe (non chiffre ici) : chaque noeud GPU monte le meme dataset et le meme depot de modeles.
- · A cette echelle, la colocation bat generalement l'on-prem : power au compteur, climatisation et remote hands coutent moins que de tout construire soi-meme.
- · La gestion de cluster (Slurm ou Kubernetes + un scheduler) est supposee - le materiel est la moitie facile.
- + Scale horizontalement - on ajoute des noeuds, pas des refontes
- + 384 Go de VRAM par noeud, depot de modeles partage
- + Fabric prete pour l'entrainement multi-noeuds
- − Prix par noeud seulement - stockage partage, switch fabric et colocation en plus
- − Demande une equipe ops : scheduling, monitoring, failover
- − GPU PCIe, pas SXM - le pretraining a l'echelle frontiere veut un cluster H100/B200
Noeuds A6000 : memes 384 Go par noeud a environ 60 % du cout GPU.
Les noeuds L40S troquent un peu de debit contre des pieces standard datacenter et du support.
Pour de l'entrainement frontiere, louer un pod H100/B200 - voir GPU cloud pricing.
Sur 36 mois, à la conso de cette config et au tarif cloud live de son GPU.
- Matériel
- $69,670
- Électricité
- $6,606
- Coût total de possession
- $76,276
- Équivalent cloud, mensuel
- $2,698/mo
- Équivalent cloud, total
- $97,131
- Seuil de rentabilité
- 28 mois
- · Les besoins de haute disponibilité gardent en général une capacité cloud en réserve même quand posséder a du sens - l'hybride couvre les deux.
- · Sur 36 mois, posséder économise environ 20855 $ par rapport à l'équivalent cloud.
Les liens « Acheter sur Amazon » sont affiliés - en tant que Partenaire Amazon, Obolith touche une commission sur les achats éligibles.