Private AI Cluster
Varios nodos GPU, almacenamiento compartido y una fabric de alta velocidad. Precio por nodo: prevé tres nodos o más.
Aproximadamente ~160B de parámetros en fp16, ~320B en 8 bits o ~590B en cuantización de 4 bits.
- GPU8× NVIDIA RTX 6000 Adamemory: 48 GB GDDR6 ECC · bandwidth: 960 GB/s · interface: PCIe 4.0 x16$54,400Ver precio ↗
- CPUAMD EPYC 9354cores: 32 · threads: 64 · clock: 3.8 GHz boost$3,200Ver precio ↗
- Placa baseSupermicro H13SSL-N (SP5, EPYC 9004)chipset: SoC · memory: 12 x DDR5 RDIMM ECC, up to 3 TB · pcie: 8 x PCIe 5.0 x16 (slots + MCIO fan-out)$850Ver precio ↗
- RAMSamsung 512 GB (8x64) DDR5-4800 ECC RDIMMcapacity: 512 GB (8 x 64) · type: DDR5-4800 RDIMM · ecc: ECC$2,550Ver precio ↗
- AlmacenamientoKioxia CD8-R 3.84 TB U.2 NVMecapacity: 3.84 TB · bus: PCIe 4.0 U.2 · read: 7000 MB/s$620Ver precio ↗Sabrent Rocket 4 Plus 8 TB NVMecapacity: 8 TB · bus: PCIe 4.0 NVMe · read: 7100 MB/s$700Ver precio ↗
- FuenteFSP CRPS 2+2 redundant, 4000 W usablecapacity: 4000 W usable (2+2 hot-swap) · rating: 80+ Platinum · standard: CRPS redundant$1,400Ver precio ↗
- RefrigeraciónGeneric 4U high-static-pressure fan wall + shroudstype: rack forced-air · dissipation: chassis-wide · noise: loud (data-center)$220Ver precio ↗
- RedNVIDIA ConnectX-6 Dx 100GbEspeed: 100 GbE · ports: 2 (QSFP56) · bus: PCIe 4.0 x16$650Ver precio ↗MikroTik CRS309 8x 10GbE SFP+ switchports: 8 x SFP+ 10 GbE + 1 GbE · throughput: non-blocking · form factor: desktop / 1U$280Ver precio ↗
- UPSEaton 9PX 3000 RT (online double-conversion, 2U)capacity: 3000 VA / 2700 W · topology: online double-conversion · runtime: ~7 min at full load$1,600Ver precio ↗
- ChasisSupermicro 4U 8-GPU server chassis (CRPS, fan wall)form factor: 4U rack · gpu slots: 8 dual-slot passive · power: 2+2 CRPS redundant$3,200Ver precio ↗
Los precios de los componentes se obtienen a mano y van fechados (comprobados el 2026-09-16), sin scraping. Confirma en el sitio del vendedor antes de comprar.
- · Un nodo = 8 RTX 6000 Ada, 384 GB de VRAM. Las cifras que se muestran aquí son para un solo nodo; un clúster son tres o más.
- · La fabric 100 GbE (RoCEv2) transporta el tráfico tensor- y pipeline-parallel entre nodos y el NVMe-over-fabric hacia el almacenamiento compartido: la parte que lo convierte en un clúster y no en una sala de servidores.
- · El almacenamiento compartido vive en un nodo aparte (no incluido en el precio aquí): cada nodo GPU monta el mismo dataset y el mismo repositorio de modelos.
- · A esta escala, la colocation suele ganar al on-prem: energía por contador, climatización y remote hands cuestan menos que construirlo todo tú.
- · La gestión de clúster (Slurm o Kubernetes + un scheduler) se da por supuesta: el hardware es la mitad fácil.
- + Escala horizontalmente: se añaden nodos, no se rehace nada
- + 384 GB de VRAM por nodo, repositorio de modelos compartido
- + Fabric lista para el entrenamiento multinodo
- − Solo el precio por nodo: almacenamiento compartido, switch de fabric y colocation aparte
- − Necesita un equipo de ops: scheduling, monitorización, failover
- − GPU PCIe, no SXM: el pretraining a escala de frontera quiere un clúster H100/B200
Nodos A6000: los mismos 384 GB por nodo a alrededor del 60% del costo de GPU.
Los nodos L40S cambian algo de rendimiento por piezas estándar de centro de datos y soporte.
Para entrenamiento de frontera, alquila un pod H100/B200: ver GPU cloud pricing.
A lo largo de 36 meses, con el consumo de esta configuración y la tarifa de nube en vivo de su GPU.
- Hardware
- $69,670
- Electricidad
- $6,606
- Costo total de propiedad
- $76,276
- Nube equivalente, mensual
- $2,698/mo
- Nube equivalente, total
- $97,131
- Punto de equilibrio
- 28 meses
- · Las necesidades de alta disponibilidad suelen mantener algo de capacidad en la nube en reserva aunque comprar tenga sentido: el híbrido cubre ambas.
- · A lo largo de 36 meses, poseerla ahorra unos 20855 $ frente a la nube equivalente.
Los enlaces «Comprar en Amazon» son de afiliado: como Afiliado de Amazon, Obolith gana con las compras que cumplan los requisitos.