<- Todos os termos

GPU

Um processador com milhares de núcleos em paralelo e memória muito rápida no mesmo encapsulamento. O carro-chefe tanto do treinamento quanto da inferência de modelos grandes.

O que é

Para trabalhar com LLM, dois números da GPU são os que mais importam: quanta VRAM ela tem (o modelo cabe?) e a sua largura de banda de memória (a que velocidade consegue transmitir os pesos, o que fixa os tokens por segundo). O cômputo bruto (TFLOPS) importa mais para o treinamento e o prefill do que para a geração.

As peças de data center (H100, H200, B200, MI300X) têm muita VRAM e HBM; as de consumo (RTX 4090, 5090) são mais baratas por hora mas têm menos VRAM e nenhuma interconexão rápida.

Por que importa

A GPU é a maior linha de um orçamento de self hosting. Escolher uma pequena demais força o multi gpu ou a quantização; grande demais desperdiça dinheiro com utilização baixa.

Impacto em custo e infraestrutura

Os preços de aluguel da mesma GPU variam 2-3× entre provedores e entre on-demand e spot. O número a comparar é o preço por GPU-hora, não o preço da instância.

Conceitos relacionados

Use no Obolith

Última revisão: 2026-09-01