FP16 / BF16
Des formats flottants 16 bits. La précision par défaut pour servir les grands modèles : ~2 octets par paramètre. Le BF16 échange des bits de mantisse contre de la plage et est le standard côté entraînement.
Ce que c'est
FP16 et BF16 utilisent 16 bits. Le FP16 est plus précis mais à plage étroite (débordements possibles) ; le BF16 a la plage d'un flottant 32 bits avec moins de précision, plus stable pour l'entraînement. En inférence, les deux donnent une sortie pleine qualité à 2 octets/param.
Pourquoi c'est important
C'est la référence face à laquelle on mesure le budget VRAM et les gains de quantization. « Le 70B a besoin de 140 Go » suppose fp16/bf16.