Servir plus de requêtes par heure de GPU : batch, FP8, TensorRT
Ou : la seule remise que votre fournisseur ne peut pas vous refuser, parce qu’elle se joue dans votre code.
La réponse courte : le coût d’un résultat, c’est le prix de l’heure divisé par le nombre de résultats produits dans l’heure. Trois leviers augmentent ce second chiffre sans toucher au premier : regrouper les requêtes pour occuper la carte, réduire la précision des calculs au FP8 ou à l’INT4 sur les cartes qui le permettent, et compiler le modèle pour la carte avec TensorRT. Sur un modèle de langage, le seul regroupement bien fait multiplie souvent le débit par deux à quatre. C’est le levier le plus rentable de la maîtrise de la facture GPU, et le seul qui ne dépend d’aucune négociation.
Le regroupement est le plus puissant des trois. Une carte qui traite une requête à la fois passe la plupart de son temps à attendre la mémoire. L’idée du « continuous batching », publiée en 2022 avec le système Orca, consiste à faire entrer et sortir les requêtes du lot à chaque étape de génération plutôt que d’attendre qu’un lot entier soit fini ; NVIDIA l’appelle « in-flight batching ». vLLM y a ajouté PagedAttention, qui range le cache d’attention en petits blocs comme la mémoire virtuelle d’un système d’exploitation. L’article de recherche annonce un débit deux à quatre fois supérieur aux systèmes de référence de l’époque, à latence égale.
Pour qui : une équipe qui sert un modèle en continu et veut produire plus de réponses par heure sur une carte qui gère le FP8.
À partir de : 0,79 $ de l’heure pour une L40S de 48 Go en Community Cloud, 0,34 $ pour une RTX 4090, deux cartes de génération Ada qui calculent en FP8.
Pour démarrer : ouvrir un compte Runpod, lancer un modèle de pod vLLM, et mesurer le débit avant et après chaque réglage.
Batch, FP8, TensorRT : ce que chaque levier rapporte vraiment
| Levier | Principe | Gain publié | Condition |
|---|---|---|---|
| Regroupement continu | les requêtes entrent et sortent du lot à chaque étape | 2 à 4 fois le débit à latence égale (PagedAttention, 2023) | un serveur d’inférence qui le gère : vLLM, TensorRT-LLM |
| Précision FP8 | 1 octet par paramètre au lieu de 2 en FP16 | mémoire divisée par deux pour les poids | Hopper (H100), Ada (L40S, RTX 4090), Blackwell ; pas l’A100 |
| Quantification INT4 ou NVFP4 | un demi-octet par paramètre | mémoire environ 3,5 fois plus faible qu’en FP16 (NVFP4, NVIDIA) | NVFP4 réservé à Blackwell ; perte de qualité à mesurer |
| Compilation TensorRT-LLM | noyaux optimisés pour la carte exacte | 8 fois sur GPT-J, 4,6 fois sur Llama 2 70B, annoncés par NVIDIA | chiffres mesurés sur H100 contre une A100 : la carte change aussi |
La ligne FP8 a une conséquence directe sur le choix de la carte. Selon la bibliothèque Transformer Engine de NVIDIA, le FP8 est géré sur les architectures Hopper, Ada et Blackwell, pas sur Ampere. Une L40S à 0,79 $ de l’heure calcule donc en FP8, une A100 à 1,19 $ non. Pour un modèle de 7 milliards de paramètres, les poids occupent environ 14 Go en FP16, 7 Go en FP8 et 3,5 Go en INT4 : de quoi passer d’une carte de 24 Go à l’autre, ou faire tenir plusieurs modèles sur la même.
L’ordre d’application compte : le regroupement d’abord, parce qu’il ne coûte rien en qualité, la précision ensuite, en mesurant la qualité des réponses, et la compilation en dernier, parce qu’elle lie le modèle à une carte précise.
Une précaution sur les chiffres spectaculaires. Le blog de vLLM annonçait en 2023 un débit jusqu’à 24 fois supérieur à la bibliothèque Transformers de Hugging Face, et Orca 36,9 fois celui de FasterTransformer : ces multiplicateurs comparent à des références naïves ou anciennes, sur des cas favorables. Sur une application réelle, un gain d’un facteur deux à quatre est un objectif plus raisonnable, et il suffit déjà à diviser la facture par autant.
Si c’est le réveil du serveur qui vous coûte
Sur un service serverless, le démarrage à froid pèse parfois plus que le calcul lui-même. Son coût, et comment le réduire, est détaillé dans le coût du démarrage à froid.
Si vous cherchez la carte FP8 la moins chère
La RTX 4090 gère le FP8 et se loue autour de 0,34 $ de l’heure. Le relevé complet, avec sa remplaçante RTX 5090, est dans le prix horaire de la RTX 4090.
Si vous voulez mesurer le gain en euros
Un débit multiplié par trois change le budget d’un service de modèle de langage. Pour le recalculer, la méthode est dans le budget d’un projet IA en trois lignes.