La VRAM qu'il faut vraiment pour générer des images sans planter
Ou : l’art de faire entrer un modèle de douze milliards de paramètres dans une carte qui n’en voulait que la moitié.
La réponse courte : SDXL tient dans 8 Go, Z-Image Turbo et FLUX.2 klein 4B dans moins de 16, Flux dev demande 24 Go en FP8 et bien plus en 16 bits avec ses encodeurs de texte, Qwen-Image 20 Go en FP8, FLUX.2 dev 90 Go en version complète mais une vingtaine en 4 bits. Pour la plupart des usages, une RTX 4090 de 24 Go, louée 0,34 $ de l’heure, suffit ; une L40S de 48 Go devient utile pour les versions complètes et les workflows chargés de ControlNet, de LoRA et d’agrandissement. C’est la contrainte qui précède tout choix pour les images sur GPU loué, parce qu’un modèle qui ne tient pas en mémoire plante, ou devient d’une lenteur décourageante.
La mémoire d’un workflow ne se résume pas au modèle de diffusion. Il faut y ajouter les encodeurs de texte, souvent lourds : l’encodeur T5 de Flux pèse près de 10 Go à lui seul, et FLUX.2 dev s’appuie sur un modèle de langage de 24 milliards de paramètres. Puis l’autoencodeur, qui transforme l’image latente en pixels, les LoRA, les ControlNet, et l’image elle-même, dont la place croît avec la résolution et la taille du lot. Le blog technique de NVIDIA donne l’exemple de Flux dev : 39,3 Go pour le pipeline complet en 16 bits, 24,6 Go en FP8, 21,7 Go en FP4, et respectivement 23,9, 14,9 et 11,1 Go en mode économe.
Ce mode économe, et quelques réglages de ComfyUI, font gagner beaucoup. Le réglage du format des poids en FP8 dans le nœud de chargement divise la mémoire du modèle par deux, pour une perte de qualité que la documentation de ComfyUI juge légère. L’encodeur T5 existe lui aussi en FP8. Les options de démarrage --lowvram et --reserve-vram déchargent une partie du modèle vers la mémoire centrale, au prix de la vitesse. Et réduire la résolution ou la taille du lot reste le premier conseil en cas de manque de mémoire.
Pour qui : un créateur ou un développeur qui veut louer la carte juste suffisante pour son modèle d’images, sans payer 48 Go quand 24 suffisent.
À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,69 $ pour une RTX 5090 de 32 Go, 0,79 $ pour une L40S de 48 Go.
Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, et ne monter à 48 Go que si le modèle ou le workflow l’exige.
Combien de VRAM pour Flux, SDXL et les autres : la carte à louer
| Modèle | Mémoire annoncée | Carte suffisante chez Runpod |
|---|---|---|
| SDXL 1.0 | 8 Go selon Stability, 7 Go mesurés au pic par Runpod | toute carte de 16 Go ou plus |
| Stable Diffusion 3.5 Medium | 9,9 Go hors encodeurs de texte | 16 à 24 Go |
| FLUX.2 klein 4B | 8,4 Go distillé selon ComfyUI, environ 13 Go selon Black Forest Labs | 16 à 24 Go |
| Z-Image Turbo | moins de 16 Go | 16 à 24 Go |
| FLUX.1 dev en FP8 | 24,6 Go pour le pipeline, 14,9 Go en mode économe | RTX 4090 de 24 Go |
| FLUX.1 dev en 16 bits | 39,3 Go pour le pipeline, 23,9 Go en mode économe | L40S de 48 Go, ou 24 Go en mode économe |
| Qwen-Image | fichier de 40,9 Go en 16 bits, 20,4 Go en FP8 | RTX 4090 en FP8, L40S en 16 bits |
| HiDream-I1 | plus de 16 Go en FP8, plus de 27 Go complet | 24 Go en FP8, 48 Go complet |
| FLUX.2 dev | 90 Go complet, 64 Go en mode économe, 18 à 20 Go en 4 bits | RTX 4090 ou 5090 en 4 bits, H100 ou H200 complet |
| HunyuanImage 3.0 | trois cartes de 80 Go au moins | hors de portée d’un usage courant, et exclu de l’UE par sa licence |
Mémoire annoncée par les éditeurs, par NVIDIA ou par la documentation de ComfyUI, relevée le 27 septembre 2026.
Au-delà de la génération, trois tâches courantes changent le calcul. L’entraînement d’un LoRA Flux vise 24 Go avec ai-toolkit, et descend à 8 à 12 Go avec d’autres outils, au prix d’une lenteur certaine. L’agrandissement par SeedVR2 demande de 8 Go en GGUF à 24 Go en 16 bits, SUPIR 12 à 16 Go. Et un workflow qui enchaîne génération, ControlNet et agrandissement additionne les besoins : c’est là que les 48 Go d’une L40S évitent de tout décharger à chaque étape.
Ma règle de location tient en trois paliers. Jusqu’à 16 Go de besoin, une RTX 4090 de 24 Go, pour la marge et le prix. De 16 à 32 Go, une RTX 5090, ou une RTX 4090 avec les réglages économes. Au-delà, une L40S de 48 Go en Community Cloud, à 0,79 $ de l’heure, bien moins chère qu’une carte de 80 Go qui n’apporte rien de plus pour l’image, sauf FLUX.2 dev en version complète.
Si vous avez choisi votre modèle
Flux s’installe en quelques minutes dans ComfyUI, en version FP8 ou complète, et le prix réel d’une image dépend surtout de la carte. Le détail est dans ce que coûte vraiment une image Flux.
Si vous comptez entraîner un LoRA
L’entraînement demande plus de mémoire que la génération, et sa durée dépend beaucoup de la carte. La méthode et le coût sont dans un LoRA pour quelques euros.
Si vous agrandissez vos images
SeedVR2, SUPIR ou Real-ESRGAN n’ont ni les mêmes besoins ni les mêmes licences. Les outils et leur prix par lot sont dans agrandir ses images IA.