Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Faire tourner Flux sur un GPU loué : ce que coûte vraiment une image

Ou : pourquoi l’image la moins chère sort d’une carte grand public, et pas de la plus puissante.

La réponse courte : sur une RTX 4090 louée 0,34 $ de l’heure, une image Flux dev en FP8 à 20 étapes prend une dizaine de secondes, soit moins d’un dixième de centime si la carte travaille en continu. Sur une H100, plus rapide mais huit fois plus chère à l’heure, la même image coûte davantage, sauf à optimiser lourdement. En serverless, réveils compris, l’image revient plutôt à un ou deux centimes, le prix d’une API. Flux s’installe en quelques minutes dans un pod ComfyUI, mais sa version dev interdit l’auto-hébergement commercial sans licence : pour un usage professionnel, Flux schnell ou FLUX.2 klein 4B, sous licence Apache 2.0, font l’affaire. C’est le cas d’école de la génération d’images sur GPU.

Flux est une famille, pas un modèle. Flux dev, sorti en août 2024, compte 12 milliards de paramètres et donne la meilleure qualité de la première génération, sous licence non commerciale. Flux schnell, même taille, est une version distillée en quatre étapes, plus rapide et un peu moins fine, sous licence Apache 2.0. En 2026 sont venus FLUX.2 dev, 32 milliards de paramètres et nettement meilleur, sous licence non commerciale, et FLUX.2 klein, en 4 milliards sous Apache 2.0 ou en 9 milliards sous licence non commerciale, conçu pour la vitesse.

L’installation dans un pod ComfyUI suit les exemples officiels de ComfyUI. Deux voies existent. La plus simple est le fichier unique en FP8, d’environ 17 Go, à placer dans le dossier des checkpoints et à charger avec le nœud habituel, en réglant le CFG à 1,0. La version complète demande quatre fichiers : le modèle de diffusion, 23,8 Go, dans le dossier des modèles de diffusion ; les deux encodeurs de texte, T5 et CLIP, dans celui des encodeurs ; l’autoencodeur dans le dossier VAE. Le téléchargement de Flux dev sur Hugging Face exige un compte et l’acceptation de la licence.

Pour qui : un créateur ou un développeur qui veut générer des images Flux en volume, sur une carte de 24 Go louée à la seconde.

À partir de : 0,34 $ de l’heure pour une RTX 4090 en Community Cloud, 0,74 $ en Secure Cloud, 1,09 $ pour une L40S de 48 Go.

Pour démarrer : ouvrir un compte Runpod, lancer un pod ComfyUI sur une RTX 4090, et y déposer la version FP8 de Flux schnell ou FLUX.2 klein 4B.

Flux sur GPU cloud : le prix réel d’une image, carte par carte

ConfigurationTemps par imagePrix de l’heureCoût par image, carte occupée en continu
Flux dev FP8, 20 étapes, RTX 4090une dizaine de secondes0,34 $ en Communitymoins de 0,001 $
FLUX.2 klein 9B, RTX 40903,8 s0,34 $ en Communityenviron 0,0004 $
Flux dev 16 bits, 28 étapes, H1007,3 s2,69 $ en Communityenviron 0,0055 $
Flux dev optimisé, 28 étapes, H1002,9 s2,69 $ en Communityenviron 0,0022 $
Worker serverless RTX 4090, chaudune dizaine de secondes0,00031 $ la secondeenviron 0,003 $
Worker ComfyUI serverless de ce site, réveils comprisvariableA40 à 0,00034 $ la seconde0,011 à 0,022 $ mesurés
API Flux devsans objetà l’image0,012 $ chez WaveSpeed, 0,025 $ chez Black Forest Labs

Temps H100 tirés du blog de PyTorch, temps FLUX.2 klein 9B mesuré par Runpod, temps RTX 4090 tiré des mesures de la communauté ComfyUI.

Le tableau contient une leçon contre-intuitive : la carte la plus puissante n’est pas la moins chère par image. Une H100 est plus rapide qu’une RTX 4090, mais coûte huit fois plus cher à l’heure, 2,69 $ contre 0,34 $ : à moins de générer huit fois plus vite, ce qu’aucune mesure publiée ne montre, elle revient plus cher par image. Pour générer des images, la carte grand public de 24 Go gagne presque toujours, sauf besoin de mémoire au-delà. La L40S de 48 Go devient utile pour la version complète en 16 bits avec ses encodeurs, ou pour FLUX.2 dev.

La seconde leçon concerne le rythme. Les coûts « carte occupée en continu » supposent que le pod ne se repose jamais. En pratique, une session où l’on règle un workflow, où l’on attend, où l’on recommence, produit bien moins d’images par heure. Les mesures de la facturation du site le montrent : sur un worker serverless, réveils et reprises compris, l’image revient à 0,011 à 0,022 $, soit le prix d’une API. La carte louée ne bat vraiment l’API qu’en production soutenue.

Reste la licence de Flux dev, qui laisse l’usage commercial des images mais exclut l’exécution du modèle pour une activité génératrice de revenus. Un indépendant qui vend ses images en faisant tourner Flux dev sur sa carte louée a besoin d’une licence commerciale de Black Forest Labs, dont le prix n’est pas public. Flux schnell et FLUX.2 klein 4B, sous Apache 2.0, n’ont pas cette contrainte, et FLUX.2 klein 4B dépasse même Flux dev dans le classement d’Artificial Analysis.

La chambre noire se loue à l'heure : chaque tirage coûte d'autant moins qu'on n'éteint jamais la lumière.

Si la mémoire de la carte vous inquiète

Flux dev complet dépasse 23 Go, sa version FP8 tient dans une carte de 24 Go, FLUX.2 klein 4B dans 13. Le détail, modèle par modèle, est dans la VRAM nécessaire pour Flux et SDXL.

Si vous n’avez pas encore installé ComfyUI

Le pod ComfyUI de Runpod installe l’application et son gestionnaire d’extensions, avec deux précautions de sécurité à ne pas oublier. La marche à suivre est dans déployer ComfyUI sur une carte louée.

Si vous hésitez encore entre Flux et SDXL

SDXL tourne sur 8 Go et se vend sans condition, Flux dev est meilleur mais plus lourd et plus restrictif. Le match est dans SDXL ou Flux selon votre GPU.