Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Un LoRA pour quelques euros de GPU : la méthode et la facture

Ou : apprendre un nouveau visage ou un nouveau style à un modèle de douze milliards de paramètres, pour le prix d’un café.

La réponse courte : un LoRA est un petit fichier de quelques dizaines de mégaoctets qui apprend un style, un personnage ou un objet à un modèle d’images existant. Pour Flux dev, il faut une quinzaine d’images, un millier à deux mille pas d’entraînement et une carte de 24 Go. Sur une RTX 4090 louée 0,34 $ de l’heure, l’entraînement prend une à deux heures, soit moins d’un dollar ; sur une H100, une vingtaine de minutes. Les API d’entraînement font la même chose pour 1 à 2 $, sans rien installer. Le vrai piège n’est pas le prix, c’est la licence : un LoRA entraîné sur Flux dev hérite de sa licence non commerciale. C’est l’étape qui personnalise les images sur GPU loué.

Le principe, d’abord. Plutôt que de réentraîner les douze milliards de paramètres de Flux, un LoRA ajoute de petites matrices qui modifient son comportement, et seules ces matrices sont apprises. D’où un fichier léger, un entraînement court, et un résultat qu’on charge par-dessus le modèle d’origine, dans ComfyUI comme dans la plupart des API. Le « rang » du LoRA règle sa capacité : 16 est le réglage courant, 8 suffit pour un style, jusqu’à 64 pour la ressemblance d’un visage selon le guide d’entraînement publié par Replicate.

Plusieurs outils ouverts font le travail. ai-toolkit, sous licence MIT, entraîne Flux, FLUX.2, SDXL, Qwen-Image et WAN, avec une interface web et un modèle de pod officiel chez Runpod, maintenu par son auteur. kohya sd-scripts, sous licence Apache 2.0, descend jusqu’à 8 Go de mémoire pour Flux, au prix d’une lenteur certaine. FluxGym, sous licence MIT, offre une interface simple pour Flux sur 12 à 20 Go. SimpleTuner et OneTrainer complètent le choix.

Pour qui : un créateur ou une petite équipe qui veut apprendre un style, un produit ou un personnage à Flux ou SDXL, en payant la carte à la seconde.

À partir de : 0,34 $ de l’heure pour une RTX 4090 de 24 Go en Community Cloud, 0,74 $ en Secure Cloud, 2,69 $ pour une H100 SXM.

Pour démarrer : ouvrir un compte Runpod, lancer le modèle de pod d’ai-toolkit sur une RTX 4090, et y déposer une quinzaine d’images légendées.

Entraîner un LoRA sur GPU cloud : la recette, la durée et le coût réel

La recette la plus courante pour un LoRA Flux dev tient en quelques réglages, que les configurations d’exemple d’ai-toolkit et le guide de Replicate résument : douze à vingt images, autour de 1024 pixels de côté, une légende par image contenant un mot déclencheur, 1 000 à 2 000 pas, un rang de 16, un taux d’apprentissage de 0,0001. La qualité des images compte plus que leur nombre : des cadrages variés, une lumière variée, et aucune image floue.

Configuration mesuréeCarteDurée publiéeCoût chez Runpod
Flux dev en 4 bits, 1024 px, 1 000 pas (3,5 s par pas)RTX 4090environ 58 minenviron 0,33 $ en Community
Même configuration, 2 000 pasRTX 4090environ 1 h 57environ 0,66 $ en Community
Flux dev en QLoRA, 512 x 768, 700 pasRTX 4090environ 41 minenviron 0,23 $ en Community
Flux dev en FP8, 512 x 768, 700 pasH100 SXMenviron 20 minenviron 0,90 $ en Community
Flux dev, 512 px, 500 pasA100 80 Goenviron 10 minenviron 0,20 $ en Community

Sources : documentation de SimpleTuner pour la RTX 4090 en 4 bits, billet de Hugging Face sur l’entraînement QLoRA de Flux pour les mesures à 700 pas, exemple de Modal pour l’A100. Ces durées ne comptent ni l’installation, ni le téléchargement du modèle, ni les essais : prévoyez le double pour un premier LoRA.

API d’entraînementPrixDurée annoncée
WaveSpeed, LoRA Flux dev1 $ pour 1 000 pasenviron 7 min
fal.ai, LoRA Flux rapide2 $ par entraînement de 1 000 pasquelques minutes
Replicate, entraîneur d’ostris0,001525 $ la seconde de H20020 à 30 min et moins de 2 $ selon Replicate
Civitai2 000 Buzz par défaut pour Flux, 500 pour SDXLquelques minutes

La comparaison est claire : une carte louée coûte moins cher que l’API, mais demande une heure d’installation et de réglage la première fois. Pour un ou deux LoRA, l’API gagne en temps ; pour une série, ou pour garder la main sur chaque réglage, le pod gagne en coût.

Reste la licence, et elle mérite une lecture attentive. La licence de FLUX.1 [dev] traite toute version affinée du modèle comme un dérivé, soumis aux mêmes restrictions : un LoRA entraîné sur Flux dev ne peut être utilisé ou distribué qu’à des fins non commerciales. Et si la licence laisse l’usage commercial des images produites, elle précise aussi que faire tourner le modèle pour une activité qui génère des revenus n’est pas un usage non commercial : un usage professionnel suppose une licence commerciale de Black Forest Labs, dont le prix n’est pas public. L’auteur d’ai-toolkit le résume ainsi : tout ce qu’on entraîne sur Flux dev hérite de sa licence. Pour un LoRA destiné à un usage commercial, mieux vaut partir d’un modèle sous licence Apache 2.0, comme Flux schnell, FLUX.2 klein 4B ou Qwen-Image, ou de SDXL et sa licence OpenRAIL++.

Le LoRA ne remplace pas la machine : c'est un calque posé dessus, qui change ce qui en sort.

Si vous hésitez sur la carte

Une RTX 4090 de 24 Go suffit pour la plupart des LoRA Flux, une carte de 48 Go accélère les choses et autorise des lots plus grands. Les besoins en mémoire sont détaillés dans la VRAM pour générer des images.

Si vous comptez vendre ce que vous produisez

Flux dev, Flux schnell, SDXL, Qwen-Image : les droits sur les modèles, les LoRA et les images ne se ressemblent pas. Le point complet est dans ce que chaque licence autorise.

Si vous voulez d’abord choisir le modèle de base

Flux dev et SDXL n’ont ni la même qualité, ni la même mémoire, ni le même choix de LoRA. Le duel est dans deux générateurs d’images ouverts.