Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Générer par API sans gérer de GPU : WaveSpeed, fal.ai et Replicate

Ou : pourquoi louer une cuisine entière quand on veut seulement un croissant.

Vous voulez une image, une voix ou un clip, pas une carte graphique. C’est exactement ce que vendent les API de génération : vous envoyez un prompt, elles renvoient un fichier, et elles facturent le résultat, 0,003 $ l’image Flux schnell, 0,15 $ le clip WAN 2.2 de cinq secondes. Pas de pod à lancer, pas de modèle de plusieurs dizaines de gigaoctets à télécharger, pas de minute payée à attendre qu’un worker se réveille. Le guide qui aide à comparer les GPU cloud et les API IA traite de la location de cartes à l’heure ; cette section s’occupe de l’autre option, celle où la carte n’apparaît jamais sur la facture.

Trois plateformes dominent ce marché, et elles ne se ressemblent pas. WaveSpeed, société de Singapour fondée en 2025, aligne plus de 1 000 modèles et les prix les plus bas des trois sur les modèles ouverts. fal.ai, à San Francisco, mise sur l’infrastructure et la vitesse, avec 140 millions de dollars levés fin 2025. Replicate, racheté par Cloudflare, offre le plus grand catalogue, plus de 50 000 modèles dont beaucoup publiés par la communauté. Autour d’eux, les éditeurs vendent aussi leurs propres modèles en direct, Google pour Veo, Kling, MiniMax ou Black Forest Labs, et Runpod propose quelques modèles à l’unité sur ses points d’accès publics.

Ce qui change par rapport à un GPU loué tient en quatre points. Le prix est fixé par génération, quel que soit le temps de calcul, et la performance devient le problème de la plateforme, pas le vôtre. La latence dépend du fournisseur plus que du modèle : les mesures d’Artificial Analysis montrent des écarts de un à huit sur le même modèle, de 1,9 à 15,3 secondes pour une image Flux dev. Les modèles fermés, Kling, Veo, Nano Banana, ne s’obtiennent que par API, faute de poids téléchargeables. Et vos données passent par l’infrastructure d’un tiers, avec des conditions très différentes d’une plateforme à l’autre.

Pour qui : un développeur, un créateur ou une petite équipe qui veut des images, des clips ou des voix à la demande, sans carte graphique à louer ni à surveiller.

À partir de : 0,003 $ l’image Flux schnell, 0,012 $ l’image Flux dev, 0,15 $ le clip WAN 2.2 de cinq secondes en 480p, 1 $ de crédits d’essai pour un compte neuf éligible.

Pour démarrer : créer une clé sur WaveSpeed, lancer une première génération, puis comparer le même prompt chez fal.ai ou Replicate si la latence compte.

On glisse une demande sous la vitre, on récupère un fichier. La salle des machines existe, mais elle n'apparaît jamais sur la facture.

API de génération d’images et de vidéos : le prix à l’unité face à l’heure de GPU

Neuf questions reviennent quand on choisit une API de génération, et chacune a sa page, avec les chiffres relevés le 27 septembre 2026.

L’API qui mise tout sur le catalogue

WaveSpeed revendique la génération d’image en moins d’une seconde, mais les mesures indépendantes lui donnent 15 secondes sur Flux dev. Sa vraie force est ailleurs : un seul compte pour Kling, Veo, Seedance et WAN, au prix de l’éditeur. Le bilan, forces et faiblesses comprises, est dans l’avis complet sur WaveSpeed.

Le sprinteur et le bibliothécaire

fal.ai passe pour le plus rapide, Replicate pour le plus fourni. Sur les modèles mesurés, Replicate est pourtant souvent le plus rapide des deux, et fal.ai le moins cher en vidéo. Le détail des prix, des délais et des conditions sur vos données est dans le match fal.ai contre Replicate.

Au centime ou au chronomètre

WaveSpeed facture Flux dev 0,012 $ l’image, fal.ai 0,025 $ le mégapixel. fal.ai livre en revanche Flux schnell en 3,7 secondes, contre 10,2. Qui gagne dépend de ce que vous générez, et de qui attend devant l’écran : la réponse est dans WaveSpeed ou fal.ai, au centime.

Le moment où louer le GPU devient rentable

Une image Flux dev coûte environ 0,003 $ de calcul sur une RTX 4090 louée à la seconde, quatre fois moins qu’à l’unité. Un clip WAN 2.2 en qualité complète coûte en revanche trois fois plus cher sur une H100 que chez WaveSpeed. Le calcul complet est dans le seuil entre API et GPU.

Attendre une vidéo sans bloquer son serveur

Un clip prend entre une et plusieurs minutes, et les plateformes ne renvoient un webhook que quelques fois. Comment attendre sans perdre un clip déjà facturé, avec un exemple de vérification de signature en Go, se lit dans webhooks et jobs longs.

Brancher l’API sur votre code

Le SDK Python tient en un appel, la bibliothèque standard de Go en une soixantaine de lignes. Trois règles évitent de payer deux fois ou de perdre un fichier, dont la plus importante : ne jamais renvoyer une soumission à l’aveugle. Le code complet est dans l’intégration en Python et Go.

Le même modèle chez cinq vendeurs

Sur les modèles fermés, tout le monde revend au prix de l’éditeur. Sur les modèles ouverts, Flux dev va de 0,0038 $ à 0,025 $ l’image selon la plateforme. Le relevé complet, images, vidéo et voix, est dans les prix API par API.

La grille d’une seule plateforme

Un catalogue de mille modèles demande une grille lisible : prix par image, par tranche de cinq secondes, par seconde ou aux mille caractères, remises temporaires comprises. Elle est détaillée, pour WaveSpeed, dans la grille WaveSpeed complète.

Dix minutes pour une première image

Un compte ouvert par Google ou GitHub, un dollar d’essai, une clé active tout de suite, et deux requêtes pour une première image. Le seul piège est la limite de cinq générations par minute avant la première recharge, détaillée dans ouvrir un compte d’essai.

Sur le même sujet