Ce que coûte l'API LLM suisse, modèle par modèle, et le palier gratuit
Ou : une facture en francs suisses qui coûte moins cher qu’un café par jour, à condition de choisir le bon modèle.
La réponse courte : Infomaniak AI Services facture chaque modèle au million de tokens, sans abonnement ni frais fixe, avec une facture en fin de mois. Les prix vont de 0,05 en entrée et 0,20 en sortie pour Nemotron Nano à 0,80 et 3,60 pour Qwen3.5 397B, en passant par 0,20 et 0,75 pour Mistral Small 4, en francs suisses ou en euros hors taxes, au même montant. Un million de crédits est offert pendant le premier mois, avec une carte bancaire enregistrée. Pour un assistant interne de mille requêtes par jour, la facture mensuelle va de quelques francs à plus de soixante-dix selon le modèle. C’est l’option la plus simple parmi les LLM qui restent en Europe, et la grille se lit en deux minutes.
La grille est publiée sur la page des tarifs, dans les deux devises, avec une particularité rare : le montant est le même en francs et en euros. Les prix s’entendent hors TVA. Aucun montant minimal n’est annoncé, et une limite de dépense peut être fixée dans le Manager, ce qui protège d’une boucle de requêtes mal écrite.
Le crédit d’essai mérite une précision. Le guide de démarrage annonce un million de crédits gratuits pour tester le service pendant un mois, mais une carte de crédit est requise pour commencer à utiliser l’API. Et la documentation reste floue sur l’équivalence exacte d’un crédit, « un crédit ou token LLM » par requête. Retenez l’ordre de grandeur : de quoi tester sérieusement un modèle pendant quelques semaines, pas de quoi faire tourner une application en production.
Pour qui : une équipe qui veut chiffrer à l’avance le coût mensuel d’un LLM ouvert hébergé en Suisse, sans abonnement ni engagement.
À partir de : 0,05 le million de tokens en entrée pour Nemotron Nano, 0,20 pour Mistral Small 4 et Gemma 4, en francs suisses ou en euros hors taxes ; un million de crédits offerts le premier mois.
Pour démarrer : activer Infomaniak AI Services, enregistrer une carte, fixer une limite de dépense, et tester deux modèles sur vos propres prompts avant de choisir.
Infomaniak AI Services prix : la grille au million de tokens
| Modèle | Taille | Contexte | Entrée | Sortie |
|---|---|---|---|---|
| Nemotron 3 Nano (bêta) | 30 milliards, 3 actifs | 1 000 000 | 0,05 | 0,20 |
| Gemma 4 31B | 31 milliards | 100 000 | 0,20 | 0,40 |
| Mistral Small 4 | 119 milliards | 256 000 | 0,20 | 0,75 |
| Ministral 3 14B | 14 milliards | 100 000 | 0,30 | 0,40 |
| Qwen3.5 122B | 122 milliards, 10 actifs | 200 000 | 0,40 | 3,20 |
| Kimi K2.6 (bêta) | non communiquée | 256 000 | 0,60 | 3,00 |
| Apertus 1.5 70B (bêta) | 70 milliards | 100 000 | 0,70 | 2,50 |
| Qwen3.5 397B (bêta) | 397 milliards, 17 actifs | 200 000 | 0,80 | 3,60 |
Prix au million de tokens, en francs suisses ou en euros hors taxes, relevés le 27 septembre 2026.
| Autre service | Prix |
|---|---|
| Embeddings Qwen3-Embedding-8B | 0,07 le million de tokens |
| Embeddings BGE Multilingual Gemma2 | 0,065 le million de tokens |
| Embeddings All MiniLM L12 v2 | gratuit |
| Reclassement bge-reranker-v2-m3 | 0,01 le million de tokens |
| Transcription Whisper V3 | 0,006 la minute |
| Images Flux schnell ou Photomaker V2 | 0,30 la minute de génération |
Trois usages types, pour passer de la grille à la facture. Un assistant interne qui traite mille requêtes par jour ouvré, avec 2 000 tokens envoyés et 500 reçus à chaque fois, consomme 44 millions de tokens en entrée et 11 millions en sortie par mois. Une base documentaire de 10 000 documents d’environ mille tokens demande 10 millions de tokens d’embeddings pour être indexée. Et une heure de réunion transcrite chaque jour ouvré représente 1 320 minutes par mois.
| Usage mensuel | Modèle | Coût |
|---|---|---|
| Assistant interne, 44 M en entrée et 11 M en sortie | Nemotron 3 Nano | 4,40 |
| Même assistant | Gemma 4 31B | 13,20 |
| Même assistant | Mistral Small 4 | 17,05 |
| Même assistant | Qwen3.5 397B | 74,80 |
| Indexation de 10 000 documents | Qwen3-Embedding-8B | 0,70 |
| 22 heures de réunions transcrites | Whisper V3 | 7,92 |
Deux enseignements. Le choix du modèle pèse bien plus que le choix du fournisseur : entre Nemotron et Qwen3.5 397B, la même charge coûte dix-sept fois plus. Et le prix de sortie compte plus qu’il n’y paraît, parce qu’il est souvent trois à cinq fois plus élevé que celui d’entrée. Pour un usage qui génère beaucoup de texte, Gemma 4, à 0,40 en sortie, bat Mistral Small 4 à 0,75.
Un point de comparaison, enfin. Mistral vend son propre Small 4 moins cher, 0,12 € en entrée et 0,50 € en sortie, et 10 % de plus sur ses serveurs européens garantis. Ce que l’on paie en plus chez Infomaniak, c’est l’hébergement en Suisse et l’engagement contractuel de ne rien conserver ni réutiliser.
Si vous voulez l’avis complet
Les prix ne disent pas tout : débit, catalogue mouvant, absence de traitement par lots. Le bilan de l’API est dans l’API LLM suisse à l’essai.
Si vous comparez avec les autres fournisseurs
Mistral, OVHcloud, Scaleway, IONOS et OpenAI publient aussi leur prix au million de tokens. Le relevé complet est dans le coût au million de tokens comparé.
Si vous cherchez d’abord à tester gratuitement
Le million de crédits d’Infomaniak exige une carte. D’autres offres européennes s’en passent, avec leurs propres limites, recensées dans les paliers gratuits des API LLM.