Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Un LLM open source hébergé en Europe : avis, tarifs et migration

Ou : comment utiliser un modèle de langage sans faire traverser l’Atlantique à ses prompts, et ce que cela coûte vraiment.

Chaque requête envoyée à une API de modèle de langage part avec son contenu : la question, le document joint, parfois le dossier client entier. Chez un fournisseur américain, ce contenu relève d’une société soumise au droit américain, quelle que soit la localisation du serveur. Une API LLM européenne répond à cette question par la géographie et par le contrat : un modèle ouvert, Mistral, Gemma, Qwen ou Apertus, servi par une société suisse ou européenne, depuis ses propres centres de données, avec l’engagement écrit de ne pas conserver les prompts ni de s’en servir pour entraîner des modèles. Le guide pour louer un GPU sans vendre ses données couvre l’infrastructure ; cette section s’occupe du cas le plus fréquent, l’appel d’un LLM par API.

L’offre européenne est plus riche qu’on ne le pense. Infomaniak sert depuis Genève huit modèles ouverts, dont Mistral Small 4 à 0,20 le million de tokens en entrée, en francs suisses ou en euros. Mistral vend ses propres modèles depuis Paris, OVHcloud sert gpt-oss depuis Gravelines à 0,08 € en entrée, Scaleway un catalogue plus récent depuis Paris, IONOS depuis l’Allemagne. Tous proposent une interface compatible OpenAI, ce qui rend la migration presque triviale, à quelques pièges près.

Trois critères départagent ces offres, dans cet ordre. La clause d’entraînement et de conservation d’abord : certains fournisseurs ne gardent rien, d’autres trente jours, et l’offre gratuite de Mistral peut servir à entraîner ses modèles. Le prix au million de tokens ensuite, où l’écart entre modèles, de un à cinquante, dépasse de loin l’écart entre fournisseurs. La latence enfin, mesurée publiquement pour Mistral et Scaleway, pas pour tous. Le catalogue d’Infomaniak illustre bien ce que l’on peut attendre aujourd’hui : des modèles de 14 à 397 milliards de paramètres, des contextes jusqu’à un million de tokens, l’appel d’outils sur tous.

Pour qui : une entreprise ou un développeur qui veut un LLM ouvert par API, pour des prompts qui ne doivent ni quitter l’Europe ni servir à l’entraînement.

À partir de : 0,05 le million de tokens en entrée pour Nemotron Nano, 0,20 pour Mistral Small 4 et Gemma 4 chez Infomaniak AI Services, en francs suisses ou en euros hors taxes ; un million de crédits offerts le premier mois.

Pour démarrer : activer Infomaniak AI Services, créer un jeton d’API, et remplacer l’adresse de votre client OpenAI par celle de l’API suisse.

Le modèle lit tout ce qu'on lui confie, dans une salle dont la porte ne s'ouvre pas vers l'Atlantique.

API LLM en Europe : prix au million de tokens, latence et clause d’entraînement

Onze questions reviennent quand on choisit une API LLM européenne, et chacune a sa page, avec les chiffres relevés le 27 septembre 2026.

L’API suisse, forces et limites

Huit modèles ouverts, une API compatible OpenAI et Anthropic, rien de conservé ni réutilisé, mais ni GPT ni Claude, pas de traitement par lots et une limite de débit à surveiller. Le bilan est dans l’avis sur l’API LLM suisse.

L’européen face à l’américain

Mistral est moins cher sur les petits modèles, OpenAI domine au sommet avec GPT-6, et les deux conservent vos échanges trente jours par défaut. Le prix et le contrat sont comparés dans Mistral face à OpenAI.

Les deux françaises

OVHcloud est moins cher sur gpt-oss et Llama, Scaleway plus riche en modèles récents et mesuré publiquement. Le match est dans OVH AI Endpoints contre Scaleway.

Son propre serveur

vLLM ou Ollama sur un GPU loué coûtent le prix de l’heure, quel que soit le volume : très bon marché à pleine charge, ruineux à faible charge. Le calcul est dans héberger un LLM avec vLLM ou Ollama.

Le choix du modèle

Gemma 4, Qwen3.x et Mistral Small 4 font le meilleur compromis en français, sous licence Apache 2.0, et la licence de Llama 4 exclut l’Union européenne pour ses modèles multimodaux. Les critères sont dans choisir son LLM open source.

La quantisation

Un modèle de 70 milliards passe de 141 Go à 42 Go en 4 bits, pour une perte de quelques pour cent. Les formats et leurs pertes mesurées sont dans GGUF, AWQ ou FP8.

La migration depuis OpenAI

Trois valeurs à changer, et six pièges, dont le streaming activé par défaut chez Infomaniak. Les adresses et le code sont dans migrer sans réécrire le code.

Vos documents, interrogés en Europe

Embeddings, reclassement, base vectorielle et LLM existent tous en version européenne ou ouverte, et indexer 10 000 documents coûte moins d’un franc. La construction est dans un RAG sur données d’entreprise.

Le prix, fournisseur par fournisseur

Le même assistant interne coûte 7,92 € par mois chez OVHcloud avec gpt-oss-120b, 17,05 chez Infomaniak avec Mistral Small 4, 198 $ chez OpenAI avec GPT-6 Sol. Le relevé est dans le coût par million de tokens.

La grille suisse

Nemotron Nano à 0,05, Gemma 4 et Mistral Small 4 à 0,20, Qwen3.5 397B à 0,80 en entrée, plus les embeddings et Whisper. Le détail est dans les tarifs d’Infomaniak AI Services.

Tester gratuitement

OVHcloud répond sans compte, Scaleway offre un million de tokens, Mistral un mode gratuit qui peut entraîner ses modèles sur vos données. Les conditions sont dans les paliers gratuits des API LLM.

Sur le même sujet