Faire tourner l'IA sur sa machine : le prix de la tranquillité
Ou : la seule donnée qui ne fuit jamais est celle qui ne quitte pas le bureau, et ce bureau a une facture d’électricité.
La réponse courte : faire tourner un modèle de langage sur votre propre machine est la seule façon de garantir qu’aucun prompt ne sort de chez vous. C’est devenu simple : Ollama ou LM Studio s’installent en quelques minutes, et des modèles ouverts comme gpt-oss-20b, qui tient dans 16 Go de mémoire selon OpenAI, ou Ministral 3, que Mistral annonce en français, tournent sur une carte graphique grand public. Le prix, lui, a monté : le 28 septembre 2026, la moins chère des RTX 5090 de 32 Go se vendait 4 999,99 € sur la place de marché de NVIDIA, plus du double du prix conseillé. Pour un usage occasionnel, une API européenne qui ne garde rien coûte moins cher ; pour des données très sensibles et un usage quotidien, la machine locale se défend. C’est l’option extrême quand on cherche à garder la main sur vos données.
Le logiciel n’est plus l’obstacle. Ollama et llama.cpp sont sous licence MIT, Jan sous Apache 2.0, et LM Studio, qui exigeait une licence commerciale en entreprise, est gratuit au travail depuis le 8 juillet 2025. Seul piège : Open WebUI, l’interface la plus répandue pour partager un modèle local avec une équipe, a ajouté en avril 2025 une clause qui interdit de retirer sa marque au-delà de 50 utilisateurs par période de 30 jours, sauf licence entreprise.
Les modèles non plus. Mistral publie Ministral 3 en 3, 8 et 14 milliards de paramètres sous Apache 2.0, le 14B tenant selon sa fiche dans 24 Go en FP8. Google a passé Gemma 4 sous Apache 2.0, et estime à 17,5 Go la mémoire du plus gros, le 31B, en quantification 4 bits, avant le contexte. OpenAI annonce gpt-oss-20b dans 16 Go et gpt-oss-120b sur une seule carte de 80 Go. Une réserve pour les modèles multimodaux de Meta : la politique d’usage de Llama 3.2 et de Llama 4 refuse les droits aux entreprises dont le siège est dans l’Union européenne.
Pour qui : une équipe qui veut un LLM sans données conservées, mais sans acheter ni entretenir une machine à plusieurs milliers d’euros.
À partir de : 0,20 CHF le million de tokens en entrée et 0,75 CHF en sortie pour Mistral Small 4 chez Infomaniak AI Services, hors taxes, avec un million de crédits offerts le premier mois.
Pour démarrer : activer Infomaniak AI Services, récupérer une clé compatible OpenAI, et la brancher dans le même client que votre modèle local pour comparer.
IA locale ou cloud : le prix du matériel, ce qu’il fait tourner, et le seuil de rentabilité
| Machine | Mémoire pour le modèle | Prix relevé | Ce que l’éditeur du modèle annonce |
|---|---|---|---|
| RTX 5060 Ti 16 Go | 16 Go | dès 757 € constaté | gpt-oss-20b tient dans 16 Go |
| RTX 5080 | 16 Go | 1 059 € conseillé, dès 1 489,99 € constaté | même classe que la précédente, plus rapide |
| RTX 5090 | 32 Go | 2 099 € conseillé, dès 4 999,99 € constaté | Ministral 3 14B en FP8 (24 Go), Gemma 4 31B en 4 bits (17,5 Go) |
| Mac mini M5 Pro | jusqu’à 64 Go de mémoire unifiée | dès 1 999 € | modèles de taille moyenne selon la mémoire choisie |
| Mac Studio M5 Max | jusqu’à 128 Go de mémoire unifiée | dès 2 999 € en 36 Go | au-delà des 80 Go annoncés pour gpt-oss-120b, dans sa configuration haute |
| Framework Desktop, Ryzen AI Max+ 395 | 128 Go, dont jusqu’à 96 Go adressables par le GPU | 3 889 € en version à assembler, sans stockage | au-delà des 80 Go annoncés pour gpt-oss-120b |
| RTX 5090 louée chez Runpod | 32 Go | 0,69 $ de l’heure, Community Cloud | mêmes modèles, mais les données partent chez l’hébergeur |
Prix relevés le 28 septembre 2026 : prix conseillés et fiches de NVIDIA, annonces les moins chères de sa place de marché française, Apple Store France, configurateur Framework, grille Runpod du 27 septembre. NVIDIA ne propose plus de RTX 4090 neuve sur sa place de marché française.
La vitesse suit. Sur gpt-oss-20b, les mesures publiées par le mainteneur de llama.cpp donnent 282 tokens par seconde sur une RTX 5090, 222 sur une RTX 4090 et 92 sur un Mac équipé d’une puce M4 Max : de quoi écrire plus vite qu’on ne lit, sur chacune. Ces chiffres valent pour un modèle qui n’active que 3,6 milliards de paramètres par token ; un modèle dense de même taille est nettement plus lent, et aucune mesure officielle n’en a été trouvée.
L’électricité reste modeste. Une RTX 5090 consomme jusqu’à 575 W selon NVIDIA ; une heure à pleine charge représente donc 0,575 kWh, soit environ 0,23 € au prix moyen belge de 40,45 centimes le kWh relevé par la CREG en septembre 2026, et environ 0,12 € au tarif bleu d’EDF à 20,01 centimes. C’est un calcul au maximum : une carte qui attend une question consomme bien moins.
Le seuil de rentabilité se calcule simplement, et il est haut. Pour le prix constaté d’une RTX 5090, 4 999,99 €, on loue la même carte environ 7 200 heures chez Runpod, en comptant un euro pour un dollar : plus de trois ans à raison de huit heures par jour ouvré. Face à une API qui facture 0,20 CHF le million de tokens en entrée, l’écart est plus grand encore : il faut des milliards de tokens pour amortir la machine. Le local ne se justifie donc pas par le prix. Il se justifie par ce qu’aucun contrat ne peut promettre : l’absence physique de transfert.
Mon avis : une machine locale pour les données qu’on ne confierait à personne, dossiers médicaux, contentieux, secrets industriels, avec un modèle de 14 à 30 milliards de paramètres et Ollama ou LM Studio. Pour tout le reste, un service européen qui s’engage par contrat à ne rien conserver. Et pour tester avant d’acheter, une carte louée à l’heure, qui dit en une soirée si le modèle visé fait le travail.
Si vous voulez quand même utiliser le cloud
Retirer les noms, les numéros et les adresses avant d’envoyer un document change beaucoup de choses. La méthode est dans anonymiser avant d’envoyer à l’IA.
Si c’est la localisation du serveur qui vous inquiète
Un GPU loué en Europe n’est pas un GPU chez soi, mais ce n’est pas non plus un GPU en Virginie. La différence est expliquée dans un serveur GPU à Paris ou en Virginie.
Si ce sont les dossiers de vos clients
La machine locale n’est qu’une des protections possibles. Les autres sont dans traiter des données clients sans fuite.