Choisir son modèle ouvert : Llama, Mistral, Qwen selon l'usage
Ou : le meilleur modèle ouvert n’est ni américain ni européen, et le plus connu n’est plus le bon choix.
La réponse courte : en septembre 2026, les modèles ouverts les plus performants sont chinois, GLM-5.3, Kimi K3 ou MiMo-V2.6, mais leur taille les réserve aux API. Pour un usage courant en français, trois familles de taille moyenne, toutes sous licence Apache 2.0, font le meilleur compromis : Gemma 4 de Google, Qwen3.x d’Alibaba et Mistral Small 4. Llama, longtemps la référence, a décroché dans les classements, et la licence de Llama 4 exclut les entreprises installées dans l’Union européenne pour ses modèles multimodaux. Le bon modèle se choisit sur trois critères, dans cet ordre : la licence, la qualité en français sur votre usage, puis la taille. C’est la décision qui précède toutes les autres parmi les LLM qui restent en Europe.
La licence d’abord, parce qu’elle peut disqualifier un modèle avant même de l’avoir essayé. Apache 2.0 et MIT autorisent tout usage commercial sans condition. Les licences maison ajoutent des clauses : au-delà de 700 millions d’utilisateurs mensuels chez Meta, au-delà de 20 millions de dollars de chiffre d’affaires mensuel pour Mistral Medium 3.5, dès la première activité de revente d’accès au modèle pour Qwen3.8 Flash-Next. Et la politique d’usage de Llama 4 contient une clause que tout Européen doit lire : pour les modèles multimodaux de la famille, les droits ne sont pas accordés aux personnes domiciliées ou aux entreprises installées dans l’Union européenne, sauf en tant qu’utilisateurs finaux d’un produit qui les intègre. Llama 4 Scout et Maverick acceptant les images, ils sont concernés.
La qualité ensuite, et elle se mesure mieux qu’on ne le croit. Le classement français d’EuroEval, mis à jour le 20 septembre 2026, place parmi les modèles ouverts GLM-5.3-Flash au deuxième rang, Gemma 4 31B au quatrième, Qwen3.8 27B au cinquième, Mistral Small 3.2 au septième, et Llama 3.3 70B seulement au neuvième. Les votes de LMArena en français vont dans le même sens, avec des marges d’erreur plus larges.
Pour qui : une équipe qui veut un LLM ouvert en français, sous licence permissive, servi depuis la Suisse sans conservation des prompts.
À partir de : 0,20 le million de tokens en entrée et 0,40 en sortie pour Gemma 4 31B chez Infomaniak AI Services, 0,20 et 0,75 pour Mistral Small 4, en francs suisses ou en euros hors taxes.
Pour démarrer : activer Infomaniak AI Services et comparer Gemma 4, Mistral Small 4 et Qwen3.5 sur une dizaine de vos prompts réels.
Meilleur LLM open source 2026 : licence, français et taille, modèle par modèle
| Modèle | Taille | Licence | Rang EuroEval français | À savoir |
|---|---|---|---|---|
| GLM-5.3-Flash | 320 milliards, 18 actifs | MIT | 2 | très bon en français, trop gros pour une seule carte |
| Gemma 4 31B | 31 milliards | Apache 2.0 | 4 | meilleur compromis qualité et taille ; aussi en 26B à 4 milliards actifs |
| Qwen3.8 27B | 27 milliards | Apache 2.0 | 5 | contexte jusqu’à un million de tokens |
| Mistral Small 3.2 et Small 4 | 24 et 119 milliards, 6,5 actifs pour Small 4 | Apache 2.0 | 7 pour Small 3.2 | l’éditeur européen le plus établi |
| Llama 3.3 70B | 70 milliards | licence Llama | 9 | texte seul, obligation d’afficher « Built with Llama » |
| gpt-oss-120b | 117 milliards, 5,1 actifs | Apache 2.0 | 11 | rapide et bon marché chez OVHcloud et Scaleway |
| Apertus 1.5 70B | 72 milliards | Apache 2.0 | 12 | développé en Suisse par l’initiative Swiss AI |
| Llama 4 Scout et Maverick | 109 et 400 milliards | licence Llama 4 | non classé | droits exclus pour l’UE sur les modèles multimodaux |
Rangs EuroEval au 20 septembre 2026 : plus le chiffre est bas, meilleur est le modèle. Sur l’indice d’intelligence d’Artificial Analysis, qui ne mesure pas le français, les modèles ouverts les plus performants sont MiMo-V2.6-Pro (46,3), GLM-5.3 (44,8) et Kimi K3 (43,6) ; Gemma 4 31B obtient 19,0, Mistral Medium 3.5 14,2 et gpt-oss-120b 11,6.
La taille, enfin, se lit en deux chiffres. La mémoire nécessaire dépend du nombre total de paramètres ; la vitesse, du nombre de paramètres actifs à chaque token. Les modèles dits à mélange d’experts, comme Gemma 4 26B à 4 milliards actifs ou Qwen3.5 122B à 10 milliards actifs, occupent beaucoup de mémoire mais répondent vite. Pour un serveur à soi, un modèle dense de 27 à 31 milliards tient sur une carte de 48 Go en 8 bits ; pour une API, la taille n’est plus votre problème.
Mes recommandations, par usage. Pour un assistant généraliste en français, Gemma 4 31B ou Mistral Small 4. Pour du code, les modèles spécialisés de Qwen ou Kimi K2.6, servi chez Infomaniak dans sa catégorie code. Pour de la classification ou de l’extraction à grande échelle, gpt-oss-20b ou Nemotron 3 Nano, pour quelques centimes le million de tokens. Pour des documents très longs, Nemotron 3 Nano et son million de tokens de contexte. Et pour la meilleure qualité possible, sans contrainte de taille, GLM-5.3 ou Kimi K3 par API, en vérifiant où ils sont servis.
Si le modèle retenu ne tient pas sur votre carte
Un modèle de 70 milliards en 4 bits tient en 40 Go, pour une perte de qualité de quelques pour cent. Les formats et leurs pertes mesurées sont dans la quantisation GGUF, AWQ ou FP8.
Si vous voulez le servir vous-même
vLLM en production, Ollama pour le développement : le coût réel dépend surtout de la charge, comme le montre servir un LLM sur un GPU loué.
Si vous préférez l’appeler par API
Gemma 4, Mistral Small 4, Qwen3.5 et Apertus sont servis depuis Genève. Leur prix au million de tokens est dans la grille de l’API LLM suisse.