Québec, Canada

403-1381 1re Avenue

+1 581.849.27.96

bdgouthiere@gmail.com

Choisir son modèle ouvert : Llama, Mistral, Qwen selon l'usage

Ou : le meilleur modèle ouvert n’est ni américain ni européen, et le plus connu n’est plus le bon choix.

La réponse courte : en septembre 2026, les modèles ouverts les plus performants sont chinois, GLM-5.3, Kimi K3 ou MiMo-V2.6, mais leur taille les réserve aux API. Pour un usage courant en français, trois familles de taille moyenne, toutes sous licence Apache 2.0, font le meilleur compromis : Gemma 4 de Google, Qwen3.x d’Alibaba et Mistral Small 4. Llama, longtemps la référence, a décroché dans les classements, et la licence de Llama 4 exclut les entreprises installées dans l’Union européenne pour ses modèles multimodaux. Le bon modèle se choisit sur trois critères, dans cet ordre : la licence, la qualité en français sur votre usage, puis la taille. C’est la décision qui précède toutes les autres parmi les LLM qui restent en Europe.

La licence d’abord, parce qu’elle peut disqualifier un modèle avant même de l’avoir essayé. Apache 2.0 et MIT autorisent tout usage commercial sans condition. Les licences maison ajoutent des clauses : au-delà de 700 millions d’utilisateurs mensuels chez Meta, au-delà de 20 millions de dollars de chiffre d’affaires mensuel pour Mistral Medium 3.5, dès la première activité de revente d’accès au modèle pour Qwen3.8 Flash-Next. Et la politique d’usage de Llama 4 contient une clause que tout Européen doit lire : pour les modèles multimodaux de la famille, les droits ne sont pas accordés aux personnes domiciliées ou aux entreprises installées dans l’Union européenne, sauf en tant qu’utilisateurs finaux d’un produit qui les intègre. Llama 4 Scout et Maverick acceptant les images, ils sont concernés.

La qualité ensuite, et elle se mesure mieux qu’on ne le croit. Le classement français d’EuroEval, mis à jour le 20 septembre 2026, place parmi les modèles ouverts GLM-5.3-Flash au deuxième rang, Gemma 4 31B au quatrième, Qwen3.8 27B au cinquième, Mistral Small 3.2 au septième, et Llama 3.3 70B seulement au neuvième. Les votes de LMArena en français vont dans le même sens, avec des marges d’erreur plus larges.

Pour qui : une équipe qui veut un LLM ouvert en français, sous licence permissive, servi depuis la Suisse sans conservation des prompts.

À partir de : 0,20 le million de tokens en entrée et 0,40 en sortie pour Gemma 4 31B chez Infomaniak AI Services, 0,20 et 0,75 pour Mistral Small 4, en francs suisses ou en euros hors taxes.

Pour démarrer : activer Infomaniak AI Services et comparer Gemma 4, Mistral Small 4 et Qwen3.5 sur une dizaine de vos prompts réels.

Meilleur LLM open source 2026 : licence, français et taille, modèle par modèle

ModèleTailleLicenceRang EuroEval françaisÀ savoir
GLM-5.3-Flash320 milliards, 18 actifsMIT2très bon en français, trop gros pour une seule carte
Gemma 4 31B31 milliardsApache 2.04meilleur compromis qualité et taille ; aussi en 26B à 4 milliards actifs
Qwen3.8 27B27 milliardsApache 2.05contexte jusqu’à un million de tokens
Mistral Small 3.2 et Small 424 et 119 milliards, 6,5 actifs pour Small 4Apache 2.07 pour Small 3.2l’éditeur européen le plus établi
Llama 3.3 70B70 milliardslicence Llama9texte seul, obligation d’afficher « Built with Llama »
gpt-oss-120b117 milliards, 5,1 actifsApache 2.011rapide et bon marché chez OVHcloud et Scaleway
Apertus 1.5 70B72 milliardsApache 2.012développé en Suisse par l’initiative Swiss AI
Llama 4 Scout et Maverick109 et 400 milliardslicence Llama 4non classédroits exclus pour l’UE sur les modèles multimodaux

Rangs EuroEval au 20 septembre 2026 : plus le chiffre est bas, meilleur est le modèle. Sur l’indice d’intelligence d’Artificial Analysis, qui ne mesure pas le français, les modèles ouverts les plus performants sont MiMo-V2.6-Pro (46,3), GLM-5.3 (44,8) et Kimi K3 (43,6) ; Gemma 4 31B obtient 19,0, Mistral Medium 3.5 14,2 et gpt-oss-120b 11,6.

La taille, enfin, se lit en deux chiffres. La mémoire nécessaire dépend du nombre total de paramètres ; la vitesse, du nombre de paramètres actifs à chaque token. Les modèles dits à mélange d’experts, comme Gemma 4 26B à 4 milliards actifs ou Qwen3.5 122B à 10 milliards actifs, occupent beaucoup de mémoire mais répondent vite. Pour un serveur à soi, un modèle dense de 27 à 31 milliards tient sur une carte de 48 Go en 8 bits ; pour une API, la taille n’est plus votre problème.

Mes recommandations, par usage. Pour un assistant généraliste en français, Gemma 4 31B ou Mistral Small 4. Pour du code, les modèles spécialisés de Qwen ou Kimi K2.6, servi chez Infomaniak dans sa catégorie code. Pour de la classification ou de l’extraction à grande échelle, gpt-oss-20b ou Nemotron 3 Nano, pour quelques centimes le million de tokens. Pour des documents très longs, Nemotron 3 Nano et son million de tokens de contexte. Et pour la meilleure qualité possible, sans contrainte de taille, GLM-5.3 ou Kimi K3 par API, en vérifiant où ils sont servis.

Chaque modèle ouvre une serrure différente : la licence dit lesquelles vous avez le droit d'ouvrir.

Si le modèle retenu ne tient pas sur votre carte

Un modèle de 70 milliards en 4 bits tient en 40 Go, pour une perte de qualité de quelques pour cent. Les formats et leurs pertes mesurées sont dans la quantisation GGUF, AWQ ou FP8.

Si vous voulez le servir vous-même

vLLM en production, Ollama pour le développement : le coût réel dépend surtout de la charge, comme le montre servir un LLM sur un GPU loué.

Si vous préférez l’appeler par API

Gemma 4, Mistral Small 4, Qwen3.5 et Apertus sont servis depuis Genève. Leur prix au million de tokens est dans la grille de l’API LLM suisse.