Interroger vos documents internes sans qu'ils quittent l'Europe
Ou : comment donner à un modèle de langage la mémoire de votre entreprise, sans lui confier la clé du coffre.
La réponse courte : un RAG, ou génération augmentée par récupération, découpe vos documents en passages, les transforme en vecteurs avec un modèle d’embeddings, les range dans une base vectorielle, puis retrouve les passages pertinents à chaque question pour les fournir au LLM. Chaque brique existe en version européenne ou ouverte : embeddings et reclassement chez Infomaniak ou OVHcloud, ou bge-m3 sous licence MIT sur votre serveur, base vectorielle pgvector ou Qdrant, société berlinoise, et un LLM servi en Suisse. Indexer 10 000 documents coûte moins d’un franc d’embeddings ; la vraie difficulté est le découpage, pas le prix. C’est l’usage où une API LLM hébergée en Europe prend tout son sens, parce que ce sont vos documents qui circulent.
Le principe tient en deux temps. À l’indexation, chaque document est découpé en passages, chaque passage est converti en un vecteur de quelques centaines à quelques milliers de nombres, et ces vecteurs sont stockés. À la question, la question est convertie de la même façon, la base renvoie les passages dont les vecteurs sont les plus proches, un reclassement optionnel trie les meilleurs, et le LLM rédige la réponse à partir de ces passages seulement. Le modèle n’apprend rien de vos documents : il les lit, question par question.
C’est aussi ce qui rend la localisation cruciale. Dans un RAG, ce ne sont pas des prompts inventés qui circulent, mais des extraits de contrats, de procédures internes, de dossiers clients. Si l’embedding, le reclassement et la génération se font chez un même hébergeur suisse ou européen, et la base vectorielle sur vos serveurs, aucun passage ne quitte l’Europe.
Pour qui : une entreprise qui veut un assistant capable de répondre à partir de ses documents internes, sans que ces documents quittent la Suisse ou l’Europe.
À partir de : 0,07 le million de tokens pour les embeddings Qwen3-Embedding-8B, 0,01 pour le reclassement et 0,20 en entrée pour Mistral Small 4 chez Infomaniak AI Services, en francs suisses ou en euros hors taxes.
Pour démarrer : activer Infomaniak AI Services, indexer un petit lot de documents avec son modèle d’embeddings, et interroger le tout avec un LLM du même catalogue.
RAG sur données d’entreprise avec un LLM européen : les briques et leur coût
| Brique | Options européennes ou ouvertes | Licence ou hébergement | À savoir |
|---|---|---|---|
| Embeddings | Qwen3-Embedding-8B et BGE Multilingual Gemma2 chez Infomaniak, bge-m3 chez OVHcloud | Suisse, France | 0,07 et 0,065 le million chez Infomaniak, 0,01 € chez OVHcloud |
| Embeddings à héberger soi-même | bge-m3, multilingual-e5-large, Qwen3-Embedding | MIT, MIT, Apache 2.0 | bge-m3 : 1 024 dimensions, 8 192 tokens par passage |
| Reclassement | bge-reranker-v2-m3, Qwen3-Reranker | Apache 2.0, aussi chez Infomaniak | 0,01 et 0,009 le million chez Infomaniak |
| Base vectorielle | pgvector, Qdrant, Chroma | licence PostgreSQL, Apache 2.0, Apache 2.0 | Qdrant est édité par une société berlinoise |
| LLM | Mistral Small 4, Gemma 4, Qwen3.5 | Apache 2.0, servis en Suisse | contextes de 100 000 à 256 000 tokens |
Deux mises en garde sur les licences. Les modèles d’embeddings et de reclassement de Jina sont publiés sous licence non commerciale, inutilisables dans un produit d’entreprise sans accord. Et Weaviate a changé de licence le 26 août 2026 pour une partie de son code, désormais propriétaire : pour une base entièrement ouverte, pgvector ou Qdrant sont plus simples.
Le découpage décide de la qualité bien plus que le choix du LLM. Le guide de Hugging Face sur le RAG avancé recommande des passages de la taille maximale acceptée par le modèle d’embeddings, 512 tokens dans son exemple, avec un chevauchement d’environ un dixième, puis un reclassement des trente meilleurs résultats pour n’en garder que cinq. Découper trop court perd le contexte, trop long dilue le sens : une procédure de dix étapes coupée au milieu produit une réponse fausse, avec une assurance parfaite.
Un piège technique concerne la dimension des vecteurs. pgvector n’indexe les vecteurs classiques que jusqu’à 2 000 dimensions, 4 000 en demi-précision, selon sa documentation ; or Qwen3-Embedding-8B en produit 4 096. Il faut alors réduire la dimension, ce que ce modèle permet, ou choisir bge-m3 et ses 1 024 dimensions. Et changer de modèle d’embeddings impose de recalculer toute la base : ce choix se fait une fois, au début.
Côté coût, le RAG est étonnamment bon marché. Indexer 10 000 documents d’environ mille tokens représente 10 millions de tokens, soit 0,70 avec Qwen3-Embedding-8B chez Infomaniak. Chaque question envoie ensuite au LLM cinq passages de 512 tokens et la question, environ 3 000 tokens, et reçoit une réponse de quelque 300 tokens : mille questions par jour ouvré reviennent à une vingtaine de francs par mois avec Mistral Small 4. Le vrai coût est ailleurs, dans le temps passé à nettoyer les documents, et dans une règle qu’on oublie trop souvent : un RAG ne doit renvoyer à un utilisateur que les passages des documents qu’il a le droit de lire, ce qui se règle par un filtre sur les métadonnées à chaque recherche.
Si vous partez d’une application OpenAI existante
Un RAG construit sur les embeddings d’OpenAI doit être réindexé en changeant de fournisseur. Les autres pièges de la bascule sont dans migrer vers un LLM européen.
Si vous voulez tout héberger vous-même
Embeddings, reclassement et LLM peuvent tourner sur un GPU loué, avec vLLM. La facture dépend surtout de la charge, comme le montre un LLM sur votre propre GPU.
Si vous voulez le détail des prix suisses
Embeddings, reclassement, LLM et transcription ont chacun leur tarif au million de tokens ou à la minute, dans la grille d’Infomaniak AI Services.