Retirer les noms avant d'envoyer le fichier : la méthode
Ou : remplacer « Martine Dupont » par « Cliente A » est une bonne idée, à condition de ne pas laisser son adresse trois lignes plus bas.
La réponse courte : remplacer les noms par des codes avant d’envoyer un document à une IA, c’est pseudonymiser, pas anonymiser. Pour vous, qui gardez la table de correspondance, les données restent personnelles et le RGPD continue de s’appliquer. Pour le fournisseur qui reçoit le texte, elles peuvent ne plus l’être, si rien ne lui permet de retrouver les personnes : c’est ce qu’a jugé la Cour de justice de l’Union le 4 septembre 2025. La méthode tient en six étapes, et des outils ouverts en français existent, à condition de relire leur travail. C’est la précaution la plus rentable pour protéger le trajet de vos données.
La différence entre les deux mots a des conséquences juridiques. L’article 4 du RGPD définit la pseudonymisation comme un traitement qui empêche d’attribuer les données à une personne « sans avoir recours à des informations supplémentaires » conservées à part. Le considérant 26 précise que ces données restent des données personnelles, et que seules les informations réellement anonymes sortent du règlement. La CNIL donne un exemple parlant : une base de CV où seuls le nom et le prénom sont remplacés par un numéro « est considérée comme pseudonymisée et non comme anonymisée ».
L’anonymisation véritable doit résister à trois tests : on ne peut plus isoler une personne, on ne peut plus relier ses données à une autre source, et on ne peut plus rien en déduire sur elle. Le comité européen de la protection des données a adopté le 7 juillet 2026 de nouvelles lignes directrices sur l’anonymisation, soumises à consultation jusqu’au 30 octobre 2026, qui reprennent ces trois critères et demandent d’apprécier l’anonymat du point de vue de chaque destinataire.
Pour qui : une entreprise qui veut envoyer des documents pseudonymisés à un LLM, chez un fournisseur qui ne conserve pas les requêtes, pour ajouter une seconde protection à la première.
À partir de : 0,20 CHF le million de tokens en entrée et 0,75 CHF en sortie pour Mistral Small 4 chez Infomaniak AI Services, hors taxes, avec un million de crédits offerts le premier mois.
Pour démarrer : pseudonymiser un premier lot de documents en local, activer Infomaniak AI Services, puis réinjecter les vrais noms dans les réponses, toujours en local.
Anonymiser des données avant l’IA : la méthode en six étapes et les outils
| Étape | Ce qu’on fait | Ce qu’on oublie souvent |
|---|---|---|
| 1. Inventorier | lister les champs du document : noms, adresses, numéros, dates, montants, lieux | les signatures de courriel, les en-têtes, les métadonnées du fichier |
| 2. Remplacer les identifiants directs | nom, courriel, téléphone, IBAN, numéro de registre national ou de sécurité sociale deviennent « Client 1 », « Courriel 1 » | les noms des tiers, conjoints, avocats, médecins |
| 3. Généraliser les identifiants indirects | une date devient un mois, une adresse une région, un montant une tranche | la combinaison qui trahit : « gérant d’une boulangerie de Dinant, 52 ans » |
| 4. Garder la table en local | la correspondance entre codes et identités reste sur votre machine, jamais dans le prompt | la table envoyée par erreur avec le fichier |
| 5. Relire | un humain vérifie le texte pseudonymisé avant l’envoi | les noms mal orthographiés, que la détection automatique rate |
| 6. Réinjecter | les vrais noms sont remis dans la réponse de l’IA, en local | la réponse archivée avec les codes et la table au même endroit |
Méthode construite à partir de l’avis 05/2014 du G29, de la page anonymisation de la CNIL et du RGPD, relus le 28 septembre 2026.
L’arrêt qui change la lecture date du 4 septembre 2025. Dans l’affaire C-413/23 P, la Cour de justice a jugé que des données pseudonymisées ne sont pas des données personnelles « en toute hypothèse et pour toute personne » : pour un destinataire qui ne peut ni lever la pseudonymisation ni recouper avec d’autres éléments, elles peuvent ne pas l’être. Mais la Cour ajoute que, pour l’entreprise qui envoie, l’obligation d’informer les personnes s’apprécie au moment de la collecte et de son propre point de vue. Autrement dit : pseudonymiser avant d’envoyer à une IA réduit le risque chez le fournisseur, sans vous dispenser du RGPD chez vous. L’arrêt porte sur le règlement qui s’applique aux institutions de l’Union, dont les notions s’interprètent comme celles du RGPD.
Les outils existent, ouverts et gratuits, mais aucun n’est clé en main pour le français.
| Outil | Licence | Ce qu’il sait faire en français |
|---|---|---|
| Presidio | MIT | configuré pour l’anglais par défaut ; en français, il faut lui adjoindre un modèle linguistique ; aucun détecteur propre aux numéros français ou belges |
| Modèles français de spaCy | LGPL-LR | repèrent personnes, lieux et organisations, pas les courriels ni les IBAN, à compléter par des expressions régulières |
| camembert-ner | MIT | même repérage des noms, validé selon son auteur sur des courriels et des conversations |
| LABEL et juritools, de la Cour de cassation | MIT | chaîne utilisée pour pseudonymiser les décisions de justice publiées, pensée pour ce corpus et non pour une PME |
Licences et versions relevées le 28 septembre 2026 dans les dépôts GitHub et sur Hugging Face. Presidio, créé par Microsoft, est en cours de transfert vers une organisation communautaire indépendante.
Mon conseil : pour quelques documents par semaine, un remplacement manuel guidé par le tableau ci-dessus, avec une relecture, vaut mieux qu’un outil mal configuré. Pour des volumes réguliers, Presidio avec un modèle français et quelques expressions régulières pour les numéros nationaux, toujours suivi d’une relecture humaine. Et dans tous les cas, un fournisseur qui ne conserve pas les requêtes : la pseudonymisation est une seconde ceinture, pas un parachute.
Si vous préparez des dossiers clients
La pseudonymisation n’est qu’une des protections d’un dossier client envoyé à l’IA. Les autres sont dans passer des données clients dans une IA.
Si vous ne voulez rien envoyer du tout
Un modèle qui tourne sur votre machine ne reçoit que ce que vous lui donnez, et ne le transmet à personne. Le coût réel est dans faire tourner l’IA sur sa machine.
Si vous voulez savoir ce que le fournisseur garde
Même pseudonymisé, un texte peut être conservé ou servir à l’entraînement. Les clauses de chaque assistant sont dans le tableau des clauses d’entraînement.