Choisir un logiciel d'anonymisation de documents : les 8 critères qui comptent
Pour choisir un logiciel d'anonymisation de documents, regardez d'abord où vos fichiers sont traités et qui garde la table qui relie chaque étiquette à un vrai nom. Vérifiez ensuite les formats lus, le traitement d'un dossier entier, la relecture, la suppression réelle à l'export, la réinjection des noms dans la réponse de l'IA et le prix. Pour chaque critère, voici la question à poser à l'éditeur.
Trois familles d'outils, trois chemins pour vos fichiers
Les outils d'anonymisation de documents se rangent en trois familles ; votre fichier n'y suit pas le même chemin.
- Les services en ligne. Vous déposez le fichier sur une page web ; il part sur les serveurs de l'éditeur, y est traité, puis vous revient. Rien à installer, mais le document quitte votre poste. Si l'éditeur affirme que tout se passe dans le navigateur, demandez comment le vérifier.
- Les extensions de navigateur. Elles agissent sur les pages web, par exemple pour masquer un texte avant qu'il parte vers un assistant IA. Selon leur conception, le traitement se fait dans le navigateur ou sur un serveur de l'éditeur. Regardez les autorisations demandées à l'installation.
- Les logiciels de bureau. Installés sur l'ordinateur, ils peuvent traiter les fichiers sur place. Mais installé ne veut pas dire hors ligne : une partie du travail peut partir vers un serveur.
La famille ne suffit donc pas : seul compte le comportement réel de l'outil. Pour un PDF isolé, voir notre comparatif anonymiser un PDF en ligne ou en local.
Les 8 critères pour choisir un logiciel d'anonymisation
1. Où le document est traité
Pourquoi c'est important. Sur un serveur, le fichier a quitté votre poste, ne serait-ce que le temps du traitement : il peut y être journalisé, sauvegardé ou conservé. Traité sur l'ordinateur, il ne quitte pas le disque. De ce lieu dépend aussi, en principe, la question de la sous-traitance au sens du RGPD (voir plus bas).
La question à poser : mon fichier, ou son texte, quitte-t-il mon ordinateur pendant le traitement ? Si oui, vers quels serveurs, dans quel pays, et pour combien de temps ?
2. Où reste la table de correspondance
Pourquoi c'est important. Remplacer « Camille Durand » par [PERSONNE_1] ne coupe pas le lien : une table dit qui se cache derrière chaque étiquette. Pour le RGPD, il n'y a pseudonymisation que si ces « informations supplémentaires » sont « conservées séparément » (article 4, point 5). Qui détient la table peut ré-identifier tout le dossier : si elle reste chez l'éditeur ou part avec les copies, la protection tombe. Et tant qu'elle existe, il s'agit de pseudonymisation, pas d'anonymisation.
La question à poser : où la table est-elle stockée, qui peut la lire, est-elle chiffrée, et part-elle avec les copies exportées ?
3. Ce que le logiciel envoie sur le réseau
Pourquoi c'est important. Un logiciel installé peut se connecter pour vérifier une licence ou un compte, envoyer des statistiques d'usage (la télémétrie) ou faire fonctionner un chat IA hébergé dans le cloud. Ce dernier cas pèse le plus : le texte de vos pièces part alors vers un serveur, qui peut appartenir à un autre fournisseur.
La question à poser : quelles connexions le logiciel ouvre-t-il, quand, et avec quel contenu ? Fonctionne-t-il réseau coupé ? Si un chat IA est intégré, où part le texte ?
4. Les formats lus
Pourquoi c'est important. Chaque format a ses pièges. Un PDF scanné est une image : sans reconnaissance de caractères (OCR), le logiciel n'y voit aucun nom, et une erreur de lecture peut en laisser passer un (voir anonymiser un PDF scanné). Un Word peut contenir des commentaires et un suivi des modifications, un tableur des colonnes de noms, un e-mail des en-têtes et des pièces jointes. Partez de vos dossiers réels : jugements et pièces scannées dans un cabinet d'avocats, balances et tableurs chez un expert-comptable.
La question à poser : quels formats lisez-vous réellement, scans compris, et que devient un fichier que vous ne savez pas lire : signalé, ignoré ou recopié tel quel ?
5. Le traitement d'un dossier entier, avec des étiquettes stables
Pourquoi c'est important. Traité fichier par fichier, un même nom peut devenir [PERSONNE_1] dans une pièce et [PERSONNE_3] dans la suivante : l'IA croit alors avoir affaire à deux personnes, et son analyse se trompe. Les variantes posent le même problème : « Camille Durand », « Mme Durand » et « C. Durand » peuvent désigner la même personne. Des étiquettes stables sur tout le dossier gardent la logique de l'affaire ; une étiquette renommée, comme [PERSONNE_CLIENTE], la rend plus lisible.
La question à poser : une même personne garde-t-elle la même étiquette dans toutes les pièces, variantes comprises ? Peut-on déposer un dossier entier et renommer une étiquette ?
6. La relecture avant export, et une suppression réelle
Pourquoi c'est important. Aucune détection automatique n'est parfaite. L'outil doit montrer l'original et la copie côte à côte, permettre de masquer un passage oublié et bloquer l'export tant que la pièce n'est pas validée. À l'export, recouvrir ne suffit pas : un rectangle noir posé sur un PDF peut laisser le texte dessous, lisible par copier-coller (voir pourquoi un rectangle noir ne suffit pas). Les propriétés du fichier, comme l'auteur, peuvent aussi contenir un nom : voir les métadonnées d'un PDF.
La question à poser : le texte masqué est-il supprimé du fichier, ou seulement recouvert ? Les métadonnées et annotations sont-elles retirées ? Peut-on exporter une pièce non relue ?
7. La réinjection des vrais noms dans la réponse de l'IA
Pourquoi c'est important. Si vous pseudonymisez pour travailler avec une IA, sa réponse revient avec [PERSONNE_1] et [ORGANISATION_2]. À la main, remettre les vrais noms est long et source d'erreurs. L'outil devrait le faire avec la table de correspondance, sur votre poste, avec un aperçu avant d'enregistrer. Encore faut-il que l'IA garde les étiquettes intactes : une consigne à lui donner y aide, et une étiquette modifiée doit être signalée, pas devinée.
La question à poser : pouvez-vous remettre les vrais noms dans la réponse de l'IA ? Où, sur quels formats (texte, Word, PDF), et que se passe-t-il si l'IA a modifié une étiquette ?
8. Le prix et le modèle de licence
Pourquoi c'est important. Un logiciel d'anonymisation se paie par poste, à la page ou au document. Un prix à la page paraît modeste sur un essai, puis grimpe avec un dossier de plusieurs centaines de pages. Un prix par poste sans plafond se prévoit, quel que soit le volume. Et une licence vérifiée en ligne vous ramène au critère 3.
La question à poser : que paie-t-on exactement, avec quels plafonds, et combien sur un an avec mon volume réel ? La licence se vérifie-t-elle en ligne ?
Sous-traitance RGPD : ce que change le lieu du traitement
Le RGPD appelle sous-traitant l'organisme qui « traite des données à caractère personnel pour le compte du responsable du traitement » (article 4, point 8). Un service qui anonymise vos documents sur ses serveurs entre, en principe, dans cette définition.
Selon l'article 28, vous ne pouvez faire appel qu'à des sous-traitants « qui présentent des garanties suffisantes ». La relation est régie par un contrat écrit, qui prévoit notamment la suppression ou la restitution des données en fin de prestation. Et le prestataire ne recrute pas d'autre sous-traitant sans votre autorisation écrite préalable. Demandez donc ce contrat, et la liste de ses propres sous-traitants.
Avec un logiciel qui traite tout sur votre poste, l'éditeur ne reçoit pas vos documents : pour cette étape, il ne traite en principe aucune donnée pour votre compte, et la question de la sous-traitance ne se pose pas. Elle revient si le logiciel envoie du texte ailleurs, vers une IA intégrée par exemple. Quant à la copie confiée ensuite à une IA, elle est pseudonymisée, pas anonyme : selon la CNIL, de telles données « conservent donc un caractère personnel ».
Les 8 questions, et les réponses d'AnonymFiles
Nos réponses pour AnonymFiles, bientôt disponible pour Mac (puce Apple) et Windows. Posez les mêmes questions aux autres éditeurs.
| Critère | La question à poser | La réponse d'AnonymFiles |
|---|---|---|
| 1. Lieu du traitement | Mon fichier quitte-t-il mon ordinateur pendant le traitement ? | Non : tout se fait sur l'ordinateur. |
| 2. Table de correspondance | Où est-elle, et part-elle avec les copies ? | Sur votre ordinateur, jamais dans l'export. Pas encore chiffrée par l'application : activez le chiffrement du disque. |
| 3. Réseau | Quelles connexions, et avec quel contenu ? | Ni compte, ni télémétrie, ni vérification de licence, ni chat IA. Sur Mac, aucune connexion : les modèles sont inclus. Sur Windows, ils se téléchargent une seule fois, au premier traitement, sans texte de document. |
| 4. Formats | Quels formats lisez-vous, et que devient le reste ? | PDF texte (10 Mo maximum), Word .docx, .txt et .md. Ni les scans (lecture en préparation), ni Excel, ni les e-mails : ils sont signalés et exclus. La copie d'un Word est un texte (Markdown), sans commentaires, suivi des modifications ni images. |
| 5. Dossier entier | Une même personne garde-t-elle la même étiquette partout ? | Oui, sur tout le dossier, sous-dossiers compris. Une étiquette se renomme, par exemple [PERSONNE_CLIENTE]. |
| 6. Relecture et export | Le texte masqué est-il supprimé, métadonnées comprises ? | Oui : le contenu masqué est supprimé ; métadonnées, annotations, formulaires et liens sont retirés, et les noms de fichiers deviennent neutres. Chaque pièce est relue côte à côte avec l'original et validée avant l'export ; les montants se masquent à la main, d'un clic, pour tout le dossier. Les copies PDF, en option, sont générées à partir du texte traité, sans la mise en page d'origine. |
| 7. Réinjection | Pouvez-vous remettre les vrais noms dans la réponse de l'IA ? | Oui, dans la réponse texte (collée, ou fichier .txt ou .md), sur l'ordinateur, avec un aperçu ; pas encore dans un Word ou un PDF. Une consigne à coller dans l'IA lui demande de garder les étiquettes. |
| 8. Prix | Que paie-t-on, et pour quel volume ? | Par poste et par an, sans limite de pages : 290 € HT pour 1 ou 2 postes, 240 € HT par poste dès 3 postes, sur devis au-delà de 20. |
La détection automatique repère noms de personnes, organisations, adresses, e-mails, téléphones au format français, IBAN de neuf pays européens, dates privées et numéros d'identifiant. Aucune détection n'étant parfaite, chaque pièce se relit avant l'export : voir comment fonctionne AnonymFiles, étape par étape.
Vérifier les réponses pendant l'essai
Quatre tests, valables pour tout outil :
- Un dossier fictif. Testez avec de faux documents, jamais avec un vrai dossier client.
- Le réseau coupé. Après une première utilisation, coupez le Wi-Fi et relancez un traitement : un outil local fonctionne de la même façon. Un pare-feu applicatif montre les connexions tentées.
- Le copier-coller. Dans un PDF exporté, sélectionnez une zone masquée et collez-la dans un éditeur de texte : rien ne doit réapparaître.
- Le dossier d'export. Aucun vrai nom ne doit figurer dans les métadonnées, les noms de fichiers ou une table jointe.
Pour AnonymFiles, la page sécurité et périmètre réseau détaille ces vérifications.
Questions fréquentes
Quel est le meilleur logiciel d'anonymisation de documents ?
Celui qui répond aux huit critères pour vos dossiers : il traite les fichiers là où vous l'acceptez, laisse la table de correspondance chez vous, lit vos formats réels et supprime vraiment ce qu'il masque. Éditeur d'AnonymFiles, nous ne publions pas de classement.
Quelle différence entre un logiciel d'anonymisation et un logiciel de pseudonymisation ?
Un logiciel qui remplace les noms par des étiquettes et garde une table de correspondance fait de la pseudonymisation : avec la table, on retrouve les personnes, et les données restent personnelles au sens du RGPD. L'anonymisation rend l'identification impossible en pratique, de manière irréversible.
Un service d'anonymisation en ligne est-il interdit par le RGPD ?
Non. Le RGPD permet de confier un traitement à un prestataire. Mais un service qui traite vos documents sur ses serveurs est en principe votre sous-traitant : il doit présenter des garanties suffisantes, et un contrat écrit encadre la relation (article 28).
Peut-on anonymiser un PDF scanné avec un logiciel ?
Oui, si le logiciel reconnaît d'abord les caractères de l'image (OCR) ; sans cela, il n'y voit aucun nom. AnonymFiles ne lit pas encore les scans : il les signale et les exclut de l'export, et leur lecture est en préparation.
Combien coûte un logiciel d'anonymisation de documents ?
Cela dépend du modèle : par poste et par an, à la page ou au document, à comparer sur votre volume annuel réel. AnonymFiles, bientôt disponible, coûtera 290 € HT par an et par poste pour 1 ou 2 postes, 240 € HT par an et par poste dès 3 postes, et sera sur devis au-delà de 20 postes.