Vérifier qu'un PDF est vraiment anonymisé : 6 tests avant de l'envoyer
Pour vérifier qu'un PDF est vraiment anonymisé, testez le fichier lui-même, pas son apparence à l'écran. Copiez-collez le texte sous les zones noircies, cherchez chaque nom et ses variantes, lisez les métadonnées, ouvrez les couches cachées, contrôlez le nom du fichier, puis relisez en entier le texte extrait, celui que lira une IA. Si un seul de ces six tests fait réapparaître un nom, le fichier ne part pas.
Avant de commencer : tester le bon fichier
Testez le fichier qui partira, une fois fermé puis rouvert. Dans Aperçu, un caviardage reste modifiable tant que le document est ouvert et devient permanent à sa fermeture. Dans Acrobat Pro, le document biffé et assaini est enregistré dans un nouveau fichier : c'est lui qu'il faut vérifier.
Notez ensuite ce qui ne doit plus apparaître : noms, sociétés, adresses, e-mails, téléphones, numéros de dossier. Outils utilisés : Aperçu (Mac), Acrobat Reader, gratuit sur Mac et Windows, et trois outils libres en ligne de commande, exiftool, qpdf et pdftotext. Le caviardage lui-même est détaillé dans caviarder un PDF sur Mac avec Aperçu ou Acrobat.
Test 1 : copier-coller le texte sous les zones noircies
Pourquoi. Un rectangle noir dessiné sur une page cache le texte sans le retirer : il reste sélectionnable dessous. C'est le piège décrit dans pourquoi un rectangle noir laisse le texte lisible.
Comment.
- Sur Mac, dans Aperçu : Outils › Sélection de texte, faites glisser le curseur sur chaque zone noire en débordant un peu, puis Édition › Copier, et collez dans TextEdit.
- Sur Windows, dans Acrobat Reader : clic droit sur la page, Outil Sélection, même geste, clic droit sur la sélection, Copier, puis collez dans le Bloc-notes.
Une interdiction de copier empêche ce test, mais ne retire pas le texte du fichier.
Ce qui doit être vrai : le collage ne contient aucun passage masqué ; à sa place, rien, ou une étiquette comme [PERSONNE_1]. Sinon, repartez de l'original et utilisez un outil qui supprime le texte (« Biffer un PDF » dans Acrobat Pro, « Sélection du caviardage » dans Aperçu), comme expliqué dans caviarder un PDF de façon fiable.
Test 2 : chercher chaque nom et ses variantes
Pourquoi. Un caviardage manuel oublie facilement une occurrence : un en-tête, une note de bas de page, une annexe, un nom écrit autrement. La recherche les retrouve, à condition de chercher toutes les formes.
Comment. Pour chaque personne, cherchez le nom seul, le prénom et le nom, les initiales, le nom d'usage, la forme sans accents, l'adresse e-mail, le téléphone sous plusieurs écritures (06…, +33 6…) et le numéro de dossier. Cherchez aussi les premières lettres du nom : elles attrapent un nom coupé en fin de ligne ou mal orthographié.
- Sur Mac : le champ de recherche de la barre d'outils d'Aperçu.
- Sur Windows, dans Acrobat Reader : Ctrl + F (Commande + F sur Mac) ouvre la barre Rechercher. La recherche avancée (Édition › Recherche avancée) l'étend aux commentaires et aux signets.
Ce qui doit être vrai : zéro résultat pour chaque terme, dans les pages, les commentaires et les signets.
Test 3 : lire les métadonnées (propriétés et XMP)
Pourquoi. Un PDF garde des propriétés que l'écran n'affiche pas : titre, auteur, sujet, mots-clés, logiciel de création. Elles peuvent exister en double, dans les propriétés du document et dans un bloc XMP. Un titre comme « Conclusions DUPONT c. MARTIN » survit au caviardage des pages : comme le rappelle l'aide d'Acrobat, « la biffure supprime uniquement le texte et les images visibles ».
Comment.
- Sur Mac, dans Aperçu : Outils › Afficher l'inspecteur montre notamment l'auteur, et l'inspecteur des mots-clés, les mots-clés.
- Sur Windows et sur Mac, dans Acrobat Reader : clic droit, Propriétés du document, onglet Description. Dans Acrobat, le bouton Métadonnées supplémentaires, puis Avancé, affiche les métadonnées intégrées.
- En ligne de commande, avec exiftool (gratuit, pour Mac et Windows) :
exiftool -a -G1 fichier.pdfliste tout, groupe par groupe : [PDF] pour les propriétés, [XMP-…] pour le XMP. Attention, Creator désigne le logiciel dans le groupe PDF, mais l'auteur dans le groupe XMP-dc. Sous Windows, glisser le PDF sur exiftool(-k).exe affiche aussi la liste.
Ce qui doit être vrai : aucun nom ni référence de dossier dans ces champs ; le nom du logiciel peut rester. Si les métadonnées ont été effacées avec exiftool, le fichier doit avoir été réécrit ensuite, par exemple avec qpdf --linearize entree.pdf sortie.pdf : la documentation d'exiftool prévient que « ExifTool alone may not be used to securely edit metadata in PDF files ». Sans réécriture, les anciennes valeurs restent dans le fichier, même quand exiftool ne les affiche plus. Pour corriger, voir supprimer les métadonnées d'un PDF, ou « Assainir le document » dans Acrobat Pro.
Test 4 : ouvrir les couches cachées
Pourquoi. Un PDF transporte plus que ses pages : commentaires et annotations, qui portent un nom d'auteur, champs de formulaire, pièces jointes, calques masqués, signets. L'aide d'Acrobat les range parmi les « types de données pouvant être masquées ». Et Apple précise que, dans Aperçu, les entrées de la table des matières « qui renvoient à du texte caviardé ne sont pas supprimées ».
Comment.
- Sur Windows et sur Mac, dans Acrobat Reader : ouvrez un à un les panneaux latéraux Commentaires, Signets, Pièces jointes et Calques. S'ils manquent : Menu › Afficher › Afficher/Masquer › Panneaux latéraux (Affichage › Afficher/Masquer › Panneaux latéraux sur Mac). Une barre de message mauve signale des champs à remplir.
- Sur Mac, dans Aperçu : l'inspecteur des annotations liste les annotations, et Présentation › Table des matières affiche les signets du PDF.
- En ligne de commande :
qpdf --list-attachments fichier.pdfliste les pièces jointes. - Dans Acrobat Pro : Tous les outils › Biffer un PDF › Assainir le document › Supprimer de manière sélective affiche les informations masquées trouvées, à cocher pour les supprimer.
Ce qui doit être vrai : aucun commentaire, aucune pièce jointe, aucun champ rempli, aucun calque masqué, et des signets sans nom. Regardez aussi les liens : une adresse e-mail ou un chemin de fichier peut contenir un nom.
Test 5 : vérifier le nom du fichier et son chemin
Pourquoi. Le nom du fichier voyage avec lui : il s'affiche dans la pièce jointe d'un e-mail et dans la conversation quand vous déposez le PDF dans une IA. « Conclusions DUPONT c MARTIN v3.pdf » défait tout le caviardage. Si vous envoyez un dossier, le nom de chaque sous-dossier part avec lui.
Comment.
- Sur Mac, dans le Finder : sélectionnez le fichier et appuyez sur Retour pour le renommer ; Présentation › Afficher la barre du chemin d'accès montre les dossiers qui le contiennent.
- Sur Windows, dans l'Explorateur de fichiers : F2 renomme l'élément sélectionné, Alt + Entrée affiche ses propriétés.
Ce qui doit être vrai : un nom neutre (piece-03.pdf), dans un dossier au nom neutre, et un titre de document (test 3) qui ne reprend pas l'ancien nom. Mieux vaut produire les copies dans un nouveau dossier que renommer les originaux.
Test 6 : relire le texte que lira l'IA
Pourquoi. Une IA lit le texte du fichier, pas seulement la page affichée. Pour un PDF, avec ses modèles qui lisent les images, l'API d'OpenAI « extracts both text and page images and sends both to the model » : le texte et l'image des pages. La documentation d'Anthropic décrit la même chose pour Claude. Or ce texte extrait comprend aussi ce que l'écran ne montre pas : texte transparent, recouvert par un autre contenu ou de la couleur du fond.
Comment. Extrayez tout le texte, puis lisez-le d'un bout à l'autre, en-têtes, pieds de page et annexes compris.
- Sur Mac : pdftotext, de la suite libre Poppler (avec Homebrew :
brew install poppler). La commandepdftotext piece.pdfcrée piece.txt à côté du PDF ; l'option-layoutconserve à peu près la mise en page. - Sur Windows, dans Acrobat Reader : Édition › Copier le fichier dans le Presse-papiers, puis collez dans le Bloc-notes. Autre voie : Fichier › Enregistrer sous un autre › Texte.
Ce qui doit être vrai : le texte se lit en entier sans un nom, un numéro ou un détail qui permette de reconnaître quelqu'un. Relancez-y la recherche du test 2. C'est aussi là qu'apparaissent les identifiants indirects : un lieu, une date précise, une fonction unique. La suite de la démarche est dans anonymiser un document avant de l'envoyer à ChatGPT.
Les 6 tests en un tableau
| Test | Sur Mac | Sur Windows | Ce qui doit être vrai |
|---|---|---|---|
| 1. Copier-coller sous les zones noires | Aperçu, Sélection de texte, Copier | Acrobat Reader, Outil Sélection, Copier | Aucun passage masqué dans le collage |
| 2. Noms et variantes | Champ de recherche d'Aperçu | Ctrl + F, puis Recherche avancée | Zéro résultat, commentaires et signets compris |
| 3. Métadonnées | Inspecteur d'Aperçu, exiftool | Propriétés du document, exiftool | Aucun nom dans les propriétés ni le XMP |
| 4. Couches cachées | Inspecteur des annotations, table des matières | Panneaux Commentaires, Signets, Pièces jointes, Calques | Rien de caché qui identifie quelqu'un |
| 5. Nom et chemin | Finder : Retour, barre du chemin d'accès | Explorateur : F2, Alt + Entrée | Fichier et dossier aux noms neutres |
| 6. Texte lu par l'IA | pdftotext piece.pdf | Copier le fichier dans le Presse-papiers | Relu en entier, sans identifiant direct ni indirect |
PDF scannés : pas de texte, sauf un calque OCR
Un scan est une image : sans calque de texte, les tests 1, 2 et 6 ne trouvent rien, ce qui ne prouve rien. Deux pièges. D'abord, un scanner ou un logiciel d'OCR peut avoir ajouté sous l'image un calque de texte invisible : si le copier-coller ou pdftotext rendent du texte, ce calque existe et se caviarde comme un PDF texte. Ensuite, l'IA reçoit aussi l'image des pages : un nom lisible sur l'image peut être lu. Le masquage doit donc être incrusté dans l'image, et les tests 3, 4 et 5 restent valables. La méthode complète est dans anonymiser un PDF scanné ou une photo de document.
Ce que fait AnonymFiles, et pourquoi relire reste nécessaire
AnonymFiles est une application de bureau, bientôt disponible pour Mac (puce Apple) et Windows, qui caviarde un dossier entier sur votre ordinateur : PDF texte, Word (.docx), .txt et .md. À l'export, elle prend en charge ce que plusieurs de ces tests vérifient. Le contenu masqué est réellement supprimé, pas recouvert. Les métadonnées, annotations, formulaires et liens sont retirés. Les copies arrivent dans un nouveau dossier, avec des noms de fichiers neutres et un index des pièces exportées et exclues ; la table de correspondance entre étiquettes et vrais noms reste sur votre ordinateur, jamais dans l'export. Un PDF texte est exporté en PDF reconstruit, d'où le contenu masqué est supprimé ; un Word devient un fichier texte ; les copies PDF de lecture, en option, sont générées à partir du texte traité, et les valeurs remplacées n'y sont plus. Le détail figure dans ce que contient un export AnonymFiles et sur la page sécurité et périmètre réseau.
Relire reste nécessaire. La détection repère les noms de personnes, les organisations, les adresses, les e-mails, les téléphones au format français, les IBAN de neuf pays européens, les dates privées et les numéros d'identifiant. Aucune détection n'est parfaite, et les montants se masquent à la main, d'un clic, à la relecture. Chaque pièce se relit côte à côte avec l'original, et rien n'est exporté sans validation. Sur l'export, la recherche des noms et la lecture complète (tests 2 et 6) restent donc indispensables. Les scans, eux, ne sont pas encore lus : l'application les signale et les exclut, et leur lecture est en préparation.
Questions fréquentes
Comment savoir si un PDF caviardé laisse du texte visible ?
Ouvrez le fichier final, sélectionnez le texte sur et autour de chaque zone noire, copiez-le, puis collez-le dans un éditeur de texte. Si un passage masqué apparaît, le caviardage a échoué. Complétez par une recherche des noms et par l'extraction du texte complet, par exemple avec pdftotext.
Un PDF protégé contre la copie est-il anonymisé ?
Non. Une restriction de copie empêche le copier-coller dans un lecteur PDF, mais elle ne retire pas le texte du fichier. Seul un caviardage qui supprime le texte, contrôlé par les six tests, protège le contenu.
Faut-il refaire ces tests sur un fichier produit par un logiciel d'anonymisation ?
Oui, au moins la recherche des noms et la lecture complète du texte extrait. Aucune détection automatique n'est parfaite : un nom mal orthographié, un numéro de dossier ou une date précise peuvent rester.
Un PDF scanné peut-il contenir du texte caché ?
Oui. Un scanner ou un logiciel d'OCR peut ajouter sous l'image un calque de texte invisible. Si un copier-coller ou pdftotext renvoie du texte, ce calque existe : il doit être caviardé comme un PDF texte, en plus de l'image.
Que faire si un des tests échoue ?
N'envoyez pas le fichier. Repartez de l'original, refaites le caviardage avec un outil qui supprime le texte, nettoyez métadonnées et couches cachées, donnez un nom neutre au fichier, puis repassez les six tests sur la nouvelle version.