Accueil › Blog › Vérifier un PDF anonymisé

Vérifier qu'un PDF est vraiment anonymisé : 6 tests avant de l'envoyer

Pour vérifier qu'un PDF est vraiment anonymisé, testez le fichier lui-même, pas son apparence à l'écran. Copiez-collez le texte sous les zones noircies, cherchez chaque nom et ses variantes, lisez les métadonnées, ouvrez les couches cachées, contrôlez le nom du fichier, puis relisez en entier le texte extrait, celui que lira une IA. Si un seul de ces six tests fait réapparaître un nom, le fichier ne part pas.

Publié le · 9 min de lecture

Avant de commencer : tester le bon fichier

Testez le fichier qui partira, une fois fermé puis rouvert. Dans Aperçu, un caviardage reste modifiable tant que le document est ouvert et devient permanent à sa fermeture. Dans Acrobat Pro, le document biffé et assaini est enregistré dans un nouveau fichier : c'est lui qu'il faut vérifier.

Notez ensuite ce qui ne doit plus apparaître : noms, sociétés, adresses, e-mails, téléphones, numéros de dossier. Outils utilisés : Aperçu (Mac), Acrobat Reader, gratuit sur Mac et Windows, et trois outils libres en ligne de commande, exiftool, qpdf et pdftotext. Le caviardage lui-même est détaillé dans caviarder un PDF sur Mac avec Aperçu ou Acrobat.

Test 1 : copier-coller le texte sous les zones noircies

Pourquoi. Un rectangle noir dessiné sur une page cache le texte sans le retirer : il reste sélectionnable dessous. C'est le piège décrit dans pourquoi un rectangle noir laisse le texte lisible.

Comment.

Une interdiction de copier empêche ce test, mais ne retire pas le texte du fichier.

Ce qui doit être vrai : le collage ne contient aucun passage masqué ; à sa place, rien, ou une étiquette comme [PERSONNE_1]. Sinon, repartez de l'original et utilisez un outil qui supprime le texte (« Biffer un PDF » dans Acrobat Pro, « Sélection du caviardage » dans Aperçu), comme expliqué dans caviarder un PDF de façon fiable.

Test 2 : chercher chaque nom et ses variantes

Pourquoi. Un caviardage manuel oublie facilement une occurrence : un en-tête, une note de bas de page, une annexe, un nom écrit autrement. La recherche les retrouve, à condition de chercher toutes les formes.

Comment. Pour chaque personne, cherchez le nom seul, le prénom et le nom, les initiales, le nom d'usage, la forme sans accents, l'adresse e-mail, le téléphone sous plusieurs écritures (06…, +33 6…) et le numéro de dossier. Cherchez aussi les premières lettres du nom : elles attrapent un nom coupé en fin de ligne ou mal orthographié.

Ce qui doit être vrai : zéro résultat pour chaque terme, dans les pages, les commentaires et les signets.

Test 3 : lire les métadonnées (propriétés et XMP)

Pourquoi. Un PDF garde des propriétés que l'écran n'affiche pas : titre, auteur, sujet, mots-clés, logiciel de création. Elles peuvent exister en double, dans les propriétés du document et dans un bloc XMP. Un titre comme « Conclusions DUPONT c. MARTIN » survit au caviardage des pages : comme le rappelle l'aide d'Acrobat, « la biffure supprime uniquement le texte et les images visibles ».

Comment.

Ce qui doit être vrai : aucun nom ni référence de dossier dans ces champs ; le nom du logiciel peut rester. Si les métadonnées ont été effacées avec exiftool, le fichier doit avoir été réécrit ensuite, par exemple avec qpdf --linearize entree.pdf sortie.pdf : la documentation d'exiftool prévient que « ExifTool alone may not be used to securely edit metadata in PDF files ». Sans réécriture, les anciennes valeurs restent dans le fichier, même quand exiftool ne les affiche plus. Pour corriger, voir supprimer les métadonnées d'un PDF, ou « Assainir le document » dans Acrobat Pro.

Test 4 : ouvrir les couches cachées

Pourquoi. Un PDF transporte plus que ses pages : commentaires et annotations, qui portent un nom d'auteur, champs de formulaire, pièces jointes, calques masqués, signets. L'aide d'Acrobat les range parmi les « types de données pouvant être masquées ». Et Apple précise que, dans Aperçu, les entrées de la table des matières « qui renvoient à du texte caviardé ne sont pas supprimées ».

Comment.

Ce qui doit être vrai : aucun commentaire, aucune pièce jointe, aucun champ rempli, aucun calque masqué, et des signets sans nom. Regardez aussi les liens : une adresse e-mail ou un chemin de fichier peut contenir un nom.

Test 5 : vérifier le nom du fichier et son chemin

Pourquoi. Le nom du fichier voyage avec lui : il s'affiche dans la pièce jointe d'un e-mail et dans la conversation quand vous déposez le PDF dans une IA. « Conclusions DUPONT c MARTIN v3.pdf » défait tout le caviardage. Si vous envoyez un dossier, le nom de chaque sous-dossier part avec lui.

Comment.

Ce qui doit être vrai : un nom neutre (piece-03.pdf), dans un dossier au nom neutre, et un titre de document (test 3) qui ne reprend pas l'ancien nom. Mieux vaut produire les copies dans un nouveau dossier que renommer les originaux.

Test 6 : relire le texte que lira l'IA

Pourquoi. Une IA lit le texte du fichier, pas seulement la page affichée. Pour un PDF, avec ses modèles qui lisent les images, l'API d'OpenAI « extracts both text and page images and sends both to the model » : le texte et l'image des pages. La documentation d'Anthropic décrit la même chose pour Claude. Or ce texte extrait comprend aussi ce que l'écran ne montre pas : texte transparent, recouvert par un autre contenu ou de la couleur du fond.

Comment. Extrayez tout le texte, puis lisez-le d'un bout à l'autre, en-têtes, pieds de page et annexes compris.

Ce qui doit être vrai : le texte se lit en entier sans un nom, un numéro ou un détail qui permette de reconnaître quelqu'un. Relancez-y la recherche du test 2. C'est aussi là qu'apparaissent les identifiants indirects : un lieu, une date précise, une fonction unique. La suite de la démarche est dans anonymiser un document avant de l'envoyer à ChatGPT.

Les 6 tests en un tableau

TestSur MacSur WindowsCe qui doit être vrai
1. Copier-coller sous les zones noiresAperçu, Sélection de texte, CopierAcrobat Reader, Outil Sélection, CopierAucun passage masqué dans le collage
2. Noms et variantesChamp de recherche d'AperçuCtrl + F, puis Recherche avancéeZéro résultat, commentaires et signets compris
3. MétadonnéesInspecteur d'Aperçu, exiftoolPropriétés du document, exiftoolAucun nom dans les propriétés ni le XMP
4. Couches cachéesInspecteur des annotations, table des matièresPanneaux Commentaires, Signets, Pièces jointes, CalquesRien de caché qui identifie quelqu'un
5. Nom et cheminFinder : Retour, barre du chemin d'accèsExplorateur : F2, Alt + EntréeFichier et dossier aux noms neutres
6. Texte lu par l'IApdftotext piece.pdfCopier le fichier dans le Presse-papiersRelu en entier, sans identifiant direct ni indirect

PDF scannés : pas de texte, sauf un calque OCR

Un scan est une image : sans calque de texte, les tests 1, 2 et 6 ne trouvent rien, ce qui ne prouve rien. Deux pièges. D'abord, un scanner ou un logiciel d'OCR peut avoir ajouté sous l'image un calque de texte invisible : si le copier-coller ou pdftotext rendent du texte, ce calque existe et se caviarde comme un PDF texte. Ensuite, l'IA reçoit aussi l'image des pages : un nom lisible sur l'image peut être lu. Le masquage doit donc être incrusté dans l'image, et les tests 3, 4 et 5 restent valables. La méthode complète est dans anonymiser un PDF scanné ou une photo de document.

Ce que fait AnonymFiles, et pourquoi relire reste nécessaire

AnonymFiles est une application de bureau, bientôt disponible pour Mac (puce Apple) et Windows, qui caviarde un dossier entier sur votre ordinateur : PDF texte, Word (.docx), .txt et .md. À l'export, elle prend en charge ce que plusieurs de ces tests vérifient. Le contenu masqué est réellement supprimé, pas recouvert. Les métadonnées, annotations, formulaires et liens sont retirés. Les copies arrivent dans un nouveau dossier, avec des noms de fichiers neutres et un index des pièces exportées et exclues ; la table de correspondance entre étiquettes et vrais noms reste sur votre ordinateur, jamais dans l'export. Un PDF texte est exporté en PDF reconstruit, d'où le contenu masqué est supprimé ; un Word devient un fichier texte ; les copies PDF de lecture, en option, sont générées à partir du texte traité, et les valeurs remplacées n'y sont plus. Le détail figure dans ce que contient un export AnonymFiles et sur la page sécurité et périmètre réseau.

Relire reste nécessaire. La détection repère les noms de personnes, les organisations, les adresses, les e-mails, les téléphones au format français, les IBAN de neuf pays européens, les dates privées et les numéros d'identifiant. Aucune détection n'est parfaite, et les montants se masquent à la main, d'un clic, à la relecture. Chaque pièce se relit côte à côte avec l'original, et rien n'est exporté sans validation. Sur l'export, la recherche des noms et la lecture complète (tests 2 et 6) restent donc indispensables. Les scans, eux, ne sont pas encore lus : l'application les signale et les exclut, et leur lecture est en préparation.

Questions fréquentes

Comment savoir si un PDF caviardé laisse du texte visible ?

Ouvrez le fichier final, sélectionnez le texte sur et autour de chaque zone noire, copiez-le, puis collez-le dans un éditeur de texte. Si un passage masqué apparaît, le caviardage a échoué. Complétez par une recherche des noms et par l'extraction du texte complet, par exemple avec pdftotext.

Un PDF protégé contre la copie est-il anonymisé ?

Non. Une restriction de copie empêche le copier-coller dans un lecteur PDF, mais elle ne retire pas le texte du fichier. Seul un caviardage qui supprime le texte, contrôlé par les six tests, protège le contenu.

Faut-il refaire ces tests sur un fichier produit par un logiciel d'anonymisation ?

Oui, au moins la recherche des noms et la lecture complète du texte extrait. Aucune détection automatique n'est parfaite : un nom mal orthographié, un numéro de dossier ou une date précise peuvent rester.

Un PDF scanné peut-il contenir du texte caché ?

Oui. Un scanner ou un logiciel d'OCR peut ajouter sous l'image un calque de texte invisible. Si un copier-coller ou pdftotext renvoie du texte, ce calque existe : il doit être caviardé comme un PDF texte, en plus de l'image.

Que faire si un des tests échoue ?

N'envoyez pas le fichier. Repartez de l'original, refaites le caviardage avec un outil qui supprime le texte, nettoyez métadonnées et couches cachées, donnez un nom neutre au fichier, puis repassez les six tests sur la nouvelle version.