Caviardage de données personnelles
Collez n'importe quoi, un ticket de support, un log, une conversation, et retirez les données personnelles et les secrets qui s'y cachent avant de le partager. Tout tourne dans votre navigateur : le texte ne quitte jamais votre machine.
Détecter :
Cet outil est un simple script côté client. Votre texte est traité dans cet onglet, n'est jamais envoyé à un serveur et n'est ni stocké ni journalisé où que ce soit. Fermez l'onglet et il disparaît.
Comment utiliser Caviardage de données personnelles
- 1
Collez votre texte
Déposez le ticket, le journal de discussion, la trace d'erreur, la ligne de tableur ou le document que vous vous apprêtez à partager. Aucune limite de longueur et aucun envoi.
- 2
Choisissez le remplacement
Les barres de caviardage conservent la forme de l'original, pratique pour une capture d'écran. [REDACTED] est la présentation classique d'un document. Les étiquettes de type comme [EMAIL] indiquent ce qui a été retiré, et les marqueurs numérotés comme [EMAIL_1] gardent le lien entre les occurrences d'une même valeur.
- 3
Activez ou désactivez les détecteurs
Les neuf détecteurs sont actifs par défaut. Désactivez celui dont la catégorie peut rester : par exemple garder les URL dans un rapport de bug tout en supprimant la clé d'API juste à côté.
- 4
Vérifiez le compte, puis copiez
Le tableau indique exactement combien d'éléments de chaque type ont été retirés. Vérifiez que le nombre correspond à ce que vous attendiez, puis copiez le texte nettoyé.
Retirer les données personnelles et les secrets d'un texte
Pourquoi un texte est partagé avant d'être relu
Presque toute divulgation accidentelle de données personnelles commence par un copier-coller ordinaire et bien intentionné. Un agent de support recopie le message d'un client dans une discussion de groupe pour demander conseil. Un développeur colle une trace d'erreur dans un outil de suivi. Quelqu'un colle une ligne de tableur dans une messagerie, ou un extrait de log dans un assistant IA pour demander ce que signifie l'erreur. À chaque fois, la partie sensible, une adresse, un numéro de carte, une clé d'accès, n'était pas l'objet du message. Elle est simplement venue avec.
La solution n'est pas plus de vigilance, c'est une étape de deux secondes. Cet outil existe pour être cette étape : coller, jeter un œil au nombre d'éléments trouvés, copier la version propre. Il est volontairement assez rapide pour que son usage ne ressemble pas à une règle qu'il faut penser à appliquer.
Ce que l'outil recherche
Neuf catégories sont détectées. Les adresses e-mail et les URL sont reconnues par leur structure. Les adresses IPv4 sont vérifiées par plage, donc 999.1.1.1 et une version à cinq segments ne sont pas des adresses. Les numéros de sécurité sociale américains ne sont détectés qu'avec leurs tirets. Les téléphones exigent un indicatif international ou de vrais séparateurs. Les cartes et les IBAN sont validés par somme de contrôle. Les clés d'API sont reconnues au préfixe du fournisseur, et les JWT à leur structure base64 en trois parties.
Cette liste vient de ce qui apparaît réellement dans les textes que l'on colle. Les catégories classiques couvrent le versant humain, les catégories d'identifiants couvrent le versant machine, et c'est en pratique là que se produisent les accidents les plus coûteux : une clé cloud qui fuit coûte bien plus cher qu'un numéro de téléphone.
La précision compte plus que la couverture
La façon tentante de construire un outil de caviardage consiste à détecter largement : toute longue suite de chiffres devient une carte, tout nombre à tirets un téléphone. Le résultat est spectaculaire en démonstration et ruine discrètement les vrais documents. Un identifiant de commande devient une barre noire. Un nombre de lignes disparaît. Un numéro de version se transforme en [PHONE]. Pire, les dégâts sont invisibles : vous copiez la sortie, vous la collez, et vous découvrez plus tard que la partie dont on avait besoin a disparu.
Chaque détecteur est donc soit structurellement non ambigu, soit vérifié par somme de contrôle. Une carte doit passer le contrôle Luhn mod-10 utilisé par tous les réseaux de paiement : un nombre de 16 chiffres pris au hasard a environ une chance sur dix d'être accepté, pas une certitude. Un IBAN doit passer le contrôle mod-97 de l'ISO 13616. Une simple suite de chiffres n'est jamais un téléphone. On détecte un peu moins, mais on n'abîme presque jamais un texte qu'on voulait garder : c'est le bon compromis pour un outil dont la sortie part aussitôt ailleurs.
Choisir un style de remplacement
Les barres de caviardage conservent le poids visuel de l'original, ce qu'on veut pour une capture d'écran ou un document qui doit continuer à ressembler à un document. [REDACTED] est la convention familière du monde juridique et des demandes d'accès aux documents administratifs, et se lit clairement en texte brut. Les étiquettes de type comme [EMAIL] et [CREDIT_CARD] indiquent ce qui a été retiré, ce qui compte quand la nature de la donnée fait partie de l'explication : un rapport de bug ne raconte pas la même chose selon qu'il affiche [API_KEY] ou une barre noire anonyme.
Les marqueurs numérotés sont les plus utiles et les moins évidents. Les occurrences répétées d'une même valeur reçoivent le même numéro : un fil qui mentionne un client quatre fois produit quatre [EMAIL_1] plutôt que quatre blancs indiscernables. Le document reste cohérent : un lecteur, ou un modèle de langage, voit toujours que la même personne revient tout du long, et vous pourrez rétablir les valeurs réelles ensuite si vous avez gardé l'original.
Nettoyer un texte avant une requête d'IA
Coller des logs, des tickets et des documents internes dans un assistant conversationnel est devenu banal, et c'est aujourd'hui l'une des voies les plus fréquentes par lesquelles des données sensibles sortent d'une organisation. La requête part chez un tiers, peut être conservée et, selon la configuration, relue par un humain ou utilisée pour l'entraînement. La plupart du temps rien de tout cela n'est nécessaire, car le modèle a besoin de la forme du problème, pas de la véritable adresse e-mail du client.
Faire passer le texte par un outil de caviardage garde la partie utile et écarte la partie risquée. Le mode numéroté est le plus adapté : le modèle peut encore raisonner sur qui a fait quoi, puisque les identités restent distinctes et cohérentes, tandis que les valeurs réelles n'apparaissent jamais dans la requête. S'il faut agir sur la réponse, retraduisez les marqueurs sur votre propre machine.
Pourquoi le caviardage échoue dans les PDF et les images
L'histoire des caviardages qui ne caviardent rien est longue et gênante. Des pièces de procédure, des rapports publics et des documents d'entreprise ont été publiés avec de simples rectangles noirs dessinés sur le texte dans une visionneuse PDF, les caractères d'origine restant en dessous, sélectionnables, copiables et récupérés quelques minutes après la publication. Il se passe la même chose quand un pinceau noir est passé sur une capture d'écran ensuite enregistrée dans un format qui conserve un calque ou une vignette.
La raison est simple : un rectangle noir est une instruction de dessin, pas une suppression. Travailler en texte brut fait disparaître toute cette famille d'échecs, parce que les caractères sont réellement remplacés dans la chaîne : ce que vous copiez est tout ce qui existe. Si vous devez caviarder un PDF, utilisez un outil qui supprime le texte sous-jacent, puis vérifiez en sélectionnant par-dessus les barres noires et en collant le résultat ailleurs pour voir ce qui en sort.
Ce qu'un outil ne peut pas savoir
Les identifiants structurés se détectent parce qu'ils ont une forme. Les noms, les fonctions, les détails médicaux, les noms de code de projets internes et une phrase comme "elle habite deux portes plus loin que la clinique" n'en ont pas, et aucun moteur de motifs ne les trouvera. Un outil de caviardage retire la catégorie mécanique des données sensibles ; il ne lit pas le document à votre place.
Traitez la sortie comme une première passe qui élimine de façon fiable le matériel évident, puis relisez-la une fois avant d'envoyer. Le décompte de ce qui a été retiré sert exactement à cela : si vous attendiez deux adresses e-mail et qu'une seule a été trouvée, cet écart mérite un second regard.
Questions fréquentes
Qu'est-ce qui compte comme donnée personnelle ici ?
Mon texte est-il envoyé quelque part ?
Va-t-il détruire les nombres ordinaires de mon texte ?
Puis-je l'utiliser avant de coller dans ChatGPT ou une autre IA ?
Quelles clés d'API et quels jetons sont reconnus ?
Caviarder un texte dans un PDF le supprime-t-il vraiment ?
Quelle différence avec le générateur de texte caviardé ?
Puis-je récupérer les valeurs d'origine ?
Outils similaires
Continuez avec ces outils pratiques