Redactor de PII
Pega lo que sea, un ticket de soporte, un log, una conversación, y elimina los datos personales y los secretos que esconde antes de compartirlo. Todo funciona en tu navegador, así que el texto nunca sale de tu equipo.
Detectar:
Esta herramienta es un simple script que se ejecuta en el cliente. Tu texto se procesa en esta pestaña del navegador, nunca se envía a un servidor y no se guarda ni se registra en ningún sitio. Cierras la pestaña y desaparece.
Cómo usar Redactor de PII
- 1
Pega tu texto
Mete el ticket, el registro de chat, el volcado de error, la fila de la hoja de cálculo o el documento que estás a punto de compartir. No hay límite de longitud y no se sube nada.
- 2
Elige cómo se sustituyen las coincidencias
Las barras de censura conservan la forma del original, ideal para capturas de pantalla. [REDACTED] es el aspecto clásico de documento. Las etiquetas de tipo como [EMAIL] indican qué se ha eliminado, y los marcadores numerados como [EMAIL_1] mantienen enlazadas las repeticiones del mismo valor.
- 3
Activa o desactiva detectores
Los nueve detectores están activados por defecto. Desactiva el que sea seguro conservar: por ejemplo, dejar las URL en un informe de error y eliminar solo la clave de API que hay al lado.
- 4
Revisa el recuento y copia
El panel muestra cuántos elementos de cada tipo se han eliminado. Comprueba que el número coincide con lo que esperabas y copia el texto limpio.
Sobre eliminar datos personales y secretos de un texto
Por qué el texto se comparte antes de que nadie lo revise
Casi toda filtración accidental de datos personales empieza con un pegado normal y bienintencionado. Un agente de soporte copia el mensaje de un cliente a un chat de grupo para preguntar a un compañero qué hacer. Un desarrollador suelta una traza de error en el gestor de incidencias. Alguien pega una fila de una hoja de cálculo en una conversación, o un fragmento de log en un asistente de IA para preguntar qué significa el error. En todos los casos, la parte sensible, una dirección, un número de tarjeta, una clave de acceso, nunca era el objetivo del mensaje. Simplemente venía de acompañante.
La solución no es tener más cuidado, es un paso que dura dos segundos. Esta herramienta existe para ser ese paso: pegas, miras cuántas cosas ha encontrado y copias la versión limpia. Está hecha deliberadamente para ser tan rápida que usarla no parezca una norma que hay que recordar.
Qué busca la herramienta
Se detectan nueve categorías. Los correos y las URL se identifican por su estructura. Las direcciones IPv4 se comprueban por rango, así que 999.1.1.1 o una versión de cinco partes no se consideran direcciones. Los números de la seguridad social estadounidense solo se detectan con guiones. Los teléfonos necesitan prefijo internacional o separadores reales. Las tarjetas y los IBAN se validan con suma de control. Las claves de API se reconocen por el prefijo del proveedor, y los JWT por su estructura base64 de tres partes.
Esa lista está elegida a partir de lo que realmente aparece en el texto que la gente pega. Las categorías clásicas de datos personales cubren el lado humano y las de credenciales cubren el lado de las máquinas, que en la práctica es donde se producen los accidentes más caros: una clave de nube filtrada cuesta muchísimo más que un teléfono filtrado.
La precisión importa más que la cobertura
La forma tentadora de construir un redactor es detectar de manera agresiva: tratar toda ristra larga de dígitos como una tarjeta y todo número con guiones como un teléfono. Eso da resultados vistosos en una demo y arruina en silencio los documentos reales. Un identificador de pedido se convierte en una barra negra. Un recuento de filas desaparece. Un número de versión se transforma en [PHONE]. Y lo peor es que el daño es invisible: copias la salida, la pegas y solo descubres más tarde que falta justo lo que alguien necesitaba.
Por eso cada detector aquí es o bien estructuralmente inequívoco o bien verificado por suma de control. Una tarjeta tiene que pasar la comprobación Luhn mod-10 que usan todas las redes de pago, lo que significa que un número de 16 dígitos elegido al azar tiene alrededor de una posibilidad entre diez de ser aceptado, no una certeza. Un IBAN debe pasar la comprobación mod-97 de la ISO 13616. Una simple ristra de dígitos nunca es un teléfono. El resultado detecta algo menos a cambio de casi nunca estropear texto que querías conservar, que es el intercambio correcto para una herramienta cuya salida vas a enviar a algún sitio.
Elegir un estilo de sustitución
Las barras de censura mantienen el peso visual del original, que es lo que quieres para una captura de pantalla o un documento que debe seguir pareciendo un documento. [REDACTED] es la convención habitual en el ámbito jurídico y en las solicitudes de acceso a la información, y se lee con claridad en texto plano. Las etiquetas de tipo como [EMAIL] y [CREDIT_CARD] indican qué se ha eliminado, algo que importa cuando la naturaleza del dato forma parte de la explicación: un informe de error se lee de forma muy distinta si dice [API_KEY] que si muestra una barra negra anónima.
Los marcadores numerados son lo más útil y lo menos evidente. Las apariciones repetidas del mismo valor reciben el mismo número, así que un hilo que menciona a un cliente cuatro veces produce cuatro [EMAIL_1] en lugar de cuatro huecos indistinguibles. El documento sigue teniendo sentido: una persona, o un modelo de lenguaje, todavía puede ver que la misma persona aparece a lo largo del texto, y tú puedes volver a los valores reales después si conservaste el original.
Limpiar el texto antes de un prompt de IA
Pegar logs, tickets y documentos internos en un asistente conversacional se ha vuelto rutinario, y hoy es una de las vías más habituales por las que los datos sensibles salen de una organización. El prompt va a un tercero, puede quedar almacenado y, según la configuración, puede ser revisado por una persona o usado para entrenar. La mayoría de las veces nada de eso hace falta, porque el modelo necesita la forma del problema, no la dirección de correo real del cliente.
Pasar el texto por un redactor antes conserva la parte útil y descarta la arriesgada. Aquí el modo numerado es el que mejor encaja: el modelo puede seguir razonando sobre quién hizo qué, porque las identidades siguen siendo distinguibles y coherentes, mientras que los valores reales no aparecen nunca en el prompt. Si necesitas actuar sobre la respuesta, traduce los marcadores en tu propio equipo.
Por qué la censura falla en PDF e imágenes
Hay una larga y bochornosa historia de censuras que no censuraban. Escritos judiciales, informes gubernamentales y documentos corporativos se han publicado con rectángulos negros dibujados sobre el texto en un visor de PDF, dejando los caracteres originales intactos debajo, seleccionables, copiables y recuperados a los pocos minutos de la publicación. Lo mismo pasa cuando se pinta con un pincel negro sobre una captura que luego se guarda en un formato que conserva una capa o una miniatura.
El motivo es que un rectángulo negro es una instrucción de dibujo, no un borrado. Trabajar en texto plano elimina toda esa clase de fallo, porque los caracteres se sustituyen de verdad en la cadena: lo que copias es todo lo que existe. Si tienes que censurar un PDF, usa una herramienta que elimine el texto subyacente y verifícalo arrastrando una selección sobre las barras negras y pegando el resultado en otro sitio para ver qué sale.
Una nota sobre lo que una herramienta no puede saber
Los identificadores estructurados se detectan porque tienen una forma. Los nombres, los cargos, los detalles médicos, los nombres en clave de proyectos internos y una frase como "vive dos puertas más allá de la clínica" no la tienen, y ningún buscador de patrones los va a encontrar. Un redactor elimina la categoría mecánica de datos sensibles; no lee el documento por ti.
Trata la salida como una primera pasada que despeja de forma fiable el material evidente, y luego léela una vez antes de enviarla. El recuento de lo eliminado está ahí precisamente para eso: si esperabas dos direcciones de correo y solo ha encontrado una, esa diferencia merece una segunda mirada.
Preguntas frecuentes
¿Qué se considera PII aquí?
¿Se sube mi texto a algún sitio?
¿Va a destrozar los números normales de mi texto?
¿Puedo usarla antes de pegar algo en ChatGPT u otra IA?
¿Qué claves de API y tokens reconoce?
¿Tachar texto en un PDF lo elimina de verdad?
¿En qué se diferencia del generador de texto tachado?
¿Puedo recuperar los valores originales?
Herramientas relacionadas
Sigue trabajando con estas prácticas herramientas