T

Text Machine

Potentes herramientas de texto, en tu navegador

Redactor de PII

Pega lo que sea, un ticket de soporte, un log, una conversación, y elimina los datos personales y los secretos que esconde antes de compartirlo. Todo funciona en tu navegador, así que el texto nunca sale de tu equipo.

Tu texto

Detectar:

Esta herramienta es un simple script que se ejecuta en el cliente. Tu texto se procesa en esta pestaña del navegador, nunca se envía a un servidor y no se guarda ni se registra en ningún sitio. Cierras la pestaña y desaparece.

Cómo usar Redactor de PII

  1. 1

    Pega tu texto

    Mete el ticket, el registro de chat, el volcado de error, la fila de la hoja de cálculo o el documento que estás a punto de compartir. No hay límite de longitud y no se sube nada.

  2. 2

    Elige cómo se sustituyen las coincidencias

    Las barras de censura conservan la forma del original, ideal para capturas de pantalla. [REDACTED] es el aspecto clásico de documento. Las etiquetas de tipo como [EMAIL] indican qué se ha eliminado, y los marcadores numerados como [EMAIL_1] mantienen enlazadas las repeticiones del mismo valor.

  3. 3

    Activa o desactiva detectores

    Los nueve detectores están activados por defecto. Desactiva el que sea seguro conservar: por ejemplo, dejar las URL en un informe de error y eliminar solo la clave de API que hay al lado.

  4. 4

    Revisa el recuento y copia

    El panel muestra cuántos elementos de cada tipo se han eliminado. Comprueba que el número coincide con lo que esperabas y copia el texto limpio.

Sobre eliminar datos personales y secretos de un texto

Por qué el texto se comparte antes de que nadie lo revise

Casi toda filtración accidental de datos personales empieza con un pegado normal y bienintencionado. Un agente de soporte copia el mensaje de un cliente a un chat de grupo para preguntar a un compañero qué hacer. Un desarrollador suelta una traza de error en el gestor de incidencias. Alguien pega una fila de una hoja de cálculo en una conversación, o un fragmento de log en un asistente de IA para preguntar qué significa el error. En todos los casos, la parte sensible, una dirección, un número de tarjeta, una clave de acceso, nunca era el objetivo del mensaje. Simplemente venía de acompañante.

La solución no es tener más cuidado, es un paso que dura dos segundos. Esta herramienta existe para ser ese paso: pegas, miras cuántas cosas ha encontrado y copias la versión limpia. Está hecha deliberadamente para ser tan rápida que usarla no parezca una norma que hay que recordar.

Qué busca la herramienta

Se detectan nueve categorías. Los correos y las URL se identifican por su estructura. Las direcciones IPv4 se comprueban por rango, así que 999.1.1.1 o una versión de cinco partes no se consideran direcciones. Los números de la seguridad social estadounidense solo se detectan con guiones. Los teléfonos necesitan prefijo internacional o separadores reales. Las tarjetas y los IBAN se validan con suma de control. Las claves de API se reconocen por el prefijo del proveedor, y los JWT por su estructura base64 de tres partes.

Esa lista está elegida a partir de lo que realmente aparece en el texto que la gente pega. Las categorías clásicas de datos personales cubren el lado humano y las de credenciales cubren el lado de las máquinas, que en la práctica es donde se producen los accidentes más caros: una clave de nube filtrada cuesta muchísimo más que un teléfono filtrado.

La precisión importa más que la cobertura

La forma tentadora de construir un redactor es detectar de manera agresiva: tratar toda ristra larga de dígitos como una tarjeta y todo número con guiones como un teléfono. Eso da resultados vistosos en una demo y arruina en silencio los documentos reales. Un identificador de pedido se convierte en una barra negra. Un recuento de filas desaparece. Un número de versión se transforma en [PHONE]. Y lo peor es que el daño es invisible: copias la salida, la pegas y solo descubres más tarde que falta justo lo que alguien necesitaba.

Por eso cada detector aquí es o bien estructuralmente inequívoco o bien verificado por suma de control. Una tarjeta tiene que pasar la comprobación Luhn mod-10 que usan todas las redes de pago, lo que significa que un número de 16 dígitos elegido al azar tiene alrededor de una posibilidad entre diez de ser aceptado, no una certeza. Un IBAN debe pasar la comprobación mod-97 de la ISO 13616. Una simple ristra de dígitos nunca es un teléfono. El resultado detecta algo menos a cambio de casi nunca estropear texto que querías conservar, que es el intercambio correcto para una herramienta cuya salida vas a enviar a algún sitio.

Elegir un estilo de sustitución

Las barras de censura mantienen el peso visual del original, que es lo que quieres para una captura de pantalla o un documento que debe seguir pareciendo un documento. [REDACTED] es la convención habitual en el ámbito jurídico y en las solicitudes de acceso a la información, y se lee con claridad en texto plano. Las etiquetas de tipo como [EMAIL] y [CREDIT_CARD] indican qué se ha eliminado, algo que importa cuando la naturaleza del dato forma parte de la explicación: un informe de error se lee de forma muy distinta si dice [API_KEY] que si muestra una barra negra anónima.

Los marcadores numerados son lo más útil y lo menos evidente. Las apariciones repetidas del mismo valor reciben el mismo número, así que un hilo que menciona a un cliente cuatro veces produce cuatro [EMAIL_1] en lugar de cuatro huecos indistinguibles. El documento sigue teniendo sentido: una persona, o un modelo de lenguaje, todavía puede ver que la misma persona aparece a lo largo del texto, y tú puedes volver a los valores reales después si conservaste el original.

Limpiar el texto antes de un prompt de IA

Pegar logs, tickets y documentos internos en un asistente conversacional se ha vuelto rutinario, y hoy es una de las vías más habituales por las que los datos sensibles salen de una organización. El prompt va a un tercero, puede quedar almacenado y, según la configuración, puede ser revisado por una persona o usado para entrenar. La mayoría de las veces nada de eso hace falta, porque el modelo necesita la forma del problema, no la dirección de correo real del cliente.

Pasar el texto por un redactor antes conserva la parte útil y descarta la arriesgada. Aquí el modo numerado es el que mejor encaja: el modelo puede seguir razonando sobre quién hizo qué, porque las identidades siguen siendo distinguibles y coherentes, mientras que los valores reales no aparecen nunca en el prompt. Si necesitas actuar sobre la respuesta, traduce los marcadores en tu propio equipo.

Por qué la censura falla en PDF e imágenes

Hay una larga y bochornosa historia de censuras que no censuraban. Escritos judiciales, informes gubernamentales y documentos corporativos se han publicado con rectángulos negros dibujados sobre el texto en un visor de PDF, dejando los caracteres originales intactos debajo, seleccionables, copiables y recuperados a los pocos minutos de la publicación. Lo mismo pasa cuando se pinta con un pincel negro sobre una captura que luego se guarda en un formato que conserva una capa o una miniatura.

El motivo es que un rectángulo negro es una instrucción de dibujo, no un borrado. Trabajar en texto plano elimina toda esa clase de fallo, porque los caracteres se sustituyen de verdad en la cadena: lo que copias es todo lo que existe. Si tienes que censurar un PDF, usa una herramienta que elimine el texto subyacente y verifícalo arrastrando una selección sobre las barras negras y pegando el resultado en otro sitio para ver qué sale.

Una nota sobre lo que una herramienta no puede saber

Los identificadores estructurados se detectan porque tienen una forma. Los nombres, los cargos, los detalles médicos, los nombres en clave de proyectos internos y una frase como "vive dos puertas más allá de la clínica" no la tienen, y ningún buscador de patrones los va a encontrar. Un redactor elimina la categoría mecánica de datos sensibles; no lee el documento por ti.

Trata la salida como una primera pasada que despeja de forma fiable el material evidente, y luego léela una vez antes de enviarla. El recuento de lo eliminado está ahí precisamente para eso: si esperabas dos direcciones de correo y solo ha encontrado una, esa diferencia merece una segunda mirada.

Preguntas frecuentes

¿Qué se considera PII aquí?
Nueve categorías: direcciones de correo, números de teléfono, números de tarjeta de crédito, números de la seguridad social de EE. UU., direcciones IPv4, URL, claves y tokens de API, JWT y números de cuenta IBAN. Las cinco primeras son las categorías clásicas de información personal identificable; el resto son secretos que se filtran igual de mal y que suelen viajar en el mismo pegado.
¿Se sube mi texto a algún sitio?
No. El código de detección y sustitución es un módulo de JavaScript que se ejecuta en tu pestaña. No hay subida, ni llamada a una API, ni evento de analítica que lleve tu contenido. Ese es justamente el sentido de la herramienta: si tienes que enviar un texto sensible a algún sitio para limpiarlo, ya lo has filtrado. Puedes comprobarlo tú mismo abriendo el panel de red del navegador y viendo que no se mueve nada mientras escribes.
¿Va a destrozar los números normales de mi texto?
Está construida precisamente para evitarlo. Las tarjetas deben pasar la suma de control Luhn y los IBAN la comprobación mod-97 de la norma ISO 13616 antes de tocarlos, de modo que un número de pedido, un puerto, un recuento de filas o una versión se quedan intactos. Una simple ristra de dígitos nunca se trata como teléfono: solo cuentan los números con prefijo internacional o con separadores reales. La herramienta está ajustada para priorizar la precisión sobre la cobertura, porque un falso positivo se come en silencio el texto que querías conservar y puede que no lo notes hasta después de enviarlo.
¿Puedo usarla antes de pegar algo en ChatGPT u otra IA?
Sí, es uno de los usos principales. Si pasas el texto por aquí primero, el modelo sigue viendo la estructura y el sentido del documento mientras las direcciones, los números de tarjeta y las claves reales ya no están. El modo numerado es el que mejor encaja: las menciones repetidas de la misma persona se convierten en el mismo marcador [EMAIL_1], así el modelo sigue sabiendo quién es quién y tú puedes deshacer los marcadores después.
¿Qué claves de API y tokens reconoce?
Credenciales con prefijo de proveedor y forma inconfundible: claves sk- de OpenAI, claves live y test de Stripe, tokens personales de GitHub, identificadores de clave de acceso de AWS, claves de API de Google, tokens de Slack, PAT de GitLab, tokens de npm y claves de SendGrid, además de cualquier JWT y del token de una cabecera Authorization: Bearer. Solo se detectan formatos con prefijo, así que una palabra normal o un hash aleatorio de tu texto no se confunden con una credencial.
¿Tachar texto en un PDF lo elimina de verdad?
Normalmente no. Dibujar un rectángulo negro sobre el texto en un visor de PDF deja los caracteres originales debajo, todavía seleccionables y copiables: así ocurrieron varios fallos de censura muy conocidos. Trabajar con texto plano evita todo ese problema, porque los caracteres se sustituyen de verdad en la cadena y lo que copias es todo lo que existe.
¿En qué se diferencia del generador de texto tachado?
El generador de texto tachado es estético: oculta palabras al azar para conseguir el aspecto de documento clasificado en publicaciones y memes. Esta herramienta hace lo contrario: encuentra las partes que son realmente sensibles y elimina solo esas, dejando legible todo lo demás para que el documento siga sirviendo para algo.
¿Puedo recuperar los valores originales?
Desde la salida no. La sustitución es de un solo sentido y no se guarda ninguna correspondencia en ningún sitio, así que conserva tu texto original si lo vas a necesitar. Si quieres poder relacionar los marcadores con los valores a mano, usa el modo numerado, que da a cada valor distinto un índice estable dentro del documento.

Herramientas relacionadas

Sigue trabajando con estas prácticas herramientas

Generador de texto censurado

Conversor de Mayúsculas y Minúsculas

Buscar y Reemplazar Texto

Bionic Reading

Poner en Mayúscula la Primera Letra

Poner en Mayúscula Cada Palabra