PII-редактор
Вставьте что угодно: обращение в поддержку, лог, переписку, и уберите спрятанные внутри персональные данные и секреты до того, как поделитесь этим. Всё считается в браузере, поэтому текст не покидает ваше устройство.
Искать:
Это обычный скрипт, работающий на стороне клиента. Ваш текст обрабатывается во вкладке браузера, никогда не отправляется на сервер и нигде не сохраняется и не логируется. Закройте вкладку, и он исчезнет.
Как пользоваться PII-редактор
- 1
Вставьте текст
Вставьте обращение, лог переписки, дамп ошибки, строку таблицы или документ, которым собираетесь поделиться. Ограничения по длине нет, ничего никуда не отправляется.
- 2
Выберите способ замены
Чёрные полосы сохраняют форму оригинала и хорошо смотрятся на скриншотах. [REDACTED] — привычный вид официального документа. Метки типа вроде [EMAIL] показывают, что именно убрали, а нумерованные заполнители вроде [EMAIL_1] сохраняют связь между повторами одного и того же значения.
- 3
Включите или выключите детекторы
Все девять детекторов включены по умолчанию. Выключите тот, чью категорию можно оставить: например, сохранить URL в отчёте об ошибке, убрав только стоящий рядом API-ключ.
- 4
Проверьте счётчик и скопируйте
На панели видно, сколько элементов каждого типа было удалено. Убедитесь, что число совпадает с ожидаемым, и скопируйте очищенный текст.
Об удалении персональных данных и секретов из текста
Почему текст отправляют раньше, чем успевают проверить
Почти любая случайная утечка персональных данных начинается с обычной вставки, сделанной из лучших побуждений. Сотрудник поддержки копирует сообщение клиента в общий чат, чтобы спросить совета у коллеги. Разработчик кидает трассировку стека в трекер задач. Кто-то вставляет строку таблицы в переписку или фрагмент лога в ИИ-ассистента с вопросом, что означает ошибка. Во всех случаях чувствительная часть — адрес, номер карты, ключ доступа — не была целью сообщения. Она просто приехала вместе с ним.
Решение не в том, чтобы быть осторожнее, а в одном шаге длиной в две секунды. Этот инструмент и есть такой шаг: вставили, взглянули на количество найденного, скопировали очищенную версию. Он намеренно сделан достаточно быстрым, чтобы пользоваться им не казалось правилом, о котором нужно помнить.
Что именно ищет инструмент
Распознаются девять категорий. Адреса почты и URL определяются по структуре. Адреса IPv4 проверяются по диапазонам, поэтому 999.1.1.1 и версия из пяти частей адресами не считаются. Номера социального страхования США распознаются только в записи через дефисы. Телефонам нужен международный префикс или настоящие разделители. Карты и IBAN проверяются контрольной суммой. API-ключи определяются по префиксу поставщика, а JWT — по трёхчастной структуре base64.
Этот список составлен из того, что действительно встречается во вставляемом тексте. Классические категории закрывают человеческую сторону, а категории учётных данных — машинную, и на практике именно там случаются самые дорогие происшествия: утёкший облачный ключ обходится намного дороже утёкшего телефона.
Точность важнее охвата
Соблазнительный способ построить такой инструмент — искать агрессивно: считать картой любую длинную цепочку цифр, а телефоном любое число с дефисами. На демонстрации это выглядит внушительно, а настоящие документы тихо портит. Номер заказа превращается в чёрную полосу. Количество строк исчезает. Номер версии становится [PHONE]. Хуже того, ущерб невидим: вы копируете результат, вставляете его и лишь потом узнаёте, что пропала именно та часть, которая была нужна.
Поэтому каждый детектор здесь либо структурно однозначен, либо проверяется контрольной суммой. Карта обязана пройти проверку Луна по модулю 10, которую используют все платёжные системы, а значит случайно выбранное 16-значное число проходит примерно в одном случае из десяти, а не гарантированно. IBAN должен пройти проверку mod-97 по ISO 13616. Простая цепочка цифр никогда не является телефоном. В итоге находится немного меньше, зато текст, который вы хотели сохранить, почти никогда не страдает, и для инструмента, результат которого вы тут же кому-то отправляете, это правильный размен.
Как выбрать способ замены
Чёрные полосы сохраняют визуальный вес оригинала, и это то, что нужно для скриншота или документа, который должен остаться похожим на документ. [REDACTED] — привычная юридическая формула, знакомая по запросам на раскрытие информации, и в обычном тексте читается однозначно. Метки типа вроде [EMAIL] и [CREDIT_CARD] сообщают, что именно убрали, а это важно, когда сам характер данных является частью объяснения: отчёт об ошибке читается совершенно иначе, если в нём написано [API_KEY], а не стоит безымянная чёрная полоса.
Нумерованные заполнители полезнее всего и при этом наименее очевидны. Повторные вхождения одного значения получают один и тот же номер, поэтому переписка, где клиент упомянут четыре раза, даёт четыре [EMAIL_1], а не четыре неразличимых пробела. Документ остаётся связным: и человек, и языковая модель по-прежнему видят, что речь идёт об одном и том же человеке, а вы сможете вернуть настоящие значения позже, если сохранили оригинал.
Очистка текста перед запросом к ИИ
Вставлять логи, обращения и внутренние документы в чат-ассистента стало рутиной, и сегодня это один из самых частых путей, которыми конфиденциальные данные покидают организацию. Запрос уходит третьей стороне, может храниться, а при некоторых настройках его может просматривать человек или использовать для обучения. В большинстве случаев ничего этого не требуется, потому что модели нужна форма задачи, а не настоящий адрес почты клиента.
Прогон текста через такой инструмент сохраняет полезное и отбрасывает рискованное. Режим нумерации подходит здесь лучше всего: модель по-прежнему может рассуждать о том, кто что сделал, потому что личности остаются различимыми и согласованными, а настоящие значения в запросе не появляются ни разу. Если по ответу нужно что-то сделать, верните заполнители в исходные значения уже на своей машине.
Почему сокрытие не работает в PDF и картинках
История неудавшихся сокрытий длинная и неловкая. Судебные документы, правительственные отчёты и корпоративные материалы публиковались с чёрными прямоугольниками, нарисованными поверх текста в просмотрщике PDF, тогда как исходные символы оставались под ними, выделялись, копировались и восстанавливались через считанные минуты после публикации. То же самое происходит, когда чёрной кистью закрашивают скриншот, а затем сохраняют его в формате, который хранит слой или миниатюру.
Причина в том, что чёрный прямоугольник — это команда рисования, а не удаление. Работа с обычным текстом убирает весь этот класс ошибок, потому что символы действительно заменяются в строке: то, что вы копируете, и есть всё, что существует. Если нужно скрыть данные в PDF, используйте инструмент, который удаляет сам текст под полосой, и обязательно проверьте результат, протянув выделение по чёрным полосам и вставив его куда-нибудь ещё.
Чего инструмент знать не может
Структурированные идентификаторы находятся потому, что у них есть форма. У имён, должностей, медицинских подробностей, внутренних кодовых названий проектов и фразы вроде "она живёт через два дома от клиники" формы нет, и никакой поиск по шаблонам их не найдёт. Инструмент убирает механически распознаваемую категорию чувствительных данных, но не читает документ за вас.
Считайте результат первым проходом, который надёжно убирает очевидное, и перечитайте его один раз перед отправкой. Счётчик удалённого нужен именно для этого: если вы ожидали два адреса почты, а найден один, эта разница стоит второго взгляда.
Часто задаваемые вопросы
Что здесь считается персональными данными?
Отправляется ли мой текст куда-либо?
Не испортит ли он обычные числа в тексте?
Можно ли использовать это перед вставкой в ChatGPT или другой ИИ?
Какие API-ключи и токены распознаются?
Действительно ли чёрный прямоугольник в PDF удаляет текст?
Чем это отличается от генератора зачёркнутого текста?
Можно ли восстановить исходные значения?
Похожие инструменты
Продолжайте работу с этими удобными инструментами