T

Text Machine

Мощные текстовые инструменты прямо в браузере

PII-редактор

Вставьте что угодно: обращение в поддержку, лог, переписку, и уберите спрятанные внутри персональные данные и секреты до того, как поделитесь этим. Всё считается в браузере, поэтому текст не покидает ваше устройство.

Ваш текст

Искать:

Это обычный скрипт, работающий на стороне клиента. Ваш текст обрабатывается во вкладке браузера, никогда не отправляется на сервер и нигде не сохраняется и не логируется. Закройте вкладку, и он исчезнет.

Как пользоваться PII-редактор

  1. 1

    Вставьте текст

    Вставьте обращение, лог переписки, дамп ошибки, строку таблицы или документ, которым собираетесь поделиться. Ограничения по длине нет, ничего никуда не отправляется.

  2. 2

    Выберите способ замены

    Чёрные полосы сохраняют форму оригинала и хорошо смотрятся на скриншотах. [REDACTED] — привычный вид официального документа. Метки типа вроде [EMAIL] показывают, что именно убрали, а нумерованные заполнители вроде [EMAIL_1] сохраняют связь между повторами одного и того же значения.

  3. 3

    Включите или выключите детекторы

    Все девять детекторов включены по умолчанию. Выключите тот, чью категорию можно оставить: например, сохранить URL в отчёте об ошибке, убрав только стоящий рядом API-ключ.

  4. 4

    Проверьте счётчик и скопируйте

    На панели видно, сколько элементов каждого типа было удалено. Убедитесь, что число совпадает с ожидаемым, и скопируйте очищенный текст.

Об удалении персональных данных и секретов из текста

Почему текст отправляют раньше, чем успевают проверить

Почти любая случайная утечка персональных данных начинается с обычной вставки, сделанной из лучших побуждений. Сотрудник поддержки копирует сообщение клиента в общий чат, чтобы спросить совета у коллеги. Разработчик кидает трассировку стека в трекер задач. Кто-то вставляет строку таблицы в переписку или фрагмент лога в ИИ-ассистента с вопросом, что означает ошибка. Во всех случаях чувствительная часть — адрес, номер карты, ключ доступа — не была целью сообщения. Она просто приехала вместе с ним.

Решение не в том, чтобы быть осторожнее, а в одном шаге длиной в две секунды. Этот инструмент и есть такой шаг: вставили, взглянули на количество найденного, скопировали очищенную версию. Он намеренно сделан достаточно быстрым, чтобы пользоваться им не казалось правилом, о котором нужно помнить.

Что именно ищет инструмент

Распознаются девять категорий. Адреса почты и URL определяются по структуре. Адреса IPv4 проверяются по диапазонам, поэтому 999.1.1.1 и версия из пяти частей адресами не считаются. Номера социального страхования США распознаются только в записи через дефисы. Телефонам нужен международный префикс или настоящие разделители. Карты и IBAN проверяются контрольной суммой. API-ключи определяются по префиксу поставщика, а JWT — по трёхчастной структуре base64.

Этот список составлен из того, что действительно встречается во вставляемом тексте. Классические категории закрывают человеческую сторону, а категории учётных данных — машинную, и на практике именно там случаются самые дорогие происшествия: утёкший облачный ключ обходится намного дороже утёкшего телефона.

Точность важнее охвата

Соблазнительный способ построить такой инструмент — искать агрессивно: считать картой любую длинную цепочку цифр, а телефоном любое число с дефисами. На демонстрации это выглядит внушительно, а настоящие документы тихо портит. Номер заказа превращается в чёрную полосу. Количество строк исчезает. Номер версии становится [PHONE]. Хуже того, ущерб невидим: вы копируете результат, вставляете его и лишь потом узнаёте, что пропала именно та часть, которая была нужна.

Поэтому каждый детектор здесь либо структурно однозначен, либо проверяется контрольной суммой. Карта обязана пройти проверку Луна по модулю 10, которую используют все платёжные системы, а значит случайно выбранное 16-значное число проходит примерно в одном случае из десяти, а не гарантированно. IBAN должен пройти проверку mod-97 по ISO 13616. Простая цепочка цифр никогда не является телефоном. В итоге находится немного меньше, зато текст, который вы хотели сохранить, почти никогда не страдает, и для инструмента, результат которого вы тут же кому-то отправляете, это правильный размен.

Как выбрать способ замены

Чёрные полосы сохраняют визуальный вес оригинала, и это то, что нужно для скриншота или документа, который должен остаться похожим на документ. [REDACTED] — привычная юридическая формула, знакомая по запросам на раскрытие информации, и в обычном тексте читается однозначно. Метки типа вроде [EMAIL] и [CREDIT_CARD] сообщают, что именно убрали, а это важно, когда сам характер данных является частью объяснения: отчёт об ошибке читается совершенно иначе, если в нём написано [API_KEY], а не стоит безымянная чёрная полоса.

Нумерованные заполнители полезнее всего и при этом наименее очевидны. Повторные вхождения одного значения получают один и тот же номер, поэтому переписка, где клиент упомянут четыре раза, даёт четыре [EMAIL_1], а не четыре неразличимых пробела. Документ остаётся связным: и человек, и языковая модель по-прежнему видят, что речь идёт об одном и том же человеке, а вы сможете вернуть настоящие значения позже, если сохранили оригинал.

Очистка текста перед запросом к ИИ

Вставлять логи, обращения и внутренние документы в чат-ассистента стало рутиной, и сегодня это один из самых частых путей, которыми конфиденциальные данные покидают организацию. Запрос уходит третьей стороне, может храниться, а при некоторых настройках его может просматривать человек или использовать для обучения. В большинстве случаев ничего этого не требуется, потому что модели нужна форма задачи, а не настоящий адрес почты клиента.

Прогон текста через такой инструмент сохраняет полезное и отбрасывает рискованное. Режим нумерации подходит здесь лучше всего: модель по-прежнему может рассуждать о том, кто что сделал, потому что личности остаются различимыми и согласованными, а настоящие значения в запросе не появляются ни разу. Если по ответу нужно что-то сделать, верните заполнители в исходные значения уже на своей машине.

Почему сокрытие не работает в PDF и картинках

История неудавшихся сокрытий длинная и неловкая. Судебные документы, правительственные отчёты и корпоративные материалы публиковались с чёрными прямоугольниками, нарисованными поверх текста в просмотрщике PDF, тогда как исходные символы оставались под ними, выделялись, копировались и восстанавливались через считанные минуты после публикации. То же самое происходит, когда чёрной кистью закрашивают скриншот, а затем сохраняют его в формате, который хранит слой или миниатюру.

Причина в том, что чёрный прямоугольник — это команда рисования, а не удаление. Работа с обычным текстом убирает весь этот класс ошибок, потому что символы действительно заменяются в строке: то, что вы копируете, и есть всё, что существует. Если нужно скрыть данные в PDF, используйте инструмент, который удаляет сам текст под полосой, и обязательно проверьте результат, протянув выделение по чёрным полосам и вставив его куда-нибудь ещё.

Чего инструмент знать не может

Структурированные идентификаторы находятся потому, что у них есть форма. У имён, должностей, медицинских подробностей, внутренних кодовых названий проектов и фразы вроде "она живёт через два дома от клиники" формы нет, и никакой поиск по шаблонам их не найдёт. Инструмент убирает механически распознаваемую категорию чувствительных данных, но не читает документ за вас.

Считайте результат первым проходом, который надёжно убирает очевидное, и перечитайте его один раз перед отправкой. Счётчик удалённого нужен именно для этого: если вы ожидали два адреса почты, а найден один, эта разница стоит второго взгляда.

Часто задаваемые вопросы

Что здесь считается персональными данными?
Девять категорий: адреса электронной почты, номера телефонов, номера банковских карт, номера социального страхования США, адреса IPv4, URL, API-ключи и токены, JWT и номера счетов IBAN. Первые пять — классические персональные данные, остальные — секреты, утечка которых обходится не дешевле и которые обычно попадают в ту же самую вставку.
Отправляется ли мой текст куда-либо?
Нет. Код поиска и замены — это модуль JavaScript, который выполняется во вкладке вашего браузера. Ни загрузки, ни обращения к API, ни аналитического события с вашим содержимым. В этом и смысл инструмента: если ради очистки конфиденциальный текст нужно куда-то отправить, утечка уже произошла. Проверить легко: откройте панель сети в браузере и убедитесь, что при наборе не уходит ни одного запроса.
Не испортит ли он обычные числа в тексте?
Он специально сделан так, чтобы этого не происходило. Карты должны пройти проверку Луна, а IBAN — проверку mod-97 по стандарту ISO 13616, и только тогда их трогают. Поэтому номер заказа, порт, количество строк или номер версии остаются нетронутыми. Простая последовательность цифр никогда не считается телефоном: подходят только номера с международным префиксом или настоящими разделителями. Инструмент настроен на точность, а не на полноту, потому что ложное срабатывание молча съедает текст, который вы хотели сохранить, и заметить это можно уже после отправки.
Можно ли использовать это перед вставкой в ChatGPT или другой ИИ?
Да, это один из основных сценариев. Если сначала пропустить текст здесь, модель по-прежнему видит структуру и смысл документа, а настоящие адреса, номера карт и ключи исчезают. Лучше всего подходит режим нумерации: повторные упоминания одного человека становятся одним и тем же [EMAIL_1], поэтому модель продолжает понимать, кто есть кто, а вы потом сможете вернуть настоящие значения.
Какие API-ключи и токены распознаются?
Учётные данные с узнаваемым префиксом поставщика: ключи sk- от OpenAI, боевые и тестовые ключи Stripe, персональные токены доступа GitHub, идентификаторы ключей доступа AWS, ключи Google API, токены Slack, PAT GitLab, токены npm и ключи SendGrid, а также любой JWT и токен из заголовка Authorization: Bearer. Распознаются только форматы с префиксом, поэтому обычное слово или случайный хеш в тексте не примут за учётные данные.
Действительно ли чёрный прямоугольник в PDF удаляет текст?
Обычно нет. Нарисованный поверх текста в просмотрщике PDF чёрный прямоугольник оставляет исходные символы под собой, их по-прежнему можно выделить и скопировать. Именно так произошло несколько громких провалов с сокрытием данных. Работа с обычным текстом снимает эту проблему целиком: символы действительно заменяются в строке, и то, что вы копируете, — это всё, что существует.
Чем это отличается от генератора зачёркнутого текста?
Генератор чёрных полос нужен ради внешнего вида: он случайным образом закрашивает слова, чтобы получился вид секретного документа для поста или мема. Этот инструмент делает обратное: находит по-настоящему чувствительные фрагменты и убирает только их, оставляя остальное читаемым, чтобы документ продолжал выполнять свою задачу.
Можно ли восстановить исходные значения?
Из результата — нет. Замена односторонняя, никакая таблица соответствий нигде не сохраняется, поэтому сохраните исходный текст, если он вам понадобится. Если нужно вручную сопоставить заполнители со значениями, используйте режим нумерации: каждому отдельному значению присваивается постоянный номер в пределах документа.

Похожие инструменты

Продолжайте работу с этими удобными инструментами

Зацензуренный текст

Конвертер Регистра

Поиск и Замена Текста

Бионическое чтение

Сделать первую букву заглавной

Сделать Каждое Слово с Заглавной Буквы