T

Text Machine

Công cụ văn bản mạnh mẽ, ngay trong trình duyệt của bạn

Xóa thông tin cá nhân

Dán bất cứ thứ gì, một phiếu hỗ trợ, một tệp log, một đoạn hội thoại, rồi loại bỏ thông tin cá nhân và khóa bí mật ẩn bên trong trước khi bạn chia sẻ. Mọi thứ chạy trong trình duyệt nên văn bản không bao giờ rời khỏi máy bạn.

Văn bản của bạn

Phát hiện:

Công cụ này chỉ là một đoạn mã chạy phía trình duyệt. Văn bản của bạn được xử lý ngay trong tab này, không bao giờ gửi lên máy chủ, không được lưu hay ghi lại ở đâu cả. Đóng tab là mất.

Cách sử dụng Xóa thông tin cá nhân

  1. 1

    Dán văn bản

    Dán phiếu hỗ trợ, log hội thoại, bản đổ lỗi, một dòng bảng tính hay tài liệu mà bạn sắp chia sẻ. Không giới hạn độ dài và không có gì được tải lên.

  2. 2

    Chọn cách thay thế

    Thanh bôi đen giữ nguyên hình dạng bản gốc, hợp cho ảnh chụp màn hình. [REDACTED] là kiểu tài liệu quen thuộc nhất. Nhãn loại như [EMAIL] cho người đọc biết thứ gì đã bị xóa, còn chỗ giữ đánh số như [EMAIL_1] giữ liên kết giữa các lần lặp của cùng một giá trị.

  3. 3

    Bật hoặc tắt bộ phát hiện

    Cả chín bộ phát hiện đều bật sẵn. Hãy tắt loại nào an toàn để giữ lại, ví dụ giữ URL trong một báo cáo lỗi nhưng vẫn xóa khóa API nằm ngay bên cạnh.

  4. 4

    Kiểm tra số lượng rồi sao chép

    Bảng hiển thị chính xác bao nhiêu mục thuộc mỗi loại đã bị xóa. Xác nhận con số khớp với dự đoán của bạn rồi sao chép văn bản đã làm sạch.

Về việc xóa thông tin cá nhân và khóa bí mật khỏi văn bản

Vì sao văn bản được chia sẻ trước khi ai đó kịp kiểm tra

Gần như mọi vụ lộ thông tin cá nhân ngoài ý muốn đều bắt đầu từ một lần dán bình thường và đầy thiện chí. Nhân viên hỗ trợ chép tin nhắn của khách vào nhóm chat để hỏi đồng nghiệp nên làm gì. Lập trình viên quăng một dấu vết lỗi vào trình theo dõi vấn đề. Ai đó dán một dòng bảng tính vào khung chat, hoặc một đoạn log vào trợ lý AI để hỏi lỗi này nghĩa là gì. Trong mọi trường hợp, phần nhạy cảm, một địa chỉ, một số thẻ, một khóa truy cập, chưa bao giờ là mục đích của tin nhắn. Nó chỉ đi kèm theo.

Cách khắc phục không phải là cẩn thận hơn, mà là một bước mất hai giây. Công cụ này tồn tại để làm đúng bước đó: dán vào, liếc qua số lượng tìm được, sao chép bản đã sạch. Nó được làm cho đủ nhanh để việc dùng nó không giống một quy định phải cố nhớ.

Công cụ tìm những gì

Có chín nhóm được phát hiện. Địa chỉ email và URL được nhận theo cấu trúc. Địa chỉ IPv4 được kiểm tra phạm vi từng nhóm số nên 999.1.1.1 hay chuỗi phiên bản năm phần không bị coi là địa chỉ. Số an sinh xã hội Mỹ chỉ được nhận ở dạng có dấu gạch nối. Số điện thoại cần mã quốc tế hoặc dấu phân cách thật. Thẻ và IBAN được xác thực bằng tổng kiểm tra. Khóa API nhận theo tiền tố nhà cung cấp, còn JWT nhận theo cấu trúc base64 ba phần.

Danh sách này chọn từ những gì thực sự xuất hiện trong văn bản người ta hay dán. Các nhóm thông tin cá nhân kinh điển lo phần con người, còn các nhóm thông tin xác thực lo phần máy móc, và trên thực tế đó mới là nơi xảy ra những sự cố đắt đỏ nhất: rò một khóa đám mây tốn kém hơn rất nhiều so với rò một số điện thoại.

Chính xác quan trọng hơn bao phủ

Cách hấp dẫn nhất để làm một công cụ xóa thông tin là bắt thật rộng: coi mọi dãy số dài là thẻ, mọi con số có gạch nối là điện thoại. Kết quả nhìn rất ấn tượng khi trình diễn nhưng lại âm thầm phá hỏng tài liệu thật. Mã đơn hàng biến thành thanh đen. Số dòng biến mất. Số phiên bản hóa thành [PHONE]. Tệ hơn, thiệt hại đó vô hình: bạn sao chép kết quả, dán đi, rồi mãi sau mới biết đúng phần người ta cần đã không còn.

Vì vậy mọi bộ phát hiện ở đây đều hoặc rõ ràng về cấu trúc, hoặc được xác thực bằng tổng kiểm tra. Thẻ tín dụng phải qua phép kiểm Luhn mod-10 mà mọi tổ chức thẻ đều dùng, nghĩa là một dãy 16 chữ số lấy ngẫu nhiên chỉ có khoảng một phần mười cơ hội được chấp nhận chứ không phải chắc chắn. IBAN phải qua phép kiểm mod-97 theo ISO 13616. Một dãy chữ số trơn không bao giờ là số điện thoại. Kết quả là bắt được ít hơn một chút nhưng gần như không bao giờ làm hỏng phần văn bản bạn muốn giữ, và đó là đánh đổi đúng cho một công cụ mà kết quả của nó sắp được gửi đi ngay.

Chọn kiểu thay thế

Thanh bôi đen giữ được sức nặng thị giác của bản gốc, đúng thứ bạn cần cho ảnh chụp màn hình hoặc một tài liệu vẫn phải trông giống tài liệu. [REDACTED] là quy ước quen thuộc trong ngành luật và các yêu cầu công khai thông tin, đọc trên văn bản thuần cũng rất rõ nghĩa. Nhãn loại như [EMAIL] và [CREDIT_CARD] cho biết thứ gì đã bị xóa, điều này quan trọng khi bản chất dữ liệu là một phần của lời giải thích: một báo cáo lỗi ghi [API_KEY] kể một câu chuyện rất khác so với một thanh đen vô danh.

Chỗ giữ có đánh số vừa hữu ích nhất vừa ít được để ý nhất. Các lần xuất hiện lặp lại của cùng một giá trị nhận cùng một số, nên một chuỗi hội thoại nhắc tới một khách hàng bốn lần sẽ cho ra bốn [EMAIL_1] thay vì bốn khoảng trống không phân biệt được. Tài liệu giữ được mạch lạc: người đọc, hay một mô hình ngôn ngữ, vẫn thấy được cùng một người xuất hiện xuyên suốt, và bạn có thể ánh xạ ngược về giá trị thật sau này nếu còn giữ bản gốc.

Làm sạch văn bản trước khi đưa vào AI

Dán log, phiếu hỗ trợ và tài liệu nội bộ vào trợ lý trò chuyện đã thành chuyện thường ngày, và giờ đây đó là một trong những con đường phổ biến nhất khiến dữ liệu nhạy cảm rời khỏi tổ chức. Câu lệnh đi tới bên thứ ba, có thể được lưu lại, và ở một số cấu hình có thể được con người xem lại hoặc dùng để huấn luyện. Phần lớn trường hợp chẳng cần đến chuyện đó, vì mô hình cần hình dạng của vấn đề chứ không cần địa chỉ email thật của khách hàng.

Cho văn bản đi qua công cụ xóa thông tin trước sẽ giữ phần hữu ích và bỏ phần rủi ro. Chế độ đánh số hợp nhất ở đây: mô hình vẫn suy luận được ai làm gì vì các danh tính vẫn phân biệt được và nhất quán, trong khi giá trị thật không hề xuất hiện trong câu lệnh. Nếu cần hành động theo câu trả lời, hãy dịch ngược các chỗ giữ ngay trên máy của bạn.

Vì sao bôi đen thất bại trong PDF và ảnh

Có cả một lịch sử dài và ngượng ngùng về những lần bôi đen mà không xóa được gì. Hồ sơ tòa án, báo cáo chính phủ và tài liệu doanh nghiệp đều từng được công bố với những hình chữ nhật đen vẽ đè lên chữ trong trình xem PDF, còn ký tự gốc vẫn nguyên bên dưới, vẫn bôi chọn và sao chép được, và được khôi phục chỉ vài phút sau khi công bố. Chuyện tương tự xảy ra khi người ta quét cọ đen lên ảnh chụp màn hình rồi lưu ở định dạng còn giữ lớp hoặc ảnh thu nhỏ.

Lý do là hình chữ nhật đen chỉ là một lệnh vẽ chứ không phải một thao tác xóa. Làm việc với văn bản thuần loại bỏ toàn bộ lớp lỗi này, vì ký tự thật sự bị thay trong chuỗi: thứ bạn sao chép chính là tất cả những gì tồn tại. Nếu buộc phải bôi đen một tệp PDF, hãy dùng công cụ xóa hẳn phần chữ bên dưới, rồi kiểm chứng bằng cách kéo chọn qua các thanh đen và dán kết quả ra chỗ khác xem có gì hiện ra.

Đôi lời về thứ mà công cụ không thể biết

Các định danh có cấu trúc phát hiện được vì chúng có hình dạng. Tên người, chức danh, chi tiết bệnh án, tên mã dự án nội bộ và một câu như "cô ấy sống cách phòng khám hai căn" thì không có hình dạng nào, và không bộ so khớp mẫu nào tìm ra chúng. Công cụ xóa thông tin loại bỏ nhóm dữ liệu nhạy cảm mang tính máy móc; nó không đọc tài liệu thay bạn.

Hãy coi kết quả là lượt xử lý đầu tiên dọn sạch phần hiển nhiên một cách đáng tin cậy, rồi đọc lại một lượt trước khi gửi. Con số thống kê những gì đã bị xóa có mặt ở đó chính là để giúp việc này: nếu bạn nghĩ có hai địa chỉ email mà công cụ chỉ tìm ra một, khác biệt đó đáng để nhìn lại.

Câu hỏi thường gặp

Ở đây những gì được coi là thông tin cá nhân?
Chín nhóm: địa chỉ email, số điện thoại, số thẻ tín dụng, số an sinh xã hội Mỹ, địa chỉ IPv4, URL, khóa và token API, JWT, và số tài khoản IBAN. Năm nhóm đầu là thông tin định danh cá nhân kinh điển; phần còn lại là các bí mật rò rỉ ra cũng tai hại không kém và thường đi kèm trong cùng một lần dán.
Văn bản của tôi có bị gửi đi đâu không?
Không. Mã phát hiện và thay thế là một mô đun JavaScript chạy trong tab trình duyệt của bạn. Không có tải lên, không có lệnh gọi API, không có sự kiện phân tích nào mang theo nội dung của bạn. Đó chính là lý do công cụ này tồn tại: nếu phải gửi văn bản nhạy cảm đi đâu đó để làm sạch thì bạn đã làm rò rỉ nó rồi. Bạn có thể tự kiểm chứng bằng cách mở tab mạng của trình duyệt và thấy nó im lặng suốt lúc bạn gõ.
Nó có phá hỏng những con số bình thường trong văn bản không?
Công cụ được xây dựng chính là để tránh điều đó. Thẻ tín dụng phải qua tổng kiểm tra Luhn và IBAN phải qua phép kiểm mod-97 theo ISO 13616 thì mới bị đụng tới, nên mã đơn hàng, số cổng, số dòng hay chuỗi phiên bản đều được giữ nguyên. Một dãy chữ số trơn không bao giờ bị coi là số điện thoại; chỉ những số có mã quốc gia hoặc dấu phân cách thật mới được tính. Công cụ ưu tiên độ chính xác hơn độ phủ, vì một lần nhận nhầm sẽ âm thầm ăn mất phần văn bản bạn muốn giữ và có khi gửi đi rồi bạn mới nhận ra.
Tôi có thể dùng nó trước khi dán vào ChatGPT hay AI khác không?
Có, đó là một trong những cách dùng chính. Cho văn bản đi qua đây trước thì mô hình vẫn thấy cấu trúc và ý nghĩa của tài liệu, còn địa chỉ, số thẻ và khóa thật thì đã biến mất. Chế độ đánh số hợp nhất cho việc này: các lần nhắc tới cùng một người đều thành cùng một [EMAIL_1], nên mô hình vẫn theo dõi được ai là ai, và sau đó bạn có thể đối chiếu ngược lại.
Công cụ nhận ra những khóa API và token nào?
Các thông tin xác thực có tiền tố nhà cung cấp với hình dạng rõ ràng: khóa sk- của OpenAI, khóa live và test của Stripe, token truy cập cá nhân GitHub, ID khóa truy cập AWS, khóa API Google, token Slack, PAT của GitLab, token npm và khóa SendGrid, cùng mọi JWT và token trong tiêu đề Authorization: Bearer. Chỉ các định dạng có tiền tố mới được nhận diện, nên một từ bình thường hay một chuỗi băm ngẫu nhiên trong văn bản sẽ không bị nhầm là thông tin xác thực.
Bôi đen chữ trong PDF có thực sự xóa được không?
Thường là không. Vẽ một hình chữ nhật đen lên chữ trong trình xem PDF vẫn để nguyên các ký tự gốc bên dưới, vẫn bôi chọn và sao chép được. Nhiều vụ bôi đen thất bại nổi tiếng đã xảy ra đúng như vậy. Làm việc với văn bản thuần tránh được toàn bộ loại lỗi này, vì ký tự thật sự bị thay trong chuỗi: thứ bạn sao chép chính là tất cả những gì tồn tại.
Khác gì so với công cụ tạo chữ bôi đen?
Công cụ tạo chữ bôi đen là để nhìn cho đẹp: nó che ngẫu nhiên các từ để tạo cảm giác tài liệu mật cho bài đăng và ảnh chế. Công cụ này thì ngược lại: nó tìm đúng những phần thật sự nhạy cảm và chỉ xóa những phần đó, phần còn lại vẫn đọc được để tài liệu tiếp tục làm được việc của nó.
Có lấy lại được giá trị gốc không?
Từ kết quả thì không. Việc thay thế là một chiều và không có bảng đối chiếu nào được lưu ở đâu cả, nên hãy giữ văn bản gốc nếu bạn cần. Nếu muốn đối chiếu thủ công về sau, hãy dùng chế độ đánh số: mỗi giá trị khác nhau sẽ có một chỉ số cố định trong tài liệu.

Công cụ liên quan

Tiếp tục với những công cụ hữu ích này

Công Cụ Tạo Chữ Bôi Đen

Chuyển Đổi Kiểu Chữ

Tìm và Thay thế Văn bản

Bionic Reading

Viết Hoa Chữ Cái Đầu

Viết hoa mỗi từ