T

Text Machine

Alat teks andal, di browser Anda

Penghapus Data Pribadi

Tempel apa saja, tiket dukungan, log, transkrip percakapan, lalu buang data pribadi dan kunci rahasia yang bersembunyi di dalamnya sebelum Anda membagikannya. Semuanya berjalan di peramban, jadi teksnya tidak pernah meninggalkan perangkat Anda.

Teks Anda

Deteksi:

Alat ini hanyalah skrip biasa yang berjalan di sisi klien. Teks Anda diproses di tab peramban ini, tidak pernah dikirim ke server, dan tidak disimpan atau dicatat di mana pun. Tutup tabnya dan teks itu hilang.

Cara menggunakan Penghapus Data Pribadi

  1. 1

    Tempel teks Anda

    Masukkan tiket, log obrolan, dump galat, baris spreadsheet, atau dokumen yang hendak Anda bagikan. Tidak ada batas panjang dan tidak ada yang diunggah.

  2. 2

    Pilih cara penggantian

    Balok sensor mempertahankan bentuk aslinya sehingga cocok untuk tangkapan layar. [REDACTED] adalah tampilan dokumen yang paling dikenal. Label jenis seperti [EMAIL] memberi tahu pembaca apa yang dihapus, sedangkan placeholder bernomor seperti [EMAIL_1] menjaga keterkaitan antar pengulangan nilai yang sama.

  3. 3

    Nyalakan atau matikan detektor

    Kesembilan detektor menyala secara bawaan. Matikan yang kategorinya aman untuk dipertahankan, misalnya membiarkan URL dalam laporan bug sambil tetap menghapus kunci API di sebelahnya.

  4. 4

    Periksa hitungannya, lalu salin

    Panel menampilkan persis berapa item tiap jenis yang dihapus. Pastikan angkanya sesuai dugaan Anda, lalu salin teks yang sudah bersih.

Tentang menghapus data pribadi dan kunci rahasia dari teks

Mengapa teks dibagikan sebelum sempat diperiksa

Hampir semua kebocoran data pribadi yang tidak disengaja bermula dari tempelan biasa yang niatnya baik. Petugas dukungan menyalin pesan pelanggan ke obrolan grup untuk bertanya kepada rekan kerja. Pengembang melempar jejak galat ke pelacak isu. Seseorang menempel satu baris spreadsheet ke jendela obrolan, atau cuplikan log ke asisten AI untuk menanyakan arti pesan galatnya. Dalam semua kasus itu, bagian yang sensitif, entah alamat, nomor kartu, atau kunci akses, sama sekali bukan maksud pesannya. Ia hanya ikut terbawa.

Solusinya bukan lebih berhati-hati, melainkan satu langkah yang memakan dua detik. Alat ini ada untuk menjadi langkah itu: tempel, lihat sekilas berapa yang ditemukan, salin versi bersihnya. Ia sengaja dibuat cukup cepat supaya memakainya tidak terasa seperti aturan yang harus diingat.

Apa yang dicari alat ini

Ada sembilan kategori yang dideteksi. Alamat email dan URL dikenali dari strukturnya. Alamat IPv4 diperiksa rentang tiap oktetnya, jadi 999.1.1.1 dan string versi berbagian lima tidak dianggap alamat. Nomor jaminan sosial Amerika hanya dikenali dalam bentuk bertanda hubung. Nomor telepon harus punya awalan internasional atau pemisah sungguhan. Kartu dan IBAN divalidasi dengan checksum. Kunci API dikenali dari awalan vendornya, dan JWT dari struktur base64 tiga bagiannya.

Daftar itu dipilih dari apa yang benar-benar muncul dalam teks yang orang tempel. Kategori data pribadi klasik menutupi sisi manusia, dan kategori kredensial menutupi sisi mesin, dan dalam praktiknya di sanalah kecelakaan termahal terjadi: satu kunci cloud yang bocor jauh lebih mahal daripada satu nomor telepon yang bocor.

Ketepatan lebih penting daripada cakupan

Cara yang menggoda untuk membangun alat semacam ini adalah mencocokkan secara agresif: menganggap setiap deretan angka panjang sebagai kartu dan setiap angka bertanda hubung sebagai telepon. Hasilnya terlihat mengesankan saat demo dan diam-diam merusak dokumen sungguhan. ID pesanan berubah menjadi balok hitam. Jumlah baris lenyap. Nomor versi berubah jadi [PHONE]. Lebih buruk lagi, kerusakannya tidak terlihat: Anda menyalin keluarannya, menempelkannya, dan baru belakangan tahu bahwa justru bagian yang dibutuhkan orang lain sudah hilang.

Karena itu setiap detektor di sini entah tidak ambigu secara struktur atau diverifikasi dengan checksum. Kartu kredit harus lolos pemeriksaan Luhn mod-10 yang dipakai semua jaringan kartu, artinya angka 16 digit yang dipilih acak hanya punya sekitar satu banding sepuluh peluang diterima, bukan kepastian. IBAN harus lolos pemeriksaan mod-97 ISO 13616. Deretan angka polos tidak pernah menjadi nomor telepon. Hasilnya menangkap sedikit lebih sedikit tetapi hampir tidak pernah merusak teks yang ingin Anda pertahankan, dan itulah pertukaran yang tepat untuk alat yang keluarannya akan segera Anda kirim ke orang lain.

Memilih gaya penggantian

Balok sensor mempertahankan bobot visual aslinya, dan itulah yang Anda inginkan untuk tangkapan layar atau dokumen yang harus tetap terlihat seperti dokumen. [REDACTED] adalah konvensi yang akrab di dunia hukum dan permintaan keterbukaan informasi, dan terbaca jelas dalam teks polos. Label jenis seperti [EMAIL] dan [CREDIT_CARD] memberi tahu apa yang dihapus, dan itu penting ketika sifat datanya adalah bagian dari penjelasan: laporan bug terbaca sangat berbeda kalau tertulis [API_KEY] dibandingkan kalau hanya ada balok hitam tanpa nama.

Placeholder bernomor adalah yang paling berguna sekaligus paling tidak kentara. Kemunculan berulang atas nilai yang sama mendapat nomor yang sama, jadi utas yang menyebut satu pelanggan empat kali menghasilkan empat [EMAIL_1], bukan empat kekosongan yang tak terbedakan. Dokumennya tetap runut: pembaca, atau model bahasa, masih bisa melihat bahwa orang yang sama muncul sepanjang teks, dan Anda bisa memetakannya kembali ke nilai asli belakangan kalau menyimpan dokumen aslinya.

Membersihkan teks sebelum prompt AI

Menempel log, tiket, dan dokumen internal ke asisten percakapan sudah menjadi rutinitas, dan kini itu salah satu jalur paling umum keluarnya data sensitif dari sebuah organisasi. Prompt itu pergi ke pihak ketiga, bisa disimpan, dan pada sebagian konfigurasi bisa ditinjau manusia atau dipakai untuk pelatihan. Sebagian besar waktu semua itu tidak diperlukan, karena yang dibutuhkan model adalah bentuk masalahnya, bukan alamat email asli pelanggan.

Melewatkan teks melalui penghapus data terlebih dahulu mempertahankan bagian yang berguna dan membuang bagian yang berisiko. Mode bernomor paling pas di sini: model masih bisa menalar siapa melakukan apa karena identitasnya tetap terbedakan dan konsisten, sementara nilai aslinya sama sekali tidak pernah muncul di dalam prompt. Kalau Anda perlu menindaklanjuti jawabannya, terjemahkan kembali placeholder itu di mesin Anda sendiri.

Mengapa penyensoran gagal di PDF dan gambar

Ada sejarah panjang dan memalukan tentang penyensoran yang ternyata tidak menyensor apa pun. Berkas pengadilan, laporan pemerintah, dan dokumen korporat pernah dipublikasikan dengan persegi hitam yang sekadar digambar di atas teks pada penampil PDF, sementara karakter aslinya utuh di bawahnya, bisa diseleksi, bisa disalin, dan berhasil dipulihkan hanya beberapa menit setelah terbit. Hal serupa terjadi ketika kuas hitam disapukan pada tangkapan layar yang lalu disimpan dalam format yang menyimpan lapisan atau gambar mini.

Sebabnya sederhana: persegi hitam itu instruksi menggambar, bukan penghapusan. Bekerja dengan teks polos menghapus seluruh kelas kegagalan itu, karena karakternya benar-benar diganti di dalam string: yang Anda salin adalah semua yang ada. Kalau Anda memang harus menyensor PDF, pakailah alat yang membuang teks di bawahnya, lalu buktikan dengan menyeret seleksi melewati balok hitam dan menempelkan hasilnya di tempat lain untuk melihat apa yang muncul.

Catatan tentang hal yang tidak bisa diketahui sebuah alat

Pengenal terstruktur bisa dideteksi karena punya bentuk. Nama orang, jabatan, rincian medis, nama sandi proyek internal, dan kalimat seperti "dia tinggal dua rumah dari klinik itu" tidak punya bentuk, dan tidak ada pencocok pola yang akan menemukannya. Penghapus data membuang kategori data sensitif yang bersifat mekanis; ia tidak membaca dokumennya untuk Anda.

Perlakukan keluarannya sebagai lintasan pertama yang andal membersihkan materi yang jelas, lalu bacalah sekali sebelum Anda mengirimnya. Hitungan apa saja yang dihapus ada di sana justru untuk membantu hal itu: kalau Anda mengira ada dua alamat email tetapi hanya satu yang ditemukan, selisih itu layak dilihat lagi.

Pertanyaan yang sering diajukan

Apa saja yang dihitung sebagai data pribadi di sini?
Sembilan kategori: alamat email, nomor telepon, nomor kartu kredit, nomor jaminan sosial Amerika Serikat, alamat IPv4, URL, kunci dan token API, JWT, serta nomor rekening IBAN. Lima yang pertama adalah kategori informasi identitas pribadi klasik; sisanya adalah rahasia yang kebocorannya sama merugikan dan biasanya ikut terbawa dalam tempelan yang sama.
Apakah teks saya diunggah ke suatu tempat?
Tidak. Kode deteksi dan penggantian adalah modul JavaScript yang berjalan di tab peramban Anda. Tidak ada unggahan, tidak ada panggilan API, dan tidak ada peristiwa analitik yang membawa isi teks Anda. Justru itulah inti alat ini: kalau teks sensitif harus dikirim ke suatu tempat dulu supaya bisa dibersihkan, kebocorannya sudah terjadi. Anda bisa membuktikannya sendiri dengan membuka panel jaringan peramban dan melihat bahwa tidak ada permintaan yang keluar saat Anda mengetik.
Apakah angka biasa dalam teks saya akan ikut rusak?
Alat ini dibuat khusus untuk menghindarinya. Kartu kredit harus lolos checksum Luhn dan IBAN harus lolos pemeriksaan mod-97 sesuai ISO 13616 sebelum disentuh, sehingga nomor pesanan, nomor port, jumlah baris, atau string versi tetap utuh. Deretan angka polos tidak pernah dianggap nomor telepon; hanya nomor dengan kode negara atau pemisah sungguhan yang dihitung. Alat ini disetel mengutamakan ketepatan dibanding cakupan, karena satu salah tebak diam-diam memakan teks yang ingin Anda pertahankan dan mungkin baru Anda sadari setelah terkirim.
Bisakah dipakai sebelum menempel ke ChatGPT atau AI lain?
Bisa, itu salah satu kegunaan utamanya. Jika teks dilewatkan ke sini dulu, model tetap melihat struktur dan makna dokumen sementara alamat, nomor kartu, dan kunci yang asli sudah tidak ada. Mode bernomor paling cocok untuk ini: penyebutan berulang atas orang yang sama menjadi placeholder [EMAIL_1] yang sama, sehingga model tetap bisa mengikuti siapa itu siapa, dan Anda bisa memetakannya kembali setelahnya.
Kunci API dan token apa saja yang dikenali?
Kredensial berawalan vendor dengan bentuk yang tidak mungkin keliru: kunci sk- dari OpenAI, kunci live dan test Stripe, token akses pribadi GitHub, ID kunci akses AWS, kunci API Google, token Slack, PAT GitLab, token npm, dan kunci SendGrid, ditambah semua JWT serta token dalam header Authorization: Bearer. Hanya format berawalan yang dicocokkan, jadi kata biasa atau hash acak dalam teks Anda tidak dikira kredensial.
Apakah menghitamkan teks di PDF benar-benar menghapusnya?
Biasanya tidak. Menggambar persegi hitam di atas teks pada penampil PDF meninggalkan karakter aslinya utuh di bawahnya, masih bisa diseleksi dan disalin. Beberapa kegagalan penyensoran terkenal terjadi persis seperti itu. Bekerja dengan teks polos menghilangkan seluruh kelas masalah tersebut, karena karakternya benar-benar diganti di dalam string: yang Anda salin adalah semua yang ada.
Apa bedanya dengan generator teks tersensor?
Generator teks tersensor mengutamakan tampilan: ia menghitamkan kata secara acak untuk menghasilkan kesan dokumen rahasia pada unggahan dan meme. Alat ini justru sebaliknya: ia menemukan bagian yang benar-benar sensitif dan hanya menghapus bagian itu, membiarkan sisanya tetap terbaca sehingga dokumennya masih berguna.
Bisakah nilai aslinya dikembalikan?
Dari keluarannya tidak bisa. Penggantiannya satu arah dan tidak ada tabel pemetaan yang disimpan di mana pun, jadi simpanlah teks asli jika Anda membutuhkannya. Kalau Anda ingin mencocokkan placeholder dengan nilai secara manual, gunakan mode bernomor yang memberi setiap nilai berbeda satu indeks tetap di dalam dokumen.

Alat terkait

Lanjutkan dengan alat praktis ini

Generator Teks Disensor

Pengubah Kasus Teks

Cari dan Ganti Teks

Bionic Reading

Kapitalisasi Huruf Pertama

Kapitalisasi Setiap Kata