T

Text Machine

Leistungsstarke Text-Tools, direkt in Ihrem Browser

PII-Schwärzer

Fügen Sie ein, was Sie möchten, ein Support-Ticket, ein Log, ein Chatprotokoll, und entfernen Sie die darin versteckten personenbezogenen Daten und Secrets, bevor Sie es weitergeben. Alles läuft im Browser, der Text verlässt Ihr Gerät also nie.

Ihr Text

Erkennen:

Dieses Werkzeug ist ein einfaches clientseitiges Skript. Ihr Text wird in diesem Browser-Tab verarbeitet, nie an einen Server gesendet und nirgends gespeichert oder protokolliert. Tab schließen und er ist weg.

So verwenden Sie PII-Schwärzer

  1. 1

    Text einfügen

    Fügen Sie das Ticket, das Chatprotokoll, den Fehler-Dump, die Tabellenzeile oder das Dokument ein, das Sie gleich teilen wollen. Es gibt keine Längenbegrenzung und nichts wird hochgeladen.

  2. 2

    Ersetzungsart wählen

    Balken behalten die Form des Originals und eignen sich für Screenshots. [REDACTED] ist die klassische Dokumentoptik. Typ-Labels wie [EMAIL] sagen der Leserin, was entfernt wurde, und nummerierte Platzhalter wie [EMAIL_1] halten Wiederholungen desselben Werts miteinander verbunden.

  3. 3

    Detektoren ein- und ausschalten

    Alle neun Detektoren sind standardmäßig aktiv. Schalten Sie den aus, dessen Kategorie unbedenklich ist: etwa URLs in einem Fehlerbericht stehen lassen und nur den API-Schlüssel daneben entfernen.

  4. 4

    Zählung prüfen, dann kopieren

    Die Anzeige zeigt genau, wie viele Elemente jedes Typs entfernt wurden. Prüfen Sie, ob die Zahl Ihrer Erwartung entspricht, und kopieren Sie dann den bereinigten Text.

Personenbezogene Daten und Secrets aus Text entfernen

Warum Text geteilt wird, bevor jemand hinschaut

Fast jede versehentliche Offenlegung personenbezogener Daten beginnt mit einem gewöhnlichen, gut gemeinten Einfügen. Eine Support-Kraft kopiert die Nachricht einer Kundin in einen Gruppenchat, um Kolleginnen um Rat zu fragen. Eine Entwicklerin wirft einen Stacktrace in den Issue-Tracker. Jemand fügt eine Tabellenzeile in ein Chatfenster ein oder einen Log-Auszug in einen KI-Assistenten, um zu fragen, was der Fehler bedeutet. In jedem Fall war der sensible Teil, eine Adresse, eine Kartennummer, ein Zugriffsschlüssel, nie der Zweck der Nachricht. Er ist einfach mitgekommen.

Die Abhilfe ist nicht mehr Vorsicht, sondern ein Schritt, der zwei Sekunden dauert. Genau dieser Schritt soll dieses Werkzeug sein: einfügen, kurz auf die Zahl der Funde schauen, die saubere Fassung kopieren. Es ist bewusst so schnell, dass sich seine Benutzung nicht wie eine Vorschrift anfühlt, an die man denken muss.

Wonach das Werkzeug sucht

Neun Kategorien werden erkannt. E-Mail-Adressen und URLs werden strukturell erkannt. IPv4-Adressen werden auf gültige Bereiche geprüft, 999.1.1.1 und eine fünfteilige Versionsangabe gelten also nicht als Adressen. US-Sozialversicherungsnummern werden nur in der Schreibweise mit Bindestrichen erkannt. Telefonnummern brauchen entweder eine internationale Vorwahl oder echte Trennzeichen. Kreditkarten und IBANs werden per Prüfsumme validiert. API-Schlüssel werden am Anbieterpräfix erkannt, JWTs an ihrer dreiteiligen Base64-Struktur.

Diese Liste stammt daraus, was tatsächlich in eingefügtem Text auftaucht. Die klassischen Kategorien decken die menschliche Seite ab, die Zugangsdaten-Kategorien die maschinelle, und dort passieren in der Praxis die teuersten Unfälle: Ein abgeflossener Cloud-Schlüssel kostet weit mehr als eine abgeflossene Telefonnummer.

Präzision zählt mehr als Abdeckung

Der verlockende Weg, einen Schwärzer zu bauen, ist aggressives Matchen: jede lange Ziffernfolge als Karte, jede Zahl mit Bindestrichen als Telefonnummer behandeln. Das liefert in einer Demo eindrucksvolle Ergebnisse und ruiniert echte Dokumente im Stillen. Eine Bestell-ID wird zum schwarzen Balken. Eine Zeilenanzahl verschwindet. Eine Versionsnummer wird zu [PHONE]. Schlimmer noch, der Schaden ist unsichtbar: Sie kopieren die Ausgabe, fügen sie ein, und erfahren erst später, dass ausgerechnet der benötigte Teil fehlt.

Deshalb ist hier jeder Detektor entweder strukturell eindeutig oder prüfsummenvalidiert. Eine Kreditkarte muss die Luhn-mod-10-Prüfung bestehen, die jedes Kartennetz verwendet, das heißt eine zufällig gewählte 16-stellige Zahl hat etwa eine Chance von eins zu zehn, akzeptiert zu werden, keine Gewissheit. Eine IBAN muss die mod-97-Prüfung nach ISO 13616 bestehen. Eine bloße Ziffernfolge ist nie eine Telefonnummer. Das Ergebnis erwischt etwas weniger, beschädigt dafür fast nie Text, den Sie behalten wollten, und das ist der richtige Handel für ein Werkzeug, dessen Ausgabe Sie gleich verschicken.

Den passenden Ersetzungsstil wählen

Balken behalten das visuelle Gewicht des Originals, was man für einen Screenshot oder ein Dokument möchte, das weiterhin wie ein Dokument aussehen soll. [REDACTED] ist die vertraute Konvention aus Recht und Auskunftsanfragen und liest sich auch in reinem Text klar. Typ-Labels wie [EMAIL] und [CREDIT_CARD] sagen, was entfernt wurde, und das zählt, wenn die Art der Daten Teil der Erklärung ist: Ein Fehlerbericht liest sich völlig anders, wenn dort [API_KEY] steht, als wenn dort ein anonymer schwarzer Balken steht.

Nummerierte Platzhalter sind das Nützlichste und zugleich das Unauffälligste. Wiederholte Vorkommen desselben Werts bekommen dieselbe Nummer, ein Verlauf, der eine Kundin viermal erwähnt, ergibt also viermal [EMAIL_1] statt vier ununterscheidbarer Lücken. Das Dokument bleibt zusammenhängend: Eine Leserin oder ein Sprachmodell erkennt weiterhin, dass durchgehend dieselbe Person auftaucht, und Sie können die Platzhalter später wieder auf echte Werte abbilden, wenn Sie das Original behalten haben.

Text vor einem KI-Prompt bereinigen

Logs, Tickets und interne Dokumente in einen Chat-Assistenten einzufügen, ist längst Routine, und es ist inzwischen einer der häufigsten Wege, auf denen sensible Daten eine Organisation verlassen. Der Prompt geht an einen Dritten, kann aufbewahrt werden und in manchen Konfigurationen von Menschen gesichtet oder zum Training verwendet werden. Meist ist nichts davon nötig, denn das Modell braucht die Form des Problems, nicht die tatsächliche E-Mail-Adresse der Kundin.

Den Text vorher durch einen Schwärzer zu schicken, behält den nützlichen Teil und lässt den riskanten weg. Der nummerierte Modus passt hier am besten: Das Modell kann weiterhin darüber nachdenken, wer was getan hat, weil die Identitäten unterscheidbar und konsistent bleiben, während die echten Werte nie im Prompt auftauchen. Wenn Sie auf die Antwort hin handeln müssen, übersetzen Sie die Platzhalter auf Ihrem eigenen Rechner zurück.

Warum Schwärzen in PDFs und Bildern scheitert

Es gibt eine lange, peinliche Geschichte von Schwärzungen, die nichts geschwärzt haben. Gerichtsakten, Behördenberichte und Unternehmensunterlagen wurden veröffentlicht, während lediglich schwarze Rechtecke in einem PDF-Viewer über den Text gezeichnet worden waren, die ursprünglichen Zeichen darunter unversehrt, markierbar, kopierbar und binnen Minuten nach Veröffentlichung wiederhergestellt. Dasselbe passiert, wenn ein schwarzer Pinsel über einen Screenshot geführt und dieser anschließend in einem Format gespeichert wird, das eine Ebene oder ein Vorschaubild behält.

Der Grund ist, dass ein schwarzes Rechteck eine Zeichenanweisung ist und keine Löschung. In reinem Text zu arbeiten beseitigt diese ganze Fehlerklasse, weil die Zeichen wirklich in der Zeichenkette ersetzt werden: Was Sie kopieren, ist alles, was existiert. Falls Sie ein PDF schwärzen müssen, verwenden Sie ein Werkzeug, das den darunterliegenden Text entfernt, und prüfen Sie es, indem Sie eine Auswahl über die schwarzen Balken ziehen und das Ergebnis anderswo einfügen, um zu sehen, was herauskommt.

Was ein Werkzeug nicht wissen kann

Strukturierte Bezeichner sind erkennbar, weil sie eine Form haben. Namen, Funktionsbezeichnungen, medizinische Angaben, interne Projektcodenamen und ein Satz wie "sie wohnt zwei Türen weiter als die Praxis" haben keine, und kein Mustererkenner wird sie finden. Ein Schwärzer entfernt die mechanisch erfassbare Kategorie sensibler Daten; er liest das Dokument nicht für Sie.

Behandeln Sie die Ausgabe als ersten Durchgang, der das Offensichtliche zuverlässig beseitigt, und lesen Sie sie danach einmal, bevor Sie sie verschicken. Die Zählung des Entfernten ist genau dafür da: Wenn Sie zwei E-Mail-Adressen erwartet haben und nur eine gefunden wurde, ist dieser Unterschied einen zweiten Blick wert.

Häufig gestellte Fragen

Was gilt hier als personenbezogene Daten?
Neun Kategorien: E-Mail-Adressen, Telefonnummern, Kreditkartennummern, US-Sozialversicherungsnummern, IPv4-Adressen, URLs, API-Schlüssel und Tokens, JWTs sowie IBAN-Kontonummern. Die ersten fünf sind die klassischen personenbezogenen Kategorien; der Rest sind Secrets, deren Abfluss genauso schadet und die üblicherweise im selben Einfügen mitreisen.
Wird mein Text irgendwohin hochgeladen?
Nein. Der Code für Erkennung und Ersetzung ist ein JavaScript-Modul, das in Ihrem Browser-Tab läuft. Es gibt keinen Upload, keinen API-Aufruf und kein Analyse-Ereignis, das Ihre Inhalte transportiert. Genau darum geht es bei diesem Werkzeug: Wenn Sie sensiblen Text erst irgendwohin schicken müssen, um ihn zu bereinigen, ist er bereits abgeflossen. Sie können das selbst prüfen, indem Sie den Netzwerk-Tab des Browsers öffnen und beobachten, dass er beim Tippen still bleibt.
Zerstört es gewöhnliche Zahlen in meinem Text?
Es ist ausdrücklich so gebaut, dass das nicht passiert. Kreditkarten müssen die Luhn-Prüfsumme und IBANs die mod-97-Prüfung nach ISO 13616 bestehen, bevor sie angerührt werden. Eine Bestellnummer, ein Port, eine Zeilenanzahl oder eine Versionsangabe bleiben also unberührt. Eine bloße Ziffernfolge gilt nie als Telefonnummer, nur Nummern mit Ländervorwahl oder echten Trennzeichen zählen. Das Werkzeug ist auf Präzision statt auf Vollständigkeit ausgelegt, denn ein Fehltreffer frisst still den Text, den Sie behalten wollten, und Sie merken es womöglich erst nach dem Absenden.
Kann ich das vor dem Einfügen in ChatGPT oder eine andere KI nutzen?
Ja, das ist einer der Hauptanwendungsfälle. Wenn Sie den Text zuerst hier durchlaufen lassen, sieht das Modell weiterhin Struktur und Bedeutung des Dokuments, während die tatsächlichen Adressen, Kartennummern und Schlüssel verschwunden sind. Der nummerierte Modus passt dafür am besten: Wiederholte Erwähnungen derselben Person werden zum selben Platzhalter [EMAIL_1], das Modell kann also weiterhin nachvollziehen, wer wer ist, und Sie können die Platzhalter später zurückübersetzen.
Welche API-Schlüssel und Tokens werden erkannt?
Anbieterpräfixierte Zugangsdaten mit unverwechselbarer Form: OpenAI-sk--Schlüssel, Stripe-Live- und -Test-Schlüssel, persönliche Zugriffstoken von GitHub, AWS-Access-Key-IDs, Google-API-Schlüssel, Slack-Tokens, GitLab-PATs, npm-Tokens und SendGrid-Schlüssel, dazu jedes JWT und das Token in einem Authorization: Bearer-Header. Nur präfixierte Formate werden erkannt, ein normales Wort oder ein zufälliger Hash in Ihrem Text wird also nicht für Zugangsdaten gehalten.
Entfernt das Schwärzen in einem PDF den Text wirklich?
Meist nicht. Ein schwarzes Rechteck, das in einem PDF-Viewer über Text gezeichnet wird, lässt die ursprünglichen Zeichen darunter unversehrt, weiterhin markierbar und kopierbar. So sind mehrere prominente Schwärzungspannen entstanden. Mit reinem Text zu arbeiten vermeidet diese ganze Fehlerklasse, denn die Zeichen werden tatsächlich in der Zeichenkette ersetzt: Was Sie kopieren, ist alles, was existiert.
Was ist der Unterschied zum Schwärzungs-Textgenerator?
Der Schwärzungs-Textgenerator dient der Optik: Er schwärzt Wörter zufällig, um für Beiträge und Memes den Look eines Verschlusssachen-Dokuments zu erzeugen. Dieses Werkzeug tut das Gegenteil: Es findet die wirklich sensiblen Stellen und entfernt nur diese, während alles andere lesbar bleibt, damit das Dokument weiterhin seinen Zweck erfüllt.
Kann ich die ursprünglichen Werte zurückbekommen?
Aus der Ausgabe nicht. Die Ersetzung ist einseitig und es wird nirgends eine Zuordnung gespeichert, bewahren Sie den Originaltext also auf, wenn Sie ihn brauchen. Wenn Sie Platzhalter später von Hand zuordnen wollen, verwenden Sie den nummerierten Modus, der jedem eigenständigen Wert einen stabilen Index innerhalb des Dokuments gibt.

Verwandte Tools

Machen Sie weiter mit diesen praktischen Tools

Geschwärzter Text

Groß-/Kleinschreibung Konverter

Text suchen und ersetzen

Bionic Reading

Ersten Buchstaben großschreiben

Jeden Wort Großschreiben