Doppelte Zeilen entfernen
Entfernt wiederholte Zeilen aus Ihrem Text, während die ursprüngliche Reihenfolge erhalten bleibt.
So verwenden Sie Doppelte Zeilen entfernen
- 1
Text einfügen
Geben Sie die Zeilen, die Sie bereinigen möchten, in das Eingabefeld ein oder fügen Sie sie dort ein.
- 2
Optionen festlegen
Schalten Sie „Groß-/Kleinschreibung beachten“ und „Leerraum entfernen“ um, um zu steuern, wie Zeilen auf Duplikate verglichen werden.
- 3
Duplikate entfernen
Klicken Sie auf „Duplikate entfernen“, um wiederholte Zeilen zu entfernen und dabei das erste Vorkommen jeder Zeile zu behalten.
- 4
Ergebnis kopieren
Verwenden Sie die Schaltfläche zum Kopieren an der Ausgabe, um Ihren bereinigten Text zu sichern.
Zeilen deduplizieren, ohne die Reihenfolge zu verlieren
Die erste behalten, den Rest verwerfen
Dieses Tool entfernt wiederholte Zeilen und behält dabei das erste Auftreten jeder Zeile. Während es von oben nach unten liest, merkt es sich jede bereits gesehene Zeile; taucht eine Zeile erneut auf, wird diese spätere Kopie verworfen. Die überlebende Zeile sitzt stets an ihrer ursprünglichen Position, sodass die Gesamtreihenfolge Ihres Textes exakt erhalten bleibt.
Ein Beispiel verdeutlicht es. Bei den Zeilen apple, banana, apple, cherry, banana lautet die Ausgabe apple, banana, cherry. Das zweite apple und das zweite banana werden entfernt, doch die Reihenfolge der ersten Vorkommen bleibt unangetastet.
Deduplizieren ohne zu sortieren
Viele greifen zu einer Tabellenkalkulation oder einem sort-Befehl auf der Kommandozeile, um Duplikate zu entfernen, doch das Sortieren bringt als Nebenwirkung die Reihenfolge durcheinander. Das ist für eine alphabetisch geordnete Liste in Ordnung und verheerend für alles, bei dem die Abfolge Bedeutung trägt, etwa ein chronologisches Log, eine Rangliste oder die Schritte eines Vorgangs. Dieses Tool wahrt die Reihenfolge gerade deshalb, weil es nie sortiert.
Wenn Sie tatsächlich eine sortierte, eindeutige Liste möchten, sortieren Sie die Ausgabe im Anschluss. Das Entkoppeln der beiden Vorgänge gibt Ihnen die Kontrolle: erst deduplizieren, um die Reihenfolge zu behalten, oder erst sortieren, falls Ihnen die Reihenfolge gleichgültig ist.
Groß- und Kleinschreibung, an oder aus
Standardmäßig beachtet der Vergleich die Groß- und Kleinschreibung, sodass Apple und apple als verschiedene Zeilen gelten und beide erhalten bleiben. Deaktivieren Sie „Groß-/Kleinschreibung beachten“, und das Tool behandelt sie als dieselbe Zeile und behält nur die erste. Das ist bei realen Daten ständig von Bedeutung, wenn derselbe Wert in gemischter Schreibweise auftaucht.
Nutzen Sie den Abgleich ohne Beachtung der Schreibweise, wenn Sie Dinge wie E-Mail-Adressen, Tags oder Benutzernamen deduplizieren, bei denen „[email protected]“ und „[email protected]“ eindeutig als ein und dasselbe zählen sollten. Behalten Sie die Beachtung der Schreibweise bei, wenn die Großschreibung bedeutungstragend ist, etwa um Code-Bezeichner zu unterscheiden.
Leerraum vor dem Vergleich trimmen
Die Option „Leerraum entfernen“ ignoriert führende und nachgestellte Leerzeichen und Tabulatoren bei der Entscheidung, ob zwei Zeilen übereinstimmen. Ohne sie ist eine Zeile, die mit einem unsichtbaren nachgestellten Leerzeichen endet, technisch verschieden von derselben Zeile ohne ein solches, und beide würden überleben. Mit ihr verschmelzen diese nahezu identischen Zeilen zu einem einzigen Eintrag.
Damit lässt sich der häufigste Grund dafür ausräumen, dass die Duplikatentfernung offensichtliche Wiederholungen scheinbar „übersieht“: unsichtbarer Leerraum. Das Trimmen zu aktivieren ist meist die richtige Entscheidung, wenn Ihre Daten aus mehreren eingefügten Quellen zusammengesetzt sind.
Die beiden Optionen kombinieren
Die wahre Stärke entsteht, wenn Sie beide Schalter zusammen verwenden. Deaktivieren Sie die Beachtung der Schreibweise und aktivieren Sie das Trimmen, dann behandelt das Tool „ Apple “, „apple“ und „APPLE“ als ein und dasselbe. Das ist die nachsichtigste Einstellung und liefert in der Regel die sauberste deduplizierte Liste aus unaufgeräumter Eingabe.
Umgekehrt: Wenn Sie eine strikte Deduplizierung mit exaktem Abgleich brauchen, lassen Sie die Beachtung der Schreibweise an und das Trimmen aus. Die Zeile muss Byte für Byte identisch sein, samt aller Leerzeichen, um entfernt zu werden.
Wo es sich bezahlt macht
Typische Aufgaben sind das Bereinigen einer Verteilerliste, damit jede Adresse nur einmal vorkommt, das Verdichten von Logdateien, in denen sich derselbe Fehler hundertfach wiederholt, das Zusammenführen mehrerer Listen zu einer Hauptliste ohne Duplikate und das Aufräumen exportierter Daten vor dem Import. Überall, wo Sie zeilengetrennte Werte haben, die sich überschneiden können, reduziert dieses Tool sie auf eine eindeutige Menge.
Da jeder Eintrag als ganze Zeile beurteilt wird, glänzt es bei Listen kurzer Werte mit einem Eintrag pro Reihe und nicht bei fließendem Prosatext, in dem „Duplikat“ kein sinnvoller Begriff ist.
Zeilen, nicht Wörter oder Wortgruppen
Wichtig ist, sich zu merken, dass die Vergleichseinheit die gesamte Zeile ist. Zwei Zeilen, die ein wiederholtes Wort teilen, sich aber an irgendeiner anderen Stelle unterscheiden, bleiben beide erhalten, denn als ganze Zeilen sind sie nicht identisch. Dieses Tool findet keine wiederholten Wörter oder Sätze innerhalb eines Absatzes; es arbeitet strikt mit vollständigen Zeilen.
Wenn Ihre Duplikate noch nicht auf eigenen Zeilen stehen, teilen Sie sie zuerst auf, zum Beispiel mit „Zeilenumbrüche hinzufügen“, eingestellt auf einen Umbruch nach jedem Komma, sodass jeder Wert in einer eigenen Reihe landet, und führen Sie dann die Deduplizierung aus.
Häufig gestellte Fragen
Behält es die ursprüngliche Zeilenreihenfolge bei?
Beachtet der Vergleich die Groß-/Kleinschreibung?
Was bewirkt die Option „Leerraum entfernen“?
Welche Kopie einer doppelten Zeile wird behalten?
Wird mein Text an einen Server hochgeladen?
Verwandte Tools
Machen Sie weiter mit diesen praktischen Tools