Удалить Повторяющиеся Строки
Удаляет повторяющиеся строки из вашего текста, сохраняя исходный порядок.
Как пользоваться Удалить Повторяющиеся Строки
- 1
Вставьте текст
Введите или вставьте строки, которые нужно очистить, в поле ввода.
- 2
Задайте параметры
Переключите «Учитывать регистр» и «Обрезать пробелы», чтобы управлять тем, как строки сравниваются на дубликаты.
- 3
Удалите дубликаты
Нажмите «Удалить дубликаты», чтобы убрать повторяющиеся строки, сохранив первое вхождение каждой.
- 4
Скопируйте результат
Используйте кнопку копирования на выводе, чтобы сохранить текст без дубликатов.
Удаление дубликатов строк без потери порядка
Оставить первую, отбросить остальные
Этот инструмент удаляет повторяющиеся строки, сохраняя первое появление каждой строки. Читая сверху вниз, он запоминает каждую уже встреченную строку; когда строка появляется снова, эта более поздняя копия отбрасывается. Уцелевшая строка всегда остаётся на своей исходной позиции, поэтому общая последовательность вашего текста сохраняется в точности.
Пример проясняет это. Из строк apple, banana, apple, cherry, banana на выходе получается apple, banana, cherry. Второй apple и второй banana удаляются, но порядок первых вхождений остаётся нетронутым.
Удаление дубликатов без сортировки
Многие хватаются за таблицу или команду сортировки в командной строке, чтобы убрать дубликаты, но сортировка как побочный эффект перемешивает порядок. Для списка по алфавиту это нормально, а для всего, где последовательность несёт смысл, — хронологического лога, ранжированного списка или шагов процесса — губительно. Этот инструмент сохраняет порядок именно потому, что вообще не сортирует.
Если вам действительно нужен отсортированный список без повторов, отсортируйте результат потом. Разделение этих двух операций даёт вам контроль: сначала уберите дубликаты, чтобы сохранить порядок, или сначала отсортируйте, если порядок для вас неважен.
Учёт регистра: включён или выключен
По умолчанию сравнение учитывает регистр, поэтому Apple и apple считаются разными строками и обе сохраняются. Выключите параметр «Учитывать регистр», и инструмент будет считать их одной и той же строкой, оставляя только первую. Это постоянно играет роль в реальных данных, где одно и то же значение встречается в разном регистре.
Используйте сопоставление без учёта регистра, когда убираете дубликаты среди таких данных, как адреса электронной почты, теги или имена пользователей, где «[email protected]» и «[email protected]» явно должны считаться одним и тем же. Оставляйте учёт регистра включённым, когда регистр значим, — например, при различении идентификаторов в коде.
Обрезка пробелов перед сравнением
Параметр «Удалять пробельные символы» игнорирует начальные и конечные пробелы и табуляции при решении о том, совпадают ли две строки. Без него строка, заканчивающаяся невидимым концевым пробелом, технически отличается от той же строки без него, и обе уцелели бы. С ним эти почти одинаковые строки схлопываются в одну запись.
Это устраняет самую частую причину, по которой удаление дубликатов словно «пропускает» очевидные повторы, — невидимые пробельные символы. Включить обрезку обычно правильное решение, когда ваши данные собраны из нескольких вставленных источников.
Сочетание двух параметров
Настоящая сила появляется, когда оба переключателя используются вместе. Выключите учёт регистра и включите обрезку пробелов — и инструмент будет считать « Apple », «apple» и «APPLE» одним и тем же. Это самая снисходительная настройка, и она, как правило, даёт самый чистый список без дубликатов из неопрятного ввода.
И наоборот, если вам нужно строгое удаление только точных совпадений, оставьте учёт регистра включённым, а обрезку выключенной. Чтобы строку удалили, она должна быть идентична байт в байт, со всеми пробелами.
Где он оправдывает себя
Типичные задачи: очистка списка рассылки, чтобы каждый адрес встречался один раз; сжатие лог-файлов, где одна и та же ошибка повторяется сотни раз; объединение нескольких списков в один главный без дубликатов; приведение в порядок выгруженных данных перед импортом. Везде, где у вас есть разделённые переводами строк значения, которые могут пересекаться, этот инструмент сводит их к уникальному набору.
Поскольку каждая запись оценивается как целая строка, инструмент блистает на списках коротких значений — по одному элементу в строке, — а не на связном тексте, где понятие «дубликат» не имеет смысла.
Строки, а не слова или фразы
Важно помнить, что единица сравнения — это вся строка целиком. Две строки, в которых повторяется одно слово, но которые различаются где-либо ещё, обе сохраняются, потому что как целые строки они не идентичны. Этот инструмент не находит повторяющиеся слова или предложения внутри абзаца; он работает строго с целыми строками.
Если ваши дубликаты пока не на отдельных строках, сначала разбейте их — например, с помощью «Добавить переносы строк», настроенного на перенос после запятой, чтобы каждое значение оказалось на своей строке, — а затем запустите удаление дубликатов.
Часто задаваемые вопросы
Сохраняет ли он исходный порядок строк?
Учитывает ли сравнение регистр?
Что делает параметр «Обрезать пробелы»?
Какая копия повторяющейся строки сохраняется?
Загружается ли мой текст на сервер?
Похожие инструменты
Продолжайте работу с этими удобными инструментами