T

Text Machine

Мощные текстовые инструменты прямо в браузере

Извлечение URL из Sitemap

Извлеченные URL

Как пользоваться Извлечение URL из Sitemap

  1. 1

    Предоставьте карту сайта

    Вставьте необработанный XML вашей карты сайта в поле XML или введите URL карты сайта, чтобы получить её автоматически.

  2. 2

    Извлеките URL

    Нажмите «Извлечь URL» для вставленного XML или «Получить и извлечь», чтобы загрузить и разобрать карту сайта по её URL.

  3. 3

    Просмотрите результаты

    Каждая ссылка, найденная внутри тегов <loc>, перечисляется в области результатов вместе с общим количеством.

  4. 4

    Скопируйте или скачайте

    Используйте «Копировать в буфер обмена» или «Скачать как текстовый файл», чтобы сохранить извлечённый список URL.

Работа с XML-картами сайта: извлечение и аудит

Что такое XML-карта сайта

XML-карта сайта — это структурированный файл, который перечисляет URL, о которых вы хотите сообщить поисковым системам, заключённые в элемент urlset, где каждая страница представлена записью url. Единственный обязательный дочерний элемент каждой записи — тег loc, содержащий абсолютный URL страницы; необязательные теги вроде lastmod, changefreq и priority дают подсказки о свежести и важности. Поисковые системы воспринимают карту сайта как средство обнаружения и набор рекомендаций, а не команд, поэтому указание URL не заставляет обойти или проиндексировать его, но значительно облегчает его нахождение.

Поскольку именно в теге loc находится каждый реальный URL, извлечение содержимого всех тегов loc даёт чистый и полный перечень страниц, которые сайт сообщает поисковым системам. Этот перечень — отправная точка для широкого круга задач SEO и миграции, и именно его создаёт данный экстрактор.

Файлы индекса карт сайта и вложенные карты

Крупные сайты редко обходятся одной плоской картой. Вместо этого они используют файл индекса карт сайта — элемент sitemapindex, записи которого указывают не на страницу, а на другой файл карты сайта. Типичная схема — это один индекс, ссылающийся на отдельные карты для записей, страниц, товаров и изображений. Когда вы извлекаете URL из файла индекса, полученные теги loc содержат адреса дочерних карт, а не отдельных страниц, поэтому, возможно, придётся по очереди извлекать данные из каждой дочерней карты, чтобы добраться до настоящих URL страниц.

Понять, перед вами индекс или конечная карта сайта, — уже половина дела. Если все извлечённые URL оканчиваются на .xml или .xml.gz, у вас в руках индекс, и нужно спуститься на уровень ниже. Если же они ведут на обычные HTML-страницы, вы добрались до настоящего содержимого.

Ограничения в 50 000 URL и 50 МБ

Протокол карт сайта ограничивает один файл карты 50 000 URL и 50 МБ в несжатом виде. Сайты, превышающие любой из этих пределов, должны разбивать свои URL по нескольким файлам карт и связывать их индексом карт сайта — именно поэтому крупные сайты вообще используют файлы индекса. Знание этих ограничений помогает проверять извлечённое на разумность: если одна карта возвращает заметно больше 50 000 URL, она составлена неправильно, а если у большого сайта только одна небольшая карта, она, вероятно, неполна и в ней не хватает страниц.

Эти потолки влияют и на то, как вы проводите аудит. Когда вы выгружаете полный список URL и их количество подозрительно близко к круглому числу вроде 50 000, это явный признак того, что сайт упёрся в предел, а дополнительные URL застряли в картах, которые вы ещё не извлекли.

Карты сайта, сжатые gzip

Чтобы не выходить за предел размера и экономить трафик, многие карты сайта отдаются сжатыми через gzip, с расширением .xml.gz. Сжатая gzip карта — это обычная XML-карта сайта, которую сжали; поисковые системы распаковывают её незаметно. Когда вы получаете такую карту через этот инструмент, загрузкой занимается сервер, но если вы вручную просматриваете файл .gz, до распаковки вы увидите двоичную мешанину, а не читаемый XML. Если вставляете содержимое напрямую, вставляйте распакованный XML, а не сырые сжатые байты.

Сжатие — это исключительно оптимизация передачи, оно никак не меняет внутреннюю структуру. После распаковки сжатая gzip карта содержит те же элементы urlset, url и loc, что и любая другая, и к ней применима та же логика извлечения.

Чем так полезно извлечение URL из карты сайта

Плоский список всех URL, которые публикует сайт, — основа практической работы над SEO. Во время миграции сайта вы извлекаете карту старого сайта, чтобы построить полную карту переадресаций и не оставить ни одного URL, ведущего на ошибку 404. Для аудита контента этот список передаётся в краулер или таблицу, где можно постранично проверять коды состояния, заголовки и объём текста. Для проверки индексации можно сравнить отправленные URL с тем, что Search Console сообщает как проиндексированное, и разрыв покажет, какие страницы Google игнорирует.

Этот список также служит входными данными для пакетных инструментов. Извлечённые URL можно направить в краулер вроде Screaming Frog, в проверщик ссылок, в аудитор производительности или в скрипт, опрашивающий HTTP-заголовки каждого URL. Если отталкиваться от канонического списка из карты сайта, а не обходить сайт вслепую, вы будете проверять именно те страницы, которые сайт намеревается показывать.

Частые подводные камни при извлечении

Самая частая неожиданность — извлечь файл индекса и решить, что у сайта всего горстка страниц, тогда как на деле эти несколько URL — дочерние карты, каждая из которых содержит тысячи страниц. Прежде чем делать выводы, всегда проверяйте, являются ли ваши результаты картами сайта или настоящими страницами. Вторая ловушка — считать карту исчерпывающей: многие системы управления контентом создают карты, пропускающие отдельные типы страниц, постраничные архивы или недавно опубликованный контент, поэтому карта сайта — это нижняя граница числа URL сайта, а не полная перепись.

К другим подвохам относятся устаревшие даты lastmod, не отражающие реальных изменений; URL в карте, которые больше не возвращают 200 (осиротевшие или удалённые страницы, которые так и не вычистили); а также несоответствия протокола или хоста, когда карта перечисляет URL с http, хотя сайт уже перешёл на https. Извлечь URL — это лёгкая часть; ценность приходит из сверки этого списка с тем, что сервер действительно отдаёт.

Как встроить извлечение в рабочий процесс SEO

Чистый, воспроизводимый рабочий процесс выглядит так: найдите карту сайта — обычно ссылка на неё есть в robots.txt или она лежит по привычному пути /sitemap.xml; извлеките URL, спускаясь сквозь любые файлы индекса, пока не доберётесь до настоящих страниц; экспортируйте список в текстовый файл; затем передайте его в тот инструмент аудита или миграции, которым вы пользуетесь. Поскольку этот экстрактор умеет и разбирать вставленный XML, и получать карту сайта по URL, вы можете перейти от сырой карты к пригодному списку URL за секунды, не написав ни строчки кода.

Выполняйте извлечение регулярно, а не однократно. Сравнение сегодняшнего списка URL со списком месячной давности выявляет недавно опубликованные страницы, тихо удалённые страницы и структурные изменения сайта — всё это полезные ранние сигналы как для здоровья SEO, так и для управления контентом.

Часто задаваемые вопросы

Как экстрактор URL из карты сайта находит ссылки?
Он разбирает XML карты сайта и извлекает каждый адрес внутри тега <loc>, где карты сайта перечисляют URL каждой страницы. Затем полный список показывается с количеством найденных ссылок.
Можно ли вставить XML или загрузить карту сайта по URL?
И то, и другое. Можно вставить необработанный XML напрямую для мгновенного разбора в браузере или ввести URL карты сайта, и инструмент получит файл через прокси перед извлечением URL.
Что если мой XML недопустим или не содержит URL?
Если XML не удаётся разобрать, вы получите ошибку разбора, а если тегов <loc> нет, вам сообщат, что URL не найдены. Убедитесь, что вставили корректную карту сайта, содержащую записи <loc>.
Можно ли экспортировать извлечённые URL?
Да. После извлечения можно скопировать весь список в буфер обмена или скачать его как обычный текстовый файл для использования в аудитах, миграциях или инструментах обхода.
Бесплатен ли инструмент и конфиденциальны ли мои данные?
Он бесплатен и не требует регистрации. Вставленный XML разбирается локально в вашем браузере; только параметр «Получить и извлечь» обращается к серверу, чтобы загрузить карту сайта по указанному вами URL.

Похожие инструменты

Продолжайте работу с этими удобными инструментами

Генератор Мета-Тегов

Генератор Robots.txt

Open Graph Previewer

Кодировщик/Декодировщик HTML-сущностей

Просмотр HTTP-заголовков

Проверка цепочек перенаправлений URL