Извлечение URL из Sitemap
Как пользоваться Извлечение URL из Sitemap
- 1
Предоставьте карту сайта
Вставьте необработанный XML вашей карты сайта в поле XML или введите URL карты сайта, чтобы получить её автоматически.
- 2
Извлеките URL
Нажмите «Извлечь URL» для вставленного XML или «Получить и извлечь», чтобы загрузить и разобрать карту сайта по её URL.
- 3
Просмотрите результаты
Каждая ссылка, найденная внутри тегов <loc>, перечисляется в области результатов вместе с общим количеством.
- 4
Скопируйте или скачайте
Используйте «Копировать в буфер обмена» или «Скачать как текстовый файл», чтобы сохранить извлечённый список URL.
Работа с XML-картами сайта: извлечение и аудит
Что такое XML-карта сайта
XML-карта сайта — это структурированный файл, который перечисляет URL, о которых вы хотите сообщить поисковым системам, заключённые в элемент urlset, где каждая страница представлена записью url. Единственный обязательный дочерний элемент каждой записи — тег loc, содержащий абсолютный URL страницы; необязательные теги вроде lastmod, changefreq и priority дают подсказки о свежести и важности. Поисковые системы воспринимают карту сайта как средство обнаружения и набор рекомендаций, а не команд, поэтому указание URL не заставляет обойти или проиндексировать его, но значительно облегчает его нахождение.
Поскольку именно в теге loc находится каждый реальный URL, извлечение содержимого всех тегов loc даёт чистый и полный перечень страниц, которые сайт сообщает поисковым системам. Этот перечень — отправная точка для широкого круга задач SEO и миграции, и именно его создаёт данный экстрактор.
Файлы индекса карт сайта и вложенные карты
Крупные сайты редко обходятся одной плоской картой. Вместо этого они используют файл индекса карт сайта — элемент sitemapindex, записи которого указывают не на страницу, а на другой файл карты сайта. Типичная схема — это один индекс, ссылающийся на отдельные карты для записей, страниц, товаров и изображений. Когда вы извлекаете URL из файла индекса, полученные теги loc содержат адреса дочерних карт, а не отдельных страниц, поэтому, возможно, придётся по очереди извлекать данные из каждой дочерней карты, чтобы добраться до настоящих URL страниц.
Понять, перед вами индекс или конечная карта сайта, — уже половина дела. Если все извлечённые URL оканчиваются на .xml или .xml.gz, у вас в руках индекс, и нужно спуститься на уровень ниже. Если же они ведут на обычные HTML-страницы, вы добрались до настоящего содержимого.
Ограничения в 50 000 URL и 50 МБ
Протокол карт сайта ограничивает один файл карты 50 000 URL и 50 МБ в несжатом виде. Сайты, превышающие любой из этих пределов, должны разбивать свои URL по нескольким файлам карт и связывать их индексом карт сайта — именно поэтому крупные сайты вообще используют файлы индекса. Знание этих ограничений помогает проверять извлечённое на разумность: если одна карта возвращает заметно больше 50 000 URL, она составлена неправильно, а если у большого сайта только одна небольшая карта, она, вероятно, неполна и в ней не хватает страниц.
Эти потолки влияют и на то, как вы проводите аудит. Когда вы выгружаете полный список URL и их количество подозрительно близко к круглому числу вроде 50 000, это явный признак того, что сайт упёрся в предел, а дополнительные URL застряли в картах, которые вы ещё не извлекли.
Карты сайта, сжатые gzip
Чтобы не выходить за предел размера и экономить трафик, многие карты сайта отдаются сжатыми через gzip, с расширением .xml.gz. Сжатая gzip карта — это обычная XML-карта сайта, которую сжали; поисковые системы распаковывают её незаметно. Когда вы получаете такую карту через этот инструмент, загрузкой занимается сервер, но если вы вручную просматриваете файл .gz, до распаковки вы увидите двоичную мешанину, а не читаемый XML. Если вставляете содержимое напрямую, вставляйте распакованный XML, а не сырые сжатые байты.
Сжатие — это исключительно оптимизация передачи, оно никак не меняет внутреннюю структуру. После распаковки сжатая gzip карта содержит те же элементы urlset, url и loc, что и любая другая, и к ней применима та же логика извлечения.
Чем так полезно извлечение URL из карты сайта
Плоский список всех URL, которые публикует сайт, — основа практической работы над SEO. Во время миграции сайта вы извлекаете карту старого сайта, чтобы построить полную карту переадресаций и не оставить ни одного URL, ведущего на ошибку 404. Для аудита контента этот список передаётся в краулер или таблицу, где можно постранично проверять коды состояния, заголовки и объём текста. Для проверки индексации можно сравнить отправленные URL с тем, что Search Console сообщает как проиндексированное, и разрыв покажет, какие страницы Google игнорирует.
Этот список также служит входными данными для пакетных инструментов. Извлечённые URL можно направить в краулер вроде Screaming Frog, в проверщик ссылок, в аудитор производительности или в скрипт, опрашивающий HTTP-заголовки каждого URL. Если отталкиваться от канонического списка из карты сайта, а не обходить сайт вслепую, вы будете проверять именно те страницы, которые сайт намеревается показывать.
Частые подводные камни при извлечении
Самая частая неожиданность — извлечь файл индекса и решить, что у сайта всего горстка страниц, тогда как на деле эти несколько URL — дочерние карты, каждая из которых содержит тысячи страниц. Прежде чем делать выводы, всегда проверяйте, являются ли ваши результаты картами сайта или настоящими страницами. Вторая ловушка — считать карту исчерпывающей: многие системы управления контентом создают карты, пропускающие отдельные типы страниц, постраничные архивы или недавно опубликованный контент, поэтому карта сайта — это нижняя граница числа URL сайта, а не полная перепись.
К другим подвохам относятся устаревшие даты lastmod, не отражающие реальных изменений; URL в карте, которые больше не возвращают 200 (осиротевшие или удалённые страницы, которые так и не вычистили); а также несоответствия протокола или хоста, когда карта перечисляет URL с http, хотя сайт уже перешёл на https. Извлечь URL — это лёгкая часть; ценность приходит из сверки этого списка с тем, что сервер действительно отдаёт.
Как встроить извлечение в рабочий процесс SEO
Чистый, воспроизводимый рабочий процесс выглядит так: найдите карту сайта — обычно ссылка на неё есть в robots.txt или она лежит по привычному пути /sitemap.xml; извлеките URL, спускаясь сквозь любые файлы индекса, пока не доберётесь до настоящих страниц; экспортируйте список в текстовый файл; затем передайте его в тот инструмент аудита или миграции, которым вы пользуетесь. Поскольку этот экстрактор умеет и разбирать вставленный XML, и получать карту сайта по URL, вы можете перейти от сырой карты к пригодному списку URL за секунды, не написав ни строчки кода.
Выполняйте извлечение регулярно, а не однократно. Сравнение сегодняшнего списка URL со списком месячной давности выявляет недавно опубликованные страницы, тихо удалённые страницы и структурные изменения сайта — всё это полезные ранние сигналы как для здоровья SEO, так и для управления контентом.
Часто задаваемые вопросы
Как экстрактор URL из карты сайта находит ссылки?
Можно ли вставить XML или загрузить карту сайта по URL?
Что если мой XML недопустим или не содержит URL?
Можно ли экспортировать извлечённые URL?
Бесплатен ли инструмент и конфиденциальны ли мои данные?
Похожие инструменты
Продолжайте работу с этими удобными инструментами