T

Text Machine

Мощные текстовые инструменты прямо в браузере

Генератор Robots.txt

URL сайта (необязательно)
Правила

1

User-agent

Директива

Путь

URL карты сайта (по одному на строку)

Задержка обхода (в секундах)

Как пользоваться Генератор Robots.txt

  1. 1

    Добавьте правила обхода

    Нажмите «Добавить правило» и задайте User-agent, выберите Allow или Disallow и введите путь, к которому должно применяться каждое правило.

  2. 2

    Задайте необязательные директивы

    Добавьте URL ваших карт сайта (по одному на строку) и необязательную задержку обхода в секундах, чтобы управлять тем, как поисковые системы обходят ваш сайт.

  3. 3

    Сгенерируйте файл

    Нажмите «Сгенерировать robots.txt», чтобы построить корректно отформатированный файл из ваших правил и директив.

  4. 4

    Скопируйте или скачайте

    Используйте «Копировать в буфер обмена» или «Скачать robots.txt», затем загрузите файл в корень вашего домена (yoursite.com/robots.txt).

Как на самом деле работает robots.txt: практическое руководство

Что такое robots.txt и где он должен находиться

robots.txt — это обычный текстовый файл, реализующий протокол исключения роботов (Robots Exclusion Protocol) — добровольный стандарт, который сообщает поисковым роботам, какие части вашего сайта им не следует запрашивать. Он должен отдаваться строго из одного места: из корня вашего домена, по адресу yoursite.com/robots.txt. Файл robots.txt, размещённый в подкаталоге, например yoursite.com/blog/robots.txt, просто игнорируется. У каждого поддомена и каждого протокола своя область действия, поэтому для blog.yoursite.com нужен отдельный файл, не связанный с тем, что лежит на yoursite.com.

Соблюдение правил держится исключительно на доброй воле. Googlebot, Bingbot и другие крупные роботы подчиняются robots.txt, но вредоносные парсеры и многие ИИ-боты могут его игнорировать. Никогда не рассматривайте robots.txt как средство защиты. Это механизм вежливости для добросовестных роботов, а не замок на приватном контенте; всё по-настоящему конфиденциальное требует аутентификации, а не строки Disallow.

Четыре директивы, которые вы действительно будете использовать

Файл robots.txt состоит из групп; каждая начинается с одной или нескольких строк User-agent, указывающих робота, к которому применяются правила, после чего идут правила Allow и Disallow. User-agent: * охватывает всех роботов, для которых нет более конкретной группы. Disallow: /admin/ блокирует путь, а пустая директива Disallow (Disallow: без указания значения) означает «разрешить всё». Allow используется, чтобы сделать исключение из более широкого запрета — например, открыть доступ к одному файлу внутри в остальном запрещённой папки.

Директива Sitemap стоит особняком: она не привязана ни к одной группе User-agent и может находиться в любом месте файла, по традиции — в начале или в конце. Она должна указывать на полный абсолютный URL вашей XML-карты сайта, например https://yoursite.com/sitemap.xml, и при наличии нескольких карт вы можете перечислить несколько строк Sitemap. Это самый дешёвый способ помочь поисковым системам обнаружить все ваши URL.

Ключевое различие: обход против индексации

Это самый недопонятый момент в работе robots.txt, и ошибка здесь оборачивается реальным ущербом. robots.txt управляет обходом, а не индексацией. Запрет URL через Disallow не даёт роботам загрузить его содержимое, но не убирает этот URL из результатов поиска. Если на заблокированный URL ссылаются другие страницы, Google всё равно может проиндексировать его как голую ссылку — часто с бесполезной пометкой о том, что описание недоступно, поскольку страница заблокирована в robots.txt.

Хуже того, блокировка страницы в robots.txt вообще не позволяет Google увидеть тег noindex на этой странице, ведь он не может её обойти, чтобы прочитать тег. Поэтому правильный способ убрать страницу из поиска противоположен тому, что многие предполагают: оставьте её доступной для обхода и добавьте meta-тег noindex или заголовок X-Robots-Tag. Блокируйте страницу в robots.txt только тогда, когда ваша цель — сэкономить краулинговый бюджет, а не скрыть страницу из индекса.

Подстановочные символы и сопоставление по шаблону

Современные роботы поддерживают два символа шаблона. Звёздочка (*) соответствует любой последовательности символов, а знак доллара ($) привязывает совпадение к концу URL. Так, Disallow: /*.pdf$ блокирует все URL, оканчивающиеся на .pdf, а Disallow: /*?sort= блокирует любой URL, содержащий параметр запроса sort, — это распространённый способ не пускать в обход дубли фасетной навигации. Пути сопоставляются как префиксы, поэтому Disallow: /private одинаково блокирует /private, /private/ и /private-files.

Шаблоны мощны, но ими легко переусердствовать. Проверяйте любое нетривиальное правило перед публикацией; одна неправильно поставленная звёздочка может заблокировать куда больше, чем задумано. В Google Search Console есть инструмент проверки robots.txt, который показывает, разрешён или заблокирован конкретный URL вашими правилами, — им стоит пользоваться для всего, что сложнее простейшего файла.

Crawl-delay и скорость обхода

Директива Crawl-delay просит робота выждать заданное число секунд между последовательными запросами, что может облегчить нагрузку на небольшой или ненадёжный сервер. Загвоздка в том, что её поддержка непоследовательна: Bing и Yandex соблюдают Crawl-delay, а Google игнорирует её полностью. Вместо этого Google определяет скорость обхода автоматически и исторически предоставлял ручную настройку в Search Console. Если вас беспокоит именно то, что Googlebot перегружает ваш сервер, Crawl-delay ничем не поможет; здесь нужно ограничение частоты запросов на стороне сервера или настройки в Search Console.

Большинству сайтов вообще не стоит задавать задержку обхода. Замедляя роботов, вы замедляете и то, насколько быстро обнаруживается и индексируется новый и обновлённый контент. Приберегите её для настоящих проблем с пропускной способностью и держите значение умеренным.

Типичные ошибки, которые незаметно гробят SEO

Самая катастрофическая ошибка — выложить тестовый файл, содержащий Disallow: / под User-agent: *. Эта единственная строка закрывает весь ваш сайт от всех роботов, и такое регулярно случается, когда сайт запускается в продакшен, а заменить разработческий robots.txt никто не догадался. После любого запуска или миграции первым делом проверьте, что в вашем боевом robots.txt нет сплошного запрета Disallow.

Вторая классическая ошибка — блокировка каталогов с CSS и JavaScript. Google отрисовывает страницы как браузер, и если он не может загрузить ваши таблицы стилей и скрипты, то может увидеть сломанную страницу без оформления и счесть её неудобной для мобильных устройств или малосодержательной. Дайте роботам доступ к вашим ресурсам. Среди других частых промахов — попытки убрать страницу из индекса через robots.txt (вместо этого используйте noindex), забывчивость о том, что пути в файле чувствительны к регистру, и размещение файла где угодно, кроме корня домена.

Разумная настройка по умолчанию для большинства сайтов

Многим сайтам лучше всего подходит намеренно разрешающий robots.txt: одна группа User-agent: * с пустой директивой Disallow, чтобы всё было доступно для обхода, плюс строка Sitemap, указывающая на вашу XML-карту сайта. Отталкиваясь от этой открытой основы, вы добавляете узкие правила Disallow только для того, что действительно не должно обходиться, — например, для внутренних страниц результатов поиска, админ-разделов, URL корзины и оформления заказа, а также параметризованных URL-дубликатов.

Не поддавайтесь искушению всё переусложнить. Короткий и корректный robots.txt, который вы полностью понимаете, гораздо безопаснее длинного, скопированного откуда-то, с правилами, которые вы не можете объяснить. Сгенерировав свой файл, откройте его в браузере, чтобы убедиться, что он отдаётся как обычный текст в корне домена, а затем проверьте важные пути в тестере, прежде чем на него полагаться.

Часто задаваемые вопросы

Для чего нужен файл robots.txt?
Файл robots.txt сообщает поисковым роботам, к каким частям вашего сайта они могут или не могут получать доступ. Он использует директивы User-agent, Allow и Disallow и размещается в корне вашего домена, чтобы боты читали его перед обходом.
Как работают правила Allow и Disallow?
Disallow блокирует роботам доступ к пути, а Allow явно разрешает один, что полезно для открытия подпапки внутри в остальном заблокированного каталога. Можно нацелиться на всех ботов через User-agent для всех роботов или написать отдельные правила для конкретных роботов вроде Googlebot.
Что делает crawl-delay?
Crawl-delay предлагает, сколько секунд робот должен ждать между запросами, что может снизить нагрузку на сервер. Учтите, что не все поисковые системы его соблюдают; например, Google игнорирует crawl-delay и предпочитает настройки скорости обхода в Search Console.
Зачем добавлять строку с картой сайта?
Включение директивы Sitemap указывает роботам на ваш XML-файл карты сайта, чтобы они эффективнее обнаруживали ваши страницы. Инструмент позволяет перечислить несколько URL карт сайта, по одному на строку, и записывает их в файл за вас.
Гарантирует ли robots.txt, что страница не попадёт в Google?
Нет. Disallow предотвращает обход, но заблокированный URL всё равно может быть проиндексирован, если на него ссылаются другие страницы. Чтобы не допустить попадания страницы в результаты поиска, используйте meta-тег noindex или заголовок на странице, доступной для обхода, а не полагайтесь только на robots.txt.

Похожие инструменты

Продолжайте работу с этими удобными инструментами

Генератор Мета-Тегов

Проверка цепочек перенаправлений URL

Open Graph Previewer

Кодировщик/Декодировщик HTML-сущностей

Просмотр HTTP-заголовков

Извлечение URL из Sitemap