Генератор Robots.txt
1
User-agent
Директива
Путь
Задержка обхода (в секундах)
Как пользоваться Генератор Robots.txt
- 1
Добавьте правила обхода
Нажмите «Добавить правило» и задайте User-agent, выберите Allow или Disallow и введите путь, к которому должно применяться каждое правило.
- 2
Задайте необязательные директивы
Добавьте URL ваших карт сайта (по одному на строку) и необязательную задержку обхода в секундах, чтобы управлять тем, как поисковые системы обходят ваш сайт.
- 3
Сгенерируйте файл
Нажмите «Сгенерировать robots.txt», чтобы построить корректно отформатированный файл из ваших правил и директив.
- 4
Скопируйте или скачайте
Используйте «Копировать в буфер обмена» или «Скачать robots.txt», затем загрузите файл в корень вашего домена (yoursite.com/robots.txt).
Как на самом деле работает robots.txt: практическое руководство
Что такое robots.txt и где он должен находиться
robots.txt — это обычный текстовый файл, реализующий протокол исключения роботов (Robots Exclusion Protocol) — добровольный стандарт, который сообщает поисковым роботам, какие части вашего сайта им не следует запрашивать. Он должен отдаваться строго из одного места: из корня вашего домена, по адресу yoursite.com/robots.txt. Файл robots.txt, размещённый в подкаталоге, например yoursite.com/blog/robots.txt, просто игнорируется. У каждого поддомена и каждого протокола своя область действия, поэтому для blog.yoursite.com нужен отдельный файл, не связанный с тем, что лежит на yoursite.com.
Соблюдение правил держится исключительно на доброй воле. Googlebot, Bingbot и другие крупные роботы подчиняются robots.txt, но вредоносные парсеры и многие ИИ-боты могут его игнорировать. Никогда не рассматривайте robots.txt как средство защиты. Это механизм вежливости для добросовестных роботов, а не замок на приватном контенте; всё по-настоящему конфиденциальное требует аутентификации, а не строки Disallow.
Четыре директивы, которые вы действительно будете использовать
Файл robots.txt состоит из групп; каждая начинается с одной или нескольких строк User-agent, указывающих робота, к которому применяются правила, после чего идут правила Allow и Disallow. User-agent: * охватывает всех роботов, для которых нет более конкретной группы. Disallow: /admin/ блокирует путь, а пустая директива Disallow (Disallow: без указания значения) означает «разрешить всё». Allow используется, чтобы сделать исключение из более широкого запрета — например, открыть доступ к одному файлу внутри в остальном запрещённой папки.
Директива Sitemap стоит особняком: она не привязана ни к одной группе User-agent и может находиться в любом месте файла, по традиции — в начале или в конце. Она должна указывать на полный абсолютный URL вашей XML-карты сайта, например https://yoursite.com/sitemap.xml, и при наличии нескольких карт вы можете перечислить несколько строк Sitemap. Это самый дешёвый способ помочь поисковым системам обнаружить все ваши URL.
Ключевое различие: обход против индексации
Это самый недопонятый момент в работе robots.txt, и ошибка здесь оборачивается реальным ущербом. robots.txt управляет обходом, а не индексацией. Запрет URL через Disallow не даёт роботам загрузить его содержимое, но не убирает этот URL из результатов поиска. Если на заблокированный URL ссылаются другие страницы, Google всё равно может проиндексировать его как голую ссылку — часто с бесполезной пометкой о том, что описание недоступно, поскольку страница заблокирована в robots.txt.
Хуже того, блокировка страницы в robots.txt вообще не позволяет Google увидеть тег noindex на этой странице, ведь он не может её обойти, чтобы прочитать тег. Поэтому правильный способ убрать страницу из поиска противоположен тому, что многие предполагают: оставьте её доступной для обхода и добавьте meta-тег noindex или заголовок X-Robots-Tag. Блокируйте страницу в robots.txt только тогда, когда ваша цель — сэкономить краулинговый бюджет, а не скрыть страницу из индекса.
Подстановочные символы и сопоставление по шаблону
Современные роботы поддерживают два символа шаблона. Звёздочка (*) соответствует любой последовательности символов, а знак доллара ($) привязывает совпадение к концу URL. Так, Disallow: /*.pdf$ блокирует все URL, оканчивающиеся на .pdf, а Disallow: /*?sort= блокирует любой URL, содержащий параметр запроса sort, — это распространённый способ не пускать в обход дубли фасетной навигации. Пути сопоставляются как префиксы, поэтому Disallow: /private одинаково блокирует /private, /private/ и /private-files.
Шаблоны мощны, но ими легко переусердствовать. Проверяйте любое нетривиальное правило перед публикацией; одна неправильно поставленная звёздочка может заблокировать куда больше, чем задумано. В Google Search Console есть инструмент проверки robots.txt, который показывает, разрешён или заблокирован конкретный URL вашими правилами, — им стоит пользоваться для всего, что сложнее простейшего файла.
Crawl-delay и скорость обхода
Директива Crawl-delay просит робота выждать заданное число секунд между последовательными запросами, что может облегчить нагрузку на небольшой или ненадёжный сервер. Загвоздка в том, что её поддержка непоследовательна: Bing и Yandex соблюдают Crawl-delay, а Google игнорирует её полностью. Вместо этого Google определяет скорость обхода автоматически и исторически предоставлял ручную настройку в Search Console. Если вас беспокоит именно то, что Googlebot перегружает ваш сервер, Crawl-delay ничем не поможет; здесь нужно ограничение частоты запросов на стороне сервера или настройки в Search Console.
Большинству сайтов вообще не стоит задавать задержку обхода. Замедляя роботов, вы замедляете и то, насколько быстро обнаруживается и индексируется новый и обновлённый контент. Приберегите её для настоящих проблем с пропускной способностью и держите значение умеренным.
Типичные ошибки, которые незаметно гробят SEO
Самая катастрофическая ошибка — выложить тестовый файл, содержащий Disallow: / под User-agent: *. Эта единственная строка закрывает весь ваш сайт от всех роботов, и такое регулярно случается, когда сайт запускается в продакшен, а заменить разработческий robots.txt никто не догадался. После любого запуска или миграции первым делом проверьте, что в вашем боевом robots.txt нет сплошного запрета Disallow.
Вторая классическая ошибка — блокировка каталогов с CSS и JavaScript. Google отрисовывает страницы как браузер, и если он не может загрузить ваши таблицы стилей и скрипты, то может увидеть сломанную страницу без оформления и счесть её неудобной для мобильных устройств или малосодержательной. Дайте роботам доступ к вашим ресурсам. Среди других частых промахов — попытки убрать страницу из индекса через robots.txt (вместо этого используйте noindex), забывчивость о том, что пути в файле чувствительны к регистру, и размещение файла где угодно, кроме корня домена.
Разумная настройка по умолчанию для большинства сайтов
Многим сайтам лучше всего подходит намеренно разрешающий robots.txt: одна группа User-agent: * с пустой директивой Disallow, чтобы всё было доступно для обхода, плюс строка Sitemap, указывающая на вашу XML-карту сайта. Отталкиваясь от этой открытой основы, вы добавляете узкие правила Disallow только для того, что действительно не должно обходиться, — например, для внутренних страниц результатов поиска, админ-разделов, URL корзины и оформления заказа, а также параметризованных URL-дубликатов.
Не поддавайтесь искушению всё переусложнить. Короткий и корректный robots.txt, который вы полностью понимаете, гораздо безопаснее длинного, скопированного откуда-то, с правилами, которые вы не можете объяснить. Сгенерировав свой файл, откройте его в браузере, чтобы убедиться, что он отдаётся как обычный текст в корне домена, а затем проверьте важные пути в тестере, прежде чем на него полагаться.
Часто задаваемые вопросы
Для чего нужен файл robots.txt?
Как работают правила Allow и Disallow?
Что делает crawl-delay?
Зачем добавлять строку с картой сайта?
Гарантирует ли robots.txt, что страница не попадёт в Google?
Похожие инструменты
Продолжайте работу с этими удобными инструментами