T

Text Machine

Des outils de texte puissants, dans votre navigateur

Générateur de Robots.txt

URL du site web (optionnel)
Règles

1

User-agent

Directive

Chemin

URLs de Sitemap (une par ligne)

Délai d'exploration (secondes)

Comment utiliser Générateur de Robots.txt

  1. 1

    Ajoutez des règles d'exploration

    Cliquez sur Ajouter une règle et définissez le User-agent, choisissez Allow ou Disallow, et saisissez le chemin auquel chaque règle doit s'appliquer.

  2. 2

    Définissez les directives facultatives

    Ajoutez les URL de vos sitemaps (une par ligne) et un crawl-delay facultatif en secondes pour contrôler la façon dont les moteurs de recherche explorent votre site.

  3. 3

    Générez le fichier

    Cliquez sur Générer le robots.txt pour construire un fichier correctement formaté à partir de vos règles et directives.

  4. 4

    Copiez ou téléchargez

    Utilisez Copier dans le presse-papiers ou Télécharger le robots.txt, puis envoyez le fichier à la racine de votre domaine (votresite.com/robots.txt).

Comment fonctionne réellement le robots.txt : guide pratique

Ce qu'est le robots.txt et où il doit impérativement se trouver

Le robots.txt est un fichier en texte brut qui met en œuvre le Robots Exclusion Protocol, une norme facultative indiquant aux robots d'exploration les parties de votre site qu'ils ne doivent pas demander. Il doit être servi depuis un emplacement précis et unique : la racine de votre domaine, à l'adresse yoursite.com/robots.txt. Un robots.txt placé dans un sous-répertoire, comme yoursite.com/blog/robots.txt, est tout bonnement ignoré. Chaque sous-domaine et chaque protocole possède sa propre portée : blog.yoursite.com a donc besoin de son propre fichier, distinct de celui de yoursite.com.

Le respect des règles repose sur la bonne volonté de chacun. Googlebot, Bingbot et les autres robots d'exploration grand public obéissent au robots.txt, mais les aspirateurs de contenu malveillants et bon nombre de robots d'IA peuvent l'ignorer. Ne considérez jamais le robots.txt comme une mesure de sécurité. C'est un mécanisme de politesse destiné aux robots bien élevés, pas un verrou sur du contenu privé ; tout ce qui est réellement sensible exige une authentification, pas une ligne Disallow.

Les quatre directives que vous utilisez vraiment

Un robots.txt s'organise en groupes, chacun débutant par une ou plusieurs lignes User-agent qui nomment le robot auquel s'appliquent les règles, suivies des règles Allow et Disallow. User-agent: * cible tout robot ne disposant pas d'un groupe plus spécifique. Disallow: /admin/ bloque un chemin, tandis qu'un Disallow vide (Disallow: sans rien après) signifie tout autoriser. Allow sert à ménager une exception au sein d'un blocage plus large, par exemple pour autoriser un seul fichier à l'intérieur d'un dossier par ailleurs interdit.

La directive Sitemap est particulière : elle est indépendante de tout groupe User-agent et peut figurer n'importe où dans le fichier, par convention en haut ou en bas. Elle doit pointer vers l'URL absolue complète de votre sitemap XML, par exemple https://yoursite.com/sitemap.xml, et vous pouvez aligner plusieurs lignes Sitemap si vous en avez plus d'un. C'est le moyen le moins coûteux d'aider les moteurs de recherche à découvrir l'ensemble de vos URL.

La distinction cruciale : exploration et indexation

C'est le point le plus mal compris au sujet du robots.txt, et s'y tromper cause de réels dégâts. Le robots.txt contrôle l'exploration, pas l'indexation. Interdire une URL empêche les robots d'en récupérer le contenu, mais ne la retire pas des résultats de recherche. Si d'autres pages renvoient vers une URL bloquée, Google peut tout de même l'indexer sous forme de simple lien, souvent accompagné de la mention peu utile indiquant qu'aucune description n'est disponible parce que la page est bloquée par le robots.txt.

Pire encore, bloquer une page dans le robots.txt empêche définitivement Google de voir une balise noindex présente sur cette page, puisqu'il ne peut pas l'explorer pour lire la balise. La bonne façon de retirer une page des résultats est donc l'inverse de ce que beaucoup supposent : laissez-la explorable et ajoutez une balise meta noindex ou un en-tête X-Robots-Tag. Ne bloquez dans le robots.txt que lorsque votre objectif est d'économiser le budget d'exploration, et non de masquer une page de l'index.

Caractères génériques et correspondance de motifs

Les robots modernes prennent en charge deux caractères de motif. L'astérisque (*) correspond à n'importe quelle suite de caractères, et le signe dollar ($) ancre la correspondance à la fin de l'URL. Ainsi, Disallow: /*.pdf$ bloque toute URL se terminant par .pdf, et Disallow: /*?sort= bloque toute URL contenant un paramètre de requête de tri, une méthode courante pour tenir les doublons de la navigation à facettes à l'écart de l'exploration. Les chemins sont mis en correspondance comme des préfixes : Disallow: /private bloque donc indifféremment /private, /private/ et /private-files.

Les motifs sont puissants, mais faciles à employer à l'excès. Testez toute règle non triviale avant de la déployer ; un seul astérisque mal placé peut bloquer bien plus que prévu. La Google Search Console comprend un testeur de robots.txt qui indique si une URL donnée est autorisée ou bloquée par vos règles, un outil qui vaut la peine d'être utilisé pour tout fichier dépassant le cas le plus simple.

Crawl-delay et fréquence d'exploration

La directive Crawl-delay demande à un robot d'attendre un certain nombre de secondes entre deux requêtes successives, ce qui peut soulager un serveur modeste ou fragile. Le hic, c'est que sa prise en charge est inégale : Bing et Yandex respectent le Crawl-delay, mais Google l'ignore complètement. Google détermine plutôt la fréquence d'exploration automatiquement et a longtemps proposé un réglage manuel dans la Search Console. Si votre souci est précisément que Googlebot sollicite trop votre serveur, le Crawl-delay n'y changera rien ; il vous faut plutôt une limitation de débit côté serveur ou les réglages de la Search Console.

Pour la plupart des sites, vous ne devriez pas définir de délai d'exploration du tout. Ralentir les robots ralentit aussi la vitesse à laquelle le contenu nouveau et mis à jour est découvert et indexé. Réservez-le aux véritables problèmes de capacité, et gardez une valeur modérée.

Les erreurs courantes qui plombent discrètement le SEO

L'erreur la plus catastrophique consiste à mettre en ligne un fichier de préproduction contenant Disallow: / sous User-agent: *. Cette seule ligne bloque l'intégralité de votre site pour tous les robots, et cela arrive régulièrement lorsqu'un site passe en production sans que personne ne remplace le robots.txt de développement. Après toute mise en ligne ou migration, la première chose à vérifier est que votre robots.txt de production ne contient pas de Disallow général.

La deuxième erreur classique est de bloquer les répertoires CSS et JavaScript. Google affiche les pages comme un navigateur, et s'il ne peut pas récupérer vos feuilles de style et vos scripts, il risque de voir une page cassée, sans mise en forme, et de la juger comme offrant une mauvaise expérience mobile ou un contenu pauvre. Laissez les robots accéder à vos ressources. Parmi les autres faux pas fréquents : utiliser le robots.txt pour tenter de désindexer une page (utilisez plutôt noindex), oublier que le fichier est sensible à la casse dans ses chemins, et placer le fichier ailleurs qu'à la racine du domaine.

Une configuration par défaut raisonnable pour la plupart des sites

Bien des sites ont tout intérêt à adopter un robots.txt volontairement permissif : un unique groupe User-agent: * avec un Disallow vide pour que tout soit explorable, plus une ligne Sitemap pointant vers votre sitemap XML. À partir de cette base ouverte, vous ajoutez ensuite des règles Disallow ciblées uniquement pour ce qui ne doit vraiment pas être exploré, comme les pages de résultats de recherche interne, les espaces d'administration, les URL de panier et de paiement, et les URL en double comportant des paramètres.

Résistez à la tentation de trop en faire. Un robots.txt court et correct que vous comprenez parfaitement est bien plus sûr qu'un long fichier copié ailleurs, truffé de règles que vous ne savez pas expliquer. Une fois le vôtre généré, ouvrez-le dans un navigateur pour confirmer qu'il est bien servi en texte brut à la racine, puis validez les chemins importants dans un testeur avant de vous y fier.

Questions fréquentes

À quoi sert un fichier robots.txt ?
Un fichier robots.txt indique aux robots d'exploration des moteurs de recherche les parties de votre site auxquelles ils peuvent accéder ou non. Il utilise les directives User-agent, Allow et Disallow et se place à la racine de votre domaine pour que les robots le lisent avant l'exploration.
Comment fonctionnent les règles Allow et Disallow ?
Disallow empêche les robots d'accéder à un chemin, tandis qu'Allow en autorise un explicitement, ce qui est utile pour ouvrir un sous-dossier au sein d'un répertoire par ailleurs bloqué. Vous pouvez cibler tous les robots avec le User-agent pour tous les robots, ou écrire des règles distinctes pour des robots spécifiques comme Googlebot.
À quoi sert le crawl-delay ?
Le crawl-delay suggère le nombre de secondes qu'un robot doit attendre entre deux requêtes, ce qui peut réduire la charge serveur. Notez que tous les moteurs de recherche ne le respectent pas ; Google, par exemple, ignore le crawl-delay et préfère les réglages de fréquence d'exploration dans la Search Console.
Pourquoi ajouter une ligne de sitemap ?
Inclure une directive Sitemap indique aux robots l'emplacement de votre sitemap XML afin qu'ils découvrent vos pages plus efficacement. L'outil vous permet de lister plusieurs URL de sitemaps, une par ligne, et les inscrit dans le fichier pour vous.
Le robots.txt garantit-il qu'une page reste hors de Google ?
Non. Disallow empêche l'exploration, mais une URL bloquée peut tout de même être indexée si d'autres pages y renvoient. Pour exclure une page des résultats de recherche, utilisez une balise meta ou un en-tête noindex sur une page explorable, plutôt que de vous fier au robots.txt seul.

Outils similaires

Continuez avec ces outils pratiques

Générateur de Meta Tags

Vérificateur de Chaînes de Redirection URL

Open Graph Previewer

Encodeur/Décodeur d'Entités HTML

Visualiseur d'En-têtes HTTP

Extracteur d'URL de Sitemap