Modèle de robots.txt et directives d'exploration
Des modèles de robots.txt prêts à copier pour les configurations de site les plus courantes, plus les règles qui vous évitent de bloquer Google par accident.
Le robots.txt est le premier fichier que la plupart des robots d'exploration demandent, et une seule ligne erronée peut masquer tout votre site aux moteurs de recherche. Ces modèles prêts à copier couvrent les situations que les propriétaires de sites rencontrent le plus souvent, avec des notes en langage clair sur ce que fait chaque directive. Remplacez les espaces réservés entre crochets par vos propres chemins et votre domaine, puis validez le fichier avant de le mettre en ligne.
6 variantes prêtes à l'emploi
Site de production standard
Un site en ligne ordinaire qui souhaite une exploration complète et un renvoi vers le sitemap.
À utiliser quand : vous exploitez un site de production sain et voulez que les moteurs de recherche explorent tout librement tout en trouvant votre sitemap rapidement.
Directives
- User-agent : *
- Disallow : (laissez la valeur vide pour tout autoriser)
- Sitemap : [https://example.com/sitemap.xml]
Un Disallow vide signifie que rien n'est bloqué. Vous n'avez pas besoin d'une ligne Allow pour cela ; l'autorisation par défaut est le comportement normal.
Hygiène facultative
- Disallow : [/wp-admin/] (bloquez un vrai chemin d'administration si vous en avez un)
- Allow : [/wp-admin/admin-ajax.php]
Remarque : le robots.txt contrôle l'exploration, pas l'indexation. Une URL bloquée peut tout de même apparaître dans les résultats si d'autres pages y renvoient. Pour garder une page hors de l'index, autorisez l'exploration et ajoutez une balise meta noindex, ou protégez-la derrière une connexion. Placez le fichier à la racine du domaine : [https://example.com/robots.txt].
Site de préproduction, de développement ou de prélancement
Un environnement non public que vous devez tenir entièrement à l'écart des moteurs de recherche.
À utiliser quand : le site est un serveur de préproduction, une copie de développement ou une version de prélancement que personne ne devrait trouver dans les résultats de recherche.
Directives
- User-agent : *
- Disallow : /
Un simple Disallow : / demande aux robots conformes d'ignorer chaque URL de l'hôte. C'est intentionnel ici et dangereux partout ailleurs.
Avertissement crucial : ne laissez jamais cette ligne atteindre la production. La catastrophe de désindexation la plus courante est un Disallow : / copié de la préproduction vers le site en ligne lors du déploiement.
Protection plus solide
- Le robots.txt est une requête, pas un verrou. Les robots malveillants l'ignorent.
- Ajoutez une authentification HTTP (un nom d'utilisateur et un mot de passe) pour que l'environnement soit vraiment privé.
- Si vous ajoutez un noindex à l'échelle du site en secours, ne bloquez pas aussi la page avec Disallow : / : une page bloquée ne révèle jamais sa balise noindex.
Remarque : si une URL de préproduction a déjà été explorée, ne comptez pas sur Disallow : / pour la retirer. Bloquer l'URL empêche aussi Google de voir une balise noindex. Autorisez temporairement l'exploration avec noindex, ou utilisez les outils de suppression dans la Search Console.
Contrôle de l'exploration pour l'e-commerce
Une boutique qui doit détourner le budget d'exploration des URL à faible valeur.
À utiliser quand : une boutique génère d'innombrables URL de facettes, de paramètres et de compte qui gaspillent le budget d'exploration et diluent les signaux.
Blocages typiques
- User-agent : *
- Disallow : [/cart]
- Disallow : [/checkout]
- Disallow : [/account/]
- Disallow : [/search] (résultats de la recherche interne du site)
- Disallow : [/*?*sort=] (un paramètre de tri n'importe où dans la chaîne de requête)
- Disallow : [/*?*filter=] (filtres à facettes)
- Disallow : [/*.pdf$] (bloquer toute URL se terminant par .pdf : $ ancre la fin)
Utilisez * pour faire correspondre n'importe quelle séquence et $ pour ancrer la fin d'une URL. Les chemins sont sensibles à la casse, donc [/Search] et [/search] sont des règles différentes.
Attention : ne bloquez que les paramètres qui créent de véritables doublons ou des pages pauvres. Bloquer un paramètre qui modifie le contenu principal du produit (ou vos URL canoniques) peut masquer des pages que vous voulez voir se positionner. Préférez les balises canoniques pour le contenu dupliqué et réservez le robots.txt au gaspillage d'exploration que vous ne voulez jamais voir récupéré.
Autoriser les moteurs de recherche, bloquer les scrapers
Accueillir les grands robots de recherche tout en éconduisant les robots agressifs ou indésirables.
À utiliser quand : vous voulez que Google, Bing et les autres grands moteurs explorent librement, mais souhaitez décourager les scrapers connus et les robots gourmands en bande passante.
Autorisez les moteurs que vous voulez
- User-agent : Googlebot
- Disallow : (vide)
- User-agent : Bingbot
- Disallow : (vide)
Découragez un robot précis
- User-agent : [BadBot]
- Disallow : /
Chaque bloc User-agent est évalué indépendamment, et un robot suit le groupe le plus précis qui le nomme. Conservez un groupe User-agent : * final pour que les robots non nommés reçoivent aussi des instructions claires.
Pour freiner les robots d'IA conformes, nommez-les également : par exemple User-agent : GPTBot avec Disallow : /. Cela n'arrête que les robots qui choisissent de respecter le robots.txt.
Retour à la réalité : le robots.txt est facultatif. Les moteurs bien élevés le respectent ; les scrapers malveillants et de nombreux robots d'IA l'ignorent et peuvent même s'en servir pour trouver les chemins que vous avez nommés. Pour une véritable application, bloquez par user-agent ou par IP au niveau du serveur ou du pare-feu, ou utilisez la limitation de débit. Considérez le robots.txt comme une orientation, pas comme une sécurité.
Déclaration d'un sitemap et de plusieurs sitemaps
Orienter les robots vers un ou plusieurs sitemaps, y compris un index de sitemaps.
À utiliser quand : vous voulez que chaque robot découvre vos sitemaps, en particulier pour un grand site réparti sur plusieurs fichiers.
Sitemap unique
- Sitemap : [https://example.com/sitemap.xml]
Plusieurs sitemaps
- Sitemap : [https://example.com/sitemap-posts.xml]
- Sitemap : [https://example.com/sitemap-products.xml]
- Sitemap : [https://example.com/sitemap-images.xml]
Ou un seul index de sitemaps
- Sitemap : [https://example.com/sitemap_index.xml]
Règles à suivre :
- Indiquez chaque sitemap sur sa propre ligne. Il n'y a pas de limite au nombre de lignes Sitemap, mais chaque fichier de sitemap individuel est limité à 50 000 URL et 50 Mo décompressé : répartissez les sites plus grands sur plusieurs fichiers ou un index de sitemaps.
- Utilisez toujours une URL absolue complète avec le protocole (https) et l'hôte corrects.
- La directive Sitemap est indépendante des groupes User-agent, placez-la donc n'importe où dans le fichier.
- Soumettre les sitemaps dans la Search Console et les Bing Webmaster Tools reste recommandé en secours.
Liste de contrôle QA avant publication
Repérez les erreurs qui désindexent un site en silence avant de mettre le fichier en ligne.
À utiliser quand : vous êtes sur le point de publier ou de remplacer un fichier robots.txt et voulez éviter les erreurs classiques et coûteuses.
Vérifiez chaque point
- Confirmez que le fichier est à la racine : [https://example.com/robots.txt]. Un fichier dans un sous-dossier est ignoré.
- Assurez-vous qu'aucun Disallow : / égaré ne subsiste de la préproduction.
- Vérifiez la casse de chaque chemin ; le robots.txt est sensible à la casse.
- Vérifiez que les dossiers CSS, JS et images ne sont pas bloqués, afin que Google puisse afficher les pages.
- Confirmez que chaque ligne Sitemap utilise une URL https complète qui renvoie un 200.
- Surveillez les règles Disallow : plus larges que prévu (une barre oblique finale a son importance).
- Rappelez-vous que le robots.txt ne désindexe pas ; associez les blocages à noindex ou aux outils de suppression là où c'est nécessaire.
- Retestez après toute mise à jour de CMS ou de plugin, qui peut écraser le fichier.
Test final : ouvrez [https://example.com/robots.txt] dans un navigateur pour confirmer qu'il se charge, puis validez-le avec un testeur de robots.txt avant et après la mise en ligne.
Comment utiliser ce modèle
- Créez un fichier texte brut nommé exactement robots.txt et placez-le à la racine de votre domaine pour qu'il soit accessible à l'adresse https://yourdomain.com/robots.txt ; les fichiers dans les sous-dossiers sont ignorés.
- Définissez votre valeur par défaut : laissez Disallow vide pour autoriser l'exploration complète, et n'ajoutez des lignes Disallow que pour les chemins que vous voulez réellement tenir à l'écart de l'exploration.
- Regroupez les règles sous une ligne User-agent ; utilisez User-agent : * pour tous les robots, ou nommez un robot précis comme Googlebot pour lui attribuer son propre groupe.
- Écrivez les chemins Disallow exactement tels qu'ils apparaissent dans vos URL, en gardant à l'esprit que les chemins sont sensibles à la casse et qu'une barre oblique finale change ce qui est mis en correspondance.
- Utilisez les caractères génériques avec prudence : * correspond à n'importe quelle séquence de caractères et $ ancre la fin d'une URL, ce qui est utile pour bloquer des paramètres ou des types de fichiers.
- Ajoutez une ligne Sitemap par sitemap en utilisant des URL https absolues complètes, ou pointez vers un seul fichier d'index de sitemaps pour les grands sites.
- Validez le fichier dans un testeur de robots.txt et récupérez quelques URL importantes pour confirmer qu'elles sont toujours autorisées avant de publier.
- Après le lancement, surveillez la couverture dans la Search Console et le rapport robots.txt pour détecter les erreurs d'exploration, et revérifiez le fichier après toute mise à jour de CMS, de thème ou de plugin.
Conseils pro
- Ne mettez jamais Disallow : / en ligne sur un site en production ; cette seule ligne demande aux robots d'ignorer chaque URL et constitue la cause la plus fréquente de désindexation accidentelle.
- Le robots.txt contrôle l'exploration, pas l'indexation. Pour retirer une page des résultats, autorisez l'exploration et ajoutez une balise noindex, ou protégez-la derrière une authentification, plutôt que de compter sur Disallow.
- Ne bloquez pas les répertoires CSS, JavaScript ou images ; Google en a besoin pour afficher et comprendre vos pages, et les bloquer peut nuire au positionnement.
- Considérez le robots.txt comme public et consultatif : n'importe qui peut le lire, les robots bien élevés le respectent et les robots malveillants l'ignorent, alors utilisez des contrôles côté serveur pour une vraie protection.
Questions fréquentes
Disallow retire-t-il une page de Google ?
Non. Disallow empêche les robots conformes de récupérer la page, mais une URL interdite peut tout de même être indexée si d'autres pages y renvoient. Pour garder une page hors de l'index, autorisez l'exploration et ajoutez une directive noindex, ou protégez-la derrière une authentification.
Où le fichier robots.txt doit-il se trouver ?
À la racine de chaque hôte, pour qu'il soit accessible à l'adresse https://yourdomain.com/robots.txt. Un robots.txt placé dans un sous-dossier est ignoré. Chaque sous-domaine et chaque protocole est traité séparément, donc les versions https, http et www peuvent chacune nécessiter leur propre fichier.
Le robots.txt est-il sensible à la casse ?
Les valeurs des chemins le sont. Disallow : /Folder/ et Disallow : /folder/ correspondent à des URL différentes, alors copiez les chemins exactement tels qu'ils apparaissent sur votre site. Les noms de directives comme User-agent et Disallow ne sont pas sensibles à la casse, mais l'essentiel est de respecter la casse réelle de vos URL.
Quelle est la différence entre Disallow et noindex ?
Disallow contrôle l'exploration : il demande aux robots de ne pas récupérer une URL. Noindex contrôle l'indexation : il demande aux moteurs de recherche de ne pas afficher une page dans les résultats. Si vous interdisez une page avec Disallow, Google ne peut pas voir sa balise noindex, donc pour désindexer une page, vous devez autoriser l'exploration et utiliser noindex.
Comment bloquer un robot mais autoriser les autres ?
Attribuez à ce robot son propre groupe, par exemple User-agent : BadBot suivi de Disallow : /, et conservez un groupe User-agent : * distinct pour tous les autres. Chaque robot suit le groupe le plus précis qui le nomme, si bien que le robot visé est bloqué tandis que les autres restent autorisés.
Le robots.txt arrêtera-t-il les scrapers et les robots d'IA ?
Seulement ceux qui choisissent de le respecter. Le robots.txt est facultatif, donc les moteurs de recherche sérieux le suivent tandis que de nombreux scrapers et robots l'ignorent totalement. Pour une véritable application, bloquez par user-agent ou par IP au niveau du serveur ou du pare-feu, ou ajoutez de la limitation de débit et de l'authentification.