À quoi sert le fichier robots.txt ?
Le fichier robots.txt, placé à la racine de votre site (par exemple https://www.exemple.ma/robots.txt), indique aux robots d’exploration des moteurs de recherche les zones qu’ils peuvent visiter ou non. Il sert surtout à éviter qu’ils perdent du temps sur des pages sans intérêt pour la recherche : back-office, panier, résultats de recherche interne, pages filtrées à l’infini. Sa syntaxe est standardisée par la norme RFC 9309.
Ce que robots.txt ne fait pas
C’est l’erreur la plus fréquente : robots.txt ne garantit pas qu’une page n’apparaîtra pas dans Google. Une page bloquée peut encore être indexée, sans description, si d’autres sites font un lien vers elle. Pour retirer une page des résultats, utilisez une balise meta robots noindex et laissez la page explorable, afin que Google puisse lire cette consigne. Et pour protéger des données confidentielles, seule une authentification est efficace : le fichier est public et les robots malveillants l’ignorent.
Comment utiliser le générateur
- Choisissez un modèle (WordPress, boutique, application) ou saisissez vos propres chemins.
- Ajoutez l’adresse complète de votre sitemap XML.
- Si vous le souhaitez, bloquez les robots qui collectent des contenus pour entraîner des modèles d’intelligence artificielle. Cette consigne n’est respectée que par les robots qui suivent la norme, et le blocage de Google-Extended n’a pas d’effet sur votre référencement dans Google Search.
- Téléchargez le fichier et placez-le à la racine de votre site, puis vérifiez-le dans le rapport robots.txt de la Google Search Console.
Les pièges à éviter
- Un
Disallow: /oublié après la mise en ligne d’un site en préproduction : tout le site disparaît progressivement de Google. - Bloquer les CSS et JavaScript : Google en a besoin pour afficher et comprendre vos pages.
- La casse et la barre finale : les chemins sont sensibles aux majuscules, et
/adminbloque aussi/administration. - Crawl-delay : ignoré par Googlebot ; inutile dans la plupart des cas.
Le générateur fonctionne entièrement dans votre navigateur. Pour contrôler la présentation de vos pages dans les résultats, utilisez notre aperçu SERP Google et le générateur de données structurées. Un doute sur l’indexation de votre site ? C’est un point que nous vérifions en priorité dans notre accompagnement en référencement naturel.
Vous êtes une agence ? Nous travaillons en marque blanche →
Questions fréquentes
Robots.txt empêche-t-il une page d’apparaître dans Google ?
Pas toujours : une page bloquée peut être indexée si d’autres sites font un lien vers elle. Pour la retirer des résultats, utilisez une balise meta robots noindex et laissez-la explorable.
Où placer le fichier robots.txt ?
À la racine du domaine, par exemple https://www.exemple.ma/robots.txt. Chaque sous-domaine a son propre fichier.
Bloquer les robots d’IA nuit-il au référencement ?
Bloquer GPTBot, ClaudeBot, CCBot ou Google-Extended n’a pas d’effet sur l’exploration par Googlebot, donc sur votre référencement dans Google Search.
