Le robots.txt est un fichier texte d’une dizaine de lignes et il a pourtant déjà fait disparaître des sites entiers de Google — à cause d’un seul « Disallow: / » mal placé. Ce guide explique ce que le fichier fait vraiment, donne des modèles pour les plateformes courantes et montre comment piloter les robots d’IA.
Ce que le robots.txt peut — et ne peut pas — faire
Il indique aux robots quels chemins ne pas récupérer. Il n’empêche pas l’indexation : une page bloquée par le robots.txt peut quand même apparaître dans Google si d’autres sites y renvoient, mais sans description. Pour garder une page hors de l’index, il faut une balise noindex, et la page ne doit pas être bloquée, sinon Google ne verra jamais la balise.
La syntaxe en cinq lignes
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://exemple.com/sitemap_index.xml User-agent: à quel robot s’appliquent les règles suivantes ;*pour tous.Disallow: préfixe de chemin à ne pas explorer. Vide = tout autorisé.Allow: exception dans un chemin bloqué.Sitemap: URL absolue, peut apparaître plusieurs fois.- Jokers :
*n’importe quels caractères,$fin d’URL :Disallow: /*.pdf$
Modèles
WordPress
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://exemple.com/sitemap_index.xml Shopify
Shopify génère le fichier lui-même ; les ajustements passent par robots.txt.liquid. Le classique — bloquer panier, paiement, recherche et paramètres de filtre — est déjà en place par défaut.
Next.js / sites statiques
User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://exemple.com/sitemap.xml Le générateur de robots.txt construit ces modèles avec vos chemins et vérifie la syntaxe.
Piloter les robots d’IA
GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) et Google-Extended (entraînement de Gemini) respectent le robots.txt. Les bloquer signifie : pas d’entraînement sur vos contenus, mais pas non plus de citation dans les réponses d’IA. Pour la plupart des sites de contenu, autoriser est le meilleur choix — la visibilité dans les recherches par IA compte davantage que la protection contre l’entraînement.
User-agent: GPTBot
Disallow: / Les trois erreurs qui sortent un site de Google
- Disallow: / hérité de l’environnement de préproduction et mis en ligne.
- CSS et JS bloqués : Google ne peut pas afficher la page et la considère comme vide.
- Fichier au mauvais endroit : seul
exemple.com/robots.txtcompte, pas un sous-dossier.
Après chaque modification : Search Console → Paramètres → rapport robots.txt, et vérifiez avec le vérificateur d’en-têtes HTTP que le fichier est servi en statut 200.
Questions fréquentes
Ai-je vraiment besoin d’un robots.txt ?
Sans fichier, tout est autorisé, ce qui convient aux petits sites. Il est utile pour la ligne sitemap et pour bloquer recherche, filtres et chemins d’administration.
En combien de temps un changement prend-il effet ?
Google lit le fichier à peu près chaque jour ; les changements s’appliquent sous 24 heures.
Gratuit, fonctionne dans votre navigateur, rien n’est envoyé, sans inscription.
Continuer la lecture
Plus de Outils SEO et site web.


