...
Contact Contact

Écrire un robots.txt : guide avec exemples pour WordPress, Shopify et Next.js

How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js) How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js)

Le robots.txt est un fichier texte d’une dizaine de lignes et il a pourtant déjà fait disparaître des sites entiers de Google — à cause d’un seul « Disallow: / » mal placé. Ce guide explique ce que le fichier fait vraiment, donne des modèles pour les plateformes courantes et montre comment piloter les robots d’IA.

Ce que le robots.txt peut — et ne peut pas — faire

Il indique aux robots quels chemins ne pas récupérer. Il n’empêche pas l’indexation : une page bloquée par le robots.txt peut quand même apparaître dans Google si d’autres sites y renvoient, mais sans description. Pour garder une page hors de l’index, il faut une balise noindex, et la page ne doit pas être bloquée, sinon Google ne verra jamais la balise.

La syntaxe en cinq lignes

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://exemple.com/sitemap_index.xml
  • User-agent : à quel robot s’appliquent les règles suivantes ; * pour tous.
  • Disallow : préfixe de chemin à ne pas explorer. Vide = tout autorisé.
  • Allow : exception dans un chemin bloqué.
  • Sitemap : URL absolue, peut apparaître plusieurs fois.
  • Jokers : * n’importe quels caractères, $ fin d’URL : Disallow: /*.pdf$

Modèles

WordPress

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://exemple.com/sitemap_index.xml

Shopify

Shopify génère le fichier lui-même ; les ajustements passent par robots.txt.liquid. Le classique — bloquer panier, paiement, recherche et paramètres de filtre — est déjà en place par défaut.

Advertisement

Next.js / sites statiques

User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://exemple.com/sitemap.xml

Le générateur de robots.txt construit ces modèles avec vos chemins et vérifie la syntaxe.

Piloter les robots d’IA

GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) et Google-Extended (entraînement de Gemini) respectent le robots.txt. Les bloquer signifie : pas d’entraînement sur vos contenus, mais pas non plus de citation dans les réponses d’IA. Pour la plupart des sites de contenu, autoriser est le meilleur choix — la visibilité dans les recherches par IA compte davantage que la protection contre l’entraînement.

User-agent: GPTBot
Disallow: /

Les trois erreurs qui sortent un site de Google

  1. Disallow: / hérité de l’environnement de préproduction et mis en ligne.
  2. CSS et JS bloqués : Google ne peut pas afficher la page et la considère comme vide.
  3. Fichier au mauvais endroit : seul exemple.com/robots.txt compte, pas un sous-dossier.

Après chaque modification : Search Console → Paramètres → rapport robots.txt, et vérifiez avec le vérificateur d’en-têtes HTTP que le fichier est servi en statut 200.

Questions fréquentes

Ai-je vraiment besoin d’un robots.txt ?

Sans fichier, tout est autorisé, ce qui convient aux petits sites. Il est utile pour la ligne sitemap et pour bloquer recherche, filtres et chemins d’administration.

En combien de temps un changement prend-il effet ?

Google lit le fichier à peu près chaque jour ; les changements s’appliquent sous 24 heures.

Essayez maintenant : Générateur de robots.txt

Gratuit, fonctionne dans votre navigateur, rien n’est envoyé, sans inscription.

Ouvrir l’outil →
Add a comment Add a comment

Leave a Reply

Your email address will not be published. Required fields are marked *

Submit Comment

Advertisement
Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.