...
Contacto Contacto

Cómo escribir un robots.txt: guía con ejemplos para WordPress, Shopify y Next.js

How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js) How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js)

El robots.txt es un archivo de texto de quizá diez líneas y, aun así, ha sacado sitios enteros de Google por un solo «Disallow: /» mal puesto. Esta guía explica qué hace realmente el archivo, da plantillas para las plataformas habituales y muestra cómo controlar los rastreadores de IA.

Qué puede y qué no puede hacer

Indica a los rastreadores qué rutas no deben descargar. No impide la indexación: una página bloqueada por robots.txt puede seguir apareciendo en Google si otros enlazan a ella, solo que sin descripción. Para mantener una página fuera del índice hace falta una etiqueta noindex, y la página no debe estar bloqueada, o Google nunca verá la etiqueta.

La sintaxis del robots.txt en cinco líneas

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://ejemplo.com/sitemap_index.xml
  • User-agent: a qué bot se aplican las reglas siguientes; * para todos.
  • Disallow: prefijo de ruta que no debe rastrearse. Vacío = todo permitido.
  • Allow: excepción dentro de una ruta bloqueada.
  • Sitemap: URL absoluta, puede repetirse.
  • Comodines: * cualquier carácter, $ fin de URL: Disallow: /*.pdf$

Plantillas

WordPress

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://ejemplo.com/sitemap_index.xml

Shopify

Shopify genera el archivo por sí mismo; los ajustes van en robots.txt.liquid. Lo típico —bloquear carrito, checkout, búsqueda y parámetros de filtro— ya viene de serie.

Advertisement

Next.js / sitios estáticos

User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://ejemplo.com/sitemap.xml

El generador de robots.txt construye estas plantillas con tus rutas y comprueba la sintaxis.

Controlar los rastreadores de IA

GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) y Google-Extended (entrenamiento de Gemini) respetan el robots.txt. Bloquearlos significa no entrenar con tu contenido, pero tampoco aparecer en las respuestas de IA. Para la mayoría de los sitios de contenido, permitirlos es la mejor opción: la visibilidad en las búsquedas con IA importa más que protegerse del entrenamiento.

User-agent: GPTBot
Disallow: /

Los tres errores que sacan un sitio de Google

  1. Disallow: / del entorno de pruebas que pasa a producción.
  2. CSS y JS bloqueados: Google no puede renderizar la página y la considera vacía.
  3. Archivo en el sitio equivocado: solo cuenta ejemplo.com/robots.txt, no una subcarpeta.

Tras cada cambio: Search Console → Ajustes → informe de robots.txt, y con el comprobador de cabeceras HTTP asegúrate de que el archivo se sirve con estado 200.

Preguntas frecuentes

¿Necesito un robots.txt?

Sin archivo todo está permitido, y para sitios pequeños está bien. Es útil para la línea del sitemap y para bloquear búsqueda, filtros y rutas de administración.

¿Cuánto tarda en aplicarse un cambio?

Google lee el archivo aproximadamente a diario; los cambios se aplican en 24 horas.

Pruébalo ahora: Generador de robots.txt

Gratis, funciona en tu navegador, no se sube nada, sin registro.

Abrir la herramienta →
Add a comment Add a comment

Leave a Reply

Your email address will not be published. Required fields are marked *

Submit Comment

Advertisement
Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.