El robots.txt es un archivo de texto de quizá diez líneas y, aun así, ha sacado sitios enteros de Google por un solo «Disallow: /» mal puesto. Esta guía explica qué hace realmente el archivo, da plantillas para las plataformas habituales y muestra cómo controlar los rastreadores de IA.
Qué puede y qué no puede hacer
Indica a los rastreadores qué rutas no deben descargar. No impide la indexación: una página bloqueada por robots.txt puede seguir apareciendo en Google si otros enlazan a ella, solo que sin descripción. Para mantener una página fuera del índice hace falta una etiqueta noindex, y la página no debe estar bloqueada, o Google nunca verá la etiqueta.
La sintaxis del robots.txt en cinco líneas
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://ejemplo.com/sitemap_index.xml User-agent: a qué bot se aplican las reglas siguientes;*para todos.Disallow: prefijo de ruta que no debe rastrearse. Vacío = todo permitido.Allow: excepción dentro de una ruta bloqueada.Sitemap: URL absoluta, puede repetirse.- Comodines:
*cualquier carácter,$fin de URL:Disallow: /*.pdf$
Plantillas
WordPress
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://ejemplo.com/sitemap_index.xml Shopify
Shopify genera el archivo por sí mismo; los ajustes van en robots.txt.liquid. Lo típico —bloquear carrito, checkout, búsqueda y parámetros de filtro— ya viene de serie.
Next.js / sitios estáticos
User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://ejemplo.com/sitemap.xml El generador de robots.txt construye estas plantillas con tus rutas y comprueba la sintaxis.
Controlar los rastreadores de IA
GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl) y Google-Extended (entrenamiento de Gemini) respetan el robots.txt. Bloquearlos significa no entrenar con tu contenido, pero tampoco aparecer en las respuestas de IA. Para la mayoría de los sitios de contenido, permitirlos es la mejor opción: la visibilidad en las búsquedas con IA importa más que protegerse del entrenamiento.
User-agent: GPTBot
Disallow: / Los tres errores que sacan un sitio de Google
- Disallow: / del entorno de pruebas que pasa a producción.
- CSS y JS bloqueados: Google no puede renderizar la página y la considera vacía.
- Archivo en el sitio equivocado: solo cuenta
ejemplo.com/robots.txt, no una subcarpeta.
Tras cada cambio: Search Console → Ajustes → informe de robots.txt, y con el comprobador de cabeceras HTTP asegúrate de que el archivo se sirve con estado 200.
Preguntas frecuentes
¿Necesito un robots.txt?
Sin archivo todo está permitido, y para sitios pequeños está bien. Es útil para la línea del sitemap y para bloquear búsqueda, filtros y rutas de administración.
¿Cuánto tarda en aplicarse un cambio?
Google lee el archivo aproximadamente a diario; los cambios se aplican en 24 horas.
Gratis, funciona en tu navegador, no se sube nada, sin registro.
Sigue leyendo
Más de Herramientas SEO y web.


