Un sitemap XML es una lista de las URL que quieres que se indexen, nada más. No sustituye al enlazado interno ni garantiza la indexación, pero le dice a Google qué páginas existen y cuándo cambiaron por última vez. Precisamente en sitios nuevos, grandes o mal enlazados, marca la diferencia entre «encontrado en días» y «en meses».
Qué debe incluir el sitemap XML
- Todas las páginas que deban aparecer en la búsqueda: portada, categorías, productos, artículos, landings.
- Solo la versión canónica de cada URL: ni http y https, ni con y sin barra final.
- Solo páginas con estado 200 que no estén bloqueadas por noindex ni robots.txt.
Qué dejar fuera
- Archivos de etiquetas, páginas de autor, paginación, resultados de búsqueda, URL de filtros.
- Redirecciones, páginas 404, login y carrito.
- Páginas con noindex: es contradictorio y resta confianza.
La regla práctica: si una página no debería ser un resultado de búsqueda, no pinta nada en el sitemap XML. El generador de sitemap XML comprueba el estado y los duplicados de las URL antes de construir el archivo.
Límites y estructura
Máximo 50.000 URL y 50 MB sin comprimir por archivo; más allá, un índice de sitemaps que apunte a varios. Conviene dividir por tipo (páginas, entradas, productos, imágenes): así en Search Console se ve al momento qué sección tiene problemas. WordPress con Yoast o Rank Math genera justo esa estructura en /sitemap_index.xml.
lastmod: el único dato que Google usa
<lastmod> con la fecha real de modificación ayuda a Google a rastrear primero las páginas que han cambiado. <priority> y <changefreq> se ignoran casi por completo. Importante: cambia lastmod solo si cambió el contenido; quien pone la fecha de hoy en cada build anula la señal.
Leer el informe de sitemaps
Search Console → Sitemaps: «Correcto» solo significa que el archivo se puede leer. Lo decisivo es comparar «URL descubiertas» con «URL indexadas» en Páginas: si la indexación queda muy por debajo del número del sitemap, hay problemas de calidad o duplicados. «Rastreada: actualmente sin indexar» señala contenido pobre; «Duplicada: el usuario no ha indicado ninguna versión canónica», etiquetas canonical ausentes.
Preguntas frecuentes
¿Debe estar el sitemap en el robots.txt?
No es obligatorio, pero la línea Sitemap: https://…/sitemap_index.xml ayuda a Bing y otros buscadores a encontrarlo. El generador de robots.txt la añade solo.
¿Cada cuánto lee Google el sitemap?
En sitios activos, a diario; tras enviarlo en Search Console, en cuestión de horas.
¿Las imágenes necesitan sitemap propio?
Solo si se cargan por JavaScript o si la búsqueda de imágenes es un objetivo; si no, basta con incrustarlas en páginas normales.
Gratis, funciona en tu navegador, no se sube nada, sin registro.
Sigue leyendo
Más de Herramientas SEO y web.


