Extractor de URLs de Sitemap
Cómo usar Extractor de URLs de Sitemap
- 1
Proporciona tu sitemap
Pega el XML en bruto de tu sitemap en el cuadro XML, o introduce una URL de sitemap para obtenerlo automáticamente.
- 2
Extrae las URL
Haz clic en 'Extraer URL' para el XML pegado, o en 'Obtener y extraer' para descargar y analizar un sitemap a partir de su URL.
- 3
Revisa los resultados
Cada enlace encontrado dentro de las etiquetas <loc> se enumera en el área de resultados junto con el recuento total.
- 4
Copia o descarga
Usa 'Copiar al portapapeles' o 'Descargar como archivo de texto' para guardar la lista de URL extraídas.
Trabajar con sitemaps XML: extracción y auditoría
Qué es un sitemap XML
Un sitemap XML es un archivo estructurado que enumera las URL que quieres que conozcan los buscadores, envueltas en un elemento urlset donde cada página es una entrada url. El único hijo obligatorio de cada entrada es la etiqueta loc, que contiene la URL absoluta de la página; las etiquetas opcionales como lastmod, changefreq y priority ofrecen pistas sobre la actualidad y la importancia. Los buscadores tratan el sitemap como una ayuda para el descubrimiento y un conjunto de sugerencias, no de órdenes, así que incluir una URL no obliga a que se rastree ni se indexe, pero sí hace que la URL sea mucho más fácil de encontrar.
Como la etiqueta loc es donde reside cada URL real, extraer el contenido de todas las etiquetas loc te da un inventario limpio y completo de las páginas que un sitio anuncia a los buscadores. Ese inventario es el punto de partida de una amplia variedad de tareas de SEO y de migración, que es exactamente lo que produce este extractor.
Archivos de índice de sitemaps y sitemaps anidados
Los sitios grandes rara vez usan un único sitemap plano. En su lugar usan un archivo de índice de sitemaps, un elemento sitemapindex cuyas entradas apuntan cada una a otro archivo de sitemap en lugar de a una página. Una configuración típica podría tener un índice que referencia sitemaps separados para entradas, páginas, productos e imágenes. Cuando extraes URL de un archivo de índice, las etiquetas loc que obtienes son las URL de los sitemaps hijos, no de páginas individuales, así que puede que necesites extraer de cada sitemap hijo a su vez para llegar a las URL reales de las páginas.
Reconocer si estás viendo un índice o un sitemap final es la mitad de la batalla. Si todas las URL extraídas terminan en .xml o .xml.gz, tienes un índice y deberías bajar un nivel. Si apuntan a páginas HTML normales, has llegado al contenido real.
Los límites de 50.000 URL y 50 MB
El protocolo de sitemaps limita un único archivo de sitemap a 50.000 URL y 50 MB sin comprimir. Los sitios que superan cualquiera de los dos límites deben repartir sus URL entre varios archivos de sitemap y unirlos con un índice de sitemaps, que es la razón principal por la que los sitios grandes usan archivos de índice. Conocer estos límites te ayuda a verificar lo que extraes: si un único sitemap devuelve muchas más de 50.000 URL es que está mal formado, y si un sitio grande expone un único sitemap pequeño es que probablemente está incompleto y le faltan páginas.
Estos techos también moldean cómo auditas. Cuando extraes una lista completa de URL y el recuento aterriza sospechosamente cerca de un número redondo como 50.000, esa es una señal clara de que el sitio ha alcanzado el límite y de que hay URL adicionales varadas en sitemaps que aún no has extraído.
Sitemaps comprimidos con gzip
Para mantenerse por debajo del límite de tamaño y ahorrar ancho de banda, muchos sitemaps se sirven comprimidos con gzip y con la extensión .xml.gz. Un sitemap comprimido con gzip no es más que un sitemap XML normal que ha sido comprimido; los buscadores lo descomprimen de forma transparente. Cuando obtienes uno con esta herramienta, el servidor se encarga de la descarga, pero si inspeccionas un archivo .gz a mano verás un galimatías binario en lugar de XML legible hasta que se descomprima. Si pegas el contenido directamente, pega el XML descomprimido, no los bytes comprimidos en bruto.
La compresión es puramente una optimización del transporte y no cambia nada de la estructura interna. Una vez descomprimido, un sitemap con gzip tiene los mismos elementos urlset, url y loc que cualquier otro, y se aplica la misma lógica de extracción.
Por qué extraer las URL del sitemap es tan útil
Una lista plana de todas las URL que publica un sitio es la columna vertebral del trabajo práctico de SEO. Durante una migración de sitio, extraes el sitemap del sitio antiguo para construir un mapa completo de redirecciones de modo que ninguna URL acabe en un 404. Para una auditoría de contenido, la lista alimenta un rastreador o una hoja de cálculo donde puedes comprobar los códigos de estado, los títulos y el recuento de palabras página por página. Para las comprobaciones de indexación, puedes comparar las URL que envías con lo que Search Console informa como indexado, y la diferencia te dice qué páginas está ignorando Google.
La lista también es la entrada para herramientas masivas. Puedes canalizar las URL extraídas hacia un rastreador como Screaming Frog, hacia un comprobador de enlaces, hacia un auditor de rendimiento o hacia un script que sondea las cabeceras HTTP de cada URL. Partir de la lista canónica del sitemap, en lugar de rastrear a ciegas, garantiza que estás auditando exactamente las páginas que el sitio pretende exponer.
Errores comunes al extraer
La sorpresa más frecuente es extraer un archivo de índice y pensar que el sitio solo tiene un puñado de páginas, cuando en realidad esas pocas URL son sitemaps hijos que contienen cada uno miles de páginas. Comprueba siempre si tus resultados son sitemaps o páginas reales antes de sacar conclusiones. Un segundo error es dar por hecho que el sitemap es exhaustivo: muchos gestores de contenido generan sitemaps que omiten ciertos tipos de página, archivos paginados o contenido publicado recientemente, así que un sitemap es un mínimo de las URL de un sitio, no un censo completo.
Otras trampas incluyen fechas lastmod obsoletas que no reflejan cambios reales, URL en el sitemap que ya no devuelven 200 (páginas huérfanas o eliminadas que nunca se depuraron) y desajustes de protocolo o de host en los que el sitemap enumera URL http mientras que el sitio se ha pasado a https. Extraer las URL es la parte fácil; el valor viene de contrastar esa lista con lo que el servidor sirve realmente.
Integrar la extracción en un flujo de trabajo de SEO
Un flujo de trabajo limpio y repetible se ve así: encuentra el sitemap, normalmente enlazado desde robots.txt o ubicado en la ruta convencional /sitemap.xml; extrae las URL, profundizando a través de cualquier archivo de índice hasta llegar a las páginas reales; exporta la lista a un archivo de texto; y luego introdúcela en la herramienta de auditoría o migración que estés usando. Como este extractor puede tanto analizar el XML pegado como obtener un sitemap por su URL, puedes pasar de un sitemap en bruto a una lista de URL utilizable en segundos sin escribir nada de código.
Ejecuta la extracción de forma periódica en lugar de una sola vez. Comparar la lista de URL de hoy con la del mes pasado saca a la luz páginas publicadas recientemente, páginas eliminadas sin avisar y cambios estructurales en el sitio, todo lo cual constituye señales tempranas útiles tanto para la salud del SEO como para la gobernanza del contenido.
Preguntas frecuentes
¿Cómo encuentra los enlaces el extractor de URL de sitemaps?
¿Puedo pegar XML o cargar un sitemap desde una URL?
¿Qué pasa si mi XML no es válido o no tiene URL?
¿Puedo exportar las URL extraídas?
¿Es gratuita la herramienta y son privados mis datos?
Herramientas relacionadas
Sigue trabajando con estas prácticas herramientas