Sitemap URL-Extraktor
So verwenden Sie Sitemap URL-Extraktor
- 1
Sitemap bereitstellen
Fügen Sie das rohe XML Ihrer Sitemap in das XML-Feld ein oder geben Sie eine Sitemap-URL ein, um sie automatisch abzurufen.
- 2
URLs extrahieren
Klicken Sie für eingefügtes XML auf „URLs extrahieren“ oder auf „Abrufen und extrahieren“, um eine Sitemap von ihrer URL herunterzuladen und zu parsen.
- 3
Ergebnisse prüfen
Jeder innerhalb von <loc>-Tags gefundene Link wird im Ergebnisbereich zusammen mit der Gesamtzahl aufgelistet.
- 4
Kopieren oder herunterladen
Verwenden Sie „In die Zwischenablage kopieren“ oder „Als Textdatei herunterladen“, um die extrahierte URL-Liste zu sichern.
Arbeiten mit XML-Sitemaps: Extraktion und Prüfung
Was eine XML-Sitemap ist
Eine XML-Sitemap ist eine strukturierte Datei, die die URLs auflistet, von denen Suchmaschinen erfahren sollen, eingebettet in ein urlset-Element, in dem jede Seite ein url-Eintrag ist. Das einzige Pflicht-Unterelement jedes Eintrags ist das loc-Tag, das die absolute URL der Seite enthält; optionale Tags wie lastmod, changefreq und priority geben Hinweise auf Aktualität und Wichtigkeit. Suchmaschinen behandeln die Sitemap als Hilfe zum Auffinden von Seiten und als eine Reihe von Vorschlägen, nicht als Befehle, sodass das Auflisten einer URL nicht erzwingt, dass sie gecrawlt oder indexiert wird – es macht die URL jedoch deutlich leichter auffindbar.
Da jede echte URL im loc-Tag steht, liefert das Extrahieren des Inhalts aller loc-Tags ein sauberes, vollständiges Verzeichnis der Seiten, die eine Website gegenüber Suchmaschinen bewirbt. Dieses Verzeichnis ist der Ausgangspunkt für eine Vielzahl von SEO- und Migrationsaufgaben – und genau das erzeugt dieser Extraktor.
Sitemap-Indexdateien und verschachtelte Sitemaps
Große Websites verwenden selten eine einzige flache Sitemap. Stattdessen nutzen sie eine Sitemap-Indexdatei, ein sitemapindex-Element, dessen Einträge jeweils auf eine weitere Sitemap-Datei verweisen statt auf eine Seite. Eine typische Konfiguration könnte einen Index enthalten, der auf separate Sitemaps für Beiträge, Seiten, Produkte und Bilder verweist. Wenn Sie URLs aus einer Indexdatei extrahieren, sind die zurückgegebenen loc-Tags die URLs der untergeordneten Sitemaps und nicht die einzelner Seiten, sodass Sie unter Umständen aus jeder untergeordneten Sitemap nacheinander extrahieren müssen, um zu den tatsächlichen Seiten-URLs zu gelangen.
Zu erkennen, ob Sie eine Index- oder eine endständige Sitemap vor sich haben, ist die halbe Miete. Enden die extrahierten URLs alle auf .xml oder .xml.gz, halten Sie einen Index in den Händen und sollten eine Ebene tiefer gehen. Verweisen sie auf normale HTML-Seiten, haben Sie den eigentlichen Inhalt erreicht.
Die Grenzen von 50.000 URLs und 50 MB
Das Sitemap-Protokoll begrenzt eine einzelne Sitemap-Datei auf 50.000 URLs und 50 MB im unkomprimierten Zustand. Websites, die eine dieser Grenzen überschreiten, müssen ihre URLs auf mehrere Sitemap-Dateien aufteilen und diese über einen Sitemap-Index zusammenführen – das ist der Hauptgrund, warum große Websites überhaupt Indexdateien verwenden. Wenn Sie diese Grenzen kennen, können Sie das Extrahierte auf Plausibilität prüfen: Liefert eine einzelne Sitemap weit mehr als 50.000 URLs, ist sie fehlerhaft aufgebaut, und stellt eine große Website nur eine einzige kleine Sitemap bereit, ist diese wahrscheinlich unvollständig und es fehlen Seiten.
Diese Obergrenzen prägen auch die Art und Weise, wie Sie prüfen. Wenn Sie eine vollständige URL-Liste abrufen und die Anzahl verdächtig nahe an einer runden Zahl wie 50.000 liegt, ist das ein deutliches Signal dafür, dass die Website die Grenze erreicht hat und weitere URLs in Sitemaps festsitzen, die Sie noch nicht extrahiert haben.
Gzip-komprimierte Sitemaps
Um unter der Größengrenze zu bleiben und Bandbreite zu sparen, werden viele Sitemaps gzip-komprimiert mit der Endung .xml.gz ausgeliefert. Eine gzip-komprimierte Sitemap ist lediglich eine normale XML-Sitemap, die komprimiert wurde; Suchmaschinen entpacken sie transparent. Wenn Sie eine solche über dieses Tool abrufen, übernimmt der Server den Download, doch wenn Sie eine .gz-Datei von Hand untersuchen, sehen Sie binären Zeichensalat statt lesbarem XML, bis die Datei entpackt ist. Wenn Sie Inhalte direkt einfügen, fügen Sie das entpackte XML ein und nicht die rohen komprimierten Bytes.
Die Komprimierung ist rein eine Optimierung für die Übertragung und ändert nichts an der inneren Struktur. Einmal entpackt, weist eine gzip-komprimierte Sitemap dieselben urlset-, url- und loc-Elemente auf wie jede andere, und es gilt dieselbe Extraktionslogik.
Warum das Extrahieren von Sitemap-URLs so nützlich ist
Eine flache Liste sämtlicher URLs, die eine Website veröffentlicht, ist das Rückgrat praktischer SEO-Arbeit. Bei einer Website-Migration extrahieren Sie die Sitemap der alten Website, um eine vollständige Weiterleitungskarte zu erstellen, damit keine URL auf einem 404 endet. Für ein Content-Audit speist die Liste einen Crawler oder eine Tabelle, in der Sie Statuscodes, Titel und Wortzahlen Seite für Seite überprüfen können. Für Indexierungsprüfungen können Sie die von Ihnen eingereichten URLs mit dem abgleichen, was die Search Console als indexiert meldet, und die Lücke verrät Ihnen, welche Seiten Google ignoriert.
Die Liste dient außerdem als Eingabe für Massenwerkzeuge. Sie können extrahierte URLs in einen Crawler wie Screaming Frog, in einen Link-Checker, in ein Werkzeug zur Performance-Prüfung oder in ein Skript einspeisen, das die HTTP-Header jeder URL abfragt. Wenn Sie von der maßgeblichen Sitemap-Liste ausgehen, statt blind zu crawlen, stellen Sie sicher, dass Sie genau die Seiten prüfen, die die Website veröffentlichen möchte.
Häufige Fallstricke beim Extrahieren
Die häufigste Überraschung besteht darin, eine Indexdatei zu extrahieren und zu glauben, die Website habe nur eine Handvoll Seiten, während diese wenigen URLs in Wirklichkeit untergeordnete Sitemaps sind, die jeweils Tausende von Seiten enthalten. Prüfen Sie stets, ob es sich bei Ihren Ergebnissen um Sitemaps oder um tatsächliche Seiten handelt, bevor Sie Schlüsse ziehen. Ein zweiter Fallstrick ist die Annahme, die Sitemap sei vollständig: Viele Content-Management-Systeme erzeugen Sitemaps, die bestimmte Seitentypen, paginierte Archive oder kürzlich veröffentlichte Inhalte auslassen, sodass eine Sitemap eine Untergrenze für die URLs einer Website darstellt und keine vollständige Erfassung.
Zu den weiteren Tücken zählen veraltete lastmod-Datumsangaben, die keine echten Änderungen widerspiegeln, URLs in der Sitemap, die keinen Status 200 mehr zurückgeben (verwaiste oder gelöschte Seiten, die nie aussortiert wurden), sowie Protokoll- oder Host-Abweichungen, bei denen die Sitemap http-URLs auflistet, während die Website bereits zu https gewechselt ist. Das Extrahieren der URLs ist der einfache Teil; der eigentliche Wert entsteht durch den Abgleich dieser Liste mit dem, was der Server tatsächlich ausliefert.
Die Extraktion in einen SEO-Workflow einbinden
Ein sauberer, wiederholbarer Arbeitsablauf sieht so aus: Suchen Sie die Sitemap, die meist von der robots.txt aus verlinkt ist oder unter dem üblichen Pfad /sitemap.xml liegt; extrahieren Sie die URLs und arbeiten Sie sich durch etwaige Indexdateien, bis Sie zu echten Seiten gelangen; exportieren Sie die Liste in eine Textdatei; und speisen Sie sie anschließend in das jeweils von Ihnen verwendete Prüf- oder Migrationswerkzeug ein. Da dieser Extraktor sowohl eingefügtes XML parsen als auch eine Sitemap anhand ihrer URL abrufen kann, gelangen Sie in Sekunden von einer rohen Sitemap zu einer nutzbaren URL-Liste, ganz ohne Code zu schreiben.
Führen Sie die Extraktion regelmäßig durch und nicht nur ein einziges Mal. Der Vergleich der heutigen URL-Liste mit der des Vormonats bringt neu veröffentlichte Seiten, stillschweigend entfernte Seiten und strukturelle Änderungen an der Website zum Vorschein – allesamt nützliche Frühindikatoren sowohl für die SEO-Gesundheit als auch für die Content-Governance.
Häufig gestellte Fragen
Wie findet der Sitemap-URL-Extraktor Links?
Kann ich XML einfügen oder eine Sitemap von einer URL laden?
Was, wenn mein XML ungültig ist oder keine URLs enthält?
Kann ich die extrahierten URLs exportieren?
Ist das Tool kostenlos und sind meine Daten privat?
Verwandte Tools
Machen Sie weiter mit diesen praktischen Tools