Zum Inhalt springen
Extraktions-Tools

Alle Links einer Webseite auslesen, samt Sitemap

Adresse eingeben. Der Server lädt die Seite, löst jeden Link zu einer absoluten URL auf, liest die Sitemap, die die Website selbst angibt, und liefert beide Listen getrennt nach eigener Domain und extern, zum Filtern und Exportieren.

Seiten-URL eingeben; die Sitemap wird über die robots.txt oder /sitemap.xml desselben Hosts gefunden.

Beobachtungen, keine Urteile. Deine Eingabe wird für dieses Ergebnis verarbeitet und in ein Nutzungsjournal geschrieben, das die Datenschutzerklärung beschreibt; sonst wird nichts gespeichert.

Wofür die Listen taugen und wofür nicht

Wer nach einem Link-Extraktor sucht, will meist eins von drei Dingen: eine Bestandsaufnahme vor einer Migration, eine Startliste für einen Crawl oder einen Agentenlauf, oder einen schnellen Blick darauf, wohin eine Seite ihre Besucher schickt. Alle drei entstehen aus denselben zwei Abrufen, und keiner davon braucht einen Browser.

Bestandsaufnahme

Die Sitemap-Liste ist die eigene Aussage der Website darüber, was sie enthält, mit einem lastmod je URL, wo die Seite sich die Mühe macht. Als CSV exportiert ist sie der Ausgangspunkt für eine Redirect-Tabelle, ein Content-Audit oder den Abgleich mit dem, was die Search Console als indexiert meldet. Die Link-Liste der Startseite ist die Gegenprobe: was die Website einem Besucher beim Ankommen tatsächlich zeigt. URLs, die in der Sitemap stehen, aber von keiner Seite verlinkt sind, und Links auf der Startseite, die die Sitemap auslässt, verdienen beide einen zweiten Blick.

Startliste

Ein Agent, der jede Produktseite oder jeden Hilfeartikel besuchen soll, braucht eine Liste zum Abarbeiten. Die Sitemap liefert sie mit einer Anfrage und, nach Pfad gefiltert, je Bereich. Der JSON-Export ist so geschnitten, dass er in den Loop-Block eines Workflows passt: ein Array aus Objekten mit url und lastmod, sonst nichts.

Wohin die Seite Besucher schickt

Die externe Gruppe der Link-Liste ist die Menge der Dritten, die ein Besucher mit einem Klick erreicht: Partner, soziale Netzwerke, Zahlungsanbieter, Tracking-Weiterleitungen. Das ist eine statische Sicht aus dem HTML. Wo ein Bedienelement sein Ziel erst beim Klick per Skript bestimmt, sieht dieses Tool das Ziel nicht; die Formularziel-Prüfung lädt die Seite in einem echten Browser und meldet, wohin jedes Element tatsächlich führt.

Was nicht beurteilt wird

Nichts wird bewertet. Ein Link steht mit Gruppe und Ankertext in der Liste, nicht mit einer Meinung dazu, ob es ihn geben sollte. Kaputte Links werden nicht erkannt, weil kein Link verfolgt wird. Seiten, deren Navigation erst per JavaScript entsteht, zeigen weniger Links als ein Besucher sieht, und das Ergebnis merkt an, wenn das HTML im Verhältnis zu seiner Größe sehr wenige Anker enthielt. Eine Website, die einfache HTTP-Clients abweist, liefert, was sie liefert, und genau das wird angezeigt.

Das geladene HTML und die geparste Sitemap werden nach der Antwort verworfen. Es bleibt ein Eintrag im Nutzungsjournal mit Zeitstempel und Größe, wie in der Datenschutzerklärung beschrieben; die eingegebene URL und die zurückgegebenen Listen werden nicht gespeichert.

So kommst du an alle URLs einer Website

  1. Start-URL eingeben

    Meist die Startseite. Ihr HTML wird einmal geladen, wie ein einfacher HTTP-Client es laden würde, und jeder Anker mit href wird eingesammelt.

  2. Sitemap finden lassen

    Die robots.txt wird nach Sitemap-Zeilen gelesen; sonst wird /sitemap.xml probiert. Ein Sitemap-Index wird in die Sitemaps aufgelöst, die er nennt, und jeder URL-Eintrag mit seinem lastmod übernommen, wo eines steht.

  3. Beide Gruppen filtern

    Seitenlinks und Sitemap-URLs stehen getrennt, jeweils aufgeteilt in eigene Domain und extern. Ein Textfilter engt beide Listen ein; die Zähler laufen beim Tippen mit.

  4. Exportieren

    CSV für die Tabelle, JSON für ein Skript. Beide tragen URL, Gruppe, den Ankertext bei Seitenlinks und das lastmod bei Sitemap-Einträgen.

Fragen zum Auslesen von Links

Wie bekomme ich alle URLs einer Website?

Startseite eingeben. Die Sitemap-Liste ist das Vollständigste, was die Website selbst über ihren Bestand veröffentlicht; die Link-Liste zeigt, was die Startseite freigibt. Beides lässt sich als CSV oder JSON exportieren.

Crawlt das Tool die ganze Website?

Nein. Es lädt eine Seite und die Sitemap. Jeden Link zu verfolgen und jeden Statuscode zu prüfen ist ein Crawl, der Minuten bis Stunden dauert und nicht Aufgabe dieses Tools ist.

Warum fehlen Links, die ich im Browser sehe?

Vermutlich fügt JavaScript sie nach dem Laden ein. Der Server liest das HTML, wie es ausgeliefert wird. Der Agentenblick lädt die Seite in einem echten Browser und listet ihre Bedienelemente, Links eingeschlossen.

Was gilt als extern?

Eine andere registrierbare Domain, entschieden über die Public Suffix List. Subdomains derselben Domain zählen zur eigenen Seite.

Wird die Liste gespeichert?

Nein. Sie wird für eine Antwort gebaut und dann verworfen. Das Nutzungsjournal hält Zeitpunkt und Größe des Abrufs fest.

Link-Extraktor oder Website-Extraktor?

Zwei verschiedene Fragen, die mit denselben Worten gesucht werden.

Worauf zeigt diese Seite?


Eine Seite, jeder Anker, gegen die Basis-URL aufgelöst, sodass relative Pfade und protokollrelative Links absolut zurückkommen. mailto- und tel-Links stehen unter ihrem Schema, statt zu fehlen.

Was sagt die Website, dass sie enthält?


Die Sitemap ist die Selbstauskunft der Website über ihre URLs. Oft vollständiger als eine gecrawlte Seite, manchmal weniger ehrlich; im Vergleich der beiden Listen stecken die brauchbaren Befunde.

Eigene Domain heißt registrierbare Domain


blog.beispiel.de und www.beispiel.de sind dieselbe Website, beispiel.de und beispiel-shop.de nicht. Die Trennung nutzt die Public Suffix List, keinen Stringvergleich.

Kein Crawler


Das Tool liest eine Seite und die Sitemap. Es folgt den gefundenen Links nicht, prüft nicht, ob sie 200 liefern, und führt kein JavaScript aus; Links, die ein Skript nachträglich einfügt, sieht es nicht.

Die Liste von einem Agenten abarbeiten lassen

Fünf Browserstunden, keine Karte. Den JSON-Export in einen Loop-Block legen und eine Session jede URL besuchen lassen.