Webseite zu Text: den Inhalt einer URL als Text oder Markdown holen
Link einfügen, Format wählen. Ein Server in der EU lädt die Seite, wirft Navigation, Cookie-Hinweis und Footer weg und gibt den eigentlichen Inhalt als Text oder Markdown zurück, mit einer Tokenschätzung, damit du weißt, was der Text im Prompt kostet.
Gib die URL eines Artikels, einer Doku-Seite oder einer Produktseite ein und wähle Text oder Markdown.
Beobachtungen, keine Urteile. Deine Eingabe wird für dieses Ergebnis verarbeitet und in ein Nutzungsjournal geschrieben, das die Datenschutzerklärung beschreibt; sonst wird nichts gespeichert.
In drei Schritten von der URL zum Text
-
URL einfügen
Jede öffentliche http- oder https-Adresse. Weiterleitungen werden verfolgt; die endgültige URL steht im Ergebnis, damit klar ist, welche Seite tatsächlich gelesen wurde.
-
Text oder Markdown wählen
Markdown behält Überschriften, Listen, Tabellen und Links und passt in einen Prompt oder eine Wissensbasis. Text ist für Suchindizes, Diffs und alles, was keine Formatierung tragen soll.
-
Kopieren, herunterladen oder im Agentenblick öffnen
Fällt das Ergebnis dünn aus, weil die Seite JavaScript braucht, lädt der Knopf zum Agentenblick dieselbe URL in einem echten EU-Browser und zeigt, was ein Agent dort liest.
Was der Server sieht und was nicht
Das ist das schnellste Tool auf dieser Seite, weil es am wenigsten tut. Der Server ruft die URL wie ein gewöhnlicher HTTP-Client ab, parst das HTML, entscheidet, welcher Teil des Dokuments Inhalt und welcher Teil Mobiliar ist, und serialisiert den Inhalt als Text oder Markdown. Kein Browser startet, kein Skript der Seite läuft. Deshalb kommt bei den meisten Seiten die Antwort in deutlich unter einer Sekunde, und deshalb kommt bei manchen Seiten fast nichts.
Was behalten wird
Die Inhaltsheuristik bewertet Blöcke des Dokuments nach Textdichte, Linkdichte und Position, so wie es Readability-artige Extraktoren seit fünfzehn Jahren tun. Überschriften, Absätze, Listen, Zitate, Tabellen und Codeblöcke innerhalb der gewinnenden Region bleiben. Der Markdown-Modus erhält ihre Struktur mit ATX-Überschriften, GFM-Tabellen und eingezäuntem Code; der Textmodus macht Absätze mit Leerzeilen daraus. Menüs, Cookie-Hinweise, Teilen-Leisten, Artikelempfehlungen und Footer fallen weg. Bilder werden durch ihren Alt-Text ersetzt, wo einer existiert, sonst durch nichts.
Die Tokenschätzung
Die Zahl neben der Ausgabe ist Zeichen geteilt durch vier und heißt absichtlich Schätzung. Tokenizer unterscheiden sich je Modell, und deutscher Text mit langen Komposita tokenisiert schlechter als englischer. Die Zahl soll den Unterschied zwischen einem Artikel mit 2.000 Tokens und einem Forenthread mit 40.000 sichtbar machen, bevor einer von beiden im Kontextfenster landet, nicht als Abrechnungsgrundlage dienen.
Wo das Tool an seine Grenze kommt
Eine Seite, die ihren Inhalt erst per JavaScript nachlädt, eine Seite hinter einem Login, eine Seite, die statt des Artikels eine Consent-Wand ausliefert, bis jemand klickt: Alle drei liefern ein Gerippe, weil der Server sieht, was ein Client ohne JavaScript sieht. Das Ergebnis sagt das, wenn der extrahierte Inhalt im Verhältnis zum HTML verdächtig kurz ist, und bietet an, dieselbe URL im Agentenblick zu öffnen. Der lädt sie in einem echten Browser, beantwortet das Cookie-Banner und liest die Seite so, wie ein Agent sie liest. Das kostet eine Browser-Session und ein paar Sekunden; dieser Weg hier kostet nur einen Abruf.
Transkribiert wird nicht. Ein Link auf ein Video, einen Podcast oder ein PDF liefert den Text, der auf der Seite um das Medium herumsteht, meist Titel und Beschreibung. Das Medium selbst wird nicht geladen.
Nichts bleibt liegen
Das geladene HTML und der extrahierte Text existieren für die Dauer einer Anfrage. Das Nutzungsjournal hält fest, dass ein Abruf stattfand, wann und wie groß die Antwort war, wie in der Datenschutzerklärung beschrieben. Die eingegebene URL und der zurückgegebene Text werden nirgends geschrieben.
Fragen zum Text aus einer Webseite
Wie bekomme ich den Text einer Webseite ohne Kopieren und Einfügen?
URL oben eintragen. Der Server lädt die Seite und gibt den Hauptinhalt als Text oder Markdown zurück, Menüs, Cookie-Hinweis und Footer sind dann schon entfernt.
Funktioniert das bei Seiten, die Inhalte per JavaScript laden?
Nicht allein: Der Server liest das HTML, wie es ausgeliefert wird, ohne Skripte auszuführen. Fällt das Ergebnis dünn aus, bietet das Tool an, dieselbe URL im Agentenblick mit einem echten Browser zu öffnen.
Kann ich einen Video-Link in Text umwandeln?
Nein. Zurück kommt der Text, der auf der Seite um das Video steht, meist Titel und Beschreibung. Audio oder Video wird weder geladen noch transkribiert.
Wie genau ist die Tokenzahl?
Zeichen geteilt durch vier, als Schätzung gekennzeichnet. Die echte Zahl hängt vom Tokenizer des Modells und von der Sprache ab; Deutsch braucht meist mehr Tokens pro Wort als Englisch.
Werden URL oder Text gespeichert?
Nein. Beides existiert für eine Anfrage. Das Nutzungsjournal hält Zeitpunkt und Größe des Abrufs fest, sonst nichts.
Und Seiten hinter einem Login?
Der Server hat kein Konto und sieht die Login-Seite. Für deine eigenen Portale kann eine Browserberg-Session mit Zugangsdaten aus dem Tresor anmelden und dieselbe Extraktion als Workflow-Schritt laufen lassen.
Wohin der Text üblicherweise geht
In einen Prompt
Markdown ohne Beiwerk ist die günstigste treue Darstellung eines Artikels für ein Modell. Die Tokenschätzung sagt vor dem Einfügen, ob er passt.
In einen Retrieval-Index
Text mit Überschriften als eigene Zeilen lässt sich sauber in Chunks schneiden. Navigation und Footer, die sonst bei jeder Anfrage mitgefunden würden, sind schon weg.
In einen Diff
Dieselbe URL zweimal im Abstand einer Woche laden und die Texte vergleichen: Änderungen am Inhalt sind sichtbar, Änderungen am Theme, am Menü oder an der Werbung nicht.
In einen geplanten Workflow
Braucht die Seite Login oder Browser, läuft dieselbe Extraktion in einer Browserberg-Session nach Zeitplan, und das Ergebnis geht an deinen Endpunkt.
Passende Tools
Wenn die Seite einen Browser oder einen Login braucht
Fünf Browserstunden, keine Karte. Dieselbe Extraktion in einer Session, die sich anmeldet, das Banner beantwortet und auf das Skript wartet.