Zum Inhalt springen
Extraktions-Tools

HTML in Markdown umwandeln, direkt im Browser

Markup einfügen oder eine .html-Datei ablegen. Überschriften, Listen, Links, Bilder, Codeblöcke und Tabellen kommen als Markdown heraus, Skripte und Styles nicht, und die Tokenschätzung sagt, was das Ergebnis im Prompt kostet. Die Umwandlung läuft auf deinem Rechner; hochgeladen wird nichts.

Fragment oder ganzes Dokument einfügen; eine auf das Feld gezogene Datei wird lokal gelesen.

Dieses Tool läuft im Browser und braucht JavaScript.

Beobachtungen, keine Urteile. Deine Eingabe wird für dieses Ergebnis verarbeitet und in ein Nutzungsjournal geschrieben, das die Datenschutzerklärung beschreibt; sonst wird nichts gespeichert.

Was der Konverter behält, verwirft und nicht wissen kann

Markdown ist eine kleinere Sprache als HTML, also ist jeder Konverter eine Reihe von Entscheidungen darüber, was bleibt. Dieser ist auf einen Zweck ausgelegt: Text zu erzeugen, den ein Modell gut liest und den ein Mensch noch bearbeiten kann. Das verschiebt ihn Richtung Struktur und weg von Darstellung.

Bleibt

Überschriften h1 bis h6 werden ATX-Überschriften. Absätze, nummerierte und unnummerierte Listen mit Verschachtelung, Zitate, Trennlinien, Links mit href, Bilder mit Alt-Text und src, Hervorhebung und Fettdruck, Inline-Code und Zeilenumbrüche innerhalb eines Absatzes haben eine direkte Entsprechung und bekommen sie. Tabellen werden zu GFM-Tabellen, mit der Kopfzeile aus thead oder aus der ersten Zeile mit th-Zellen und dem Zellinhalt auf eine Zeile geglättet, weil eine Markdown-Tabelle keinen Absatz aufnehmen kann. Eingezäunte Codeblöcke tragen die Sprache, wenn die Klasse am code-Element eine nennt, nach der Konvention language-x oder lang-x.

Fällt weg

script, style, noscript, template, iframe und object werden mit Inhalt entfernt, Kommentare ebenfalls. Inline-Styles, Klassen, IDs und data-Attribute haben in Markdown keine Entsprechung und verschwinden, und genau darum geht es: Das HTML einer Seite ist oft zehnmal so groß wie ihr Inhalt, und fast der ganze Unterschied ist Markup, das ein Modell nicht braucht. Leere Elemente und Folgen von Leerraum kollabieren.

Kann nicht wissen

Der Konverter lädt nichts nach. Relative Links bleiben relativ, weil er die Basis-URL nicht kennt, sofern das Dokument kein base-Element trägt. Per URL referenzierte Bilder bleiben Referenzen. Inhalt, den ein Skript eingefügt hätte, ist nicht da, weil kein Skript läuft. Und der Konverter hat keine Meinung dazu, welcher Teil einer Seite der Artikel ist: Fügst du eine ganze Seite ein, bekommst du die ganze Seite als Markdown, Navigation und Footer inklusive. Diese Entscheidung trifft das Tool Webseite zu Text, für eine URL statt für eingefügtes Markup.

Im Browser

Die Umwandlung ist eine reine Funktion über die eingefügte Zeichenkette und läuft vollständig in der Seite. Keine Anfrage transportiert das HTML, keine das Markdown; das lässt sich im Netzwerk-Panel nachsehen. Nichts wird gespeichert, und mit dem Schließen des Tabs ist die Eingabe weg. Deshalb funktioniert das Tool nach dem Laden der Seite auch offline, und deshalb gibt es keine Größengrenze außer der, die dein Browser-Tab verkraftet.

Die Tokenzahl ist Zeichen geteilt durch vier, und das Etikett sagt Schätzung, weil es eine ist. Tokenizer unterscheiden sich zwischen Modellen, Markdown-Syntaxzeichen tokenisieren anders als Fließtext, und Tabellen kosten mehr Tokens, als ihr Text vermuten lässt, weil jeder Strich und jeder Bindestrich ein Token ist. Nutze die Zahl, um zwei Fassungen desselben Dokuments zu vergleichen, nicht als Abrechnung.

Wo umgewandeltes Markdown landet

Prompts und Systemkontext


Dokumentation, Richtlinien und Produktbeschreibungen kosten als Markdown einen Bruchteil des HTML und behalten die Struktur, an der sich ein Modell orientiert.

Wissensdatenbanken und Wikis


Alte HTML-Hilfeseiten wandern mit intakten Überschriften und Tabellen in ein Markdown-basiertes System, bereit für die Überarbeitung von Hand.

Versionsverwaltung


Markdown lässt sich zeilenweise vergleichen. Eine Änderung an einem Absatz erscheint als geänderte Zeile, nicht als geänderter Markup-Klumpen.

Extraktions-Pipelines


In einer Browserberg-Session liefert der Agentenblick schon eine strukturierte Lesung einer lebenden Seite; dieser Konverter ist für Markup, das du bereits hast.

HTML zu md in drei Schritten

  1. Einfügen oder ablegen

    Ein Fragment, eine ganze Seite mit head und body oder eine gespeicherte .html-Datei. Der head wird ignoriert, der body umgewandelt.

  2. Tabellen und Code prüfen

    Tabellen werden zu GFM-Pipe-Tabellen, wenn jede Zeile gleich viele Zellen hat, und zu verschachtelten Listen, wenn nicht. pre und code werden eingezäunte Blöcke mit der Sprache aus der Klasse, wo eine gesetzt ist.

  3. Kopieren oder herunterladen

    Das Ergebnis geht in die Zwischenablage oder in eine .md-Datei. Die Tokenschätzung daneben ist Zeichen geteilt durch vier und heißt Schätzung, weil sie eine ist.

Fragen zur Umwandlung von HTML in Markdown

Wie wandle ich HTML in Markdown um?

Markup oben einfügen oder Datei ablegen. Daneben erscheint das Markdown mit Überschriften, Listen, Links und Tabellen; Skripte und Styles sind entfernt. Kopieren oder als .md herunterladen.

Kommt das Tool mit Tabellen zurecht?

Ja, als GFM-Pipe-Tabellen, wenn die Zeilen regelmäßig sind. Zellen werden auf eine Zeile geglättet. Unregelmäßige Tabellen mit verbundenen Zellen werden verschachtelte Listen, die das Raster verlieren, aber den Text behalten.

Wird mein HTML hochgeladen?

Nein. Die Umwandlung läuft im Browser-Tab. Du kannst beim Konvertieren das Netzwerk-Panel beobachten und siehst keine Anfrage.

Kann das Tool eine URL umwandeln?

Dieses nicht; es lädt nichts. Das Tool Webseite zu Text nimmt eine URL, extrahiert den Hauptinhalt und liefert Markdown.

Warum weicht die Tokenzahl von der meines Modells ab?

Sie ist Zeichen geteilt durch vier. Jeder Tokenizer ist anders, und Markdown-Satzzeichen tokenisieren anders als Fließtext. Nimm die Zahl zum Vergleichen von Fassungen, nicht als Rechnung.

Lebende Seiten genauso lesen

Fünf Browserstunden, keine Karte. Der observe-Aufruf einer Session liefert eine strukturierte Lesung jeder Seite, die ein Agent erreicht, Login inklusive.