Zum Inhalt springen
Tool

Was sieht ein KI-Agent auf deiner Seite?

Keine Pixel. Ein Browser-Agent liest einen Baum aus Rollen, Namen und Bedienelementen und bezahlt dafür in Tokens. Dieses Tool lädt deine URL in einem Chromium in der EU und zeigt diesen Baum in drei Stufen neben dem Screenshot, den ein Mensch sähe.

Öffentliche URL eingeben. Der Scan öffnet sie in einem frischen Browser, wartet, bis die Seite ruhig ist, und liefert Baum, Bedienelemente und Screenshot.

Diese Prüfung öffnet einen echten Browser auf unseren Servern und braucht JavaScript in deinem.

Beobachtungen, keine Urteile. Deine Eingabe wird für dieses Ergebnis verarbeitet und in ein Nutzungsjournal geschrieben, das die Datenschutzerklärung beschreibt; sonst wird nichts gespeichert.

Das Ergebnis lesen

  1. Drei Stufen vergleichen

    full behält jeden Knoten mit Text, economy klappt Dekoration und Wiederholungen zusammen, lean behält Bedienelemente und Überschriften. Jeder Reiter zeigt Zeichen, Zeilen und geschätzte Tokens.

  2. Tabelle der Bedienelemente

    Eine Zeile je interaktivem Element: codierte Id, Rolle, zugänglicher Name, ob überhaupt ein Name da ist, und ob es nur per Skript klickbar ist.

  3. Begründung der Klickbarkeit

    Ein Element gilt aus einem genannten Grund als klickbar oder nicht: verdeckt, ohne Größe, deaktiviert, außerhalb des Fensters. Der Grund ist das, was du behebst.

  4. Baum gegen Screenshot halten

    Was du im Bild siehst und im Baum nicht findest, existiert für einen Agenten nicht. Meist ein reiner Icon-Button, ein div mit onclick oder Text auf einem Canvas.

Wofür die Spalten gut sind

hasAccessibleName


Die nützlichste Spalte für Entwickler. Ein Agent, der ein Element über seinen Namen anspricht, kann keins ansprechen, das keinen hat.

jsClickable


Reagiert nur über einen Skript-Handler. Ein Agent kann es noch nutzen, ein Screenreader kann es nicht benennen, eine Tastatur nicht erreichen.

Grund für nicht klickbar


Verdeckt heißt: Am Mittelpunkt des Elements trifft der Treffertest etwas anderes. Ein Overlay, ein Cookie-Banner, ein Chat-Widget.

Tokens je Stufe


Zeichen geteilt durch vier, als Schätzung gekennzeichnet. Gut genug, um Seiten und Stufen miteinander zu vergleichen, nicht mehr.

Wie die Sicht entsteht

Der Scan führt den Agent-View-Bericht in einer normalen Browserberg-Session aus, ohne Modell. Ein Container startet, Chromium lädt die URL, und die Wahrnehmungsschicht, derselbe browserseitige Code, der jeden Agentenlauf versorgt, geht durch den lebenden DOM und baut den Baum. Es ist derselbe Code, keine Nachbildung, und genau das ist der Sinn: Was du hier liest, bekäme ein Agent in die Hand.

Rollen und Namen statt Tags

Der Baum entsteht aus der Zugänglichkeitssemantik der Seite, nicht aus Tag-Namen. Ein div mit role=button und aria-label ist ein Button mit Namen; ein button, der nur ein SVG enthält, ist ein Button ohne. Auf deutschen Portalen ist das zweite erstaunlich häufig: Lupe, Warenkorb, Zahnrad, alles als Icon ohne Text, und der Agent rät positionsbasiert.

Klickbarkeit aus vier Signalen

Ob ein Element klickbar ist, wird aus vier Signalen entschieden, und der Grund wird protokolliert, statt in einem Boolean zu verschwinden. Erreichbarkeit ist ein Treffertest am Punkt des Elements, document.elementFromPoint, kein Vergleich von Rechtecken. Ein Button unter einem transparenten Overlay hat eine tadellose Bounding Box und lässt sich trotzdem nicht klicken. Die Rechteck-Variante wurde verworfen, weil sie verdeckte Elemente als erreichbar meldet.

Drei Stufen

Ein Agent braucht nicht immer die ganze Seite. full liest der Verifizierer, wenn er beurteilt, ob eine Aufgabe erledigt ist; economy ist das, wogegen ein Schritt meist plant; lean ist das, was ein langer Lauf zwischen Schritten im Kontext behält. Alle drei nebeneinander zeigen, was auf jeder Stufe verloren geht und ob das Element, um das es dir geht, bis lean überlebt.

Die Tokenschätzung

Die Zahl neben jeder Stufe ist Zeichen durch vier. Echte Tokenizer unterscheiden sich nach Modell und Sprache, und deutsche Komposita tokenisieren schlechter als Englisch. Für den Vergleich von Seiten und Stufen reicht es. Eine Seite, deren lean-Sicht noch achttausend Tokens kostet, sagt etwas über ihre Struktur.

Was das Tool nicht beurteilt

Es berichtet Struktur, keine Qualität. Eine Seite mit kleinem, gut benanntem Baum ist für einen Agenten leichter, aber das Tool vergibt keine Note, kein Ranking, keinen Vergleich mit anderen. Es sieht die Seite, wie sie nach dem Laden zur Ruhe kam, in einem frischen Profil mit EU-Adresse. Was hinter einem Login, einer Geo-Weiterleitung oder einer späteren Interaktion liegt, fehlt. Ein Cookie-Banner ist Teil der Seite und steht im Baum, so wie der Agent es anträfe. Und der Screenshot dient dem Vergleich, nicht als Beleg: Ein Agent liest ihn nicht.

Derselbe Bericht aus der eigenen Session

from browserberg import Browserberg

bb = Browserberg(api_key=API_KEY)

with bb.sessions.create() as s:
    view = s.agent_view("https://www.beispiel.de/")
    for v in view["views"]:
        print(v["fidelity"], v["chars"], v["lines"])
    ohne_namen = [c for c in view["controls"] if not c["hasAccessibleName"]]
    print(len(ohne_namen), "Bedienelemente ohne Namen")

Fragen zur Agenten-Sicht

Sieht ein KI-Agent die Seite wie ein Mensch?

In der Regel nicht. Die meisten Browser-Agenten lesen einen Textbaum aus Rollen, Namen und Bedienelementen, abgeleitet aus DOM und Zugänglichkeitssemantik; Screenshots sind bei manchen Systemen eine Ergänzung. Dieses Tool zeigt den Baum, den Browserberg-Agenten lesen.

Wie viele Tokens kostet eine Webseite?

Das schwankt um Größenordnungen. Eine saubere Produktseite liegt bei lean vielleicht bei zweitausend Tokens; eine Portal-Startseite mit Mega-Menüs kann bei full dreißigtausend überschreiten. Das Tool schätzt je Stufe, damit du vergleichen kannst.

Warum steht mein Button auf nicht klickbar?

Die Grund-Spalte sagt, welches der vier Signale fehlt. Häufig: ein Overlay über dem Mittelpunkt, eine Box ohne Größe, ein disabled-Attribut, eine Position außerhalb des Viewports.

Geht das auch hinter einem Login?

Nicht mit dem öffentlichen Tool. Derselbe Bericht steht in deiner eigenen Session nach einem Tresor-Login zur Verfügung, im SDK als agent_view.

Wird das Ergebnis gespeichert?

Die URL landet im Nutzungsjournal, das die Tagesgrenze hält. Baum, Tabelle und Screenshot existieren in deinem Tab und werden mit der Session freigegeben.

Den Baum jeder Seite lesen, die du automatisierst

Fünf Browserstunden, keine Karte. agent_view aus der eigenen Session, auch hinter Logins.