Zum Inhalt springen
Glossar

Ein KI-Agent entscheidet, ein Skript wiederholt nur

Beide steuern dieselbe Engine. Der Unterschied liegt darin, wo die Entscheidungen liegen: Ein Skript kodiert sie vorab als Selektoren und Wartezeiten, ein Agent trifft sie zur Laufzeit anhand der aktuellen Seite.

Vier Eigenschaften, die aus diesem Unterschied folgen

Er liest die Seite, statt Selektoren zu treffen


Das Modell erhält eine Darstellung des aktuellen Zustands, meist einen Accessibility-Baum, ein gefiltertes DOM oder einen Screenshot, und wählt eine Aktion. Ein umgestalteter Button, der jeden Selektor bräche, kostet ihn oft nichts.

Gleiche Eingabe, unterschiedliche Durchläufe


Zwei Ausführungen derselben Aufgabe können verschiedene Wege nehmen und beide richtig sein. Jede Annahme einer Testsuite über Determinismus gehört auf den Prüfstand, beginnend bei der Erfolgsprüfung.

Kosten entstehen je Entscheidung, nicht je Schritt


Jeder Zug verbraucht Token für die Seitendarstellung und für die Schlussfolgerung. Eine Seite mit vierzig Zügen kostet etwa das Vierzigfache einer Seite mit einem Zug. Die Größe der Darstellung dominiert die Rechnung.

Die Seite wird zu ungeprüfter Eingabe


Von Dritten gerenderter Text landet im selben Kontextfenster wie Ihre Anweisungen. Diese Angriffsfläche kannte klassische Automatisierung nicht.

Wo die Grenze üblicherweise verläuft

Stabile interne Anwendung, hohes Volumen Skript. Determinismus und Kosten sprechen beide für den Selektor.
Hunderte ähnliche Portale, keines identisch Agent. Hunderte Skripte zu schreiben und zu pflegen ist der teure Teil.
Layout ändert sich ohne Ankündigung Agent, oder ein Skript mit Agent als Rückfallebene bei fehlendem Selektor.
Regulierter Ablauf mit Nachweispflicht Beides, sofern jede Aktion protokolliert wird. Der Nachweis zählt mehr als der Mechanismus.
Typische Züge für Anmeldung und ein Formular Etwa 6 bis 15, je nachdem wie viel Seite je Zug übertragen wird
Wesentlicher Kostentreiber Token für die Seitendarstellung, meist deutlich vor der Schlussfolgerung

Stand: 2026-08-31

Häufige Fragen

Ist ein KI-Agent dasselbe wie Computer Use?

Verwandt, aber enger gefasst. Computer Use übergibt dem Modell den gesamten Desktop samt nativer Anwendungen und Dateisystem. Ein Browser-Agent ist auf einen Browser beschränkt, was den Handlungsraum verkleinert, Fehler nachvollziehbarer macht und die Isolation erheblich vereinfacht.

Ersetzen Agenten Playwright?

Nein, sie setzen darauf auf. Praktisch jedes Agenten-Framework sendet Klicks und Eingaben weiterhin über Playwright, Puppeteer oder das DevTools-Protokoll. Ersetzt wird der Teil Ihres Codes, der entschieden hat, welches Element zu klicken ist.

Warum kostet dieselbe Aufgabe manchmal das Zehnfache?

Weil ein misslungener Durchlauf weiterläuft. Ein verfehltes Element führt zu einem erneuten Versuch, der Versuch fügt einen Zug hinzu, und jeder Zug überträgt die Seite erneut. Eine Obergrenze für Züge je Aufgabe ist die wirksamste Kostenbremse, die den meisten Teams fehlt.

Wie teste ich etwas Nichtdeterministisches?

Prüfen Sie Ergebnisse statt Wege. Ob die Rechnung heruntergeladen wurde, lässt sich feststellen; ob der Agent den dritten Menüpunkt geklickt hat, ist keine sinnvolle Zusicherung, wenn ein anderer Weg gleichwertig ist.

Ihrem Agenten einen Browser geben, den er nicht beschädigt

Sitzungen, die einen fehlgeschlagenen Durchlauf isolieren, Zugangsdaten aus dem Modellkontext halten und den Ablauf protokollieren.