Ein KI-Agent entscheidet, ein Skript wiederholt nur
Beide steuern dieselbe Engine. Der Unterschied liegt darin, wo die Entscheidungen liegen: Ein Skript kodiert sie vorab als Selektoren und Wartezeiten, ein Agent trifft sie zur Laufzeit anhand der aktuellen Seite.
Vier Eigenschaften, die aus diesem Unterschied folgen
Er liest die Seite, statt Selektoren zu treffen
Das Modell erhält eine Darstellung des aktuellen Zustands, meist einen Accessibility-Baum, ein gefiltertes DOM oder einen Screenshot, und wählt eine Aktion. Ein umgestalteter Button, der jeden Selektor bräche, kostet ihn oft nichts.
Gleiche Eingabe, unterschiedliche Durchläufe
Zwei Ausführungen derselben Aufgabe können verschiedene Wege nehmen und beide richtig sein. Jede Annahme einer Testsuite über Determinismus gehört auf den Prüfstand, beginnend bei der Erfolgsprüfung.
Kosten entstehen je Entscheidung, nicht je Schritt
Jeder Zug verbraucht Token für die Seitendarstellung und für die Schlussfolgerung. Eine Seite mit vierzig Zügen kostet etwa das Vierzigfache einer Seite mit einem Zug. Die Größe der Darstellung dominiert die Rechnung.
Die Seite wird zu ungeprüfter Eingabe
Von Dritten gerenderter Text landet im selben Kontextfenster wie Ihre Anweisungen. Diese Angriffsfläche kannte klassische Automatisierung nicht.
Wo die Grenze üblicherweise verläuft
| Stabile interne Anwendung, hohes Volumen | Skript. Determinismus und Kosten sprechen beide für den Selektor. |
|---|---|
| Hunderte ähnliche Portale, keines identisch | Agent. Hunderte Skripte zu schreiben und zu pflegen ist der teure Teil. |
| Layout ändert sich ohne Ankündigung | Agent, oder ein Skript mit Agent als Rückfallebene bei fehlendem Selektor. |
| Regulierter Ablauf mit Nachweispflicht | Beides, sofern jede Aktion protokolliert wird. Der Nachweis zählt mehr als der Mechanismus. |
| Typische Züge für Anmeldung und ein Formular | Etwa 6 bis 15, je nachdem wie viel Seite je Zug übertragen wird |
| Wesentlicher Kostentreiber | Token für die Seitendarstellung, meist deutlich vor der Schlussfolgerung |
Stand: 2026-08-31
Häufige Fragen
Ist ein KI-Agent dasselbe wie Computer Use?
Verwandt, aber enger gefasst. Computer Use übergibt dem Modell den gesamten Desktop samt nativer Anwendungen und Dateisystem. Ein Browser-Agent ist auf einen Browser beschränkt, was den Handlungsraum verkleinert, Fehler nachvollziehbarer macht und die Isolation erheblich vereinfacht.
Ersetzen Agenten Playwright?
Nein, sie setzen darauf auf. Praktisch jedes Agenten-Framework sendet Klicks und Eingaben weiterhin über Playwright, Puppeteer oder das DevTools-Protokoll. Ersetzt wird der Teil Ihres Codes, der entschieden hat, welches Element zu klicken ist.
Warum kostet dieselbe Aufgabe manchmal das Zehnfache?
Weil ein misslungener Durchlauf weiterläuft. Ein verfehltes Element führt zu einem erneuten Versuch, der Versuch fügt einen Zug hinzu, und jeder Zug überträgt die Seite erneut. Eine Obergrenze für Züge je Aufgabe ist die wirksamste Kostenbremse, die den meisten Teams fehlt.
Wie teste ich etwas Nichtdeterministisches?
Prüfen Sie Ergebnisse statt Wege. Ob die Rechnung heruntergeladen wurde, lässt sich feststellen; ob der Agent den dritten Menüpunkt geklickt hat, ist keine sinnvolle Zusicherung, wenn ein anderer Weg gleichwertig ist.
Ihrem Agenten einen Browser geben, den er nicht beschädigt
Sitzungen, die einen fehlgeschlagenen Durchlauf isolieren, Zugangsdaten aus dem Modellkontext halten und den Ablauf protokollieren.