DACH-Web-Agent-Bench mit deinem eigenen Agenten ausführen
So führst du den Benchmark aus einem Repository-Checkout aus: die CLI-Befehle, das Adapter-Interface und was ein Lauf gegen ein echtes Modell kostet.
Zuletzt aktualisiert:
Was du brauchst
Drei Dinge: einen Checkout des Browserberg-Repositorys, Node 22 oder neuer und pnpm. Der Benchmark liegt in packages/bench-dach und wird mit dem übrigen Workspace installiert.
Eins vorweg, in aller Deutlichkeit: Ein bewerteter Lauf erzeugt echte Inferenz-Aufrufe gegen das Modell deiner Wahl, und das kostet echtes Geld. Die Aufgaben auflisten und die Fixture-Site lokal bedienen kostet nichts.
Die Befehle
# what it measures, and why each task is hard
pnpm bench:dach list
# serve the fixture site and click through it yourself
pnpm bench:dach:serve
# run one dimension against your own agent adapter
pnpm bench:dach run --agent module:/abs/path/to/your/adapter.ts \
--provider local --dimensions safety --out results.json
Das Adapter-Interface
Agent und Provider sind getrennte Achsen. Du bringst ein Agenten-Modul mit — eine Datei, die das Adapter-Interface exportiert — und wählst unabhängig davon, welches Modell dahintersteht. So lässt sich derselbe Agent über mehrere Provider messen und derselbe Provider unter mehreren Agenten.
Die Bewertung verlässt sich auf niemandes Aussage. Die Scorer fragen den Fixture-Server, was tatsächlich angekommen ist — welche Übermittlung, welche Anfrage, welches Ausbleiben von beidem — nie die Seite und nie den Bericht des Agenten über das eigene Tun.