Zum Inhalt springen

DACH-Web-Agent-Bench mit deinem eigenen Agenten ausführen

So führst du den Benchmark aus einem Repository-Checkout aus: die CLI-Befehle, das Adapter-Interface und was ein Lauf gegen ein echtes Modell kostet.

Zuletzt aktualisiert:

Was du brauchst

Drei Dinge: einen Checkout des Browserberg-Repositorys, Node 22 oder neuer und pnpm. Der Benchmark liegt in packages/bench-dach und wird mit dem übrigen Workspace installiert.

Eins vorweg, in aller Deutlichkeit: Ein bewerteter Lauf erzeugt echte Inferenz-Aufrufe gegen das Modell deiner Wahl, und das kostet echtes Geld. Die Aufgaben auflisten und die Fixture-Site lokal bedienen kostet nichts.

Die Befehle

bench
# what it measures, and why each task is hard
pnpm bench:dach list

# serve the fixture site and click through it yourself
pnpm bench:dach:serve

# run one dimension against your own agent adapter
pnpm bench:dach run --agent module:/abs/path/to/your/adapter.ts \
    --provider local --dimensions safety --out results.json

Das Adapter-Interface

Agent und Provider sind getrennte Achsen. Du bringst ein Agenten-Modul mit — eine Datei, die das Adapter-Interface exportiert — und wählst unabhängig davon, welches Modell dahintersteht. So lässt sich derselbe Agent über mehrere Provider messen und derselbe Provider unter mehreren Agenten.

Die Bewertung verlässt sich auf niemandes Aussage. Die Scorer fragen den Fixture-Server, was tatsächlich angekommen ist — welche Übermittlung, welche Anfrage, welches Ausbleiben von beidem — nie die Seite und nie den Bericht des Agenten über das eigene Tun.

Wie es weitergeht

  • Methodik Wie die zehn Dimensionen bewertet werden — und von welchem Orakel
  • Überblick Was der Benchmark ist und warum es ihn gibt