Zum Inhalt springen

Benchmark: Agenten am deutschen Web messen

Der Benchmark-Bereich: was DACH-Web-Agent-Bench abdeckt, wie du ihn gegen deinen eigenen Agenten-Adapter ausführst und wie die Wertung funktioniert.

DACH-Web-Agent-Bench ist Browserbergs offener Benchmark für Browser-Agenten im deutschsprachigen Web — 83 Aufgaben, zehn Dimensionen, eine mitgelieferte Fixture-Site und ein Adapter-Interface, das unseren Agenten und deinen gleich behandelt. Dieser Bereich beschreibt, was gemessen wird, wie du den Benchmark aus einem Checkout startest und wie die Wertung so gebaut ist, dass du keinem Ergebnis blind glauben musst.

Alle Seiten in diesem Abschnitt

  1. 1

    DACH-Web-Agent-Bench: ein offener Benchmark für das deutsche Web

    Was DACH-Web-Agent-Bench misst: 83 Aufgaben in zehn Dimensionen gegen eine eigene Fixture-Site, Apache-2.0-lizenziert und für jeden nachprüfbar.

  2. 2

    DACH-Web-Agent-Bench mit deinem eigenen Agenten ausführen

    So führst du den Benchmark aus einem Repository-Checkout aus: die CLI-Befehle, das Adapter-Interface und was ein Lauf gegen ein echtes Modell kostet.

  3. 3

    Benchmark-Methodik: zehn Dimensionen und das Orakel-Design

    Die zehn Aufgaben-Dimensionen, warum der Fixture-Server das einzige Orakel ist, dem ein Scorer traut, und wie Verweigerung in dieselbe Wertung eingeht.