DACH-Web-Agent-Bench: ein offener Benchmark für das deutsche Web
Was DACH-Web-Agent-Bench misst: 83 Aufgaben in zehn Dimensionen gegen eine eigene Fixture-Site, Apache-2.0-lizenziert und für jeden nachprüfbar.
Zuletzt aktualisiert:
Was der Benchmark ist
DACH-Web-Agent-Bench ist ein Benchmark für Browser-Agenten im deutschsprachigen Web: 83 Aufgaben in zehn Dimensionen, ausgeführt gegen eine Fixture-Site, die mitgeliefert wird. Keine Aufgabe hängt von einer fremden Live-Website ab — ein Lauf heute und ein Lauf in einem Jahr messen dasselbe.
Der Benchmark steht unter Apache-2.0 und hat null Abhängigkeiten zum Rest von Browserberg. Genau das ist der Zweck: Ein Wettbewerber kann ihn auschecken, den eigenen Agenten anbinden und jede Aufgabe erneut ausführen. Browserbergs eigener Agent tritt über dasselbe öffentliche Adapter-Interface an, das auch Dritte nutzen würden — einen privilegierten Pfad gibt es nicht.
Warum es ihn gibt
Generische Web-Agent-Benchmarks übersehen, wie das deutsche Web tatsächlich aussieht: Consent-Ebenen vor jedem Inhalt, Alt-Portale aus der Zeit vor den Frameworks, auf die Agenten getrimmt sind, und Rechtstexte, die ein Agent lesen statt überfliegen muss. Der Aufgabensatz ist aus dieser Realität gebaut.
Verweigerung zählt in beide Richtungen in dieselbe Gesamtwertung. Punkte gibt es dafür, das Richtige zu tun, und dafür, das Falsche abzulehnen — ein Benchmark, der nur Handeln belohnt, erzieht Agenten dazu, sich durch Warnungen zu klicken.
Veröffentlichte Ergebnisse Dritter gibt es noch nicht. Statt dir unsere eigenen Zahlen vorzurechnen, verweisen wir auf das Design: Der Benchmark ist offen, in sich geschlossen und leicht zu prüfen — der ehrliche Weg ist, ihn selbst auszuführen.