Erster offener Benchmark-Datensatz BenGER für deutsche juristische Argumentation veröffentlicht

Mit BenGER (Benchmark for German Law) steht ein offener Benchmark-Datensatz zur Verfügung, der die Leistung aktueller Large Language Models bei subsumtionsbasierter juristischer Argumentation im deutschen Recht prüft. Im Mittelpunkt steht die Falllösung im Gutachtenstil, wie sie in Studium und Staatsexamen verlangt wird.

BenGER umfasst 581 klausurartige Falllösungsaufgaben aus der Zeitschrift für das juristische Studium (ZJS) sowie 15 weitere Fälle aus dem Benchathon im Frühjahr 2026. Hinzu kommen 531 händisch erstellte kurze Aufgaben zu juristischen Grundprinzipien. Der Datensatz enthält menschliche Vergleichslösungen in klassischer Form und Lösungen, die gemeinsam mit KI erstellt wurden. Bewertet wurden zwölf LLM-Systeme mit einem rubrikbasierten LLM-as-a-Judge, der auf Grundlage der Benchathon-Daten mit menschlichen Korrekturen statistisch validiert wurde.

Der Datensatz soll Universitäten, Studierenden und Forschung ein offenes und reproduzierbares Werkzeug für die Evaluation juristischer KI-Systeme bereitstellen.

Datensatz-PaperDatensatz

PlattformCode