Ein Projekt der Statika · statika.ai
Statika

StatikBench

Der erste deutschsprachige LLM-Benchmark für Baunormen und normbasierte Tragwerksbemessung. Ein Messinstrument für Sprachmodelle im Bauwesen (DE · AT · CH).

5.888 Aufgaben 11 Subtracks 43.480 Lösungsfelder ✓ SOFiSTiK 2024 · 2026 ✓ PyNite · anaStruct Lizenzpflichtig
q M(x) L₁ L₂ L₃ 4.888 Aufgaben · 39.104 Felder
Warum

Die Lücke, die StatikBench schließt

Für chinesische Baunormen gibt es AECBench, für US-Codes den PE Civil Bench, und zur dänischen Bauordnung BR18 existieren erste Evaluierungen. Für DIN, die Nationalen Anhänge der Eurocodes, ÖNORM und SIA gab es bisher keinen Vergleichstest. StatikBench schließt diese Lücke.

Der Datensatz besteht aus 5.888 vollständig synthetischen, seed-reproduzierbaren Aufgaben. Jede Musterlösung wird deterministisch gerechnet und anschließend mehrfach unabhängig gegengerechnet. Normen werden ausschließlich referenziert, nie im Wortlaut wiedergegeben.

5.888Aufgaben in vier Aufgabenbereichen
138Negativ-Items für die Halluzinationsmessung
2.821Felder durch SOFiSTiK bestätigt
0,0002 %Median-Abweichung Balkenstatik
Aufgabenbereiche

Vier Bereiche, elf Subtracks

BereichSubtracksAufgabenGeltung
LastannahmenWind (EC1-1-4/NA) · Schnee (EC1-1-3/NA) · Erdbeben (EC8/NA)320DE
BalkenstatikEinfeldträger · Kragarm · Zweifeld-Durchlaufträger360DE · AT · CH
Balkenstatik, statisch unbestimmtDreifeld-Durchlaufträger, unsymmetrisch belastet4.888DE · AT · CH
BemessungEC3-Biegeknicken · EC5-Holzbau · EC2-Stahlbeton (zwei Nachweisarten)320DE
Negativ-Items als Sicherheitsmetrik. In 138 Aufgaben fehlt bewusst eine zur Lösung nötige Angabe, die richtige Antwort ist dort „keine Angabe möglich". Ein Modell, das trotzdem Zahlen liefert, erfindet Lastannahmen. Daraus entsteht die Halluzinationsrate: die Kennzahl, die für Tragwerksplanerinnen und Tragwerksplaner zählt.
Verifikation

Jede Musterlösung mehrfach unabhängig bestätigt

Ein Benchmark taugt nur so viel wie seine Referenzlösungen. Jede Ground Truth durchläuft daher eine mehrstufige, voneinander unabhängige Prüfung: von analytischen Ankern über eine Doppel-Gegenrechnung mit zwei unabhängigen Open-Source-Rechenkernen bis zur feldweisen Gegenrechnung mit SOFiSTiK, der in der deutschsprachigen Tragwerksplanung etablierten DIN-EN/NA-Software, dort in zwei Programmfassungen (2024 und 2026) mit deckungsgleichem Ergebnis.

PrüfstufeUmfangErgebnis
Analytische Anker
qL²/8 · 5qL⁴/384EI · π²EI/L²
jede Lösung bestätigt
Doppel-Gegenrechnung Balkenstatik
PyNite · anaStruct
1.583 Felder 100 % innerhalb der Toleranzen · max. 0,014 %
SOFiSTiK 2024, Balkenstatik 1.583 Felder 1.582 Felder bestätigt · Median der Abweichung 0,0002 %
SOFiSTiK 2026, Balkenstatik
unabhängige Wiederholung
1.583 Felder Ergebnis identisch zur Fassung 2024
SOFiSTiK 2024 und 2026, Bemessung
EC3-Knicken · EC5-Holz · EC2-Bewehrung
1.239 Felder
je Fassung
in beiden Fassungen bestätigt · Ergebnisse deckungsgleich
Durchlaufträger, statisch unbestimmt
neue Klasse in v0.4
4.888 Aufgaben
39.104 Felder
Musterlösungen mit SOFiSTiK bestimmt; alle acht Lösungsgrößen analytisch gegengeprüft (Dreimomentenverfahren, Integration der Biegelinie) · größte Abweichung 0,222 %, Median ≤ 0,011 %

2.821 Lösungsfelder sind durch SOFiSTiK bestätigt, jeweils in zwei Programmfassungen mit deckungsgleichem Ergebnis; die Balkenstatik zusätzlich durch zwei unabhängige Open-Source-Rechenkerne. Sämtliche normativen Parameter sind quellenbelegt statt angenommen.

Bekannte Abdeckungsgrenzen. Nicht durch Gegenrechnung abgedeckt sind der EC2-Biegenachweis gegen vorhandene Bewehrung (das Bemessungsmodul gibt die Vergleichsgröße nicht aus) sowie die Querkraft-Teilgrößen, für die das Bemessungsmodul andere Modellannahmen trifft als die Aufgabenstellung vorgibt. Beides ist in den Verifikationsberichten dokumentiert und fließt nicht in die Bewertung ein. Weitere Prüfstufen bis zur externen Fachprüfung sind in Umsetzung.

SOFiSTiK ist eine Marke der SOFiSTiK AG; PyNite und anaStruct sind Projekte ihrer jeweiligen Inhaber. Die Nennung erfolgt ausschließlich zur wahrheitsgemäßen Beschreibung der zur unabhängigen Gegenrechnung eingesetzten Prüfsoftware. Eine geschäftliche Verbindung, Partnerschaft oder Empfehlung durch die genannten Anbieter besteht nicht.

Ergebnisse

Was Sprachmodelle heute können und was nicht

Gemessen werden Feldgenauigkeit (Field-EM), Halluzinationsrate, Verify-Catch, Antwortzeit und Formatstabilität. Alle Werte stammen aus reproduzierbaren Läufen gegen die Messfassungen v0.1 und v0.3; die Neubewertung gegen v0.4 ist in Vorbereitung.

Modell / ModusField-EMHalluzinationVerify-CatchLatenzParse-Fehler
Qwen3.6:35B (roh)22,8 %42,1 %26,7 %1,8 s0/576
Qwen3.6:35B (roh) · Reasoning58,0 %23,1 %11,3 %73,6 s11/600
Qwen3.6:27B (roh)123,0 %33,3 %30,4 %5,0 s0/120
Qwen3.6:27B (roh)1 · Reasoning275,2 %20,0 %12,6 %353 s0/79
Gemma 4 26B (roh)121,7 %44,4 %28,7 %25,3 s2/120
Gemma 4 26B (roh)1 · Reasoning35,6 %55,6 %14,9 %122,9 s49/120
Claude Fable 5 (Anthropic)392,7 %13,9 %27,5 s0/120
Claude Opus 5 (Anthropic)392,6 %17,6 %24,8 s3/120
Statika AI96,9 %0,0 %31,1 %2,9 s0/600

1 n = 120 (track-balanciertes Subset). 2 41 von 120 Anfragen im Timeout (900 s), gewertet n = 79, die Zahl ist dadurch eher optimistisch. 3 n = 120, gemessen gegen Fassung v0.3 mit eigenem Harness nach identischer Metrikdefinition; Latenz = Median; Verify-Catch nicht erhoben.

Rohe Sprachmodelle scheitern an normbasierter Tragwerksplanung und erfinden bei fehlenden Angaben in vier von zehn Fällen Werte. Reasoning hebt die Genauigkeit, löst aber weder das Wissens- noch das Sicherheitsproblem.

Offenlegung. StatikBench wird von der Statika betrieben, dem Anbieter von Statika AI, einem der gemessenen Systeme. Aufgaben, Musterlösungen und Auswertung sind deterministisch und seed-reproduzierbar; die Verifikation der Musterlösungen erfolgt durch programmfremde Rechenkerne. Lizenznehmer können sämtliche Läufe eigenständig nachvollziehen.
Fassungen

Versionsstand

FassungAufgabenStatus
v0.45.888aktuell, Standard-Konfiguration
v0.31.000Vorgängerfassung, Grundlage der veröffentlichten Auswertungen
v0.1600Vorgängerfassung, nur zur Reproduktion früherer Auswertungen
Zugang

Zugang und Lizenzen

StatikBench ist kostenpflichtig lizenziert. Der Datensatz ist als Datenbank nach §§ 87a ff. UrhG geschützt; die Rechte des Datenbankherstellers werden ausdrücklich geltend gemacht. Für Text und Data Mining ist der Nutzungsvorbehalt nach § 44b Abs. 3 UrhG erklärt, die gesetzliche Schranke greift damit nicht; Training bedarf einer Lizenz. Der Zugriff über die Zugangsanfrage dient der Prüfung vor einem Lizenzerwerb und begründet kein Nutzungsrecht.

A — Evaluierung

befristete interne Prüfung

B — Forschung

Hochschulen, nicht-kommerziell, mit Publikationsrecht

C — Unternehmen

interne Bewertung eigener Modelle

D — Publikation

Veröffentlichung von Ergebnissen und Ranglisten

E — KI-Training

Training, Feinabstimmung, Destillation

F — OEM

Einbettung in eigene Produkte, Weitergabe

Zugang beantragen Konditionen anfragen

StatikBench ist ein Messinstrument für Sprachmodelle. Es ist keine Grundlage für Tragwerksplanung oder Nachweisführung an realen Bauwerken.