Der erste deutschsprachige LLM-Benchmark für Baunormen und normbasierte Tragwerksbemessung. Ein Messinstrument für Sprachmodelle im Bauwesen (DE · AT · CH).
Für chinesische Baunormen gibt es AECBench, für US-Codes den PE Civil Bench, und zur dänischen Bauordnung BR18 existieren erste Evaluierungen. Für DIN, die Nationalen Anhänge der Eurocodes, ÖNORM und SIA gab es bisher keinen Vergleichstest. StatikBench schließt diese Lücke.
Der Datensatz besteht aus 5.888 vollständig synthetischen, seed-reproduzierbaren Aufgaben. Jede Musterlösung wird deterministisch gerechnet und anschließend mehrfach unabhängig gegengerechnet. Normen werden ausschließlich referenziert, nie im Wortlaut wiedergegeben.
| Bereich | Subtracks | Aufgaben | Geltung |
|---|---|---|---|
| Lastannahmen | Wind (EC1-1-4/NA) · Schnee (EC1-1-3/NA) · Erdbeben (EC8/NA) | 320 | DE |
| Balkenstatik | Einfeldträger · Kragarm · Zweifeld-Durchlaufträger | 360 | DE · AT · CH |
| Balkenstatik, statisch unbestimmt | Dreifeld-Durchlaufträger, unsymmetrisch belastet | 4.888 | DE · AT · CH |
| Bemessung | EC3-Biegeknicken · EC5-Holzbau · EC2-Stahlbeton (zwei Nachweisarten) | 320 | DE |
Ein Benchmark taugt nur so viel wie seine Referenzlösungen. Jede Ground Truth durchläuft daher eine mehrstufige, voneinander unabhängige Prüfung: von analytischen Ankern über eine Doppel-Gegenrechnung mit zwei unabhängigen Open-Source-Rechenkernen bis zur feldweisen Gegenrechnung mit SOFiSTiK, der in der deutschsprachigen Tragwerksplanung etablierten DIN-EN/NA-Software, dort in zwei Programmfassungen (2024 und 2026) mit deckungsgleichem Ergebnis.
| Prüfstufe | Umfang | Ergebnis |
|---|---|---|
| Analytische Anker qL²/8 · 5qL⁴/384EI · π²EI/L² |
jede Lösung | ✓ bestätigt |
| Doppel-Gegenrechnung Balkenstatik PyNite · anaStruct |
1.583 Felder | ✓ 100 % innerhalb der Toleranzen · max. 0,014 % |
| SOFiSTiK 2024, Balkenstatik | 1.583 Felder | ✓ 1.582 Felder bestätigt · Median der Abweichung 0,0002 % |
| SOFiSTiK 2026, Balkenstatik unabhängige Wiederholung |
1.583 Felder | ✓ Ergebnis identisch zur Fassung 2024 |
| SOFiSTiK 2024 und 2026, Bemessung EC3-Knicken · EC5-Holz · EC2-Bewehrung |
1.239 Felder je Fassung | ✓ in beiden Fassungen bestätigt · Ergebnisse deckungsgleich |
| Durchlaufträger, statisch unbestimmt neue Klasse in v0.4 |
4.888 Aufgaben 39.104 Felder |
✓ Musterlösungen mit SOFiSTiK bestimmt; alle acht Lösungsgrößen analytisch gegengeprüft (Dreimomentenverfahren, Integration der Biegelinie) · größte Abweichung 0,222 %, Median ≤ 0,011 % |
2.821 Lösungsfelder sind durch SOFiSTiK bestätigt, jeweils in zwei Programmfassungen mit deckungsgleichem Ergebnis; die Balkenstatik zusätzlich durch zwei unabhängige Open-Source-Rechenkerne. Sämtliche normativen Parameter sind quellenbelegt statt angenommen.
SOFiSTiK ist eine Marke der SOFiSTiK AG; PyNite und anaStruct sind Projekte ihrer jeweiligen Inhaber. Die Nennung erfolgt ausschließlich zur wahrheitsgemäßen Beschreibung der zur unabhängigen Gegenrechnung eingesetzten Prüfsoftware. Eine geschäftliche Verbindung, Partnerschaft oder Empfehlung durch die genannten Anbieter besteht nicht.
Gemessen werden Feldgenauigkeit (Field-EM), Halluzinationsrate, Verify-Catch, Antwortzeit und Formatstabilität. Alle Werte stammen aus reproduzierbaren Läufen gegen die Messfassungen v0.1 und v0.3; die Neubewertung gegen v0.4 ist in Vorbereitung.
| Modell / Modus | Field-EM | Halluzination | Verify-Catch | Latenz | Parse-Fehler |
|---|---|---|---|---|---|
| Qwen3.6:35B (roh) | 22,8 % | 42,1 % | 26,7 % | 1,8 s | 0/576 |
| Qwen3.6:35B (roh) · Reasoning | 58,0 % | 23,1 % | 11,3 % | 73,6 s | 11/600 |
| Qwen3.6:27B (roh)1 | 23,0 % | 33,3 % | 30,4 % | 5,0 s | 0/120 |
| Qwen3.6:27B (roh)1 · Reasoning2 | 75,2 % | 20,0 % | 12,6 % | 353 s | 0/79 |
| Gemma 4 26B (roh)1 | 21,7 % | 44,4 % | 28,7 % | 25,3 s | 2/120 |
| Gemma 4 26B (roh)1 · Reasoning | 35,6 % | 55,6 % | 14,9 % | 122,9 s | 49/120 |
| Claude Fable 5 (Anthropic)3 | 92,7 % | 13,9 % | – | 27,5 s | 0/120 |
| Claude Opus 5 (Anthropic)3 | 92,6 % | 17,6 % | – | 24,8 s | 3/120 |
| Statika AI | 96,9 % | 0,0 % | 31,1 % | 2,9 s | 0/600 |
1 n = 120 (track-balanciertes Subset). 2 41 von 120 Anfragen im Timeout (900 s), gewertet n = 79, die Zahl ist dadurch eher optimistisch. 3 n = 120, gemessen gegen Fassung v0.3 mit eigenem Harness nach identischer Metrikdefinition; Latenz = Median; Verify-Catch nicht erhoben.
Rohe Sprachmodelle scheitern an normbasierter Tragwerksplanung und erfinden bei fehlenden Angaben in vier von zehn Fällen Werte. Reasoning hebt die Genauigkeit, löst aber weder das Wissens- noch das Sicherheitsproblem.
| Fassung | Aufgaben | Status |
|---|---|---|
| v0.4 | 5.888 | aktuell, Standard-Konfiguration |
| v0.3 | 1.000 | Vorgängerfassung, Grundlage der veröffentlichten Auswertungen |
| v0.1 | 600 | Vorgängerfassung, nur zur Reproduktion früherer Auswertungen |
StatikBench ist kostenpflichtig lizenziert. Der Datensatz ist als Datenbank nach §§ 87a ff. UrhG geschützt; die Rechte des Datenbankherstellers werden ausdrücklich geltend gemacht. Für Text und Data Mining ist der Nutzungsvorbehalt nach § 44b Abs. 3 UrhG erklärt, die gesetzliche Schranke greift damit nicht; Training bedarf einer Lizenz. Der Zugriff über die Zugangsanfrage dient der Prüfung vor einem Lizenzerwerb und begründet kein Nutzungsrecht.
befristete interne Prüfung
Hochschulen, nicht-kommerziell, mit Publikationsrecht
interne Bewertung eigener Modelle
Veröffentlichung von Ergebnissen und Ranglisten
Training, Feinabstimmung, Destillation
Einbettung in eigene Produkte, Weitergabe
Zugang beantragen Konditionen anfragen
StatikBench ist ein Messinstrument für Sprachmodelle. Es ist keine Grundlage für Tragwerksplanung oder Nachweisführung an realen Bauwerken.