LexLab Research24h Source Sync

Legal AI
Model Benchmark

Welche Basismodelle liefern bei juristischen Aufgaben verlässliche Ergebnisse — und unter welchen Bedingungen dürfen Kanzleien sie einsetzen? Leistung und Mandatsdatenschutz werden bewusst getrennt bewertet.

Zuverlässigster Entwurf

Claude Opus 4.8

67.6% vollständig richtig

Vergleichsfeld

13 Modelle

Juli 2026

Testumfang

63 Aufgaben

davon 34 Vertragsentwürfe

Praxis-Benchmark

Vertragsentwurf: Zuverlässigkeit vor Stil

Zuverlässigkeit misst den Anteil vollständig bestandener Aufgaben. Nutzbarkeit bewertet Klarheit, Länge und Struktur von 1 bis 3. Die Werte werden nicht zu einem künstlichen Gesamtscore vermischt.

Primärquelle
← Seitlich scrollen für alle Werte →
#ModellZuverlässigkeitNutzbarkeitKosten / Aufgabe
01
Claude Opus 4.8
Anthropic
67.6%
2.67 / 3≈ $0.29
02
Claude Fable 5Aktuell
Anthropic
61.8%
2.66 / 3≈ $0.64
03
Claude Opus 5Aktuell
Anthropic
61.8%
2.47 / 3≈ $0.74
04
Grok 4.5
xAI
58.8%
2.61 / 3≈ $0.19
05
Kimi K3
Moonshot
58.8%
2.64 / 3≈ $0.14
06
Gemini 3.5 FlashAktuell
Google
55.9%
2.60 / 3≈ $0.08
07
Claude Sonnet 4.6
Anthropic
50.0%
2.63 / 3$0.13
08
Gemini 3.1 Pro
Google
50.0%
2.69 / 3$0.07
09
GPT 5.6 SolAktuell
OpenAI
44.1%
2.75 / 3≈ $0.19
10
Qwen3.7 Max
Alibaba
44.1%
2.67 / 3≈ $0.03
11
GPT-5.5
OpenAI
41.2%
2.77 / 3$0.15
12
DeepSeek V4 Pro
DeepSeek
26.5%
2.68 / 3≈ $0.03
13
GPT-5.4-mini
OpenAI
26.5%
2.55 / 3≈ $0.01
Quelle: Legal AI Benchmarking · API-Modelle bei Standard-Reasoning · Kosten in USDQuelle erfolgreich synchronisiert

Ergänzende Qualitätssignale

Was Arena und METR zusätzlich zeigen

Legal-Richtigkeit bleibt der Kern. Die folgenden externen Messungen liefern einen zweiten Blick auf Dokumentarbeit, Faktentreue und mehrstufige Ausführung — werden aber bewusst nicht in den Legal-Rang eingerechnet.

Arena.ai

Dokumentqualität & Faktentreue

Live · Community

Was es ergänzt

Die Document Arena vergleicht Modelle bei PDF- und Langdokument-Aufgaben anhand realer Nutzerpräferenzen. Der Factuality-Modus ergänzt Präferenzurteile um die überprüfte Richtigkeit einzelner Web-Claims.

Nicht übertragbar

Kein juristischer Lösungsschlüssel, keine deutsche Rechtsordnung und keine Prüfung von Fundstellenqualität. Rank Spreads zeigen, wie unsicher ein Rang statistisch noch ist.

METR

Mehrstufige Aufgabenreichweite

TH 1.1 · Periodisch

Was es ergänzt

Die 50%-Time-Horizon beschreibt die menschliche Expertenzeit einer Aufgabe, bei der ein Agent voraussichtlich in der Hälfte der Fälle erfolgreich ist. Das ist ein nützlicher Hinweis auf planungsintensive Workflows.

Nicht übertragbar

Gemessen werden überwiegend Software-, ML- und Cybersecurity-Aufgaben — nicht Recht. Der Wert ist weder reale Laufzeit noch Garantie für selbstständige Kanzleiarbeit; Messungen über 16 Stunden gelten derzeit als unzuverlässig.

LexLab-Lesart: Legal-Benchmark für fachliche Verlässlichkeit, Arena für erlebte Antwort- und Dokumentqualität, METR für agentische Aufgabenreichweite. Ein starkes Signal kann ein schwaches in einer anderen Dimension nicht ausgleichen.

Release Watch

Neu veröffentlicht, noch nicht gerankt

Neue Modelle erhalten erst dann einen Rang, wenn ein dokumentierter Legal-Test vorliegt. So wird Marketing nicht mit Messung verwechselt.

Mandatsdaten-Check

Modellleistung ist nicht Produktfreigabe

ChatGPT, Claude und Gemini sind Anwendungen; GPT, Claude Fable oder Gemini 3.6 sind Modelle. Für Verschwiegenheit und Datenschutz zählt das konkrete Produkt, der Tarif, die Konfiguration und der Vertrag — nicht der Benchmarkplatz.

OpenAI

ChatGPT / OpenAI API

Consumer-Zugang

Nur anonymisiert verwenden

Organisationszugang

Business, Enterprise oder API sind prüffähig

Geschäftsdaten werden standardmäßig nicht zum Modelltraining verwendet; Aufbewahrung und Datenresidenz hängen von Produkt und Vertrag ab.

Anbieterangaben

Anthropic

Claude / Claude API

Consumer-Zugang

Nur anonymisiert verwenden

Organisationszugang

Claude for Work oder API sind prüffähig

Ein- und Ausgaben kommerzieller Produkte werden standardmäßig nicht für das Modelltraining genutzt; Enterprise bietet zusätzliche Retention Controls.

Anbieterangaben

Google

Gemini / Vertex AI

Consumer-Zugang

Nur anonymisiert verwenden

Organisationszugang

Workspace Core Service oder Vertex AI sind prüffähig

Workspace- und Vertex-Angebote bieten Schutz vor Modelltraining ohne Freigabe; der konkrete Workspace-Status muss administrativ geprüft werden.

Anbieterangaben

Kein Tarif ist automatisch kanzleifreigegeben.

Vor Mandatsdaten sind mindestens Verschwiegenheit, Auftragsverarbeitung, Speicherfristen, Datenstandort, Unterauftragsverarbeiter, Zugriffsrechte und Kanzleirichtlinie konkret zu prüfen. Im Zweifel ausschließlich anonymisierte oder synthetische Inhalte verwenden.

Methodik & Grenzen

Was die Zahlen aussagen — und was nicht

01

Praxisnaher Ausschnitt

63 Single-Turn-Aufgaben aus Vertragsentwurf und Informationsextraktion; Schwerpunkt auf Commercial, IP, Employment, M&A und Competition.

02

Kein deutscher Rechtsbenchmark

Die Aufgaben sind englischsprachig und US-/UK-lastig. Aussagen zu deutschem Recht, deutscher Zitierpraxis oder Fachterminologie wären daraus nicht belastbar.

03

Momentaufnahme

Modelle und Produkte verändern sich. Die Quelle testet einen Lauf je Aufgabe; Konsistenz und Drift werden derzeit nicht gemessen.

04

Automatische Aktualisierung mit Sicherheitsnetz

LexLab synchronisiert die veröffentlichte Rangliste alle 24 Stunden. Neue getestete Modelle erscheinen automatisch; bei Quellenausfall bleibt der letzte geprüfte Datensatz sichtbar.

Spezialisierte Legal-AI-Produkte vergleichen

Basismodelle sind nur eine Schicht des Kanzlei-Stacks.