Alle Meldungen
The DecoderLegal Tech

19 Tage ohne menschliche Hilfe: KI-Benchmark MirrorCode lässt Modelle tagelang autonom programmieren

Der Benchmark MirrorCode von Epoch AI testet die Fähigkeit von KI-Modellen, komplexe Software-Programme autonome nachzubauen, wobei Claude Opus 4.7 mit 56 Prozent Erfolgsquote führt und ein 16.000-Zeilen-Toolkit in 14 Stunden reimplementierte. Die Ergebnisse zeigen sowohl das fortgeschrittene Potenzial von KI-Systemen bei umfangreichen Programmiertasks als auch ihre gegenwärtigen Grenzen bei hochkomplexen Aufgaben. Für juristische und steuerliche Fachkräfte relevant: Dies unterstreicht die wachsende Bedeutung von IP-Schutzbestimmungen und haftungsrechtlichen Fragen beim Eins

Originalquelle lesen

Diese Zusammenfassung dient der schnellen Orientierung und ersetzt weder die Originalquelle noch eine rechtliche Prüfung. Sie wurde KI-gestützt erstellt und redaktionell kuratiert.

Weitere Meldungen

Alle