GPT-5.6 Sol schlägt Claude Opus 5 bei ARC-AGI-3 mit zwei zusätzlichen API-Einstellungen
OpenAI's GPT-5.6 Sol erreicht beim ARC-AGI-3-Test 38,3 Prozent mit proprietärer API-Infrastruktur, während das Modell in der offiziellen, anbieterneutralen Testumgebung nur 7,8 Prozent erzielt. Der Vergleich mit Anthropics Claude Opus 5 ist methodisch fraglich, da möglicherweise veraltete API-Versionen verwendet wurden und die höheren Ergebnisse durch zusätzliche API-Einstellungen erzielt wurden. Für Bewerter von KI-Systemen ist dies ein Beispiel für die kritische Relevanz standardisierter Testbedingungen und transparenter Benchmarking-Methodologie.
Originalquelle lesenDiese Zusammenfassung dient der schnellen Orientierung und ersetzt weder die Originalquelle noch eine rechtliche Prüfung. Sie wurde KI-gestützt erstellt und redaktionell kuratiert.