The DecoderLegal Tech
KI-Agenten als Start-up-Chef: Neuer Benchmark lässt Sprachmodelle 500 Tage ein Unternehmen führen
Forscher der Princeton University haben mit CEO-Bench einen Benchmark entwickelt, der KI-Agenten als virtuelle Geschäftsführer über 500 simulierte Tage prüft. Die meisten aktuellen Sprachmodelle scheitern in diesem Test und führen das fiktive Softwareunternehmen in den Konkurs, während einfache regelbasierte Systeme ohne KI nahezu alle Modelle übertreffen. Dies demonstriert erhebliche Defizite von Sprachmodellen bei komplexen wirtschaftlichen Entscheidungsprozessen und strategischem Management.
Originalquelle lesenDiese Zusammenfassung dient der schnellen Orientierung und ersetzt weder die Originalquelle noch eine rechtliche Prüfung. Sie wurde KI-gestützt erstellt und redaktionell kuratiert.