Alle Meldungen
The DecoderLegal Tech

KI-Agenten als Start-up-Chef: Neuer Benchmark lässt Sprachmodelle 500 Tage ein Unternehmen führen

Forscher der Princeton University haben mit CEO-Bench einen Benchmark entwickelt, der KI-Agenten als virtuelle Geschäftsführer über 500 simulierte Tage prüft. Die meisten aktuellen Sprachmodelle scheitern in diesem Test und führen das fiktive Softwareunternehmen in den Konkurs, während einfache regelbasierte Systeme ohne KI nahezu alle Modelle übertreffen. Dies demonstriert erhebliche Defizite von Sprachmodellen bei komplexen wirtschaftlichen Entscheidungsprozessen und strategischem Management.

Originalquelle lesen

Diese Zusammenfassung dient der schnellen Orientierung und ersetzt weder die Originalquelle noch eine rechtliche Prüfung. Sie wurde KI-gestützt erstellt und redaktionell kuratiert.

Weitere Meldungen

Alle