Option
Heim
Eilmeldung
Inhalt
ScottMartinez
ScottMartinez
25. September 2025

OpenAI führt GDPval-Benchmark ein, um die Leistung von KI im Vergleich zu Menschen in Schlüsselindustrien zu bewerten. Die Ergebnisse zeigen, dass GPT-5 und Claude Opus 4.1 bei einigen Aufgaben fast auf Expertenniveau liegen, aber bei der Komplexität von Aufgaben in der realen Welt eingeschränkt sind. Die Ergebnisse zeigen eine schnelle Verbesserung seit GPT-4o.

OpenAI führt GDPval-Benchmark ein, um die Leistung von KI im Vergleich zu Menschen in Schlüsselindustrien zu bewerten. Die Ergebnisse zeigen, dass GPT-5 und Claude Opus 4.1 bei einigen Aufgaben fast auf Expertenniveau liegen, aber bei der Komplexität von Aufgaben in der realen Welt eingeschränkt sind. Die Ergebnisse zeigen eine schnelle Verbesserung seit GPT-4o.
Kommentare (0)
0/300
OR