option
Home
Flash News
Content
ScottMartinez
ScottMartinez
September 25, 2025

OpenAI introduces GDPval benchmark to assess AI vs human performance in key industries, finding GPT-5 and Claude Opus 4.1 near expert-level in some tasks but limited in real-world job complexity. Results show rapid improvement since GPT-4o.

OpenAI introduces GDPval benchmark to assess AI vs human performance in key industries, finding GPT-5 and Claude Opus 4.1 near expert-level in some tasks but limited in real-world job complexity. Results show rapid improvement since GPT-4o.
Comments (0)
0/300
OR