option
Maison
Flash info
Contenu
ScottMartinez
ScottMartinez
25 septembre 2025

L'OpenAI présente le benchmark GDPval pour évaluer les performances de l'IA par rapport à celles de l'homme dans des secteurs clés. Le GPT-5 et Claude Opus 4.1 sont proches du niveau d'expert dans certaines tâches, mais limités dans la complexité des emplois dans le monde réel. Les résultats montrent une amélioration rapide depuis GPT-4o.

L'OpenAI présente le benchmark GDPval pour évaluer les performances de l'IA par rapport à celles de l'homme dans des secteurs clés. Le GPT-5 et Claude Opus 4.1 sont proches du niveau d'expert dans certaines tâches, mais limités dans la complexité des emplois dans le monde réel. Les résultats montrent une amélioration rapide depuis GPT-4o.
commentaires (0)
0/300
OR