opção
ScottMartinez
ScottMartinez
25 de Setembro de 2025

A OpenAI apresenta o benchmark GDPval para avaliar o desempenho da IA em comparação com o desempenho humano nos principais setores, constatando que o GPT-5 e o Claude Opus 4.1 estão próximos do nível de especialista em algumas tarefas, mas são limitados na complexidade do trabalho no mundo real. Os resultados mostram uma rápida melhora desde o GPT-4o.

A OpenAI apresenta o benchmark GDPval para avaliar o desempenho da IA em comparação com o desempenho humano nos principais setores, constatando que o GPT-5 e o Claude Opus 4.1 estão próximos do nível de especialista em algumas tarefas, mas são limitados na complexidade do trabalho no mundo real. Os resultados mostram uma rápida melhora desde o GPT-4o.
Comentários (0)
0/300
OR