オプション
家
速報
コンテンツ
ScottMartinez
ScottMartinez
2025年9月25日

OpenAIは、主要産業におけるAI対人間のパフォーマンスを評価するGDPvalベンチマークを導入し、GPT-5とClaude Opus 4.1が一部のタスクでエキスパートレベルに近いが、実際の仕事の複雑さでは限界があることを発見した。結果はGPT-4o以来の急速な改善を示している。

OpenAIは、主要産業におけるAI対人間のパフォーマンスを評価するGDPvalベンチマークを導入し、GPT-5とClaude Opus 4.1が一部のタスクでエキスパートレベルに近いが、実際の仕事の複雑さでは限界があることを発見した。結果はGPT-4o以来の急速な改善を示している。
コメント (0)
0/300
OR