OpenAI发布GPT-5:跨行业表现比肩人类专家
周四,OpenAI发布了突破性基准评估工具GDPval,用于衡量其人工智能模型在不同行业领域与人类专业人士的对比表现。该评估标志着OpenAI朝着衡量其系统能否在经济影响性工作中超越人类的目标迈出了第一步——这也是公司追求通用人工智能的核心目标。
据OpenAI表示,GPT-5和Anthropic的Claude Opus 4.1均展现出接近行业专家水平的输出质量。
尽管这些发现并不意味着人类工作将被立即取代,但它们代表着重要的进展追踪。OpenAI承认GDPval目前仅能评估现实世界专业任务中的一小部分,这与某些CEO预测的AI将在数年内引发广泛颠覆的观点形成对照。
GDPval评估涵盖美国GDP九大关键领域——包括医疗保健、金融、制造业和政府机构——测试范围涉及从软件工程到新闻传媒等44种职业。
在GDPval-v0版本中,专业人士将AI生成的报告与人类同行的作品进行比对。其中一项示例任务要求投资银行家分析末端物流配送领域的竞争对手格局,并与AI生成的版本进行对比。OpenAI据此计算出每个模型在所有职业类别中相对于人类输出的“胜率”。
增强型GPT-5-high模型在40.6%的情况下达到或超越了专家输出水平,而Claude Opus 4.1则取得了49%的持平率——OpenAI指出后者较高的得分可能源于Claude在视觉呈现方面的优势而非实质性的内容提升。
在Disrupt 2025与10000余名科技及风险投资创新者建立联系
汇聚Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本及Elad Gil等250多位行业领袖,举办200余场聚焦增长的专题会议。共同庆祝TechCrunch成立20周年,同时从科技领域顶尖思想家处获取竞争优势洞察。9月26日前提前注册最高可节省668美元。
在Disrupt 2025与10000余名科技及风险投资创新者建立联系
汇聚Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本及Elad Gil等250多位行业领袖,举办200余场聚焦增长的专题会议。共同庆祝TechCrunch成立20周年,同时从科技领域顶尖思想家处获取竞争优势洞察。9月26日前提前注册最高可节省668美元。

图片来源:OpenAI OpenAI承认GDPval-v0的评估范围较为局限——目前仅测试研究报告生成能力——并计划在后续版本中评估更广泛的工作场景交互。
首席经济学家Aaron Chatterji博士向TechCrunch表示,这些结果表明专业人士可以越来越多地将常规任务委托给AI,从而腾出精力从事更高价值的工作。
评估负责人Tejal Patwardhan指出迅猛的发展速度:十五个月前GPT-4o仅获得13.7%的评分,而GPT-5的性能已实现近三倍提升——这种发展轨迹预计将持续保持。
虽然AIME 2025和GPQA Diamond等基准测试在AI评估领域占据主导地位,但多数模型在这些学术测试中已接近饱和。GDPval代表着行业日益重视实践性及产业相关性的评估标准——尽管OpenAI仍需进行更全面的测试才能最终证实在各专业领域达到人类水平的表现。
相关文章
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
相关专题推荐
评论 (0)
0/500
周四,OpenAI发布了突破性基准评估工具GDPval,用于衡量其人工智能模型在不同行业领域与人类专业人士的对比表现。该评估标志着OpenAI朝着衡量其系统能否在经济影响性工作中超越人类的目标迈出了第一步——这也是公司追求通用人工智能的核心目标。
据OpenAI表示,GPT-5和Anthropic的Claude Opus 4.1均展现出接近行业专家水平的输出质量。
尽管这些发现并不意味着人类工作将被立即取代,但它们代表着重要的进展追踪。OpenAI承认GDPval目前仅能评估现实世界专业任务中的一小部分,这与某些CEO预测的AI将在数年内引发广泛颠覆的观点形成对照。
GDPval评估涵盖美国GDP九大关键领域——包括医疗保健、金融、制造业和政府机构——测试范围涉及从软件工程到新闻传媒等44种职业。
在GDPval-v0版本中,专业人士将AI生成的报告与人类同行的作品进行比对。其中一项示例任务要求投资银行家分析末端物流配送领域的竞争对手格局,并与AI生成的版本进行对比。OpenAI据此计算出每个模型在所有职业类别中相对于人类输出的“胜率”。
增强型GPT-5-high模型在40.6%的情况下达到或超越了专家输出水平,而Claude Opus 4.1则取得了49%的持平率——OpenAI指出后者较高的得分可能源于Claude在视觉呈现方面的优势而非实质性的内容提升。
在Disrupt 2025与10000余名科技及风险投资创新者建立联系
汇聚Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本及Elad Gil等250多位行业领袖,举办200余场聚焦增长的专题会议。共同庆祝TechCrunch成立20周年,同时从科技领域顶尖思想家处获取竞争优势洞察。9月26日前提前注册最高可节省668美元。
在Disrupt 2025与10000余名科技及风险投资创新者建立联系
汇聚Netflix、Box、a16z、ElevenLabs、Wayve、红杉资本及Elad Gil等250多位行业领袖,举办200余场聚焦增长的专题会议。共同庆祝TechCrunch成立20周年,同时从科技领域顶尖思想家处获取竞争优势洞察。9月26日前提前注册最高可节省668美元。

OpenAI承认GDPval-v0的评估范围较为局限——目前仅测试研究报告生成能力——并计划在后续版本中评估更广泛的工作场景交互。
首席经济学家Aaron Chatterji博士向TechCrunch表示,这些结果表明专业人士可以越来越多地将常规任务委托给AI,从而腾出精力从事更高价值的工作。
评估负责人Tejal Patwardhan指出迅猛的发展速度:十五个月前GPT-4o仅获得13.7%的评分,而GPT-5的性能已实现近三倍提升——这种发展轨迹预计将持续保持。
虽然AIME 2025和GPQA Diamond等基准测试在AI评估领域占据主导地位,但多数模型在这些学术测试中已接近饱和。GDPval代表着行业日益重视实践性及产业相关性的评估标准——尽管OpenAI仍需进行更全面的测试才能最终证实在各专业领域达到人类水平的表现。
Anthropic 推出 Opus 4.8,新增动态工作流工具
Anthropic 于周四发布了 Opus 4.8,这是其旗舰公开模型的最新版本。该版本定价与前一版本相同,目前已在所有平台上开放使用。距离 Opus 4.7 发布仅过去 41 天,Anthropic 显著加快了开发周期,远超近期 Sonnet 和 Haiku 版本三至七个月的发布间隔。此次快速更新很可能是对 Opus 4.7 反响平平的回应——该版本曾令许多用户感到失望。与此同时,OpenAI的
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met





首页






