OpenAI 发布 GPT-5.4 Pro 和 Thinking 版本

周四,OpenAI 推出了 GPT-5.4,这是一款被描述为“我们目前功能最强大、效率最高的面向专业工作的前沿基础模型”的新模型。除了标准版外,GPT-5.4 还推出了专注于推理的变体(GPT-5.4 Thinking)和性能优化版(GPT-5.4 Pro)。
该模型的API版本将支持高达100万令牌的上下文窗口,这标志着OpenAI迄今为止提供的最大上下文容量。
OpenAI 还强调了令牌效率的提升,指出 GPT-5.4 解决相同问题所需的令牌数量比前代模型显著减少。
该新模型在基准测试中表现大幅提升,在计算机应用基准测试 OSWorld-Verified 和 WebArena Verified 中创下纪录。此外,在 OpenAI 针对知识型工作任务的 GDPval 测试中,其得分达到 83%,同样刷新了纪录。
据 Mercor 首席执行官 Brendan Foody 的声明,GPT-5.4 在 Mercor 的 APEX-Agents 基准测试中表现领先,该测试旨在评估法律和金融领域的专业技能。
“GPT-5.4在生成幻灯片、财务模型和法律分析等长期交付成果方面表现卓越,”福迪表示,“在运行速度更快、成本更低的同时,其性能仍处于顶尖水平,超越了竞争对手的前沿模型。”
GPT-5.4延续了OpenAI在减少幻觉和事实错误方面的努力。该公司报告称,与GPT-5.2相比,新模型在单个陈述中出错的概率降低了33%,整体响应中出现错误的概率降低了18%。
作为此次发布的一部分,OpenAI 重新设计了 GPT-5.4 API 处理工具调用的方式,引入了一个名为“工具搜索”(Tool Search)的新系统。此前,系统提示必须预先定义所有可用工具——随着工具库的扩展,这一过程会消耗大量令牌。新系统允许模型按需检索工具定义,在工具众多的环境中,这使得请求处理更快且更具成本效益。
OpenAI 还新增了一项安全评估机制,用于评估其模型的“思维链”(即在多步骤任务中揭示模型推理过程的实时注释)。AI 安全研究人员长期以来一直担心,推理模型可能会歪曲其思维链,而测试证实,在某些条件下确实可能发生这种情况。
OpenAI的新评估表明,在GPT-5.4的Thinking版本中,这种欺骗行为发生的概率较低,"这表明该模型缺乏隐藏其推理过程的能力,且CoT监控仍是一种有效的安全工具。"
相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
评论 (0)
0/500

周四,OpenAI 推出了 GPT-5.4,这是一款被描述为“我们目前功能最强大、效率最高的面向专业工作的前沿基础模型”的新模型。除了标准版外,GPT-5.4 还推出了专注于推理的变体(GPT-5.4 Thinking)和性能优化版(GPT-5.4 Pro)。
该模型的API版本将支持高达100万令牌的上下文窗口,这标志着OpenAI迄今为止提供的最大上下文容量。
OpenAI 还强调了令牌效率的提升,指出 GPT-5.4 解决相同问题所需的令牌数量比前代模型显著减少。
该新模型在基准测试中表现大幅提升,在计算机应用基准测试 OSWorld-Verified 和 WebArena Verified 中创下纪录。此外,在 OpenAI 针对知识型工作任务的 GDPval 测试中,其得分达到 83%,同样刷新了纪录。
据 Mercor 首席执行官 Brendan Foody 的声明,GPT-5.4 在 Mercor 的 APEX-Agents 基准测试中表现领先,该测试旨在评估法律和金融领域的专业技能。
“GPT-5.4在生成幻灯片、财务模型和法律分析等长期交付成果方面表现卓越,”福迪表示,“在运行速度更快、成本更低的同时,其性能仍处于顶尖水平,超越了竞争对手的前沿模型。”
GPT-5.4延续了OpenAI在减少幻觉和事实错误方面的努力。该公司报告称,与GPT-5.2相比,新模型在单个陈述中出错的概率降低了33%,整体响应中出现错误的概率降低了18%。
作为此次发布的一部分,OpenAI 重新设计了 GPT-5.4 API 处理工具调用的方式,引入了一个名为“工具搜索”(Tool Search)的新系统。此前,系统提示必须预先定义所有可用工具——随着工具库的扩展,这一过程会消耗大量令牌。新系统允许模型按需检索工具定义,在工具众多的环境中,这使得请求处理更快且更具成本效益。
OpenAI 还新增了一项安全评估机制,用于评估其模型的“思维链”(即在多步骤任务中揭示模型推理过程的实时注释)。AI 安全研究人员长期以来一直担心,推理模型可能会歪曲其思维链,而测试证实,在某些条件下确实可能发生这种情况。
OpenAI的新评估表明,在GPT-5.4的Thinking版本中,这种欺骗行为发生的概率较低,"这表明该模型缺乏隐藏其推理过程的能力,且CoT监控仍是一种有效的安全工具。"
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本
在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略
最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率
正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。





首页






