OpenAI 推出 GPT-5.4 Pro 及支持百万上下文窗口的 Thinking 模型
元素OpenAI 已正式宣布推出其最新的基础模型GPT-5.4 ,并称其为迄今为止功能最强大、效率最高的专业级模型。 据AIbase 报道,该系列采用了差异化的发布策略:除了标准版本外,OpenAI 还推出了专注于复杂逻辑推理的GPT-5.4Thinking,以及专为高性能任务打造的GPT-5.4Pro。

在技术层面,GPT-5.4的 API版本实现了重大升级,其上下文窗口容量高达100万个令牌——这是OpenAI迄今为止提供的最大容量。该模型在令牌效率方面也取得了显著提升,能够以更少的资源解决类似问题。
在安全性和准确性方面,新模型相较于 GPT-5.2 将每条语句的错误率降低了 33%,并将整体响应错误率降低了 18%。为缓解推理模型中潜在的“思维链欺骗”风险,OpenAI 引入了一套新的安全评估系统。测试表明,GPT-5.4Thinking 具备更高的透明度,使其推理步骤难以被隐瞒或伪造。
在基准测试中,GPT-5.4 表现强劲,在OSWorld-Verified和WebArena Verified等计算资源消耗测试中创下新纪录,同时在GDPval知识任务中取得了83%的惊人成绩。
Mercor首席执行官Brendan Foody指出,该模型在金融和法律等专业领域的APEX-Agents 基准测试中同样处于领先地位,尤其在生成金融模型、法律分析及其他长篇交付成果方面表现卓越。借助全新的“工具搜索”系统,该模型在调用外部工具时效率显著提升,大幅降低了大规模工具集成场景中的令牌开销。
相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
评论 (0)
0/500

在技术层面,
在安全性和准确性方面,新模型相较于 GPT-5.2 将每条语句的错误率降低了 33%,并将整体响应错误率降低了 18%。为缓解推理模型中潜在的“
在基准测试中,
Mercor首席执行官Brendan Foody指出,该模型在金融和法律等专业领域的
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧
报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展
针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级
阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic





首页






