选项
首页
新闻
GPT-5发布挑战重重,OpenAI积极应对推进障碍

GPT-5发布挑战重重,OpenAI积极应对推进障碍

2025-11-26
124

GPT-5发布挑战重重,OpenAI积极应对推进障碍

更新于2025年8月8日美国东部时间下午5:21:本文发布后不久,OpenAI联合创始人兼首席执行官萨姆·阿尔特曼确认公司将恢复部分用户的GPT-4o及其他旧版模型访问权限,并承认GPT-5的推出过程“比我们预期的更为坎坷”。

说得委婉些,万众期待的OpenAI新模型GPT-5的发布开局颇为不顺。

即便忽略昨日直播发布会上出现的图表错误和语音演示故障(该发布会推出了四个独立模型以及其中三个模型可用的“思考”模式),自发布以来的多份用户报告显示,GPT-5在处理相对简单的问题时表现挣扎,而这些问题早期的OpenAI模型——以及竞争对手AI实验室的系统——都能正确解决。

例如,数据科学家科林·弗雷泽分享了GPT-5错误处理数学证明的截图——具体来说,是关于8.888循环是否等于9的问题(实际上并不等于)。

它在一个简单的算术方程5.9 = x + 5.11上也出错了,这是许多小学生都能解决的问题。

使用GPT-5来评估OpenAI自己有缺陷的演示图表,也未能产生有用或准确的回应。

此外,它在下面这个更棘手的文字题上栽了跟头(说实话,连我起初也觉得这题颇具挑战——尽管埃隆·马斯克的Grok 4 AI给出了正确答案。提示一下:请记住石板不能切割;所有80块必须保持完整)。

在我的测试中,较旧的GPT-4o模型至少能更可靠地处理其中一道数学题。不幸的是,OpenAI正在逐步淘汰这些旧模型——包括之前默认的GPT-4o和高级推理模型o3——对于ChatGPT用户而言,不过近期内开发者仍可通过API访问它们。

编码表现未达基准测试水平

尽管OpenAI的内部基准测试和某些第三方测试显示GPT-5在编码方面是表现最佳的模型,但实际使用情况表明,Anthropic最近升级的Claude Opus 4.1通常能更有效地处理“一次性”任务——按用户要求交付其预期的应用程序或软件构建。请看开发者贾斯汀·孙在X上发布的这个例子:

此外,安全公司SPLX的一份报告披露,OpenAI的内部安全措施在诸如业务对齐、易受提示注入和混淆逻辑攻击等领域存在显著漏洞。

尽管是零散的反馈,但来自AI重度用户的早期评价总体上反应平淡。

AI领域影响者、前谷歌员工比拉瓦尔·西杜在X上进行了一项投票,征求粉丝们的“氛围感评价”。截至当时共172票,主流回应是“有点普通”。

正如化名账号“AI泄露与新闻”所指出的:“来自X和Reddit AMA关于GPT-5的压倒性共识是非常负面的。”

AIPRM的首席工程师、X平台上知名的AI评论者蒂博尔·布拉霍汇总了ChatGPT-5推出问题的全面总结。他指出,其中一个旗舰功能——根据查询复杂度自动选择思考或非思考模式的“路由器”——已成为主要投诉点,因为该模型对许多用户经常默认使用非思考模式。

竞争对手伺机而动

因此,围绕ChatGPT-5的舆论远非一致好评——这对OpenAI构成了严峻挑战,因为来自美国巨头如谷歌和Anthropic的竞争日趋激烈,同时还有越来越多免费、开源且能力强大的中国大型语言模型涌现,它们提供的功能是许多美国模型所不具备的。

以阿里巴巴千问研究团队为例,他们今天将其高性能Qwen 3模型升级至支持100万token的上下文长度。这使得用户每次交互能交换的信息量比GPT-5目前提供的多出近四倍。

随着OpenAI本周另一重要发布——新的开源gpt-oss模型系列——也收到了褒贬不一的早期评价,这家用户领先的专注AI公司(ChatGPT目前拥有7亿周活跃用户)前景变得不确定。

这种情绪在预测市场Polymarket上得到了呼应,用户普遍押注谷歌很可能在2025年8月底前拥有领先的AI模型。

其他重度用户,例如Otherside AI的联合创始人兼首席执行官马特·舒默——他早期获得了GPT-5访问权限并发表了正面评价——暗示随着更多人针对新模型优化其工作流程,看法可能会转变:

尽管现在对GPT-5下定论还为时过早——随着更多人在各种任务中测试它,看法可能会发生显著变化——但初步迹象表明,这并非像之前GPT-4、GPT-4o或o3发布时那样的“全垒打”。对于一家最近刚获得新一轮融资但因高昂研发支出仍处于亏损状态的公司来说,这是一个令人不安的信号。

相关文章
在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在青少年开始使用ChatGPT数年后,OpenAI推出了更安全的ChatGPT版本 在因人工智能聊天机器人缺乏安全协议——这导致了青少年自杀及其他心理健康危机——而引发一系列诉讼后,OpenAI 于周一推出了“ChatGPT for Teens”。这一新产品集成了增强的安全功能,并致力于解决学校中由人工智能工具助长的学术不端行为这一日益严重的问题。从教育角度来看,“ChatGPT for Teens”除了推出“学习模式”外,还提供了其他旨在培养好奇心和解决问题能力的工具,鼓励用户
Frontier AI Labs 拒绝透露针对失控模型的遏制策略 Frontier AI Labs 拒绝透露针对失控模型的遏制策略 最新研究表明,极少数领先的人工智能实验室曾公布或演示过遏制响应计划。遏制计划规定了当人工智能系统试图颠覆人类控制时应采取的程序,明确了哪些访问权限将被撤销,以及何时应彻底关闭系统。这些发现来自致力于推动前沿人工智能安全开发实践的组织“Guidelight AI Standards”,该组织对五家主要实验室应对此类情景的准备情况进行了评估。 OpenAI 排名最高,而 Anthropic 和 Met
NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率 NEA的蒂芙尼·拉克:企业仍在努力应对人工智能的投资回报率 正在加载播放器…今年早些时候,“token最大化”(tokenmaxxing)在硅谷占据主导地位,首席执行官们敦促员工最大限度地利用人工智能。然而,这种热情很快遭遇了现实。据报道,Uber在几个月内就超出了其年度人工智能预算,一些公司跨部门削减了Claude许可证,而Meta则取消了内部绩效排名。NEA合伙人蒂芙尼·拉克(Tiffany Luck)每天都在应对这种兴奋与实际回报之间的差距。她此前曾成功说服企业电子商务是未来,如今她完全专注于人工智能,特别是其为消费者创造“神奇时刻”的潜力。
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (1)
0/500
DanielAllen
DanielAllen 2026-06-01 18:00:19

Honestly, I'm not surprised. OpenAI rushed GPT-4o and now they're backtracking? Classic move 😅. Hope they get it right eventually, but I'm sticking with Claude for now.

OR