选项
首页
新闻
OpenAI 的 GPT-4.5 模型亮相:批判性评估

OpenAI 的 GPT-4.5 模型亮相:批判性评估

2025-11-01
155

OpenAI 最近发布的 GPT-4.5 令人工智能界沸腾不已。在直播揭晓之后,核心问题仍然是:这是一次重大突破,还是一次微妙的升级?我们将深入分析围绕 GPT-4.5 的各种说法,并将其与前代产品和竞争对手进行比较,从而将事实与宣传炒作区分开来。

关键点

GPT-4.5 在市场上被宣传为具有增强预训练功能的多功能通用模型。

早期的基准数据显示,GPT-4.5 在特定任务上落后于某些开源模型。

GPT-4.5 的应用程序接口价格大大高于以前的版本。

人们开始质疑,OpenAI 是否在优先考虑纯粹的规模,而不是模型架构和训练方法上真正的创新改进。

DeepSeek V3 等替代方案提供了性能相当、效率更高的强大开源选择。

GPT-4.5:承诺与现实

初步反应和悬而未决的问题

人们对 GPT-4.5 的反应既兴奋又怀疑。

强调让机型看起来 "更自然",引发了人们对其具体、可衡量的进步的质疑。许多人不禁要问:它的幻觉减少了吗?它的幻觉是否减少了?它在日常应用中真正超越 GPT-4o 的程度有多大?这些悬而未决的疑问要求我们更深入地研究该模型的性能和技术基础。

在人工智能领域,失望之情溢于言表。用户正在寻求可量化的进步,而不仅仅是表面上自然的对话风格。真正衡量人工智能成功与否的标准是其管理复杂任务、提供实用解决方案和产生真正创造性成果的能力。

任何人工智能模型最终都要根据其客观性能和成本效益来评判。如果不能在这些关键领域取得长足进步,"更自然 "的交互方式可能不足以成为升级的理由。

基准比较:近距离观察

GPT-4.5 的官方基准数据略显平淡。

虽然它在某些领域取得了进步,但与 DeepSeek V3(一种相对较新的开源模型)相比,其性能明显不足。考虑到 OpenAI 丰富的资源和专业知识,这一点令人惊讶。将 GPT-4.5 主要与其直接前身 GPT-4o 进行比较,而不是与更广泛的现代竞争对手进行比较,这一决定进一步加深了人们的怀疑。

以下是基准性能的细分,重点关注关键领域:

  • 数学(AIME '24):GPT-4.5 实现了 36.7% 的准确率,与其他可用的基础模型相比相对较低。这是一项至关重要的能力,因为强大的数学推理能力对于众多现实世界的应用至关重要。
  • 科学(GPQA):在这方面,GPT-4.5 的表现更为稳健,准确率达到 71.4%。这表明 GPT-4.5 对科学原理有扎实的理解,但这并不意味着 GPT-4.5 的整体能力超群。
  • 编码(SWE-Bench 验证):GPT-4.5 的得分率为 38%,表明其在编程任务方面存在明显不足。

重要的是要记住,这些基准只能有限地反映模型在特定、受控场景中的能力。要进行全面评估,就必须在不同的实际应用中进行测试,以准确衡量其潜力。

任务GPT-4.5 精确度GPT-4o 精度
GPQA(科学)71.4%53.6%
AIME '24(数学)36.7%9.3%
SWE-Bench 验证(编码)38%31%
MMMU(多模式)74.4%69.1%

API 定价:自然 "的溢价?

使用 GPT-4.5 应用程序接口的成本明显高于早期版本。

这种定价策略引发了关于可访问性的重要问题,尤其是对小公司和独立开发人员而言。在 "自然性 "方面的改进是否足以证明大幅提价是合理的?

对于大多数人来说,答案可能是否定的。人工智能模型的根本价值在于其性能、精度和运行效率。如果 GPT-4.5 无法在这些核心指标上实现实质性飞跃,那么其高昂的成本就很难得到维护。价格更低廉的开源替代品很可能会获得巨大的吸引力。

考虑一下 Aider 编码基准:在 GPT-4.5 上执行该基准要比使用 DeepSeek V3 昂贵得多。这种价格上的差距造成了更高的准入门槛,可能会阻碍 GPT-4.5 在开发人员中的广泛应用。

此外,据说它的价格比 DeepSeek 高出数百倍。仅这一成本因素就可能成为许多人放弃 GPT-4.5 而选择更经济的系统的决定性原因。

模型输入价格(每 100 万个代币)输出价格(每 100 万个代币)
GPT-4.5$75.00$150.00
GPT-4o$2.50$10.00

开源替代品的崛起:DeepSeek V3

DeepSeek V3 为何值得关注

DeepSeek V3等高性能开源模型的崛起对OpenAI的市场领导地位构成了严峻挑战。

DeepSeek V3提供了极具竞争力的性能、运行效率和模型透明度等极具吸引力的组合。据报道,它的成本比 GPT-4.5 低数百倍。

以下是它的一些主要优势:

  • 有竞争力的性能:基准测试表明,DeepSeek V3 在数学和编码等关键领域可与 GPT-4.5 竞争,有时甚至超越 GPT-4.5。
  • 成本效益:作为开源软件,DeepSeek V3 没有相关的应用程序接口(API)成本,因此部署成本大大降低。这就为更多人提供了先进的人工智能技术。
  • 透明度和定制化:开源模型提供了更高的工作透明度,并允许进行广泛的定制。开发人员可以根据特定用途调整模型,并参与其演变。

值得注意的是,DeepSeek 最近举办了 "开源周 "活动,发布了多个专注于 GPU 效率和优化的资源库。这正是许多企业扩大运营所需的实用创新类型,而不仅仅是完善模型的对话感。

GPT-4.5:权衡利弊

优点

有可能实现更自然、更流畅的语言交互。

可能在某些任务类别中取得专业进步。

来自 OpenAI 的持续开发和维护支持。

强大的通用语言能力。

缺点

与同类产品相比,API 成本过高。

在多个基准测试中,性能落后于领先的开源替代方案。

模型的内部架构和训练数据不够清晰。

在数学和编码任务方面存在明显弱点。

价格比 GPT-4o 高 12 到 30 倍。

常见问题

GPT-4.5 是 GPT-4o 的重大升级吗?

最初的基准测试结果并不一致。它在某些学科上取得了进步,但在特定挑战上与其他开源模型相比还有差距。要明确评估其价值,需要进行更全面的实际评估。

GPT-4.5 是否值得高昂的应用程序接口费用?

答案取决于您的特殊要求和资金限制。如果您需要为特定的关键应用提供顶级性能,那么可能值得考虑。但是,对于大多数用户来说,高昂的价格很难让人信服,尤其是在有能力免费提供开源选项的情况下。

DeepSeek V3 等开源人工智能模型的主要优势是什么?

开源模型具有极具竞争力的性能、卓越的成本效益、更高的操作透明度和定制灵活性。它们使每个人都能获得强大的人工智能工具,并鼓励社区驱动的创新。

相关问题

人工智能模型开发的未来是什么?

人工智能发展的轨迹可能会涉及专有和开源努力之间的协同作用。OpenAI 等大型科技公司将继续通过大规模模型推动技术发展,而开源社区在实现人工智能访问民主化以及通过合作开发和定制化促进创新方面将发挥至关重要的作用。重要的是要认识到 GPT-4.5 有明显的不足之处,OpenAI 需要解决几个方面的问题,才能有效地与其他开源模型竞争。

相关文章
苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护 苹果智能眼镜或将在WWDC27上首次亮相,重点突出隐私保护 彭博社的马克·古尔曼报道,苹果智能眼镜(内部代号 N50)计划于 2027 年 6 月的全球开发者大会(WWDC27)上首次亮相,零售版预计将于 2027 年秋季上市。该设备原定于今年晚些时候及 2027 年初发布,但现已推迟,以便进行进一步的产品完善并加强隐私保护协议。隐私仍是苹果智能眼镜战略的核心支柱。从 Meta 等竞争对手的隐私争议中吸取教训,苹果正在实施强有力的功能与政策。目前考虑的方案包括:完全移除摄像头,专注于人工智能交互、音频播放和通话;或保留摄像头但禁用照片和视频录制功能,仅
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展 OpenAI 否认增长放缓担忧,称多个业务部门加速发展 针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (5)
0/500
GregoryRamirez
GregoryRamirez 2026-04-29 00:00:58

Die Diskussion um GPT-4.5 erinnert mich an die ewige Frage: Ist es wirklich ein Durchbruch oder nur ein cleveres Marketing-Upgrade? 🤔 Die Geschwindigkeitssteigerung klingt praktisch, aber ich frage mich, ob die Kosten für Endnutzer wieder steigen werden. Die KI-Community scheint gespalten – einige feiern es, andere sehen nur inkrementelle Fortschritte. Spannend wird sein, wie sich das auf den Wettbewerb mit anderen Modellen auswirkt.

KennethRoberts
KennethRoberts 2026-04-16 12:02:09

Die Diskussion um GPT-4.5 ist echt spannend. Ich frage mich, ob die Verbesserungen wirklich so bahnbrechend sind oder ob es eher um Marketing geht. Die KI-Entwicklung wird immer schneller, aber die Kosten und der Energieverbrauch sind auch ein Thema, über das man reden sollte. 🤔

RichardJohnson
RichardJohnson 2026-03-02 08:00:14

이번 GPT-4.5 발표를 보면서 AI 경쟁이 점점 더 치열해지고 있다는 생각이 들어요. 🤔 다른 기업들도 곧 비슷한 모델을 내놓지 않을까? 기술 발전 속도가 너무 빨라서 따라가기 벅차네요. 개인정보 보호 문제는 어떻게 해결할지 궁금해지는데...

FredLee
FredLee 2026-02-13 12:00:43

Wait, another model drop already? 🤔 The speed is insane but I'm low-key worried about how smaller AI labs can keep up. Also, did they mention anything about training costs this time? The energy consumption talk is always glossed over...

FredBrown
FredBrown 2025-12-03 08:30:34

Est-ce que GPT-4.5 est vraiment une révolution ou juste un coup marketing? 🤔 J’ai l’impression qu’OpenAI accélère la cadence pour devancer la concurrence, mais est-ce au détriment de la stabilité ? En tout cas, ça donne envie de tester !

OR