选项
首页
新闻
我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

2025-04-17
170

我将gpt -4O通过编码测试进行了,它使它们呈现 - 除了一个奇怪的结果

如果你一直在关注科技界,你可能已经知道OpenAI刚刚发布了其最新的大型语言模型GPT-4o,其中“o”代表“omni”。这个新模型承诺在文本、图形和语音方面具有多功能性,我迫不及待地想用我的标准编码测试集来检验它的能力。这些测试已经针对多种AI模型进行了运行,得出了一些非常有趣的结果。坚持看到最后,因为有一个你不想错过的转折。

如果你有兴趣进行自己的实验,请查看这个指南:如何测试AI聊天机器人的编码能力 - 你也可以。它概述了我使用的所有测试,以及它们如何工作和结果中需要关注的内容的详细解释。

现在,让我们深入探讨每个测试的结果,看看GPT-4o与之前的竞争者如Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced以及早期版本的ChatGPT相比表现如何。

1. 编写WordPress插件

以下是GPT-4o用户界面的一瞥:

有趣的是,GPT-4o自行决定包含一个JavaScript文件,该文件动态更新两个字段中的行数。虽然提示中没有明确排除JavaScript,但这种创造性的方法出乎意料且有效。JavaScript还增强了Randomize按钮的功能,允许在不刷新整个页面的情况下生成多个结果集。

行排列正确,重复项按照规格适当分开。这是一段扎实的代码,只有一个小问题:Randomize按钮没有单独放在一行上,尽管我在提示中没有明确要求这一点,所以不扣分。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:界面:良好,功能:良好
  • Microsoft Copilot:界面:合格,功能:失败
  • Meta AI:界面:合格,功能:失败
  • Meta Code Llama:完全失败
  • Google Gemini Advanced:界面:良好,功能:失败
  • ChatGPT 4:界面:良好,功能:良好
  • ChatGPT 3.5:界面:良好,功能:良好

2. 重写字符串函数

此测试评估模型处理美元和美分转换的能力。GPT-4o成功重写了代码,以拒绝可能导致后续行问题的输入,确保仅处理有效的美元和美分值。

我有点失望的是,它没有自动为像.75这样的值添加前导零,转换为0.75。然而,由于我没有明确要求此功能,这不是AI的错。这提醒我们,即使AI提供了功能性代码,你可能仍需优化提示以获得你所需的确切结果。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:成功
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 查找一个烦人的错误

此测试很有趣,因为解决方案并非一目了然。我在自己的编码中最初被这个错误难住了,所以我向第一个ChatGPT模型求助。它立即找到了错误,当时真是令人震惊。

相比之下,我测试的其他三个大型语言模型错过了这个问题中的误导。错误信息指向代码的某一部分,但实际问题出在别处,需要深入了解WordPress框架才能识别。

幸运的是,GPT-4o正确识别了问题并准确描述了修复方法。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失败。极其失败。热情失败。表情符号失败。
  • Meta AI:成功
  • Meta Code Llama:失败
  • Google Gemini Advanced:失败
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

到目前为止,GPT-4o三战三胜。让我们看看它在最后测试中的表现。

4. 编写脚本

针对此测试,GPT-4o实际上提供了超出我要求的内容。测试涉及使用鲜为人知的Mac脚本工具Keyboard Maestro、Apple的AppleScript和Chrome脚本行为。顺便说一句,Keyboard Maestro对我来说是个游戏改变者,它能够重新编程操作系统和应用程序,使Mac成为我的生产力首选。

要通过测试,AI需要正确概述一个使用Keyboard Maestro代码、AppleScript和Chrome API功能的组合解决方案。

令人惊讶的是,GPT-4o给了我两个不同版本:

两个版本都正确与Keyboard Maestro交互,但它们在处理大小写敏感性上有所不同。左侧版本不正确,因为AppleScript不支持“as lowercase”。右侧版本使用“contains”且不区分大小写,运行良好。

我谨慎地给GPT-4o通过,因为它确实提供了可用的代码。然而,返回两个选项,其中一个不正确,让我需要额外工作来评估和选择正确的一个。这可能与我自己编写代码一样耗时。

以下是本次及之前测试的综合结果:

  • ChatGPT GPT-4o:成功,但有保留
  • Microsoft Copilot:失败
  • Meta AI:失败
  • Meta Code Llama:失败
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失败

总体结果

以下是所有模型在四个测试中的表现:

  • ChatGPT GPT-4o:4个测试全部成功,但有一个奇怪的双选答案
  • Microsoft Copilot:4个测试全部失败
  • Meta AI:4个测试中1个成功
  • Meta Code Llama:4个测试中1个成功
  • Google Gemini Advanced:4个测试中1个成功
  • ChatGPT 4:4个测试全部成功
  • ChatGPT 3.5:4个测试中3个成功

到目前为止,ChatGPT一直是我的编码助手首选。它总是能交付(除了偶尔失误)。其他AI在我的测试中大多表现不佳。但GPT-4o在最后一个双答案回应中给了我一个意外的难题。这让我质疑这个模型内部发生了什么,导致了这样的小问题。

尽管如此,GPT-4o仍是我的编码测试中的最佳表现者,所以我可能会继续使用它并更熟悉它的特性。或者,我可能会回退到ChatGPT Plus中的GPT-3.5或GPT-4。请继续关注;下次ChatGPT更新其模型时,我肯定会重新运行这些测试,看看它能否在所有四个测试中始终选择正确答案。

你有否尝试过用这些AI模型进行编码?你的体验如何?请在下面的评论中告诉我们。

相关文章
内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 内部细节曝光:下一代 Gemini 算力紧张,内部团队在开发优先级和资源分配上存在分歧 报告显示,谷歌备受期待的下一代 Gemini 模型发布已被推迟。由于内部在开发优先级和资源分配上存在分歧,加上计算能力有限以及复杂的审批流程,导致发布时间延后了两个月。尽管谷歌拥有定制的 TPU 芯片,但由于模型训练、Google Cloud 服务以及众多消费和企业级 AI 应用对计算资源的需求相互竞争,谷歌仍面临计算资源短缺的问题。目前,高层管理人员正通过组织结构调整来解决这些部门间的冲突。与此同时,领导层也发生了变化,联合创始人谢尔盖·布林越来越多地参与到核心模型训练中,并倡导将资源专门用于
OpenAI 否认增长放缓担忧,称多个业务部门加速发展 OpenAI 否认增长放缓担忧,称多个业务部门加速发展 针对外界对其销售增长放缓及未达内部基准的质疑,人工智能领域的领军企业 OpenAI 于 4 月 28 日(星期二)发表了一份信心十足的声明。该公司澄清称,其消费产品和企业服务正在快速推进,直接驳斥了近期关于业务放缓的猜测。针对该公司“未达成多项内部目标”的说法,OpenAI 将这些报道斥为“典型的标题党”。公司强调了企业对 AI 集成的强劲需求,并指出其广告业务早期增长前景良好。据 OpenAI 内部人士透露,公司内部情绪依然乐观。尽管市场竞争日益激烈,但公司正在向投资者传递信心,声称其商业
阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴超级杯:Qwen3.8-Max 重磅登场,代码与办公工具能力全面升级 阿里巴巴正式发布了Qwen3.8-Max,这是一款拥有2.4万亿参数的下一代基础大模型。这一重大AI进展在编码和专业办公任务等核心领域带来了显著的性能提升,展现了强大的技术能力。在权威的Arena大模型排名中,Qwen3.8-Max取得了令人瞩目的成绩,仅次于Anthropic的Claude系列,位居行业前列。这一里程碑标志着国内大模型在处理复杂任务方面取得了快速进展,为开发者和企业用户提供了先进的智能工具。该模型的API现已在Qwen AI平台上上线,并集成到新推出的“Qwen Offic
相关专题推荐
音乐创作 最佳用于歌曲草稿的 AI 旋律创作工具
最佳用于歌曲草稿的 AI 旋律创作工具

2026 年最新最佳顶级评分 AI 旋律创作工具,助力歌曲草稿创作!XIX.AI 精心策划了一套极具影响力且经过严格真实世界测试的变革性合集,旨在提供最佳的创作体验。您可以找到详细的免费与付费版对比、精准的排名以及必试选项,这些工具旨在帮助您轻松创作出令人惊艳的歌曲草稿,并显著提升您的创意生产力。立即探索,发现您的完美工具!

8 个工具
xix.ai
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
评论 (22)
0/500
RoyMartínez
RoyMartínez 2026-05-01 10:01:09

GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.

PaulYoung
PaulYoung 2026-03-15 08:00:58

Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔

JonathanAllen
JonathanAllen 2025-04-26 19:46:22

GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔

WillHarris
WillHarris 2025-04-26 02:21:39

GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔

DonaldGonzález
DonaldGonzález 2025-04-24 19:41:59

GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔

JustinAnderson
JustinAnderson 2025-04-23 13:12:28

¡El GPT-4o me impresionó con sus habilidades de codificación! Pasó todos mis tests excepto por un resultado extraño que me dejó pensando. Su versatilidad en texto, gráficos y voz es genial! Pero ese fallo, hay que arreglarlo, OpenAI! 😎

OR