選項
首頁
新聞
我將gpt -4O通過編碼測試進行了,它使它們呈現 - 除了一個奇怪的結果

我將gpt -4O通過編碼測試進行了,它使它們呈現 - 除了一個奇怪的結果

2025-04-17
170

我將gpt -4O通過編碼測試進行了,它使它們呈現 - 除了一個奇怪的結果

如果你有在關注科技圈,你可能已經知道 OpenAI 剛剛推出了最新的大型語言模型 GPT-4o,其中「o」代表「omni」。這個新模型承諾在文字、圖形和語音方面具有多功能性,我迫不及待地想用我的標準編碼測試來檢驗它的表現。這些測試已經針對眾多 AI 模型進行過,結果相當引人入勝。請跟著我看到最後,因為有個你不想錯過的轉折。

如果你有興趣進行自己的實驗,請參閱此指南:如何測試 AI 聊天機器人的編碼能力 - 你也可以。它詳細列出了我使用的所有測試,並解釋它們的運作方式以及結果中需要注意的事項。

現在,讓我們來看看每個測試的結果,並比較 GPT-4o 與之前的競爭者如 Microsoft Copilot、Meta AI、Meta Code Llama、Google Gemini Advanced 以及早期版本的 ChatGPT 的表現。

1. 撰寫 WordPress 插件

以下是 GPT-4o 的用戶界面一瞥:

有趣的是,GPT-4o 主動加入了一個 JavaScript 文件,動態更新兩個欄位的行數。雖然提示中未明確排除 JavaScript,但這種創意方法出乎意料且有效。JavaScript 還增強了隨機化按鈕的功能,允許在不重新整理頁面的情況下產生多組結果。

行數排列正確,根據規格適當分隔了重複項。這段程式碼很穩固,只有一個小問題:隨機化按鈕未獨立成行,但因為提示中未明確要求,所以不扣分。

以下是此次及先前測試的總體結果:

  • ChatGPT GPT-4o:界面:良好,功能:良好
  • Microsoft Copilot:界面:適當,功能:失敗
  • Meta AI:界面:適當,功能:失敗
  • Meta Code Llama:完全失敗
  • Google Gemini Advanced:界面:良好,功能:失敗
  • ChatGPT 4:界面:良好,功能:良好
  • ChatGPT 3.5:界面:良好,功能:良好

2. 重寫字串函數

此測試評估模型處理美元和分幣轉換的能力。GPT-4o 成功重寫了程式碼,拒絕可能導致後續行出問題的輸入,確保僅處理有效的美元和分幣值。

我有點失望它未自動將 .75 這類值加上前導零轉為 0.75。然而,由於我未明確要求此功能,這不是 AI 的錯。這提醒我們,即使 AI 提供了功能性程式碼,你可能仍需精煉提示以獲得完全符合需求的結果。

以下是此次及先前測試的總體結果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:成功
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

3. 找出惱人錯誤

這個測試很有趣,因為解決方案並不顯而易見。我自己在編碼時最初被這個錯誤難倒,於是向第一個 ChatGPT 模型求助,它立即找出了錯誤,當時真是令人震驚。

相比之下,我測試的其他三個 LLM 都錯過了這個問題的誤導。錯誤訊息指向程式碼的某一部分,但實際問題在其他地方,需要對 WordPress 框架有深入了解才能辨識。

幸運的是,GPT-4o 正確辨識了問題並準確描述了修復方法。

以下是此次及先前測試的總體結果:

  • ChatGPT GPT-4o:成功
  • Microsoft Copilot:失敗。極其慘烈。熱情洋溢。表情符號滿天飛。
  • Meta AI:成功
  • Meta Code Llama:失敗
  • Google Gemini Advanced:失敗
  • ChatGPT 4:成功
  • ChatGPT 3.5:成功

到目前為止,GPT-4o 三戰全勝。讓我們看看它在最後一項測試中的表現。

4. 撰寫腳本

在這項測試中,GPT-4o 實際上提供了超出我要求的內容。這項測試涉及使用鮮為人知的 Mac 腳本工具 Keyboard Maestro、Apple 的 AppleScript 和 Chrome 腳本行為。順便一提,Keyboard Maestro 對我來說是個改變遊戲規則的工具,它能重新編程作業系統和應用程式,使 Mac 成為我的首選生產力工具。

要通過測試,AI 需要正確概述一個結合 Keyboard Maestro 程式碼、AppleScript 和 Chrome API 功能的解決方案。

令人驚訝的是,GPT-4o 給了我兩個不同版本:

兩個版本都正確與 Keyboard Maestro 互動,但它們在處理大小寫敏感性上有所不同。左邊的版本不正確,因為 AppleScript 不支援「as lowercase」。右邊的版本使用「contains」且不區分大小寫,運作正常。

我給 GPT-4o 通過,但持保留態度,因為它確實提供了可用的程式碼。然而,返回兩個選項,其中一個不正確,讓我需要額外工作來評估和選擇正確的選項。這可能和我自己編寫程式碼一樣耗時。

以下是此次及先前測試的總體結果:

  • ChatGPT GPT-4o:成功,但有保留
  • Microsoft Copilot:失敗
  • Meta AI:失敗
  • Meta Code Llama:失敗
  • Google Gemini Advanced:成功
  • ChatGPT 4:成功
  • ChatGPT 3.5:失敗

總體結果

以下是所有模型在四項測試中的表現:

  • ChatGPT GPT-4o:4 項全數成功,但有一次奇怪的雙選答案
  • Microsoft Copilot:0 項成功
  • Meta AI:1 項成功
  • Meta Code Llama:1 項成功
  • Google Gemini Advanced:1 項成功
  • ChatGPT 4:4 項全數成功
  • ChatGPT 3.5:3 項成功

到目前為止,ChatGPT 一直是我的編碼助手首選。它總是能交付(除了偶爾失誤)。其他 AI 在我的測試中大多表現不佳。但 GPT-4o 在最後的雙答案回應中讓我有些意外,這讓我好奇這個模型內部發生了什麼導致這樣的問題。

儘管如此,GPT-4o 仍是我的編碼測試中的最佳表現者,所以我可能會繼續使用它並熟悉它的特性。或者,我可能會回到 ChatGPT Plus 的 GPT-3.5 或 GPT-4。請繼續關注,下次 ChatGPT 更新模型時,我一定會重新運行這些測試,看看它能否在所有四項測試中始終選擇正確答案。

你有沒有用這些 AI 模型進行編碼?你的經驗如何?請在下方留言分享。

相關文章
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧 內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧 報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展 OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展 針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級 阿里巴巴超級盃:Qwen3.8-Max 重磅登場,程式碼與辦公工具能力全面升級 阿里巴巴正式釋出了Qwen3.8-Max,這是一款擁有2.4萬億引數的下一代基礎大模型。這一重大AI進展在編碼和專業辦公任務等核心領域帶來了顯著的效能提升,展現了強大的技術能力。在權威的Arena大模型排名中,Qwen3.8-Max取得了令人矚目的成績,僅次於Anthropic的Claude系列,位居行業前列。這一里程碑標誌著國內大模型在處理複雜任務方面取得了快速進展,為開發者和企業使用者提供了先進的智慧工具。該模型的API現已在Qwen AI平臺上上線,並整合到新推出的“Qwen Offic
相關專題推薦
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
會議助理 頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動
頂尖 AI 會議摘要工具:清晰追蹤決策與後續行動

2026 年最新高評價最佳 AI 會議摘要工具,助您清晰追蹤決策並輕鬆進行後續跟進。這份精選清單展示了一系列強大且具顛覆性的解決方案,透過自動化會議記錄、識別關鍵行動項目,以及簡化所有專案的團隊協作,大幅提升生產力。 獲取免費版與付費版的比較分析,搭配實際測試報告及每週更新的排行榜,助您找到最合適的工具。立即探索,釋放您的 AI 優勢!

9 個工具
xix.ai
數據分析 最佳人工智慧資料清洗工具:快速處理缺失值與重複資料
最佳人工智慧資料清洗工具:快速處理缺失值與重複資料

2026年最新、最優秀且評分最高的AI資料清洗工具,可快速處理缺失值與重複資料問題。這份精心挑選的清單展示了那些功能強大、能帶來顛覆性變革的解決方案,可顯著提升工作效率。所有候選工具都經過了嚴格的實際應用測試,以確保其穩定性。您可以獲取免費版與付費版的對比資訊,找出最符合您需求的必備工具。即刻訪問XIX.AI,開啟您的AI優勢之旅。

11 個工具
xix.ai
評論 (22)
0/500
RoyMartínez
RoyMartínez 2026-05-01 10:01:09

GPT-4o klingt beeindruckend, aber diese 'eine seltsame Ausnahme' macht mich neugierig. Was war das für ein seltsames Ergebnis? Vielleicht ein Hinweis darauf, dass KI bei bestimmten Logikaufgaben immer noch überraschend 'menschlich' scheitern kann? 🤔 Die Omni-Fähigkeiten sind cool, aber ich frage mich, wie stabil die Performance in allen Modi wirklich ist.

PaulYoung
PaulYoung 2026-03-15 08:00:58

Bon article ! Les tests de programmation sont toujours révélateurs. Je me demande s’il y a des biais selon les langages utilisés pour l'entraînement… Ou peut-être que c’est lié à la façon dont la requête est formulée ? 🤔

JonathanAllen
JonathanAllen 2025-04-26 19:46:22

GPT-4o é impressionante, passando na maioria dos meus testes de codificação! Mas aquele resultado estranho me deixou confuso. Ainda assim, é versátil em texto, gráficos e voz. Se ao menos pudesse explicar aquele resultado estranho, seria perfeito! 🤔

WillHarris
WillHarris 2025-04-26 02:21:39

GPT-4o thật ấn tượng, vượt qua hầu hết các bài kiểm tra mã hóa của tôi! Nhưng kết quả lạ đó làm tôi bối rối. Tuy nhiên, nó rất linh hoạt trong văn bản, đồ họa và giọng nói. Giá mà nó có thể giải thích kết quả lạ đó, thì sẽ hoàn hảo! 🤔

DonaldGonzález
DonaldGonzález 2025-04-24 19:41:59

GPT-4oは私のコードテストのほとんどを完璧にこなすので感動しました!しかし、その一つの奇妙な結果が気になりました。それでも、テキスト、グラフィック、音声での多様性は素晴らしいです。あの奇妙な結果を説明できれば完璧だったのに!🤔

JustinAnderson
JustinAnderson 2025-04-23 13:12:28

¡El GPT-4o me impresionó con sus habilidades de codificación! Pasó todos mis tests excepto por un resultado extraño que me dejó pensando. Su versatilidad en texto, gráficos y voz es genial! Pero ese fallo, hay que arreglarlo, OpenAI! 😎

OR