選項
首頁
新聞
Github Copilot的AI測試:混合編碼成功使我感到困惑

Github Copilot的AI測試:混合編碼成功使我感到困惑

2025-04-21
340

探索 AI 編碼工具的不一致性

令人困惑的是,所有基於同一基礎大型語言模型的 AI 工具,為何表現結果如此不同。例如,ChatGPT、Perplexity 和 GitHub Copilot 皆使用 OpenAI 的 GPT-4 模型。然而,我最近的測試顯示出顯著的性能差異:ChatGPT 和 Perplexity 的專業計劃表現出色,而 GitHub Copilot 的成功率僅為 50%。

我使用整合於 VS Code 環境中的 GitHub Copilot 進行了這些測試。我將在即將推出的文章中分享設置的詳細指南。現在,讓我們深入探討我所進行的測試細節。

如果你對我的測試方法和使用的提示語感到好奇,可以查看我關於評估 AI 聊天機器人編碼能力的詳細指南。

TL;DR: GitHub Copilot 在我進行的四項測試中通過了兩項。

測試 1:撰寫 WordPress 插件

這項測試完全令人失望。這是我的初步實驗,讓我不確定 GitHub Copilot 是否在編碼上存在問題,還是 VS Code 內的交互限制影響了其能力。

背景如下:我要求 AI 開發一個功能完整的 WordPress 插件,包含管理界面和操作邏輯。插件的任務是接受一組名稱列表,對其進行排序,並分離任何重複項以避免相鄰。

這項任務源自我妻子數位商品電子商務業務的實際需求,她管理一個活躍的 Facebook 社群。

在測試的十個 AI 模型中,五個完全通過了這項測試,三個部分通過,兩個(包括 Microsoft Copilot)完全失敗。儘管給予了相同的提示語,GitHub Copilot 僅生成了 PHP 代碼。雖然問題確實可以用 PHP 獨立解決,但 GitHub Copilot 試圖引用 JavaScript 卻未實際生成。

David Gewirtz/ZDNET 截圖

David Gewirtz/ZDNET 截圖

當我嘗試從 JavaScript 文件中提示 GitHub Copilot 完成任務時,它居然回應了更多 PHP 代碼,仍然引用了一個不存在的 JavaScript 文件。

David Gewirtz/ZDNET 截圖

David Gewirtz/ZDNET 截圖

測試 2:重寫字串函數

這項測試相對簡單:我提供了一個用於驗證美元和美分的函數,但僅檢查整數美元。挑戰在於讓 AI 修正該函數。

GitHub Copilot 確實修改了代碼,但結果有問題。它假設任何輸入字串都是有效的,若字串為空則會導致錯誤。此外,更新後的正則表達式無法處理各種邊緣情況,例如 "3."、".3" 或 "00.30" 等輸入。對於一個用於驗證貨幣的函數來說,這種疏忽是不可接受的,GitHub Copilot 再次失敗。

測試 3:尋找惱人的錯誤

在這項測試中,GitHub Copilot 表現出色。這項測試基於我遇到的真實編碼挑戰,錯誤訊息並未直接指向實際問題。這有點像編碼謎題,需要深入理解 WordPress API 調用才能解決。

Microsoft Copilot、Gemini 和 Meta Code Llama 在這項測試中表現不佳,但 GitHub Copilot 完美解決,展示了其處理複雜真實世界問題的能力。

測試 4:撰寫腳本

GitHub Copilot 在這項測試中也成功了,而 Microsoft Copilot 則表現不佳。該任務涉及創建一個需要整合 AppleScript、Chrome 對象模型和 Mac 專用工具 Keyboard Maestro 的腳本。

要通過測試,AI 需要識別並處理這三個環境的細微差別,GitHub Copilot 做到了這一點。

最終想法

看到使用先進 GPT-4 模型的 GitHub Copilot 在一半的測試中失敗,令人失望。鑑於 GitHub 作為領先的源碼管理平台的地位,人們會期望其 AI 編碼支持更為可靠。

然而,AI 世界不斷演進,我樂觀地認為 GitHub Copilot 的表現將隨時間改善。我們將在幾個月後重新審視其進展。

你是否依賴 AI 進行編碼協助?你最常用的 AI 工具是哪個?你有沒有試過 GitHub Copilot?請在下方評論中分享你的經驗。

在社交媒體上關注我的每日項目進展。別忘了訂閱我的每週電子報,並在 Twitter/X 上關注我 @DavidGewirtz,在 Facebook 上關注 Facebook.com/DavidGewirtz,在 Instagram 上關注 Instagram.com/DavidGewirtz,在 Bluesky 上關注 @DavidGewirtz.com,以及在 YouTube 上關注 YouTube.com/DavidGewirtzTV。

相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
漫畫創作 最適合視覺敘事的 AI 對話氣泡工具
最適合視覺敘事的 AI 對話氣泡工具

2026 年最新、最受好評的視覺敘事 AI 對話氣泡工具,現已登陸 XIX.AI!這份精心挑選的合集收錄了強大且具顛覆性的工具,能協助創作者提升生產力並突破創作瓶頸。 查看免費版與付費版的比較、參考實際測試結果,並查閱最新排行榜,找出最適合打造引人入勝視覺敘事的必試解決方案。立即探索,發掘您的理想工具!

10 個工具
xix.ai
評論 (41)
0/500
GregoryWilson
GregoryWilson 2026-08-29 12:00:06

GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔

HarryMartinez
HarryMartinez 2026-05-28 14:00:14

Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔

EricAllen
EricAllen 2026-05-19 10:00:12

Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.

ArthurJackson
ArthurJackson 2026-03-12 04:00:47

Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.

LarryMartin
LarryMartin 2025-11-27 20:30:43

이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!

PaulRoberts
PaulRoberts 2025-11-08 12:30:36

Acho frustrante que ferramentas como Copilot e ChatGPT usem o mesmo modelo base mas tenham performances tão diferentes. Isso me faz questionar se a implementação é realmente bem feita ou se só estão colocando um nome famoso pra vender mais. 🤔

OR