Github Copilot的AI測試:混合編碼成功使我感到困惑
探索 AI 編碼工具的不一致性
令人困惑的是,所有基於同一基礎大型語言模型的 AI 工具,為何表現結果如此不同。例如,ChatGPT、Perplexity 和 GitHub Copilot 皆使用 OpenAI 的 GPT-4 模型。然而,我最近的測試顯示出顯著的性能差異:ChatGPT 和 Perplexity 的專業計劃表現出色,而 GitHub Copilot 的成功率僅為 50%。
我使用整合於 VS Code 環境中的 GitHub Copilot 進行了這些測試。我將在即將推出的文章中分享設置的詳細指南。現在,讓我們深入探討我所進行的測試細節。
如果你對我的測試方法和使用的提示語感到好奇,可以查看我關於評估 AI 聊天機器人編碼能力的詳細指南。
TL;DR: GitHub Copilot 在我進行的四項測試中通過了兩項。
測試 1:撰寫 WordPress 插件
這項測試完全令人失望。這是我的初步實驗,讓我不確定 GitHub Copilot 是否在編碼上存在問題,還是 VS Code 內的交互限制影響了其能力。
背景如下:我要求 AI 開發一個功能完整的 WordPress 插件,包含管理界面和操作邏輯。插件的任務是接受一組名稱列表,對其進行排序,並分離任何重複項以避免相鄰。
這項任務源自我妻子數位商品電子商務業務的實際需求,她管理一個活躍的 Facebook 社群。
在測試的十個 AI 模型中,五個完全通過了這項測試,三個部分通過,兩個(包括 Microsoft Copilot)完全失敗。儘管給予了相同的提示語,GitHub Copilot 僅生成了 PHP 代碼。雖然問題確實可以用 PHP 獨立解決,但 GitHub Copilot 試圖引用 JavaScript 卻未實際生成。

David Gewirtz/ZDNET 截圖 當我嘗試從 JavaScript 文件中提示 GitHub Copilot 完成任務時,它居然回應了更多 PHP 代碼,仍然引用了一個不存在的 JavaScript 文件。

David Gewirtz/ZDNET 截圖 測試 2:重寫字串函數
這項測試相對簡單:我提供了一個用於驗證美元和美分的函數,但僅檢查整數美元。挑戰在於讓 AI 修正該函數。
GitHub Copilot 確實修改了代碼,但結果有問題。它假設任何輸入字串都是有效的,若字串為空則會導致錯誤。此外,更新後的正則表達式無法處理各種邊緣情況,例如 "3."、".3" 或 "00.30" 等輸入。對於一個用於驗證貨幣的函數來說,這種疏忽是不可接受的,GitHub Copilot 再次失敗。
測試 3:尋找惱人的錯誤
在這項測試中,GitHub Copilot 表現出色。這項測試基於我遇到的真實編碼挑戰,錯誤訊息並未直接指向實際問題。這有點像編碼謎題,需要深入理解 WordPress API 調用才能解決。
Microsoft Copilot、Gemini 和 Meta Code Llama 在這項測試中表現不佳,但 GitHub Copilot 完美解決,展示了其處理複雜真實世界問題的能力。
測試 4:撰寫腳本
GitHub Copilot 在這項測試中也成功了,而 Microsoft Copilot 則表現不佳。該任務涉及創建一個需要整合 AppleScript、Chrome 對象模型和 Mac 專用工具 Keyboard Maestro 的腳本。
要通過測試,AI 需要識別並處理這三個環境的細微差別,GitHub Copilot 做到了這一點。
最終想法
看到使用先進 GPT-4 模型的 GitHub Copilot 在一半的測試中失敗,令人失望。鑑於 GitHub 作為領先的源碼管理平台的地位,人們會期望其 AI 編碼支持更為可靠。
然而,AI 世界不斷演進,我樂觀地認為 GitHub Copilot 的表現將隨時間改善。我們將在幾個月後重新審視其進展。
你是否依賴 AI 進行編碼協助?你最常用的 AI 工具是哪個?你有沒有試過 GitHub Copilot?請在下方評論中分享你的經驗。
在社交媒體上關注我的每日項目進展。別忘了訂閱我的每週電子報,並在 Twitter/X 上關注我 @DavidGewirtz,在 Facebook 上關注 Facebook.com/DavidGewirtz,在 Instagram 上關注 Instagram.com/DavidGewirtz,在 Bluesky 上關注 @DavidGewirtz.com,以及在 YouTube 上關注 YouTube.com/DavidGewirtzTV。
相關文章
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
相關專題推薦
評論 (41)
0/500
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!
探索 AI 編碼工具的不一致性
令人困惑的是,所有基於同一基礎大型語言模型的 AI 工具,為何表現結果如此不同。例如,ChatGPT、Perplexity 和 GitHub Copilot 皆使用 OpenAI 的 GPT-4 模型。然而,我最近的測試顯示出顯著的性能差異:ChatGPT 和 Perplexity 的專業計劃表現出色,而 GitHub Copilot 的成功率僅為 50%。
我使用整合於 VS Code 環境中的 GitHub Copilot 進行了這些測試。我將在即將推出的文章中分享設置的詳細指南。現在,讓我們深入探討我所進行的測試細節。
如果你對我的測試方法和使用的提示語感到好奇,可以查看我關於評估 AI 聊天機器人編碼能力的詳細指南。
TL;DR: GitHub Copilot 在我進行的四項測試中通過了兩項。
測試 1:撰寫 WordPress 插件
這項測試完全令人失望。這是我的初步實驗,讓我不確定 GitHub Copilot 是否在編碼上存在問題,還是 VS Code 內的交互限制影響了其能力。
背景如下:我要求 AI 開發一個功能完整的 WordPress 插件,包含管理界面和操作邏輯。插件的任務是接受一組名稱列表,對其進行排序,並分離任何重複項以避免相鄰。
這項任務源自我妻子數位商品電子商務業務的實際需求,她管理一個活躍的 Facebook 社群。
在測試的十個 AI 模型中,五個完全通過了這項測試,三個部分通過,兩個(包括 Microsoft Copilot)完全失敗。儘管給予了相同的提示語,GitHub Copilot 僅生成了 PHP 代碼。雖然問題確實可以用 PHP 獨立解決,但 GitHub Copilot 試圖引用 JavaScript 卻未實際生成。
當我嘗試從 JavaScript 文件中提示 GitHub Copilot 完成任務時,它居然回應了更多 PHP 代碼,仍然引用了一個不存在的 JavaScript 文件。
測試 2:重寫字串函數
這項測試相對簡單:我提供了一個用於驗證美元和美分的函數,但僅檢查整數美元。挑戰在於讓 AI 修正該函數。
GitHub Copilot 確實修改了代碼,但結果有問題。它假設任何輸入字串都是有效的,若字串為空則會導致錯誤。此外,更新後的正則表達式無法處理各種邊緣情況,例如 "3."、".3" 或 "00.30" 等輸入。對於一個用於驗證貨幣的函數來說,這種疏忽是不可接受的,GitHub Copilot 再次失敗。
測試 3:尋找惱人的錯誤
在這項測試中,GitHub Copilot 表現出色。這項測試基於我遇到的真實編碼挑戰,錯誤訊息並未直接指向實際問題。這有點像編碼謎題,需要深入理解 WordPress API 調用才能解決。
Microsoft Copilot、Gemini 和 Meta Code Llama 在這項測試中表現不佳,但 GitHub Copilot 完美解決,展示了其處理複雜真實世界問題的能力。
測試 4:撰寫腳本
GitHub Copilot 在這項測試中也成功了,而 Microsoft Copilot 則表現不佳。該任務涉及創建一個需要整合 AppleScript、Chrome 對象模型和 Mac 專用工具 Keyboard Maestro 的腳本。
要通過測試,AI 需要識別並處理這三個環境的細微差別,GitHub Copilot 做到了這一點。
最終想法
看到使用先進 GPT-4 模型的 GitHub Copilot 在一半的測試中失敗,令人失望。鑑於 GitHub 作為領先的源碼管理平台的地位,人們會期望其 AI 編碼支持更為可靠。
然而,AI 世界不斷演進,我樂觀地認為 GitHub Copilot 的表現將隨時間改善。我們將在幾個月後重新審視其進展。
你是否依賴 AI 進行編碼協助?你最常用的 AI 工具是哪個?你有沒有試過 GitHub Copilot?請在下方評論中分享你的經驗。
在社交媒體上關注我的每日項目進展。別忘了訂閱我的每週電子報,並在 Twitter/X 上關注我 @DavidGewirtz,在 Facebook 上關注 Facebook.com/DavidGewirtz,在 Instagram 上關注 Instagram.com/DavidGewirtz,在 Bluesky 上關注 @DavidGewirtz.com,以及在 YouTube 上關注 YouTube.com/DavidGewirtzTV。
蘋果智慧眼鏡或將在WWDC27上首次亮相,重點突出隱私保護
彭博社的馬克·古爾曼報道,蘋果智慧眼鏡(內部代號 N50)計劃於 2027 年 6 月的全球開發者大會(WWDC27)上首次亮相,零售版預計將於 2027 年秋季上市。該裝置原定於今年晚些時候及 2027 年初發布,但現已推遲,以便進行進一步的產品完善並加強隱私保護協議。隱私仍是蘋果智慧眼鏡戰略的核心支柱。從 Meta 等競爭對手的隱私爭議中吸取教訓,蘋果正在實施強有力的功能與政策。目前考慮的方案包括:完全移除攝像頭,專注於人工智慧互動、音訊播放和通話;或保留攝像頭但禁用照片和影片錄製功能,僅
內部細節曝光:下一代 Gemini 算力緊張,內部團隊在開發優先順序和資源分配上存在分歧
報告顯示,谷歌備受期待的下一代 Gemini 模型釋出已被推遲。由於內部在開發優先順序和資源分配上存在分歧,加上計算能力有限以及複雜的審批流程,導致釋出時間延後了兩個月。儘管谷歌擁有定製的 TPU 晶片,但由於模型訓練、Google Cloud 服務以及眾多消費和企業級 AI 應用對計算資源的需求相互競爭,谷歌仍面臨計算資源短缺的問題。目前,高層管理人員正透過組織結構調整來解決這些部門間的衝突。與此同時,領導層也發生了變化,聯合創始人謝爾蓋·布林越來越多地參與到核心模型訓練中,並倡導將資源專門用於
OpenAI 否認增長放緩擔憂,稱多個業務部門加速發展
針對外界對其銷售增長放緩及未達內部基準的質疑,人工智慧領域的領軍企業 OpenAI 於 4 月 28 日(星期二)發表了一份信心十足的宣告。該公司澄清稱,其消費產品和企業服務正在快速推進,直接駁斥了近期關於業務放緩的猜測。針對該公司“未達成多項內部目標”的說法,OpenAI 將這些報道斥為“典型的標題黨”。公司強調了企業對 AI 整合的強勁需求,並指出其廣告業務早期增長前景良好。據 OpenAI 內部人士透露,公司內部情緒依然樂觀。儘管市場競爭日益激烈,但公司正在向投資者傳遞信心,聲稱其商業
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!





首頁






