Github Copilot的AI测试:混合编码成功使我感到困惑
探索AI编码工具的不一致性
令人费解的是,所有基于相同基础大语言模型的AI工具,竟然会产生如此不同的结果。例如,ChatGPT、Perplexity 和 GitHub Copilot 都使用了 OpenAI 的 GPT-4 模型。然而,我最近的测试显示性能差异明显:ChatGPT 和 Perplexity 的专业版表现出色,而 GitHub Copilot 的成功率只有50%。
我在 VS Code 环境中集成了 GitHub Copilot 进行这些测试。我将在即将发布的一篇文章中分享设置的详细指南。现在,让我们深入探讨我进行的测试细节。
如果你对我的测试方法和使用的提示词感到好奇,可以查看我关于评估AI聊天机器人编码能力的详细指南。
TL;DR: GitHub Copilot 在我进行的四项测试中通过了两项。
测试1:编写 WordPress 插件
这次测试完全令人失望。这是我的初步实验,让我不确定是 GitHub Copilot 在编码方面存在问题,还是 VS Code 环境中的交互限制影响了其能力。
背景是这样的:我要求AI开发一个功能完整的 WordPress 插件,包括管理界面和操作逻辑。插件的任务是接受一个名字列表,对其排序,并将任何重复项分开以避免相邻。
这项任务源自我妻子数字商品电商业务的实际需求,她管理着一个活跃的 Facebook 群组。
在测试的十个AI模型中,五个完全通过了这项测试,三个部分通过,两个(包括 Microsoft Copilot)完全失败。尽管 GitHub Copilot 使用了相同的提示词,但它只生成了 PHP 代码。虽然这个问题确实可以用 PHP 单独解决,但 GitHub Copilot 试图引用 JavaScript,却没有实际生成 JavaScript 代码。

David Gewirtz/ZDNET 截图 当我尝试在 JavaScript 文件中提示 GitHub Copilot 完成任务时,它竟然又生成了更多的 PHP 代码,仍然引用了一个不存在的 JavaScript 文件。

David Gewirtz/ZDNET 截图 测试2:重写字符串函数
这项测试相对简单:我提供了一个用于验证美元和美分的函数,但它只检查整数美元。挑战在于让AI纠正这个函数。
GitHub Copilot 确实修改了代码,但结果有问题。它假设任何输入字符串都是有效的,如果字符串为空,就会导致错误。此外,更新后的正则表达式无法处理各种边缘情况,例如“3.”、“.3”或“00.30”等输入。对于一个用于验证货币的函数,这种疏忽是不可接受的,这标志着 GitHub Copilot 的又一次失败。
测试3:查找一个烦人的错误
在这项测试中,GitHub Copilot 表现出色。这项测试基于我遇到的一个真实编码挑战,错误信息并未直接指向实际问题。这有点像一个编码谜题,需要深入理解 WordPress API 调用才能解决。
虽然 Microsoft Copilot、Gemini 和 Meta Code Llama 在这项测试中表现不佳,但 GitHub Copilot 完美应对,展现了其处理复杂现实问题的能力。
测试4:编写脚本
GitHub Copilot 在这项测试中也成功了,而 Microsoft Copilot 则失败了。任务涉及创建一个需要整合 AppleScript、Chrome 对象模型和 Mac 专用工具 Keyboard Maestro 的脚本。
要通过测试,AI需要识别并处理这三个环境的细微差别,而 GitHub Copilot 做到了这一点。
最终思考
看到使用先进 GPT-4 模型的 GitHub Copilot 在一半的测试中失败,令人失望。鉴于 GitHub 作为领先的源代码管理平台的地位,人们会期望其AI编码支持更加可靠。
然而,AI的世界在不断发展,我乐观地认为 GitHub Copilot 的性能会随着时间推移而改善。我们将在几个月后重新审视它的进展。
你依赖AI进行编码辅助吗?你的首选AI工具是哪个?你尝试过 GitHub Copilot 吗?在下面的评论中分享你的经验。
在社交媒体上关注我的每日项目进展。不要忘记订阅我的每周通讯,并在 Twitter/X 上关注我,账号为 @DavidGewirtz,在 Facebook 上为 Facebook.com/DavidGewirtz,在 Instagram 上为 Instagram.com/DavidGewirtz,在 Bluesky 上为 @DavidGewirtz.com,在 YouTube 上为 YouTube.com/DavidGewirtzTV。
相关文章
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
印度软件巨头缩减招聘,承诺随着 AI 代理规模扩大不裁员
随着人工智能重塑传统的劳动密集型商业模式,印度领先的软件外包公司塔塔咨询服务公司(TCS)公布了其战略应对措施。在周二的年度股东大会上,董事长概述了人机协作的愿景,并澄清了公司在人工智能时代的人力资源战略。不裁员,但招聘将放缓TCS董事长明确表示,公司没有因采用人工智能而裁员的计划,尽管整体招聘速度将放缓。虽然TCS此前减少了超过10,000名员工,但官员们强调,公司现在更倾向于通过自然流失来优化其人员结构,而非突然裁员。高层管理人员指出,以前由人类处理的重复性、机械性任务正不可避免地转向
中国在全国高考期间锁定人工智能模型,以阻止即时作业辅导
随着2026年高考临近,关于考试期间暂停使用AI工具的谣言引发了激烈的网络争论。针对公众关切,各大AI平台和教育应用澄清了立场:并非全面禁止,而是对考试相关功能实施有针对性的“限时锁定”。这些平台采用了精确的基于时间的控制机制。在官方考试时间内,如拍照解题和题目分析等功能将被暂时禁用。然而,日常对话功能和一般生活类查询对用户完全开放。这种有针对性的做法并非没有先例。去年,几个AI平台在高考期间引入了类似的限制措施。业内人士指出,这些措施旨在符合监管标准,即禁止使用深度合成服务从事损害公共利益
相关专题推荐
评论 (41)
0/500
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!
探索AI编码工具的不一致性
令人费解的是,所有基于相同基础大语言模型的AI工具,竟然会产生如此不同的结果。例如,ChatGPT、Perplexity 和 GitHub Copilot 都使用了 OpenAI 的 GPT-4 模型。然而,我最近的测试显示性能差异明显:ChatGPT 和 Perplexity 的专业版表现出色,而 GitHub Copilot 的成功率只有50%。
我在 VS Code 环境中集成了 GitHub Copilot 进行这些测试。我将在即将发布的一篇文章中分享设置的详细指南。现在,让我们深入探讨我进行的测试细节。
如果你对我的测试方法和使用的提示词感到好奇,可以查看我关于评估AI聊天机器人编码能力的详细指南。
TL;DR: GitHub Copilot 在我进行的四项测试中通过了两项。
测试1:编写 WordPress 插件
这次测试完全令人失望。这是我的初步实验,让我不确定是 GitHub Copilot 在编码方面存在问题,还是 VS Code 环境中的交互限制影响了其能力。
背景是这样的:我要求AI开发一个功能完整的 WordPress 插件,包括管理界面和操作逻辑。插件的任务是接受一个名字列表,对其排序,并将任何重复项分开以避免相邻。
这项任务源自我妻子数字商品电商业务的实际需求,她管理着一个活跃的 Facebook 群组。
在测试的十个AI模型中,五个完全通过了这项测试,三个部分通过,两个(包括 Microsoft Copilot)完全失败。尽管 GitHub Copilot 使用了相同的提示词,但它只生成了 PHP 代码。虽然这个问题确实可以用 PHP 单独解决,但 GitHub Copilot 试图引用 JavaScript,却没有实际生成 JavaScript 代码。
当我尝试在 JavaScript 文件中提示 GitHub Copilot 完成任务时,它竟然又生成了更多的 PHP 代码,仍然引用了一个不存在的 JavaScript 文件。
测试2:重写字符串函数
这项测试相对简单:我提供了一个用于验证美元和美分的函数,但它只检查整数美元。挑战在于让AI纠正这个函数。
GitHub Copilot 确实修改了代码,但结果有问题。它假设任何输入字符串都是有效的,如果字符串为空,就会导致错误。此外,更新后的正则表达式无法处理各种边缘情况,例如“3.”、“.3”或“00.30”等输入。对于一个用于验证货币的函数,这种疏忽是不可接受的,这标志着 GitHub Copilot 的又一次失败。
测试3:查找一个烦人的错误
在这项测试中,GitHub Copilot 表现出色。这项测试基于我遇到的一个真实编码挑战,错误信息并未直接指向实际问题。这有点像一个编码谜题,需要深入理解 WordPress API 调用才能解决。
虽然 Microsoft Copilot、Gemini 和 Meta Code Llama 在这项测试中表现不佳,但 GitHub Copilot 完美应对,展现了其处理复杂现实问题的能力。
测试4:编写脚本
GitHub Copilot 在这项测试中也成功了,而 Microsoft Copilot 则失败了。任务涉及创建一个需要整合 AppleScript、Chrome 对象模型和 Mac 专用工具 Keyboard Maestro 的脚本。
要通过测试,AI需要识别并处理这三个环境的细微差别,而 GitHub Copilot 做到了这一点。
最终思考
看到使用先进 GPT-4 模型的 GitHub Copilot 在一半的测试中失败,令人失望。鉴于 GitHub 作为领先的源代码管理平台的地位,人们会期望其AI编码支持更加可靠。
然而,AI的世界在不断发展,我乐观地认为 GitHub Copilot 的性能会随着时间推移而改善。我们将在几个月后重新审视它的进展。
你依赖AI进行编码辅助吗?你的首选AI工具是哪个?你尝试过 GitHub Copilot 吗?在下面的评论中分享你的经验。
在社交媒体上关注我的每日项目进展。不要忘记订阅我的每周通讯,并在 Twitter/X 上关注我,账号为 @DavidGewirtz,在 Facebook 上为 Facebook.com/DavidGewirtz,在 Instagram 上为 Instagram.com/DavidGewirtz,在 Bluesky 上为 @DavidGewirtz.com,在 YouTube 上为 YouTube.com/DavidGewirtzTV。
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
印度软件巨头缩减招聘,承诺随着 AI 代理规模扩大不裁员
随着人工智能重塑传统的劳动密集型商业模式,印度领先的软件外包公司塔塔咨询服务公司(TCS)公布了其战略应对措施。在周二的年度股东大会上,董事长概述了人机协作的愿景,并澄清了公司在人工智能时代的人力资源战略。不裁员,但招聘将放缓TCS董事长明确表示,公司没有因采用人工智能而裁员的计划,尽管整体招聘速度将放缓。虽然TCS此前减少了超过10,000名员工,但官员们强调,公司现在更倾向于通过自然流失来优化其人员结构,而非突然裁员。高层管理人员指出,以前由人类处理的重复性、机械性任务正不可避免地转向
中国在全国高考期间锁定人工智能模型,以阻止即时作业辅导
随着2026年高考临近,关于考试期间暂停使用AI工具的谣言引发了激烈的网络争论。针对公众关切,各大AI平台和教育应用澄清了立场:并非全面禁止,而是对考试相关功能实施有针对性的“限时锁定”。这些平台采用了精确的基于时间的控制机制。在官方考试时间内,如拍照解题和题目分析等功能将被暂时禁用。然而,日常对话功能和一般生活类查询对用户完全开放。这种有针对性的做法并非没有先例。去年,几个AI平台在高考期间引入了类似的限制措施。业内人士指出,这些措施旨在符合监管标准,即禁止使用深度合成服务从事损害公共利益
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!





首页






