Gemini Pro 2.5:强大的编码助手,对Chatgpt构成重大威胁
在评估AI用于编码辅助时,我开发了一套四个标准化测试。这些测试对于评估AI如何支持你的编程工作至关重要。毕竟,你最不需要的就是一个会在你的代码中增加更多错误的AI,对吧?
不久前,一位读者质疑我的方法,建议AI可能在面对不同挑战时表现更好。这是一个合理的观点,但我坚持使用这些测试,因为它们简单直接。我使用PHP和JavaScript,这些语言并非最难的,并通过AI运行一些脚本查询。这种一致性使我们能够直接比较性能。
测试包括编写一个简单的WordPress插件、重写一个字符串函数、寻找一个我曾经苦恼的错误,以及使用编程工具从Chrome提取数据。这就像教人开车——如果他们连车道都出不了,你不会让他们在高速公路上自由行驶。
到目前为止,只有ChatGPT的GPT-4(及以上)大语言模型通过了所有这些测试。有趣的是,Perplexity Pro也成功了,但那是因为它基于GPT-4系列大语言模型。另一方面,Microsoft Copilot尽管使用了相同的模型,却未能通过任何测试。
Google的Gemini表现也好不到哪里去。最初,Bard(Gemini的早期名称)在大多数测试中失败,甚至Gemini Advanced(每月20美元)去年也未能通过四项测试中的三项。
但现在,Google推出了Gemini Pro 2.5,它对所有人免费,但有使用限制。我在测试中仅用两个提示就达到了这些限制,这有点限制性。可能是因为任务的复杂性而非提示数量导致了限制。我的前两个请求是编写一个完整的WordPress插件和修复一些代码,这可能比简单查询更快地消耗了我的限制。
尽管需要等待,结果却令人惊讶且值得。
测试1:编写一个简单的WordPress插件
这一次,Gemini Pro 2.5表现出色。挑战是创建一个WordPress插件,提供一个用户界面来随机化输入行并分发重复项,使它们不相邻。
之前,Gemini Advanced没有创建后端仪表板,而是要求在公共页面的正文中使用短代码。它确实创建了一个基本的用户界面,但点击按钮没有任何反应。无论我如何调整提示,它仍然失败。
但Gemini Pro 2.5提供了一个扎实的用户界面,代码如预期般工作。真正让我印象深刻的是插件的图标选择。大多数AI忽略这个细节,但Gemini Pro 2.5未经我提示就从WordPress Dashicon集中选择了一个相关图标。代码文档齐全,每个主要部分都解释得很清楚。

截图由David Gewirtz/ZDNET提供 
截图由David Gewirtz/ZDNET提供 测试2:重写一个字符串函数
在第二个测试中,我要求Gemini Pro 2.5修改一些字符串处理代码,以处理美元和美分,而不仅仅是整数。ChatGPT做对了,而Bard在最初失败后最终成功。
上次,Gemini Advanced以一种微妙但危险的方式失败。它不允许非十进制输入,并错误地将数字限制在小数点前两位,误解了美元和美分的概念。这种错误如果不被发现,可能会导致大量错误报告。
然而,Gemini Pro 2.5完美应对。它正确检查了输入类型,修剪了空格,修复了正则表达式以处理前导零和小数输入,并拒绝了负数输入。代码注释完善,包含一整套测试示例。虽然它不允许分组逗号或前导货币符号,但这些是可控的错误,不是崩溃,所以我认为它通过了。
测试3:寻找一个错误
曾经,我在代码中遇到了一个本应工作但没有工作的错误。这个问题很棘手,当我专注于传递的参数数量时,ChatGPT指出我需要更改一个钩子。
Bard和Meta都没有找到问题,沿着我走过的无用路径。2024年2月,Gemini Advanced建议“可能在插件或WordPress的其他地方”,这毫无帮助。
使用Gemini Pro 2.5时,我在前两个测试后达到了使用限制,所以我不得不等到第二天。当我终于运行测试时,Gemini Pro 2.5不仅找到了错误,还清楚地告诉我修复的位置,并附上了一个有用的图表。

截图由David Gewirtz/ZDNET提供 
截图由David Gewirtz/ZDNET提供 测试4:编写一个脚本
最后一个测试涉及理解Chrome的内部对象模型、AppleScript和Keyboard Maestro,一个宏构建工具。任务是打开Chrome标签并根据参数设置活动标签。
大多数AI能很好地处理Chrome和AppleScript部分,但常常在Keyboard Maestro上遇到困难。然而,Gemini Pro 2.5做对了。它编写了正确传递变量的必要代码,添加了错误检查和用户通知,甚至提供了设置Keyboard Maestro的步骤。

截图由David Gewirtz/ZDNET提供 通过了所有四个测试,Gemini Pro 2.5加入了能够真正协助编程任务的AI工具精英群体。
Google的AI赶上OpenAI的产品只是时间问题。Google 2017年的“Attention is all you need”论文开启了生成式AI热潮,所以他们达到这一水平并不令人惊讶。Gemini Pro 2.5比ChatGPT Plus慢,响应时间在15秒到一分钟之间,但准确性比速度更重要。
Google还免费提供了Google Code Assist,限制较为宽松,但前提是生成的代码质量高。有了Gemini Pro 2.5,这种质量现在显而易见。虽然目前标记为“实验性”,我预计Google会很快完善它,可能提供一个限制较少的付费版本。
显然,Gemini Pro 2.5将在编码辅助领域挑战ChatGPT。我会密切关注这一发展,并很快分享更多更新。
相关文章
佛罗里达州就暴力事件起诉 OpenAI 和萨姆·阿尔特曼
佛罗里达州总检察长于周一提起了一项史无前例的州级诉讼,起诉 OpenAI 及其首席执行官山姆·奥特曼(Sam Altman),指控该公司的 ChatGPT 与多起暴力事件有关。诉讼称,OpenAI 优先考虑赢得“人工智能军备竞赛并积累巨额财富”,而忽视了安全问题。“今天我们宣布了对 OpenAI 及其首席执行官山姆·奥特曼提起的首个全州性诉讼,”佛罗里达州总检察长詹姆斯·乌特迈尔(James Uthmeier)表示。“OpenAI 和奥特曼无视内部和外部的安全警告,使儿童面临巨大风险,并允许
OpenAI 发布了先进的语音模型,旨在实现更自然的实时对话
OpenAI 推出了两款新的对话模型——GPT-Live-1 和 GPT-Live-1 mini,旨在使对话听起来更自然,并更有效地管理对话轮次。这些全双工模型能够同时说话和聆听,允许用户自然地打断对话,并支持实时翻译等功能。该公司还正在将 GPT-Live-1 mini 作为默认选项,取代 ChatGPT 当前的“高级语音模式”。付费用户将能够使用规模更大的 GPT-Live-1 模型。 此前,
OpenAI 发布了 GPT-5.6,这是其模型系列中的最新成员
OpenAI 于周四发布了其最新模型系列,为竞争日益激烈的 AI 领域带来了强大的新选择。GPT-5.6 共有三个版本:Sol(作为主力机型设计)、Terra(中端选项)和 Luna(经济实惠的选择)。这些模型扩展了多个领域的能力,该公司承诺其在企业任务、编程和科学研究方面将表现出色。首席执行官萨姆·奥尔特曼表示,新模型比早期版本效率更高、性价比更优,他近日向CNBC透露,Sol在AI编程任务中的
相关专题推荐
评论 (26)
0/500
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?
在评估AI用于编码辅助时,我开发了一套四个标准化测试。这些测试对于评估AI如何支持你的编程工作至关重要。毕竟,你最不需要的就是一个会在你的代码中增加更多错误的AI,对吧?
不久前,一位读者质疑我的方法,建议AI可能在面对不同挑战时表现更好。这是一个合理的观点,但我坚持使用这些测试,因为它们简单直接。我使用PHP和JavaScript,这些语言并非最难的,并通过AI运行一些脚本查询。这种一致性使我们能够直接比较性能。
测试包括编写一个简单的WordPress插件、重写一个字符串函数、寻找一个我曾经苦恼的错误,以及使用编程工具从Chrome提取数据。这就像教人开车——如果他们连车道都出不了,你不会让他们在高速公路上自由行驶。
到目前为止,只有ChatGPT的GPT-4(及以上)大语言模型通过了所有这些测试。有趣的是,Perplexity Pro也成功了,但那是因为它基于GPT-4系列大语言模型。另一方面,Microsoft Copilot尽管使用了相同的模型,却未能通过任何测试。
Google的Gemini表现也好不到哪里去。最初,Bard(Gemini的早期名称)在大多数测试中失败,甚至Gemini Advanced(每月20美元)去年也未能通过四项测试中的三项。
但现在,Google推出了Gemini Pro 2.5,它对所有人免费,但有使用限制。我在测试中仅用两个提示就达到了这些限制,这有点限制性。可能是因为任务的复杂性而非提示数量导致了限制。我的前两个请求是编写一个完整的WordPress插件和修复一些代码,这可能比简单查询更快地消耗了我的限制。
尽管需要等待,结果却令人惊讶且值得。
测试1:编写一个简单的WordPress插件
这一次,Gemini Pro 2.5表现出色。挑战是创建一个WordPress插件,提供一个用户界面来随机化输入行并分发重复项,使它们不相邻。
之前,Gemini Advanced没有创建后端仪表板,而是要求在公共页面的正文中使用短代码。它确实创建了一个基本的用户界面,但点击按钮没有任何反应。无论我如何调整提示,它仍然失败。
但Gemini Pro 2.5提供了一个扎实的用户界面,代码如预期般工作。真正让我印象深刻的是插件的图标选择。大多数AI忽略这个细节,但Gemini Pro 2.5未经我提示就从WordPress Dashicon集中选择了一个相关图标。代码文档齐全,每个主要部分都解释得很清楚。
测试2:重写一个字符串函数
在第二个测试中,我要求Gemini Pro 2.5修改一些字符串处理代码,以处理美元和美分,而不仅仅是整数。ChatGPT做对了,而Bard在最初失败后最终成功。
上次,Gemini Advanced以一种微妙但危险的方式失败。它不允许非十进制输入,并错误地将数字限制在小数点前两位,误解了美元和美分的概念。这种错误如果不被发现,可能会导致大量错误报告。
然而,Gemini Pro 2.5完美应对。它正确检查了输入类型,修剪了空格,修复了正则表达式以处理前导零和小数输入,并拒绝了负数输入。代码注释完善,包含一整套测试示例。虽然它不允许分组逗号或前导货币符号,但这些是可控的错误,不是崩溃,所以我认为它通过了。
测试3:寻找一个错误
曾经,我在代码中遇到了一个本应工作但没有工作的错误。这个问题很棘手,当我专注于传递的参数数量时,ChatGPT指出我需要更改一个钩子。
Bard和Meta都没有找到问题,沿着我走过的无用路径。2024年2月,Gemini Advanced建议“可能在插件或WordPress的其他地方”,这毫无帮助。
使用Gemini Pro 2.5时,我在前两个测试后达到了使用限制,所以我不得不等到第二天。当我终于运行测试时,Gemini Pro 2.5不仅找到了错误,还清楚地告诉我修复的位置,并附上了一个有用的图表。
测试4:编写一个脚本
最后一个测试涉及理解Chrome的内部对象模型、AppleScript和Keyboard Maestro,一个宏构建工具。任务是打开Chrome标签并根据参数设置活动标签。
大多数AI能很好地处理Chrome和AppleScript部分,但常常在Keyboard Maestro上遇到困难。然而,Gemini Pro 2.5做对了。它编写了正确传递变量的必要代码,添加了错误检查和用户通知,甚至提供了设置Keyboard Maestro的步骤。
通过了所有四个测试,Gemini Pro 2.5加入了能够真正协助编程任务的AI工具精英群体。
Google的AI赶上OpenAI的产品只是时间问题。Google 2017年的“Attention is all you need”论文开启了生成式AI热潮,所以他们达到这一水平并不令人惊讶。Gemini Pro 2.5比ChatGPT Plus慢,响应时间在15秒到一分钟之间,但准确性比速度更重要。
Google还免费提供了Google Code Assist,限制较为宽松,但前提是生成的代码质量高。有了Gemini Pro 2.5,这种质量现在显而易见。虽然目前标记为“实验性”,我预计Google会很快完善它,可能提供一个限制较少的付费版本。
显然,Gemini Pro 2.5将在编码辅助领域挑战ChatGPT。我会密切关注这一发展,并很快分享更多更新。
佛罗里达州就暴力事件起诉 OpenAI 和萨姆·阿尔特曼
佛罗里达州总检察长于周一提起了一项史无前例的州级诉讼,起诉 OpenAI 及其首席执行官山姆·奥特曼(Sam Altman),指控该公司的 ChatGPT 与多起暴力事件有关。诉讼称,OpenAI 优先考虑赢得“人工智能军备竞赛并积累巨额财富”,而忽视了安全问题。“今天我们宣布了对 OpenAI 及其首席执行官山姆·奥特曼提起的首个全州性诉讼,”佛罗里达州总检察长詹姆斯·乌特迈尔(James Uthmeier)表示。“OpenAI 和奥特曼无视内部和外部的安全警告,使儿童面临巨大风险,并允许
OpenAI 发布了先进的语音模型,旨在实现更自然的实时对话
OpenAI 推出了两款新的对话模型——GPT-Live-1 和 GPT-Live-1 mini,旨在使对话听起来更自然,并更有效地管理对话轮次。这些全双工模型能够同时说话和聆听,允许用户自然地打断对话,并支持实时翻译等功能。该公司还正在将 GPT-Live-1 mini 作为默认选项,取代 ChatGPT 当前的“高级语音模式”。付费用户将能够使用规模更大的 GPT-Live-1 模型。 此前,
OpenAI 发布了 GPT-5.6,这是其模型系列中的最新成员
OpenAI 于周四发布了其最新模型系列,为竞争日益激烈的 AI 领域带来了强大的新选择。GPT-5.6 共有三个版本:Sol(作为主力机型设计)、Terra(中端选项)和 Luna(经济实惠的选择)。这些模型扩展了多个领域的能力,该公司承诺其在企业任务、编程和科学研究方面将表现出色。首席执行官萨姆·奥尔特曼表示,新模型比早期版本效率更高、性价比更优,他近日向CNBC透露,Sol在AI编程任务中的
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?





首页






