Gemini Pro 2.5:強大的編碼助手,對Chatgpt構成重大威脅
在評估用於程式設計輔助的AI時,我開發了一套四項標準化測試。這些測試對於評估AI如何有效支持您的程式設計工作至關重要。畢竟,您最不希望的是AI為您的程式碼添加更多錯誤,對吧?
不久前,一位讀者質疑我的方法,認為AI在不同挑戰下可能表現更好。這是一個合理的觀點,但我堅持這些測試,因為它們簡單直接。我使用PHP和JavaScript,這兩種語言並非最困難的,並通過AI運行一些腳本查詢。這種一致性讓我們可以直接比較性能。
測試包括撰寫一個簡單的WordPress插件、重寫一個字串函數、尋找我曾經苦惱的錯誤,以及使用程式設計工具從Chrome提取資料。這就像教人開車——如果他們連車道都開不出來,你不會讓他們在高速公路上自由駕駛。
至今,只有ChatGPT的GPT-4(及以上)LLM通過了所有這些測試。有趣的是,Perplexity Pro也成功了,但那是因為它運行在GPT-4系列LLM上。另一方面,Microsoft Copilot儘管使用相同的LLM,卻未能通過任何一項測試。
Google的Gemini表現也好不到哪裡去。最初,Bard(Gemini的早期名稱)未能通過大多數測試,甚至Gemini Advanced(每月20美元)在去年也未能通過四項中的三項測試。
但現在,Google推出了Gemini Pro 2.5,且對所有人免費,儘管有使用限制。在測試中,我僅僅兩次提示後就達到了這些限制,這有點限制。可能是使用限制基於任務的複雜性而非提示次數。我的前兩個請求是撰寫一個完整的WordPress插件和修復一些程式碼,這可能比簡單查詢更快耗盡了我的限制。
儘管需要等待,結果卻令人驚訝且值得。
測試1:撰寫一個簡單的WordPress插件
這次,Gemini Pro 2.5表現出色。挑戰是創建一個WordPress插件,提供用戶界面以隨機化輸入行並分佈重複項,使其不相鄰。
此前,Gemini Advanced未創建後端儀表板,而是要求在公開頁面的正文中使用短碼。它確實創建了一個基本UI,但點擊按鈕毫無反應。無論我如何調整提示,它仍然失敗。
但Gemini Pro 2.5提供了穩固的UI,程式碼按預期運行。真正讓我印象深刻的是插件的圖標選擇。大多數AI忽略這個細節,但Gemini Pro 2.5未經提示就從WordPress Dashicon集中選擇了一個相關圖標。程式碼文檔完善,每個主要部分都有清晰的解釋。

截圖由David Gewirtz/ZDNET提供 
截圖由David Gewirtz/ZDNET提供 測試2:重寫字串函數
在第二項測試中,我要求Gemini Pro 2.5修改一些字串處理程式碼,以處理美元和美分,而不僅僅是整數。ChatGPT正確完成了這項任務,而Bard在最初失敗後最終成功。
上次,Gemini Advanced以微妙但危險的方式失敗。它不允許非小數輸入,並錯誤地將數字限制在小數點前兩位,誤解了美元和美分的概念。如果未被發現,這種錯誤可能導致大量錯誤報告。
然而,Gemini Pro 2.5完美解決了問題。它正確檢查輸入類型,修剪空白,修復正則表達式以處理前導零和小數輸入,並拒絕負數輸入。程式碼有詳細的註釋,並提供了一整套測試範例。雖然它不允許分組逗號或前導貨幣符號,但這些是可控的錯誤,而非崩潰,因此我認為它通過了測試。
測試3:尋找錯誤
有一次,我在程式碼中遇到了一個本應運作但實際上沒有的錯誤。這個問題很棘手,當我專注於傳遞的參數數量時,ChatGPT指出我需要在鉤子中更改一些內容。
Bard和Meta都錯過了目標,沿著我走過的無效路徑。2024年2月,Gemini Advanced建議問題「可能在插件或WordPress的其他地方」,這毫無幫助。
使用Gemini Pro 2.5時,我在前兩個測試後達到了使用限制,因此不得不等到第二天。當我最終運行測試時,Gemini Pro 2.5不僅找到了錯誤,還清楚地告訴我如何修復,並附上了一個有用的圖表。

截圖由David Gewirtz/ZDNET提供 
截圖由David Gewirtz/ZDNET提供 測試4:撰寫腳本
最後一項測試涉及理解Chrome的內部對象模型、AppleScript和Keyboard Maestro(一個宏構建工具)。測試內容是打開Chrome標籤並根據參數設置活動標籤。
大多數AI能很好處理Chrome和AppleScript部分,但常常在Keyboard Maestro上遇到困難。然而,Gemini Pro 2.5正確完成了任務。它撰寫了正確傳遞變量的程式碼,添加了錯誤檢查和用戶通知,甚至提供了設置Keyboard Maestro的步驟。

截圖由David Gewirtz/ZDNET提供 通過所有四項測試,Gemini Pro 2.5加入了真正能協助程式設計任務的頂尖AI工具行列。
Google的AI趕上OpenAI的產品只是時間問題。Google 2017年的「Attention is all you need」論文開啟了生成式AI熱潮,因此他們達到這一點並不令人意外。Gemini Pro 2.5比ChatGPT Plus慢,回應時間在15秒到一分鐘之間,但準確性比速度更重要。
Google還免費提供了Google Code Assist,限制較為寬鬆,但前提是生成的程式碼品質高。有了Gemini Pro 2.5,這種品質現在顯而易見。雖然目前標記為「實驗性」,我預計Google很快會改進它,或許會推出使用限制較少的付費版本。
顯然,Gemini Pro 2.5將在程式設計輔助領域挑戰ChatGPT。我將密切關注這一發展,並很快分享更多更新。
相關文章
佛羅里達州就暴力事件起訴 OpenAI 和薩姆·阿爾特曼
佛羅里達州總檢察長於週一提起了一項史無前例的州級訴訟,起訴 OpenAI 及其執行長山姆·奧特曼(Sam Altman),指控該公司的 ChatGPT 與多起暴力事件有關。訴訟稱,OpenAI 優先考慮贏得“人工智慧軍備競賽並積累鉅額財富”,而忽視了安全問題。“今天我們宣佈了對 OpenAI 及其執行長山姆·奧特曼提起的首個全州性訴訟,”佛羅里達州總檢察長詹姆斯·烏特邁爾(James Uthmeier)表示。“OpenAI 和奧特曼無視內部和外部的安全警告,使兒童面臨巨大風險,並允許
OpenAI 推出先進的語音模型,以實現更自然的即時對話
OpenAI 已推出兩款新的對話模型——GPT-Live-1 與 GPT-Live-1 mini,旨在讓對話聽起來更自然,並更有效地管理對話輪次。這些全雙工模型能夠同時說話和聆聽,讓使用者能自然地打斷對話,並支援即時翻譯等功能。該公司同時將 GPT-Live-1 mini 作為預設選項,取代 ChatGPT 當前的高階語音模式。付費級別的使用者則可使用規模更大的 GPT-Live-1 模型。 此前
OpenAI 推出 GPT-5.6,這是其模型系列中的最新成員
OpenAI 於週四推出其最新模型系列,為日益競爭激烈的 AI 領域帶來了強大且嶄新的選擇。GPT-5.6 共有三種變體:Sol(設計為主力機型)、Terra(中階選項)以及 Luna(經濟實惠的選擇)。這些模型擴展了跨領域的能力,該公司承諾在企業任務、程式設計及科學研究方面都能展現強勁表現。執行長山姆·奧特曼(Sam Altman)表示,新模型相較於早期版本在效率與成本效益方面都有顯著提升;他近
相關專題推薦
評論 (26)
0/500
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?
在評估用於程式設計輔助的AI時,我開發了一套四項標準化測試。這些測試對於評估AI如何有效支持您的程式設計工作至關重要。畢竟,您最不希望的是AI為您的程式碼添加更多錯誤,對吧?
不久前,一位讀者質疑我的方法,認為AI在不同挑戰下可能表現更好。這是一個合理的觀點,但我堅持這些測試,因為它們簡單直接。我使用PHP和JavaScript,這兩種語言並非最困難的,並通過AI運行一些腳本查詢。這種一致性讓我們可以直接比較性能。
測試包括撰寫一個簡單的WordPress插件、重寫一個字串函數、尋找我曾經苦惱的錯誤,以及使用程式設計工具從Chrome提取資料。這就像教人開車——如果他們連車道都開不出來,你不會讓他們在高速公路上自由駕駛。
至今,只有ChatGPT的GPT-4(及以上)LLM通過了所有這些測試。有趣的是,Perplexity Pro也成功了,但那是因為它運行在GPT-4系列LLM上。另一方面,Microsoft Copilot儘管使用相同的LLM,卻未能通過任何一項測試。
Google的Gemini表現也好不到哪裡去。最初,Bard(Gemini的早期名稱)未能通過大多數測試,甚至Gemini Advanced(每月20美元)在去年也未能通過四項中的三項測試。
但現在,Google推出了Gemini Pro 2.5,且對所有人免費,儘管有使用限制。在測試中,我僅僅兩次提示後就達到了這些限制,這有點限制。可能是使用限制基於任務的複雜性而非提示次數。我的前兩個請求是撰寫一個完整的WordPress插件和修復一些程式碼,這可能比簡單查詢更快耗盡了我的限制。
儘管需要等待,結果卻令人驚訝且值得。
測試1:撰寫一個簡單的WordPress插件
這次,Gemini Pro 2.5表現出色。挑戰是創建一個WordPress插件,提供用戶界面以隨機化輸入行並分佈重複項,使其不相鄰。
此前,Gemini Advanced未創建後端儀表板,而是要求在公開頁面的正文中使用短碼。它確實創建了一個基本UI,但點擊按鈕毫無反應。無論我如何調整提示,它仍然失敗。
但Gemini Pro 2.5提供了穩固的UI,程式碼按預期運行。真正讓我印象深刻的是插件的圖標選擇。大多數AI忽略這個細節,但Gemini Pro 2.5未經提示就從WordPress Dashicon集中選擇了一個相關圖標。程式碼文檔完善,每個主要部分都有清晰的解釋。
測試2:重寫字串函數
在第二項測試中,我要求Gemini Pro 2.5修改一些字串處理程式碼,以處理美元和美分,而不僅僅是整數。ChatGPT正確完成了這項任務,而Bard在最初失敗後最終成功。
上次,Gemini Advanced以微妙但危險的方式失敗。它不允許非小數輸入,並錯誤地將數字限制在小數點前兩位,誤解了美元和美分的概念。如果未被發現,這種錯誤可能導致大量錯誤報告。
然而,Gemini Pro 2.5完美解決了問題。它正確檢查輸入類型,修剪空白,修復正則表達式以處理前導零和小數輸入,並拒絕負數輸入。程式碼有詳細的註釋,並提供了一整套測試範例。雖然它不允許分組逗號或前導貨幣符號,但這些是可控的錯誤,而非崩潰,因此我認為它通過了測試。
測試3:尋找錯誤
有一次,我在程式碼中遇到了一個本應運作但實際上沒有的錯誤。這個問題很棘手,當我專注於傳遞的參數數量時,ChatGPT指出我需要在鉤子中更改一些內容。
Bard和Meta都錯過了目標,沿著我走過的無效路徑。2024年2月,Gemini Advanced建議問題「可能在插件或WordPress的其他地方」,這毫無幫助。
使用Gemini Pro 2.5時,我在前兩個測試後達到了使用限制,因此不得不等到第二天。當我最終運行測試時,Gemini Pro 2.5不僅找到了錯誤,還清楚地告訴我如何修復,並附上了一個有用的圖表。
測試4:撰寫腳本
最後一項測試涉及理解Chrome的內部對象模型、AppleScript和Keyboard Maestro(一個宏構建工具)。測試內容是打開Chrome標籤並根據參數設置活動標籤。
大多數AI能很好處理Chrome和AppleScript部分,但常常在Keyboard Maestro上遇到困難。然而,Gemini Pro 2.5正確完成了任務。它撰寫了正確傳遞變量的程式碼,添加了錯誤檢查和用戶通知,甚至提供了設置Keyboard Maestro的步驟。
通過所有四項測試,Gemini Pro 2.5加入了真正能協助程式設計任務的頂尖AI工具行列。
Google的AI趕上OpenAI的產品只是時間問題。Google 2017年的「Attention is all you need」論文開啟了生成式AI熱潮,因此他們達到這一點並不令人意外。Gemini Pro 2.5比ChatGPT Plus慢,回應時間在15秒到一分鐘之間,但準確性比速度更重要。
Google還免費提供了Google Code Assist,限制較為寬鬆,但前提是生成的程式碼品質高。有了Gemini Pro 2.5,這種品質現在顯而易見。雖然目前標記為「實驗性」,我預計Google很快會改進它,或許會推出使用限制較少的付費版本。
顯然,Gemini Pro 2.5將在程式設計輔助領域挑戰ChatGPT。我將密切關注這一發展,並很快分享更多更新。
佛羅里達州就暴力事件起訴 OpenAI 和薩姆·阿爾特曼
佛羅里達州總檢察長於週一提起了一項史無前例的州級訴訟,起訴 OpenAI 及其執行長山姆·奧特曼(Sam Altman),指控該公司的 ChatGPT 與多起暴力事件有關。訴訟稱,OpenAI 優先考慮贏得“人工智慧軍備競賽並積累鉅額財富”,而忽視了安全問題。“今天我們宣佈了對 OpenAI 及其執行長山姆·奧特曼提起的首個全州性訴訟,”佛羅里達州總檢察長詹姆斯·烏特邁爾(James Uthmeier)表示。“OpenAI 和奧特曼無視內部和外部的安全警告,使兒童面臨巨大風險,並允許
OpenAI 推出先進的語音模型,以實現更自然的即時對話
OpenAI 已推出兩款新的對話模型——GPT-Live-1 與 GPT-Live-1 mini,旨在讓對話聽起來更自然,並更有效地管理對話輪次。這些全雙工模型能夠同時說話和聆聽,讓使用者能自然地打斷對話,並支援即時翻譯等功能。該公司同時將 GPT-Live-1 mini 作為預設選項,取代 ChatGPT 當前的高階語音模式。付費級別的使用者則可使用規模更大的 GPT-Live-1 模型。 此前
OpenAI 推出 GPT-5.6,這是其模型系列中的最新成員
OpenAI 於週四推出其最新模型系列,為日益競爭激烈的 AI 領域帶來了強大且嶄新的選擇。GPT-5.6 共有三種變體:Sol(設計為主力機型)、Terra(中階選項)以及 Luna(經濟實惠的選擇)。這些模型擴展了跨領域的能力,該公司承諾在企業任務、程式設計及科學研究方面都能展現強勁表現。執行長山姆·奧特曼(Sam Altman)表示,新模型相較於早期版本在效率與成本效益方面都有顯著提升;他近
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?





首頁






