Maison
Gemini Pro 2.5: un puissant assistant de codage représentant une menace majeure pour le chatpt
Lorsqu'il s'agit d'évaluer l'IA pour l'assistance au codage, j'ai développé un ensemble de quatre tests standardisés. Ces tests sont cruciaux pour évaluer dans quelle mesure une IA peut soutenir vos efforts de programmation. Après tout, la dernière chose dont vous avez besoin est une IA qui ajoute encore plus de bugs à votre code, n'est-ce pas ?
Il y a quelque temps, un lecteur a remis en question mon approche, suggérant que les IA pourraient mieux performer avec des défis différents. C'est un point valable, mais je m'en tiens à ces tests car ils sont simples. J'utilise PHP et JavaScript, qui ne sont pas les langages les plus difficiles, et j'exécute quelques requêtes de script via les IA. Cette cohérence nous permet de comparer directement les performances.
Les tests incluent l'écriture d'un plugin WordPress simple, la réécriture d'une fonction de chaîne, la recherche d'un bug qui m'a autrefois posé problème, et l'utilisation d'outils de programmation pour extraire des données de Chrome. C'est comme apprendre à quelqu'un à conduire — vous ne le laisseriez pas s'élancer sur une autoroute s'il ne peut même pas sortir de l'allée.
À ce jour, seul le modèle GPT-4 (et supérieur) de ChatGPT a réussi tous ces tests. Fait intéressant, Perplexity Pro a également réussi, mais c'est parce qu'il repose sur la série de modèles GPT-4. En revanche, Microsoft Copilot, malgré l'utilisation du même modèle, a échoué à tous les tests.
Le Gemini de Google n'a pas fait beaucoup mieux. Initialement, Bard (le premier nom de Gemini) a échoué à la plupart des tests, et même Gemini Advanced, qui coûte 20 $ par mois, a échoué à trois des quatre tests l'année dernière.
Mais maintenant, Google a introduit Gemini Pro 2.5, et il est gratuit pour tout le monde, bien qu'avec des limites de taux. J'ai atteint ces limites après seulement deux invites lors de mes tests, ce qui est un peu restrictif. Il est possible que la limitation de taux soit basée sur la complexité des tâches plutôt que sur le nombre d'invites. Mes deux premières requêtes consistaient à écrire un plugin WordPress complet et à corriger du code, ce qui pourrait avoir consommé ma limite plus rapidement que des requêtes plus simples.
Malgré l'attente, les résultats étaient surprenants et en valaient la peine.
Test 1 : Écrire un plugin WordPress simple
Cette fois-ci, Gemini Pro 2.5 a fait un carton. Le défi consistait à créer un plugin WordPress qui fournit une interface utilisateur pour randomiser les lignes d'entrée et répartir les doublons afin qu'ils ne soient pas adjacents.
Auparavant, Gemini Advanced n'avait pas créé de tableau de bord backend mais nécessitait un shortcode dans le texte d'une page publique. Il avait créé une interface utilisateur basique, mais cliquer sur le bouton ne faisait rien. Peu importe comment j'ajustais les invites, cela échouait toujours.
Mais Gemini Pro 2.5 a fourni une interface utilisateur solide, et le code fonctionnait comme prévu. Ce qui m'a vraiment impressionné, c'était le choix de l'icône pour le plugin. La plupart des IA ignorent ce détail, mais Gemini Pro 2.5 a choisi une icône pertinente dans l'ensemble Dashicon de WordPress sans aucune incitation de ma part. Le code était bien documenté, chaque segment majeur étant clairement expliqué.

Capture d’écran par David Gewirtz/ZDNET 
Capture d’écran par David Gewirtz/ZDNET Test 2 : Réécrire une fonction de chaîne
Dans le deuxième test, j'ai demandé à Gemini Pro 2.5 de modifier un code de traitement de chaîne pour gérer les dollars et les cents, pas seulement les entiers. ChatGPT a réussi ce test, tandis que Bard a finalement réussi après des échecs initiaux.
La dernière fois, Gemini Advanced a échoué de manière subtile mais dangereuse. Il n'acceptait pas les entrées non décimales et limitait incorrectement les nombres à deux chiffres avant la virgule, mécomprenant le concept des dollars et des cents. Ce type d'erreur pourrait entraîner une avalanche de rapports de bugs si elle n'est pas détectée.
Gemini Pro 2.5, cependant, a réussi brillamment. Il a correctement vérifié les types d'entrée, supprimé les espaces, corrigé l'expression régulière pour gérer les zéros en début de chaîne et les entrées uniquement décimales, et rejeté les entrées négatives. Le code était bien commenté, avec un ensemble complet d'exemples de tests. Bien qu'il n'ait pas permis les virgules de regroupement ou les symboles de devise en tête, ce étaient des erreurs contrôlées, pas des plantages, donc je considère cela comme un succès.
Test 3 : Trouver un bug
Une fois, j'ai lutté avec un bug dans mon code qui aurait dû fonctionner mais ne le faisait pas. Le problème était délicat, et alors que je me concentrais sur le nombre de paramètres passés, ChatGPT m'a fait remarquer que je devais changer quelque chose dans un hook.
Bard et Meta ont tous deux manqué la cible, suivant le même chemin futile que moi. Gemini Advanced, en février 2024, a suggéré de chercher "probablement ailleurs dans le plugin ou WordPress", ce qui n'était pas utile.
Avec Gemini Pro 2.5, j'ai atteint la limite de taux après les deux premiers tests, donc j'ai dû attendre le lendemain. Quand j'ai enfin effectué le test, Gemini Pro 2.5 a non seulement trouvé le bug mais m'a aussi montré exactement où le corriger, avec un diagramme utile.

Capture d’écran par David Gewirtz/ZDNET 
Capture d’écran par David Gewirtz/ZDNET Test 4 : Écrire un script
Le test final implique de comprendre le modèle d'objet interne de Chrome, AppleScript et Keyboard Maestro, un outil de création de macros. Il s'agit d'ouvrir des onglets Chrome et de définir l'onglet actif en fonction d'un paramètre.
La plupart des IA gèrent bien les parties Chrome et AppleScript mais luttent souvent avec Keyboard Maestro. Gemini Pro 2.5, cependant, a réussi. Il a écrit le code nécessaire pour passer correctement les variables, ajouté des vérifications d'erreurs et des notifications utilisateur, et même fourni des étapes pour configurer Keyboard Maestro.

Capture d’écran par David Gewirtz/ZDNET Avec les quatre tests réussis, Gemini Pro 2.5 rejoint le groupe élite des outils d'IA qui peuvent véritablement aider dans les tâches de programmation.
Il ne s'agissait que d'une question de temps avant que l'IA de Google ne rattrape les offres d'OpenAI. L'article de Google de 2017 "Attention is all you need" a lancé le boom de l'IA générative, donc il n'est pas surprenant qu'ils aient atteint ce point. Gemini Pro 2.5 est plus lent que ChatGPT Plus, prenant entre 15 secondes et une minute pour répondre, mais la précision est plus importante que la vitesse.
Google a également rendu Google Code Assist gratuit avec des limites généreuses, mais cela n'a de valeur que si le code généré est de haute qualité. Avec Gemini Pro 2.5, cette qualité est maintenant évidente. Bien que marqué actuellement comme "expérimental", je m'attends à ce que Google affine cela bientôt, potentiellement en offrant une version payante avec moins de limites de taux.
Il est clair que Gemini Pro 2.5 est prêt à défier ChatGPT dans le domaine de l'assistance au codage. Je vais garder un œil attentif sur ce développement et partager plus de mises à jour bientôt.
Article connexe
La Floride intente un procès à OpenAI et Sam Altman pour des incidents violents
L’avocat général de la Floride a intenté lundi une action en justice au niveau de l’État, sans précédent, contre OpenAI et son PDG, Sam Altman, alléguant que le ChatGPT de l’entreprise est lié à plusieurs incidents violents.Le recours soutient qu’Op
OpenAI dévoile des modèles vocaux avancés pour des conversations en temps réel plus naturelles
OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuve
OpenAI dévoile GPT-5.6, le dernier-né de sa gamme de modèles
OpenAI a lancé jeudi sa dernière gamme de modèles, apportant ainsi de nouvelles options performantes dans un secteur de l'IA de plus en plus concurrentiel.GPT-5.6 se décline en trois variantes :
Recommandations de sujets spéciaux liés
commentaires (26)
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?
Lorsqu'il s'agit d'évaluer l'IA pour l'assistance au codage, j'ai développé un ensemble de quatre tests standardisés. Ces tests sont cruciaux pour évaluer dans quelle mesure une IA peut soutenir vos efforts de programmation. Après tout, la dernière chose dont vous avez besoin est une IA qui ajoute encore plus de bugs à votre code, n'est-ce pas ?
Il y a quelque temps, un lecteur a remis en question mon approche, suggérant que les IA pourraient mieux performer avec des défis différents. C'est un point valable, mais je m'en tiens à ces tests car ils sont simples. J'utilise PHP et JavaScript, qui ne sont pas les langages les plus difficiles, et j'exécute quelques requêtes de script via les IA. Cette cohérence nous permet de comparer directement les performances.
Les tests incluent l'écriture d'un plugin WordPress simple, la réécriture d'une fonction de chaîne, la recherche d'un bug qui m'a autrefois posé problème, et l'utilisation d'outils de programmation pour extraire des données de Chrome. C'est comme apprendre à quelqu'un à conduire — vous ne le laisseriez pas s'élancer sur une autoroute s'il ne peut même pas sortir de l'allée.
À ce jour, seul le modèle GPT-4 (et supérieur) de ChatGPT a réussi tous ces tests. Fait intéressant, Perplexity Pro a également réussi, mais c'est parce qu'il repose sur la série de modèles GPT-4. En revanche, Microsoft Copilot, malgré l'utilisation du même modèle, a échoué à tous les tests.
Le Gemini de Google n'a pas fait beaucoup mieux. Initialement, Bard (le premier nom de Gemini) a échoué à la plupart des tests, et même Gemini Advanced, qui coûte 20 $ par mois, a échoué à trois des quatre tests l'année dernière.
Mais maintenant, Google a introduit Gemini Pro 2.5, et il est gratuit pour tout le monde, bien qu'avec des limites de taux. J'ai atteint ces limites après seulement deux invites lors de mes tests, ce qui est un peu restrictif. Il est possible que la limitation de taux soit basée sur la complexité des tâches plutôt que sur le nombre d'invites. Mes deux premières requêtes consistaient à écrire un plugin WordPress complet et à corriger du code, ce qui pourrait avoir consommé ma limite plus rapidement que des requêtes plus simples.
Malgré l'attente, les résultats étaient surprenants et en valaient la peine.
Test 1 : Écrire un plugin WordPress simple
Cette fois-ci, Gemini Pro 2.5 a fait un carton. Le défi consistait à créer un plugin WordPress qui fournit une interface utilisateur pour randomiser les lignes d'entrée et répartir les doublons afin qu'ils ne soient pas adjacents.
Auparavant, Gemini Advanced n'avait pas créé de tableau de bord backend mais nécessitait un shortcode dans le texte d'une page publique. Il avait créé une interface utilisateur basique, mais cliquer sur le bouton ne faisait rien. Peu importe comment j'ajustais les invites, cela échouait toujours.
Mais Gemini Pro 2.5 a fourni une interface utilisateur solide, et le code fonctionnait comme prévu. Ce qui m'a vraiment impressionné, c'était le choix de l'icône pour le plugin. La plupart des IA ignorent ce détail, mais Gemini Pro 2.5 a choisi une icône pertinente dans l'ensemble Dashicon de WordPress sans aucune incitation de ma part. Le code était bien documenté, chaque segment majeur étant clairement expliqué.
Test 2 : Réécrire une fonction de chaîne
Dans le deuxième test, j'ai demandé à Gemini Pro 2.5 de modifier un code de traitement de chaîne pour gérer les dollars et les cents, pas seulement les entiers. ChatGPT a réussi ce test, tandis que Bard a finalement réussi après des échecs initiaux.
La dernière fois, Gemini Advanced a échoué de manière subtile mais dangereuse. Il n'acceptait pas les entrées non décimales et limitait incorrectement les nombres à deux chiffres avant la virgule, mécomprenant le concept des dollars et des cents. Ce type d'erreur pourrait entraîner une avalanche de rapports de bugs si elle n'est pas détectée.
Gemini Pro 2.5, cependant, a réussi brillamment. Il a correctement vérifié les types d'entrée, supprimé les espaces, corrigé l'expression régulière pour gérer les zéros en début de chaîne et les entrées uniquement décimales, et rejeté les entrées négatives. Le code était bien commenté, avec un ensemble complet d'exemples de tests. Bien qu'il n'ait pas permis les virgules de regroupement ou les symboles de devise en tête, ce étaient des erreurs contrôlées, pas des plantages, donc je considère cela comme un succès.
Test 3 : Trouver un bug
Une fois, j'ai lutté avec un bug dans mon code qui aurait dû fonctionner mais ne le faisait pas. Le problème était délicat, et alors que je me concentrais sur le nombre de paramètres passés, ChatGPT m'a fait remarquer que je devais changer quelque chose dans un hook.
Bard et Meta ont tous deux manqué la cible, suivant le même chemin futile que moi. Gemini Advanced, en février 2024, a suggéré de chercher "probablement ailleurs dans le plugin ou WordPress", ce qui n'était pas utile.
Avec Gemini Pro 2.5, j'ai atteint la limite de taux après les deux premiers tests, donc j'ai dû attendre le lendemain. Quand j'ai enfin effectué le test, Gemini Pro 2.5 a non seulement trouvé le bug mais m'a aussi montré exactement où le corriger, avec un diagramme utile.
Test 4 : Écrire un script
Le test final implique de comprendre le modèle d'objet interne de Chrome, AppleScript et Keyboard Maestro, un outil de création de macros. Il s'agit d'ouvrir des onglets Chrome et de définir l'onglet actif en fonction d'un paramètre.
La plupart des IA gèrent bien les parties Chrome et AppleScript mais luttent souvent avec Keyboard Maestro. Gemini Pro 2.5, cependant, a réussi. Il a écrit le code nécessaire pour passer correctement les variables, ajouté des vérifications d'erreurs et des notifications utilisateur, et même fourni des étapes pour configurer Keyboard Maestro.
Avec les quatre tests réussis, Gemini Pro 2.5 rejoint le groupe élite des outils d'IA qui peuvent véritablement aider dans les tâches de programmation.
Il ne s'agissait que d'une question de temps avant que l'IA de Google ne rattrape les offres d'OpenAI. L'article de Google de 2017 "Attention is all you need" a lancé le boom de l'IA générative, donc il n'est pas surprenant qu'ils aient atteint ce point. Gemini Pro 2.5 est plus lent que ChatGPT Plus, prenant entre 15 secondes et une minute pour répondre, mais la précision est plus importante que la vitesse.
Google a également rendu Google Code Assist gratuit avec des limites généreuses, mais cela n'a de valeur que si le code généré est de haute qualité. Avec Gemini Pro 2.5, cette qualité est maintenant évidente. Bien que marqué actuellement comme "expérimental", je m'attends à ce que Google affine cela bientôt, potentiellement en offrant une version payante avec moins de limites de taux.
Il est clair que Gemini Pro 2.5 est prêt à défier ChatGPT dans le domaine de l'assistance au codage. Je vais garder un œil attentif sur ce développement et partager plus de mises à jour bientôt.
La Floride intente un procès à OpenAI et Sam Altman pour des incidents violents
L’avocat général de la Floride a intenté lundi une action en justice au niveau de l’État, sans précédent, contre OpenAI et son PDG, Sam Altman, alléguant que le ChatGPT de l’entreprise est lié à plusieurs incidents violents.Le recours soutient qu’Op
OpenAI dévoile des modèles vocaux avancés pour des conversations en temps réel plus naturelles
OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuve
OpenAI dévoile GPT-5.6, le dernier-né de sa gamme de modèles
OpenAI a lancé jeudi sa dernière gamme de modèles, apportant ainsi de nouvelles options performantes dans un secteur de l'IA de plus en plus concurrentiel.GPT-5.6 se décline en trois variantes :
Oh great, another AI coding assistant claiming to be a 'threat' to ChatGPT. 🙄 I'll believe it when I see it actually fixing my spaghetti code without introducing new bugs. Standardized tests? Sounds like marketing fluff to me. Show me the real-world results!
Honestly, I've been burned by so-called "powerful" coding assistants before. The real test is whether it can refactor my spaghetti code without hallucinating imports. Gemini Pro 2.5 sounds promising, but I'll believe it when I see it on a real project 🤨
Also ich hab's mal mit Python getestet und muss sagen, die Fehleranalyse ist echt krass. Aber ob das wirklich eine 'Bedrohung' für ChatGPT ist? Die haben doch beide ihre Nischen. Hauptsache, die Preise bleiben im Wettbewerb vernünftig 😅
Como programador, siempre estoy buscando asistentes de IA confiables. Los cuatro tests estandarizados que describes suenan muy útiles, ¡debería probarlos con Gemini y ChatGPT! Si realmente supera en bugs, sería un cambio de juego. 🤔 ¿Habrá algún análisis de costo? A veces estas herramientas premium son caras.
Just read about Gemini Pro 2.5 and wow, those coding tests sound intense! 😅 Curious if it’ll really outshine ChatGPT or just hype. Anyone tried it yet?











