Hogar
AI de copilot de GitHub probado: El éxito de codificación mixta me deja desconcertado
Explorando las inconsistencias en las herramientas de codificación de IA
Es realmente desconcertante cómo las herramientas de IA, todas construidas sobre el mismo modelo de lenguaje grande fundacional, pueden producir resultados tan variados. Por ejemplo, ChatGPT, Perplexity y GitHub Copilot aprovechan el modelo GPT-4 de OpenAI. Sin embargo, mis pruebas recientes mostraron diferencias marcadas en el rendimiento: mientras que los planes pro de ChatGPT y Perplexity destacaron, GitHub Copilot tuvo una tasa de éxito del 50%.
Realicé estas pruebas usando GitHub Copilot integrado en un entorno de VS Code. Compartiré una guía detallada sobre cómo configurarlo en un próximo artículo. Por ahora, profundicemos en los detalles de las pruebas que realicé.
Si tienes curiosidad sobre mi metodología de prueba y los prompts utilizados, puedes consultar mi guía detallada sobre la evaluación de las capacidades de codificación de un chatbot de IA.
TL;DR: GitHub Copilot logró pasar dos de las cuatro pruebas que realicé.
Prueba 1: Escribir un plugin de WordPress
Esta prueba fue una completa decepción. Fue mi experimento inicial, dejándome inseguro de si GitHub Copilot tiene dificultades con la codificación o si las restricciones de interacción dentro de VS Code limitan sus capacidades.
Aquí está el contexto: pedí a la IA que desarrollara un plugin de WordPress completamente funcional que incluyera una interfaz de administración y lógica operativa. La tarea del plugin era aceptar una lista de nombres, ordenarlos y separar cualquier duplicado para evitar que estuvieran adyacentes.
Esta tarea surgió de una necesidad del mundo real de la tienda de comercio electrónico de bienes digitales de mi esposa, donde ella gestiona un grupo activo de Facebook.
Mientras que cinco de los diez modelos de IA probados pasaron esta prueba completamente, tres pasaron parcialmente y dos, incluido Microsoft Copilot, fallaron completamente. GitHub Copilot, a pesar de recibir el mismo prompt, solo produjo código PHP. Aunque el problema podía resolverse con PHP solo, GitHub Copilot intentó referirse a JavaScript sin generarlo realmente.

Captura de pantalla por David Gewirtz/ZDNET Cuando intenté solicitar a GitHub Copilot desde un archivo JavaScript para completar la tarea, respondió de manera extraña con más código PHP, aún haciendo referencia a un archivo JavaScript inexistente.

Captura de pantalla por David Gewirtz/ZDNET Prueba 2: Reescribir una función de cadena
Esta prueba fue relativamente sencilla: proporcioné una función destinada a validar dólares y centavos, pero solo verificaba dólares enteros. El desafío era que la IA corrigiera la función.
GitHub Copilot modificó el código, pero el resultado fue problemático. Asumió que cualquier cadena de entrada era válida, lo que causaría errores si la cadena estaba vacía. Además, la expresión regular actualizada no podía manejar varios casos extremos, como entradas como "3.", ".3" o "00.30". Para una función destinada a validar moneda, tales omisiones son inaceptables, marcando otro fallo para GitHub Copilot.
Prueba 3: Encontrar un error molesto
Aquí, GitHub Copilot brilló. Esta prueba se basó en un desafío de codificación real que enfrenté, donde el mensaje de error no apuntaba directamente al problema real. Es algo así como un acertijo de codificación, que requiere una comprensión profunda de las llamadas a la API de WordPress para resolverlo.
Mientras que Microsoft Copilot, Gemini y Meta Code Llama tropezaron en esta prueba, GitHub Copilot lo logró, mostrando su capacidad para abordar problemas complejos del mundo real.
Prueba 4: Escribir un script
GitHub Copilot también tuvo éxito en esta prueba, donde Microsoft Copilot se quedó corto. La tarea involucraba crear un script que necesitaba integrar AppleScript, el modelo de objetos de Chrome y una utilidad específica de Mac llamada Keyboard Maestro.
Para pasar, la IA necesitaba reconocer y abordar los matices de los tres entornos, y GitHub Copilot lo hizo exactamente.
Pensamientos finales
Es desalentador ver que GitHub Copilot, que utiliza el modelo avanzado GPT-4, falló en la mitad de las pruebas. Dado el estatus de GitHub como una plataforma líder de gestión de código fuente, uno esperaría que su soporte de codificación de IA fuera más confiable.
Sin embargo, el mundo de la IA está en constante evolución, y soy optimista de que el rendimiento de GitHub Copilot mejorará con el tiempo. Volveremos a revisarlo en unos meses para ver cómo ha progresado.
¿Dependes de la IA para asistencia en codificación? ¿Qué herramienta de IA es tu preferida? ¿Has probado GitHub Copilot? Comparte tus experiencias en los comentarios a continuación.
Mantente actualizado con el progreso diario de mi proyecto en las redes sociales. No olvides suscribirte a mi boletín semanal y seguirme en Twitter/X en @DavidGewirtz, en Facebook en Facebook.com/DavidGewirtz, en Instagram en Instagram.com/DavidGewirtz, en Bluesky en @DavidGewirtz.com y en YouTube en YouTube.com/DavidGewirtzTV.
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (41)
0/500
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!
Explorando las inconsistencias en las herramientas de codificación de IA
Es realmente desconcertante cómo las herramientas de IA, todas construidas sobre el mismo modelo de lenguaje grande fundacional, pueden producir resultados tan variados. Por ejemplo, ChatGPT, Perplexity y GitHub Copilot aprovechan el modelo GPT-4 de OpenAI. Sin embargo, mis pruebas recientes mostraron diferencias marcadas en el rendimiento: mientras que los planes pro de ChatGPT y Perplexity destacaron, GitHub Copilot tuvo una tasa de éxito del 50%.
Realicé estas pruebas usando GitHub Copilot integrado en un entorno de VS Code. Compartiré una guía detallada sobre cómo configurarlo en un próximo artículo. Por ahora, profundicemos en los detalles de las pruebas que realicé.
Si tienes curiosidad sobre mi metodología de prueba y los prompts utilizados, puedes consultar mi guía detallada sobre la evaluación de las capacidades de codificación de un chatbot de IA.
TL;DR: GitHub Copilot logró pasar dos de las cuatro pruebas que realicé.
Prueba 1: Escribir un plugin de WordPress
Esta prueba fue una completa decepción. Fue mi experimento inicial, dejándome inseguro de si GitHub Copilot tiene dificultades con la codificación o si las restricciones de interacción dentro de VS Code limitan sus capacidades.
Aquí está el contexto: pedí a la IA que desarrollara un plugin de WordPress completamente funcional que incluyera una interfaz de administración y lógica operativa. La tarea del plugin era aceptar una lista de nombres, ordenarlos y separar cualquier duplicado para evitar que estuvieran adyacentes.
Esta tarea surgió de una necesidad del mundo real de la tienda de comercio electrónico de bienes digitales de mi esposa, donde ella gestiona un grupo activo de Facebook.
Mientras que cinco de los diez modelos de IA probados pasaron esta prueba completamente, tres pasaron parcialmente y dos, incluido Microsoft Copilot, fallaron completamente. GitHub Copilot, a pesar de recibir el mismo prompt, solo produjo código PHP. Aunque el problema podía resolverse con PHP solo, GitHub Copilot intentó referirse a JavaScript sin generarlo realmente.
Cuando intenté solicitar a GitHub Copilot desde un archivo JavaScript para completar la tarea, respondió de manera extraña con más código PHP, aún haciendo referencia a un archivo JavaScript inexistente.
Prueba 2: Reescribir una función de cadena
Esta prueba fue relativamente sencilla: proporcioné una función destinada a validar dólares y centavos, pero solo verificaba dólares enteros. El desafío era que la IA corrigiera la función.
GitHub Copilot modificó el código, pero el resultado fue problemático. Asumió que cualquier cadena de entrada era válida, lo que causaría errores si la cadena estaba vacía. Además, la expresión regular actualizada no podía manejar varios casos extremos, como entradas como "3.", ".3" o "00.30". Para una función destinada a validar moneda, tales omisiones son inaceptables, marcando otro fallo para GitHub Copilot.
Prueba 3: Encontrar un error molesto
Aquí, GitHub Copilot brilló. Esta prueba se basó en un desafío de codificación real que enfrenté, donde el mensaje de error no apuntaba directamente al problema real. Es algo así como un acertijo de codificación, que requiere una comprensión profunda de las llamadas a la API de WordPress para resolverlo.
Mientras que Microsoft Copilot, Gemini y Meta Code Llama tropezaron en esta prueba, GitHub Copilot lo logró, mostrando su capacidad para abordar problemas complejos del mundo real.
Prueba 4: Escribir un script
GitHub Copilot también tuvo éxito en esta prueba, donde Microsoft Copilot se quedó corto. La tarea involucraba crear un script que necesitaba integrar AppleScript, el modelo de objetos de Chrome y una utilidad específica de Mac llamada Keyboard Maestro.
Para pasar, la IA necesitaba reconocer y abordar los matices de los tres entornos, y GitHub Copilot lo hizo exactamente.
Pensamientos finales
Es desalentador ver que GitHub Copilot, que utiliza el modelo avanzado GPT-4, falló en la mitad de las pruebas. Dado el estatus de GitHub como una plataforma líder de gestión de código fuente, uno esperaría que su soporte de codificación de IA fuera más confiable.
Sin embargo, el mundo de la IA está en constante evolución, y soy optimista de que el rendimiento de GitHub Copilot mejorará con el tiempo. Volveremos a revisarlo en unos meses para ver cómo ha progresado.
¿Dependes de la IA para asistencia en codificación? ¿Qué herramienta de IA es tu preferida? ¿Has probado GitHub Copilot? Comparte tus experiencias en los comentarios a continuación.
Mantente actualizado con el progreso diario de mi proyecto en las redes sociales. No olvides suscribirte a mi boletín semanal y seguirme en Twitter/X en @DavidGewirtz, en Facebook en Facebook.com/DavidGewirtz, en Instagram en Instagram.com/DavidGewirtz, en Bluesky en @DavidGewirtz.com y en YouTube en YouTube.com/DavidGewirtzTV.
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!











