A IA do Github Copilot testada: sucesso de codificação mista me deixa confuso
Explorando as Inconsistências em Ferramentas de Codificação de IA
É realmente intrigante como ferramentas de IA, todas construídas sobre o mesmo modelo de linguagem de grande escala, podem produzir resultados tão variados. Por exemplo, ChatGPT, Perplexity e GitHub Copilot utilizam o modelo GPT-4 da OpenAI. No entanto, meus testes recentes mostraram diferenças gritantes no desempenho: enquanto os planos profissionais do ChatGPT e do Perplexity se destacaram, o GitHub Copilot teve uma taxa de sucesso de 50%.
Realizei esses testes usando o GitHub Copilot integrado a um ambiente VS Code. Compartilharei um guia detalhado sobre como configurar isso em um artigo futuro. Por enquanto, vamos mergulhar nos detalhes dos testes que realizei.
Se você está curioso sobre minha metodologia de teste e os prompts utilizados, pode conferir meu guia detalhado sobre como avaliar as capacidades de codificação de um chatbot de IA.
TL;DR: O GitHub Copilot conseguiu passar em dois dos quatro testes que realizei.
Teste 1: Escrevendo um Plugin para WordPress
Este teste foi uma completa decepção. Foi meu experimento inicial, deixando-me inseguro se o GitHub Copilot tem dificuldades com codificação ou se as limitações de interação dentro do VS Code prejudicam suas capacidades.
Aqui está o contexto: pedi à IA que desenvolvesse um plugin para WordPress totalmente funcional, que incluísse uma interface administrativa e lógica operacional. A tarefa do plugin era aceitar uma lista de nomes, ordená-los e separar quaisquer duplicatas para evitar adjacência.
Essa tarefa surgiu de uma necessidade real do negócio de comércio eletrônico de bens digitais da minha esposa, onde ela gerencia um grupo ativo no Facebook.
Enquanto cinco dos dez modelos de IA testados passaram neste teste completamente, três passaram parcialmente e dois, incluindo o Microsoft Copilot, falharam completamente. O GitHub Copilot, apesar de receber o mesmo prompt, produziu apenas código PHP. Embora o problema pudesse ser resolvido apenas com PHP, o GitHub Copilot tentou referenciar JavaScript sem realmente gerá-lo.

Captura de tela por David Gewirtz/ZDNET Quando tentei solicitar ao GitHub Copilot, a partir de um arquivo JavaScript, para completar a tarefa, ele respondeu bizarramente com mais código PHP, ainda referenciando um arquivo JavaScript inexistente.

Captura de tela por David Gewirtz/ZDNET Teste 2: Reescrevendo uma Função de String
Este teste foi relativamente simples: forneci uma função destinada a validar dólares e centavos, mas que verificava apenas dólares inteiros. O desafio era que a IA corrigisse a função.
O GitHub Copilot modificou o código, mas o resultado foi problemático. Ele presumiu que qualquer string de entrada era válida, o que causaria erros se a string estivesse vazia. Além disso, a expressão regular atualizada não conseguia lidar com vários casos extremos, como entradas como "3.", ".3" ou "00.30". Para uma função destinada a validar moeda, tais descuidos são inaceitáveis, marcando outra falha para o GitHub Copilot.
Teste 3: Encontrando um Bug Irritante
Aqui, o GitHub Copilot brilhou. Este teste foi baseado em um desafio de codificação real que enfrentei, onde a mensagem de erro não apontava diretamente para o problema real. É um pouco como um enigma de codificação, exigindo uma compreensão profunda das chamadas de API do WordPress para resolver.
Enquanto o Microsoft Copilot, Gemini e Meta Code Llama tropeçaram neste teste, o GitHub Copilot acertou em cheio, demonstrando sua capacidade de enfrentar problemas complexos do mundo real.
Teste 4: Escrevendo um Script
O GitHub Copilot também teve sucesso neste teste, onde o Microsoft Copilot ficou aquém. A tarefa envolvia criar um script que precisava integrar AppleScript, o modelo de objeto do Chrome e um utilitário específico para Mac chamado Keyboard Maestro.
Para passar, a IA precisava reconhecer e abordar as nuances de todos os três ambientes, e o GitHub Copilot fez exatamente isso.
Considerações Finais
É desanimador ver o GitHub Copilot, que usa o avançado modelo GPT-4, falhar em metade dos testes. Dado o status do GitHub como uma plataforma líder de gerenciamento de código-fonte, seria de esperar que seu suporte à codificação com IA fosse mais confiável.
No entanto, o mundo da IA está em constante evolução, e estou otimista de que o desempenho do GitHub Copilot melhorará com o tempo. Revisitaremos isso em alguns meses para ver como ele progrediu.
Você depende de IA para assistência em codificação? Qual ferramenta de IA é a sua preferida? Já experimentou o GitHub Copilot? Compartilhe suas experiências nos comentários abaixo.
Fique atualizado com o progresso diário do meu projeto nas redes sociais. Não se esqueça de se inscrever na minha newsletter semanal e me seguir no Twitter/X em @DavidGewirtz, no Facebook em Facebook.com/DavidGewirtz, no Instagram em Instagram.com/DavidGewirtz, no Bluesky em @DavidGewirtz.com e no YouTube em YouTube.com/DavidGewirtzTV.
Artigo relacionado
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
A China Bloqueia Modelos de IA Durante o Gaokam para Impedir Ajuda Imediata nas Tarefas
Com a aproximação do Gaokao 2026, os rumores sobre a suspensão de ferramentas de IA durante o período da prova acenderam um intenso debate online. Em resposta à preocupação do público, as principais plataformas de IA e aplicativos educacionais esclar
Recomendações de tópicos especiais relacionados
Comentários (41)
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!
Explorando as Inconsistências em Ferramentas de Codificação de IA
É realmente intrigante como ferramentas de IA, todas construídas sobre o mesmo modelo de linguagem de grande escala, podem produzir resultados tão variados. Por exemplo, ChatGPT, Perplexity e GitHub Copilot utilizam o modelo GPT-4 da OpenAI. No entanto, meus testes recentes mostraram diferenças gritantes no desempenho: enquanto os planos profissionais do ChatGPT e do Perplexity se destacaram, o GitHub Copilot teve uma taxa de sucesso de 50%.
Realizei esses testes usando o GitHub Copilot integrado a um ambiente VS Code. Compartilharei um guia detalhado sobre como configurar isso em um artigo futuro. Por enquanto, vamos mergulhar nos detalhes dos testes que realizei.
Se você está curioso sobre minha metodologia de teste e os prompts utilizados, pode conferir meu guia detalhado sobre como avaliar as capacidades de codificação de um chatbot de IA.
TL;DR: O GitHub Copilot conseguiu passar em dois dos quatro testes que realizei.
Teste 1: Escrevendo um Plugin para WordPress
Este teste foi uma completa decepção. Foi meu experimento inicial, deixando-me inseguro se o GitHub Copilot tem dificuldades com codificação ou se as limitações de interação dentro do VS Code prejudicam suas capacidades.
Aqui está o contexto: pedi à IA que desenvolvesse um plugin para WordPress totalmente funcional, que incluísse uma interface administrativa e lógica operacional. A tarefa do plugin era aceitar uma lista de nomes, ordená-los e separar quaisquer duplicatas para evitar adjacência.
Essa tarefa surgiu de uma necessidade real do negócio de comércio eletrônico de bens digitais da minha esposa, onde ela gerencia um grupo ativo no Facebook.
Enquanto cinco dos dez modelos de IA testados passaram neste teste completamente, três passaram parcialmente e dois, incluindo o Microsoft Copilot, falharam completamente. O GitHub Copilot, apesar de receber o mesmo prompt, produziu apenas código PHP. Embora o problema pudesse ser resolvido apenas com PHP, o GitHub Copilot tentou referenciar JavaScript sem realmente gerá-lo.
Quando tentei solicitar ao GitHub Copilot, a partir de um arquivo JavaScript, para completar a tarefa, ele respondeu bizarramente com mais código PHP, ainda referenciando um arquivo JavaScript inexistente.
Teste 2: Reescrevendo uma Função de String
Este teste foi relativamente simples: forneci uma função destinada a validar dólares e centavos, mas que verificava apenas dólares inteiros. O desafio era que a IA corrigisse a função.
O GitHub Copilot modificou o código, mas o resultado foi problemático. Ele presumiu que qualquer string de entrada era válida, o que causaria erros se a string estivesse vazia. Além disso, a expressão regular atualizada não conseguia lidar com vários casos extremos, como entradas como "3.", ".3" ou "00.30". Para uma função destinada a validar moeda, tais descuidos são inaceitáveis, marcando outra falha para o GitHub Copilot.
Teste 3: Encontrando um Bug Irritante
Aqui, o GitHub Copilot brilhou. Este teste foi baseado em um desafio de codificação real que enfrentei, onde a mensagem de erro não apontava diretamente para o problema real. É um pouco como um enigma de codificação, exigindo uma compreensão profunda das chamadas de API do WordPress para resolver.
Enquanto o Microsoft Copilot, Gemini e Meta Code Llama tropeçaram neste teste, o GitHub Copilot acertou em cheio, demonstrando sua capacidade de enfrentar problemas complexos do mundo real.
Teste 4: Escrevendo um Script
O GitHub Copilot também teve sucesso neste teste, onde o Microsoft Copilot ficou aquém. A tarefa envolvia criar um script que precisava integrar AppleScript, o modelo de objeto do Chrome e um utilitário específico para Mac chamado Keyboard Maestro.
Para passar, a IA precisava reconhecer e abordar as nuances de todos os três ambientes, e o GitHub Copilot fez exatamente isso.
Considerações Finais
É desanimador ver o GitHub Copilot, que usa o avançado modelo GPT-4, falhar em metade dos testes. Dado o status do GitHub como uma plataforma líder de gerenciamento de código-fonte, seria de esperar que seu suporte à codificação com IA fosse mais confiável.
No entanto, o mundo da IA está em constante evolução, e estou otimista de que o desempenho do GitHub Copilot melhorará com o tempo. Revisitaremos isso em alguns meses para ver como ele progrediu.
Você depende de IA para assistência em codificação? Qual ferramenta de IA é a sua preferida? Já experimentou o GitHub Copilot? Compartilhe suas experiências nos comentários abaixo.
Fique atualizado com o progresso diário do meu projeto nas redes sociais. Não se esqueça de se inscrever na minha newsletter semanal e me seguir no Twitter/X em @DavidGewirtz, no Facebook em Facebook.com/DavidGewirtz, no Instagram em Instagram.com/DavidGewirtz, no Bluesky em @DavidGewirtz.com e no YouTube em YouTube.com/DavidGewirtzTV.
A Anthropic amplia as ferramentas de codificação do Claude AI para o Japão em busca de crescimento no exterior
A Anthropic, uma proeminente empresa de inteligência artificial dos Estados Unidos, está intensificando seu alcance global. Na quarta-feira, a empresa realizou um grande encontro de desenvolvedores, “Code with Claude”, em Tóquio, reunindo cerca de 50
Gigante de Software da Índia Reduz Contratações e Promete Não Demitir à Medida que Agentes de IA se Expande
À medida que a inteligência artificial remodela os modelos de negócios tradicionais intensivos em mão de obra, a Tata Consultancy Services (TCS), uma das principais empresas indianas de terceirização de software, apresentou sua resposta estratégica.
A China Bloqueia Modelos de IA Durante o Gaokam para Impedir Ajuda Imediata nas Tarefas
Com a aproximação do Gaokao 2026, os rumores sobre a suspensão de ferramentas de IA durante o período da prova acenderam um intenso debate online. Em resposta à preocupação do público, as principais plataformas de IA e aplicativos educacionais esclar
GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔
Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔
Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.
Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.
이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!





Lar






