옵션
뉴스
github copilot의 AI 테스트 : 혼합 코딩 성공이 나를 당황하게합니다.

github copilot의 AI 테스트 : 혼합 코딩 성공이 나를 당황하게합니다.

2025년 4월 21일
340

AI 코딩 도구의 불일치 탐구

모두 동일한 기반 대형 언어 모델로 구축된 AI 도구들이 이렇게 다양한 결과를 낳을 수 있다는 것이 정말로 당혹스럽습니다. 예를 들어, ChatGPT, Perplexity, 그리고 GitHub Copilot은 모두 OpenAI의 GPT-4 모델을 활용합니다. 하지만 최근 테스트에서 성능 차이가 뚜렷했습니다: ChatGPT와 Perplexity의 프로 플랜은 뛰어났지만, GitHub Copilot은 50%의 성공률을 보였습니다.

저는 VS Code 환경에 통합된 GitHub Copilot을 사용해 이 테스트를 진행했습니다. 이에 대한 자세한 설정 가이드는 곧 나올 기사에서 공유할 예정입니다. 지금은 제가 진행한 테스트의 세부 사항을 살펴보겠습니다.

제 테스트 방법론과 사용된 프롬프트가 궁금하다면, AI 챗봇의 코딩 능력을 평가하는 제 자세한 가이드를 확인할 수 있습니다.

TL;DR: GitHub Copilot은 제가 진행한 네 가지 테스트 중 두 가지를 통과했습니다.

테스트 1: WordPress 플러그인 작성

이 테스트는 완전히 실망스러웠습니다. 첫 번째 실험이었기 때문에 GitHub Copilot이 코딩에 어려움을 겪는지, 아니면 VS Code 내의 상호작용 제약이 그 능력을 방해하는지 확신할 수 없었습니다.

배경은 다음과 같습니다: 저는 AI에게 관리자 인터페이스와 작동 로직을 포함한 완전한 기능을 갖춘 WordPress 플러그인을 개발하도록 요청했습니다. 플러그인의 임무는 이름 목록을 받아 정렬하고, 중복된 이름이 인접하지 않도록 분리하는 것이었습니다.

이 작업은 제 아내의 디지털 상품 전자상거래 비즈니스에서 실제로 필요했던 것으로, 그녀는 활발한 Facebook 그룹을 관리하고 있습니다.

테스트한 10개의 AI 모델 중 5개는 이 테스트를 완전히 통과했고, 3개는 부분적으로 통과했으며, Microsoft Copilot을 포함한 2개는 완전히 실패했습니다. GitHub Copilot은 동일한 프롬프트를 받았음에도 PHP 코드만 생성했습니다. 문제는 PHP만으로 해결할 수 있었지만, GitHub Copilot은 JavaScript를 참조하려 했으나 실제로는 생성하지 않았습니다.

David Gewirtz/ZDNET의 스크린샷

David Gewirtz/ZDNET의 스크린샷

JavaScript 파일 내에서 GitHub Copilot에게 작업을 완료하도록 프롬프트했을 때, 이상하게도 더 많은 PHP 코드를 생성하며 존재하지 않는 JavaScript 파일을 참조했습니다.

David Gewirtz/ZDNET의 스크린샷

David Gewirtz/ZDNET의 스크린샷

테스트 2: 문자열 함수 재작성

이 테스트는 비교적 간단했습니다: 저는 달러와 센트를 검증하는 함수를 제공했지만, 이 함수는 정수 달러만 확인했습니다. AI의 과제는 이 함수를 수정하는 것이었습니다.

GitHub Copilot은 코드를 수정했지만, 결과는 문제가 있었습니다. 입력 문자열이 항상 유효하다고 가정했기 때문에 문자열이 비어 있으면 오류가 발생했습니다. 또한, 업데이트된 정규 표현식은 "3.", ".3", "00.30"과 같은 다양한 엣지 케이스를 처리하지 못했습니다. 통화를 검증하는 함수로서는 이러한 간과는 용납할 수 없으며, GitHub Copilot은 또 한 번 실패했습니다.

테스트 3: 성가신 버그 찾기

여기서 GitHub Copilot은 빛을 발했습니다. 이 테스트는 제가 실제로 직면했던 코딩 도전 과제를 기반으로 했으며, 오류 메시지가 실제 문제로 직접 연결되지 않았습니다. 이는 코딩 수수께끼와 비슷하며, WordPress API 호출에 대한 깊은 이해가 필요했습니다.

Microsoft Copilot, Gemini, Meta Code Llama는 이 테스트에서 실패했지만, GitHub Copilot은 이를 완벽히 해결하며 복잡한 실제 문제를 다룰 수 있는 능력을 보여주었습니다.

테스트 4: 스크립트 작성

GitHub Copilot은 Microsoft Copilot이 실패한 이 테스트에서도 성공했습니다. 이 작업은 AppleScript, Chrome 객체 모델, 그리고 Keyboard Maestro라는 Mac 전용 유틸리티를 통합해야 하는 스크립트 작성을 포함했습니다.

통과하려면 AI가 세 가지 환경의 미묘한 차이를 인식하고 해결해야 했으며, GitHub Copilot은 이를 정확히 수행했습니다.

최종 생각

고급 GPT-4 모델을 사용하는 GitHub Copilot이 테스트의 절반에서 실패한 것은 실망스럽습니다. GitHub가 선도적인 소스 관리 플랫폼이라는 점을 고려할 때, AI 코딩 지원이 더 신뢰할 만할 것이라고 기대했습니다.

하지만 AI의 세계는 계속 진화하고 있으며, GitHub Copilot의 성능이 시간이 지나면서 개선될 것이라고 낙관합니다. 몇 달 후 다시 점검하여 얼마나 발전했는지 확인할 것입니다.

코딩 지원에 AI를 사용하시나요? 어떤 AI 도구를 주로 사용하시나요? GitHub Copilot을 사용해 보셨나요? 아래 댓글에서 경험을 공유해 주세요.

소셜 미디어에서 제 일일 프로젝트 진행 상황을 업데이트받으세요. 주간 뉴스레터에 가입하는 것도 잊지 마시고, Twitter/X에서 @DavidGewirtz, Facebook에서 Facebook.com/DavidGewirtz, Instagram에서 Instagram.com/DavidGewirtz, Bluesky에서 @DavidGewirtz.com, YouTube에서 YouTube.com/DavidGewirtzTV를 팔로우해 주세요.

관련 기사
초지능의 등장: 우리가 이를 받아들일 것인가? 초지능의 등장: 우리가 이를 받아들일 것인가? 플레이어 로딩 중…AI 기업들은 초지능 AI가 필연적인 것처럼 이야기해 왔지만, 최근 OpenAI의 Hugging Face 침해 사건과 같은 안전 사고들은 인간보다 더 유능한 AI 시스템을 배포하는 잠재적 위험을 드러내고 있습니다. 그렇다면 우리가 이러한 시스템의 행동을 신뢰성 있게 제어할 수 없을 때 어떤 일이 발생할까요?이 TechCrunch의 Equity 에피소드에서 Rebecca Bellan은 AI 연구자이자 기업가이며 현재 비영리
iFLYTEK, Spark X2.5 범용 대형 모델을 공개하다 iFLYTEK, Spark X2.5 범용 대형 모델을 공개하다 9월 1일, iFlytek은 최신 공식 발표에 따라 에지 중심의 대형 언어 모델인 Xinghuo X2.5-4B와 Xinghuo X2.5-1.7B를 오픈소스로 공개합니다. 두 모델은 모두 최대 100만 토큰의 컨텍스트 창을 네이티브로 지원합니다. 이들은 지능형 에이전트 상호작용, 수학적 추론, 일반 이해력 등 주요 영역에서 상당한 개선을 제공하며, 차량 내 시스템, 스마트 기기, IoT 생태계와 같은 에지 애플리케이션에 견고한 지원을 제공합니다.
사용자 반발 이후 메타, AI 사진 편집 기능 제거 사용자 반발 이후 메타, AI 사진 편집 기능 제거 Meta, the social media giant, is once again embroiled in a public debate regarding the delicate balance between artificial intelligence and user privacy. According to TechCrunch, Meta’s Superintelligence Labs introduced a new AI image generator, Muse
관련 특별 주제 추천
애니메이션 제작 소셜 미디어 콘텐츠용 AI 장면 애니메이션 도구
소셜 미디어 콘텐츠용 AI 장면 애니메이션 도구

XIX.AI가 선정한 2026년 소셜 미디어 콘텐츠용 최신 최고 평점 AI 장면 애니메이션 도구를 여기서 만나보세요. 이 강력하고 혁신적인 도구들은 실제 테스트 결과와 무료 버전 대 유료 버전의 상세한 비교 정보를 제공하여 크리에이터들의 생산성을 크게 높여줍니다. 지금 바로 살펴보고 AI를 활용한 경쟁력을 확보해 보세요.

9 도구
xix.ai
비디오 제작 릴스, 숏츠 및 제품 출시 캠페인을 위한 AI 단편 동영상 훅 생성기
릴스, 숏츠 및 제품 출시 캠페인을 위한 AI 단편 동영상 훅 생성기

2026년 최신 최고의 AI 단편 동영상 훅 생성기: 릴스, 숏츠 및 제품 출시 캠페인용! XIX.AI는 실제 테스트를 통해 반드시 시도해 봐야 할 결과를 제공하는, 최고 평점을 받은 강력한 혁신적인 도구들을 엄선합니다. 매주 업데이트되는 이 페이지에서는 무료와 유료 버전의 비교 순위를 제공하여, 콘텐츠 창의성과 생산성을 높일 수 있는 완벽한 솔루션을 찾으실 수 있도록 도와드립니다. 지금 바로 탐색하여 AI의 경쟁력을 확보하세요!

11 도구
xix.ai
글쓰기 장문 작성용 AI 기사 개요 도구
장문 작성용 AI 기사 개요 도구

2026년 최신, 최고 평점을 받은 장문 작성을 위한 AI 개요 작성 도구 모음! 이 엄선된 컬렉션은 실제 테스트를 통해 정확하고 체계적인 개요를 제공하여 글쓰기 효율을 획기적으로 높여주는 강력하고 혁신적인 도구들을 소개합니다. XIX.AI도 이 엄선된 목록에 포함되어 있습니다. 무료 버전과 유료 버전을 비교해 보고, 자신에게 딱 맞는 도구를 선택해 보세요. 지금 바로 살펴보고 AI의 힘을 최대한 활용하세요!

9 도구
xix.ai
챗봇 언어 연습, 면접 준비 및 일상 유창성을 위한 최고의 AI 역할극 채팅 앱
언어 연습, 면접 준비 및 일상 유창성을 위한 최고의 AI 역할극 채팅 앱

2026년 최신 최고 인기 AI 역할극 채팅 앱: 언어 연습, 면접 준비 및 일상 유창성을 위한 최고의 선택! XIX.AI는 무료와 유료 비교, 실제 테스트, 매주 업데이트되는 순위 등을 제공하는 강력한 혁신적인 컬렉션을 엄선합니다. 이 필수 도구들은 글쓰기 실력을 향상시키고, 유창성 관련 어려움을 극복하며, 모든 일상 상황에서 의사소통 효율성을 높이는 데 도움을 줍니다. 지금 바로 탐색하여 언어 성장을 위한 완벽한 도구를 발견하세요!

10 도구
xix.ai
음악 작곡 리믹스 제작, 샘플링 준비, 카라오케 마스터 파일 제작을 위한 AI 스템 분리 도구
리믹스 제작, 샘플링 준비, 카라오케 마스터 파일 제작을 위한 AI 스템 분리 도구

2026년 최신형으로 선정된 최고 평점의 AI 스템 분리 도구들은 리믹스 제작, 샘플링 준비, 카라오케 녹음에 특화되어 있습니다. 이 강력하고 혁신적인 도구들은 실제 환경에서의 테스트를 거쳐 정밀한 오디오 분리 기능을 제공함으로써 작업 효율성을 크게 향상시켜 줍니다. XIX.AI는 매주 업데이트되는 무료 버전과 유료 버전의 비교 가이드를 제공하여 사용자의 니즈에 가장 적합한 도구를 찾는 데 도움을 줍니다. 지금 바로 확인하여 AI 기술의 잠재력을 최대한 활용해 보세요.

8 도구
xix.ai
데이터 분석 수익 대시보드, 퍼널 분석, 그리고 제품 지표를 위한 AI SQL 코파일럿
수익 대시보드, 퍼널 분석, 그리고 제품 지표를 위한 AI SQL 코파일럿

2026년 최신 최고의 AI SQL 코파일럿들이 최상위 순위에 올랐습니다! XIX.AI는 매주 업데이트되는 실제 환경 테스트를 위해 강력하고 혁신적인 도구들을 선별하여 제공합니다. 반드시 사용해 보아야 할 이 도구들은 정확한 수익 대시보드를 생성하고, 판매 과정을 분석하며, 제품 관련 지표를 신속하게 추적할 수 있도록 도와 생산성을 크게 향상시켜 줍니다. 데이터 기반 의사결정을 위한 완벽한 도구를 찾아보세요! 238자

9 도구
xix.ai
의견 (41)
0/500
GregoryWilson
GregoryWilson 2026년 8월 29일 오후 1시 0분 6초 GMT+09:00

GitHub Copilotのテスト結果、正直謎すぎますね。同じGPT-4ベースなのに、ツールによって精度がこんなに違うのは不思議です。ChatGPTやPerplexityとはまた別の挙動を示すので、使い分けが重要になりそうです。AIの限界を実感しました🤔

HarryMartinez
HarryMartinez 2026년 5월 28일 오후 3시 0분 14초 GMT+09:00

Honestly, this doesn't surprise me. Even with the same underlying model, the way each tool fine-tunes prompts and handles context makes a huge difference. Copilot's mixed results probably come from its integration with IDE specifics. Still, it's baffling why the same model can give such inconsistent outputs for similar tasks. 🤔

EricAllen
EricAllen 2026년 5월 19일 오전 11시 0분 12초 GMT+09:00

Ich hab's auch ausprobiert und finde es echt seltsam, dass die Ergebnisse so unterschiedlich sind, obwohl die Basis ähnlich ist. Manchmal schreibt Copilot super Code, manchmal totalen Unsinn. Vielleicht liegt's an der Integration in die IDE? 🤔 Auf jeden Fall muss da noch viel verbessert werden, bevor ich mich voll darauf verlassen kann.

ArthurJackson
ArthurJackson 2026년 3월 12일 오전 5시 0분 47초 GMT+09:00

Интересно, почему ИИ-инструменты на одной базовой модели GPT-4 работают так по-разному? GitHub Copilot иногда генерирует код, который выглядит логично, но потом выдает полную ерунду 😅 Может, дело в тонкой настройке или контексте? Это напоминает мне капризного коллегу-программиста, который то гений, то беспомощен.

LarryMartin
LarryMartin 2025년 11월 27일 오후 9시 30분 43초 GMT+09:00

이 기사 읽어보니 AI 코딩 도구의 편차가 정말 신기하네요. 같은 기술인데 결과가 이렇게 다를 수 있다니... 개발자로 일하면서 Copilot이 가끔 완벽한 코드를 써주다가도 갑자기 엉뚱한 걸 제안해서 당황했던 적이 많아요. 🤔 앞으로 AI 도구들이 더 안정화되길 바랍니다!

PaulRoberts
PaulRoberts 2025년 11월 8일 오후 1시 30분 36초 GMT+09:00

Acho frustrante que ferramentas como Copilot e ChatGPT usem o mesmo modelo base mas tenham performances tão diferentes. Isso me faz questionar se a implementação é realmente bem feita ou se só estão colocando um nome famoso pra vender mais. 🤔

OR