연구 결과, 실제 테스트에서 AI 코드의 성능이 과대평가된 것으로 드러났다
METR 연구소의 연구에 따르면, AI 프로그래밍 능력을 평가하는 데 널리 사용되는 ‘SWE-bench Verified’ 벤치마크가 실제 소프트웨어 개발 환경에서 AI 에이전트의 성능을 상당히 과대평가할 가능성이 있는 것으로 나타났다. 이 연구는 벤치마크에서 ‘합격’ 판정을 받은 AI 생성 코드 솔루션 중 약 절반이 실제 프로젝트 유지보수 담당자에 의한 코드 검토 과정에서 거부될 가능성이 높다는 사실을 밝혀냈으며, 이는 자동화된 평가 결과와 실제 코드 품질 사이에 상당한 격차가 존재함을 보여준다.
SWE-bench Verified는 오랫동안 AI 지원 소프트웨어 공학을 평가하는 핵심 표준으로 여겨져 왔으며, 모델이 오픈소스 프로젝트에서 실제 프로그래밍 과제를 해결할 수 있는지 테스트하고, 코드 변경 사항이 프로젝트의 자동화 테스트 스위트를 통과하는지 검증해 왔다. Anthropic과 OpenAI를 비롯한 여러 AI 기업들은 모델의 발전을 입증하기 위해 이 벤치마크의 결과를 자주 인용한다.

이번 연구에서 METR 팀은 오픈소스 프로젝트인 scikit-learn, Sphinx, pytest를 관리하는 숙련된 개발자 4명을 모집하여 AI가 생성한 코드 296개를 수동으로 검토하게 했습니다. 이 코드 샘플들은 Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet, GPT-5 등 5가지 서로 다른 모델에 의해 생성되었습니다. 결과에 따르면, 유지보수 담당자들의 실제 승인률은 SWE-bench의 자동 평가 점수보다 평균 약 24%포인트 낮았으며, 이는 통계적으로 유의미한 차이였습니다.
또한 이 연구는 거부된 AI 코드가 주로 스타일상의 문제가 아니라 보다 중대한 엔지니어링 결함 때문이라는 점을 확인했습니다. 유지보수 담당자들은 문제를 세 가지 주요 유형으로 분류했습니다: 프로젝트 사양을 충족하지 못하는 코드 품질, 기존 코드 구조의 파괴, 그리고 근본적인 기능적 오류입니다. 상당수의 사례는 자동화된 테스트를 통과했음에도 불구하고 코드가 의도된 문제를 올바르게 해결하지 못한 기능적 오류와 관련이 있었습니다.
모델 비교와 관련하여, 연구 결과 Claude 3.5 Sonnet에서 Claude 3.7 Sonnet으로 업그레이드했을 때 벤치마크 통과율은 크게 향상되었으나, 유지보수 담당자가 지적한 기능적 오류의 수도 증가한 것으로 나타났다. Claude 3.7 Sonnet에서 Claude 4 Opus로 전환할 때는 코드 품질 문제가 더 많이 발생했으나, Claude 4.5 Sonnet에서는 코드 품질이 개선된 것으로 나타났습니다. 반면, 이번 수동 평가에서 GPT-5는 전반적으로 Anthropic 모델 시리즈보다 현저히 낮은 성능을 보였습니다.

연구팀은 또한 "작업 완료 시간"에 대한 추정 분석을 수행했다. SWE-bench 자동 평가 결과에 따르면, Claude 4.5 Sonnet이 50%의 성공률로 작업을 완료하는 데는 약 50분의 인간 노동력이 소요될 것으로 나타났다. 그러나 유지보수 담당자들의 점수를 기준으로 할 때, 추정 시간은 약 8분으로 줄어들어 벤치마크가 능력을 최대 7배까지 과대평가했을 가능성을 시사한다.
하지만 연구진은 이번 연구가 AI 프로그래밍 에이전트의 능력에 근본적인 한계가 있음을 시사하는 것은 아니라고 강조했다. 프롬프트 전략을 개선하거나, 더 많은 인간 피드백을 반영하거나, 반복적인 수정 과정을 거친다면 자동 평가와 수동 검토 간의 격차는 줄어들 수 있다. 또한 실험 환경은 실제 개발 과정과 차이가 있다. 예를 들어, AI 에이전트는 단 한 번의 제출 기회만 주어진 반면, 인간 개발자는 일반적으로 피드백을 바탕으로 코드를 반복적으로 수정할 수 있다.
요약하자면, 이 연구는 AI 프로그래밍 에이전트의 실용적 유용성을 평가할 때 벤치마크 점수에만 의존하는 것은 체계적인 편향을 초래할 수 있다고 결론지었다. AI 코딩 모델이 급속히 진화함에 따라, 실제 개발 환경을 더 잘 반영하는 평가 시스템을 개발하는 것이 AI 소프트웨어 공학 분야의 중요한 연구 방향으로 부상했다.
관련 기사
통이 랩, 직교 분리기 기술 적용된 ‘Qwen3.7-Max’ 공개… 국내 다수 벤치마크에서 1위 기록
Tongyi Lab은 차세대 AI 에이전트 파운데이션 모델인 ‘Qwen3.7-Max’를 공식 출시했습니다. 이 모델은 여러 권위 있는 벤치마크에서 1위를 차지했으며, 장기간의 생산 환경에서 지능형 에이전트가 보이는 취약성과 불안정성 등 업계의 주요 과제를 해결합니다.알려지지 않은 하드웨어 플랫폼인 ZW-M890L PPU에서 실시된 엄격한 스트레스 테스트에서
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련
전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
마이크로소프트, 16개 언어에서 동시에 듣고 말할 수 있는 자체 개발한 최초의 전이중 AI 음성 모델 공개
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는
관련 특별 주제 추천
의견 (2)
0/500
Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅
Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?
METR 연구소의 연구에 따르면, AI 프로그래밍 능력을 평가하는 데 널리 사용되는 ‘SWE-bench Verified’ 벤치마크가 실제 소프트웨어 개발 환경에서 AI 에이전트의 성능을 상당히 과대평가할 가능성이 있는 것으로 나타났다. 이 연구는 벤치마크에서 ‘합격’ 판정을 받은 AI 생성 코드 솔루션 중 약 절반이 실제 프로젝트 유지보수 담당자에 의한 코드 검토 과정에서 거부될 가능성이 높다는 사실을 밝혀냈으며, 이는 자동화된 평가 결과와 실제 코드 품질 사이에 상당한 격차가 존재함을 보여준다.
SWE-bench Verified는 오랫동안 AI 지원 소프트웨어 공학을 평가하는 핵심 표준으로 여겨져 왔으며, 모델이 오픈소스 프로젝트에서 실제 프로그래밍 과제를 해결할 수 있는지 테스트하고, 코드 변경 사항이 프로젝트의 자동화 테스트 스위트를 통과하는지 검증해 왔다. Anthropic과 OpenAI를 비롯한 여러 AI 기업들은 모델의 발전을 입증하기 위해 이 벤치마크의 결과를 자주 인용한다.

이번 연구에서 METR 팀은 오픈소스 프로젝트인 scikit-learn, Sphinx, pytest를 관리하는 숙련된 개발자 4명을 모집하여 AI가 생성한 코드 296개를 수동으로 검토하게 했습니다. 이 코드 샘플들은 Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet, GPT-5 등 5가지 서로 다른 모델에 의해 생성되었습니다. 결과에 따르면, 유지보수 담당자들의 실제 승인률은 SWE-bench의 자동 평가 점수보다 평균 약 24%포인트 낮았으며, 이는 통계적으로 유의미한 차이였습니다.
또한 이 연구는 거부된 AI 코드가 주로 스타일상의 문제가 아니라 보다 중대한 엔지니어링 결함 때문이라는 점을 확인했습니다. 유지보수 담당자들은 문제를 세 가지 주요 유형으로 분류했습니다: 프로젝트 사양을 충족하지 못하는 코드 품질, 기존 코드 구조의 파괴, 그리고 근본적인 기능적 오류입니다. 상당수의 사례는 자동화된 테스트를 통과했음에도 불구하고 코드가 의도된 문제를 올바르게 해결하지 못한 기능적 오류와 관련이 있었습니다.
모델 비교와 관련하여, 연구 결과 Claude 3.5 Sonnet에서 Claude 3.7 Sonnet으로 업그레이드했을 때 벤치마크 통과율은 크게 향상되었으나, 유지보수 담당자가 지적한 기능적 오류의 수도 증가한 것으로 나타났다. Claude 3.7 Sonnet에서 Claude 4 Opus로 전환할 때는 코드 품질 문제가 더 많이 발생했으나, Claude 4.5 Sonnet에서는 코드 품질이 개선된 것으로 나타났습니다. 반면, 이번 수동 평가에서 GPT-5는 전반적으로 Anthropic 모델 시리즈보다 현저히 낮은 성능을 보였습니다.

연구팀은 또한 "작업 완료 시간"에 대한 추정 분석을 수행했다. SWE-bench 자동 평가 결과에 따르면, Claude 4.5 Sonnet이 50%의 성공률로 작업을 완료하는 데는 약 50분의 인간 노동력이 소요될 것으로 나타났다. 그러나 유지보수 담당자들의 점수를 기준으로 할 때, 추정 시간은 약 8분으로 줄어들어 벤치마크가 능력을 최대 7배까지 과대평가했을 가능성을 시사한다.
하지만 연구진은 이번 연구가 AI 프로그래밍 에이전트의 능력에 근본적인 한계가 있음을 시사하는 것은 아니라고 강조했다. 프롬프트 전략을 개선하거나, 더 많은 인간 피드백을 반영하거나, 반복적인 수정 과정을 거친다면 자동 평가와 수동 검토 간의 격차는 줄어들 수 있다. 또한 실험 환경은 실제 개발 과정과 차이가 있다. 예를 들어, AI 에이전트는 단 한 번의 제출 기회만 주어진 반면, 인간 개발자는 일반적으로 피드백을 바탕으로 코드를 반복적으로 수정할 수 있다.
요약하자면, 이 연구는 AI 프로그래밍 에이전트의 실용적 유용성을 평가할 때 벤치마크 점수에만 의존하는 것은 체계적인 편향을 초래할 수 있다고 결론지었다. AI 코딩 모델이 급속히 진화함에 따라, 실제 개발 환경을 더 잘 반영하는 평가 시스템을 개발하는 것이 AI 소프트웨어 공학 분야의 중요한 연구 방향으로 부상했다.
통이 랩, 직교 분리기 기술 적용된 ‘Qwen3.7-Max’ 공개… 국내 다수 벤치마크에서 1위 기록
Tongyi Lab은 차세대 AI 에이전트 파운데이션 모델인 ‘Qwen3.7-Max’를 공식 출시했습니다. 이 모델은 여러 권위 있는 벤치마크에서 1위를 차지했으며, 장기간의 생산 환경에서 지능형 에이전트가 보이는 취약성과 불안정성 등 업계의 주요 과제를 해결합니다.알려지지 않은 하드웨어 플랫폼인 ZW-M890L PPU에서 실시된 엄격한 스트레스 테스트에서
제네시스 AI, 단일 모델로 로봇 작업 마스터… ‘챗GPT’와 유사한 전환점 마련
전 세계적으로 로봇 공학에 대한 관심이 높아지는 가운데, 제네시스 AI는 자사의 첫 번째 로봇 파운데이션 모델인 ‘GENE-26.5’를 선보였습니다. 이번 출시는 범용 로봇 공학, 특히 복잡하고 구조화되지 않은 작업을 처리하는 분야에서 큰 도약을 의미합니다.최근 공개 시연에서는 이 로봇의 놀라운 민첩성과 자율성이 돋보였습니다. 한 손으로 달걀을 휘젓는 것과
마이크로소프트, 16개 언어에서 동시에 듣고 말할 수 있는 자체 개발한 최초의 전이중 AI 음성 모델 공개
기술 전문 매체 TestingCatalog에 따르면, 마이크로소프트는 현재 자사의 첫 번째 네이티브 실시간 음성 모델인 ‘MAI Realtime’을 테스트 중입니다. 16개 언어와 두 가지 독특한 음성 스타일을 지원하는 이 시스템은 듣기와 말하기를 동시에 처리할 수 있어, 자동 언어 감지 및 대화 도중 언어 전환이 가능합니다. 이러한 발전 덕분에 사용자는
Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅
Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?





집






