オプション
ニュース
研究によると、実環境でのテストにおいてAIコードの性能が過大評価されていたことが判明した

研究によると、実環境でのテストにおいてAIコードの性能が過大評価されていたことが判明した

2026年5月9日
196

METR研究所の研究によると、AIのプログラミング能力を評価するために広く利用されている「SWE-bench Verified」ベンチマークは、実際のソフトウェア開発におけるAIエージェントのパフォーマンスを大幅に過大評価している可能性があることが示唆されています。この研究では、同ベンチマークで「合格」と判定されたAI生成コードのソリューションの約半数が、実際のプロジェクトのメンテナーによるコードレビューでは却下される可能性が高いことが判明し、自動評価結果と実際のコード品質との間に大きな隔たりがあることが浮き彫りになりました。

SWE-bench Verifiedは、AI支援型ソフトウェアエンジニアリングを評価するための主要な基準として長年位置づけられてきた。このベンチマークは、モデルがオープンソースプロジェクトにおける実際のプログラミング課題を解決できるかどうかをテストし、コードの変更がプロジェクトの自動テストスイートを通過するかどうかを検証するものである。AnthropicやOpenAIを含む複数のAI企業は、モデルの進歩を示すために、このベンチマークの結果を頻繁に引用している。

QQ20260312-093454.jpg

本研究において、METRチームは、オープンソースプロジェクトであるscikit-learn、Sphinx、pytestのメンテナンスを担当する4名の経験豊富な開発者に協力を依頼し、AIが生成した296件のコードを手動でレビューしてもらった。これらのコードサンプルは、Claude 3.5 Sonnet、Claude 3.7 Sonnet、Claude 4 Opus、Claude 4.5 Sonnet、GPT-5の5つの異なるモデルによって生成されたものである。 その結果、メンテナーによる実際の採用率は、SWE-benchによる自動評価スコアよりも平均で約24パーセントポイント低く、これは統計的に有意な差であることが明らかになった。

また、この研究では、却下されたAIコードの主な原因はスタイル上の問題ではなく、より根本的な技術的欠陥にあることも判明しました。メンテナーは問題を主に3つのタイプに分類しました。プロジェクトの仕様を満たしていないコード品質、既存のコード構造の破壊、そして根本的な機能エラーです。ケースの相当な割合は機能エラーに関連しており、自動テストには合格したものの、コードが意図された問題を正しく解決できていないというものでした。

モデル比較に関しては、Claude 3.5 SonnetからClaude 3.7 Sonnetへのアップグレードによりベンチマークの合格率が大幅に改善された一方で、メンテナーによって指摘された機能エラーの数も増加したことが判明した。 Claude 3.7 SonnetからClaude 4 Opusへの移行では、コード品質の問題がより多く見られるようになった一方、Claude 4.5 Sonnetではコード品質の改善が確認された。対照的に、GPT-5はこの手動評価において、Anthropicのモデルシリーズ全体と比較して著しく劣る結果となった。

人工知能の脳、大規模モデル

研究チームは「タスク完了時間」の推定分析も実施した。SWE-benchの自動評価結果によると、Claude 4.5 Sonnetが50%の成功率でタスクを完了するには、人間が約50分の労力を要するとされる。しかし、メンテナーによる評価スコアに基づくと、推定時間はわずか約8分まで短縮され、このベンチマークが能力を最大7倍も過大評価している可能性が示唆された。

ただし、研究者らは、本研究がAIプログラミングエージェントの能力に根本的な限界があることを示唆するものではないとも強調している。プロンプト戦略の改善、より多くの人的フィードバック、あるいは複数の反復サイクルにより、自動評価と手動レビューの間のギャップは縮小し得る。さらに、実験設定は実際の開発プロセスとは異なる。例えば、AIエージェントには提出の機会が1回しかなかったのに対し、人間の開発者は通常、フィードバックに基づいてコードを反復的に修正することができる。

要約すると、本研究は、AIプログラミングエージェントの実用的な有用性を評価する際にベンチマークスコアのみに依存することは、体系的なバイアスを生じさせる可能性があると結論付けている。AIコーディングモデルが急速に進化する中、現実の開発環境をよりよく反映した評価システムを開発することは、AIソフトウェア工学における重要な研究方向となっている。

関連記事
内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた 内部詳細が明かされた次世代ジェミニ:計算リソースの逼迫、開発チーム間で優先順位とリソース配分を巡り意見が割れた 報告によると、Googleの次世代Geminiモデルの発売は延期された。開発の優先順位とリソース配分をめぐる社内での意見の相違、限られた計算能力、複雑な承認手続きが重なり、2ヶ月の延期を余儀なくされた。独自開発のTPUチップを所有しているものの、モデルのトレーニング、Google Cloudサービス、多数の消費者向けおよび企業向けAIアプリケーションからの競合する需要により、Googleは計算資源の不足に直面している。上層部は現在、組織再編成を通じてこれらの部門間の対立に対処している。同時に、リ
OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明 OpenAI、成長鈍化への懸念を退け、複数の事業部門が加速していると表明 外部からの販売成長の鈍化や社内目標の未達に関する scrutiny に対応し、AI リーダーである OpenAI は 4 月 28 日(火曜日)、自信に満ちた声明を発表した。同社は、消費者向け製品とエンタープライズサービスが急速に進展しており、最近のビジネス減速に関する憶測を直接否定していると明らかにした。同社が「複数の社内目標を逸脱した」とする主張に対し、OpenAI はこれらの報道を「典型的なクリックベイト」と一蹴した。同社は、AI 統合に対する堅調なエンタープライズ需要を強調し、広告施策
アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー アリババ・スーパーカップ:Qwen3.8-Max、強化されたコーディング機能とオフィスツールを搭載してデビュー アリババは公式に、2.4兆パラメータを備えた次世代の基盤大規模モデル「Qwen3.8-Max」を発表しました。この重要なAIの進歩は、コーディングや専門的なオフィス業務といった中核領域において大幅なパフォーマンス向上をもたらし、堅牢な技術能力を示しています。権威あるArena大規模モデルランキングにおいて、Qwen3.8-Maxは目覚ましい結果を残し、AnthropicのClaudeシリーズに次ぐ順位で、業界リーダーの仲間入りを果たしました。このマイルストーンは、複雑なタスクの処理における国内
関連特集おすすめ
作曲 曲のドラフト作成に最適なAIメロディ作成ツール
曲のドラフト作成に最適なAIメロディ作成ツール

2026年最新版 高評価のAIメロディ作成ツールで曲のドラフト作成!XIX.AIは、厳格な実世界テストを経て最高の作成体験を提供する、革新的な強力なコレクションを厳選しました。詳細な無料版と有料版の比較、正確なランキング、そして素晴らしい曲のドラフトを楽に作成し、創造的な生産性を大幅に向上させるためにぜひ試すべきオプションが見つかります。今すぐ探索して、あなたに最適なツールを見つけましょう!

8 ツール
xix.ai
チャットボット 面接練習用のベストなAI会話トレーニングツール
面接練習用のベストなAI会話トレーニングツール

2026年最新版・最高評価のAI会話トレーニングツールが、面接練習に最適です。XIX.AIにてご提供しています!この厳選コレクションには、現実世界での厳格なテストを経て正確なフィードバックを提供する強力なツールが含まれています。無料版と有料版の比較や詳細なランキングをご覧いただき、自信とスキルを高めるための必須オプションをお選びください。今すぐ探索して、面接成功に最適なツールを見つけましょう!

12 ツール
xix.ai
デザインとアート クリエイティブな実験に最適なAIスタイル転送ツール
クリエイティブな実験に最適なAIスタイル転送ツール

2026年版 クリエイティブな実験に最適な、最新・最高評価のAIスタイル転送ツール!XIX.AIは、実地テストと厳格なランキングを通じて卓越した結果をもたらす、強力で画期的な「必試」ツールを厳選しました。これらのトップソリューションは、コンテンツ制作を加速させ、無限の創造的可能性を切り拓くことで、クリエイターの生産性を大幅に向上させます。 今すぐチェックして、あなたにぴったりのツールを見つけ、今日から創作を始めましょう!

9 ツール
xix.ai
漫画制作 ビジュアルストーリーテリングに最適なAI吹き出しツール
ビジュアルストーリーテリングに最適なAI吹き出しツール

2026年版、ビジュアルストーリーテリングに最適な高評価AIダイアログバブルツールがXIX.AIに登場!この厳選コレクションには、クリエイターの生産性を高め、創作上のボトルネックを解消する、画期的な強力ツールが揃っています。 無料版と有料版の比較、実地テストの結果、最新のランキングを確認して、魅力的なビジュアルストーリーを構築するのに最適な、ぜひ試すべきソリューションを見つけましょう。今すぐチェックして、あなたにぴったりのツールを発見してください!

10 ツール
xix.ai
ミーティングアシスタント AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握
AI会議要約ツールのトップ選定:決定事項とフォローアップを明確に把握

2026年版:意思決定の追跡を明確にし、フォローアップを容易にする、高評価のAI会議要約ツールベストセレクション。この厳選リストでは、会議メモの自動化、重要なアクション項目の特定、すべてのプロジェクトにわたるチーム連携の効率化を通じて、生産性を劇的に向上させる、強力で画期的なソリューションをご紹介します。 無料版と有料版の比較、実地テストの結果、毎週更新されるランキングを参考に、最適なツールを見つけてください。今すぐチェックして、AIの力を最大限に活用しましょう!

9 ツール
xix.ai
データ分析 最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正
最強のAIデータクリーニングツール:欠損値や重複データを迅速に修正

2026年最新かつ最も評価の高いAIデータクリーニングツールをご紹介。欠損値や重複データを迅速に修正できるこれらのツールは、生産性を大幅に向上させる強力なソリューションです。各ツールは信頼性を確保するため、厳格な実環境でのテストを経ています。無料版と有料版の比較情報もご用意しており、あなたのニーズに最も合ったツールを見つけ出せます。今すぐXIX.AIで詳細を確認し、AI活用の強みを最大限に引き出しましょう。

11 ツール
xix.ai
コメント (2)
0/500
MichaelMartinez
MichaelMartinez 2026年6月28日 3:00:18 JST

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 2026年5月16日 21:00:16 JST

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR