上海交通大学の研究チームが「SWE-Explore」ベンチマークを公開、AIコーディングエージェントにおける行単位の局所化の欠陥を明らかに
上海交通大学を含む国際研究チームは本日、新たなベンチマークテストツール「SWE-Explore」を公開した。このツールは、コード検索と実際の修正段階を切り離すことで、「行レベル精度」において、現在のAIコーディングエージェントが抱える重大な技術的欠点を定量的に明らかにするものである。 本研究は、「最終的な修正率」のみに依存していた従来の単一評価モデルを超え、エージェントの上流にある探索の質を直接測定するための新たな基準を提供するとともに、AIソフトウェア工学の評価をより深い領域へと進化させるものである。
SWE-benchのような従来のベンチマークは、エンドツーエンドの結果のみに焦点を当てているため、コードの読み取りや理解の段階におけるエージェントの真の欠陥を隠蔽してしまうことがよくあります。この問題に対処するため、研究チームは、GPT-5.4、 Gemini3Pro、Claude Sonnet4.6、Kimi K2.6といった主流の大規模モデルの成功した動作軌跡に基づき、複数の独立した解決経路からコンセンサスコードセグメントを抽出し、10のプログラミング言語と203のオープンソースプロジェクトにまたがる848の欠陥タスクを含むデータセットを構築した。

評価結果によると、Claude CodeやOpenHandsのような汎用コーディングエージェントは「ファイルレベル」の位置特定では良好な性能を示すものの、特定の「コード行」に焦点を当てると、中核領域のカバー率が14%から19%へと急激に低下することが明らかになった。 アブレーション実験により、「最小コンテキスト閾値」効果がさらに確認された。重要な中核領域の可視化割合が50%を下回ると、モデルの修復は概して失敗するが、50%から75%の閾値を超えると、修復成功率は劇的に上昇する。
この研究結果は、AIエージェントの現在のボトルネックが、パッチ作成能力そのものにあるのではなく、重要なコンテキストを正確にフィルタリングし、捕捉することにあることを示唆している。プロジェクトマネージャーが自動化導入提案の半数を却下している現在の業界状況において、 SWE-Exploreが提唱する「フィルタリングを減らし、読み込みを増やす」という技術的方向性は、次世代の専門的コードローカライゼーションシステム(CoSILなど)のアーキテクチャ最適化への道筋を示すだけでなく、自動ソフトウェア工学のパラダイムシフトを「力業による生成」から「精密な検索」へと加速させるものである。
関連記事
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン
カリフォルニア州の自動運転車規制:違反切符、ジオフェンス、そして100万マイルという新たな時代
Guident社は南フロリダでAuveTechのシャトルを運行しており、同社の遠隔監視技術を活用して、ウェストパームビーチでの4マイルのルートとボカラトンでの1マイルのルートを管理している。 | 提供:Guidentカリフォルニア州は、自動運転車の規制環境を再定義しつつあり、テクノロジー業界の「迅速に動き、失敗を恐れない」という考え方から、厳格な説明責任と厳しい走行距離要件へと移行している。Gui
関連特集おすすめ
コメント (0)
0/500
上海交通大学を含む国際研究チームは本日、新たなベンチマークテストツール「SWE-Explore」を公開した。このツールは、コード検索と実際の修正段階を切り離すことで、「行レベル精度」において、現在のAIコーディングエージェントが抱える重大な技術的欠点を定量的に明らかにするものである。 本研究は、「最終的な修正率」のみに依存していた従来の単一評価モデルを超え、エージェントの上流にある探索の質を直接測定するための新たな基準を提供するとともに、AIソフトウェア工学の評価をより深い領域へと進化させるものである。
SWE-benchのような従来のベンチマークは、エンドツーエンドの結果のみに焦点を当てているため、コードの読み取りや理解の段階におけるエージェントの真の欠陥を隠蔽してしまうことがよくあります。この問題に対処するため、研究チームは、GPT-5.4、 Gemini3Pro、Claude Sonnet4.6、Kimi K2.6といった主流の大規模モデルの成功した動作軌跡に基づき、複数の独立した解決経路からコンセンサスコードセグメントを抽出し、10のプログラミング言語と203のオープンソースプロジェクトにまたがる848の欠陥タスクを含むデータセットを構築した。

評価結果によると、Claude CodeやOpenHandsのような汎用コーディングエージェントは「ファイルレベル」の位置特定では良好な性能を示すものの、特定の「コード行」に焦点を当てると、中核領域のカバー率が14%から19%へと急激に低下することが明らかになった。 アブレーション実験により、「最小コンテキスト閾値」効果がさらに確認された。重要な中核領域の可視化割合が50%を下回ると、モデルの修復は概して失敗するが、50%から75%の閾値を超えると、修復成功率は劇的に上昇する。
この研究結果は、AIエージェントの現在のボトルネックが、パッチ作成能力そのものにあるのではなく、重要なコンテキストを正確にフィルタリングし、捕捉することにあることを示唆している。プロジェクトマネージャーが自動化導入提案の半数を却下している現在の業界状況において、 SWE-Exploreが提唱する「フィルタリングを減らし、読み込みを増やす」という技術的方向性は、次世代の専門的コードローカライゼーションシステム(CoSILなど)のアーキテクチャ最適化への道筋を示すだけでなく、自動ソフトウェア工学のパラダイムシフトを「力業による生成」から「精密な検索」へと加速させるものである。
DeepMindのCEOハサビス氏:1日6時間睡眠し、通常午前1時頃に活力を感じます。
フォーチュンは最近、Google DeepMindのCEOであるデミス・ハサビスへのインタビューを掲載し、彼の休息と生産性に対する非伝統的なアプローチを明らかにした。ハサビスは、睡眠時間が非常に短いことを明かし、覚醒時間を2つの明確な作業ブロックに構造化していると語った。彼の睡眠習慣について、ハサビスは「6時間の睡眠を目標としているが、私の習慣は典型的ではない。一日中効果的に機能できる」と述べた。彼は、6時間未満の睡眠は脳の健康に悪影響を及ぼすことを強調した。2010年にDeepMindを共
OpenAIとAnthropic、収益の伸び悩みにもかかわらず市場シェア争いを繰り広げる
OpenAIが収益目標を達成できなかったとする最近の報道を受け、今週火曜日にハイテク株に売り圧力が生じたにもかかわらず、AI研究機関への民間投資家は依然として堅調だ。経験豊富な出資者たちは、メディアによる否定的な報道にもかかわらず、投資額を減らすつもりはないことを明らかにしている。アナリストらは、現在のAI競争はまだ初期段階にあると見ており、「勝者総取り」という結末はあり得ないと見ている。高いコン





家






