上海交通大学团队发布SWE-Explore基准测试,揭示了AI编码代理中行级定位的缺陷
一个由上海交通大学等机构组成的国际研究团队今日发布了名为SWE-Explore的新型基准测试工具。该工具通过将代码搜索与实际修复阶段解耦,从“行级准确率”层面定量揭示了当前AI编码代理存在的显著技术缺陷。 这项研究突破了以往仅依赖“最终修复率”的单一评估模式,为直接衡量代理程序上游搜索质量提供了新标准,并推动人工智能软件工程评估向更深层次发展。
像 SWE-bench 这样的传统基准测试往往仅关注端到端结果,因此掩盖了代理在代码阅读和理解阶段的真实缺陷。为解决这一问题,研究团队基于 GPT-5.4、 Gemini3Pro、Claude Sonnet4.6和Kimi K2.6等主流大模型的成功运行轨迹,从多个独立解法路径中提取共识代码片段,构建了一个包含10种编程语言、203个开源项目、共计848个缺陷任务的数据集。

评估结果表明,尽管 Claude Code 和 OpenHands 等通用编码代理在“文件级”定位方面表现良好,但当聚焦于具体的“代码行”时,其核心区域覆盖率会急剧下降至 14% 至 19% 之间。 消融实验进一步证实了“最小上下文阈值”效应:当关键核心区域的可见比例低于50%时,模型的修复通常会失败;然而,一旦该比例跨越50%至75%的阈值,修复成功率便会大幅提升。
这一研究结果表明,当前 AI 代理面临的瓶颈并不完全在于补丁编写能力,而在于能否准确过滤和捕捉关键上下文。在当前行业背景下,项目经理会拒绝一半的自动化采用提案, SWE-Explore提出的“少过滤、多阅读”技术方向,不仅为下一代专用代码本地化系统(如CoSIL)的架构优化指明了方向,同时也加速了自动化软件工程从“暴力生成”向“精准检索”的范式转变。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
一个由上海交通大学等机构组成的国际研究团队今日发布了名为SWE-Explore的新型基准测试工具。该工具通过将代码搜索与实际修复阶段解耦,从“行级准确率”层面定量揭示了当前AI编码代理存在的显著技术缺陷。 这项研究突破了以往仅依赖“最终修复率”的单一评估模式,为直接衡量代理程序上游搜索质量提供了新标准,并推动人工智能软件工程评估向更深层次发展。
像 SWE-bench 这样的传统基准测试往往仅关注端到端结果,因此掩盖了代理在代码阅读和理解阶段的真实缺陷。为解决这一问题,研究团队基于 GPT-5.4、 Gemini3Pro、Claude Sonnet4.6和Kimi K2.6等主流大模型的成功运行轨迹,从多个独立解法路径中提取共识代码片段,构建了一个包含10种编程语言、203个开源项目、共计848个缺陷任务的数据集。

评估结果表明,尽管 Claude Code 和 OpenHands 等通用编码代理在“文件级”定位方面表现良好,但当聚焦于具体的“代码行”时,其核心区域覆盖率会急剧下降至 14% 至 19% 之间。 消融实验进一步证实了“最小上下文阈值”效应:当关键核心区域的可见比例低于50%时,模型的修复通常会失败;然而,一旦该比例跨越50%至75%的阈值,修复成功率便会大幅提升。
这一研究结果表明,当前 AI 代理面临的瓶颈并不完全在于补丁编写能力,而在于能否准确过滤和捕捉关键上下文。在当前行业背景下,项目经理会拒绝一半的自动化采用提案, SWE-Explore提出的“少过滤、多阅读”技术方向,不仅为下一代专用代码本地化系统(如CoSIL)的架构优化指明了方向,同时也加速了自动化软件工程从“暴力生成”向“精准检索”的范式转变。
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






