Дом
Команда Шанхайского университета Цзяотун представила тестовый набор SWE-Explore, выявивший недостатки локализации на уровне строк в кодирующих агентах ИИ
Международная исследовательская группа, в состав которой входит Шанхайский университет Цзяо Тун, сегодня представила SWE-Explore — новый инструмент для тестирования по эталонным показателям. Он позволяет количественно выявить существенные технические недостатки современных агентов по кодированию на основе ИИ на уровне «точности на уровне строк», отделяя процесс поиска кода от этапа фактического исправления. Данное исследование выходит за рамки прежней модели оценки, основанной исключительно на «конечном коэффициенте исправлений», предлагая новый стандарт для непосредственной оценки качества этапа предварительного поиска в агентах и способствуя развитию оценки программной инженерии на базе ИИ в более глубоких областях.
Традиционные тестовые наборы, такие как SWE-bench, часто маскируют реальные недостатки агентов на этапах чтения и понимания кода, поскольку они сосредоточены исключительно на конечных результатах. Чтобы решить эту проблему, исследовательская группа извлекла консенсусные сегменты кода из нескольких независимых путей решения на основе траекторий успешной работы основных крупных моделей, таких как GPT-5.4, Gemini3Pro, Claude Sonnet4.6 и Kimi K2.6, создав набор данных, содержащий 848 задач с дефектами на 10 языках программирования и в 203 проектах с открытым исходным кодом.

Результаты оценки показывают, что, хотя общие агенты кодирования, такие как Claude Code и OpenHands, демонстрируют хорошие результаты при позиционировании на «уровне файла», их охват ключевых областей резко падает до 14–19 %, когда внимание сосредотачивается на конкретных «строках кода». Эксперименты по абляции дополнительно подтвердили эффект «минимального порогового значения контекста»: когда видимая доля ключевых основных областей составляет менее 50%, исправление моделью, как правило, заканчивается неудачей; однако, как только она превышает пороговое значение от 50% до 75%, вероятность успешного исправления резко возрастает.
Результаты данного исследования указывают на то, что текущее «узкое место» для ИИ-агентов заключается не столько в способности писать патчи, сколько в точном фильтрировании и улавливании критически важного контекста. В современных условиях отрасли, когда руководители проектов отклоняют половину предложений по внедрению автоматизированных решений, техническое направление «меньше фильтрации, больше чтения», предложенное SWE-Explore, не только указывает путь к оптимизации архитектуры специализированных систем локализации кода следующего поколения (таких как CoSIL), но и ускоряет смену парадигмы автоматизированной разработки программного обеспечения с «генерации методом перебора» на «точный поиск».
Связанная статья
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства
Соблюдение требований к автономным транспортным средствам в Калифорнии: новая эра штрафов, геозоны и 1 млн миль
Компания Guident эксплуатирует шаттл AuveTech в Южной Флориде, обслуживая маршрут протяженностью четыре мили в Вест-Палм-Бич и маршрут протяженностью одну милю в Бока-Ратоне с использованием своей тех
Рекомендации по связанным специальным темам
Комментарии (0)
Международная исследовательская группа, в состав которой входит Шанхайский университет Цзяо Тун, сегодня представила SWE-Explore — новый инструмент для тестирования по эталонным показателям. Он позволяет количественно выявить существенные технические недостатки современных агентов по кодированию на основе ИИ на уровне «точности на уровне строк», отделяя процесс поиска кода от этапа фактического исправления. Данное исследование выходит за рамки прежней модели оценки, основанной исключительно на «конечном коэффициенте исправлений», предлагая новый стандарт для непосредственной оценки качества этапа предварительного поиска в агентах и способствуя развитию оценки программной инженерии на базе ИИ в более глубоких областях.
Традиционные тестовые наборы, такие как SWE-bench, часто маскируют реальные недостатки агентов на этапах чтения и понимания кода, поскольку они сосредоточены исключительно на конечных результатах. Чтобы решить эту проблему, исследовательская группа извлекла консенсусные сегменты кода из нескольких независимых путей решения на основе траекторий успешной работы основных крупных моделей, таких как GPT-5.4, Gemini3Pro, Claude Sonnet4.6 и Kimi K2.6, создав набор данных, содержащий 848 задач с дефектами на 10 языках программирования и в 203 проектах с открытым исходным кодом.

Результаты оценки показывают, что, хотя общие агенты кодирования, такие как Claude Code и OpenHands, демонстрируют хорошие результаты при позиционировании на «уровне файла», их охват ключевых областей резко падает до 14–19 %, когда внимание сосредотачивается на конкретных «строках кода». Эксперименты по абляции дополнительно подтвердили эффект «минимального порогового значения контекста»: когда видимая доля ключевых основных областей составляет менее 50%, исправление моделью, как правило, заканчивается неудачей; однако, как только она превышает пороговое значение от 50% до 75%, вероятность успешного исправления резко возрастает.
Результаты данного исследования указывают на то, что текущее «узкое место» для ИИ-агентов заключается не столько в способности писать патчи, сколько в точном фильтрировании и улавливании критически важного контекста. В современных условиях отрасли, когда руководители проектов отклоняют половину предложений по внедрению автоматизированных решений, техническое направление «меньше фильтрации, больше чтения», предложенное SWE-Explore, не только указывает путь к оптимизации архитектуры специализированных систем локализации кода следующего поколения (таких как CoSIL), но и ускоряет смену парадигмы автоматизированной разработки программного обеспечения с «генерации методом перебора» на «точный поиск».
Генеральный директор DeepMind Хассабис: я сплю шесть часов в день, обычно чувствую прилив энергии около часа ночи.
В недавнем интервью журналу Fortune генеральный директор Google DeepMind Демис Хаассабис раскрыл свой нестандартный подход к отдыху и продуктивности. Хаассабис признался, что спит очень мало, распределяя свои бодрствующие часы на два отдельных рабочи
OpenAI и Anthropic борются за долю рынка, несмотря на снижение выручки
Несмотря на недавние сообщения о том, что OpenAI не достигла целевых показателей по выручке, что во вторник оказало давление на акции технологических компаний, частные инвесторы, вкладывающие средства











