Hogar
El equipo de la Universidad Jiao Tong de Shanghái publica el banco de pruebas SWE-Explore, que pone de manifiesto fallos de localización a nivel de línea en los agentes de programación basados en IA
Un equipo internacional de investigación, en el que participa la Universidad Jiao Tong de Shanghái, ha presentado hoy SWE-Explore, una nueva herramienta de pruebas de referencia. Esta herramienta revela cuantitativamente importantes deficiencias técnicas de los actuales agentes de codificación de IA en cuanto a la «precisión a nivel de línea», al separar la búsqueda de código de la fase de reparación propiamente dicha. Este estudio va más allá del anterior modelo de evaluación único, que se basaba exclusivamente en la «tasa de reparación final», y ofrece un nuevo estándar para medir directamente la calidad de la búsqueda previa en los agentes, impulsando así la evolución de la evaluación de la ingeniería de software de IA hacia ámbitos más profundos.
Las pruebas de referencia tradicionales, como SWE-bench, suelen ocultar los defectos reales de los agentes en las etapas de lectura y comprensión del código, ya que se centran únicamente en los resultados de extremo a extremo. Para solucionar esto, el equipo de investigación extrajo segmentos de código consensuados a partir de múltiples rutas de solución independientes, basándose en las trayectorias de funcionamiento exitosas de grandes modelos dominantes como GPT-5.4, Gemini3Pro, Claude Sonnet4.6 y Kimi K2.6, creando así un conjunto de datos que contiene 848 tareas con defectos en 10 lenguajes de programación y 203 proyectos de código abierto.

Los resultados de la evaluación muestran que, aunque los agentes de programación generales como Claude Code y OpenHands obtienen buenos resultados en el posicionamiento «a nivel de archivo», su cobertura de las áreas centrales se reduce drásticamente hasta situarse entre el 14 % y el 19 % cuando se centran en «líneas de código» específicas. Los experimentos de ablación confirmaron además el efecto del «umbral mínimo de contexto»: cuando la proporción visible de las áreas centrales clave es inferior al 50 %, la reparación del modelo suele fallar; sin embargo, una vez que se supera el umbral del 50 % al 75 %, la tasa de éxito de la reparación aumenta drásticamente.
Este resultado de la investigación indica que el cuello de botella actual de los agentes de IA no radica exclusivamente en la capacidad de escribir parches, sino más bien en filtrar y captar con precisión el contexto crítico. En el contexto actual del sector, en el que los gestores de proyectos rechazan la mitad de las propuestas de adopción automatizada, la orientación técnica de «menos filtrado, más lectura» propuesta por SWE-Explore no solo marca el camino para la optimización de la arquitectura de los sistemas especializados de localización de código de próxima generación (como CoSIL), sino que también acelera el cambio de paradigma de la ingeniería de software automatizada, pasando de la «generación por fuerza bruta» a la «recuperación precisa».
Artículo relacionado
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en
Cumplimiento de la normativa sobre vehículos autónomos en California: una nueva era de multas, geovallas y 1 millón de millas
Guident opera un servicio de transporte de AuveTech en el sur de Florida, gestionando una ruta de cuatro millas en West Palm Beach y otra de una milla en Boca Ratón mediante su tecnología de monitoriz
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Un equipo internacional de investigación, en el que participa la Universidad Jiao Tong de Shanghái, ha presentado hoy SWE-Explore, una nueva herramienta de pruebas de referencia. Esta herramienta revela cuantitativamente importantes deficiencias técnicas de los actuales agentes de codificación de IA en cuanto a la «precisión a nivel de línea», al separar la búsqueda de código de la fase de reparación propiamente dicha. Este estudio va más allá del anterior modelo de evaluación único, que se basaba exclusivamente en la «tasa de reparación final», y ofrece un nuevo estándar para medir directamente la calidad de la búsqueda previa en los agentes, impulsando así la evolución de la evaluación de la ingeniería de software de IA hacia ámbitos más profundos.
Las pruebas de referencia tradicionales, como SWE-bench, suelen ocultar los defectos reales de los agentes en las etapas de lectura y comprensión del código, ya que se centran únicamente en los resultados de extremo a extremo. Para solucionar esto, el equipo de investigación extrajo segmentos de código consensuados a partir de múltiples rutas de solución independientes, basándose en las trayectorias de funcionamiento exitosas de grandes modelos dominantes como GPT-5.4, Gemini3Pro, Claude Sonnet4.6 y Kimi K2.6, creando así un conjunto de datos que contiene 848 tareas con defectos en 10 lenguajes de programación y 203 proyectos de código abierto.

Los resultados de la evaluación muestran que, aunque los agentes de programación generales como Claude Code y OpenHands obtienen buenos resultados en el posicionamiento «a nivel de archivo», su cobertura de las áreas centrales se reduce drásticamente hasta situarse entre el 14 % y el 19 % cuando se centran en «líneas de código» específicas. Los experimentos de ablación confirmaron además el efecto del «umbral mínimo de contexto»: cuando la proporción visible de las áreas centrales clave es inferior al 50 %, la reparación del modelo suele fallar; sin embargo, una vez que se supera el umbral del 50 % al 75 %, la tasa de éxito de la reparación aumenta drásticamente.
Este resultado de la investigación indica que el cuello de botella actual de los agentes de IA no radica exclusivamente en la capacidad de escribir parches, sino más bien en filtrar y captar con precisión el contexto crítico. En el contexto actual del sector, en el que los gestores de proyectos rechazan la mitad de las propuestas de adopción automatizada, la orientación técnica de «menos filtrado, más lectura» propuesta por SWE-Explore no solo marca el camino para la optimización de la arquitectura de los sistemas especializados de localización de código de próxima generación (como CoSIL), sino que también acelera el cambio de paradigma de la ingeniería de software automatizada, pasando de la «generación por fuerza bruta» a la «recuperación precisa».
CEO de DeepMind, Hassabis: Duermo seis horas al día y generalmente me siento con energía alrededor de la 1 a. m.
Fortune ha presentado recientemente una entrevista con Demis Hassabis, director ejecutivo de Google DeepMind, en la que revela su enfoque poco convencional para el descanso y la productividad. Hassabis ha revelado que duerme muy poco, estructurando s
OpenAI y Anthropic compiten por la cuota de mercado a pesar de la caída de los ingresos
A pesar de los recientes informes que sugieren que OpenAI no ha alcanzado sus objetivos de ingresos —lo que ha generado presión sobre las acciones tecnológicas este martes—, los inversores privados en











